Перейти к основному содержимому
Назад в Журнал Образовательная статья
Сколько на самом деле стоит внедрение ИИ в 2026
Большинство смет на ИИ в 2026 году скрывают две одинаковые статьи: интеграцию и счётчик API, который тикает бесконечно. Вот как выглядит честный расчёт.
Обновлено: 24 мая 2026 г. Стоимость ИИ
~13 мин чтения Время чтения 7 Разделов Аналитика С данными
01 Анатомия сметы
Почему смета на $40K и смета на $400K могут быть одинаково честными
По тем внедрениям, что мы запускали, разрыв между дешёвой и дорогой сборкой почти никогда не про сам ИИ. Он про то, сколько других систем приходится трогать. Чатбот, отвечающий по одному PDF через Claude Sonnet 4.5 на Anthropic API, выкатывается за две недели меньше чем за $30K. Тот же чатбот, который читает тикеты Zendesk, пишет в HubSpot, эскалирует в Slack и держит GDPR, это шесть месяцев работы от $250K.
Обе цифры могут быть честными. Ни одна не говорит, какая подходит вашему бизнесу. Стоимость самого LLM-вызова обычно меньше 15% от любой из сумм. Остальное это сантехника, eval, ревью безопасности и неловкие недели, когда продуктовая команда и дата-команда спорят, кто владелец промпта.
02 Стоимость сборки по типу задачи
Что люди реально платят в 2026
Диапазоны ниже это то, что мы реально запускали, плюс цифры от операторов за последний год. Расчёт исходит из партнёра, который уже строил такое. Если делаете полностью внутри без опыта продакшен-LLM, долларовая стоимость снижается, календарная вырастает примерно вдвое. Закономерность простая: дешёвые сметы прячут интеграцию, дорогие прячут расходы на API. Честная версия раскрывает оба пункта. Если ещё думаете, какой тип системы строить, начните с разбора агенты vs чатботы vs копилоты.
Проект NANDA Массачусетского технологического института в июле 2025 года сообщил: окупившиеся GenAI-внедрения экономили от 2 до 10 миллионов долларов в год на клиентском сервисе и обработке документов – самой негламурной части стека.
РИС. 01 – СТОИМОСТЬ СБОРКИ ПО ТИПУ ЗАДАЧИ (USD K) Стоимость сборки, средний бизнес в 2026
Чатбот по одному документу $15K – $60K RAG по базе знаний $35K – $180K Агент поддержки (мульти-система) $80K – $300K Конвейер обработки документов $40K – $220K Голосовой или телефонный агент $100K – $450K Кастомный многошаговый агент $180K – $600K+
$0K $150K $300K $450K $600K
– Проекты A&M Flow + публичные данные операторов, 2026 USD.
03 Счётчик
Страшна не цена токенов. Страшен объём.
Сейчас Claude Sonnet 4.5 стоит $3 за миллион входных токенов и $15 за миллион выходных согласно прайсу Anthropic. GPT-5 и GPT-4o находятся примерно в той же зоне по прайсу OpenAI. Цифры кажутся ничтожными, пока не умножишь. Агент поддержки на 5,000 разговоров в месяц при среднем 8,000 входных и 1,500 выходных токенов на разговор это около $120 на вход, $112 на выход, итого $232 в месяц. Тот же агент на 200,000 разговорах ближе к $9,300 в месяц. Один и тот же промпт, та же модель, три порядка разницы в счёте.
Сметы вендоров, прячущие эту цифру внутри фиксированной месячной платы, обычно рассчитаны на низкий объём и будут пересмотрены, как только вы вырастете. По разговорам с операторами в продакшене закономерность повторяется: третий месяц нормально, на девятом счёт утроился и никто не предупредил. Если вендор не выделяет расходы на токены отдельно от стоимости сборки, разворачивайтесь. Именно здесь проекты годами теряют деньги.
Быстрая прикидка по токенам
Закладывайте примерно 1 цент на средний вызов Claude Sonnet 4.5 (около 2K на вход, 500 на выход). Умножьте на дневной объём, потом на 30. Это нижний пол расходов на API. Добавьте 25% на ретраи, eval и крон, который кто-то поставит в 3 ночи через полгода.
04 Инфра и тулинг
Скучные ежемесячные счета, о которых не говорят
Помимо API модели, каждая продакшен-система ИИ тащит за собой небольшой зоопарк сопровождающих счетов. Типичный агент поддержки для среднего бизнеса выглядит так: Pinecone serverless для векторов за $50 до $300 в месяц, выделенный vCPU Hetzner CCX33 для оркестрации примерно за €60 в месяц, Vercel Pro для фронта за $20 на место, инструмент наблюдаемости вроде Helicone или LangSmith за $50 до $500 в зависимости от объёма и управляемый Postgres для сессий и аудита за $25 до $200. По отдельности ни одна цифра не страшная. Вместе они спокойно перешагивают $1,000 в месяц ещё до того, как LLM появляется в счёте.
РИС. 02 – ТИПИЧНЫЕ ЕЖЕМЕСЯЧНЫЕ РАСХОДЫ Стек ежемесячных расходов агента поддержки
- Статья – Поставщик (пример) – USD в месяц
- LLM API – Anthropic Claude Sonnet 4.5 – $200 – $9,000
- Векторная БД – Pinecone serverless – $50 – $300
- Вычисления – Hetzner CCX33 – €60
- Хостинг фронта – Vercel Pro – $20 / seat
- Наблюдаемость – Helicone or LangSmith – $50 – $500
- Управляемый Postgres – Neon, Supabase – $25 – $200
Если планируете тяжёлый инференс на open-weight моделях, у Modal, Replicate и Fireworks есть открытый прайс на хостинг GPU, на который стоит посмотреть до того, как браться за свой кластер. Внешний разбор, почему совокупные расходы на инфру растут, есть в a16z про экономику генеративного ИИ.
05 Спорное мнение
Большая часть экономии живёт в промпте, не в выборе модели
Операторы любят спрашивать, не переехать ли с Claude на GPT-5 ради экономии. На практике разница между правильной и неправильной моделью на вызов это где-то 30 до 50%. Разница между неряшливым промптом, который таскает 12 тысяч токенов лишнего контекста каждый ход, и аккуратным на 2 тысячи это чистые 6x. Самый быстрый способ срезать счёт это переписать промпт, закэшировать системное сообщение и подрезать контекст ретривала, а не мигрировать к другому провайдеру. Видел команды, которые шесть недель мигрировали модель ради 20% экономии, тогда как полдня чистки промпта дали бы 70%.
Следствие: выбирайте провайдера, поддерживающего prompt caching (сейчас это и Anthropic, и OpenAI), и стройте системный промпт так, чтобы кэшируемый префикс был большим. На прайсе чтения из кэша указаны как доля от обычной входной цены. Это единственная самая важная ручка на стороне ежемесячных расходов. У OpenAI cookbook есть набор полезных паттернов на эту тему.
06 Пример расчёта
Реалистичный 12-месячный бюджет агента поддержки
Формула
Стоимость года 1 = build + integration + 12 × run + 20% резерв
build
Инженерия, дизайн, eval, деплой
integration
CRM, helpdesk, auth, дата-пайплайны (часто 40–60% от сборки)
run
LLM API + векторная БД + вычисления + наблюдаемость + Postgres
резерв
Расширение скоупа это правило, не исключение
Результат
Агент поддержки: сборка $90K + интеграция $45K (50%) + 12 × $1,800 операции ($21.6K) + 20% резерв ($31K) = ~$187K стоимость года 1 . Год 2 опускается примерно до $40K, потому что сборка уже амортизирована и остаются только операции плюс ретейнер на поддержку.
Если хотите проверить, окупается ли такая математика у вас, интерактивный калькулятор ROI берёт ваш объём разговоров, зарплату агента и rate разрешения как входы и проверяет кейс на прочность.
Глобальный опрос Deloitte по автоматизации, опубликованный в июне 2022 года, показал: организации, масштабировавшие автоматизацию, снизили издержки в среднем на 32 процента, а типичная программа окупалась около 22 месяцев.
07 Как бы мы подошли к этому
Сначала запустите маленькую версию с метриками, потом масштабируйте
Если бы меня попросили завтра потратить ваш бюджет, порядок был бы такой: выкатить минимальную версию кейса за четыре недели на готовом API, навесить метрики с первого дня чтобы реально видеть стоимость токенов на разговор и на интент и принять решение build-vs-buy на втором месяце уже по реальным данным, не по догадкам. Почти каждая команда, потратившая $400K на кастомную сборку до этого шага, переписывала большую часть в течение года.
Второй ход: поставить ревью на шестом месяце ещё до подписания контракта. Операционные расходы не совпадут с тем, что было в смете. Либо объём ниже ожиданий и вы платите за неиспользуемую ёмкость, либо выше и цену за вызов надо пересматривать. Оба исхода нормальны, если вы заранее планировали к ним вернуться. Оба плохи, если замечаете только когда финдиректор спрашивает, почему счёт AWS удвоился.
Признаки, что проект не окупится
- Кейс выбран потому что модно, а не потому что объём оправдывает
- Смета прячет токены в плоскую месячную плату, которую никто не объясняет
- В скоупе нет eval; качество поползёт и никто не заметит
- Интеграция упомянута одной строкой но не оценена
- Внутренний спонсор не может описать как выглядит успех на шестом месяце
Если хотите проверить смету, которая уже у вас на руках, мы прочитаем её бесплатно и скажем, каких статей не хватает. Начать здесь.
Связанные статьи
- → Выбор партнёра по внедрению
- → Строгое измерение ROI
- → Скрытая стоимость НЕ-использования ИИ
- → 90-дневный план внедрения
Часто задаваемые вопросы
Сколько стоит внедрение для малого бизнеса?+ От $0 до $80K в год. Низ это подписки по местам вроде ChatGPT Team за $25 на пользователя. Верх это одно кастомное внедрение средней сложности. Большинству малых бизнесов не стоит заказывать кастомную сборку до того, как подписочные инструменты упрутся в потолок. Самый дешёвый честный старт с ИИ?+ Подписки по местам ($20 до $30 на пользователя в месяц) для команды с самой повторяющейся работой со знаниями. Измерьте сэкономленное время за два месяца. Только потом думайте про кастомную сборку для процесса, который подписками не покрыть. Сколько стоит кастомный чатбот?+ От $15K до $300K в зависимости от глубины интеграции, языков и сложности действий. Ежемесячные операции от $200 до $9,000. Простой бот по одному документу внизу. Многоязычный, многосистемный агент с действиями вверху. Какие цены у Claude и GPT-5 для бизнеса?+ Claude Sonnet 4.5 стоит $3 за миллион входных токенов и $15 за миллион выходных по прайсу anthropic.com. GPT-5 и GPT-4o примерно в той же зоне на openai.com. Тарифы по местам (Claude Team, ChatGPT Team) от $25 до $30 за место. Корпоративные контракты кастомные, обычно $40 до $100 за место с годовыми обязательствами. Почему стоимости внедрений так различаются?+ Два внедрения одного и того же могут отличаться в 10x из-за сложности интеграции, качества данных, требований к точности, уровня автономии и compliance. Бот, отвечающий на одной странице на одном языке, дёшев. Тот же бот с пятью бэкенд-системами, шестью языками, действиями и проверкой HIPAA дорогой. Какой реалистичный срок окупаемости?+ Для удачно выбранных первых внедрений ждите 6 до 12 месяцев до положительного ROI. Автоматизация поддержки с высоким объёмом окупается за 3 до 6 месяцев. Многошаговые агенты и платформы 12 до 24 месяцев. Если нет положительного сигнала к 12 месяцу, обычно дело в неверно выбранном кейсе, а не в технологии.
ANM SOLUTIONS / СВЯЗАТЬСЯ
Нужно применить это к вашему бизнесу?
Превращаем ИИ-аналитику в измеримый результат. Расскажите про ваш процесс – покажем место, где эффект будет максимальным.
Похожие статьи
ROI
Измерение ROI ИИ: как получить защитимое число (2026)
Опинион-гид по измерению ROI ИИ для финансово ориентированных операторов. Три слоя возврата, защитимая формула, честный стандарт доказательств и когда закрывать проект.
Читать статью
Опубликовано: 2026-05-03 · Автор: A&M Flow