Большинство смет на ИИ в 2026 году скрывают две одинаковые статьи: интеграцию и счётчик API, который тикает бесконечно. Вот как выглядит честный расчёт.
01Анатомия сметы
Почему смета на $40K и смета на $400K могут быть одинаково честными
По тем внедрениям, что мы запускали, разрыв между дешёвой и дорогой сборкой почти никогда не про сам ИИ. Он про то, сколько других систем приходится трогать. Чатбот, отвечающий по одному PDF через Claude Sonnet 4.5 на Anthropic API, выкатывается за две недели меньше чем за $30K. Тот же чатбот, который читает тикеты Zendesk, пишет в HubSpot, эскалирует в Slack и держит GDPR, это шесть месяцев работы от $250K.
Обе цифры могут быть честными. Ни одна не говорит, какая подходит вашему бизнесу. Стоимость самого LLM-вызова обычно меньше 15% от любой из сумм. Остальное это сантехника, eval, ревью безопасности и неловкие недели, когда продуктовая команда и дата-команда спорят, кто владелец промпта.
02Стоимость сборки по типу задачи
Что люди реально платят в 2026
Диапазоны ниже это то, что мы реально запускали, плюс цифры от операторов за последний год. Расчёт исходит из партнёра, который уже строил такое. Если делаете полностью внутри без опыта продакшен-LLM, долларовая стоимость снижается, календарная вырастает примерно вдвое. Закономерность простая: дешёвые сметы прячут интеграцию, дорогие прячут расходы на API. Честная версия раскрывает оба пункта. Если ещё думаете, какой тип системы строить, начните с разбора агенты vs чатботы vs копилоты.
Проект NANDA Массачусетского технологического института в июле 2025 года сообщил: окупившиеся GenAI-внедрения экономили от 2 до 10 миллионов долларов в год на клиентском сервисе и обработке документов – самой негламурной части стека.
РИС. 01 – СТОИМОСТЬ СБОРКИ ПО ТИПУ ЗАДАЧИ (USD K)
Стоимость сборки, средний бизнес в 2026
– Проекты A&M Flow + публичные данные операторов, 2026 USD.
03Счётчик
Страшна не цена токенов. Страшен объём.
Сейчас Claude Sonnet 4.5 стоит $3 за миллион входных токенов и $15 за миллион выходных согласно прайсу Anthropic. GPT-5 и GPT-4o находятся примерно в той же зоне по прайсу OpenAI. Цифры кажутся ничтожными, пока не умножишь. Агент поддержки на 5,000 разговоров в месяц при среднем 8,000 входных и 1,500 выходных токенов на разговор это около $120 на вход, $112 на выход, итого $232 в месяц. Тот же агент на 200,000 разговорах ближе к $9,300 в месяц. Один и тот же промпт, та же модель, три порядка разницы в счёте.
Сметы вендоров, прячущие эту цифру внутри фиксированной месячной платы, обычно рассчитаны на низкий объём и будут пересмотрены, как только вы вырастете. По разговорам с операторами в продакшене закономерность повторяется: третий месяц нормально, на девятом счёт утроился и никто не предупредил. Если вендор не выделяет расходы на токены отдельно от стоимости сборки, разворачивайтесь. Именно здесь проекты годами теряют деньги.
04Инфра и тулинг
Скучные ежемесячные счета, о которых не говорят
Помимо API модели, каждая продакшен-система ИИ тащит за собой небольшой зоопарк сопровождающих счетов. Типичный агент поддержки для среднего бизнеса выглядит так: Pinecone serverless для векторов за $50 до $300 в месяц, выделенный vCPU Hetzner CCX33 для оркестрации примерно за €60 в месяц, Vercel Pro для фронта за $20 на место, инструмент наблюдаемости вроде Helicone или LangSmith за $50 до $500 в зависимости от объёма и управляемый Postgres для сессий и аудита за $25 до $200. По отдельности ни одна цифра не страшная. Вместе они спокойно перешагивают $1,000 в месяц ещё до того, как LLM появляется в счёте.
РИС. 02 – ТИПИЧНЫЕ ЕЖЕМЕСЯЧНЫЕ РАСХОДЫ
Стек ежемесячных расходов агента поддержки
| Статья | Поставщик (пример) | USD в месяц | |
|---|---|---|---|
| LLM API | Anthropic Claude Sonnet 4.5 | $200 – $9,000 | |
| Векторная БД | Pinecone serverless | $50 – $300 | |
| Вычисления | Hetzner CCX33 | €60 | |
| Хостинг фронта | Vercel Pro | $20 / seat | |
| Наблюдаемость | Helicone or LangSmith | $50 – $500 | |
| Управляемый Postgres | Neon, Supabase | $25 – $200 |
Если планируете тяжёлый инференс на open-weight моделях, у Modal, Replicate и Fireworks есть открытый прайс на хостинг GPU, на который стоит посмотреть до того, как браться за свой кластер. Внешний разбор, почему совокупные расходы на инфру растут, есть в a16z про экономику генеративного ИИ.
05Спорное мнение
Большая часть экономии живёт в промпте, не в выборе модели
Операторы любят спрашивать, не переехать ли с Claude на GPT-5 ради экономии. На практике разница между правильной и неправильной моделью на вызов это где-то 30 до 50%. Разница между неряшливым промптом, который таскает 12 тысяч токенов лишнего контекста каждый ход, и аккуратным на 2 тысячи это чистые 6x. Самый быстрый способ срезать счёт это переписать промпт, закэшировать системное сообщение и подрезать контекст ретривала, а не мигрировать к другому провайдеру. Видел команды, которые шесть недель мигрировали модель ради 20% экономии, тогда как полдня чистки промпта дали бы 70%.
Следствие: выбирайте провайдера, поддерживающего prompt caching (сейчас это и Anthropic, и OpenAI), и стройте системный промпт так, чтобы кэшируемый префикс был большим. На прайсе чтения из кэша указаны как доля от обычной входной цены. Это единственная самая важная ручка на стороне ежемесячных расходов. У OpenAI cookbook есть набор полезных паттернов на эту тему.
06Пример расчёта
Реалистичный 12-месячный бюджет агента поддержки
Если хотите проверить, окупается ли такая математика у вас, интерактивный калькулятор ROI берёт ваш объём разговоров, зарплату агента и rate разрешения как входы и проверяет кейс на прочность.
Глобальный опрос Deloitte по автоматизации, опубликованный в июне 2022 года, показал: организации, масштабировавшие автоматизацию, снизили издержки в среднем на 32 процента, а типичная программа окупалась около 22 месяцев.
07Как бы мы подошли к этому
Сначала запустите маленькую версию с метриками, потом масштабируйте
Если бы меня попросили завтра потратить ваш бюджет, порядок был бы такой: выкатить минимальную версию кейса за четыре недели на готовом API, навесить метрики с первого дня чтобы реально видеть стоимость токенов на разговор и на интент и принять решение build-vs-buy на втором месяце уже по реальным данным, не по догадкам. Почти каждая команда, потратившая $400K на кастомную сборку до этого шага, переписывала большую часть в течение года.
Второй ход: поставить ревью на шестом месяце ещё до подписания контракта. Операционные расходы не совпадут с тем, что было в смете. Либо объём ниже ожиданий и вы платите за неиспользуемую ёмкость, либо выше и цену за вызов надо пересматривать. Оба исхода нормальны, если вы заранее планировали к ним вернуться. Оба плохи, если замечаете только когда финдиректор спрашивает, почему счёт AWS удвоился.
Если хотите проверить смету, которая уже у вас на руках, мы прочитаем её бесплатно и скажем, каких статей не хватает. Начать здесь.
Часто задаваемые вопросы
Сколько стоит внедрение для малого бизнеса?+
Самый дешёвый честный старт с ИИ?+
Сколько стоит кастомный чатбот?+
Какие цены у Claude и GPT-5 для бизнеса?+
Почему стоимости внедрений так различаются?+
Какой реалистичный срок окупаемости?+
ANM SOLUTIONS / СВЯЗАТЬСЯ
Нужно применить это к вашему бизнесу?
Превращаем ИИ-аналитику в измеримый результат. Расскажите про ваш процесс – покажем место, где эффект будет максимальным.
Похожие статьи
Калькулятор ROI ИИ для отдела продаж: цена лида, а не недели (2026)
Как считать ROI ИИ для отдела продаж по одному лиду: ресёрч, скоринг и КП по цене человека и модели с проверкой, объём безубыточности и бизнес-кейс, который подпишут финансы.
Читать статьюФинансыROI автоматизации дебиторской задолженности: два числа, а не одно (2026)
Как считать ROI автоматизации дебиторской задолженности: цена напоминания у человека и у модели плюс деньги, высвобожденные коротким DSO, с формулами, бенчмарками 2025-2026 и честными вводными.
Читать статьюROIИзмерение ROI ИИ: как получить защитимое число (2026)
Гид по измерению ROI ИИ для финансово ориентированных операторов: три слоя возврата, защитимая формула, честные доказательства и когда закрывать проект.
Читать статью