Большинство ИИ-ботов поддержки, которых отключают на третьем месяце, были обречены на первой неделе, когда кто-то выбрал векторную базу до того, как написал пятьдесят репрезентативных тестовых диалогов.
Меня всё время спрашивают, какую модель брать для поддержки. Это почти никогда не тот вопрос. Важно другое: что вы разрешаете боту делать, что заставляете его отказывать и как вы узнаёте, что он врёт клиентам, до того как клиенты сами вам об этом сообщат. Это статья для оператора, который уже знает, что такое LLM, и хочет запустить такую систему без попадания в общий список разборов провалов. Из тех немногих, что мы развернули, и тех, чьи разборы я читал, повторяется один и тот же набор решений.
01Урок Klarna
Почему громкая цифра никогда не была сутью
В феврале 2024 Klarna объявила, что её ассистент на OpenAI закрывает две трети всего чат-саппорта, выполняя работу 700 агентов. Релиз гремел везде. Восемнадцать месяцев спустя та же компания нанимала людей обратно, а CEO публично говорил, что качество просело. Оба факта верны. Бот действительно обрабатывал этот объём. И обрабатывал его недостаточно хорошо.
Большинство операторов сделали неверный вывод. Не то, что LLM не справляются с саппортом. А то, что resolution rate – тщеславная метрика в тот момент, когда у клиента выбор между авто-закрытием и эскалацией с мучениями. Если вы меряете только первую колонку, вы получаете систему, оптимизированную под закрытие тикетов, а не под решение проблем. Цифра Klarna была настоящей. То, что она измеряла, не было тем, что думал совет директоров.
02Выбор модели
Выбирайте модель последней, а не первой
Модель – самое дешёвое решение, которое вы принимаете. Claude Sonnet 4.5 по $3 на входе и $15 на выходе за миллион токенов, GPT-5 через Azure OpenAI для покупателей с регуляторкой, Gemini 2.5 Pro если вы и так на Google Workspace. Все они проходят планку. Ни одна не спасёт вас от плохого ретрива или инструмента возвратов без потолка списания. Я видел, как две команды шесть недель A/B-тестируют Claude против GPT и выпускают продукт хуже, чем у той команды, что взяла Sonnet в первый день и потратила эти шесть недель на написание eval-кейсов.
Та же логика и с векторными хранилищами. Pinecone нормальный. pgvector в том же Postgres, который у вас уже крутится, тоже нормальный и дешевле. Cohere Rerank перед любым из них даст вам больше точности, чем смена эмбеддинг-модели. Интересная работа в определениях инструментов и JSON-схемах, которые вы отдаёте модели, а не в бенчмарк-битвах. Прочитайте документацию Anthropic по tool use один раз, потом перепишите свой refund-инструмент пять раз, прежде чем он начнёт работать.
03Реальность вендоров
Intercom Fin, Zendesk AI и ловушка build vs buy
Intercom Fin хороший. Хороший в узком смысле: B2B SaaS с чистым help-центром, простым SKU и планкой CSAT, терпящей редкие пожимания плечами. Цена за решённый диалог выглядит разумной, пока вы не наложите её на свой реальный микс тикетов и не поймёте, что платите премию за лёгкие, которые бот и так выигрывал. Для потребительских брендов с грязным каталогом, мультиязычными возвратами или чем-то регулируемым Fin – инструмент не той формы. Zendesk AI agents примерно в той же корзине, с дополнительной болью в виде брака с моделью данных Zendesk.
В январе 2024 года Intercom сообщила, что клиенты её ИИ-агента Fin закрывают в среднем 41 процент диалогов от начала до конца. Это честная база для планирования, что бы ни обещала более громкая презентация.
Стройте только тогда, когда коробочный путь заставляет вас гнуть бизнес под свои ограничения. Честная середина для большинства команд, с которыми я общаюсь, – тонкий собственный оркестратор поверх управляемой модели и управляемого векторного хранилища, разговаривающий с вашим хелпдеском через его API. Вы пишете тысячи четыре строк кода. Владеете тем, что важно: определениями инструментов, eval-харнесом и маршрутизацией эскалаций. Арендуете то, что не важно: веса модели и хранилище.
РИС. 01 – КОМУ ЧТО ПОДХОДИТ
Три честных пути и их типовые провалы
| Коробка (Fin, Zendesk AI) | Тонкий кастом | Полный кастом | |
|---|---|---|---|
| Подходит когда | Чистые доки, простой SKU, в основном английский | Грязные данные, реальные tool calls, мультиязык | Регулируемая отрасль или уникальный воркфлоу |
| Полная стоимость | $2K–$10K / mo | $60K–$180K build, $4K–$15K / mo | $200K+ build, $20K+ / mo |
| Как ломается | Бизнес гнётся под инструмент | Уходит ответственная команда и поддержки нет | Шесть месяцев задержки и в итоге всё равно Fin |
04Настоящая работа
Ретрив, инструменты и eval-набор, который вы откладываете
Бот, который доезжает до прода, отличается от бота, который выживает встречу с реальным трафиком, той самой работой, которую никто не пишет в коммерческое предложение. Модели среди этой работы нет.
Куда тратить недели
- Пятьдесят реальных диалогов, размеченных вручную, прогоняются еженощно против каждой версии модели
- Tool-схемы с явными случаями отказа, не только happy path
- Знания, обновляющиеся в день изменения продукта, автоматизированно из одного источника
- Порог уверенности, настроенный по интентам, а не один глобальный
На что тратили недели мёртвые боты
- A/B сравнение трёх моделей в презентации вместо написания eval-набора
- Ингест всех PDF из SharePoint без разметки ни одного
- Refund-инструмент без потолка списания и без аудита
- Ежеквартальные обновления знаний для продукта с еженедельными релизами
Eval-набор – самая неблестящая часть. Пятьдесят диалогов это пол, не потолок. Они должны быть настоящие: с опечатками, со склеенными вопросами, с клиентом, который начал на польском и переключился на английский на середине. Кукбук OpenAI даёт пристойные шаблоны для старта, если вы такого никогда не делали. Смысл eval не в том, чтобы поставить боту оценку. Смысл в том, чтобы заметить, когда обновление модели или правка знаний тихо ломает то, что раньше работало.
05Уровни действий
Что вы реально разрешаете боту делать
Сдвиг возможностей, который имеет значение в 2026, – это tool calling, меняющий состояние. Бот не отвечает на вопросы, он выдаёт возвраты, меняет адреса и ставит подписки на паузу. Здесь живут деньги и здесь же живут иски. Правильный дизайн – три уровня, неправильный – одна большая корзина под названием «права ассистента».
РИС. 02 – УРОВНИ РАЗРЕШЕНИЯ ДЕЙСТВИЙ
Обратимость решает, на каком уровне живёт действие
| Автоматически без трения | Подтверждение одним тапом | Только человек | |
|---|---|---|---|
| Примеры | Статус заказа, трекинг, контакты | Возвраты ниже порога, паузы подписок, смена адреса | Закрытие аккаунта, смена identity, возвраты выше порога |
| Обратимость | Полностью обратимо | Обратимо с усилием | Практически навсегда |
| Что обязательно логировать | Действие, время, id клиента | Всё то же плюс токен подтверждения | Всё плюс id человека и причина |
Если у вашего refund-инструмента нет потолка на один вызов и дневного агрегатного потолка, у вас нет refund-инструмента, у вас инцидент, ждущий своего треда на Hacker News. Потолок не потому, что модель глупая. Он потому, что упорный клиент с работающим браузером и желанием повторять найдёт формулировку, которая обойдёт ваши guardrails. Потолок – это то, что ограничит радиус взрыва когда это случится.
06Непопулярное мнение
Мультиязычный саппорт это в основном проблема знаний
Я постоянно вижу команды, которые относятся к мультиязыку как к проблеме модели. Это не она. Sonnet 4.5 и GPT-5 оба говорят на двадцати с лишним языках достаточно хорошо, чтобы обмануть случайного слушателя. Проблема в том, что ваши help-статьи существуют на английском, ваша политика возвратов существует на английском с наполовину переведённой немецкой версией 2022 года, а польская команда эскалаций использует другую схему тикетов, чем испанская. Бот говорит на языке свободно и уверенно даёт неправильные ответы, потому что лежащие в основе знания неправильны или отсутствуют.
“Бот настолько умён, насколько хуже всех переведён абзац в вашей базе знаний. Почините этот абзац до того как менять модель.
Запускайтесь на двух языках. Добейтесь примерно равных CSAT, частоты эскалаций и оспоренных возвратов на обоих. Только тогда добавляйте третий. Команды, запускающие сразу семь, выбирают тот же скриншот дашборда, что выбрала Klarna.
07Как бы мы к этому подошли
Что мы реально отгрузили бы за двенадцать недель
Для среднего бизнеса, делающего это впервые, двенадцать недель – честная цифра. Первые три – аудит знаний и eval-набор, та самая часть, которую все хотят пропустить. Недели с четвёртой по шестую – tool-слой и оркестрация: выбор модели и написание refund и lookup инструментов с потолками и аудитом. Седьмая и восьмая – закрытый пилот только на внутреннем трафике. Девятая и десятая – пять процентов реального трафика с проверкой каждого вывода человеком, это раздражает и это необходимо. Одиннадцатая и двенадцатая – расширение до сорока или пятидесяти процентов если и только если eval-набор оставался зелёным две недели подряд. Тот, кто продаёт вам четыре недели на тот же scope, продаёт демо, а не деплой. Девяностодневный план разбирает последовательность подробнее, а разбор стоимости внедрения – что сколько реально стоит на каждом этапе.
Часто задаваемые вопросы
Какую модель в итоге брать?+
Стоит ли Intercom Fin своих денег?+
Каким должен быть eval-набор на запуске?+
Как не дать боту выдавать мошеннические возвраты?+
А голосовой саппорт, не только чат?+
Заменит ли это наших живых агентов?+
ANM SOLUTIONS / СВЯЗАТЬСЯ
Нужно применить это к вашему бизнесу?
Превращаем ИИ-аналитику в измеримый результат. Расскажите про ваш процесс – покажем место, где эффект будет максимальным.
Похожие статьи
90-дневный план внедрения ИИ: от скоупа до продакшена
Взгляд практика на первые 90 дней внедрения ИИ. Скучный стек, eval первым, kill switch к 90-му дню. Где планы идут не так и что делать вместо.
Читать статьюВыбор вендораКак выбрать партнёра по внедрению ИИ и не переплатить
Пять категорий партнёров по внедрению ИИ, где каждая подходит и как отличить полезного вендора от дорогой фабрики слайдов за один разговор.
Читать статью