Перейти к основному содержимому

Назад в Журнал Образовательная статья

ИИ для клиентской поддержки: плейбук практика (2026)

Модель – самое дешёвое из ваших решений. Боты поддержки умирают на третьем месяце из-за пропущенного eval-набора, refund-инструмента без потолка и мультиязычного запуска, который сочли проблемой модели.

Обновлено: 24 мая 2026 г. Клиентская поддержка

~9 мин чтения Время чтения 7 Разделов Гайд Подробный гайд

Большинство ИИ-ботов поддержки, которых отключают на третьем месяце, были обречены на первой неделе, когда кто-то выбрал векторную базу до того, как написал пятьдесят репрезентативных тестовых диалогов.

Меня всё время спрашивают, какую модель брать для поддержки. Это почти никогда не тот вопрос. Важно другое: что вы разрешаете боту делать, что заставляете его отказывать и как вы узнаёте, что он врёт клиентам, до того как клиенты сами вам об этом сообщат. Это статья для оператора, который уже знает, что такое LLM, и хочет запустить такую систему без попадания в общий список разборов провалов. Из тех немногих, что мы развернули, и тех, чьи разборы я читал, повторяется один и тот же набор решений.

01 Урок Klarna

Почему громкая цифра никогда не была сутью

В феврале 2024 Klarna объявила, что её ассистент на OpenAI закрывает две трети всего чат-саппорта, выполняя работу 700 агентов. Релиз гремел везде. Восемнадцать месяцев спустя та же компания нанимала людей обратно, а CEO публично говорил, что качество просело. Оба факта верны. Бот действительно обрабатывал этот объём. И обрабатывал его недостаточно хорошо.

Большинство операторов сделали неверный вывод. Не то, что LLM не справляются с саппортом. А то, что resolution rate – тщеславная метрика в тот момент, когда у клиента выбор между авто-закрытием и эскалацией с мучениями. Если вы меряете только первую колонку, вы получаете систему, оптимизированную под закрытие тикетов, а не под решение проблем. Цифра Klarna была настоящей. То, что она измеряла, не было тем, что думал совет директоров.

02 Выбор модели

Выбирайте модель последней, а не первой

Модель – самое дешёвое решение, которое вы принимаете. Claude Sonnet 4.5 по $3 на входе и $15 на выходе за миллион токенов, GPT-5 через Azure OpenAI для покупателей с регуляторкой, Gemini 2.5 Pro если вы и так на Google Workspace. Все они проходят планку. Ни одна не спасёт вас от плохого ретрива или инструмента возвратов без потолка списания. Я видел, как две команды шесть недель A/B-тестируют Claude против GPT и выпускают продукт хуже, чем у той команды, что взяла Sonnet в первый день и потратила эти шесть недель на написание eval-кейсов.

Та же логика и с векторными хранилищами. Pinecone нормальный. pgvector в том же Postgres, который у вас уже крутится, тоже нормальный и дешевле. Cohere Rerank перед любым из них даст вам больше точности, чем смена эмбеддинг-модели. Интересная работа в определениях инструментов и JSON-схемах, которые вы отдаёте модели, а не в бенчмарк-битвах. Прочитайте документацию Anthropic по tool use один раз, потом перепишите свой refund-инструмент пять раз, прежде чем он начнёт работать.

03 Реальность вендоров

Intercom Fin, Zendesk AI и ловушка build vs buy

Intercom Fin хороший. Хороший в узком смысле: B2B SaaS с чистым help-центром, простым SKU и планкой CSAT, терпящей редкие пожимания плечами. Цена за решённый диалог выглядит разумной, пока вы не наложите её на свой реальный микс тикетов и не поймёте, что платите премию за лёгкие, которые бот и так выигрывал. Для потребительских брендов с грязным каталогом, мультиязычными возвратами или чем-то регулируемым Fin – инструмент не той формы. Zendesk AI agents примерно в той же корзине, с дополнительной болью в виде брака с моделью данных Zendesk.

В январе 2024 года Intercom сообщила, что клиенты её ИИ-агента Fin закрывают в среднем 41 процент диалогов от начала до конца. Это честная база для планирования, что бы ни обещала более громкая презентация.

Стройте только тогда, когда коробочный путь заставляет вас гнуть бизнес под свои ограничения. Честная середина для большинства команд, с которыми я общаюсь, – тонкий собственный оркестратор поверх управляемой модели и управляемого векторного хранилища, разговаривающий с вашим хелпдеском через его API. Вы пишете тысячи четыре строк кода. Владеете тем, что важно: определениями инструментов, eval-харнесом и маршрутизацией эскалаций. Арендуете то, что не важно: веса модели и хранилище.

РИС. 01 – КОМУ ЧТО ПОДХОДИТ Три честных пути и их типовые провалы

  • Коробка (Fin, Zendesk AI) – Тонкий кастом – Полный кастом
  • Подходит когда – Чистые доки, простой SKU, в основном английский – Грязные данные, реальные tool calls, мультиязык – Регулируемая отрасль или уникальный воркфлоу
  • Полная стоимость – $2K–$10K / mo – $60K–$180K build, $4K–$15K / mo – $200K+ build, $20K+ / mo
  • Как ломается – Бизнес гнётся под инструмент – Уходит ответственная команда и поддержки нет – Шесть месяцев задержки и в итоге всё равно Fin

04 Настоящая работа

Ретрив, инструменты и eval-набор, который вы откладываете

Бот, который доезжает до прода, отличается от бота, который выживает встречу с реальным трафиком, той самой работой, которую никто не пишет в коммерческое предложение. Модели среди этой работы нет.

Куда тратить недели
  • Пятьдесят реальных диалогов, размеченных вручную, прогоняются еженощно против каждой версии модели
  • Tool-схемы с явными случаями отказа, не только happy path
  • Знания, обновляющиеся в день изменения продукта, автоматизированно из одного источника
  • Порог уверенности, настроенный по интентам, а не один глобальный
На что тратили недели мёртвые боты
  • A/B сравнение трёх моделей в презентации вместо написания eval-набора
  • Ингест всех PDF из SharePoint без разметки ни одного
  • Refund-инструмент без потолка списания и без аудита
  • Ежеквартальные обновления знаний для продукта с еженедельными релизами

Eval-набор – самая неблестящая часть. Пятьдесят диалогов это пол, не потолок. Они должны быть настоящие: с опечатками, со склеенными вопросами, с клиентом, который начал на польском и переключился на английский на середине. Кукбук OpenAI даёт пристойные шаблоны для старта, если вы такого никогда не делали. Смысл eval не в том, чтобы поставить боту оценку. Смысл в том, чтобы заметить, когда обновление модели или правка знаний тихо ломает то, что раньше работало.

05 Уровни действий

Что вы реально разрешаете боту делать

Сдвиг возможностей, который имеет значение в 2026, – это tool calling, меняющий состояние. Бот не отвечает на вопросы, он выдаёт возвраты, меняет адреса и ставит подписки на паузу. Здесь живут деньги и здесь же живут иски. Правильный дизайн – три уровня, неправильный – одна большая корзина под названием «права ассистента».

РИС. 02 – УРОВНИ РАЗРЕШЕНИЯ ДЕЙСТВИЙ Обратимость решает, на каком уровне живёт действие

  • Автоматически без трения – Подтверждение одним тапом – Только человек
  • Примеры – Статус заказа, трекинг, контакты – Возвраты ниже порога, паузы подписок, смена адреса – Закрытие аккаунта, смена identity, возвраты выше порога
  • Обратимость – Полностью обратимо – Обратимо с усилием – Практически навсегда
  • Что обязательно логировать – Действие, время, id клиента – Всё то же плюс токен подтверждения – Всё плюс id человека и причина

Если у вашего refund-инструмента нет потолка на один вызов и дневного агрегатного потолка, у вас нет refund-инструмента, у вас инцидент, ждущий своего треда на Hacker News. Потолок не потому, что модель глупая. Он потому, что упорный клиент с работающим браузером и желанием повторять найдёт формулировку, которая обойдёт ваши guardrails. Потолок – это то, что ограничит радиус взрыва когда это случится.

06 Непопулярное мнение

Мультиязычный саппорт это в основном проблема знаний

Я постоянно вижу команды, которые относятся к мультиязыку как к проблеме модели. Это не она. Sonnet 4.5 и GPT-5 оба говорят на двадцати с лишним языках достаточно хорошо, чтобы обмануть случайного слушателя. Проблема в том, что ваши help-статьи существуют на английском, ваша политика возвратов существует на английском с наполовину переведённой немецкой версией 2022 года, а польская команда эскалаций использует другую схему тикетов, чем испанская. Бот говорит на языке свободно и уверенно даёт неправильные ответы, потому что лежащие в основе знания неправильны или отсутствуют.

“ Бот настолько умён, насколько хуже всех переведён абзац в вашей базе знаний. Почините этот абзац до того как менять модель.

Запускайтесь на двух языках. Добейтесь примерно равных CSAT, частоты эскалаций и оспоренных возвратов на обоих. Только тогда добавляйте третий. Команды, запускающие сразу семь, выбирают тот же скриншот дашборда, что выбрала Klarna.

07 Как бы мы к этому подошли

Что мы реально отгрузили бы за двенадцать недель

Для среднего бизнеса, делающего это впервые, двенадцать недель – честная цифра. Первые три – аудит знаний и eval-набор, та самая часть, которую все хотят пропустить. Недели с четвёртой по шестую – tool-слой и оркестрация: выбор модели и написание refund и lookup инструментов с потолками и аудитом. Седьмая и восьмая – закрытый пилот только на внутреннем трафике. Девятая и десятая – пять процентов реального трафика с проверкой каждого вывода человеком, это раздражает и это необходимо. Одиннадцатая и двенадцатая – расширение до сорока или пятидесяти процентов если и только если eval-набор оставался зелёным две недели подряд. Тот, кто продаёт вам четыре недели на тот же scope, продаёт демо, а не деплой. Девяностодневный план разбирает последовательность подробнее, а разбор стоимости внедрения – что сколько реально стоит на каждом этапе.

Если нужна вторая пара глаз

Это такой проект, которому помогает чей-то взгляд со стороны, особенно если этот кто-то видел пару таких провалов с одинаковой причиной. Страница услуг описывает, как это выглядит на практике, или можете прислать нам scope и мы честно скажем, стоит ли строить, покупать или подождать полгода.

Связанные статьи

Часто задаваемые вопросы

Какую модель в итоге брать?+ Claude Sonnet 4.5 если начинаете с нуля и хотите лучшую дисциплину tool calling сегодня. GPT-5 через Azure OpenAI если покупателю нужен Azure tenant по требованиям комплаенса. Gemini 2.5 Pro если уже на Google Workspace и хотите биллинг в одном месте. Разница между ними реальна, но меньше чем разница между любой из них и отсутствующим eval-набором. Стоит ли Intercom Fin своих денег?+ Для B2B SaaS с чистыми доками и англоязычной аудиторией – да. Для потребительского бренда с грязным каталогом или чего-то мультиязычного и регулируемого – нет. Цена за решённый диалог выглядит привлекательно, пока вы не поймёте, что платите премию за лёгкие тикеты, которые бот и так бы выиграл. Каким должен быть eval-набор на запуске?+ Пятьдесят настоящих диалогов это пол. Сто пятьдесят – комфортно. После двухсот большинство команд перестаёт добавлять новую ценность. Набор должен расти по мере того, как вы находите новые режимы отказа в проде, так что планируйте добавлять по десять-двадцать в месяц первые полгода эксплуатации. Как не дать боту выдавать мошеннические возвраты?+ Потолок на один вызов, дневной агрегатный потолок, шаг верификации identity для сумм выше порога и полный аудит-трейл с залогированным токеном подтверждения. Относитесь к refund-инструменту так же, как относились бы к джуниор-агенту в первый день: ограниченные права, логируемые действия и супервайзер, который раз в неделю смотрит граничные случаи. А голосовой саппорт, не только чат?+ Бюджет задержки для голоса жестокий: меньше восьмисот миллисекунд туда и обратно, иначе ощущение неестественное. Слой модели в это попадает. Слой ретрива обычно нет, если у вас нет отдельного кэша для топ-интентов. Относитесь к голосу как ко второму проекту, после того как чат-версия отработала стабильно два квартала, а не как к фиче ко дню запуска. Заменит ли это наших живых агентов?+ Нет. Объём рутины падает, доля сложных случаев в работе людей растёт, а оставшиеся люди должны быть сильнее. Компании, обещавшие совету директоров сокращение штата и получившие его, обычно откатывали это в течение года, Klarna – самый публичный пример. Планируйте плоский или слегка снижающийся штат и заметный сдвиг в составе работы.

ANM SOLUTIONS / СВЯЗАТЬСЯ

Нужно применить это к вашему бизнесу?

Превращаем ИИ-аналитику в измеримый результат. Расскажите про ваш процесс – покажем место, где эффект будет максимальным.

Похожие статьи

Внедрение

90-дневный план внедрения ИИ: от скоупа до продакшена

Взгляд практика на первые 90 дней внедрения ИИ. Скучный стек, eval первым, kill switch к 90-му дню. Где планы идут не так и что делать вместо.

Читать статью

Выбор вендора

Как выбрать партнёра по внедрению ИИ и не переплатить

Честный разбор пяти категорий партнёров по внедрению ИИ, где каждая подходит и как отличить полезного вендора от дорогой фабрики слайдов за один технический разговор.

Опубликовано: 2026-05-05 · Автор: A&M Flow