реплика

Средний CSAT вырос, клиенты злее. Как мерить после робота

Средний CSAT после робота растёт, а клиенты злее. Как считать CSAT по бакетам и какие метрики честнее опроса после звонка.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·23 июля 2025·7 минут чтения

Через месяц после запуска голосового агента средний CSAT обычно не падает. Часто он даже подрастает на пункт-другой. При этом руководитель поддержки видит больше жалоб в мессенджерах, а команда говорит, что клиенты приходят на линию уже злыми. Обе картины верные. Врёт не агент и не опрос — врёт среднее.

Короткий ответ: CSAT после робота нельзя смотреть одной цифрой. Его нужно разложить по бакетам — отдельно обращения, которые агент закрыл сам, отдельно те, что ушли человеку. Ориентир Balto/Famulor: разрыв CSAT contained-бакета с базовым уровнем до запуска не должен превышать 3 пунктов. Если разрыв больше — автоматизация оплачена качеством сервиса, просто счёт пришёл не туда, куда вы смотрите.

И второе: опрос после звонка — самый слабый инструмент из доступных. Поведение клиента после разговора говорит правду быстрее, чем его оценка по пятибалльной шкале.

Эффект усреднения: почему средний CSAT растёт, а клиенты злее

Простые обращения — статус заказа, запись, напоминание, часы работы — агент закрывает за секунды и в любое время суток. Клиент, который раньше ждал в очереди четыре минуты, получает ответ сразу и ставит высокую оценку. Таких обращений большинство, и они тянут среднее вверх.

Сложные — спор по списанию, ошибка в заказе, нестандартная ситуация — ломаются. Клиент дважды объясняет проблему, не попадает в сценарий, прорывается к человеку и начинает разговор с оператором уже раздражённым. Таких обращений меньшинство, и они тянут среднее вниз.

Сложить одно с другим — получить «нормально». Дальше вы месяц смотрите на ровную линию и не видите, что на части обращений сервис стал хуже, чем был до запуска. Та же логика ломает и другие показатели: каких метрик не хватает, когда containment 80%.

Klarna: канонический пример того, что скрывает среднее

Пресс-релиз OpenAI и Klarna от 27 февраля 2024 года: за первый месяц ассистент обработал 2,3 млн диалогов — две трети всех чатов поддержки; среднее время разрешения сократилось с 11 минут до менее чем 2; повторные обращения снизились примерно на 25%.

Обратная сторона всплыла позже: по публикациям Forbes, CSAT просел примерно на 22%, компания вернула людей на обслуживание премиальных клиентов и перешла к гибридной модели.

Важно, что именно здесь сломалось. Не технология: на массовых простых обращениях она отработала. Сломалась стратегия полной замены без градуированной автономии и без эскалации по уровню уверенности. Подробный разбор — в статье «Klarna заменила операторов на ИИ и вернула людей обратно».

Как мерить CSAT после робота: срезы вместо одной цифры

Один дашборд с одной линией не показывает ничего. Работающий минимум — шесть срезов.

СрезЧто сравниваемЧто считать сигналом
CSAT contained-бакетас базовым уровнем до запускаразрыв больше 3 пунктов (ориентир Balto/Famulor)
CSAT escalated-бакетас CSAT contained-бакетаescalated заметно ниже — человек получает клиента уже разогретым
CSAT по типам обращенийденьги, споры, личная ситуация против статуса и записипровал на «денежных» темах: эти интенты отданы агенту рано
Повторное обращение за 72 часас ориентиром менее 15% (Balto/Famulor)рост — «решено» в отчёте, не решено у клиента
Forced escalation rateс ориентиром менее 10%рост — клиент пробивается к человеку сам, а не по правилу
Доля ответивших на опросcontained против escalatedразная наполняемость — средние по бакетам несопоставимы

Разбивка по типам обращений опирается на данные CNews: ИИ доверяют информирование о статусе заказа и доставки — 54% опрошенных, напоминания — 50%, консультации по тарифам — около 40%. Доверие резко падает на задачах, связанных с деньгами, спорами и персональной ситуацией. Если у вас средний CSAT ровный, а в срезе «спорные списания» он на дне — вы нашли не проблему метрики, а проблему маршрутизации.

85–90% CSAT у бота — чей это результат

У цифры есть источник: по данным вендора irisagent, CSAT на успешно разрешённых ботом обращениях составляет 85–90%. Две оговорки съедают половину смысла. Первая: это результаты лучших внедрений, а не среднее по рынку. Вторая — в самой формулировке: считаются только успешно разрешённые обращения, то есть уже отфильтрованный бакет, из которого вычли всё, что сломалось.

HoReCa0:00
Так звучит обращение из отфильтрованного бакета: минута, бронь на двоих, всё зафиксировано. Сложные случаи в эту статистику не попадают.

Здесь же разваливается миф «вендорские 80–90% — это то, что получу я». Формулировки вида «up to» почти никогда не сопровождаются определением того, что считается решённым обращением. Единственный честный предиктор вашего результата — пилот на ваших звонках с вашим определением успеха.

Не сравнивайте свой CSAT с чужим

Чужой CSAT посчитан на другой базе обращений, другой шкале и другом определении «решено». Сравнивать имеет смысл только с собственным базовым уровнем до запуска — и по бакетам.

Ограничения: почему опросу после звонка нельзя верить целиком

Отвечают немногие и с перекосом. Опрос после звонка заполняют в основном те, кто на полюсах: очень доволен или очень зол. Спокойное большинство молчит. Публичных российских данных по доле ответивших именно на постзвонковый опрос в открытом доступе нет — тем более нельзя строить решение на одной цифре из такого опроса.

«Понравился ли робот» — плохой вопрос. Он меряет отношение к технологии, а не решённость задачи. Ответ на него предсказуемо смещён: по данным Solar Staff, 45% опрошенных хотят гарантированную возможность переключиться на человека, а 33% против полной замены поддержки на ИИ. Спрашивать надо о результате: решён ли ваш вопрос, пришлось ли обращаться повторно.

Поведение честнее ответа. Повторное обращение за 72 часа, forced escalation rate, transfer success rate (ориентир — более 90%, Balto/Famulor) не зависят от настроения и желания заполнять форму. Клиент, который перезвонил на следующий день, уже сказал всё про качество, и опрос тут ничего не добавит.

Плохой CSAT в escalated-бакете часто не про агента. Он про то, как устроена передача человеку: поздно, без контекста, с повтором всех вопросов заново. Это отдельная механика — она разобрана в статье про то, почему бот не переводит на оператора. И это же первое, что стоит чинить, потому что чинится дешевле остального.

Частые вопросы

Как правильно измерять CSAT после внедрения голосового бота
Разбивать на бакеты: обращения, закрытые агентом, и обращения, ушедшие человеку. Сравнивать каждый бакет с собственным базовым уровнем до запуска, а не с чужими цифрами. Ориентир Balto/Famulor — разрыв contained-бакета с базой не более 3 пунктов.
Почему средний CSAT вырос, а жалоб стало больше
Из-за усреднения. Простые обращения ускорились и подняли среднее, сложные сломались и опустили его; в сумме получается ровная линия, за которой не видно провала на трудных кейсах. Именно так выглядит история Klarna в отчётности.
Какой CSAT считается нормальным для голосового AI-агента
Универсальной нормы нет. Цифра 85–90% (по данным вендора irisagent) относится только к успешно разрешённым ботом обращениям и к лучшим внедрениям — как бенчмарк для своего проекта она не годится. Норма — ваш собственный уровень до запуска.
Какие метрики смотреть вместо опроса после звонка
Поведенческие: повторное обращение за 72 часа (ориентир менее 15%), forced escalation rate (менее 10%), transfer success rate (более 90%) — ориентиры Balto/Famulor. Они не зависят от того, захотел ли клиент заполнить форму.

Вывод

Средний CSAT после робота — это не метрика качества, а метрика структуры обращений. Он растёт ровно потому, что доля простых звонков в потоке выросла, и продолжает расти, пока сложные обращения ломаются молча. Разложите его по бакетам, добавьте два-три поведенческих показателя — и увидите то же самое, что видит клиент. Если бакеты покажут провал на деньгах и спорах, это вопрос не качества модели, а границ автономии и правил эскалации; на экономику проекта это влияет напрямую — см. расчёт ROI голосового AI-агента.

Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и посмотреть срезы на реальном потоке.

Тот самый простой бакет звучит примерно так

Соберите агента по своему сайту и позвоните ему с типовым вопросом клиента — бесплатно. Так слышно, из чего складывается высокая оценка в contained-бакете и почему она мало говорит об остальном потоке.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.