Средний CSAT вырос, клиенты злее. Как мерить после робота
Средний CSAT после робота растёт, а клиенты злее. Как считать CSAT по бакетам и какие метрики честнее опроса после звонка.
Через месяц после запуска голосового агента средний CSAT обычно не падает. Часто он даже подрастает на пункт-другой. При этом руководитель поддержки видит больше жалоб в мессенджерах, а команда говорит, что клиенты приходят на линию уже злыми. Обе картины верные. Врёт не агент и не опрос — врёт среднее.
Короткий ответ: CSAT после робота нельзя смотреть одной цифрой. Его нужно разложить по бакетам — отдельно обращения, которые агент закрыл сам, отдельно те, что ушли человеку. Ориентир Balto/Famulor: разрыв CSAT contained-бакета с базовым уровнем до запуска не должен превышать 3 пунктов. Если разрыв больше — автоматизация оплачена качеством сервиса, просто счёт пришёл не туда, куда вы смотрите.
И второе: опрос после звонка — самый слабый инструмент из доступных. Поведение клиента после разговора говорит правду быстрее, чем его оценка по пятибалльной шкале.
Эффект усреднения: почему средний CSAT растёт, а клиенты злее
Простые обращения — статус заказа, запись, напоминание, часы работы — агент закрывает за секунды и в любое время суток. Клиент, который раньше ждал в очереди четыре минуты, получает ответ сразу и ставит высокую оценку. Таких обращений большинство, и они тянут среднее вверх.
Сложные — спор по списанию, ошибка в заказе, нестандартная ситуация — ломаются. Клиент дважды объясняет проблему, не попадает в сценарий, прорывается к человеку и начинает разговор с оператором уже раздражённым. Таких обращений меньшинство, и они тянут среднее вниз.
Сложить одно с другим — получить «нормально». Дальше вы месяц смотрите на ровную линию и не видите, что на части обращений сервис стал хуже, чем был до запуска. Та же логика ломает и другие показатели: каких метрик не хватает, когда containment 80%.
Klarna: канонический пример того, что скрывает среднее
Пресс-релиз OpenAI и Klarna от 27 февраля 2024 года: за первый месяц ассистент обработал 2,3 млн диалогов — две трети всех чатов поддержки; среднее время разрешения сократилось с 11 минут до менее чем 2; повторные обращения снизились примерно на 25%.
Обратная сторона всплыла позже: по публикациям Forbes, CSAT просел примерно на 22%, компания вернула людей на обслуживание премиальных клиентов и перешла к гибридной модели.
Важно, что именно здесь сломалось. Не технология: на массовых простых обращениях она отработала. Сломалась стратегия полной замены без градуированной автономии и без эскалации по уровню уверенности. Подробный разбор — в статье «Klarna заменила операторов на ИИ и вернула людей обратно».
Как мерить CSAT после робота: срезы вместо одной цифры
Один дашборд с одной линией не показывает ничего. Работающий минимум — шесть срезов.
| Срез | Что сравниваем | Что считать сигналом |
|---|---|---|
| CSAT contained-бакета | с базовым уровнем до запуска | разрыв больше 3 пунктов (ориентир Balto/Famulor) |
| CSAT escalated-бакета | с CSAT contained-бакета | escalated заметно ниже — человек получает клиента уже разогретым |
| CSAT по типам обращений | деньги, споры, личная ситуация против статуса и записи | провал на «денежных» темах: эти интенты отданы агенту рано |
| Повторное обращение за 72 часа | с ориентиром менее 15% (Balto/Famulor) | рост — «решено» в отчёте, не решено у клиента |
| Forced escalation rate | с ориентиром менее 10% | рост — клиент пробивается к человеку сам, а не по правилу |
| Доля ответивших на опрос | contained против escalated | разная наполняемость — средние по бакетам несопоставимы |
Разбивка по типам обращений опирается на данные CNews: ИИ доверяют информирование о статусе заказа и доставки — 54% опрошенных, напоминания — 50%, консультации по тарифам — около 40%. Доверие резко падает на задачах, связанных с деньгами, спорами и персональной ситуацией. Если у вас средний CSAT ровный, а в срезе «спорные списания» он на дне — вы нашли не проблему метрики, а проблему маршрутизации.
85–90% CSAT у бота — чей это результат
У цифры есть источник: по данным вендора irisagent, CSAT на успешно разрешённых ботом обращениях составляет 85–90%. Две оговорки съедают половину смысла. Первая: это результаты лучших внедрений, а не среднее по рынку. Вторая — в самой формулировке: считаются только успешно разрешённые обращения, то есть уже отфильтрованный бакет, из которого вычли всё, что сломалось.
Здесь же разваливается миф «вендорские 80–90% — это то, что получу я». Формулировки вида «up to» почти никогда не сопровождаются определением того, что считается решённым обращением. Единственный честный предиктор вашего результата — пилот на ваших звонках с вашим определением успеха.
Чужой CSAT посчитан на другой базе обращений, другой шкале и другом определении «решено». Сравнивать имеет смысл только с собственным базовым уровнем до запуска — и по бакетам.
Ограничения: почему опросу после звонка нельзя верить целиком
Отвечают немногие и с перекосом. Опрос после звонка заполняют в основном те, кто на полюсах: очень доволен или очень зол. Спокойное большинство молчит. Публичных российских данных по доле ответивших именно на постзвонковый опрос в открытом доступе нет — тем более нельзя строить решение на одной цифре из такого опроса.
«Понравился ли робот» — плохой вопрос. Он меряет отношение к технологии, а не решённость задачи. Ответ на него предсказуемо смещён: по данным Solar Staff, 45% опрошенных хотят гарантированную возможность переключиться на человека, а 33% против полной замены поддержки на ИИ. Спрашивать надо о результате: решён ли ваш вопрос, пришлось ли обращаться повторно.
Поведение честнее ответа. Повторное обращение за 72 часа, forced escalation rate, transfer success rate (ориентир — более 90%, Balto/Famulor) не зависят от настроения и желания заполнять форму. Клиент, который перезвонил на следующий день, уже сказал всё про качество, и опрос тут ничего не добавит.
Плохой CSAT в escalated-бакете часто не про агента. Он про то, как устроена передача человеку: поздно, без контекста, с повтором всех вопросов заново. Это отдельная механика — она разобрана в статье про то, почему бот не переводит на оператора. И это же первое, что стоит чинить, потому что чинится дешевле остального.
Частые вопросы
Как правильно измерять CSAT после внедрения голосового бота
Почему средний CSAT вырос, а жалоб стало больше
Какой CSAT считается нормальным для голосового AI-агента
Какие метрики смотреть вместо опроса после звонка
Вывод
Средний CSAT после робота — это не метрика качества, а метрика структуры обращений. Он растёт ровно потому, что доля простых звонков в потоке выросла, и продолжает расти, пока сложные обращения ломаются молча. Разложите его по бакетам, добавьте два-три поведенческих показателя — и увидите то же самое, что видит клиент. Если бакеты покажут провал на деньгах и спорах, это вопрос не качества модели, а границ автономии и правил эскалации; на экономику проекта это влияет напрямую — см. расчёт ROI голосового AI-агента.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и посмотреть срезы на реальном потоке.
