Klarna заменила операторов на ИИ и вернула людей обратно
Кейс «Klarna ИИ поддержка» без мифов: цифры пресс-релиза, падение CSAT на 22% и чек-лист эскалации, чтобы замена операторов на ИИ не вышла дороже.
В феврале 2024 года шведский финтех Klarna объявил, что его ИИ-ассистент делает работу примерно 700 операторов. Через полтора года компания вернула живых людей на обслуживание части клиентов. С тех пор кейс «Klarna ИИ поддержка» цитируют в двух взаимоисключающих версиях: как доказательство того, что ИИ уже заменил операторов, и как доказательство того, что ИИ в поддержке не работает. Обе версии неверны.
Короткий ответ такой. Технология сработала ровно там, куда её поставили, — на массовом потоке простых однотипных обращений. Она не сработала на сложных, спорных и эмоциональных. Провалилась не модель, а стратегия: полная замена первой линии без градуированной автономии и без эскалации по уровню уверенности. Klarna не откатилась назад к людям — она перешла к гибридной модели, то есть к тому, с чего стоило начинать.
Ниже — обе половины истории с атрибуцией, разбор того, почему средние метрики улучшались одновременно с падением удовлетворённости, и практический блок: что стоило сделать иначе и как проверить это на своём проекте.
Что именно объявила Klarna: цифры пресс-релиза
Первая половина кейса — совместный пресс-релиз OpenAI и Klarna от 27 февраля 2024 года. Все цифры ниже — из него, то есть это данные компании о собственном внедрении, а не независимое измерение:
- за первый месяц работы ассистент обработал 2,3 млн диалогов — две трети всех чатов поддержки;
- объём выполненной работы компания оценила как эквивалент примерно 700 операторов;
- среднее время разрешения обращения сократилось с 11 минут до менее чем 2 минут;
- повторные обращения снизились примерно на 25%;
- ожидаемое улучшение прибыли — около 40 млн долларов в 2024 году.
Это сильные цифры, и отмахиваться от них нечестно: две трети чатов — измеримый объём, а не маркетинговая абстракция. Но у них два свойства, которые теряются при пересказе. Первое: речь о текстовой поддержке крупного финтеха с потоком однотипных вопросов вроде «где мой платёж» и «как вернуть товар». Второе: среди этих метрик нет ни одной метрики качества.
Вторая половина: CSAT и возврат людей
Дальше произошло то, что в исходном релизе измерять не стали. По публикациям Forbes и последующим материалам деловой прессы, удовлетворённость клиентов (CSAT) просела примерно на 22%. Klarna вернула людей на обслуживание премиальных клиентов и публично перешла к гибридной модели, где ИИ закрывает поток, а человек доступен по запросу и на сложных случаях.
Важна формулировка: не «отключила ИИ», а вернула людей туда, где они нужны. Ассистент продолжает работать — изменилась архитектура распределения задач между ним и людьми.
Цифры производительности — из пресс-релиза компании (сторона, заинтересованная в результате). Цифры по качеству — из деловой прессы. Это разные источники с разной мотивацией, и подавать их как единый «отчёт Klarna» некорректно.
Почему время разрешения падало, а CSAT падал вместе с ним
Здесь и находится системный урок, ради которого стоит разбирать этот кейс.
Среднее время разрешения — усреднённая метрика. Простые обращения ускоряются радикально: вместо очереди и оператора клиент получает ответ за секунды. Их много, они тянут среднее вниз, и на дашборде картина выглядит триумфальной. Сложные обращения при этом не просто не ускоряются — они ломаются. Клиент со спорной транзакцией, ошибочным списанием или нестандартной ситуацией попадает в цикл, где агент не понимает запрос, не признаёт этого и не передаёт человека.
CSAT устроен иначе. Он не усредняется по объёму так же милосердно: тяжёлый негативный опыт весит в восприятии бренда несопоставимо больше, чем удачно закрытый вопрос про статус доставки. Получается ножницы — операционные метрики растут, клиентские падают.
Отсюда практическое правило: containment без парных метрик качества — метрика самообмана. Доля обращений, закрытых без человека, ничего не говорит о том, был ли вопрос решён: клиент мог просто бросить чат. Containment, repeat contact rate, forced escalation и CSAT по бакетам читаются только вместе.
Замена операторов на ИИ: что говорят данные о сокращениях
Тему сокращений в статьях про ИИ в поддержке принято обходить. Обходить её не нужно — замена операторов на ИИ действительно происходит, и есть данные о том, чем она заканчивается.
По прогнозу Forrester (Predictions 2026), около 55% работодателей, сокративших персонал ради ИИ, сожалеют о решении, а примерно треть потратила на повторный найм больше, чем сэкономила. У явления есть название — «layoff boomerang». По данным Careerminds, среди компаний, столкнувшихся с откатом, 35,6% наняли обратно больше половины сокращённых.
Gartner в пресс-релизе от 25 июня 2025 года прогнозирует, что более 40% проектов agentic AI будут отменены к концу 2027 года — из-за роста затрат, неясной бизнес-ценности и недостаточного контроля рисков. Там же аналитики отмечают, что из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130; остальное — «agent washing».
Оговорка, без которой эти цифры вводят в заблуждение: и Forrester, и Careerminds, и кейс Klarna описывают рынки с другой структурой издержек и другой стоимостью труда. Оператор поддержки в США и в российском регионе стоит бизнесу принципиально разных денег, и экономика замены считается по-другому. Переносить проценты напрямую нельзя — их нужно пересчитывать под свои ставки. Как это делать, разобрано в статье как посчитать ROI голосового AI-агента.
Осторожный вывод: увольнять первую линию по результатам первого месяца пилота — самая дорогая ошибка в этом классе проектов. Сначала измеряется, какая доля потока реально закрывается без человека и с каким качеством, и только потом принимаются кадровые решения.
Три мифа, которые кейс Klarna не подтверждает
Миф «ИИ заменит операторов уже завтра». Кейс показывает обратное: даже при двух третях автоматизированных чатов человек понадобился обратно — на сегменте, где цена ошибки выше. Независимые оценки production-внедрений дают containment 40–70% (dragapp), а не 100%. Технология снимает рутину, а не функцию целиком.
Миф «заменил людей — сэкономил». Экономия на ФОТ реальна, но она не единственная строка в расчёте. В минусе оказываются отток клиентов, стоимость повторного найма и обучения, потеря экспертизы. Данные Forrester выше — про это.
Миф «ИИ в звонках и чатах вообще не работает». Это симметричная ошибка, и она встречается не реже. 2,3 млн диалогов за месяц и падение времени разрешения с 11 до менее чем 2 минут — это не имитация работы. На структурированных транзакционных интентах (статус заказа, запись, напоминание, подтверждение) containment достигает 70–90%. Технология работает; вопрос в том, какие задачи ей отдают.
Почему так важна градуированная автономия, показывает τ-bench — бенчмарк консистентности агентов от Sierra и Принстона (препринт arXiv:2406.12045). GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи показатель pass^8 падает ниже 25%. То есть агент может справиться, но не гарантирует одинакового результата каждый раз. Именно поэтому нужны пороги уверенности, тесты и обязательный выход на человека — а не вера в то, что «модель разберётся».
Что Klarna сделала, что стоило сделать и как проверить это у себя
| Что сделала Klarna | Что стоило сделать | Как проверить у себя |
|---|---|---|
| Отдала ИИ весь поток чатов сразу | Разделить поток по типам обращений и включать автономию по одному интенту | Выгрузить обращения за месяц и посчитать долю топ-5 однотипных запросов |
| Мерила скорость и объём | Мерить скорость вместе с CSAT по бакетам «закрыто ботом» и «эскалировано» | Настроить два опроса удовлетворённости вместо одного общего |
| Считала эквивалент 700 операторов | Считать стоимость обращения и стоимость ошибки отдельно по сегментам | Посчитать, во сколько обходится один потерянный премиальный клиент |
| Замена людей до накопления данных | Гибрид с первого дня, кадровые решения — после квартала измерений | Зафиксировать срок пилота и метрики приёмки до старта |
| Эскалация как аварийный сценарий | Эскалация как штатный путь с порогом уверенности | Проверить, есть ли у агента явная фраза перевода и живой маршрут |
Чек-лист проектирования эскалации
- Порог уверенности. Определён численно: ниже порога агент не «пробует ещё раз», а передаёт человека. Порог настраивается отдельно по типам обращений — на деньгах и спорах он выше.
- CSAT по бакетам. Отдельно по обращениям, закрытым агентом, и по эскалированным. Ориентир: разрыв contained-бакета с базовым уровнем не более 3 пунктов.
- Repeat contact rate за 72 часа — менее 15%. Если клиент возвращается с тем же вопросом, обращение не было решено, чем бы ни считал дашборд.
- Forced escalation rate — менее 10%. Доля случаев, когда клиент вынужден требовать человека сам. Высокое значение означает, что агент не признаёт своих границ.
- Transfer success rate — более 90%. Перевод должен доходить до живого человека с сохранённым контекстом, а не начинать разговор заново.
- Явный выход. Клиент в любой момент может попросить человека и получает его. Это не уступка, а требование рынка: по данным Solar Staff, 45% россиян хотят гарантированную возможность переключиться на оператора, а 83% предпочитают гибридную модель.
Эти же метрики стоит спрашивать у поставщика до подписания договора — подробный список вопросов собран в статье как выбрать голосового AI-агента.
Ограничения: чего кейс Klarna не доказывает
Кейс полезный, но его регулярно растягивают на выводы, которых в нём нет.
Это текстовая поддержка, а не голос. Чат прощает паузу в три секунды и позволяет переспросить. В голосе бюджет на ответ измеряется сотнями миллисекунд, добавляются распознавание речи, шум, акценты и перебивания. Механика провала на сложных обращениях в голосе будет жёстче, а метрики — другими. Разница между технологиями разобрана в материале про то, чем голосовой AI-агент отличается от робота обзвона.
Это крупный финтех, а не малый бизнес. У Klarna поток, при котором даже 1% сложных обращений — это десятки тысяч случаев в месяц, и есть ресурс на собственную команду внедрения. В компании с 200 обращениями в месяц и экономика, и риски устроены иначе: там одна испорченная коммуникация может весить больше, чем вся экономия.
Это другой рынок. Другая стоимость труда, другие ожидания от сервиса, другая регуляторика. Российский контекст добавляет своё: по данным НАФИ (август 2025 года, выборка 6213 человек), доля позитивных оценок ИИ-ассистентов снизилась с 37% годом ранее до 33%, при этом 57% респондентов не отличают бота от человека в разговоре. Подробнее — в статье почему клиенты не любят голосовых ботов.
И главное: кейс ничего не говорит о вашей доле автоматизируемых обращений. Она зависит от того, насколько структурирован ваш поток. Единственный честный предиктор — пилот на своих данных со своим определением успеха, а не чужой процент.
Как аргумент «смотрите, у них получилось, значит получится у нас» и как аргумент «смотрите, у них не получилось, значит это всё хайп». В обоих случаях из истории вынимается вывод, которого в ней нет.
Частые вопросы
Что на самом деле произошло с ИИ-поддержкой Klarna
Значит ли кейс Klarna, что ИИ в поддержке не работает
Можно ли сокращать операторов после внедрения ИИ
Какую долю обращений реально можно закрыть без оператора
Что должно происходить, когда агент не понимает клиента
Вывод
Klarna — не история про то, что ИИ победил или проиграл. Это история про то, что автоматизация первой линии без градуированной автономии и без confidence-based эскалации улучшает средние метрики и портит клиентский опыт одновременно. Технология делает то, что умеет: закрывает массовый однотипный поток быстрее и дешевле человека. Всё остальное — вопрос архитектуры и честного измерения, а не силы модели. Правильный порядок действий — узкий сценарий, парные метрики качества, работающая эскалация и только потом разговор про масштаб.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и посмотреть, какая часть вашего потока действительно закрывается без оператора.
