реплика

Klarna заменила операторов на ИИ и вернула людей обратно

Кейс «Klarna ИИ поддержка» без мифов: цифры пресс-релиза, падение CSAT на 22% и чек-лист эскалации, чтобы замена операторов на ИИ не вышла дороже.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·15 июля 2026·11 минут чтения

В феврале 2024 года шведский финтех Klarna объявил, что его ИИ-ассистент делает работу примерно 700 операторов. Через полтора года компания вернула живых людей на обслуживание части клиентов. С тех пор кейс «Klarna ИИ поддержка» цитируют в двух взаимоисключающих версиях: как доказательство того, что ИИ уже заменил операторов, и как доказательство того, что ИИ в поддержке не работает. Обе версии неверны.

Короткий ответ такой. Технология сработала ровно там, куда её поставили, — на массовом потоке простых однотипных обращений. Она не сработала на сложных, спорных и эмоциональных. Провалилась не модель, а стратегия: полная замена первой линии без градуированной автономии и без эскалации по уровню уверенности. Klarna не откатилась назад к людям — она перешла к гибридной модели, то есть к тому, с чего стоило начинать.

Ниже — обе половины истории с атрибуцией, разбор того, почему средние метрики улучшались одновременно с падением удовлетворённости, и практический блок: что стоило сделать иначе и как проверить это на своём проекте.

Что именно объявила Klarna: цифры пресс-релиза

Первая половина кейса — совместный пресс-релиз OpenAI и Klarna от 27 февраля 2024 года. Все цифры ниже — из него, то есть это данные компании о собственном внедрении, а не независимое измерение:

  • за первый месяц работы ассистент обработал 2,3 млн диалогов — две трети всех чатов поддержки;
  • объём выполненной работы компания оценила как эквивалент примерно 700 операторов;
  • среднее время разрешения обращения сократилось с 11 минут до менее чем 2 минут;
  • повторные обращения снизились примерно на 25%;
  • ожидаемое улучшение прибыли — около 40 млн долларов в 2024 году.

Это сильные цифры, и отмахиваться от них нечестно: две трети чатов — измеримый объём, а не маркетинговая абстракция. Но у них два свойства, которые теряются при пересказе. Первое: речь о текстовой поддержке крупного финтеха с потоком однотипных вопросов вроде «где мой платёж» и «как вернуть товар». Второе: среди этих метрик нет ни одной метрики качества.

Вторая половина: CSAT и возврат людей

Дальше произошло то, что в исходном релизе измерять не стали. По публикациям Forbes и последующим материалам деловой прессы, удовлетворённость клиентов (CSAT) просела примерно на 22%. Klarna вернула людей на обслуживание премиальных клиентов и публично перешла к гибридной модели, где ИИ закрывает поток, а человек доступен по запросу и на сложных случаях.

Важна формулировка: не «отключила ИИ», а вернула людей туда, где они нужны. Ассистент продолжает работать — изменилась архитектура распределения задач между ним и людьми.

Как правильно ссылаться на этот кейс

Цифры производительности — из пресс-релиза компании (сторона, заинтересованная в результате). Цифры по качеству — из деловой прессы. Это разные источники с разной мотивацией, и подавать их как единый «отчёт Klarna» некорректно.

Почему время разрешения падало, а CSAT падал вместе с ним

Здесь и находится системный урок, ради которого стоит разбирать этот кейс.

Среднее время разрешения — усреднённая метрика. Простые обращения ускоряются радикально: вместо очереди и оператора клиент получает ответ за секунды. Их много, они тянут среднее вниз, и на дашборде картина выглядит триумфальной. Сложные обращения при этом не просто не ускоряются — они ломаются. Клиент со спорной транзакцией, ошибочным списанием или нестандартной ситуацией попадает в цикл, где агент не понимает запрос, не признаёт этого и не передаёт человека.

CSAT устроен иначе. Он не усредняется по объёму так же милосердно: тяжёлый негативный опыт весит в восприятии бренда несопоставимо больше, чем удачно закрытый вопрос про статус доставки. Получается ножницы — операционные метрики растут, клиентские падают.

Отсюда практическое правило: containment без парных метрик качества — метрика самообмана. Доля обращений, закрытых без человека, ничего не говорит о том, был ли вопрос решён: клиент мог просто бросить чат. Containment, repeat contact rate, forced escalation и CSAT по бакетам читаются только вместе.

Замена операторов на ИИ: что говорят данные о сокращениях

Тему сокращений в статьях про ИИ в поддержке принято обходить. Обходить её не нужно — замена операторов на ИИ действительно происходит, и есть данные о том, чем она заканчивается.

По прогнозу Forrester (Predictions 2026), около 55% работодателей, сокративших персонал ради ИИ, сожалеют о решении, а примерно треть потратила на повторный найм больше, чем сэкономила. У явления есть название — «layoff boomerang». По данным Careerminds, среди компаний, столкнувшихся с откатом, 35,6% наняли обратно больше половины сокращённых.

Gartner в пресс-релизе от 25 июня 2025 года прогнозирует, что более 40% проектов agentic AI будут отменены к концу 2027 года — из-за роста затрат, неясной бизнес-ценности и недостаточного контроля рисков. Там же аналитики отмечают, что из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130; остальное — «agent washing».

Оговорка, без которой эти цифры вводят в заблуждение: и Forrester, и Careerminds, и кейс Klarna описывают рынки с другой структурой издержек и другой стоимостью труда. Оператор поддержки в США и в российском регионе стоит бизнесу принципиально разных денег, и экономика замены считается по-другому. Переносить проценты напрямую нельзя — их нужно пересчитывать под свои ставки. Как это делать, разобрано в статье как посчитать ROI голосового AI-агента.

Осторожный вывод: увольнять первую линию по результатам первого месяца пилота — самая дорогая ошибка в этом классе проектов. Сначала измеряется, какая доля потока реально закрывается без человека и с каким качеством, и только потом принимаются кадровые решения.

Три мифа, которые кейс Klarna не подтверждает

Миф «ИИ заменит операторов уже завтра». Кейс показывает обратное: даже при двух третях автоматизированных чатов человек понадобился обратно — на сегменте, где цена ошибки выше. Независимые оценки production-внедрений дают containment 40–70% (dragapp), а не 100%. Технология снимает рутину, а не функцию целиком.

Миф «заменил людей — сэкономил». Экономия на ФОТ реальна, но она не единственная строка в расчёте. В минусе оказываются отток клиентов, стоимость повторного найма и обучения, потеря экспертизы. Данные Forrester выше — про это.

Миф «ИИ в звонках и чатах вообще не работает». Это симметричная ошибка, и она встречается не реже. 2,3 млн диалогов за месяц и падение времени разрешения с 11 до менее чем 2 минут — это не имитация работы. На структурированных транзакционных интентах (статус заказа, запись, напоминание, подтверждение) containment достигает 70–90%. Технология работает; вопрос в том, какие задачи ей отдают.

Розница и e-commerce0:00
Запись структурированного обращения — того типа задач, где технология действительно закрывает поток.

Почему так важна градуированная автономия, показывает τ-bench — бенчмарк консистентности агентов от Sierra и Принстона (препринт arXiv:2406.12045). GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи показатель pass^8 падает ниже 25%. То есть агент может справиться, но не гарантирует одинакового результата каждый раз. Именно поэтому нужны пороги уверенности, тесты и обязательный выход на человека — а не вера в то, что «модель разберётся».

Что Klarna сделала, что стоило сделать и как проверить это у себя

Что сделала KlarnaЧто стоило сделатьКак проверить у себя
Отдала ИИ весь поток чатов сразуРазделить поток по типам обращений и включать автономию по одному интентуВыгрузить обращения за месяц и посчитать долю топ-5 однотипных запросов
Мерила скорость и объёмМерить скорость вместе с CSAT по бакетам «закрыто ботом» и «эскалировано»Настроить два опроса удовлетворённости вместо одного общего
Считала эквивалент 700 операторовСчитать стоимость обращения и стоимость ошибки отдельно по сегментамПосчитать, во сколько обходится один потерянный премиальный клиент
Замена людей до накопления данныхГибрид с первого дня, кадровые решения — после квартала измеренийЗафиксировать срок пилота и метрики приёмки до старта
Эскалация как аварийный сценарийЭскалация как штатный путь с порогом уверенностиПроверить, есть ли у агента явная фраза перевода и живой маршрут

Чек-лист проектирования эскалации

  • Порог уверенности. Определён численно: ниже порога агент не «пробует ещё раз», а передаёт человека. Порог настраивается отдельно по типам обращений — на деньгах и спорах он выше.
  • CSAT по бакетам. Отдельно по обращениям, закрытым агентом, и по эскалированным. Ориентир: разрыв contained-бакета с базовым уровнем не более 3 пунктов.
  • Repeat contact rate за 72 часа — менее 15%. Если клиент возвращается с тем же вопросом, обращение не было решено, чем бы ни считал дашборд.
  • Forced escalation rate — менее 10%. Доля случаев, когда клиент вынужден требовать человека сам. Высокое значение означает, что агент не признаёт своих границ.
  • Transfer success rate — более 90%. Перевод должен доходить до живого человека с сохранённым контекстом, а не начинать разговор заново.
  • Явный выход. Клиент в любой момент может попросить человека и получает его. Это не уступка, а требование рынка: по данным Solar Staff, 45% россиян хотят гарантированную возможность переключиться на оператора, а 83% предпочитают гибридную модель.

Эти же метрики стоит спрашивать у поставщика до подписания договора — подробный список вопросов собран в статье как выбрать голосового AI-агента.

Ограничения: чего кейс Klarna не доказывает

Кейс полезный, но его регулярно растягивают на выводы, которых в нём нет.

Это текстовая поддержка, а не голос. Чат прощает паузу в три секунды и позволяет переспросить. В голосе бюджет на ответ измеряется сотнями миллисекунд, добавляются распознавание речи, шум, акценты и перебивания. Механика провала на сложных обращениях в голосе будет жёстче, а метрики — другими. Разница между технологиями разобрана в материале про то, чем голосовой AI-агент отличается от робота обзвона.

Это крупный финтех, а не малый бизнес. У Klarna поток, при котором даже 1% сложных обращений — это десятки тысяч случаев в месяц, и есть ресурс на собственную команду внедрения. В компании с 200 обращениями в месяц и экономика, и риски устроены иначе: там одна испорченная коммуникация может весить больше, чем вся экономия.

Это другой рынок. Другая стоимость труда, другие ожидания от сервиса, другая регуляторика. Российский контекст добавляет своё: по данным НАФИ (август 2025 года, выборка 6213 человек), доля позитивных оценок ИИ-ассистентов снизилась с 37% годом ранее до 33%, при этом 57% респондентов не отличают бота от человека в разговоре. Подробнее — в статье почему клиенты не любят голосовых ботов.

И главное: кейс ничего не говорит о вашей доле автоматизируемых обращений. Она зависит от того, насколько структурирован ваш поток. Единственный честный предиктор — пилот на своих данных со своим определением успеха, а не чужой процент.

Где кейс Klarna применять точно не стоит

Как аргумент «смотрите, у них получилось, значит получится у нас» и как аргумент «смотрите, у них не получилось, значит это всё хайп». В обоих случаях из истории вынимается вывод, которого в ней нет.

Частые вопросы

Что на самом деле произошло с ИИ-поддержкой Klarna
Компания в феврале 2024 года запустила ИИ-ассистента, который за первый месяц обработал 2,3 млн диалогов — две трети всех чатов (пресс-релиз OpenAI и Klarna от 27.02.2024). Позже, по публикациям Forbes, выяснилось, что CSAT просел примерно на 22%, и компания вернула людей на обслуживание премиальных клиентов. Сейчас там гибридная модель: ИИ на потоке, человек на сложных случаях.
Значит ли кейс Klarna, что ИИ в поддержке не работает
Нет. Сокращение среднего времени разрешения с 11 минут до менее чем 2 минут по данным компании — реальный результат на массовых простых обращениях. Провалилась стратегия полной замены без эскалации, а не технология. На структурированных задачах вроде статуса заказа или записи containment достигает 70–90%.
Можно ли сокращать операторов после внедрения ИИ
Данные советуют не спешить. По прогнозу Forrester (Predictions 2026), около 55% работодателей, сокративших персонал ради ИИ, сожалеют о решении, а примерно треть потратила на повторный найм больше, чем сэкономила. Разумный порядок — сначала квартал измерений на гибридной модели, потом кадровые решения.
Какую долю обращений реально можно закрыть без оператора
Независимые оценки production-внедрений дают 40–70% (dragapp), вендоры заявляют 60–90%. На узких структурированных сценариях верхняя граница выше, на консультациях и спорных ситуациях — заметно ниже. Свою цифру можно узнать только пилотом на собственном потоке обращений.
Что должно происходить, когда агент не понимает клиента
Штатный перевод на человека по порогу уверенности, а не попытка угадать ответ. Рабочие ориентиры: forced escalation ниже 10%, transfer success выше 90%, repeat contact rate за 72 часа ниже 15%. Если этих метрик в отчётности нет, containment показывает не решённые вопросы, а брошенные диалоги.

Вывод

Klarna — не история про то, что ИИ победил или проиграл. Это история про то, что автоматизация первой линии без градуированной автономии и без confidence-based эскалации улучшает средние метрики и портит клиентский опыт одновременно. Технология делает то, что умеет: закрывает массовый однотипный поток быстрее и дешевле человека. Всё остальное — вопрос архитектуры и честного измерения, а не силы модели. Правильный порядок действий — узкий сценарий, парные метрики качества, работающая эскалация и только потом разговор про масштаб.

Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и посмотреть, какая часть вашего потока действительно закрывается без оператора.

Свой узкий сценарий проверить быстрее, чем спорить о кейсе

По адресу сайта бесплатно собирается голосовой агент под одну задачу — ему можно позвонить и услышать, где он справляется сам, а где разговор пора отдавать человеку.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.