реплика

Вендор говорит containment 85%. Что он на самом деле измерил

Containment, deflection и resolution — три разные цифры, которые зовут одним словом. Разбор терминов и вопросы, снимающие подмену понятий.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·10 сентября 2025·7 минут чтения

Вендор показывает слайд: containment 85%. Цифра выглядит убедительно, но сама по себе она не значит ничего — пока вы не спросили, что именно засчитано в эти 85%. Клиент, который бросил трубку на третьей секунде, у одного поставщика попадёт в успешные звонки, у другого — в потерянные. Обе методики законны, и обе дают «85%».

Поэтому термины голосовых агентов стоит разбирать не как глоссарий, а как защиту от подмены понятий. Короткий ответ на вопрос заголовка: скорее всего, вендор измерил containment — долю звонков, закрытых без человека. Это не то же самое, что решённый вопрос клиента, и не то же, что отведённое обращение.

Ниже — термины парами, там, где подмена стоит денег.

Что такое containment и чем он отличается от deflection и resolution

Deflection — обращение не дошло до оператора. И всё. Клиент мог получить ответ, а мог устать и положить трубку: в обоих случаях обращение «отведено». Самая широкая и самая бесполезная для покупателя цифра.

Containment rate — доля обращений, закрытых агентом без передачи человеку. Строже, потому что предполагает завершённый диалог. Но не говорит, доволен ли клиент и не перезвонил ли он через час.

Resolution rate — доля обращений, реально решённых. Самая честная и самая редкая цифра: она требует определения слова «решено» и проверки постфактум.

Порядок почти всегда такой: deflection больше containment, containment больше resolution. Если вендор называет одно число — спросите, какое из трёх.

Типичные диапазоны для калибровки. Классический DTMF-IVR: containment 5–10%, conversational IVR: 10–15%. Заявления вендоров agentic-решений (например, Teneo): 60–90%. Независимые оценки production-внедрений (dragapp): 40–70%; по оценке платформы Balto, ранняя стадия даёт 20–40%, зрелая — 40–70%. На структурированных сценариях (статус заказа, запись, напоминание) — 70–90%.

Containment против escalation rate: одна цифра ничего не доказывает

Высокий containment получают двумя способами. Первый: агент хорошо решает вопросы. Второй: агент плохо переводит на человека. Снаружи оба выглядят одинаково.

Поэтому containment читают только в паре с метриками эскалации. Ориентиры (Balto/Famulor): forced escalation rate — когда клиент сам требует человека — менее 10%; transfer success rate более 90%; repeat contact rate за 72 часа менее 15%. Плюс CSAT по бакетам: contained против escalated, разрыв contained-бакета с базовым уровнем не более 3 пунктов.

Агент, который физически не умеет переводить на оператора, покажет отличный containment и очередь жалоб. Подробный разбор — в статье о метриках голосового AI-агента.

«Точность 97%» и «до 90%»: где цифра меняет смысл

Точность распознавания против точности понимания. WER (Word Error Rate) — доля ошибок расшифровки слов: агент услышал «Пятницкая» как «пятнадцатая». Intent recognition accuracy — доля правильно понятых намерений; у зрелых систем это 90–97% (оценка Balto). Можно распознать все слова верно и понять запрос неправильно. Когда на слайде написано «точность 97%», уточните, что и на каком материале мерили: WER резко растёт на акцентах, фоновом шуме, узкополосной телефонии и отраслевых терминах.

«До 90%» против типичного диапазона. Конструкция «up to» — это лучший результат на лучшем сценарии у лучшего клиента. Не среднее, не типичное, не ваше. Retell AI заявляет 50–80% containment в течение 60 дней после запуска, Decagon — resolution 70–75%: это заявления, измеренные самими продавцами.

Agent washing. Gartner в пресс-релизе от 25 июня 2025 года отметил: из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130. Остальное — переименование обычной автоматизации в «агента». Проверяет не слово на сайте, а поведение в диалоге, который вы сами сломаете вопросом не по скрипту. Чем сценарный робот отличается от агента — в разборе за что вы платите.

Миф, который стоит денег

«Вендорские 80–90% resolution — это то, что получу я». Нет. Независимые оценки production-внедрений дают 40–70%, а формулировки «до 90%» почти всегда приводятся без определения того, что считается решённым. Единственный честный предиктор — пилот на своих данных и по своему определению успеха.

Розница и e-commerce0:00
Тот случай, который стоит за словом resolution: вопрос клиента закрыт внутри звонка, заказ подтверждён, перевода на человека не было.

Термин, значение и вопрос вендору

ТерминЧто значитЧто спросить у вендора
Deflectionобращение не дошло до оператораСброс вы считаете отведённым?
Containmentзакрыто без передачи человекуЗвонки короче 10 секунд входят в знаменатель?
Resolutionвопрос реально решёнКак проверяете и через какой срок?
Escalation / handoffпередача разговора человекуДоля forced escalation и успешность перевода?
AHTсреднее время обработки обращенияОчередь и постобработка входят в расчёт?
CSATудовлетворённость клиентаДаёте разбивку contained против escalated?
WERдоля ошибок распознавания словМерили на студии или на телефонии?
Barge-inклиент может перебить агентаДоля ложных срабатываний от шума?
Endpointingопределение конца реплики клиентаКакая отсечка по умолчанию?
Латентность P95задержка у 95% реплик, а не средняяПоказываете P95 или среднее?
Guardrailsограничители допустимого поведенияЧто агент физически не может сказать?
RAGответ с опорой на базу знанийОткуда факты и как обновляется база?
Галлюцинацияуверенно сформулированный вымыселКто отвечает, если агент пообещал лишнее?
AI SDRагент для исходящих продажЭто диалог или озвученный скрипт?

Ориентиры к таблице. World-class уровень AHT — 4–5 минут (методология SQM). Порог естественности по латентности — менее 500 мс P95; свыше секунды воспринимается как робот. Типичное окно endpointing — 200–400 мс: короткая отсечка перебивает думающего клиента, длинная делает паузы неестественными. Последний вопрос не риторический: суд обязал Air Canada исполнить политику возврата, выдуманную её собственным чат-ботом.

Ограничения: почему цифры двух вендоров сравнивать бессмысленно

Единого отраслевого определения resolution не существует. Один считает решённым звонок, после которого клиент не перезвонил за 24 часа. Второй — тот, где сработал целевой сценарий. Третий — тот, где клиент нажал «да» в опросе. Стандарта, обязывающего считать одинаково, нет ни в России, ни на мировом рынке.

Отсюда три следствия. Первое: два числа из двух коммерческих предложений несопоставимы, пока рядом нет определений и знаменателей. Второе: диапазоны выше — ориентиры, а не обещания; containment 40–70% в production нельзя округлить до «около 70%». Третье: даже согласованные определения не переносятся между сценариями — запись на приём и спор о деньгах дают разный containment на одной технологии.

Терминология не заменяет проверку. Свою цифру даёт только пилот на своих звонках с определением успеха, зафиксированным до старта. Как формулировать вопросы поставщику — в материале про 12 неудобных вопросов; почему дешёвая минута выходит дороже — в разборе цены голосового агента.

Частые вопросы

Чем containment отличается от resolution простыми словами
Containment — звонок закрыт без человека. Resolution — вопрос клиента действительно решён. Клиент может положить трубку в раздражении: для containment это успех, для resolution — нет.
Какой containment считается нормальным
Независимые оценки production-внедрений дают 40–70% (dragapp), на структурированных задачах вроде записи или статуса заказа — 70–90%. Цифра сильно зависит от сценария, поэтому без описания задач она несопоставима.
Почему вендоры показывают разные цифры на одинаковых задачах
Потому что они по-разному определяют успех и формируют знаменатель: короткие сбросы, повторные звонки и переводы по просьбе клиента можно включить в расчёт или исключить. Единого отраслевого стандарта нет.
Что такое agent washing
Так называют маркетинговое переименование обычной сценарной автоматизации в «AI-агента». По оценке Gartner из пресс-релиза от 25 июня 2025 года, из тысяч вендоров, называющих себя agentic, реально таковыми являются около 130.

Вывод

Термины в этой сфере не описывают реальность, а нарезают её — и нарезать можно по-разному. Один и тот же час работы агента становится высоким deflection, средним containment или скромным resolution — в зависимости от того, кто считает. Это не обман, а отсутствие стандарта, которым продавцы пользуются по умолчанию. Защита простая: на каждую цифру спрашивать определение, знаменатель и период измерения. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и посчитать метрики по вашим определениям.

Одна цифра из презентации против одного живого разговора

Чужие проценты мало что значат, пока не сверены определения. Бесплатный агент собирается по адресу вашего сайта — позвоните ему и сломайте разговор вопросом не по сценарию: услышанное методики не требует.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.