Вендор говорит containment 85%. Что он на самом деле измерил
Containment, deflection и resolution — три разные цифры, которые зовут одним словом. Разбор терминов и вопросы, снимающие подмену понятий.
Вендор показывает слайд: containment 85%. Цифра выглядит убедительно, но сама по себе она не значит ничего — пока вы не спросили, что именно засчитано в эти 85%. Клиент, который бросил трубку на третьей секунде, у одного поставщика попадёт в успешные звонки, у другого — в потерянные. Обе методики законны, и обе дают «85%».
Поэтому термины голосовых агентов стоит разбирать не как глоссарий, а как защиту от подмены понятий. Короткий ответ на вопрос заголовка: скорее всего, вендор измерил containment — долю звонков, закрытых без человека. Это не то же самое, что решённый вопрос клиента, и не то же, что отведённое обращение.
Ниже — термины парами, там, где подмена стоит денег.
Что такое containment и чем он отличается от deflection и resolution
Deflection — обращение не дошло до оператора. И всё. Клиент мог получить ответ, а мог устать и положить трубку: в обоих случаях обращение «отведено». Самая широкая и самая бесполезная для покупателя цифра.
Containment rate — доля обращений, закрытых агентом без передачи человеку. Строже, потому что предполагает завершённый диалог. Но не говорит, доволен ли клиент и не перезвонил ли он через час.
Resolution rate — доля обращений, реально решённых. Самая честная и самая редкая цифра: она требует определения слова «решено» и проверки постфактум.
Порядок почти всегда такой: deflection больше containment, containment больше resolution. Если вендор называет одно число — спросите, какое из трёх.
Типичные диапазоны для калибровки. Классический DTMF-IVR: containment 5–10%, conversational IVR: 10–15%. Заявления вендоров agentic-решений (например, Teneo): 60–90%. Независимые оценки production-внедрений (dragapp): 40–70%; по оценке платформы Balto, ранняя стадия даёт 20–40%, зрелая — 40–70%. На структурированных сценариях (статус заказа, запись, напоминание) — 70–90%.
Containment против escalation rate: одна цифра ничего не доказывает
Высокий containment получают двумя способами. Первый: агент хорошо решает вопросы. Второй: агент плохо переводит на человека. Снаружи оба выглядят одинаково.
Поэтому containment читают только в паре с метриками эскалации. Ориентиры (Balto/Famulor): forced escalation rate — когда клиент сам требует человека — менее 10%; transfer success rate более 90%; repeat contact rate за 72 часа менее 15%. Плюс CSAT по бакетам: contained против escalated, разрыв contained-бакета с базовым уровнем не более 3 пунктов.
Агент, который физически не умеет переводить на оператора, покажет отличный containment и очередь жалоб. Подробный разбор — в статье о метриках голосового AI-агента.
«Точность 97%» и «до 90%»: где цифра меняет смысл
Точность распознавания против точности понимания. WER (Word Error Rate) — доля ошибок расшифровки слов: агент услышал «Пятницкая» как «пятнадцатая». Intent recognition accuracy — доля правильно понятых намерений; у зрелых систем это 90–97% (оценка Balto). Можно распознать все слова верно и понять запрос неправильно. Когда на слайде написано «точность 97%», уточните, что и на каком материале мерили: WER резко растёт на акцентах, фоновом шуме, узкополосной телефонии и отраслевых терминах.
«До 90%» против типичного диапазона. Конструкция «up to» — это лучший результат на лучшем сценарии у лучшего клиента. Не среднее, не типичное, не ваше. Retell AI заявляет 50–80% containment в течение 60 дней после запуска, Decagon — resolution 70–75%: это заявления, измеренные самими продавцами.
Agent washing. Gartner в пресс-релизе от 25 июня 2025 года отметил: из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130. Остальное — переименование обычной автоматизации в «агента». Проверяет не слово на сайте, а поведение в диалоге, который вы сами сломаете вопросом не по скрипту. Чем сценарный робот отличается от агента — в разборе за что вы платите.
«Вендорские 80–90% resolution — это то, что получу я». Нет. Независимые оценки production-внедрений дают 40–70%, а формулировки «до 90%» почти всегда приводятся без определения того, что считается решённым. Единственный честный предиктор — пилот на своих данных и по своему определению успеха.
Термин, значение и вопрос вендору
| Термин | Что значит | Что спросить у вендора |
|---|---|---|
| Deflection | обращение не дошло до оператора | Сброс вы считаете отведённым? |
| Containment | закрыто без передачи человеку | Звонки короче 10 секунд входят в знаменатель? |
| Resolution | вопрос реально решён | Как проверяете и через какой срок? |
| Escalation / handoff | передача разговора человеку | Доля forced escalation и успешность перевода? |
| AHT | среднее время обработки обращения | Очередь и постобработка входят в расчёт? |
| CSAT | удовлетворённость клиента | Даёте разбивку contained против escalated? |
| WER | доля ошибок распознавания слов | Мерили на студии или на телефонии? |
| Barge-in | клиент может перебить агента | Доля ложных срабатываний от шума? |
| Endpointing | определение конца реплики клиента | Какая отсечка по умолчанию? |
| Латентность P95 | задержка у 95% реплик, а не средняя | Показываете P95 или среднее? |
| Guardrails | ограничители допустимого поведения | Что агент физически не может сказать? |
| RAG | ответ с опорой на базу знаний | Откуда факты и как обновляется база? |
| Галлюцинация | уверенно сформулированный вымысел | Кто отвечает, если агент пообещал лишнее? |
| AI SDR | агент для исходящих продаж | Это диалог или озвученный скрипт? |
Ориентиры к таблице. World-class уровень AHT — 4–5 минут (методология SQM). Порог естественности по латентности — менее 500 мс P95; свыше секунды воспринимается как робот. Типичное окно endpointing — 200–400 мс: короткая отсечка перебивает думающего клиента, длинная делает паузы неестественными. Последний вопрос не риторический: суд обязал Air Canada исполнить политику возврата, выдуманную её собственным чат-ботом.
Ограничения: почему цифры двух вендоров сравнивать бессмысленно
Единого отраслевого определения resolution не существует. Один считает решённым звонок, после которого клиент не перезвонил за 24 часа. Второй — тот, где сработал целевой сценарий. Третий — тот, где клиент нажал «да» в опросе. Стандарта, обязывающего считать одинаково, нет ни в России, ни на мировом рынке.
Отсюда три следствия. Первое: два числа из двух коммерческих предложений несопоставимы, пока рядом нет определений и знаменателей. Второе: диапазоны выше — ориентиры, а не обещания; containment 40–70% в production нельзя округлить до «около 70%». Третье: даже согласованные определения не переносятся между сценариями — запись на приём и спор о деньгах дают разный containment на одной технологии.
Терминология не заменяет проверку. Свою цифру даёт только пилот на своих звонках с определением успеха, зафиксированным до старта. Как формулировать вопросы поставщику — в материале про 12 неудобных вопросов; почему дешёвая минута выходит дороже — в разборе цены голосового агента.
Частые вопросы
Чем containment отличается от resolution простыми словами
Какой containment считается нормальным
Почему вендоры показывают разные цифры на одинаковых задачах
Что такое agent washing
Вывод
Термины в этой сфере не описывают реальность, а нарезают её — и нарезать можно по-разному. Один и тот же час работы агента становится высоким deflection, средним containment или скромным resolution — в зависимости от того, кто считает. Это не обман, а отсутствие стандарта, которым продавцы пользуются по умолчанию. Защита простая: на каждую цифру спрашивать определение, знаменатель и период измерения. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и посчитать метрики по вашим определениям.
