реплика

Три демо звучали одинаково. Как сравнить поставщиков агентов

Как сравнить поставщиков голосовых агентов честно: один сценарий, общая база знаний, по 20 звонков каждому и слепая оценка записей по чек-листу.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·9 сентября 2026·7 минут чтения

Сравнить поставщиков голосовых агентов по их собственным материалам невозможно. У одного на сайте ролик про запись в клинику, у другого — про подтверждение доставки, у третьего живое демо на его сценарии и его базе знаний. Три записи, снятые в трёх разных условиях, не образуют сравнения: побеждает тот, кто выбрал себе задачу полегче.

Работающая методика простая и скучная. Один сценарий, одна база знаний, один и тот же набор звонков — по двадцать на каждого поставщика, — записи слушает человек, который не знает, чей это агент, и заполняет один чек-лист. Метрики считаются по одинаковым определениям. Всё остальное — переговоры, а не сравнение.

Ниже — как собрать такой прогон, что именно в нём фиксировать, сколько звонков нужно и чего эта процедура всё равно не покажет.

Почему демо-ролик ничего не сравнивает

Проблема не в том, что вендоры показывают лучшее. Проблема в том, что у каждого «лучшее» своё.

Демо снимается в тишине, на своём сценарии, часто не с первого дубля. Кейс Air.ai — вирусный взлёт на демонстрациях, за которым не последовало жизнеспособного продукта, а дело дошло до урегулирования с FTC (по данным aiagents.wiki) — стоит помнить как напоминание: демо в тишине и продакшен в реальной телефонии измеряют разное. Что именно скрывает даже честная демонстрация, разобрано в статье про оценку демо агента.

С цифрами то же самое. Вендоры называют containment 60–90% (например, Teneo), независимые оценки production-внедрений дают 40–70% (dragapp). Но даже внутри одного диапазона числа несравнимы, пока не совпадает определение: у одного поставщика «удержано» — это разговор без перевода на человека, у другого — обращение, после которого клиент не перезвонил в течение 72 часов. Это самый распространённый миф процесса выбора: что проценты с двух лендингов можно поставить рядом.

Как сравнить поставщиков голосовых агентов: четыре одинаковых условия

Сравнение начинается с того, что вы фиксируете за всех участников.

Один сценарий. Берётся ваш реальный частотный сценарий — не самый сложный и не самый простой, а тот, которого в потоке больше всего. Формулируется письменно: что агент должен выяснить, что сказать, где остановиться, когда передать человека.

Одна база знаний. Один и тот же документ уходит всем: услуги, прайс, филиалы, зона обслуживания, список того, чего компания не делает. Разные наборы фактов делают разговоры несравнимыми ещё до первого звонка. Из чего этот документ собирается — в материале про базу знаний для агента.

Один набор звонков. Двадцать одинаковых входных ситуаций на каждого: типовая заявка, клиент без части данных, клиент с вопросом за пределами базы, требование позвать человека, шумный фон, перебивание на середине реплики. Одни и те же двадцать — каждому.

Одно определение успеха. Что считается закрытым звонком именно у вас: заявка с заполненными полями, подтверждённая запись, корректно переданный человеку разговор. Определение пишется до прогонов, а не после.

HoReCa0:00
Входящий на минуту с небольшим: бронь столика на завтра на 17:00 на двоих, имя Анна, номер телефона для связи. Агент проговаривает записанное вслух и обещает СМС с подтверждением. По такому короткому разговору чек-лист заполняется целиком — представился, собрал дату, время и количество гостей, повторил данные на проверку, назвал следующий шаг. Именно такой сценарий и стоит давать всем участникам сравнения.

Почему двадцать звонков, а не два

Один удачный разговор не характеризует агента. Препринт τ-bench (Sierra и Принстон, arXiv:2406.12045) показывает, почему: модель решает задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи доля успеха падает ниже 25%. Языковой агент не детерминирован — он может справиться и не гарантирует одинакового результата каждый раз.

Практический вывод для сравнения: каждую ситуацию прогоняйте несколько раз подряд. Разброс между прогонами — такая же характеристика поставщика, как и лучший результат. Двадцать звонков на участника — это минимум, при котором разброс вообще становится виден; на решении о годовом контракте лучше сорок.

Чек-лист слепой оценки

Записи обезличиваются: убираются приветствия с названием вендора, файлы получают номера. Оценщик — человек из вашей компании, который работает с этими клиентами, и он не знает, чей агент говорит.

Что проверяемЧто считается хорошимКак фиксировать
Представление и повод звонкаНазваны компания и причина в первой репликеДа / нет
Полнота собранных данныхВсе обязательные поля полученыЧисло полей из N
Реакция на вопрос вне базы знанийПризнал, что не знает, передал человекуДа / выдумал ответ
Просьба позвать человекаПеревод с первой просьбыС какой просьбы сработал
Перебивание и шумЗамолчал вовремя, не потерял нитьОценка 1–3
ПаузыОтвет без заметного зависанияОценка 1–3
Ошибки в записанномИмя, номер, адрес зафиксированы верноЧисло ошибок
Общее впечатлениеСтал бы клиент продолжать разговорОценка 1–5

Оценки складываются по каждому участнику отдельно. Слепота здесь не формальность: знание бренда сдвигает оценку сильнее, чем разница между агентами. Как слушать звонки, чтобы услышать проблему, а не подтвердить ожидание, — в отдельном материале.

Одинаковые метрики и один знаменатель

Помимо чек-листа считаются четыре числа, каждое по единому определению: доля звонков, закрытых без человека; доля разговоров с вынужденной эскалацией (ориентир — менее 10%); доля успешных переводов на человека (более 90%); задержка ответа. По латентности ориентир общий: порог естественности — менее 500 мс P95, свыше секунды разговор воспринимается как робот. Что стоит за этими числами — в статье про метрики голосового агента.

Деньги приводятся к одному знаменателю отдельно. Ставка за минуту у разных поставщиков считает разное, поэтому сравнивают не её, а стоимость одного результата: заявки, записи, квалифицированного лида. Механика пересчёта — в материале про тарификацию голосовых агентов.

Ограничения: чего сравнение не покажет

Двадцать звонков не покажут поведение под нагрузкой. Ни очередь, ни параллельные линии, ни деградацию в час пик. Это проверяется только пилотом на части реального трафика — как его считать, разобрано в статье про пилот голосового агента.

Сравнение фиксирует момент, а не траекторию. Агент, проигравший на старте, может обгонять после двух недель правок. Поэтому наравне с результатом фиксируйте, сколько времени у каждого поставщика заняла одна и та же правка сценария.

Оценщик устаёт. После пятидесятого файла оценки сползают. Слушать нужно порциями, вперемешку и желательно вдвоём с расхождениями по спорным записям.

Одинаковые условия невозможно выдержать полностью. У поставщиков разная телефония, разные модели, разные ограничения по интеграциям. Задача — не стерильность, а честность: одинаковый сценарий, одинаковая фактура, одинаковый чек-лист.

Частые вопросы

Как сравнить поставщиков голосовых агентов между собой?
Дать всем один сценарий и одну базу знаний, прогнать по двадцать одинаковых звонков на каждого, обезличить записи и оценить их по единому чек-листу силами человека, который не знает, чей это агент. Метрики считать по одному определению, а деньги приводить к стоимости результата, а не минуты.
Почему нельзя ориентироваться на демо и ролики вендоров?
Потому что каждый показывает свой сценарий в своих условиях и часто не с первого дубля. Сравнимость появляется только тогда, когда задачу задаёте вы, а не поставщик.
Сколько звонков нужно для честного сравнения?
Минимум двадцать на участника, лучше сорок при решении о годовом контракте. Одного прогона мало: препринт τ-bench показывает падение доли успеха примерно с 61% при одной попытке до менее 25% при восьми повторах одной и той же задачи.
Можно ли сравнивать containment, заявленный вендорами?
Только после того, как совпало определение. Вендорские заявления держатся в диапазоне 60–90%, независимые оценки production-внедрений — 40–70%, и разница часто объясняется не качеством, а тем, что считать закрытым обращением.

Вывод

Сравнение поставщиков — это не переговоры и не просмотр записей, а измерение в одинаковых условиях. Один сценарий, одна база знаний, двадцать одинаковых звонков, обезличенные записи и единый чек-лист дают результат, который можно показать финансовому директору. Отдельно фиксируется скорость правок: она предсказывает следующий год работы лучше, чем лучший разговор из демо. Список вопросов, которые задаются до всякого прогона, собран в статье про выбор голосового AI-агента.

Сделайте первый замер до переговоров с вендорами

По адресу вашего сайта бесплатно собирается агент, которому можно позвонить. Прогоните на нём тот же чек-лист — получите точку отсчёта, с которой потом сравниваете всех остальных.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.