Три демо звучали одинаково. Как сравнить поставщиков агентов
Как сравнить поставщиков голосовых агентов честно: один сценарий, общая база знаний, по 20 звонков каждому и слепая оценка записей по чек-листу.
Сравнить поставщиков голосовых агентов по их собственным материалам невозможно. У одного на сайте ролик про запись в клинику, у другого — про подтверждение доставки, у третьего живое демо на его сценарии и его базе знаний. Три записи, снятые в трёх разных условиях, не образуют сравнения: побеждает тот, кто выбрал себе задачу полегче.
Работающая методика простая и скучная. Один сценарий, одна база знаний, один и тот же набор звонков — по двадцать на каждого поставщика, — записи слушает человек, который не знает, чей это агент, и заполняет один чек-лист. Метрики считаются по одинаковым определениям. Всё остальное — переговоры, а не сравнение.
Ниже — как собрать такой прогон, что именно в нём фиксировать, сколько звонков нужно и чего эта процедура всё равно не покажет.
Почему демо-ролик ничего не сравнивает
Проблема не в том, что вендоры показывают лучшее. Проблема в том, что у каждого «лучшее» своё.
Демо снимается в тишине, на своём сценарии, часто не с первого дубля. Кейс Air.ai — вирусный взлёт на демонстрациях, за которым не последовало жизнеспособного продукта, а дело дошло до урегулирования с FTC (по данным aiagents.wiki) — стоит помнить как напоминание: демо в тишине и продакшен в реальной телефонии измеряют разное. Что именно скрывает даже честная демонстрация, разобрано в статье про оценку демо агента.
С цифрами то же самое. Вендоры называют containment 60–90% (например, Teneo), независимые оценки production-внедрений дают 40–70% (dragapp). Но даже внутри одного диапазона числа несравнимы, пока не совпадает определение: у одного поставщика «удержано» — это разговор без перевода на человека, у другого — обращение, после которого клиент не перезвонил в течение 72 часов. Это самый распространённый миф процесса выбора: что проценты с двух лендингов можно поставить рядом.
Как сравнить поставщиков голосовых агентов: четыре одинаковых условия
Сравнение начинается с того, что вы фиксируете за всех участников.
Один сценарий. Берётся ваш реальный частотный сценарий — не самый сложный и не самый простой, а тот, которого в потоке больше всего. Формулируется письменно: что агент должен выяснить, что сказать, где остановиться, когда передать человека.
Одна база знаний. Один и тот же документ уходит всем: услуги, прайс, филиалы, зона обслуживания, список того, чего компания не делает. Разные наборы фактов делают разговоры несравнимыми ещё до первого звонка. Из чего этот документ собирается — в материале про базу знаний для агента.
Один набор звонков. Двадцать одинаковых входных ситуаций на каждого: типовая заявка, клиент без части данных, клиент с вопросом за пределами базы, требование позвать человека, шумный фон, перебивание на середине реплики. Одни и те же двадцать — каждому.
Одно определение успеха. Что считается закрытым звонком именно у вас: заявка с заполненными полями, подтверждённая запись, корректно переданный человеку разговор. Определение пишется до прогонов, а не после.
Почему двадцать звонков, а не два
Один удачный разговор не характеризует агента. Препринт τ-bench (Sierra и Принстон, arXiv:2406.12045) показывает, почему: модель решает задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи доля успеха падает ниже 25%. Языковой агент не детерминирован — он может справиться и не гарантирует одинакового результата каждый раз.
Практический вывод для сравнения: каждую ситуацию прогоняйте несколько раз подряд. Разброс между прогонами — такая же характеристика поставщика, как и лучший результат. Двадцать звонков на участника — это минимум, при котором разброс вообще становится виден; на решении о годовом контракте лучше сорок.
Чек-лист слепой оценки
Записи обезличиваются: убираются приветствия с названием вендора, файлы получают номера. Оценщик — человек из вашей компании, который работает с этими клиентами, и он не знает, чей агент говорит.
| Что проверяем | Что считается хорошим | Как фиксировать |
|---|---|---|
| Представление и повод звонка | Названы компания и причина в первой реплике | Да / нет |
| Полнота собранных данных | Все обязательные поля получены | Число полей из N |
| Реакция на вопрос вне базы знаний | Признал, что не знает, передал человеку | Да / выдумал ответ |
| Просьба позвать человека | Перевод с первой просьбы | С какой просьбы сработал |
| Перебивание и шум | Замолчал вовремя, не потерял нить | Оценка 1–3 |
| Паузы | Ответ без заметного зависания | Оценка 1–3 |
| Ошибки в записанном | Имя, номер, адрес зафиксированы верно | Число ошибок |
| Общее впечатление | Стал бы клиент продолжать разговор | Оценка 1–5 |
Оценки складываются по каждому участнику отдельно. Слепота здесь не формальность: знание бренда сдвигает оценку сильнее, чем разница между агентами. Как слушать звонки, чтобы услышать проблему, а не подтвердить ожидание, — в отдельном материале.
Одинаковые метрики и один знаменатель
Помимо чек-листа считаются четыре числа, каждое по единому определению: доля звонков, закрытых без человека; доля разговоров с вынужденной эскалацией (ориентир — менее 10%); доля успешных переводов на человека (более 90%); задержка ответа. По латентности ориентир общий: порог естественности — менее 500 мс P95, свыше секунды разговор воспринимается как робот. Что стоит за этими числами — в статье про метрики голосового агента.
Деньги приводятся к одному знаменателю отдельно. Ставка за минуту у разных поставщиков считает разное, поэтому сравнивают не её, а стоимость одного результата: заявки, записи, квалифицированного лида. Механика пересчёта — в материале про тарификацию голосовых агентов.
Ограничения: чего сравнение не покажет
Двадцать звонков не покажут поведение под нагрузкой. Ни очередь, ни параллельные линии, ни деградацию в час пик. Это проверяется только пилотом на части реального трафика — как его считать, разобрано в статье про пилот голосового агента.
Сравнение фиксирует момент, а не траекторию. Агент, проигравший на старте, может обгонять после двух недель правок. Поэтому наравне с результатом фиксируйте, сколько времени у каждого поставщика заняла одна и та же правка сценария.
Оценщик устаёт. После пятидесятого файла оценки сползают. Слушать нужно порциями, вперемешку и желательно вдвоём с расхождениями по спорным записям.
Одинаковые условия невозможно выдержать полностью. У поставщиков разная телефония, разные модели, разные ограничения по интеграциям. Задача — не стерильность, а честность: одинаковый сценарий, одинаковая фактура, одинаковый чек-лист.
Частые вопросы
Как сравнить поставщиков голосовых агентов между собой?
Почему нельзя ориентироваться на демо и ролики вендоров?
Сколько звонков нужно для честного сравнения?
Можно ли сравнивать containment, заявленный вендорами?
Вывод
Сравнение поставщиков — это не переговоры и не просмотр записей, а измерение в одинаковых условиях. Один сценарий, одна база знаний, двадцать одинаковых звонков, обезличенные записи и единый чек-лист дают результат, который можно показать финансовому директору. Отдельно фиксируется скорость правок: она предсказывает следующий год работы лучше, чем лучший разговор из демо. Список вопросов, которые задаются до всякого прогона, собран в статье про выбор голосового AI-агента.
