Демо голосового агента звучало идеально. Что оно не показывает
Демо голосового AI-агента показывает голос и один гладкий сценарий. Как сломать его на встрече: 5 проверок вживую и чек-лист из 8 пунктов.
Демо голосового агента почти всегда проходит хорошо. Не потому, что вендор жульничает, — просто демо устроено так, что показывает сильные стороны технологии и обходит слабые. Живой голос, интонация, гладкий диалог по сценарию — это умеют почти все платформы на рынке. Именно поэтому по демо нельзя выбрать поставщика.
Короткий ответ на вопрос в заголовке. Демо показывает качество синтеза речи и один отрепетированный сценарий. Оно не показывает, что произойдёт при уличном шуме, акценте, перебивании на середине фразы, вопросе за границей базы знаний, требовании позвать человека и на вашей реальной телефонии. Всё, что ломает агента в продакшене, на демо просто не случается.
Сломать демо можно прямо на встрече, это занимает минут пятнадцать.
Почему красивая демка ничего не доказывает
Канонический пример — Air.ai: вирусный взлёт на демо-роликах голосового агента, за которым не последовало жизнеспособного продукта. Проект прекратил существование, дело дошло до урегулирования с FTC (по данным aiagents.wiki). Вывод стоит держать в голове на любой встрече: демо в тишине не равно продакшену в реальной телефонии.
Второй фон — agent washing. По данным Gartner (пресс-релиз от 25 июня 2025 года), из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130; остальное — обычная автоматизация с новым названием. Демо — ровно тот формат, где отличить контекстного агента от скриптового робота с хорошим голосом сложнее всего: на отрепетированной ветке они звучат одинаково.
Демо показывает тембр, темп речи, чистый happy path и скорость на студийном канале. Не показывает распознавание в шуме, реакцию на перебивание, вопрос вне базы знаний, механику эскалации, задержку на вашей АТС и повторяемость.
Пять сценариев, которыми нужно ломать демо вживую
Просите прогнать их не в записи, а здесь и сейчас, своим голосом, со своей формулировкой.
- Шум и акцент. Включите фоном улицу или цех, говорите быстро, проглатывайте окончания. Точность распознавания предсказуемо падает на акцентах, шуме, узкополосной телефонии и отраслевых терминах — это ограничение технологии, а не брак вендора. Важно не то, ошибся ли агент, а как: переспрашивает по делу или уверенно едет дальше по неверно распознанному слову.
- Перебивание. Начните говорить на середине его реплики. Агент должен замолчать почти мгновенно. Обратная проблема не менее важна: ложное срабатывание, когда система замолкает от кашля, поддакивания или шума.
- Вопрос вне базы знаний. Спросите про то, чего в базе точно нет: редкий тариф, нестандартную гарантию, скидку. Правильный ответ — честное «не знаю» плюс действие, неправильный — уверенная выдумка. Бот Air Canada пообещал пассажиру несуществующую политику возврата, и суд встал на сторону пассажира: за слова агента отвечает бизнес.
- Требование человека. Трижды скажите «позовите оператора». Смотрите, переводит ли агент, что он передаёт человеку вместе со звонком и что слышит клиент в момент перевода.
- Реальная телефония. Попросите позвонить на ваш номер через обычную линию, а не через браузер. Порог естественности — менее 500 мс P95, свыше секунды пауза читается как «это робот». Каскадные системы STT → LLM → TTS без оптимизации дают 670–3200 мс (оценки Coval и Hamming), и разница между браузером и SIP-каналом вылезает именно здесь. Подробнее — в разборе латентности голосового агента.
Почему один и тот же кейс надо прогнать трижды подряд
Это самая честная проверка на демо, и почти никто её не просит.
В препринте τ-bench (Sierra и Принстон, arXiv:2406.12045) модель решает розничную задачу с первого раза примерно в 61% случаев. Но при восьми повторных прогонах одной и той же задачи доля случаев, когда она справилась все восемь раз, падает ниже 25%. Агент может сделать правильно — и не гарантирует, что сделает так же в следующий раз.
Отсюда развенчивается миф, на котором держится половина демонстраций: «ИИ понимает как человек, значит один удачный диалог доказывает работоспособность». Один диалог — один сэмпл. Три одинаковых запроса подряд покажут разброс: совпали ли условия, одинаково ли записались данные. Если на третьем прогоне агент назвал другую цену или срок — вы увидели ровно то, за чем пришли.
Непостоянство есть у любого LLM-агента. Вопрос не в том, есть ли оно, а чем вендор его ограничивает: guardrails, сверка с источником, жёсткие шаблоны для чисел и обязательств, эскалация при низкой уверенности. Ответ «наша модель не ошибается» хуже, чем сам разброс.
Чек-лист: 8 проверок на демо и что считать плохим ответом
| Что попросить | Плохой ответ или результат |
|---|---|
| Прогнать мой сценарий, а не ваш готовый | «Покажем на следующей встрече», демонстрация только записи |
| Позвонить на мой мобильный через обычную линию | Только браузерный виджет; заметная пауза после каждой реплики |
| Перебить агента на середине фразы | Договаривает до конца или замолкает от постороннего шума |
| Задать вопрос вне базы знаний | Уверенный выдуманный ответ вместо «не знаю, уточню» |
| Три раза сказать «переведите на человека» | Уводит обратно в сценарий; менеджер получает звонок без контекста |
| Прогнать один и тот же кейс три раза подряд | Разные цифры, условия или итоговые данные в карточке |
| Показать, что попало в CRM после звонка | Только ссылка на запись разговора, поля не заполнены |
| Назвать, что именно считается успешным звонком | Метрика без определения: «resolution до 90%» без критерия |
Последний пункт важнее, чем кажется. Вендорские заявления о 60–90% containment и независимые оценки production-внедрений в 40–70% (dragapp) расходятся в том числе потому, что «решённым» считают разное.
Ограничения: чего не покажет даже хорошее демо
Даже если вендор честно прогнал все восемь пунктов, две вещи останутся за кадром — и это не его вина.
Экономику на вашем объёме. На демо не видно ни доли звонков с эскалацией, ни средней длительности на ваших клиентах, ни того, во что превратится счёт при вашей нагрузке. Цена минуты в презентации и итоговая сумма — разные величины: сколько стоит голосовой AI-агент.
Поведение на вашей базе знаний. Демо-агент работает на десятке подготовленных фактов. Ваш — на прайсе с исключениями, устаревших регламентах и трёх версиях условий доставки. Именно там появляются галлюцинации и «не знаю» в ответ на типовой вопрос.
Отсюда вывод: демо отсеивает слабых поставщиков, но не выбирает подходящего. Выбирает пилот на ваших данных — с заранее зафиксированным определением успеха. Демо — фильтр, пилот — решение.
Частые вопросы
Как оценить демо голосового AI-агента, если я не технарь
Можно ли просить показать демо на своём сценарии
Почему агент на демо отвечает быстрее, чем потом в работе
Демо прошло хорошо — можно уже покупать
Вывод
Демо быстро отсеивает тех, кто продаёт ролик. Но всё, что определяет результат — консистентность, поведение на вашем контенте, задержка на вашей телефонии, итоговый счёт, — на демонстрации не измеряется. Задача покупателя не восхититься голосом, а аккуратно сломать сценарий и посмотреть, как агент ведёт себя в поломанном состоянии. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и прогнать его столько раз, сколько нужно.
