реплика

Демо голосового агента звучало идеально. Что оно не показывает

Демо голосового AI-агента показывает голос и один гладкий сценарий. Как сломать его на встрече: 5 проверок вживую и чек-лист из 8 пунктов.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·20 августа 2025·6 минут чтения

Демо голосового агента почти всегда проходит хорошо. Не потому, что вендор жульничает, — просто демо устроено так, что показывает сильные стороны технологии и обходит слабые. Живой голос, интонация, гладкий диалог по сценарию — это умеют почти все платформы на рынке. Именно поэтому по демо нельзя выбрать поставщика.

Короткий ответ на вопрос в заголовке. Демо показывает качество синтеза речи и один отрепетированный сценарий. Оно не показывает, что произойдёт при уличном шуме, акценте, перебивании на середине фразы, вопросе за границей базы знаний, требовании позвать человека и на вашей реальной телефонии. Всё, что ломает агента в продакшене, на демо просто не случается.

Сломать демо можно прямо на встрече, это занимает минут пятнадцать.

Почему красивая демка ничего не доказывает

Канонический пример — Air.ai: вирусный взлёт на демо-роликах голосового агента, за которым не последовало жизнеспособного продукта. Проект прекратил существование, дело дошло до урегулирования с FTC (по данным aiagents.wiki). Вывод стоит держать в голове на любой встрече: демо в тишине не равно продакшену в реальной телефонии.

Второй фон — agent washing. По данным Gartner (пресс-релиз от 25 июня 2025 года), из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130; остальное — обычная автоматизация с новым названием. Демо — ровно тот формат, где отличить контекстного агента от скриптового робота с хорошим голосом сложнее всего: на отрепетированной ветке они звучат одинаково.

Демо показывает тембр, темп речи, чистый happy path и скорость на студийном канале. Не показывает распознавание в шуме, реакцию на перебивание, вопрос вне базы знаний, механику эскалации, задержку на вашей АТС и повторяемость.

Пять сценариев, которыми нужно ломать демо вживую

Просите прогнать их не в записи, а здесь и сейчас, своим голосом, со своей формулировкой.

  1. Шум и акцент. Включите фоном улицу или цех, говорите быстро, проглатывайте окончания. Точность распознавания предсказуемо падает на акцентах, шуме, узкополосной телефонии и отраслевых терминах — это ограничение технологии, а не брак вендора. Важно не то, ошибся ли агент, а как: переспрашивает по делу или уверенно едет дальше по неверно распознанному слову.
  2. Перебивание. Начните говорить на середине его реплики. Агент должен замолчать почти мгновенно. Обратная проблема не менее важна: ложное срабатывание, когда система замолкает от кашля, поддакивания или шума.
  3. Вопрос вне базы знаний. Спросите про то, чего в базе точно нет: редкий тариф, нестандартную гарантию, скидку. Правильный ответ — честное «не знаю» плюс действие, неправильный — уверенная выдумка. Бот Air Canada пообещал пассажиру несуществующую политику возврата, и суд встал на сторону пассажира: за слова агента отвечает бизнес.
  4. Требование человека. Трижды скажите «позовите оператора». Смотрите, переводит ли агент, что он передаёт человеку вместе со звонком и что слышит клиент в момент перевода.
  5. Реальная телефония. Попросите позвонить на ваш номер через обычную линию, а не через браузер. Порог естественности — менее 500 мс P95, свыше секунды пауза читается как «это робот». Каскадные системы STT → LLM → TTS без оптимизации дают 670–3200 мс (оценки Coval и Hamming), и разница между браузером и SIP-каналом вылезает именно здесь. Подробнее — в разборе латентности голосового агента.

Почему один и тот же кейс надо прогнать трижды подряд

Это самая честная проверка на демо, и почти никто её не просит.

В препринте τ-bench (Sierra и Принстон, arXiv:2406.12045) модель решает розничную задачу с первого раза примерно в 61% случаев. Но при восьми повторных прогонах одной и той же задачи доля случаев, когда она справилась все восемь раз, падает ниже 25%. Агент может сделать правильно — и не гарантирует, что сделает так же в следующий раз.

Отсюда развенчивается миф, на котором держится половина демонстраций: «ИИ понимает как человек, значит один удачный диалог доказывает работоспособность». Один диалог — один сэмпл. Три одинаковых запроса подряд покажут разброс: совпали ли условия, одинаково ли записались данные. Если на третьем прогоне агент назвал другую цену или срок — вы увидели ровно то, за чем пришли.

Производство0:00
Настоящий разговор, а не демо-ролик: клиент отвечает обрывками, просит мессенджер, которого у компании нет, и торгуется по цене. Но и это один сэмпл — разброс виден только на нескольких прогонах.
Разброс — не повод отказываться

Непостоянство есть у любого LLM-агента. Вопрос не в том, есть ли оно, а чем вендор его ограничивает: guardrails, сверка с источником, жёсткие шаблоны для чисел и обязательств, эскалация при низкой уверенности. Ответ «наша модель не ошибается» хуже, чем сам разброс.

Чек-лист: 8 проверок на демо и что считать плохим ответом

Что попроситьПлохой ответ или результат
Прогнать мой сценарий, а не ваш готовый«Покажем на следующей встрече», демонстрация только записи
Позвонить на мой мобильный через обычную линиюТолько браузерный виджет; заметная пауза после каждой реплики
Перебить агента на середине фразыДоговаривает до конца или замолкает от постороннего шума
Задать вопрос вне базы знанийУверенный выдуманный ответ вместо «не знаю, уточню»
Три раза сказать «переведите на человека»Уводит обратно в сценарий; менеджер получает звонок без контекста
Прогнать один и тот же кейс три раза подрядРазные цифры, условия или итоговые данные в карточке
Показать, что попало в CRM после звонкаТолько ссылка на запись разговора, поля не заполнены
Назвать, что именно считается успешным звонкомМетрика без определения: «resolution до 90%» без критерия

Последний пункт важнее, чем кажется. Вендорские заявления о 60–90% containment и независимые оценки production-внедрений в 40–70% (dragapp) расходятся в том числе потому, что «решённым» считают разное.

Ограничения: чего не покажет даже хорошее демо

Даже если вендор честно прогнал все восемь пунктов, две вещи останутся за кадром — и это не его вина.

Экономику на вашем объёме. На демо не видно ни доли звонков с эскалацией, ни средней длительности на ваших клиентах, ни того, во что превратится счёт при вашей нагрузке. Цена минуты в презентации и итоговая сумма — разные величины: сколько стоит голосовой AI-агент.

Поведение на вашей базе знаний. Демо-агент работает на десятке подготовленных фактов. Ваш — на прайсе с исключениями, устаревших регламентах и трёх версиях условий доставки. Именно там появляются галлюцинации и «не знаю» в ответ на типовой вопрос.

Отсюда вывод: демо отсеивает слабых поставщиков, но не выбирает подходящего. Выбирает пилот на ваших данных — с заранее зафиксированным определением успеха. Демо — фильтр, пилот — решение.

Частые вопросы

Как оценить демо голосового AI-агента, если я не технарь
Не нужно разбираться в архитектуре. Достаточно говорить с агентом как обычный клиент: перебивать, шуметь, спрашивать лишнее, требовать человека, повторять один и тот же вопрос. Оценивать надо не голос, а поведение в этих ситуациях.
Можно ли просить показать демо на своём сценарии
Да, это нормальная практика. Отказ или «покажем на следующей встрече» — сам по себе сигнал: скорее всего, сценарий собирается вручную и долго. Полный список неудобных вопросов к вендору — в статье как выбрать голосового AI-агента.
Почему агент на демо отвечает быстрее, чем потом в работе
Демо обычно идёт через браузер, а рабочий звонок — через SIP и оператора связи, где добавляются сеть и телефония. Ориентир естественности — менее 500 мс P95, свыше секунды пауза воспринимается как робот. Поэтому задержку надо мерить на реальной линии.
Демо прошло хорошо — можно уже покупать
Демо показывает, что технология в принципе работает, но не показывает вашу экономику и поведение на вашей базе знаний. Дальше нужен ограниченный пилот на реальном трафике с заранее согласованными метриками. Хорошее демо — основание перейти к пилоту, а не подписать годовой договор.

Вывод

Демо быстро отсеивает тех, кто продаёт ролик. Но всё, что определяет результат — консистентность, поведение на вашем контенте, задержка на вашей телефонии, итоговый счёт, — на демонстрации не измеряется. Задача покупателя не восхититься голосом, а аккуратно сломать сценарий и посмотреть, как агент ведёт себя в поломанном состоянии. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и прогнать его столько раз, сколько нужно.

Возьмите этот чек-лист и сломайте нашего агента

По адресу вашего сайта бесплатно собирается агент, которому можно позвонить. Перебивайте, шумите, спрашивайте лишнее, требуйте человека и прогоните один кейс трижды — те же восемь проверок.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.