Чего голосовой AI-агент не умеет: список, которого нет на лендингах
Что не умеет голосовой AI-агент: непостоянство ответов, ошибки распознавания, ответственность за галлюцинации — и где он всё-таки работает.
Голосовой AI-агент не умеет трёх вещей: гарантировать одинаковый ответ на один и тот же вопрос, слышать всё, что слышите вы, и отвечать за собственные слова — отвечает бизнес. Остальные пункты списка — следствия этих трёх.
На лендингах такого списка нет, и это объяснимо: там продают. Но решение о внедрении принимают по границам технологии, а не по её витрине. Ниже — что именно не умеет голосовой AI-агент, почему он так устроен и что делают вместо каждого несбывшегося ожидания.
Речь дальше идёт про LLM-агентов, а не про скриптовые роботы обзвона: это разные технологии, и наборы проблем у них разные.
Он не даёт одинаковый ответ дважды
Самое неудобное свойство LLM-агента — непостоянство. В препринте τ-bench (Sierra совместно с Принстонским университетом, arXiv:2406.12045) GPT-4o решает retail-задачу с первого раза примерно в 61% случаев. Но если прогнать ту же самую задачу восемь раз подряд, метрика pass^8 — доля задач, решённых во всех восьми прогонах, — падает ниже 25%.
Практический перевод: агент, который безупречно отработал сценарий на демо, может отработать его иначе на сотом звонке. Не хуже — иначе. Формулировка сместится, порядок вопросов поменяется, редкая ветка сработает не так, как в тесте.
Значит, одной удачной записи демо недостаточно как доказательства: нужны регрессионные прогоны сценариев, зафиксированные формулировки в критичных местах и эскалация при низкой уверенности модели.
Он не слышит того, что слышите вы
Распознавание речи деградирует предсказуемо: на акцентах (особенно у неносителей языка), фоновом шуме, узкополосной телефонии, отраслевых терминах, названиях и фамилиях. Телефонный канал сам по себе срезает частоты — то, что микрофон в тихой комнате берёт без ошибок, в звонке из машины теряется.
Даже когда речь распознана верно, остаётся распознавание намерения. Точность intent recognition у зрелых систем платформа Balto оценивает в 90–97%. Это хороший показатель — и одновременно от 3 до 10 непонятых обращений на сотню.
Отсюда правило для любой демонстрации: демо в тишине не равно продакшену в реальной телефонии. История Air.ai — вирусный взлёт на демо, за которым не последовало жизнеспособного продукта, а дело дошло до урегулирования с FTC (по данным aiagents.wiki) — ровно про этот разрыв. Где именно теряется точность на пути от звука до ответа, разобрано в статье о том, как работает голосовой AI-агент.
Он не отвечает за свои слова — отвечаете вы
Галлюцинация — уверенно сформулированный вымысел модели. В голосе она опаснее, чем в переписке: собеседник не может перечитать фразу, у него нет ссылки на источник, и он по умолчанию считает сказанное позицией компании.
Показательный прецедент — Air Canada. Чат-бот авиакомпании сообщил пассажиру несуществующую политику возврата средств. Суд встал на сторону пассажира и обязал компанию исполнить то, что пообещал бот. Юридически обещание агента — обещание бизнеса, и ссылка на «это ответил ИИ» не сработала.
Практическое следствие непопулярное: агента нельзя выпускать туда, где цена выдуманного ответа выше цены пропущенного звонка. RAG, ограничители и прямой запрет отвечать за пределами базы знаний снижают частоту галлюцинаций, но не обнуляют её — механика описана в разборе галлюцинаций и guardrails.
Он не ведёт разговор, где на кону деньги и спор
Это ограничение не техническое, а на стороне клиента. По данным CNews, ИИ доверяют информирование о статусе заказа и доставки 54% опрошенных, напоминания — 50%, консультации по тарифам — около 40%. На задачах, связанных с деньгами, спорами и персональной ситуацией, доверие резко падает.
Технически агент такой разговор проведёт. Клиент не хочет, чтобы он его проводил, — и это тоже «не умеет», просто измеряется не WER, а жалобами и оттоком. Значит, передача разговора человеку должна быть спроектированной частью сценария, а не аварийным выходом.
Что не умеет голосовой AI-агент: таблица замен
| Чего не умеет | Почему | Что делать вместо |
|---|---|---|
| Повторить один и тот же результат | вероятностная природа модели: pass^8 ниже 25% при 61% с первой попытки (τ-bench) | регрессионные прогоны сценариев перед каждым изменением промпта; жёстко зафиксированные формулировки в критичных местах |
| Разобрать речь в шуме, с акцентом, по узкой полосе | WER растёт именно на этих условиях | пилот на своих реальных записях, а не на студийных; переспрос и подтверждение ключевых данных по цифрам |
| Отличить собственное знание от вымысла | модель не знает границ своей базы | RAG, запрет отвечать вне базы, фраза-заглушка «уточню и вернусь» |
| Взять на себя ответственность за сказанное | обязательство ложится на компанию (Air Canada) | цены, сроки и условия возврата агент называет только из системы, а не «по памяти» |
| Спорить о деньгах и разбирать личную ситуацию | доверие к ИИ на таких задачах резко падает (CNews) | эскалация по теме, а не только по уверенности модели |
| Закрыть всю первую линию | production containment 40–70% (независимые оценки dragapp) | считать нагрузку по нижней границе диапазона и планировать гибрид с самого начала |
Ограничения работают в обе стороны
Из перечисленного легко сделать вывод «значит, не работает». Это второй распространённый миф, и он ложен ровно так же, как обещания с лендингов.
Разница видна в цифрах. Вендоры называют containment 60–90%; независимые оценки production-внедрений (dragapp) дают 40–70%; а на структурированных транзакционных интентах — статус заказа, запись, напоминание — те же оценки показывают 70–90%. Технология не «работает плохо». Она работает избирательно: там, где задача формализуема, результат высокий, а падает он там, где разговор непредсказуем.
Масштаб тоже реален. Ассистент Klarna за первый месяц обработал 2,3 млн диалогов — две трети всех обращений в поддержку, сократив среднее время разрешения с 11 минут до менее чем 2 (совместный пресс-релиз OpenAI и Klarna от 27.02.2024). У этой истории есть обратная сторона: CSAT просел примерно на 22%, и компания вернула людей на обслуживание премиальных клиентов. Но это провал стратегии полной замены, а не доказательство неработающей технологии.
Бенчмарки containment, τ-bench и оценки Balto получены на англоязычных данных и зарубежных внедрениях. Публичных замеров WER и containment по России в открытом доступе практически нет, поэтому для русской речи и местной телефонии эти цифры проверяются только пилотом на собственных записях.
Поэтому правильный вопрос поставщику — не «сколько процентов вы закрываете», а «сколько на моих сценариях и что именно вы считаете закрытым». Остальные вопросы собраны в чек-листе, как выбрать голосового AI-агента.
Частые вопросы
Что будет, если бот не поймёт вопрос?
Почему на демо агент работает лучше, чем на реальных звонках?
Можно ли полностью убрать операторов первой линии?
Кто отвечает, если агент пообещал клиенту лишнее?
Вывод
Голосовой AI-агент — не собеседник с гарантией, а инструмент с известными границами. Он непостоянен на повторах, теряет точность на шуме и акцентах, способен уверенно выдумать несуществующее правило, и юридическая ответственность за это остаётся на компании. На структурированных задачах он при этом закрывает 70–90% обращений — цифра, которую скептики недооценивают ровно так же, как оптимисты переоценивают.
Разница между провальным и рабочим внедрением проходит не по качеству модели, а по выбору задач и по тому, насколько честно спроектирована передача человеку. Если хотите проверить, где проходит эта граница на ваших звонках, — можем собрать демо на вашем сценарии.
