реплика

Чего голосовой AI-агент не умеет: список, которого нет на лендингах

Что не умеет голосовой AI-агент: непостоянство ответов, ошибки распознавания, ответственность за галлюцинации — и где он всё-таки работает.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·29 апреля 2026·7 минут чтения

Голосовой AI-агент не умеет трёх вещей: гарантировать одинаковый ответ на один и тот же вопрос, слышать всё, что слышите вы, и отвечать за собственные слова — отвечает бизнес. Остальные пункты списка — следствия этих трёх.

На лендингах такого списка нет, и это объяснимо: там продают. Но решение о внедрении принимают по границам технологии, а не по её витрине. Ниже — что именно не умеет голосовой AI-агент, почему он так устроен и что делают вместо каждого несбывшегося ожидания.

Речь дальше идёт про LLM-агентов, а не про скриптовые роботы обзвона: это разные технологии, и наборы проблем у них разные.

Он не даёт одинаковый ответ дважды

Самое неудобное свойство LLM-агента — непостоянство. В препринте τ-bench (Sierra совместно с Принстонским университетом, arXiv:2406.12045) GPT-4o решает retail-задачу с первого раза примерно в 61% случаев. Но если прогнать ту же самую задачу восемь раз подряд, метрика pass^8 — доля задач, решённых во всех восьми прогонах, — падает ниже 25%.

Практический перевод: агент, который безупречно отработал сценарий на демо, может отработать его иначе на сотом звонке. Не хуже — иначе. Формулировка сместится, порядок вопросов поменяется, редкая ветка сработает не так, как в тесте.

Значит, одной удачной записи демо недостаточно как доказательства: нужны регрессионные прогоны сценариев, зафиксированные формулировки в критичных местах и эскалация при низкой уверенности модели.

Он не слышит того, что слышите вы

Распознавание речи деградирует предсказуемо: на акцентах (особенно у неносителей языка), фоновом шуме, узкополосной телефонии, отраслевых терминах, названиях и фамилиях. Телефонный канал сам по себе срезает частоты — то, что микрофон в тихой комнате берёт без ошибок, в звонке из машины теряется.

Даже когда речь распознана верно, остаётся распознавание намерения. Точность intent recognition у зрелых систем платформа Balto оценивает в 90–97%. Это хороший показатель — и одновременно от 3 до 10 непонятых обращений на сотню.

Отсюда правило для любой демонстрации: демо в тишине не равно продакшену в реальной телефонии. История Air.ai — вирусный взлёт на демо, за которым не последовало жизнеспособного продукта, а дело дошло до урегулирования с FTC (по данным aiagents.wiki) — ровно про этот разрыв. Где именно теряется точность на пути от звука до ответа, разобрано в статье о том, как работает голосовой AI-агент.

Он не отвечает за свои слова — отвечаете вы

Галлюцинация — уверенно сформулированный вымысел модели. В голосе она опаснее, чем в переписке: собеседник не может перечитать фразу, у него нет ссылки на источник, и он по умолчанию считает сказанное позицией компании.

Показательный прецедент — Air Canada. Чат-бот авиакомпании сообщил пассажиру несуществующую политику возврата средств. Суд встал на сторону пассажира и обязал компанию исполнить то, что пообещал бот. Юридически обещание агента — обещание бизнеса, и ссылка на «это ответил ИИ» не сработала.

Практическое следствие непопулярное: агента нельзя выпускать туда, где цена выдуманного ответа выше цены пропущенного звонка. RAG, ограничители и прямой запрет отвечать за пределами базы знаний снижают частоту галлюцинаций, но не обнуляют её — механика описана в разборе галлюцинаций и guardrails.

Он не ведёт разговор, где на кону деньги и спор

Это ограничение не техническое, а на стороне клиента. По данным CNews, ИИ доверяют информирование о статусе заказа и доставки 54% опрошенных, напоминания — 50%, консультации по тарифам — около 40%. На задачах, связанных с деньгами, спорами и персональной ситуацией, доверие резко падает.

Технически агент такой разговор проведёт. Клиент не хочет, чтобы он его проводил, — и это тоже «не умеет», просто измеряется не WER, а жалобами и оттоком. Значит, передача разговора человеку должна быть спроектированной частью сценария, а не аварийным выходом.

Что не умеет голосовой AI-агент: таблица замен

Чего не умеетПочемуЧто делать вместо
Повторить один и тот же результатвероятностная природа модели: pass^8 ниже 25% при 61% с первой попытки (τ-bench)регрессионные прогоны сценариев перед каждым изменением промпта; жёстко зафиксированные формулировки в критичных местах
Разобрать речь в шуме, с акцентом, по узкой полосеWER растёт именно на этих условияхпилот на своих реальных записях, а не на студийных; переспрос и подтверждение ключевых данных по цифрам
Отличить собственное знание от вымысламодель не знает границ своей базыRAG, запрет отвечать вне базы, фраза-заглушка «уточню и вернусь»
Взять на себя ответственность за сказанноеобязательство ложится на компанию (Air Canada)цены, сроки и условия возврата агент называет только из системы, а не «по памяти»
Спорить о деньгах и разбирать личную ситуациюдоверие к ИИ на таких задачах резко падает (CNews)эскалация по теме, а не только по уверенности модели
Закрыть всю первую линиюproduction containment 40–70% (независимые оценки dragapp)считать нагрузку по нижней границе диапазона и планировать гибрид с самого начала

Ограничения работают в обе стороны

Из перечисленного легко сделать вывод «значит, не работает». Это второй распространённый миф, и он ложен ровно так же, как обещания с лендингов.

Разница видна в цифрах. Вендоры называют containment 60–90%; независимые оценки production-внедрений (dragapp) дают 40–70%; а на структурированных транзакционных интентах — статус заказа, запись, напоминание — те же оценки показывают 70–90%. Технология не «работает плохо». Она работает избирательно: там, где задача формализуема, результат высокий, а падает он там, где разговор непредсказуем.

Розница и e-commerce0:00
Разговор из той самой формализуемой половины: объём заказа, адрес, время доставки — агент не выходит за пределы того, что есть в системе.

Масштаб тоже реален. Ассистент Klarna за первый месяц обработал 2,3 млн диалогов — две трети всех обращений в поддержку, сократив среднее время разрешения с 11 минут до менее чем 2 (совместный пресс-релиз OpenAI и Klarna от 27.02.2024). У этой истории есть обратная сторона: CSAT просел примерно на 22%, и компания вернула людей на обслуживание премиальных клиентов. Но это провал стратегии полной замены, а не доказательство неработающей технологии.

Про происхождение цифр

Бенчмарки containment, τ-bench и оценки Balto получены на англоязычных данных и зарубежных внедрениях. Публичных замеров WER и containment по России в открытом доступе практически нет, поэтому для русской речи и местной телефонии эти цифры проверяются только пилотом на собственных записях.

Поэтому правильный вопрос поставщику — не «сколько процентов вы закрываете», а «сколько на моих сценариях и что именно вы считаете закрытым». Остальные вопросы собраны в чек-листе, как выбрать голосового AI-агента.

Частые вопросы

Что будет, если бот не поймёт вопрос?
В зрелых системах срабатывает эскалация: агент переспрашивает один раз и передаёт разговор человеку с контекстом. Дешёвые решения вместо этого зацикливаются на «не понял, повторите» или сбрасывают звонок — это и есть главная причина раздражения клиентов.
Почему на демо агент работает лучше, чем на реальных звонках?
Демо обычно записано в тишине, с чистой речью и по сценарию, который проходили много раз. В продакшене добавляются шум, акценты, узкополосная телефония и непредсказуемые формулировки. Требуйте пилот на своих записях, а не только демонстрацию.
Можно ли полностью убрать операторов первой линии?
Нет. Независимые оценки production-внедрений (dragapp) дают containment 40–70%, и даже на самых структурированных сценариях остаётся 10–30% обращений, которые уходят человеку. Планировать нужно гибридную схему.
Кто отвечает, если агент пообещал клиенту лишнее?
Компания. Прецедент Air Canada: суд обязал авиакомпанию исполнить условия, которые придумал её собственный бот. Поэтому обязывающие вещи — цены, сроки, условия возврата — агент должен брать из системы, а не формулировать сам.

Вывод

Голосовой AI-агент — не собеседник с гарантией, а инструмент с известными границами. Он непостоянен на повторах, теряет точность на шуме и акцентах, способен уверенно выдумать несуществующее правило, и юридическая ответственность за это остаётся на компании. На структурированных задачах он при этом закрывает 70–90% обращений — цифра, которую скептики недооценивают ровно так же, как оптимисты переоценивают.

Разница между провальным и рабочим внедрением проходит не по качеству модели, а по выбору задач и по тому, насколько честно спроектирована передача человеку. Если хотите проверить, где проходит эта граница на ваших звонках, — можем собрать демо на вашем сценарии.

Решите сами, попадает ли ваш сценарий в рабочую половину

По адресу вашего сайта бесплатно собирается агент, которому можно позвонить. Пять минут разговора честнее любого списка ограничений: слышно, где он держится, а где начинает плыть.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.