реплика

Бот пообещал скидку, которой нет. Галлюцинации ИИ и цена ошибки

Галлюцинации ИИ в звонках: почему агент выдумывает скидки, кто за это отвечает и какие guardrails ставить. Чек-лист из 8 ограничителей.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·1 апреля 2026·6 минут чтения

Галлюцинация — это уверенно сформулированный вымысел модели. В звонке она не выглядит сбоем: спокойный голос называет скидку, срок доставки или условие возврата, которых у компании нет. Клиент это запоминает, а через неделю приходит требовать обещанное.

Отвечает за такое обещание бизнес. Не подрядчик, не разработчик модели, не «нейросеть ошиблась». Самый известный прецедент — Air Canada: чат-бот авиакомпании сообщил пассажиру несуществующую политику возврата средств, суд встал на сторону пассажира и обязал компанию исполнить то, что пообещал бот. Аргумент «это сказал не мы, а система» не сработал.

Галлюцинации ИИ не отключаются одним переключателем. Их снижают две разные вещи, которые часто путают. База знаний и RAG отвечают на вопрос «откуда агент берёт факты». Guardrails — ограничители — отвечают на вопрос «о чём агенту вообще нельзя говорить и что он обязан сделать вместо этого». Работает только связка.

Почему возникают галлюцинации ИИ у голосового агента

Языковая модель устроена так, чтобы правдоподобно продолжить разговор, а не чтобы замолчать. Если клиент спрашивает про рассрочку, а в базе знаний её нет, модель не оставит паузу — она соберёт ответ из общего представления о том, как обычно бывает у похожих компаний. Ответ будет гладким, уверенным и неверным.

Поэтому пустая или дырявая база знаний — главный источник выдумок. Не «плохая модель», а отсутствие фактов в том месте, где агент их ищет. RAG (генерация с опорой на извлечённые из базы документы) — основной способ снижения галлюцинаций: агент отвечает не по памяти, а по конкретному фрагменту вашего документа, и этот фрагмент можно потом открыть и проверить. Что и в каком виде туда класть — отдельная работа, о ней есть материал про базу знаний для агента.

Второй источник — вера в то, что модель «понимает как человек». Это миф, и он измерен. В препринте τ-bench (Sierra совместно с Принстоном, arXiv:2406.12045) GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи метрика pass^8 падает ниже 25%. То есть агент может справиться, но не гарантирует одинакового результата каждый раз. «Сработало на демо» и «сработает всегда» — разные утверждения, и второе никто пока не подтвердил.

Кто отвечает, если агент пообещал лишнее

Рамка простая: агент говорит от имени компании, значит его слова — это слова компании. Кейс Air Canada показал, что суд может рассматривать сказанное ботом как обязательство продавца, а не как техническую неисправность.

Отсюда следствие, о котором вспоминают поздно: разговор надо уметь поднять. Запись и транскрипт — это одновременно защита в споре и персональные данные со всеми требованиями к согласиям и хранению, включая локализацию баз на территории РФ (разбор 152-ФЗ и записи разговоров). Компания, которая не хранит записи, в споре не докажет ничего.

Чек-лист: что именно ограничивать guardrails

Ограничители нужны точечно — там, где цена выдуманной фразы измеряется деньгами или юридическими последствиями. Минимальный набор:

  1. Цены и скидки. Агент называет только то, что есть в прайсе. Никаких «могу предложить», «думаю, сделаем дешевле», округлений и пересчётов на ходу.
  2. Сроки. Доставка, монтаж, ремонт, срок ответа. Если в базе нет точной даты — говорим диапазон из базы или передаём вопрос, но не изобретаем «завтра-послезавтра».
  3. Гарантии и возврат. Цитировать формулировку из документа, а не пересказывать её своими словами. Именно на пересказе рождается «несуществующая политика возврата».
  4. Юридические и медицинские утверждения. Запрет на трактовку договора, толкование нормы, диагноз, дозировку, оценку «положено вам или нет». Только фиксация вопроса и передача профильному специалисту.
  5. Индивидуальные условия и обязательства. Агент не согласовывает нестандартный договор, не подтверждает бронь вне регламента, не обещает «решим в порядке исключения».
  6. Персональные данные. Не зачитывать вслух данные клиента до идентификации и не запрашивать больше, чем нужно сценарию.
  7. Конкуренты. Не оценивать чужие продукты и не сравнивать с ними — сравнение из уст бота почти всегда выдумка.
  8. Стоп-триггеры на человека. Жалоба, угроза, упоминание юриста, требование вернуть деньги, третий заход на один и тот же вопрос — сразу перевод, без попытки дожать.
Как проверять

Прогоняйте один и тот же сценарий не один раз, а восемь-десять — с разными формулировками вопроса. Один удачный прогон ничего не доказывает, это и показывает τ-bench.

Почему «не знаю» — рабочий ответ, а не провал

Агент, который умеет сказать «этого у меня нет, соединяю с менеджером», безопаснее агента, который отвечает на всё. Признание незнания стоит одной переадресации. Выдуманное обещание стоит спора с клиентом, а иногда и исполнения этого обещания.

Медицина0:00
Слушайте, где агент останавливается: он подбирает обследование и называет цену, но не ставит диагноз — на вопрос про рецепт отвечает, что его выпишет врач после осмотра.

Спрос на такую честность подтверждается опросами. По данным Solar Staff, 45% опрошенных хотят гарантированную возможность переключиться на человека, а 83% предпочитают гибридную модель. По данным CNews, ИИ доверяют информирование о статусе заказа (54%) и напоминания (50%), но доверие резко падает на задачах, связанных с деньгами, спорами и персональной ситуацией. Это и есть карта того, где нужны ограничители: чем ближе к деньгам и конфликту, тем жёстче рамка и тем быстрее передача разговора человеку.

Ограничения: чего guardrails не дают

Ограничители снижают риск, но не обнуляют его. Причина в том, что проверяющий слой часто сам вероятностный: если фильтр на выходе — это ещё одна модель, она тоже иногда ошибается. Жёсткие детерминированные правила (белый список цен, шаблон формулировки гарантии) надёжнее, но покрывают только заранее предусмотренные случаи. Формулировка, которую вы не предвидели, проскочит.

Второй риск — перезакрутить гайки. Полный запрет говорить о чём-либо превращает агента обратно в голосовое меню: на каждый второй вопрос звучит «уточните у менеджера», клиент раздражается, containment падает. Независимые оценки production-внедрений дают containment 40–70% (оценка dragapp) — агент, зажатый до состояния автоответчика, окажется в нижней части этого диапазона или ниже. Ровно за это не любят дешёвые массовые обзвоны, и повторять их логику в дорогом решении бессмысленно.

Третье: guardrails не чинят то, чего агент в принципе не умеет. Они не компенсируют плохое распознавание речи на шумной линии, не дают агенту понять эмоцию и не заменяют человека там, где нужен человек — об этом есть честный список ограничений. Ограничитель — это не интеллект, это забор.

Частые вопросы

Что такое галлюцинации ИИ простыми словами?
Это уверенно сформулированный вымысел модели: агент называет факт, которого нет в ваших данных. В голосовом канале это особенно опасно, потому что ошибка звучит так же спокойно и убедительно, как верный ответ.
Кто отвечает, если голосовой агент пообещал клиенту лишнее?
Компания, от имени которой он говорил. В деле Air Canada суд обязал авиакомпанию исполнить условия возврата, которые выдумал её чат-бот. Ссылка на ошибку системы защитой не является.
Можно ли полностью исключить ошибки голосового агента?
Нет. RAG и guardrails снижают частоту ошибок, но не дают гарантии: τ-bench (arXiv:2406.12045) показывает падение консистентности с примерно 61% при одном прогоне до менее 25% при восьми. Поэтому нужны эскалация на человека и выборочный контроль разговоров.
Что делать, если у агента нет ответа на вопрос клиента?
Правильное поведение — сказать, что информации нет, и перевести на сотрудника или зафиксировать заявку на обратный звонок. Попытка «додумать» ответ создаёт обязательство, которое потом придётся исполнять или оспаривать.

Что в итоге

Галлюцинации — не экзотический сбой, а штатное свойство языковых моделей, с которым работают инженерно. База знаний убирает причину: агенту становится откуда брать факты. Guardrails убирают последствия: перечисляют темы, где выдумка недопустима, и превращают «не знаю» в нормальный сценарий, а не в поражение. Проверять это надо многократными прогонами и выборочным прослушиванием, а не одним удачным демо.

Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и показать, как агент ведёт себя на вопросах, ответа на которые у него нет.

Спросите у агента то, чего нет на вашем сайте

Агент собирается по вашему сайту бесплатно, и ему можно позвонить. Задайте вопрос, ответа на который на сайте нет, — сразу слышно, где проходит граница между фактом и выдумкой.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.