Агент выучил свою ошибку и повторяет её всем: самообучение бота
Самообучающийся голосовой бот: почему дообучение на своих же разговорах закрепляет ошибки и что работает вместо него — разбор записей и версии сценария.
«Самообучающийся голосовой бот» — формулировка, которая на демо звучит как достоинство, а в договоре должна звучать как вопрос. Что именно обучается: языковая модель, база знаний, текст сценария или порядок вопросов? И кто нажимает кнопку — человек или система сама, по итогам вчерашних звонков?
Короткий ответ. Автоматическое дообучение агента на его же разговорах — плохая идея по четырём причинам: оно закрепляет собственные ошибки, размывает формулировки, делает поведение невоспроизводимым и переносит юридическую ответственность за сказанное на компанию, которая уже не знает, что именно её агент говорит. Работает другое и гораздо более скучное: человек слушает записи, находит расхождение, вносит правку в базу знаний или сценарий и фиксирует версию.
Ниже — почему автоматическая петля ломается, кто отвечает за слова агента и как выглядит нормальный цикл обновления.
Что продают под словами «самообучающийся голосовой бот»
Под одним словом обычно скрыты три разные вещи, и путать их дорого.
Дообучение модели. Веса меняются на ваших данных. Массовому бизнесу это почти никогда не продают: дорого, долго и требует размеченного корпуса.
Автоматическое изменение подсказки и базы знаний. Система сама дописывает в контекст агента фразы, которые «сработали», или подтягивает в базу ответы из прошлых диалогов. Это и есть то, что чаще всего называют самообучением. Ровно здесь возникают все проблемы ниже.
Аналитика без автоматической правки. Система размечает разговоры и показывает человеку, где клиенты срывались. Ничего не меняется само. Это не самообучение, но именно это приносит результат.
Отличать их стоит на этапе выбора поставщика — вопрос «что именно и по какому триггеру меняется без моего участия» уместно задать в одном ряду с остальными неудобными вопросами.
Почему агент, который учится сам, закрепляет ошибки
Петля обратной связи без человека замыкается на собственном выходе агента. Дальше начинается четыре типа деградации.
Закрепление ошибок. Агент однажды неточно назвал условие — скажем, срок выезда или состав услуги, — разговор закончился успешно по формальному признаку (клиент согласился, лид создан), и формулировка попала в число «успешных». На следующей неделе она произносится чаще. Через месяц это норма сценария. Успешный по метрике звонок и корректный звонок — не одно и то же, и как раз это расхождение не видно по зелёным отчётам.
Дрейф формулировок. Каждая итерация чуть смещает тон и лексику. Отдельная правка незаметна, накопленный за квартал сдвиг заметен всем, кроме тех, кто внутри: голос первой линии перестаёт совпадать с сайтом и документами.
Невоспроизводимость. Даже без всякого самообучения консистентность LLM-агентов ограничена. Препринт τ-bench (Sierra и Принстон, arXiv:2406.12045) показывает: GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи pass^8 падает ниже 25%. Агент может справиться — и не гарантирует одинакового результата каждый раз. Если поверх этого разброса сценарий ещё и меняется сам, воспроизвести вчерашний разговор нельзя в принципе. А значит, нельзя ни разобрать жалобу, ни доказать, что было сказано.
Ответственность за сказанное. Это отдельная тема, и она стоит дороже остальных трёх.
Кто отвечает за то, что сказал агент
Канонический пример — Air Canada. Чат-бот авиакомпании сообщил пассажиру несуществующую политику возврата средств; суд встал на сторону пассажира и обязал компанию исполнить обещанное ботом. Вывод простой: за слова агента отвечает бизнес, а не модель и не поставщик платформы.
Из этого следует требование к процессу, а не к технологии. Компания должна в любой момент уметь ответить на вопрос «почему агент сказал именно это» — и ответ «так получилось после автоматического обновления» не работает ни в переписке с клиентом, ни в споре. Механика ограничителей, которые не дают агенту обещать лишнего, разобрана в статье про галлюцинации и guardrails.
Разговоры и транскрипты подпадают под 152-ФЗ, а с 1 сентября 2025 года (изменения внесены законом № 156-ФЗ от 24.06.2025) согласие на обработку персональных данных должно оформляться отдельным документом, а не строкой в общем пользовательском соглашении. Прежде чем пускать записи клиентов в любой автоматический цикл обучения, стоит проверить с юристом, что именно покрыто вашим согласием и на какой срок. Подробнее — в статье про 152-ФЗ и запись разговоров.
Что работает вместо: разбор записей и версии
Нормальный цикл выглядит буднично и состоит из пяти шагов.
- Выборка записей. Не случайные звонки, а те, где что-то пошло не так: досрочные сбросы, повторные обращения, переводы на человека, длинные паузы.
- Разметка причины человеком. Что именно сломалось: агент не знал факта, знал, но сформулировал плохо, ушёл не в ту ветку или его неверно расслышали.
- Правка в источнике. Не знал факта — правится база знаний. Сломалась логика — правится сценарий разговора. Это разные объекты, и смешивать их в одном «промпте» — главная причина, по которой правки начинают конфликтовать.
- Версия и дата. Каждое изменение — отдельная версия с автором, датой и одной строкой «зачем». Тогда падение метрики можно связать с конкретной правкой, а не с погодой.
- Проверка на потоке. Изменение оценивается на сопоставимой выборке. Замена первой фразы с ростом конверсии на следующий день — это не результат теста, а совпадение; как считать честно — отдельный разговор.
Что автоматике отдать можно, а что нет:
| Задача | Автоматически | Только через человека |
|---|---|---|
| Найти звонки с проблемой | Да: разметка сбросов, повторов, эскалаций | — |
| Сгруппировать частые вопросы без ответа | Да: кластеризация тем | — |
| Изменить факт в базе знаний (цена, срок, условие) | Нет | Да, с версией и датой |
| Изменить формулировку обещания клиенту | Нет | Да, согласовано с теми, кто отвечает за оффер |
| Добавить новую ветку сценария | Нет | Да, после разбора записей |
| Расширить словарь распознавания (названия, термины) | Частично: кандидатов собирает система | Утверждает человек |
Полезная деталь с рынка: Neuro.net известен обучением на исторических записях реальных операторов. Обратите внимание на источник данных: это разговоры людей, отобранные до запуска, а не собственный выход агента, замкнутый сам на себя. Само же слово «самообучение» работает на рынке примерно так же, как слово agentic, — маркетинговой рамкой поверх обычной автоматизации; про этот отсев формулировок — куда идут голосовые AI-агенты.
Где ручной цикл проигрывает
Честно про минусы предлагаемого подхода. Он медленный: между появлением проблемы и правкой проходит от дня до недели, в зависимости от того, как часто кто-то слушает записи. Он стоит времени конкретного человека — и если владельца у агента внутри компании нет, цикл просто не запускается. Он плохо масштабируется: на сотнях тысяч звонков вручную разбирается доля процента, поэтому выборка должна быть не случайной, а целевой.
И у него есть предел: ручной разбор чинит факты и логику, но не распознавание речи, задержку и качество канала — там правкой сценария ничего не добиться.
Частые вопросы
Бывают ли по-настоящему самообучающиеся голосовые боты
Почему нельзя обучать агента на его же разговорах
Кто отвечает, если агент пообещал клиенту лишнее
Как тогда улучшать агента
Вывод
Самообучающийся голосовой бот — это не уровень зрелости технологии, а ответ на вопрос, кто принимает решение об изменении. Если его принимает система по признаку «звонок закончился успешно», компания через месяц не знает, что говорит её первая линия, и не может это восстановить. Если человек по записям — цикл идёт медленнее, зато каждое изменение объяснимо и откатывается. Если хотите проверить, что говорит агент на ваших сценариях, — можем собрать демо и разобрать записи вместе.
