реплика

Агент выучил свою ошибку и повторяет её всем: самообучение бота

Самообучающийся голосовой бот: почему дообучение на своих же разговорах закрепляет ошибки и что работает вместо него — разбор записей и версии сценария.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·21 сентября 2026·7 минут чтения

«Самообучающийся голосовой бот» — формулировка, которая на демо звучит как достоинство, а в договоре должна звучать как вопрос. Что именно обучается: языковая модель, база знаний, текст сценария или порядок вопросов? И кто нажимает кнопку — человек или система сама, по итогам вчерашних звонков?

Короткий ответ. Автоматическое дообучение агента на его же разговорах — плохая идея по четырём причинам: оно закрепляет собственные ошибки, размывает формулировки, делает поведение невоспроизводимым и переносит юридическую ответственность за сказанное на компанию, которая уже не знает, что именно её агент говорит. Работает другое и гораздо более скучное: человек слушает записи, находит расхождение, вносит правку в базу знаний или сценарий и фиксирует версию.

Ниже — почему автоматическая петля ломается, кто отвечает за слова агента и как выглядит нормальный цикл обновления.

Что продают под словами «самообучающийся голосовой бот»

Под одним словом обычно скрыты три разные вещи, и путать их дорого.

Дообучение модели. Веса меняются на ваших данных. Массовому бизнесу это почти никогда не продают: дорого, долго и требует размеченного корпуса.

Автоматическое изменение подсказки и базы знаний. Система сама дописывает в контекст агента фразы, которые «сработали», или подтягивает в базу ответы из прошлых диалогов. Это и есть то, что чаще всего называют самообучением. Ровно здесь возникают все проблемы ниже.

Аналитика без автоматической правки. Система размечает разговоры и показывает человеку, где клиенты срывались. Ничего не меняется само. Это не самообучение, но именно это приносит результат.

Отличать их стоит на этапе выбора поставщика — вопрос «что именно и по какому триггеру меняется без моего участия» уместно задать в одном ряду с остальными неудобными вопросами.

Почему агент, который учится сам, закрепляет ошибки

Петля обратной связи без человека замыкается на собственном выходе агента. Дальше начинается четыре типа деградации.

Закрепление ошибок. Агент однажды неточно назвал условие — скажем, срок выезда или состав услуги, — разговор закончился успешно по формальному признаку (клиент согласился, лид создан), и формулировка попала в число «успешных». На следующей неделе она произносится чаще. Через месяц это норма сценария. Успешный по метрике звонок и корректный звонок — не одно и то же, и как раз это расхождение не видно по зелёным отчётам.

Дрейф формулировок. Каждая итерация чуть смещает тон и лексику. Отдельная правка незаметна, накопленный за квартал сдвиг заметен всем, кроме тех, кто внутри: голос первой линии перестаёт совпадать с сайтом и документами.

Невоспроизводимость. Даже без всякого самообучения консистентность LLM-агентов ограничена. Препринт τ-bench (Sierra и Принстон, arXiv:2406.12045) показывает: GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи pass^8 падает ниже 25%. Агент может справиться — и не гарантирует одинакового результата каждый раз. Если поверх этого разброса сценарий ещё и меняется сам, воспроизвести вчерашний разговор нельзя в принципе. А значит, нельзя ни разобрать жалобу, ни доказать, что было сказано.

Ответственность за сказанное. Это отдельная тема, и она стоит дороже остальных трёх.

Сервисная компания0:00
Разговор о станции биологической очистки: агент собирает состав сантехники и число жильцов, считает залповый сброс около 640 литров, называет станцию с принудительным сбросом за 109 900 ₽ и монтаж в диапазоне 80–150 тысяч. Каждая из этих цифр — из базы знаний и правил расчёта. Если такие числа начнут меняться сами по итогам «успешных» звонков, заметить это по отчётам будет нечем.

Кто отвечает за то, что сказал агент

Канонический пример — Air Canada. Чат-бот авиакомпании сообщил пассажиру несуществующую политику возврата средств; суд встал на сторону пассажира и обязал компанию исполнить обещанное ботом. Вывод простой: за слова агента отвечает бизнес, а не модель и не поставщик платформы.

Из этого следует требование к процессу, а не к технологии. Компания должна в любой момент уметь ответить на вопрос «почему агент сказал именно это» — и ответ «так получилось после автоматического обновления» не работает ни в переписке с клиентом, ни в споре. Механика ограничителей, которые не дают агенту обещать лишнего, разобрана в статье про галлюцинации и guardrails.

Записи — это персональные данные

Разговоры и транскрипты подпадают под 152-ФЗ, а с 1 сентября 2025 года (изменения внесены законом № 156-ФЗ от 24.06.2025) согласие на обработку персональных данных должно оформляться отдельным документом, а не строкой в общем пользовательском соглашении. Прежде чем пускать записи клиентов в любой автоматический цикл обучения, стоит проверить с юристом, что именно покрыто вашим согласием и на какой срок. Подробнее — в статье про 152-ФЗ и запись разговоров.

Что работает вместо: разбор записей и версии

Нормальный цикл выглядит буднично и состоит из пяти шагов.

  1. Выборка записей. Не случайные звонки, а те, где что-то пошло не так: досрочные сбросы, повторные обращения, переводы на человека, длинные паузы.
  2. Разметка причины человеком. Что именно сломалось: агент не знал факта, знал, но сформулировал плохо, ушёл не в ту ветку или его неверно расслышали.
  3. Правка в источнике. Не знал факта — правится база знаний. Сломалась логика — правится сценарий разговора. Это разные объекты, и смешивать их в одном «промпте» — главная причина, по которой правки начинают конфликтовать.
  4. Версия и дата. Каждое изменение — отдельная версия с автором, датой и одной строкой «зачем». Тогда падение метрики можно связать с конкретной правкой, а не с погодой.
  5. Проверка на потоке. Изменение оценивается на сопоставимой выборке. Замена первой фразы с ростом конверсии на следующий день — это не результат теста, а совпадение; как считать честно — отдельный разговор.

Что автоматике отдать можно, а что нет:

ЗадачаАвтоматическиТолько через человека
Найти звонки с проблемойДа: разметка сбросов, повторов, эскалаций
Сгруппировать частые вопросы без ответаДа: кластеризация тем
Изменить факт в базе знаний (цена, срок, условие)НетДа, с версией и датой
Изменить формулировку обещания клиентуНетДа, согласовано с теми, кто отвечает за оффер
Добавить новую ветку сценарияНетДа, после разбора записей
Расширить словарь распознавания (названия, термины)Частично: кандидатов собирает системаУтверждает человек

Полезная деталь с рынка: Neuro.net известен обучением на исторических записях реальных операторов. Обратите внимание на источник данных: это разговоры людей, отобранные до запуска, а не собственный выход агента, замкнутый сам на себя. Само же слово «самообучение» работает на рынке примерно так же, как слово agentic, — маркетинговой рамкой поверх обычной автоматизации; про этот отсев формулировок — куда идут голосовые AI-агенты.

Где ручной цикл проигрывает

Честно про минусы предлагаемого подхода. Он медленный: между появлением проблемы и правкой проходит от дня до недели, в зависимости от того, как часто кто-то слушает записи. Он стоит времени конкретного человека — и если владельца у агента внутри компании нет, цикл просто не запускается. Он плохо масштабируется: на сотнях тысяч звонков вручную разбирается доля процента, поэтому выборка должна быть не случайной, а целевой.

И у него есть предел: ручной разбор чинит факты и логику, но не распознавание речи, задержку и качество канала — там правкой сценария ничего не добиться.

Частые вопросы

Бывают ли по-настоящему самообучающиеся голосовые боты
Бывают системы, которые автоматически меняют базу знаний или подсказку по итогам прошлых диалогов. Технически это возможно, но замыкает петлю на собственном выходе агента: успешно завершившийся звонок с неточной формулировкой эту формулировку и закрепляет. Полезна здесь автоматическая разметка проблемных звонков, а не автоматическая правка.
Почему нельзя обучать агента на его же разговорах
Потому что критерий «успешный звонок» не совпадает с критерием «корректный звонок», и ошибка, прошедшая по формальному признаку успеха, начинает воспроизводиться. Добавьте к этому ограниченную консистентность моделей (τ-bench: около 61% с первого раза против менее 25% при восьми прогонах) — и поведение агента становится невозможно воспроизвести и разобрать.
Кто отвечает, если агент пообещал клиенту лишнее
Бизнес. В деле Air Canada суд обязал авиакомпанию исполнить условия возврата, которых не существовало и которые придумал её чат-бот. Это не юридическая консультация: конкретные последствия в российской практике стоит обсуждать с юристом, но принцип «за слова агента отвечает компания» устойчив.
Как тогда улучшать агента
Целевой выборкой записей, разметкой причины, правкой в источнике — отдельно база знаний, отдельно сценарий — и версионированием каждой правки с датой и автором. Проверять изменение нужно на сопоставимой выборке, а не по метрике следующего дня.

Вывод

Самообучающийся голосовой бот — это не уровень зрелости технологии, а ответ на вопрос, кто принимает решение об изменении. Если его принимает система по признаку «звонок закончился успешно», компания через месяц не знает, что говорит её первая линия, и не может это восстановить. Если человек по записям — цикл идёт медленнее, зато каждое изменение объяснимо и откатывается. Если хотите проверить, что говорит агент на ваших сценариях, — можем собрать демо и разобрать записи вместе.

Сценарий проще услышать, чем прочитать в конструкторе

Соберите агента по своему сайту и позвоните ему как клиент — это бесплатно. Полторы минуты разговора показывают, какие формулировки и цифры агент берёт из базы знаний, а где ему нечего сказать.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.