реплика

Агент записал адрес с ошибкой. WER и что с ним делать

Агент записал адрес с ошибкой. Что такое WER, почему распознавание речи не бывает точным на 100% и как страховать критичные поля.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·16 июля 2025·6 минут чтения

Клиент продиктовал адрес, агент записал «Гагарина, 14» вместо «Гагарина, 40». Курьер уехал не туда, клиент раздражён, менеджер разбирает претензию. Это не поломка агента — это обычная ошибка распознавания речи. У неё есть метрика: WER (Word Error Rate), доля неверно распознанных слов в расшифровке.

Короткий ответ на вопрос заголовка: WER снижают, но до нуля не доводят никогда — ни на одном языке, ни на одной модели. Рабочая задача другая: не дать ошибке распознавания попасть в критичное поле заявки. Решается это не выбором модели, а конструкцией разговора — подтверждением, тон-набором и словарём названий.

И сразу разведём две вещи, которые в отчётах постоянно склеивают в одну.

Транскрипция верная, а поле неверное — и наоборот

Транскрипция — это текст того, что услышал агент. Поле — это то, что он положил в карточку CRM. Между ними стоит извлечение сущностей и логика сценария, и ломаться они могут независимо друг от друга.

Первый случай: расшифровка идеальная. Клиент сказал «мне удобно в четверг, хотя нет, лучше в пятницу», агент записал всё дословно — и поставил в поле «дата визита» четверг. WER нулевой, заявка неверная.

Второй случай: агент услышал «Смирнофф» вместо «Смирнов». WER не нулевой — но телефон, адрес и время записаны правильно, менеджер поправит фамилию за две секунды. Ошибка есть, ущерба нет.

Отсюда главное правило темы: целевая метрика — доля корректно заполненных заявок, а не WER расшифровки. WER остаётся диагностическим инструментом: он показывает, где именно рвётся. Как встроить его в общую систему показателей — в разборе метрик голосового AI-агента.

Почему агент не расслышал: где распознавание речи падает

Качество распознавания в звонке нестабильно, и деградирует оно предсказуемо. Известные слабые места:

  • Акцент. Точность заметно падает на речи неносителей языка.
  • Фоновый шум. Улица, цех, детский сад, громкая связь в машине.
  • Узкополосная телефония. Телефонный канал режет частоты и сжимает звук кодеком — модель получает уже испорченный сигнал.
  • Отраслевые термины и названия. Артикулы, названия ЖК, марки, фамилии, аббревиатуры.

Дальше по цепочке работает понимание намерения: у зрелых систем intent recognition accuracy держится на уровне 90–97% (оценка платформы Balto — это вендорский ориентир, а не независимое исследование). То есть даже при хорошей расшифровке несколько диалогов из ста агент трактует не так, как задумал клиент.

Отдельно про телефонию. Узкополосный канал не чинится сменой модели распознавания: если на входе звук в 8 кГц с потерями от кодека, никакая модель не восстановит то, чего в сигнале нет. Это лечится на стороне связи — кодеком, качеством SIP-транка, отказом от лишних перекодировок. Что именно нужно проверить у провайдера, разобрано в статье про телефонию и подключение. Как устроена цепочка STT → LLM → TTS целиком — в материале о том, как работает голосовой AI-агент.

Где ошибка стоит дороже всего: поле, цена, страховка

Ошибка в одном поле стоит копейки, в другом — сорванной сделки. Считать надо по последствию, а не по количеству неверных букв.

ПолеЦена ошибкиКак страховать
Номер телефонаСвязи с клиентом нет вообще, лид потерян молчаТон-набор (DTMF) вместо диктовки; повтор номера по цифрам с подтверждением
АдресВыезд не туда: оплаченный впустую час курьера или мастераПовтор адреса вслух целиком; сверка дома и квартиры отдельно; подстановка из справочника
Сумма, тариф, количествоСпор с клиентом, ручной перерасчёт, репутационный ущербОбязательный повтор суммы; запрет агенту называть цифры вне базы знаний
Артикул, модель, номер заказаНе тот товар, не та заявка, повторный контактТон-набор для цифровых кодов; словарь артикулов в базе знаний
Имя, фамилияНеловкость при следующем звонке, редко — критичноНе переспрашивать дважды; отдать на ручную правку менеджеру
Дата и время визитаНеявка, пустое окно в расписанииПроговорить дату словами: «записываю на пятницу, 12 сентября, в 15:00»

Три приёма из правой колонки закрывают большую часть ущерба. Подтверждение повтором — агент проговаривает критичное поле обратно и ждёт согласия; это стоит 5–8 секунд разговора и применяется только к тем полям, где ошибка дорогая. Тон-набор уместен там, где клиент и так привык нажимать кнопки: номер телефона, код заказа, номер договора. Словарь названий в базе знаний — список ваших ЖК, моделей, артикулов и терминов, который подсказывает системе правильные варианты вместо фонетически похожих.

Правило одного подтверждения

Подтверждать каждое поле нельзя — разговор превращается в допрос и клиент кладёт трубку. Выберите в сценарии одно-два поля, без которых заявка бесполезна, и подтверждайте только их.

HoReCa0:00
Слушайте место, где агент повторяет номер телефона и время брони вслух: на цифрах, именах и адресах и видно качество распознавания.

Ограничения: почему 100% не будет и почему гнаться за WER бессмысленно

Стопроцентного распознавания не существует. Люди тоже переспрашивают: оператор при плохой связи просит продиктовать по буквам — и это нормальная часть работы, а не признак поломки.

Заодно развенчаем распространённый миф — «ИИ понимает как человек». Не понимает. В препринте τ-bench (Sierra совместно с Принстонским университетом, arXiv:2406.12045) модель решает задачу с первого прогона примерно в 61% случаев, но при восьми повторах одной и той же задачи доля стабильно успешных прогонов падает ниже 25%. То есть агент может справиться — и не гарантирует одинакового результата каждый раз. Это аргумент не против технологии, а в пользу подтверждений, ограничителей и эскалации на человека.

Второе ограничение — экономическое. Распознавание речи стоит денег: по оценке LPTracker, в себестоимости минуты качественного AI-звонка около 14,15 ₽ на STT приходится до 5 ₽. Более точная модель почти всегда дороже и часто медленнее, а латентность в голосе критична. Улучшать WER с 8% до 6%, если оба варианта одинаково путают ваши артикулы, — трата бюджета без эффекта на выручку.

Третье. Вендорский WER измерен на чистом датасете, а не на ваших звонках с улицы и из машины. Сравнивать модели по чужой цифре бессмысленно — сравнивать надо на своей записи звонков.

Практический вывод: не оптимизируйте WER как самоцель. Смотрите долю заявок, где все критичные поля заполнены верно, и разбирайте руками те, где не заполнены. Как выстроить такой разбор, чтобы он не превратился в случайное прослушивание, — в статье о том, как слушать звонки агента.

Частые вопросы

Что такое WER простыми словами?
WER (Word Error Rate) — доля неверно распознанных слов в расшифровке разговора. Считается как сумма замен, пропусков и лишних слов, делённая на количество слов в эталоне. Метрика полезна для диагностики, но качество работы агента по ней одной не оценивают.
Какой WER считается нормальным для звонков?
Универсальной нормы нет: цифра сильно зависит от канала связи, шума и лексики отрасли, поэтому чужие бенчмарки на ваши звонки не переносятся. Практичнее замерить WER на собственной выборке записей и следить за динамикой. Ориентироваться при этом лучше на долю корректно заполненных заявок.
Почему агент путает адреса и артикулы?
Это самые уязвимые к распознаванию данные: короткие, редкие и фонетически похожие друг на друга. Помогает словарь названий и артикулов в базе знаний плюс подтверждение поля повтором. Для цифровых кодов надёжнее тон-набор.
Улучшится ли распознавание, если сменить модель?
Иногда да, но не в случае узкополосного телефонного канала: если звук испорчен кодеком, восстанавливать в нём нечего. Сначала проверяют качество связи и настройки телефонии, а уже потом модель. Часто больший эффект даёт словарь терминов и правильный сценарий подтверждений.

Что в итоге

Ошибки распознавания речи неизбежны, и мерить их отдельно от результата — занятие бесполезное. Значение имеет одно: попала ошибка в критичное поле заявки или нет. Разберитесь, какие два-три поля в вашем сценарии стоят дорого, закройте их подтверждением, тон-набором и словарём — и следите за долей корректно заполненных заявок, а не за красивым WER в презентации вендора.

Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и посмотреть, где именно ломаются поля.

Продиктуйте агенту свой адрес и послушайте, что он услышал

По адресу вашего сайта бесплатно собирается агент с вашими услугами и названиями. Позвоните ему, назовите улицу и артикул — и станет видно, какие поля в вашем сценарии придётся страховать.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.