Агент записал адрес с ошибкой. WER и что с ним делать
Агент записал адрес с ошибкой. Что такое WER, почему распознавание речи не бывает точным на 100% и как страховать критичные поля.
Клиент продиктовал адрес, агент записал «Гагарина, 14» вместо «Гагарина, 40». Курьер уехал не туда, клиент раздражён, менеджер разбирает претензию. Это не поломка агента — это обычная ошибка распознавания речи. У неё есть метрика: WER (Word Error Rate), доля неверно распознанных слов в расшифровке.
Короткий ответ на вопрос заголовка: WER снижают, но до нуля не доводят никогда — ни на одном языке, ни на одной модели. Рабочая задача другая: не дать ошибке распознавания попасть в критичное поле заявки. Решается это не выбором модели, а конструкцией разговора — подтверждением, тон-набором и словарём названий.
И сразу разведём две вещи, которые в отчётах постоянно склеивают в одну.
Транскрипция верная, а поле неверное — и наоборот
Транскрипция — это текст того, что услышал агент. Поле — это то, что он положил в карточку CRM. Между ними стоит извлечение сущностей и логика сценария, и ломаться они могут независимо друг от друга.
Первый случай: расшифровка идеальная. Клиент сказал «мне удобно в четверг, хотя нет, лучше в пятницу», агент записал всё дословно — и поставил в поле «дата визита» четверг. WER нулевой, заявка неверная.
Второй случай: агент услышал «Смирнофф» вместо «Смирнов». WER не нулевой — но телефон, адрес и время записаны правильно, менеджер поправит фамилию за две секунды. Ошибка есть, ущерба нет.
Отсюда главное правило темы: целевая метрика — доля корректно заполненных заявок, а не WER расшифровки. WER остаётся диагностическим инструментом: он показывает, где именно рвётся. Как встроить его в общую систему показателей — в разборе метрик голосового AI-агента.
Почему агент не расслышал: где распознавание речи падает
Качество распознавания в звонке нестабильно, и деградирует оно предсказуемо. Известные слабые места:
- Акцент. Точность заметно падает на речи неносителей языка.
- Фоновый шум. Улица, цех, детский сад, громкая связь в машине.
- Узкополосная телефония. Телефонный канал режет частоты и сжимает звук кодеком — модель получает уже испорченный сигнал.
- Отраслевые термины и названия. Артикулы, названия ЖК, марки, фамилии, аббревиатуры.
Дальше по цепочке работает понимание намерения: у зрелых систем intent recognition accuracy держится на уровне 90–97% (оценка платформы Balto — это вендорский ориентир, а не независимое исследование). То есть даже при хорошей расшифровке несколько диалогов из ста агент трактует не так, как задумал клиент.
Отдельно про телефонию. Узкополосный канал не чинится сменой модели распознавания: если на входе звук в 8 кГц с потерями от кодека, никакая модель не восстановит то, чего в сигнале нет. Это лечится на стороне связи — кодеком, качеством SIP-транка, отказом от лишних перекодировок. Что именно нужно проверить у провайдера, разобрано в статье про телефонию и подключение. Как устроена цепочка STT → LLM → TTS целиком — в материале о том, как работает голосовой AI-агент.
Где ошибка стоит дороже всего: поле, цена, страховка
Ошибка в одном поле стоит копейки, в другом — сорванной сделки. Считать надо по последствию, а не по количеству неверных букв.
| Поле | Цена ошибки | Как страховать |
|---|---|---|
| Номер телефона | Связи с клиентом нет вообще, лид потерян молча | Тон-набор (DTMF) вместо диктовки; повтор номера по цифрам с подтверждением |
| Адрес | Выезд не туда: оплаченный впустую час курьера или мастера | Повтор адреса вслух целиком; сверка дома и квартиры отдельно; подстановка из справочника |
| Сумма, тариф, количество | Спор с клиентом, ручной перерасчёт, репутационный ущерб | Обязательный повтор суммы; запрет агенту называть цифры вне базы знаний |
| Артикул, модель, номер заказа | Не тот товар, не та заявка, повторный контакт | Тон-набор для цифровых кодов; словарь артикулов в базе знаний |
| Имя, фамилия | Неловкость при следующем звонке, редко — критично | Не переспрашивать дважды; отдать на ручную правку менеджеру |
| Дата и время визита | Неявка, пустое окно в расписании | Проговорить дату словами: «записываю на пятницу, 12 сентября, в 15:00» |
Три приёма из правой колонки закрывают большую часть ущерба. Подтверждение повтором — агент проговаривает критичное поле обратно и ждёт согласия; это стоит 5–8 секунд разговора и применяется только к тем полям, где ошибка дорогая. Тон-набор уместен там, где клиент и так привык нажимать кнопки: номер телефона, код заказа, номер договора. Словарь названий в базе знаний — список ваших ЖК, моделей, артикулов и терминов, который подсказывает системе правильные варианты вместо фонетически похожих.
Подтверждать каждое поле нельзя — разговор превращается в допрос и клиент кладёт трубку. Выберите в сценарии одно-два поля, без которых заявка бесполезна, и подтверждайте только их.
Ограничения: почему 100% не будет и почему гнаться за WER бессмысленно
Стопроцентного распознавания не существует. Люди тоже переспрашивают: оператор при плохой связи просит продиктовать по буквам — и это нормальная часть работы, а не признак поломки.
Заодно развенчаем распространённый миф — «ИИ понимает как человек». Не понимает. В препринте τ-bench (Sierra совместно с Принстонским университетом, arXiv:2406.12045) модель решает задачу с первого прогона примерно в 61% случаев, но при восьми повторах одной и той же задачи доля стабильно успешных прогонов падает ниже 25%. То есть агент может справиться — и не гарантирует одинакового результата каждый раз. Это аргумент не против технологии, а в пользу подтверждений, ограничителей и эскалации на человека.
Второе ограничение — экономическое. Распознавание речи стоит денег: по оценке LPTracker, в себестоимости минуты качественного AI-звонка около 14,15 ₽ на STT приходится до 5 ₽. Более точная модель почти всегда дороже и часто медленнее, а латентность в голосе критична. Улучшать WER с 8% до 6%, если оба варианта одинаково путают ваши артикулы, — трата бюджета без эффекта на выручку.
Третье. Вендорский WER измерен на чистом датасете, а не на ваших звонках с улицы и из машины. Сравнивать модели по чужой цифре бессмысленно — сравнивать надо на своей записи звонков.
Практический вывод: не оптимизируйте WER как самоцель. Смотрите долю заявок, где все критичные поля заполнены верно, и разбирайте руками те, где не заполнены. Как выстроить такой разбор, чтобы он не превратился в случайное прослушивание, — в статье о том, как слушать звонки агента.
Частые вопросы
Что такое WER простыми словами?
Какой WER считается нормальным для звонков?
Почему агент путает адреса и артикулы?
Улучшится ли распознавание, если сменить модель?
Что в итоге
Ошибки распознавания речи неизбежны, и мерить их отдельно от результата — занятие бесполезное. Значение имеет одно: попала ошибка в критичное поле заявки или нет. Разберитесь, какие два-три поля в вашем сценарии стоят дорого, закройте их подтверждением, тон-набором и словарём — и следите за долей корректно заполненных заявок, а не за красивым WER в презентации вендора.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и посмотреть, где именно ломаются поля.
