Клиент звонит из машины: распознавание речи в шуме и помехах
Распознавание речи в шуме: что ломается первым при звонке из машины и с громкой связи, какие приёмы удерживают разговор и что проверять на демо.
Реальный входящий звонок редко приходит из тишины. Клиент говорит из машины на громкой связи, с улицы, из цеха, из комнаты, где работает телевизор. Распознавание речи в шуме деградирует предсказуемо — и ломается при этом не то, что ожидают.
Короткий ответ. Первым рвётся не разбор слов, а управление очередью реплик: агент перестаёт понимать, договорил ли клиент, и замолкает от постороннего звука. Вторым идут цифры и имена — самое короткое и самое дорогое в заявке. Лечится это не сменой модели, а конструкцией разговора: короткие закрытые вопросы, честный переспрос вместо догадки, подтверждение критичных полей вслух и явный запасной канал, когда линия совсем плохая.
Ниже — что именно происходит с сигналом в четырёх типичных условиях, какие приёмы удерживают разговор и что просить показать на демо.
Что ломается первым: не слова, а очередь реплик
За ритм диалога отвечают два механизма, и оба опираются на определение того, где в аудиопотоке речь, а где нет. Endpointing решает, что клиент закончил реплику; типичная отсечка — 200–400 мс тишины. Barge-in позволяет клиенту перебить агента.
В тишине оба работают надёжно. В шуме тишины не существует. Детектор речевой активности видит сигнал там, где его нет, и получается одно из двух: агент не дожидается конца фразы и перебивает или, наоборот, держит паузу, потому что фоновый гул для него — продолжающаяся речь. Обратная беда — ложное срабатывание barge-in: агент замолкает от кашля, от «угу», от реплики диктора в телевизоре. В препринте FireRedChat (arXiv) для этого вводят прямые метрики — время реакции на перебивание и долю ложных срабатываний.
Клиент слышит при этом не «плохое распознавание», а сбитый разговор: его перебивают или не дают вставить слово. Как устроена цепочка от телефонии до синтеза — в разборе, как работает голосовой AI-агент.
Распознавание речи в шуме: четыре типичных условия
| Условие | Что происходит с сигналом | Что ломается первым | Что помогает |
|---|---|---|---|
| Громкая связь | Эхо, микрофон берёт всю комнату, голос дальше от источника | Ложные срабатывания barge-in, обрыв реплики | Короткие вопросы, подтверждение вслух |
| Машина, дорога | Постоянный широкополосный гул, ветер, попутчики | Endpointing: паузы читаются неверно | Закрытые вопросы, тон-набор для цифр |
| Слабый сигнал | Потеря пакетов и джиттер — из слова выпадают куски | Числа и имена, целые короткие ответы | Переспрос, перенос в СМС или мессенджер |
| Речь на фоне (телевизор, зал) | Чужая речь неотличима от речи клиента | Агент отвечает на чужую реплику | Явная просьба уточнить, повтор ключевых полей |
Отдельно про слабый сигнал: это единственная строка таблицы, которую не чинят ни моделью, ни сценарием. Если звук пришёл в узкой полосе, сжатый кодеком и с потерями, восстанавливать в нём нечего. Лечится на стороне связи — качеством транка и отказом от лишних перекодировок; что проверять у провайдера, собрано в статье про телефонию.
Почему цифры и имена ломаются раньше остального
Точность распознавания падает на фоновом шуме, узкополосной телефонии, акцентах и отраслевых терминах. Но внутри этого списка есть особо уязвимый класс — короткие и фонетически близкие фрагменты без контекста: «тринадцать» и «тридцать», «пятьдесят» и «шестьдесят», «Гагарина, 14» и «Гагарина, 40». У модели нет соседних слов, по которым можно было бы восстановить смысл.
Имена и фамилии страдают по другой причине: их нет в словаре, и правдоподобный вариант всегда найдётся. Цена ошибки при этом разная — перепутанная фамилия стоит неловкости, перепутанная цифра в номере телефона означает молча потерянный лид. Как страховать критичные поля и почему целевая метрика — доля верно заполненных заявок, а не WER, разобрано в материале про распознавание речи и WER.
Приёмы, которые удерживают разговор
Короткие закрытые вопросы. Чем длиннее ожидаемый ответ, тем больше шансов, что кусок из него выпадет. В шумных сценариях вопрос формулируется так, чтобы ответ занимал два-три слова, и задаётся строго по одному.
Переспрос вместо догадки. Ключевое поведение. Агент, который не расслышал и переспросил другими словами, ведёт себя как человек. Агент, который выбрал наиболее вероятный вариант и поехал дальше, создаёт ошибку, о которой никто не узнает до выезда курьера.
Подтверждение по цифрам. Номер и адрес проговариваются обратно — цифрами, группами, с паузой на согласие. Приём стоит 5–8 секунд и применяется к одному-двум полям, без которых заявка бесполезна. Подтверждать всё подряд нельзя: разговор превращается в допрос.
Тон-набор для длинных кодов. Номер договора, заказа, лицевого счёта надёжнее набрать на клавиатуре: цифра передаётся сигналом, а не звуком.
Явный запасной канал. Если связь рвётся, честный выход — сказать об этом и предложить СМС, мессенджер или обратный звонок. Это лучше и пятого переспроса, и заявки, собранной наугад.
Короткие реплики самого агента. Длинный монолог на шумной линии не удерживается: клиент теряет начало фразы и переспрашивает сам.
Ограничения: чего приёмы не чинят
Испорченный сигнал. Смена модели не восстановит то, чего в звуке нет. Сначала связь, потом модель.
Переспрос имеет цену. Один переспрос воспринимается нормально, два подряд — уже раздражают. После второго честнее предложить человека или другой канал, чем продолжать собирать данные вслепую.
Более точная модель не бесплатна. По оценке платформы LPTracker, в себестоимости минуты качественного AI-звонка около 14,15 ₽ распознавание занимает до 5 ₽. Точнее — обычно дороже и медленнее, а задержка в голосе критична сама по себе. Как складывается эта цифра целиком — в разборе, сколько стоит голосовой AI-агент.
Вендорский WER измерен не на ваших звонках. Бенчмарк снят на чистой записи, а вам нужен результат на линии из машины. Сравнивать модели по чужой цифре бессмысленно.
Здесь же уместно развернуть популярный аргумент. По данным опроса НАФИ (август 2025, выборка 6213 человек), 57% россиян не отличают бота от человека в разговоре — и отсюда часто делают вывод, что задача решена. В шуме отличают: человек переспрашивает и уточняет, а плохо настроенный агент уверенно едет дальше по неверно услышанному. Преимущество даёт не маскировка, а честное «не расслышал, повторите, пожалуйста».
Что проверять на демо
Демо обычно проходит в тишине, с чистого канала и по отрепетированному сценарию — в условиях, которых в продакшене не бывает. Семь проверок, которые стоит устроить самому:
- Позвонить с громкой связи из машины или с улицы, а не из кабинета.
- Продиктовать номер телефона и адрес с числами 13, 30, 50, 60 — и посмотреть, что доехало до карточки.
- Кашлянуть или сказать «угу» в середине реплики агента: замолчит ли он без причины.
- Сделать паузу внутри фразы — «мой номер... восемь девятьсот...» — и проверить, не обрежет ли его endpointing.
- Включить фоном речь: телевизор или разговор рядом.
- Прогнать один и тот же сценарий трижды и сравнить результаты.
- Проверять на своей телефонии, а не через веб-виджет на сайте поставщика.
Остальные восемь проверок демо, включая поведение вне базы знаний и механику эскалации, собраны в статье о том, что демо агента не показывает.
Частые вопросы
Работает ли голосовой агент при плохой связи?
Почему агент путает цифры при звонке из машины?
Поможет ли более точная модель распознавания речи?
Как проверить поведение агента в шуме до покупки?
Вывод
Шум ломает разговор не там, где ждут. Раньше ошибок в словах рушится ритм: агент перебивает или замолкает от постороннего звука, потому что в шумной линии нет тишины, по которой он определяет конец реплики. Дальше страдают цифры и имена — самое короткое и самое дорогое в заявке. Конструкция, которая это выдерживает, состоит из простых вещей: короткие закрытые вопросы, переспрос вместо догадки, подтверждение одного-двух критичных полей и честный переход в другой канал, когда линия не тянет. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и прогнать его в реальных условиях.
