реплика

Клиент звонит из машины: распознавание речи в шуме и помехах

Распознавание речи в шуме: что ломается первым при звонке из машины и с громкой связи, какие приёмы удерживают разговор и что проверять на демо.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·15 сентября 2026·7 минут чтения

Реальный входящий звонок редко приходит из тишины. Клиент говорит из машины на громкой связи, с улицы, из цеха, из комнаты, где работает телевизор. Распознавание речи в шуме деградирует предсказуемо — и ломается при этом не то, что ожидают.

Короткий ответ. Первым рвётся не разбор слов, а управление очередью реплик: агент перестаёт понимать, договорил ли клиент, и замолкает от постороннего звука. Вторым идут цифры и имена — самое короткое и самое дорогое в заявке. Лечится это не сменой модели, а конструкцией разговора: короткие закрытые вопросы, честный переспрос вместо догадки, подтверждение критичных полей вслух и явный запасной канал, когда линия совсем плохая.

Ниже — что именно происходит с сигналом в четырёх типичных условиях, какие приёмы удерживают разговор и что просить показать на демо.

Что ломается первым: не слова, а очередь реплик

За ритм диалога отвечают два механизма, и оба опираются на определение того, где в аудиопотоке речь, а где нет. Endpointing решает, что клиент закончил реплику; типичная отсечка — 200–400 мс тишины. Barge-in позволяет клиенту перебить агента.

В тишине оба работают надёжно. В шуме тишины не существует. Детектор речевой активности видит сигнал там, где его нет, и получается одно из двух: агент не дожидается конца фразы и перебивает или, наоборот, держит паузу, потому что фоновый гул для него — продолжающаяся речь. Обратная беда — ложное срабатывание barge-in: агент замолкает от кашля, от «угу», от реплики диктора в телевизоре. В препринте FireRedChat (arXiv) для этого вводят прямые метрики — время реакции на перебивание и долю ложных срабатываний.

Клиент слышит при этом не «плохое распознавание», а сбитый разговор: его перебивают или не дают вставить слово. Как устроена цепочка от телефонии до синтеза — в разборе, как работает голосовой AI-агент.

Распознавание речи в шуме: четыре типичных условия

УсловиеЧто происходит с сигналомЧто ломается первымЧто помогает
Громкая связьЭхо, микрофон берёт всю комнату, голос дальше от источникаЛожные срабатывания barge-in, обрыв репликиКороткие вопросы, подтверждение вслух
Машина, дорогаПостоянный широкополосный гул, ветер, попутчикиEndpointing: паузы читаются неверноЗакрытые вопросы, тон-набор для цифр
Слабый сигналПотеря пакетов и джиттер — из слова выпадают кускиЧисла и имена, целые короткие ответыПереспрос, перенос в СМС или мессенджер
Речь на фоне (телевизор, зал)Чужая речь неотличима от речи клиентаАгент отвечает на чужую репликуЯвная просьба уточнить, повтор ключевых полей

Отдельно про слабый сигнал: это единственная строка таблицы, которую не чинят ни моделью, ни сценарием. Если звук пришёл в узкой полосе, сжатый кодеком и с потерями, восстанавливать в нём нечего. Лечится на стороне связи — качеством транка и отказом от лишних перекодировок; что проверять у провайдера, собрано в статье про телефонию.

Почему цифры и имена ломаются раньше остального

Точность распознавания падает на фоновом шуме, узкополосной телефонии, акцентах и отраслевых терминах. Но внутри этого списка есть особо уязвимый класс — короткие и фонетически близкие фрагменты без контекста: «тринадцать» и «тридцать», «пятьдесят» и «шестьдесят», «Гагарина, 14» и «Гагарина, 40». У модели нет соседних слов, по которым можно было бы восстановить смысл.

Имена и фамилии страдают по другой причине: их нет в словаре, и правдоподобный вариант всегда найдётся. Цена ошибки при этом разная — перепутанная фамилия стоит неловкости, перепутанная цифра в номере телефона означает молча потерянный лид. Как страховать критичные поля и почему целевая метрика — доля верно заполненных заявок, а не WER, разобрано в материале про распознавание речи и WER.

Приёмы, которые удерживают разговор

Короткие закрытые вопросы. Чем длиннее ожидаемый ответ, тем больше шансов, что кусок из него выпадет. В шумных сценариях вопрос формулируется так, чтобы ответ занимал два-три слова, и задаётся строго по одному.

Переспрос вместо догадки. Ключевое поведение. Агент, который не расслышал и переспросил другими словами, ведёт себя как человек. Агент, который выбрал наиболее вероятный вариант и поехал дальше, создаёт ошибку, о которой никто не узнает до выезда курьера.

Подтверждение по цифрам. Номер и адрес проговариваются обратно — цифрами, группами, с паузой на согласие. Приём стоит 5–8 секунд и применяется к одному-двум полям, без которых заявка бесполезна. Подтверждать всё подряд нельзя: разговор превращается в допрос.

Тон-набор для длинных кодов. Номер договора, заказа, лицевого счёта надёжнее набрать на клавиатуре: цифра передаётся сигналом, а не звуком.

Явный запасной канал. Если связь рвётся, честный выход — сказать об этом и предложить СМС, мессенджер или обратный звонок. Это лучше и пятого переспроса, и заявки, собранной наугад.

Короткие реплики самого агента. Длинный монолог на шумной линии не удерживается: клиент теряет начало фразы и переспрашивает сам.

HoReCa0:00
Минутная бронь, где агент вслух повторяет дату, время, число гостей и продиктованный номер телефона и каждый раз ждёт подтверждения. В тишине этот повтор кажется избыточным — на шумной линии он единственное место, где ошибка ловится до конца разговора.

Ограничения: чего приёмы не чинят

Испорченный сигнал. Смена модели не восстановит то, чего в звуке нет. Сначала связь, потом модель.

Переспрос имеет цену. Один переспрос воспринимается нормально, два подряд — уже раздражают. После второго честнее предложить человека или другой канал, чем продолжать собирать данные вслепую.

Более точная модель не бесплатна. По оценке платформы LPTracker, в себестоимости минуты качественного AI-звонка около 14,15 ₽ распознавание занимает до 5 ₽. Точнее — обычно дороже и медленнее, а задержка в голосе критична сама по себе. Как складывается эта цифра целиком — в разборе, сколько стоит голосовой AI-агент.

Вендорский WER измерен не на ваших звонках. Бенчмарк снят на чистой записи, а вам нужен результат на линии из машины. Сравнивать модели по чужой цифре бессмысленно.

Здесь же уместно развернуть популярный аргумент. По данным опроса НАФИ (август 2025, выборка 6213 человек), 57% россиян не отличают бота от человека в разговоре — и отсюда часто делают вывод, что задача решена. В шуме отличают: человек переспрашивает и уточняет, а плохо настроенный агент уверенно едет дальше по неверно услышанному. Преимущество даёт не маскировка, а честное «не расслышал, повторите, пожалуйста».

Что проверять на демо

Демо обычно проходит в тишине, с чистого канала и по отрепетированному сценарию — в условиях, которых в продакшене не бывает. Семь проверок, которые стоит устроить самому:

  1. Позвонить с громкой связи из машины или с улицы, а не из кабинета.
  2. Продиктовать номер телефона и адрес с числами 13, 30, 50, 60 — и посмотреть, что доехало до карточки.
  3. Кашлянуть или сказать «угу» в середине реплики агента: замолчит ли он без причины.
  4. Сделать паузу внутри фразы — «мой номер... восемь девятьсот...» — и проверить, не обрежет ли его endpointing.
  5. Включить фоном речь: телевизор или разговор рядом.
  6. Прогнать один и тот же сценарий трижды и сравнить результаты.
  7. Проверять на своей телефонии, а не через веб-виджет на сайте поставщика.

Остальные восемь проверок демо, включая поведение вне базы знаний и механику эскалации, собраны в статье о том, что демо агента не показывает.

Частые вопросы

Работает ли голосовой агент при плохой связи?
Работает, но с оговорками. При потере пакетов и узкополосном кодеке часть звука физически не доходит, и восстановить его нельзя ни моделью, ни сценарием. Рабочее поведение агента в такой ситуации — переспросить, подтвердить ключевые поля и предложить другой канал, а не собирать заявку наугад.
Почему агент путает цифры при звонке из машины?
Числа коротки, фонетически близки и лишены контекста: «тринадцать» и «тридцать» на шумной линии различаются одним слогом. Помогает подтверждение вслух группами цифр, тон-набор для длинных кодов и вопросы, на которые ответ занимает два-три слова.
Поможет ли более точная модель распознавания речи?
Иногда да, но не тогда, когда проблема в канале связи. Сначала проверяют телефонию и настройки, потом словарь названий и сценарий подтверждений, и только затем модель: более точная обычно дороже и медленнее, а задержка в голосовом диалоге критична.
Как проверить поведение агента в шуме до покупки?
Звонить не из тишины: громкая связь, улица, фоновая речь. Продиктовать цифры, сделать паузу внутри фразы, кашлянуть посреди реплики агента. Важно не то, ошибся ли он, а как: переспросил по делу или уверенно продолжил по неверно услышанному слову.

Вывод

Шум ломает разговор не там, где ждут. Раньше ошибок в словах рушится ритм: агент перебивает или замолкает от постороннего звука, потому что в шумной линии нет тишины, по которой он определяет конец реплики. Дальше страдают цифры и имена — самое короткое и самое дорогое в заявке. Конструкция, которая это выдерживает, состоит из простых вещей: короткие закрытые вопросы, переспрос вместо догадки, подтверждение одного-двух критичных полей и честный переход в другой канал, когда линия не тянет. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и прогнать его в реальных условиях.

Позвоните агенту с громкой связи, а не из тишины

Соберите агента по своему сайту и позвоните ему — это бесплатно. Включите громкую связь, продиктуйте номер на ходу и послушайте, где он переспрашивает, а где едет дальше по неверно услышанному.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.