Клиент кладёт трубку на второй паузе: латентность голосового агента
Латентность голосового агента: порог 500 мс P95, разбор задержки по слоям STT/LLM/TTS и почему «звучит как робот» — это про паузы.
Клиент задал вопрос. Агент молчит секунду. Клиент начинает повторять — и в этот момент агент отвечает, они говорят одновременно. На второй такой паузе человек кладёт трубку. Латентность голосового агента, то есть задержка между концом реплики человека и началом ответа, разваливает разговор быстрее, чем неудачная формулировка в скрипте.
Ориентир простой: менее 500 мс на 95-м процентиле. Менее 300 мс — отлично, 300–600 мс — приемлемо, свыше секунды — собеседник уверенно опознаёт робота, даже если синтез звучит безупречно. Это отраслевой ориентир, а не измерение конкретного продукта.
И главный вывод, ради которого стоит читать дальше: «звучит как робот» — это чаще про паузы и невозможность перебить, чем про качество голоса.
Какая латентность голосового агента считается нормальной
Секундная тишина в телефонной трубке читается однозначно: «связь пропала» или «на том конце не человек». Проблема в том, что бюджет в 500 мс делят между собой минимум три модели, сеть и телефония. Каждый слой ест свою долю, и ни один сам по себе не выглядит виноватым.
Из чего складывается задержка: разбор по слоям
Классическая каскадная архитектура работает последовательно: распознавание речи (STT) → языковая модель (LLM) → синтез (TTS). Подробнее эта цепочка разобрана в статье о том, как устроен голосовой AI-агент. По оценкам платформ Coval и Hamming (это материалы вендоров, а не независимое исследование) вклад слоёв выглядит так, и суммарно каскад без оптимизации даёт 670–3200 мс.
| Слой | Типичный вклад в задержку | Как сократить |
|---|---|---|
| Телефония и сеть | десятки–сотни мс, зависит от SIP-маршрута и кодека | держать медиасервер рядом с телефонией, не гонять аудио через лишние транзитные узлы |
| STT (распознавание) | 100–400 мс | потоковое распознавание вместо пакетного: текст идёт в модель, пока человек ещё говорит |
| Endpointing (определение конца реплики) | 200–400 мс | адаптивная отсечка: короче на коротких ответах, длиннее там, где человек диктует адрес или думает |
| LLM (генерация ответа) | 200–1000 мс | стриминг токенов, короткий системный промпт, кэш частых ответов, маленькая модель на простых репликах |
| TTS (синтез) | 100–500 мс | потоковый синтез: начинать озвучивать первое предложение, не дожидаясь конца ответа |
Идея всех оптимизаций одна: слои не должны ждать друг друга. Если синтез стартует по первой фразе, а распознавание идёт параллельно речи, суммарная задержка перестаёт быть арифметической суммой слоёв.
Отдельная ветка — native speech-to-speech, где модель обрабатывает звук напрямую, без промежуточного текста. Вендоры заявляют менее 180 мс против 450–650 мс у каскада. Эти цифры измерены самими разработчиками моделей и независимо не подтверждены. Плюс такая архитектура хуже поддаётся контролю: текстовую реплику можно проверить guardrails до озвучки, прямой аудиопоток — сложнее.
Почему «звучит как робот» — это про паузы, а не про голос
Распространённое мнение: клиентов раздражает синтетический голос. Данные говорят другое — по опросу НАФИ (август 2025 года, выборка 6213 человек) 57% россиян вообще не отличают бота от человека в разговоре. Голос давно перестал быть проблемой. Разговор выдаёт себя ритмом.
Два параметра ломают ритм чаще остальных.
Endpointing — момент, когда система решает, что человек договорил. Типичный диапазон 200–400 мс тишины. Отсечка короткая — агент влезает в середину фразы, стоит клиенту задуматься. Длинная — после каждой реплики повисает пауза.
Barge-in — возможность перебить агента. Без неё разговор превращается в прослушивание автоответчика: человек уже понял ответ, хочет уточнить, а агент дочитывает абзац. В препринте FireRedChat (arXiv) для этого используют две метрики: T90 — время реакции на перебивание, и false barge-in rate — доля ложных срабатываний, когда система замолкает от кашля, уличного шума или обычного «ага». Обе нужны в паре: агент, который замолкает от любого звука, не лучше того, кто не замолкает никогда.
Не «какая у вас задержка», а «какая задержка P95 на моей телефонии, как настроен endpointing и какой у вас false barge-in rate». Первый вопрос получает маркетинговую цифру, второй — техническую. Полный список таких вопросов есть в разборе, как выбрать голосового AI-агента.
Российская специфика: прокси съедает бюджет
По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских номеров и юрлиц ограничен. Работать через прокси технически можно, но каждый дополнительный сетевой хоп добавляет к задержке — при бюджете в 500 мс это ощутимая доля, а не погрешность. Плюс трансграничная передача аудио создаёт отдельные вопросы по 152-ФЗ.
Отсюда практический вывод: выбор между западным и локальным стеком (Яндекс SpeechKit, Salute Speech, GigaChat, YandexGPT) в России — это не только вопрос качества модели, но и вопрос латентности с легальностью. Локальный стек проигрывает в универсальности и выигрывает в предсказуемости.
Ограничения и риски: почему гнаться за минимальной задержкой вредно
Латентность — метрика, которую легко переоптимизировать во вред разговору.
Слишком короткий endpointing перебивает думающего клиента. Человек говорит «мне нужно... э-э... на четверг, если можно» — и агент вклинивается в первую же паузу. Субъективно это раздражает сильнее, чем лишние 300 мс тишины: одно читается как медлительность, другое — как хамство.
Быстрая модель хуже держит контекст. Замена модели на более лёгкую даёт выигрыш в сотни миллисекунд, но агент начинает терять договорённости, достигнутые тремя репликами раньше. Разговор становится быстрым и бессмысленным — клиент второй раз называет адрес, который уже называл.
Среднее значение скрывает провалы. Отсюда требование мерить P95, а не среднее. Средние 400 мс при P95 в 1,8 секунды означают, что каждый двадцатый ответ проваливается — и проваливается он, как правило, не случайно: длинные задержки приходятся на сложные реплики, обращения к базе знаний и запросы в CRM. То есть ровно на те моменты, где разговор решается. Об этом же принципе — парных и процентильных метриках вместо усреднённых — подробнее в обзоре метрик голосового AI-агента.
И общее ограничение: низкая задержка не спасает плохой сценарий. Агент, который мгновенно отвечает не по делу, раздражает так же, как медленный. Скорость снимает одну конкретную причину недовольства из нескольких — остальные разобраны в статье о том, почему клиенты не любят ботов.
Частые вопросы
Какая задержка ответа голосового робота считается нормальной?
Почему голосовой агент отвечает с паузой?
Можно ли перебить голосового AI-агента?
Влияет ли использование зарубежных моделей на скорость ответа в России?
Коротко
Латентность — это не про технический перфекционизм, а про то, дослушает ли клиент разговор. Держать нужно P95 ниже 500 мс, а не среднее, и добиваться этого параллельной работой слоёв, а не только заменой моделей на самые быстрые. При этом сама по себе скорость ничего не гарантирует: слишком агрессивная отсечка реплики и облегчённая модель ломают разговор не хуже задержки. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и показать замеры на вашей телефонии.
