реплика

Клиент кладёт трубку на второй паузе: латентность голосового агента

Латентность голосового агента: порог 500 мс P95, разбор задержки по слоям STT/LLM/TTS и почему «звучит как робот» — это про паузы.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·8 апреля 2026·6 минут чтения

Клиент задал вопрос. Агент молчит секунду. Клиент начинает повторять — и в этот момент агент отвечает, они говорят одновременно. На второй такой паузе человек кладёт трубку. Латентность голосового агента, то есть задержка между концом реплики человека и началом ответа, разваливает разговор быстрее, чем неудачная формулировка в скрипте.

Ориентир простой: менее 500 мс на 95-м процентиле. Менее 300 мс — отлично, 300–600 мс — приемлемо, свыше секунды — собеседник уверенно опознаёт робота, даже если синтез звучит безупречно. Это отраслевой ориентир, а не измерение конкретного продукта.

И главный вывод, ради которого стоит читать дальше: «звучит как робот» — это чаще про паузы и невозможность перебить, чем про качество голоса.

Какая латентность голосового агента считается нормальной

Секундная тишина в телефонной трубке читается однозначно: «связь пропала» или «на том конце не человек». Проблема в том, что бюджет в 500 мс делят между собой минимум три модели, сеть и телефония. Каждый слой ест свою долю, и ни один сам по себе не выглядит виноватым.

Из чего складывается задержка: разбор по слоям

Классическая каскадная архитектура работает последовательно: распознавание речи (STT) → языковая модель (LLM) → синтез (TTS). Подробнее эта цепочка разобрана в статье о том, как устроен голосовой AI-агент. По оценкам платформ Coval и Hamming (это материалы вендоров, а не независимое исследование) вклад слоёв выглядит так, и суммарно каскад без оптимизации даёт 670–3200 мс.

СлойТипичный вклад в задержкуКак сократить
Телефония и сетьдесятки–сотни мс, зависит от SIP-маршрута и кодекадержать медиасервер рядом с телефонией, не гонять аудио через лишние транзитные узлы
STT (распознавание)100–400 мспотоковое распознавание вместо пакетного: текст идёт в модель, пока человек ещё говорит
Endpointing (определение конца реплики)200–400 мсадаптивная отсечка: короче на коротких ответах, длиннее там, где человек диктует адрес или думает
LLM (генерация ответа)200–1000 мсстриминг токенов, короткий системный промпт, кэш частых ответов, маленькая модель на простых репликах
TTS (синтез)100–500 мспотоковый синтез: начинать озвучивать первое предложение, не дожидаясь конца ответа

Идея всех оптимизаций одна: слои не должны ждать друг друга. Если синтез стартует по первой фразе, а распознавание идёт параллельно речи, суммарная задержка перестаёт быть арифметической суммой слоёв.

Отдельная ветка — native speech-to-speech, где модель обрабатывает звук напрямую, без промежуточного текста. Вендоры заявляют менее 180 мс против 450–650 мс у каскада. Эти цифры измерены самими разработчиками моделей и независимо не подтверждены. Плюс такая архитектура хуже поддаётся контролю: текстовую реплику можно проверить guardrails до озвучки, прямой аудиопоток — сложнее.

Почему «звучит как робот» — это про паузы, а не про голос

Распространённое мнение: клиентов раздражает синтетический голос. Данные говорят другое — по опросу НАФИ (август 2025 года, выборка 6213 человек) 57% россиян вообще не отличают бота от человека в разговоре. Голос давно перестал быть проблемой. Разговор выдаёт себя ритмом.

HoReCa0:00
Слушайте здесь не голос, а паузы: сколько проходит между концом реплики человека и началом ответа агента.

Два параметра ломают ритм чаще остальных.

Endpointing — момент, когда система решает, что человек договорил. Типичный диапазон 200–400 мс тишины. Отсечка короткая — агент влезает в середину фразы, стоит клиенту задуматься. Длинная — после каждой реплики повисает пауза.

Barge-in — возможность перебить агента. Без неё разговор превращается в прослушивание автоответчика: человек уже понял ответ, хочет уточнить, а агент дочитывает абзац. В препринте FireRedChat (arXiv) для этого используют две метрики: T90 — время реакции на перебивание, и false barge-in rate — доля ложных срабатываний, когда система замолкает от кашля, уличного шума или обычного «ага». Обе нужны в паре: агент, который замолкает от любого звука, не лучше того, кто не замолкает никогда.

Что спрашивать у поставщика

Не «какая у вас задержка», а «какая задержка P95 на моей телефонии, как настроен endpointing и какой у вас false barge-in rate». Первый вопрос получает маркетинговую цифру, второй — техническую. Полный список таких вопросов есть в разборе, как выбрать голосового AI-агента.

Российская специфика: прокси съедает бюджет

По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских номеров и юрлиц ограничен. Работать через прокси технически можно, но каждый дополнительный сетевой хоп добавляет к задержке — при бюджете в 500 мс это ощутимая доля, а не погрешность. Плюс трансграничная передача аудио создаёт отдельные вопросы по 152-ФЗ.

Отсюда практический вывод: выбор между западным и локальным стеком (Яндекс SpeechKit, Salute Speech, GigaChat, YandexGPT) в России — это не только вопрос качества модели, но и вопрос латентности с легальностью. Локальный стек проигрывает в универсальности и выигрывает в предсказуемости.

Ограничения и риски: почему гнаться за минимальной задержкой вредно

Латентность — метрика, которую легко переоптимизировать во вред разговору.

Слишком короткий endpointing перебивает думающего клиента. Человек говорит «мне нужно... э-э... на четверг, если можно» — и агент вклинивается в первую же паузу. Субъективно это раздражает сильнее, чем лишние 300 мс тишины: одно читается как медлительность, другое — как хамство.

Быстрая модель хуже держит контекст. Замена модели на более лёгкую даёт выигрыш в сотни миллисекунд, но агент начинает терять договорённости, достигнутые тремя репликами раньше. Разговор становится быстрым и бессмысленным — клиент второй раз называет адрес, который уже называл.

Среднее значение скрывает провалы. Отсюда требование мерить P95, а не среднее. Средние 400 мс при P95 в 1,8 секунды означают, что каждый двадцатый ответ проваливается — и проваливается он, как правило, не случайно: длинные задержки приходятся на сложные реплики, обращения к базе знаний и запросы в CRM. То есть ровно на те моменты, где разговор решается. Об этом же принципе — парных и процентильных метриках вместо усреднённых — подробнее в обзоре метрик голосового AI-агента.

И общее ограничение: низкая задержка не спасает плохой сценарий. Агент, который мгновенно отвечает не по делу, раздражает так же, как медленный. Скорость снимает одну конкретную причину недовольства из нескольких — остальные разобраны в статье о том, почему клиенты не любят ботов.

Частые вопросы

Какая задержка ответа голосового робота считается нормальной?
Отраслевой ориентир — менее 500 мс на 95-м процентиле. До 300 мс разговор ощущается естественным, 300–600 мс приемлемы, свыше секунды собеседник опознаёт автоматическую систему. Важно смотреть именно на процентиль, а не на среднее значение.
Почему голосовой агент отвечает с паузой?
Пауза складывается из нескольких слоёв: распознавание речи, ожидание конца реплики, генерация ответа моделью, синтез голоса, сеть и телефония. По оценкам платформ Coval и Hamming каскадная схема без оптимизации даёт от 670 до 3200 мс. Основной способ сократить задержку — не ускорять каждый слой по отдельности, а запускать их параллельно потоками.
Можно ли перебить голосового AI-агента?
У современных агентов это штатная функция (barge-in): человек начинает говорить, агент замолкает. Качество настройки описывают двумя метриками — временем реакции на перебивание и долей ложных срабатываний от шума и поддакиваний. Если агента перебить нельзя, разговор воспринимается как автоответчик независимо от того, насколько хорош синтез голоса.
Влияет ли использование зарубежных моделей на скорость ответа в России?
Да. Доступ к аудио-API OpenAI и Google для российских юрлиц ограничен, а работа через прокси добавляет сетевую задержку — при бюджете в 500 мс это заметная доля. Плюс появляются вопросы по трансграничной передаче персональных данных.

Коротко

Латентность — это не про технический перфекционизм, а про то, дослушает ли клиент разговор. Держать нужно P95 ниже 500 мс, а не среднее, и добиваться этого параллельной работой слоёв, а не только заменой моделей на самые быстрые. При этом сама по себе скорость ничего не гарантирует: слишком агрессивная отсечка реплики и облегчённая модель ломают разговор не хуже задержки. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и показать замеры на вашей телефонии.

Задержку не читают в отчёте — её слышно в первой паузе

Соберите агента по своему сайту и позвоните ему — это бесплатно. Попробуйте перебить его на середине фразы и задуматься посреди своей: ритм разговора проверяется только так.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.