Пауза в секунду — и это робот: как работает голосовой AI-агент
Как работает голосовой AI-агент: STT, LLM и TTS по слоям, сколько миллисекунд съедает каждый и почему свыше секунды клиент слышит робота.
Голосовой AI-агент не слышит и не говорит. Он трижды переводит разговор с одного языка на другой: речь клиента — в текст, текст — в ответ, ответ — обратно в речь. Понять, как работает голосовой AI-агент, проще всего через время: каждый слой съедает свои миллисекунды, и их сумма решает, покажется разговор живым или мёртвым.
Порог известен. Задержка ниже 500 мс по P95 читается как обычная пауза в диалоге, менее 300 мс — отлично, 300–600 мс — приемлемо, а свыше секунды собеседник уже слышит робота (типичные ориентиры из разборов латентности у платформ Coval и Hamming, уровень отраслевой аналитики, не рецензируемого исследования).
Плохая новость: каскад из трёх слоёв без оптимизации даёт суммарно 670–3200 мс (там же). То есть «по умолчанию» система в порог не попадает. Почти вся инженерия в голосовых агентах — это борьба за то, чтобы уложиться в бюджет.
Как работает голосовой AI-агент: три слоя, один бюджет времени
STT — распознавание речи в текст. Принимает аудиопоток из телефонного канала и превращает его в строку. Работает потоково: гипотеза уточняется по ходу фразы, а не после её окончания. Занимает 100–400 мс. Почему выбор голоса влияет меньше, чем кажется, — в разборе синтеза и Brand Voice.
LLM — языковая модель. Получает текст реплики, историю разговора, инструкцию и данные из базы знаний и CRM. Формулирует ответ и принимает решения: уточнить, вызвать функцию (проверить запись, создать сделку), передать человеку. Самый дорогой слой: 200–1000 мс.
TTS — синтез речи. Превращает текст ответа обратно в звук с интонацией и паузами. Тоже потоковый: первый звук уходит в линию раньше, чем сгенерирована вся фраза. 100–500 мс.
Поверх этого — сеть и телефония: кодирование, SIP-транспорт, буферы оператора связи. Эта часть бюджета не зависит от качества моделей, но исправно съедает свою долю. Именно поэтому агент, который безупречно звучит в браузерном демо, может заметно тормозить на реальном звонке. Подробный разбор бюджета — в отдельной статье про латентность голосового агента.
| Слой | Что делает | Сколько занимает | Что ломается при сбое |
|---|---|---|---|
| Телефония и сеть | доставляет звук в обе стороны | зависит от канала и маршрута | эхо, «булькающий» звук, рваные паузы |
| STT | речь → текст | 100–400 мс | агент отвечает не на то: не разобрал имя, адрес, номер |
| LLM | текст → решение и ответ | 200–1000 мс | долгая пауза, уход от сценария, выдуманный факт |
| TTS | текст → речь | 100–500 мс | неверное ударение, механическая интонация |
| Управление паузами | решает, когда говорить и когда молчать | endpointing 200–400 мс | агент перебивает или, наоборот, «залипает» |
Диапазоны по слоям — оценки Coval и Hamming; конкретные цифры зависят от выбранных моделей и площадки размещения. Санкционные ограничения тут не абстракция: работа с зарубежными аудио-API через прокси добавляет задержку, а бюджет и без того тесный.
Почему агент перебивает — или не даёт вставить слово
Два механизма отвечают за ритм разговора. Endpointing определяет, что человек закончил реплику; типичная отсечка — 200–400 мс тишины. Barge-in — способность клиента перебить агента: он замолкает на полуслове и начинает слушать.
Дилемма нерешаема настройкой «по умолчанию». Короткая отсечка перебивает клиента, который задумался посреди фразы: «мой номер... восемь девятьсот...». Длинная — превращает каждую реплику в неестественную паузу и съедает тот самый бюджет в 500 мс. Отдельная беда — false barge-in: агент замолкает от кашля, поддакивания «ага» или шума в открытом офисе. В препринте FireRedChat (arXiv) для этого вводят прямые метрики — время реакции на перебивание и долю ложных срабатываний.
Практический вывод для тестирования: слушайте не «красивый» демо-звонок в тишине, а запись из машины, с улицы и от человека, который говорит медленно.
Есть архитектура без промежуточного текста — модель принимает речь и сразу отдаёт речь. Вендоры заявляют менее 180 мс против 450–650 мс у каскада. Это заявление продавцов, измеренное ими самими и не подтверждённое независимо. Плюс к скорости идёт минус к контролю: там, где нет текстового слоя, сложнее выстроить guardrails, логировать разговор и разбирать, почему агент сказал то, что сказал.
Ограничения: где цепочка рвётся
Каждый слой ошибается, и ошибки накапливаются.
STT деградирует предсказуемо. WER (доля ошибок распознавания) растёт на акцентах — особенно у неносителей языка, на фоновом шуме, на узкополосном телефонном канале и на отраслевых терминах, названиях брендов, фамилиях, артикулах. Звонок — худший из возможных аудиоканалов, и общие бенчмарки моделей, снятые на студийной записи, к нему отношения не имеют.
Понимание намерения не стопроцентное. По оценке платформы Balto, intent recognition accuracy у зрелых систем — 90–97%. Это хороший показатель, но 3–10% разговоров пойдут не туда, и сценарий обязан это предусматривать.
Ответ не воспроизводится один в один. Здесь стоит развенчать миф «ИИ понимает как человек». Бенчмарк τ-bench (препринт Sierra и Принстона, arXiv:2406.12045) показал: GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи доля стабильного успеха падает ниже 25%. Модель может справиться — она не гарантирует одинаковый результат каждый раз.
Отсюда три следствия, которые важнее любой демонстрации: нужны guardrails, нужны регулярные прогоны сценария на своих данных и нужна эскалация на человека по низкой уверенности. Развёрнутый перечень того, чего голосовой агент не умеет, — в соседнем материале.
Отдельно про класс задач. Скриптовый робот обзвона решает другую задачу другой архитектурой: ветвление по ключевым словам вместо контекстного диалога. Это дешевле и для массового уведомления достаточно — разница между роботом обзвона и LLM-агентом разобрана отдельно. Ошибка не в выборе робота, а в ожидании от него диалога.
Частые вопросы
Из чего состоит голосовой AI-агент?
Почему голосовой робот отвечает с задержкой?
Отличит ли клиент голосового AI-агента от человека?
Сколько стоит минута разговора с AI-агентом?
Коротко
Голосовой AI-агент — это конвейер из распознавания, модели и синтеза, зажатый в бюджет примерно в полсекунды. Слышимая «роботность» почти всегда не про голос, а про арифметику: где-то в цепочке потеряли 300 мс. А непонимание — почти всегда про качество звука на входе и про отсутствие сценария на те 3–10% разговоров, которые пойдут не по плану.
Оценивать агента поэтому стоит не по демо в тишине, а по записи звонка из реальной среды с реальными фамилиями и адресами. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.
