реплика

Пауза в секунду — и это робот: как работает голосовой AI-агент

Как работает голосовой AI-агент: STT, LLM и TTS по слоям, сколько миллисекунд съедает каждый и почему свыше секунды клиент слышит робота.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·6 мая 2026·6 минут чтения

Голосовой AI-агент не слышит и не говорит. Он трижды переводит разговор с одного языка на другой: речь клиента — в текст, текст — в ответ, ответ — обратно в речь. Понять, как работает голосовой AI-агент, проще всего через время: каждый слой съедает свои миллисекунды, и их сумма решает, покажется разговор живым или мёртвым.

Порог известен. Задержка ниже 500 мс по P95 читается как обычная пауза в диалоге, менее 300 мс — отлично, 300–600 мс — приемлемо, а свыше секунды собеседник уже слышит робота (типичные ориентиры из разборов латентности у платформ Coval и Hamming, уровень отраслевой аналитики, не рецензируемого исследования).

Плохая новость: каскад из трёх слоёв без оптимизации даёт суммарно 670–3200 мс (там же). То есть «по умолчанию» система в порог не попадает. Почти вся инженерия в голосовых агентах — это борьба за то, чтобы уложиться в бюджет.

Как работает голосовой AI-агент: три слоя, один бюджет времени

STT — распознавание речи в текст. Принимает аудиопоток из телефонного канала и превращает его в строку. Работает потоково: гипотеза уточняется по ходу фразы, а не после её окончания. Занимает 100–400 мс. Почему выбор голоса влияет меньше, чем кажется, — в разборе синтеза и Brand Voice.

LLM — языковая модель. Получает текст реплики, историю разговора, инструкцию и данные из базы знаний и CRM. Формулирует ответ и принимает решения: уточнить, вызвать функцию (проверить запись, создать сделку), передать человеку. Самый дорогой слой: 200–1000 мс.

TTS — синтез речи. Превращает текст ответа обратно в звук с интонацией и паузами. Тоже потоковый: первый звук уходит в линию раньше, чем сгенерирована вся фраза. 100–500 мс.

Поверх этого — сеть и телефония: кодирование, SIP-транспорт, буферы оператора связи. Эта часть бюджета не зависит от качества моделей, но исправно съедает свою долю. Именно поэтому агент, который безупречно звучит в браузерном демо, может заметно тормозить на реальном звонке. Подробный разбор бюджета — в отдельной статье про латентность голосового агента.

СлойЧто делаетСколько занимаетЧто ломается при сбое
Телефония и сетьдоставляет звук в обе сторонызависит от канала и маршрутаэхо, «булькающий» звук, рваные паузы
STTречь → текст100–400 мсагент отвечает не на то: не разобрал имя, адрес, номер
LLMтекст → решение и ответ200–1000 мсдолгая пауза, уход от сценария, выдуманный факт
TTSтекст → речь100–500 мсневерное ударение, механическая интонация
Управление паузамирешает, когда говорить и когда молчатьendpointing 200–400 мсагент перебивает или, наоборот, «залипает»

Диапазоны по слоям — оценки Coval и Hamming; конкретные цифры зависят от выбранных моделей и площадки размещения. Санкционные ограничения тут не абстракция: работа с зарубежными аудио-API через прокси добавляет задержку, а бюджет и без того тесный.

Сервисная компания0:00
Весь бюджет из таблицы слышен здесь целиком: засеките паузу между концом реплики клиента и первым словом агента.

Почему агент перебивает — или не даёт вставить слово

Два механизма отвечают за ритм разговора. Endpointing определяет, что человек закончил реплику; типичная отсечка — 200–400 мс тишины. Barge-in — способность клиента перебить агента: он замолкает на полуслове и начинает слушать.

Дилемма нерешаема настройкой «по умолчанию». Короткая отсечка перебивает клиента, который задумался посреди фразы: «мой номер... восемь девятьсот...». Длинная — превращает каждую реплику в неестественную паузу и съедает тот самый бюджет в 500 мс. Отдельная беда — false barge-in: агент замолкает от кашля, поддакивания «ага» или шума в открытом офисе. В препринте FireRedChat (arXiv) для этого вводят прямые метрики — время реакции на перебивание и долю ложных срабатываний.

Практический вывод для тестирования: слушайте не «красивый» демо-звонок в тишине, а запись из машины, с улицы и от человека, который говорит медленно.

Speech-to-speech: что обещают вендоры

Есть архитектура без промежуточного текста — модель принимает речь и сразу отдаёт речь. Вендоры заявляют менее 180 мс против 450–650 мс у каскада. Это заявление продавцов, измеренное ими самими и не подтверждённое независимо. Плюс к скорости идёт минус к контролю: там, где нет текстового слоя, сложнее выстроить guardrails, логировать разговор и разбирать, почему агент сказал то, что сказал.

Ограничения: где цепочка рвётся

Каждый слой ошибается, и ошибки накапливаются.

STT деградирует предсказуемо. WER (доля ошибок распознавания) растёт на акцентах — особенно у неносителей языка, на фоновом шуме, на узкополосном телефонном канале и на отраслевых терминах, названиях брендов, фамилиях, артикулах. Звонок — худший из возможных аудиоканалов, и общие бенчмарки моделей, снятые на студийной записи, к нему отношения не имеют.

Понимание намерения не стопроцентное. По оценке платформы Balto, intent recognition accuracy у зрелых систем — 90–97%. Это хороший показатель, но 3–10% разговоров пойдут не туда, и сценарий обязан это предусматривать.

Ответ не воспроизводится один в один. Здесь стоит развенчать миф «ИИ понимает как человек». Бенчмарк τ-bench (препринт Sierra и Принстона, arXiv:2406.12045) показал: GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи доля стабильного успеха падает ниже 25%. Модель может справиться — она не гарантирует одинаковый результат каждый раз.

Отсюда три следствия, которые важнее любой демонстрации: нужны guardrails, нужны регулярные прогоны сценария на своих данных и нужна эскалация на человека по низкой уверенности. Развёрнутый перечень того, чего голосовой агент не умеет, — в соседнем материале.

Отдельно про класс задач. Скриптовый робот обзвона решает другую задачу другой архитектурой: ветвление по ключевым словам вместо контекстного диалога. Это дешевле и для массового уведомления достаточно — разница между роботом обзвона и LLM-агентом разобрана отдельно. Ошибка не в выборе робота, а в ожидании от него диалога.

Частые вопросы

Из чего состоит голосовой AI-агент?
Из четырёх частей: телефония, STT (речь в текст), LLM (генерация ответа и решений) и TTS (синтез речи). Поверх них работает логика управления паузами — endpointing и barge-in. Такая последовательная схема называется каскадной архитектурой.
Почему голосовой робот отвечает с задержкой?
Задержка складывается из времени всех слоёв: STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс плюс сеть и телефония (оценки Coval и Hamming). Без оптимизации сумма достигает 670–3200 мс. Естественным разговор воспринимается при задержке ниже 500 мс по P95.
Отличит ли клиент голосового AI-агента от человека?
Технически — часто нет. По опросу НАФИ (август 2025, выборка 6213 человек) 57% россиян не отличают бота от человека в разговоре. При этом 45% опрошенных Solar Staff хотят гарантированную возможность переключиться на живого сотрудника, поэтому маскировка — плохая стратегия, а честное представление в начале звонка — хорошая.
Сколько стоит минута разговора с AI-агентом?
Себестоимость складывается по тем же слоям. По расчёту LPTracker полная себестоимость минуты качественного AI-звонка — около 14,15 ₽, из них телефония около 1,65 ₽, STT до 5 ₽, LLM 4–6 ₽, TTS около 1,5 ₽. Подробнее — в статье сколько стоит голосовой AI-агент.

Коротко

Голосовой AI-агент — это конвейер из распознавания, модели и синтеза, зажатый в бюджет примерно в полсекунды. Слышимая «роботность» почти всегда не про голос, а про арифметику: где-то в цепочке потеряли 300 мс. А непонимание — почти всегда про качество звука на входе и про отсутствие сценария на те 3–10% разговоров, которые пойдут не по плану.

Оценивать агента поэтому стоит не по демо в тишине, а по записи звонка из реальной среды с реальными фамилиями и адресами. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.

Проверьте бюджет в полсекунды на своём сценарии

По адресу вашего сайта бесплатно соберётся агент, которому можно позвонить с обычного телефона. Паузу между своей репликой и его ответом вы услышите точнее, чем прочитаете в любой таблице.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.