Робот обзвона или голосовой AI-агент: за что вы платите
Голосовой AI-агент и робот обзвона: чем отличаются логика, задержка, цена и где скриптового робота хватит. Разбор без маркетинга.
Голосовой AI-агент и робот обзвона — это не два названия одной технологии. Разница проходит по тому, как система принимает решение в момент разговора. Робот обзвона распознаёт ключевые слова и переходит по веткам заранее нарисованного сценария: шаг влево — «я вас не понял, повторите». Голосовой AI-агент формулирует ответ языковой моделью в реальном времени, удерживая контекст всего диалога, и потому способен отработать возражение, которого никто не заложил в скрипт.
Из этого различия следует всё остальное: скорость ответа, качество голоса, то, попадут ли данные в CRM сами или их придётся выгружать файлом, сколько времени займёт настройка и почему минута разговора у одного решения стоит единицы рублей, а у другого — десятки. Это не «дорогой» и «дешёвый» вариант одного и того же. Это разные инструменты под разные задачи.
Ниже — как устроены обе технологии, где скриптовый робот уместен и чего LLM-агент не умеет до сих пор.
Как устроен скриптовый робот обзвона
Классический робот обзвона (в терминологии рынка — автодозвон, голосовой бот на интентах) работает по конечному автомату. Есть дерево: реплика робота, ожидание ответа, распознавание, сопоставление ответа с одним из заранее описанных интентов, переход в следующий узел. Всё, что не попало в список интентов, уходит в ветку «не распознано». Отдельный разбор про голосовое меню и его containment — здесь.
Такая архитектура предсказуема, и это её главное достоинство. Робот не скажет ничего, кроме записанного, не сочинит новую цену и не пообещает того, чего нет. Точность распознавания интентов у зрелых систем платформа Balto оценивает в 90–97% — на закрытых вопросах вроде «да/нет/перезвоните позже» это работает нормально.
Ломается автомат в момент, когда человек отвечает не по сценарию. Не «да», а «а вы вообще откуда мой номер взяли». Не «нет», а «сейчас неудобно, наберите после шести, но только не в пятницу». Для скриптового робота это одинаково неизвестные ветки.
Чем голосовой AI-агент отличается технически
Голосовой AI-агент вместо дерева использует языковую модель. У неё на входе — весь разговор целиком плюс инструкция о том, кто она, что продаёт, чего говорить нельзя и когда переводить на человека. Ответ генерируется под конкретную реплику собеседника, а не выбирается из списка.
Практические следствия:
- Возражения. Агент отвечает на формулировку, которую никто не предугадывал, и возвращается к цели звонка вместо сброса.
- Память диалога. Если человек в начале сказал, что ищет двушку для семьи с двумя детьми, агент учтёт это на пятой минуте.
- Действия. Агент вызывает внешние функции: проверяет свободные слоты, ставит задачу, заполняет карточку в CRM во время разговора, а не после выгрузки отчёта.
- Правки. Поведение меняется формулировкой инструкции, а не перерисовыванием дерева на сотню узлов. Replica заявляет о сроке запуска в 2–3 дня — это данные самой компании, не независимый замер.
И ровно отсюда растёт цена. По оценке вендора gravitel, скриптовый робот стоит 3–8 ₽/мин, а AI-бот на LLM — 10–25 ₽/мин. Разница не в наценке, а в стеке: за каждой минутой стоят распознавание, генерация и синтез речи, и каждый из трёх слоёв тарифицируется отдельно. Подробный разбор — в статье сколько стоит голосовой AI-агент.
Каскад STT → LLM → TTS: почему всё упирается в задержку
Голосовой агент почти всегда собран каскадом из трёх слоёв: STT (распознавание речи в текст) → LLM (генерация ответа) → TTS (синтез речи). Реплика клиента проходит их последовательно, и задержки складываются.
Разложение по слоям (оценки платформ Coval и Hamming): STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс, плюс сеть и телефония. В сумме неоптимизированный каскад даёт 670–3200 мс — от заметной паузы до откровенно неловкой.
Ориентиры по восприятию: менее 300 мс — отлично, 300–600 мс — приемлемо, целевой порог естественности обычно ставят ниже 500 мс по P95, свыше секунды разговор ощущается как разговор с автоматом независимо от качества текста. Пауза выдаёт машину раньше, чем голос: человек замечает не смысл ответа, а то, сколько его ждали. Replica заявляет задержку менее 0,3 секунды — это заявление компании, а не измерение третьей стороны.
В России добавляется отдельный фактор. По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских юрлиц ограничен, а работа через прокси добавляет лишние миллисекунды к каждому кругу — при бюджете меньше 500 мс это критично.
Скриптовый робот против LLM-агента: сравнительная таблица
| Параметр | Скриптовый робот обзвона | Голосовой AI-агент на LLM |
|---|---|---|
| Логика | жёсткий сценарий, ветвление по ключевым словам | контекстная генерация, удержание всего диалога |
| Возражения | «не понял, повторите» или сброс | отработка формулировок, не заложенных заранее |
| Голос | заметно синтетический | близкий к человеческому |
| Задержка | обычно 1–3 секунды | цель — менее 500 мс, лучшие внедрения заявляют менее 300 мс |
| CRM | выгрузка результатов постфактум | заполнение карточки и действия во время звонка |
| Настройка | ТЗ, подрядчик, недели на дерево сценария | правка инструкции, дни |
| Цена | 3–8 ₽/мин (оценка gravitel) | 10–25 ₽/мин (оценка gravitel) |
Таблица описывает два полюса. На рынке полно промежуточных решений: скриптовый робот с приличным TTS, LLM-агент с задержкой в полторы секунды. Проверять надо конкретного поставщика, а не класс технологии — как именно, разобрано в статье как выбрать голосового AI-агента.
Почему у рынка испорченная репутация
Массовый спам-обзвон приучил людей к тому, что робот на линии равен раздражению. Цифры это подтверждают: по данным МТТ, 65% раздражает навязчивость роботизированных звонков.
Но раздражает не автоматизация как таковая. По опросу НАФИ (август 2025, выборка 6213 человек) 88% россиян уже сталкивались с ИИ-ассистентами, а 57% не отличают бота от человека в разговоре. Если бы дело было в самом факте машины на линии, эти 57% не имели бы повода злиться — они просто не знают, с кем говорят.
Злит другое: звонок без внятного повода, в неудобное время, по третьему кругу и без возможности что-то сообщить в ответ. Тот же опрос фиксирует и динамику: доля позитивных оценок ИИ-ассистентов снизилась с 37% годом ранее до 33%. Рынок портит отношение к себе сам — объёмом бесполезных звонков, а не технологией.
Короткий полезный звонок с понятной причиной воспринимается нормально, кто бы его ни делал. Подробнее о том, что вызывает отторжение, — в статье почему клиенты не любят голосовых ботов.
По оценке Gartner (пресс-релиз от 25 июня 2025 года), из тысяч вендоров, называющих свои продукты agentic, реально таковыми являются около 130. Остальное аналитики назвали agent washing — переименованием обычной автоматизации.
Где скриптового робота достаточно
Есть задачи, где LLM не нужна, а иногда и вредна: генеративная модель добавляет непредсказуемость там, где нужен ровно один заранее известный текст.
Скриптового робота достаточно, когда:
- Сообщение одностороннее. Уведомление о доставке, напоминание о визите, статус заказа. Это же и задачи с самым высоким доверием: по данным CNews, информирование о статусе заказа ИИ доверяют 54% опрошенных, напоминания — 50%.
- Ответов ровно два. «Подтверждаете запись — нажмите 1». Диалог тут не нужен.
- Объём огромный, а сценарий одинаковый. Массовые уведомления на десятки тысяч номеров.
- Цена решает. При разнице в разы на минуте и нулевой потребности в диалоге переплата не окупится.
На таких структурированных транзакционных задачах containment (доля обращений, закрытых без человека) держится на уровне 70–90% — это типичный отраслевой диапазон, а не гарантия для конкретного проекта.
LLM-агент нужен там, где ответ клиента влияет на следующий шаг: квалификация заявки, отработка отказа, запись со сложным выбором времени и услуги, входящий звонок с непредсказуемым вопросом.
Ограничения: чего голосовой AI-агент не умеет
Он не консистентен. Это главное. В бенчмарке τ-bench (Sierra совместно с Принстоном, препринт arXiv:2406.12045) модель GPT-4o решала retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи показатель pass^8 падал ниже 25%. То есть агент может справиться с задачей, но не гарантирует одинакового поведения каждый раз. Отсюда необходимость guardrails, регрессионных тестов на записанных диалогах и обязательной эскалации.
Он галлюцинирует, и за это отвечает бизнес. Канонический пример — Air Canada: чат-бот авиакомпании сообщил пассажиру несуществующую политику возврата средств, суд встал на сторону пассажира и обязал компанию исполнить обещанное ботом. «Это сказал бот» не является аргументом.
Он не закрывает 100% обращений. Вендоры заявляют containment 60–90%. Независимые оценки реальных production-внедрений (dragapp) дают 40–70%; на ранней стадии внедрения оценка Balto — 20–40%, на зрелой 40–70%. Планировать надо от нижней границы диапазона, а не от цифры с лендинга.
Он плохо переносит шум и акцент. Точность распознавания падает на фоновом шуме, узкополосной телефонной линии, редких фамилиях и отраслевых терминах. Никакая LLM не исправит того, что STT услышал неверно.
Ему не доверяют деньги. По данным CNews, доверие к ИИ резко падает на задачах, связанных с деньгами, спорами и персональной ситуацией. Это ограничение не технологии, а ожиданий клиента, и обходить его бессмысленно.
Короткий тест: что вам на самом деле нужно
Пять вопросов. Если хотя бы на два из них ответ «да» — скриптовый робот задачу не закроет.
- Влияет ли ответ клиента на то, что должно произойти дальше? Если да, нужен диалог, а не рассылка.
- Есть ли у ваших клиентов возражения, которые вы не можете перечислить списком из десяти пунктов? Если да, дерево сценария будет обрываться.
- Нужно ли, чтобы результат разговора сам попал в карточку CRM? Если да, выгрузки постфактум недостаточно.
- Стоит ли за звонком деньги — заявка, сделка, запись? Если да, потерянный из-за «не понял» лид дороже разницы в цене минуты.
- Будете ли вы менять сценарий чаще раза в месяц? Если да, цикл «ТЗ — подрядчик — неделя» станет узким местом.
Если на все пять ответ «нет» — вам, скорее всего, хватит обычного автообзвона, и платить за LLM незачем.
Частые вопросы
Чем голосовой AI-агент отличается от робота обзвона простыми словами?
Сколько стоит минута разговора у робота и у AI-агента?
Отличит ли клиент голосового AI-агента от человека?
Что будет, если агент не поймёт вопрос?
Нужен ли AI-агент для напоминаний и подтверждения записи?
Вывод
Скриптовый робот и голосовой AI-агент решают разные задачи, и спор «что лучше» бессмыслен без указания сценария. На массовых уведомлениях автомат дешевле и надёжнее. На квалификации, возражениях и входящих звонках он теряет деньги молча — по одному лиду за раз.
Выбор стоит начинать не с демонстрации голоса, а с вопроса, влияет ли ответ клиента на то, что произойдёт дальше. И помнить про ограничения: непостоянство поведения от прогона к прогону, риск галлюцинации и containment в диапазоне 40–70%, а не 100%.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.
