реплика

Робот обзвона или голосовой AI-агент: за что вы платите

Голосовой AI-агент и робот обзвона: чем отличаются логика, задержка, цена и где скриптового робота хватит. Разбор без маркетинга.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·26 августа 2026·10 минут чтения

Голосовой AI-агент и робот обзвона — это не два названия одной технологии. Разница проходит по тому, как система принимает решение в момент разговора. Робот обзвона распознаёт ключевые слова и переходит по веткам заранее нарисованного сценария: шаг влево — «я вас не понял, повторите». Голосовой AI-агент формулирует ответ языковой моделью в реальном времени, удерживая контекст всего диалога, и потому способен отработать возражение, которого никто не заложил в скрипт.

Из этого различия следует всё остальное: скорость ответа, качество голоса, то, попадут ли данные в CRM сами или их придётся выгружать файлом, сколько времени займёт настройка и почему минута разговора у одного решения стоит единицы рублей, а у другого — десятки. Это не «дорогой» и «дешёвый» вариант одного и того же. Это разные инструменты под разные задачи.

Ниже — как устроены обе технологии, где скриптовый робот уместен и чего LLM-агент не умеет до сих пор.

Как устроен скриптовый робот обзвона

Классический робот обзвона (в терминологии рынка — автодозвон, голосовой бот на интентах) работает по конечному автомату. Есть дерево: реплика робота, ожидание ответа, распознавание, сопоставление ответа с одним из заранее описанных интентов, переход в следующий узел. Всё, что не попало в список интентов, уходит в ветку «не распознано». Отдельный разбор про голосовое меню и его containment — здесь.

Такая архитектура предсказуема, и это её главное достоинство. Робот не скажет ничего, кроме записанного, не сочинит новую цену и не пообещает того, чего нет. Точность распознавания интентов у зрелых систем платформа Balto оценивает в 90–97% — на закрытых вопросах вроде «да/нет/перезвоните позже» это работает нормально.

Ломается автомат в момент, когда человек отвечает не по сценарию. Не «да», а «а вы вообще откуда мой номер взяли». Не «нет», а «сейчас неудобно, наберите после шести, но только не в пятницу». Для скриптового робота это одинаково неизвестные ветки.

Чем голосовой AI-агент отличается технически

Голосовой AI-агент вместо дерева использует языковую модель. У неё на входе — весь разговор целиком плюс инструкция о том, кто она, что продаёт, чего говорить нельзя и когда переводить на человека. Ответ генерируется под конкретную реплику собеседника, а не выбирается из списка.

Практические следствия:

  • Возражения. Агент отвечает на формулировку, которую никто не предугадывал, и возвращается к цели звонка вместо сброса.
  • Память диалога. Если человек в начале сказал, что ищет двушку для семьи с двумя детьми, агент учтёт это на пятой минуте.
  • Действия. Агент вызывает внешние функции: проверяет свободные слоты, ставит задачу, заполняет карточку в CRM во время разговора, а не после выгрузки отчёта.
  • Правки. Поведение меняется формулировкой инструкции, а не перерисовыванием дерева на сотню узлов. Replica заявляет о сроке запуска в 2–3 дня — это данные самой компании, не независимый замер.

И ровно отсюда растёт цена. По оценке вендора gravitel, скриптовый робот стоит 3–8 ₽/мин, а AI-бот на LLM — 10–25 ₽/мин. Разница не в наценке, а в стеке: за каждой минутой стоят распознавание, генерация и синтез речи, и каждый из трёх слоёв тарифицируется отдельно. Подробный разбор — в статье сколько стоит голосовой AI-агент.

Каскад STT → LLM → TTS: почему всё упирается в задержку

Голосовой агент почти всегда собран каскадом из трёх слоёв: STT (распознавание речи в текст) → LLM (генерация ответа) → TTS (синтез речи). Реплика клиента проходит их последовательно, и задержки складываются.

Разложение по слоям (оценки платформ Coval и Hamming): STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс, плюс сеть и телефония. В сумме неоптимизированный каскад даёт 670–3200 мс — от заметной паузы до откровенно неловкой.

Ориентиры по восприятию: менее 300 мс — отлично, 300–600 мс — приемлемо, целевой порог естественности обычно ставят ниже 500 мс по P95, свыше секунды разговор ощущается как разговор с автоматом независимо от качества текста. Пауза выдаёт машину раньше, чем голос: человек замечает не смысл ответа, а то, сколько его ждали. Replica заявляет задержку менее 0,3 секунды — это заявление компании, а не измерение третьей стороны.

В России добавляется отдельный фактор. По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских юрлиц ограничен, а работа через прокси добавляет лишние миллисекунды к каждому кругу — при бюджете меньше 500 мс это критично.

Скриптовый робот против LLM-агента: сравнительная таблица

ПараметрСкриптовый робот обзвонаГолосовой AI-агент на LLM
Логикажёсткий сценарий, ветвление по ключевым словамконтекстная генерация, удержание всего диалога
Возражения«не понял, повторите» или сбросотработка формулировок, не заложенных заранее
Голосзаметно синтетическийблизкий к человеческому
Задержкаобычно 1–3 секундыцель — менее 500 мс, лучшие внедрения заявляют менее 300 мс
CRMвыгрузка результатов постфактумзаполнение карточки и действия во время звонка
НастройкаТЗ, подрядчик, недели на дерево сценарияправка инструкции, дни
Цена3–8 ₽/мин (оценка gravitel)10–25 ₽/мин (оценка gravitel)

Таблица описывает два полюса. На рынке полно промежуточных решений: скриптовый робот с приличным TTS, LLM-агент с задержкой в полторы секунды. Проверять надо конкретного поставщика, а не класс технологии — как именно, разобрано в статье как выбрать голосового AI-агента.

Сервисная компания0:00
Запись настоящего разговора: клиент отвечает не по порядку, задаёт встречные вопросы и спорит про материал конструкции. В скриптовом дереве каждый такой поворот пришлось бы нарисовать заранее.

Почему у рынка испорченная репутация

Массовый спам-обзвон приучил людей к тому, что робот на линии равен раздражению. Цифры это подтверждают: по данным МТТ, 65% раздражает навязчивость роботизированных звонков.

Но раздражает не автоматизация как таковая. По опросу НАФИ (август 2025, выборка 6213 человек) 88% россиян уже сталкивались с ИИ-ассистентами, а 57% не отличают бота от человека в разговоре. Если бы дело было в самом факте машины на линии, эти 57% не имели бы повода злиться — они просто не знают, с кем говорят.

Злит другое: звонок без внятного повода, в неудобное время, по третьему кругу и без возможности что-то сообщить в ответ. Тот же опрос фиксирует и динамику: доля позитивных оценок ИИ-ассистентов снизилась с 37% годом ранее до 33%. Рынок портит отношение к себе сам — объёмом бесполезных звонков, а не технологией.

Короткий полезный звонок с понятной причиной воспринимается нормально, кто бы его ни делал. Подробнее о том, что вызывает отторжение, — в статье почему клиенты не любят голосовых ботов.

Не всё, что называют агентом, им является

По оценке Gartner (пресс-релиз от 25 июня 2025 года), из тысяч вендоров, называющих свои продукты agentic, реально таковыми являются около 130. Остальное аналитики назвали agent washing — переименованием обычной автоматизации.

Где скриптового робота достаточно

Есть задачи, где LLM не нужна, а иногда и вредна: генеративная модель добавляет непредсказуемость там, где нужен ровно один заранее известный текст.

Скриптового робота достаточно, когда:

  • Сообщение одностороннее. Уведомление о доставке, напоминание о визите, статус заказа. Это же и задачи с самым высоким доверием: по данным CNews, информирование о статусе заказа ИИ доверяют 54% опрошенных, напоминания — 50%.
  • Ответов ровно два. «Подтверждаете запись — нажмите 1». Диалог тут не нужен.
  • Объём огромный, а сценарий одинаковый. Массовые уведомления на десятки тысяч номеров.
  • Цена решает. При разнице в разы на минуте и нулевой потребности в диалоге переплата не окупится.

На таких структурированных транзакционных задачах containment (доля обращений, закрытых без человека) держится на уровне 70–90% — это типичный отраслевой диапазон, а не гарантия для конкретного проекта.

LLM-агент нужен там, где ответ клиента влияет на следующий шаг: квалификация заявки, отработка отказа, запись со сложным выбором времени и услуги, входящий звонок с непредсказуемым вопросом.

Ограничения: чего голосовой AI-агент не умеет

Он не консистентен. Это главное. В бенчмарке τ-bench (Sierra совместно с Принстоном, препринт arXiv:2406.12045) модель GPT-4o решала retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи показатель pass^8 падал ниже 25%. То есть агент может справиться с задачей, но не гарантирует одинакового поведения каждый раз. Отсюда необходимость guardrails, регрессионных тестов на записанных диалогах и обязательной эскалации.

Он галлюцинирует, и за это отвечает бизнес. Канонический пример — Air Canada: чат-бот авиакомпании сообщил пассажиру несуществующую политику возврата средств, суд встал на сторону пассажира и обязал компанию исполнить обещанное ботом. «Это сказал бот» не является аргументом.

Он не закрывает 100% обращений. Вендоры заявляют containment 60–90%. Независимые оценки реальных production-внедрений (dragapp) дают 40–70%; на ранней стадии внедрения оценка Balto — 20–40%, на зрелой 40–70%. Планировать надо от нижней границы диапазона, а не от цифры с лендинга.

Он плохо переносит шум и акцент. Точность распознавания падает на фоновом шуме, узкополосной телефонной линии, редких фамилиях и отраслевых терминах. Никакая LLM не исправит того, что STT услышал неверно.

Ему не доверяют деньги. По данным CNews, доверие к ИИ резко падает на задачах, связанных с деньгами, спорами и персональной ситуацией. Это ограничение не технологии, а ожиданий клиента, и обходить его бессмысленно.

Короткий тест: что вам на самом деле нужно

Пять вопросов. Если хотя бы на два из них ответ «да» — скриптовый робот задачу не закроет.

  1. Влияет ли ответ клиента на то, что должно произойти дальше? Если да, нужен диалог, а не рассылка.
  2. Есть ли у ваших клиентов возражения, которые вы не можете перечислить списком из десяти пунктов? Если да, дерево сценария будет обрываться.
  3. Нужно ли, чтобы результат разговора сам попал в карточку CRM? Если да, выгрузки постфактум недостаточно.
  4. Стоит ли за звонком деньги — заявка, сделка, запись? Если да, потерянный из-за «не понял» лид дороже разницы в цене минуты.
  5. Будете ли вы менять сценарий чаще раза в месяц? Если да, цикл «ТЗ — подрядчик — неделя» станет узким местом.

Если на все пять ответ «нет» — вам, скорее всего, хватит обычного автообзвона, и платить за LLM незачем.

Частые вопросы

Чем голосовой AI-агент отличается от робота обзвона простыми словами?
Робот обзвона идёт по заранее нарисованному сценарию и понимает только заложенные варианты ответа. AI-агент строит реплики языковой моделью и удерживает контекст разговора, поэтому реагирует на то, чего в сценарии не было. Отсюда разница в возражениях, задержке, работе с CRM и цене минуты.
Сколько стоит минута разговора у робота и у AI-агента?
По оценке вендора gravitel, скриптовый робот обходится в 3–8 ₽/мин, AI-бот на LLM — в 10–25 ₽/мин. Полную себестоимость минуты качественного AI-звонка LPTracker оценивает примерно в 14 ₽. Предложения по 1–3 ₽/мин относятся к скриптовой технологии.
Отличит ли клиент голосового AI-агента от человека?
По опросу НАФИ (август 2025, 6213 респондентов), 57% россиян не отличают бота от человека. При этом маскировка — плохая стратегия: люди хотят сохранить право переключиться на оператора, а честное представление в начале звонка снижает число жалоб.
Что будет, если агент не поймёт вопрос?
В нормально настроенном сценарии он передаёт разговор человеку по низкой уверенности модели либо ставит задачу на перезвон. Поэтому containment в реальных внедрениях независимо оценивается в 40–70%, а не в 100%: часть звонков уходит оператору по замыслу, а не по аварии.
Нужен ли AI-агент для напоминаний и подтверждения записи?
Обычно нет. На односторонних уведомлениях и подтверждениях с двумя вариантами ответа скриптового робота достаточно, и он дешевле. LLM-агент оправдан там, где ответ клиента меняет ход разговора.

Вывод

Скриптовый робот и голосовой AI-агент решают разные задачи, и спор «что лучше» бессмыслен без указания сценария. На массовых уведомлениях автомат дешевле и надёжнее. На квалификации, возражениях и входящих звонках он теряет деньги молча — по одному лиду за раз.

Выбор стоит начинать не с демонстрации голоса, а с вопроса, влияет ли ответ клиента на то, что произойдёт дальше. И помнить про ограничения: непостоянство поведения от прогона к прогону, риск галлюцинации и containment в диапазоне 40–70%, а не 100%.

Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.

Ответьте агенту не по сценарию и послушайте, что будет

По адресу вашего сайта бесплатно соберётся голосовой агент, которому можно позвонить. Скажите ему то, чего в скрипте быть не могло, — разница со скриптовым роботом слышна в первую минуту.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.