реплика

Как выбрать голосового AI-агента: 12 неудобных вопросов

Как выбрать голосового AI-агента: 12 вопросов поставщику, красные флаги, честные метрики вместо процентов с лендинга и правила пилота.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·12 августа 2026·12 минут чтения

Как выбрать голосового AI-агента, если все лендинги выглядят одинаково: та же фраза про «человеческий голос», тот же процент автоматизации, та же обещанная окупаемость. Короткий ответ: не по презентации, а по ответам на неудобные вопросы. Демо в тишине проходят все. Разваливаются решения позже — на шумной телефонной линии, на клиенте, который перебивает, на передаче разговора человеку и на счёте за месяц.

Ниже — 12 вопросов поставщику до подписания договора: какой ответ считать нормальным, а какой — поводом насторожиться. Плюс честный пилот, российская специфика и ситуации, когда голосовой агент не нужен вообще.

Один ориентир для калибровки ожиданий. По данным пресс-релиза Gartner от 25 июня 2025 года (аналитик Anushree Verma), из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130 — остальное аналитики называют agent washing, маркетинговым переименованием обычной автоматизации в «агента». Куда рынок движется дальше и почему отсев вендоров только начинается — в разборе трендов. Там же Gartner прогнозирует отмену более 40% проектов agentic AI к концу 2027 года из-за роста затрат и неясной бизнес-ценности. Шанс купить не то, за что вы платите, — не паранойя, а базовый сценарий.

Почему цифре с лендинга нельзя верить

Самая частая цифра в отрасли — процент решённых обращений: «до 80%», «до 90%», «70–75%». Проблема не в том, что вендоры врут, а в том, что почти никто не пишет, что считается решённым. Как смотреть демо, чтобы оно что-то доказывало, разобрано здесь.

Если «решённым» считается любой разговор, который не переключили на оператора, то клиент, бросивший трубку от раздражения, попадает в успешную статистику. Это deflection — отвод обращения из очереди, — а не resolution.

Ориентиры выглядят так. Классический DTMF-IVR закрывает без человека 5–10% обращений, conversational IVR — 10–15%. Вендоры agentic-решений заявляют 60–90% (например, Teneo). Независимые оценки реальных production-внедрений, которые приводит dragapp, дают 40–70%. На узких структурированных сценариях — статус заказа, запись на приём, напоминание — планка выше, 70–90%.

Это и есть развенчание мифа «вендорские 80–90% — это то, что получу я». 40–70% — не средняя цифра, а диапазон: где вы окажетесь внутри него, зависит от типа обращений, качества базы знаний и того, насколько узко поставлена задача. Единственный честный предиктор — пилот на ваших данных по вашему определению успеха.

Осторожно с формулировкой «up to»

«До 80%» — верхняя граница лучшего наблюдавшегося результата, а не ваш ожидаемый. Просите не процент, а определение: что засчитывалось как успех и на каком объёме звонков.

Как выбрать голосового AI-агента: сначала определение успеха, потом вендор

Прежде чем сравнивать поставщиков, зафиксируйте на бумаге, что для вас значит «работает» — так, чтобы это проверялось по логам и выгрузке из CRM.

Плохо: «агент обрабатывает входящие». Хорошо: «из 100 входящих в нерабочее время не менее N заканчиваются записанной в CRM заявкой с валидным телефоном и датой визита, и не более 15% этих клиентов перезванивают по тому же вопросу в течение 72 часов».

Второе — определитесь, какая технология нужна. Скриптовый робот обзвона и контекстный LLM-агент решают разные задачи: для уведомления «ваш заказ приехал» достаточно первого, для квалификации лида с возражениями — нет. Разбор различий есть в статье «Голосовой AI-агент и робот обзвона: в чём разница». Если вам нужен обзвон-уведомление, платить за LLM-агента незачем.

12 вопросов поставщику

  1. Что именно вы считаете решённым обращением?
    • Хороший ответ: письменное определение — какие исходы засчитываются, как обрабатывается брошенный звонок, кто и на каком объёме мерил.
    • Красный флаг: «до 80%» без определения, отказ показать методику, подмена resolution на deflection.
  2. Какая у вас латентность и как вы её измеряете?
    • Хороший ответ: цифра в P95, а не «в среднем», с разложением по слоям. Ориентир естественности диалога — менее 500 мс P95; менее 300 мс воспринимается отлично, 300–600 мс приемлемо, свыше секунды собеседник опознаёт робота. По разложению Coval и Hamming: STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс, плюс сеть и телефония — каскадная система без оптимизации даёт 670–3200 мс.
    • Красный флаг: «мгновенно», «как человек», средняя задержка вместо перцентиля, замер на веб-демо вместо телефонной линии.
  3. Какая архитектура, какие модели и где они физически работают?
    • Хороший ответ: конкретно — каскад STT→LLM→TTS или native speech-to-speech, названия моделей, регион размещения. Заявленные вендорами менее 180 мс у speech-to-speech против 450–650 мс у каскада проверяются на своём канале.
    • Красный флаг: «наша проприетарная нейросеть» без деталей, отказ назвать провайдеров STT и TTS.
  4. Где хранятся записи и транскрипты и как оформляется согласие?
    • Хороший ответ: серверы в РФ, названный хостинг, готовность подписать поручение на обработку. Записи и транскрипты — персональные данные по 152-ФЗ с требованием локализации. С 1 сентября 2025 года (закон № 156-ФЗ от 24.06.2025) согласие оформляется отдельным документом, а не строкой в пользовательском соглашении. Подробнее — в статье «152-ФЗ и запись разговоров».
    • Красный флаг: «данные в облаке, всё безопасно» без указания юрисдикции; предложение обойти согласие.
  5. Как устроена эскалация на человека?
    • Хороший ответ: передача по низкой уверенности модели и по стоп-словам, перенос контекста оператору, понятное поведение в нерабочее время, гарантированный выход на человека по требованию клиента. По данным Solar Staff, 45% россиян хотят такую возможность, 83% предпочитают гибридную модель.
    • Красный флаг: «агент справляется сам», эскалация только по явной фразе клиента, потеря контекста при переводе.
  6. Покажите парные метрики, а не только containment.
    • Хороший ответ: repeat contact rate за 72 часа (ориентир Balto и Famulor — менее 15%), forced escalation rate менее 10%, transfer success rate более 90%, CSAT отдельно по contained- и escalated-бакетам с разрывом не более 3 пунктов от базового уровня.
    • Красный флаг: этих метрик нет в отчётности. Containment без них накручивается тем, что клиента просто не выпускают к человеку.
  7. Что происходит, когда агент не знает ответа?
    • Хороший ответ: ответ строго по базе знаний (RAG), явное «не знаю» с переводом, guardrails на темы про деньги и обязательства, логирование таких случаев. В бенчмарке τ-bench (Sierra и Princeton, препринт arXiv:2406.12045) GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми прогонах одной и той же задачи pass^8 падает ниже 25%: модель может справиться, но не гарантирует одинакового результата. Цена галлюцинации бывает юридической — в деле Air Canada чат-бот сообщил несуществующую политику возврата, и суд обязал компанию исполнить обещанное ботом.
    • Красный флаг: «наша модель не галлюцинирует».
  8. Как агент ведёт себя при перебивании и в шуме?
    • Хороший ответ: barge-in и endpointing обсуждаются как настройка с компромиссом. Типичная отсечка конца реплики 200–400 мс: короткая перебивает думающего клиента, длинная делает паузы неестественными. В препринте FireRedChat (arXiv) это измеряют через время реакции на перебивание T90 и false barge-in rate — долю ложных срабатываний от шума и поддакиваний.
    • Красный флаг: тема не поднимается; демо записано в студийной тишине.
  9. Как именно считается счёт?
    • Хороший ответ: прозрачная модель — минуты, секунды, подписка или оплата за результат — плюс что входит в минуту (телефония, STT, LLM, TTS) и что тарифицируется отдельно. По оценке gravitel, скриптовые решения стоят 3–8 ₽/мин, LLM-агенты — 10–25 ₽/мин; у Zvonobot публично указано около 0,32 ₽/сек. Полная себестоимость минуты качественного AI-звонка по расчёту LPTracker — около 14,15 ₽. Детали в статье «Сколько стоит голосовой AI-агент».
    • Красный флаг: цена ниже себестоимости стека без объяснения, из чего она складывается; «всё включено» без тарифной сетки.
  10. Что входит в запуск, кто пишет сценарий и кому он принадлежит?
    • Хороший ответ: названы сроки, объём работ, кто отвечает за базу знаний, и что промпты, сценарии и записи остаются вашими при расставании.
    • Красный флаг: сценарий — «наше ноу-хау», выгрузка данных при уходе не предусмотрена.
  11. Какие интеграции с CRM и телефонией и на каком уровне?
    • Хороший ответ: конкретные коннекторы к вашей связке (Битрикс24, amoCRM, RetailCRM, 1С; Mango Office, UIS, Телфин, Asterisk, МТС Exolve) и различение «агент пишет в карточку в момент разговора» и «выгрузка постфактум файлом» — там, где важна скорость реакции, разница принципиальная.
    • Красный флаг: «интегрируемся с любой CRM через API» без примеров и сроков.
  12. Дайте два действующих клиента в моей отрасли, работающих дольше трёх месяцев.
    • Хороший ответ: контакты или живой референс-звонок; готовность обсуждать, что не получилось.
    • Красный флаг: только логотипы на сайте и кейсы возрастом в неделю. Air.ai вирусно взлетел на демо и не превратился в жизнеспособный продукт (по данным aiagents.wiki, дело дошло до урегулирования с FTC). Демо не равно продакшену.
HoReCa0:00
Это телефонная запись, а не браузерное демо: на такой и проверяются ответы на второй и восьмой вопросы — задержка и поведение при перебивании.

Таблица красных флагов

Красный флагЧто за ним обычно стоит
«До 80% решённых» без определенияСчитается deflection, а не resolution
Средняя латентность вместо P95Хвост задержек прячут; на линии будут паузы
Демо только в браузере, не по телефонуНе проверены узкая полоса телефонии, шум, эхо
Нет repeat contact rate и transfer successContainment невозможно проверить на честность
«Модель не ошибается и не выдумывает»Непонимание того, как работают LLM
Юрисдикция хранения записей не называетсяРиск по требованию локализации 152-ФЗ
Эскалация только по просьбе клиентаКлиента будут удерживать в диалоге ради метрики
Цена сильно ниже себестоимости стекаЭто скриптовый робот, а не LLM-агент
Сценарий и промпты не отдаются клиентуVendor lock при расставании
Референсы — только логотипыВнедрений в продакшене может не быть

Российская специфика: что спрашивать дополнительно

Здесь чек-лист расходится с американскими гайдами. По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских номеров и юрлиц ограничен. Прокси решает вопрос доступа, но добавляет задержку — а бюджет латентности и так меньше 500 мс — и создаёт юридические риски трансграничной передачи персональных данных.

Отсюда три дополнительных вопроса: через что вы получаете доступ к моделям, сколько добавляет прокси-хоп и что будет с сервисом, если канал закроется. Локальный стек — Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKit, GigaChat и YandexGPT, размещение в Yandex Cloud, VK Cloud или Cloud.ru — проигрывает в универсальности, но выигрывает в предсказуемости и легальности.

Уточните и маркировку звонков: с 1 сентября 2025 года юрлица обязаны передавать оператору связи название организации и категорию звонка (закон № 41-ФЗ, пункт 9.1 статьи 46 закона № 126-ФЗ «О связи», Постановление Правительства № 1300 от 28.08.2025). Спросите, поддерживает ли поставщик передачу этих данных.

По исследованию Just AI (публикация telesputnik), долю выручки более 5% на рынке разговорного ИИ имеют MTS Exolve, Ростелеком Контакт-центр, VS Robotics, BSS, Just AI, Twin24, Neuro.net, Zvonobot, Kvint.io, Tomoru; оценки объёма рынка расходятся в зависимости от учёта госзаказа. Сравнивать их имеет смысл по проверяемым признакам, а не по эпитетам: модель тарификации (посекундная, минутная, подписка, за результат), архитектура (жёсткий скрипт на интентах или контекстная LLM), где физически исполняются модели, есть ли платформа для самостоятельной сборки (Voximplant) и готовый коннектор в маркетплейсе вашей CRM (в Битрикс24 присутствуют, например, решения Tomoru и TWIN).

Как устроен честный пилот

Пилот — единственный способ получить свою цифру вместо чужой. Зафиксируйте до старта пять вещей.

  1. Определение успеха. Одно предложение, проверяемое по CRM. Написано до запуска, по ходу не меняется.
  2. Сегмент. Один тип обращений, а не «все звонки». Структурированные сценарии дают результат выше, чем сложные консультации, и смешивать их в одном замере бессмысленно.
  3. База сравнения. Как этот сегмент обрабатывается сейчас: скорость реакции, доля пропущенных, конверсия.
  4. Полный набор метрик. Не только containment, но и парные: repeat contact rate, forced escalation, transfer success, CSAT по бакетам. Плюс выборка записей, прослушанная руками, — метрики не показывают тон.
  5. Критерий остановки. При каком результате разворачиваете проект, при каком закрываете. Защита от пилота, который бесконечно «дорабатывается».

Разумный минимум по сроку — несколько недель на реальном потоке, а не два дня на тестовой базе. Вендоров сравнивают только на одинаковом сценарии, одинаковой базе знаний и одинаковом определении успеха.

Когда голосовой агент вам не нужен вообще

Честный ответ на вопрос «покупать ли» иногда «нет».

Мало звонков. Если поток — десяток звонков в день и администратор успевает их принимать, экономика не сойдётся: настройка и поддержка съедят выгоду. Порог считайте по своим цифрам, не по чужим кейсам.

Нет процесса, который агент мог бы исполнить. Без сценария разговора, актуального прайса и базы знаний агент унаследует беспорядок и озвучит его быстрее и громче. Сначала процесс, потом автоматизация.

Задача не звонковая. По данным CNews, 58% россиян ждут круглосуточной поддержки в мессенджерах, а 33% предпочли бы решать вопросы вообще без звонков. Иногда правильное решение — форма, личный кабинет или чат.

Деньги, споры и персональные ситуации. По данным CNews, ИИ доверяют информирование о статусе заказа (54%) и напоминания (50%), а доверие резко падает на задачах, связанных с деньгами и спорами. Агент первой линией на возвратах и претензиях ухудшит сервис.

Стратегия «заменить всех». По прогнозу Forrester (Predictions 2026), около 55% работодателей, сокративших персонал ради ИИ, сожалеют о решении, а примерно треть потратила на повторный найм больше, чем сэкономила. Как это выглядит на практике, разобрано в статье «Урок Klarna»: технология сработала на массовых простых обращениях, а полная замена без градуированной автономии обошлась падением CSAT.

Частые вопросы

Как понять, что вендор занимается agent washing?
Проверьте три вещи: может ли агент сам вызывать действия в ваших системах, что происходит при отклонении от сценария и как устроена эскалация. Если решение распознаёт интенты и зачитывает заготовленные ответы — это скриптовый робот: нормально для уведомлений, мало для диалога. По данным Gartner (пресс-релиз от 25.06.2025), из тысяч вендоров, называющих себя agentic, реально таковыми являются около 130.
Какой процент автоматизации считать нормальным?
Независимые оценки production-внедрений, которые приводит dragapp, дают 40–70%. На узких структурированных сценариях вроде записи на приём или статуса заказа — 70–90%. Цифры выше 80% на разнородном потоке требуют проверки: скорее всего, там считается не решение проблемы, а факт того, что звонок не ушёл к оператору.
Законно ли записывать разговоры с агентом в России?
Записи и транскрипты — персональные данные по 152-ФЗ с требованием локализации хранения в РФ. С 1 сентября 2025 года согласие оформляется отдельным документом (закон № 156-ФЗ от 24.06.2025), и с той же даты действует обязанность маркировать звонки юрлиц. Схему согласий стоит согласовать с юристом.
Обязательно ли предупреждать клиента, что говорит робот?
Прямого требования раскрывать это в российском законодательстве сейчас нет. Мировой тренд однозначен: в Калифорнии раскрытие обязательно с 1 января 2025 года (AB 2905). Честное представление в начале разговора снижает жалобы, а по данным Solar Staff 45% россиян хотят гарантированную возможность переключиться на человека.

Вывод

Выбор поставщика голосового агента — не сравнение процентов на лендингах, а проверка определений за этими процентами. Три вопроса отсеивают большую часть рынка: что считается решённым обращением, какая латентность в P95 и какие парные метрики есть в отчётности. Дальше — российские ограничения: где физически исполняются модели и где хранятся записи. Цифру всё равно даст только пилот на вашем потоке, а не чужой кейс.

Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.

Двенадцать вопросов проще задавать, услышав первый звонок

Введите адрес своего сайта — по нему бесплатно соберётся агент, и ему можно позвонить по обычной линии. Это своя точка отсчёта для тех демо, которые вам будут показывать поставщики.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.