Как выбрать голосового AI-агента: 12 неудобных вопросов
Как выбрать голосового AI-агента: 12 вопросов поставщику, красные флаги, честные метрики вместо процентов с лендинга и правила пилота.
Как выбрать голосового AI-агента, если все лендинги выглядят одинаково: та же фраза про «человеческий голос», тот же процент автоматизации, та же обещанная окупаемость. Короткий ответ: не по презентации, а по ответам на неудобные вопросы. Демо в тишине проходят все. Разваливаются решения позже — на шумной телефонной линии, на клиенте, который перебивает, на передаче разговора человеку и на счёте за месяц.
Ниже — 12 вопросов поставщику до подписания договора: какой ответ считать нормальным, а какой — поводом насторожиться. Плюс честный пилот, российская специфика и ситуации, когда голосовой агент не нужен вообще.
Один ориентир для калибровки ожиданий. По данным пресс-релиза Gartner от 25 июня 2025 года (аналитик Anushree Verma), из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130 — остальное аналитики называют agent washing, маркетинговым переименованием обычной автоматизации в «агента». Куда рынок движется дальше и почему отсев вендоров только начинается — в разборе трендов. Там же Gartner прогнозирует отмену более 40% проектов agentic AI к концу 2027 года из-за роста затрат и неясной бизнес-ценности. Шанс купить не то, за что вы платите, — не паранойя, а базовый сценарий.
Почему цифре с лендинга нельзя верить
Самая частая цифра в отрасли — процент решённых обращений: «до 80%», «до 90%», «70–75%». Проблема не в том, что вендоры врут, а в том, что почти никто не пишет, что считается решённым. Как смотреть демо, чтобы оно что-то доказывало, разобрано здесь.
Если «решённым» считается любой разговор, который не переключили на оператора, то клиент, бросивший трубку от раздражения, попадает в успешную статистику. Это deflection — отвод обращения из очереди, — а не resolution.
Ориентиры выглядят так. Классический DTMF-IVR закрывает без человека 5–10% обращений, conversational IVR — 10–15%. Вендоры agentic-решений заявляют 60–90% (например, Teneo). Независимые оценки реальных production-внедрений, которые приводит dragapp, дают 40–70%. На узких структурированных сценариях — статус заказа, запись на приём, напоминание — планка выше, 70–90%.
Это и есть развенчание мифа «вендорские 80–90% — это то, что получу я». 40–70% — не средняя цифра, а диапазон: где вы окажетесь внутри него, зависит от типа обращений, качества базы знаний и того, насколько узко поставлена задача. Единственный честный предиктор — пилот на ваших данных по вашему определению успеха.
«До 80%» — верхняя граница лучшего наблюдавшегося результата, а не ваш ожидаемый. Просите не процент, а определение: что засчитывалось как успех и на каком объёме звонков.
Как выбрать голосового AI-агента: сначала определение успеха, потом вендор
Прежде чем сравнивать поставщиков, зафиксируйте на бумаге, что для вас значит «работает» — так, чтобы это проверялось по логам и выгрузке из CRM.
Плохо: «агент обрабатывает входящие». Хорошо: «из 100 входящих в нерабочее время не менее N заканчиваются записанной в CRM заявкой с валидным телефоном и датой визита, и не более 15% этих клиентов перезванивают по тому же вопросу в течение 72 часов».
Второе — определитесь, какая технология нужна. Скриптовый робот обзвона и контекстный LLM-агент решают разные задачи: для уведомления «ваш заказ приехал» достаточно первого, для квалификации лида с возражениями — нет. Разбор различий есть в статье «Голосовой AI-агент и робот обзвона: в чём разница». Если вам нужен обзвон-уведомление, платить за LLM-агента незачем.
12 вопросов поставщику
- Что именно вы считаете решённым обращением?
- Хороший ответ: письменное определение — какие исходы засчитываются, как обрабатывается брошенный звонок, кто и на каком объёме мерил.
- Красный флаг: «до 80%» без определения, отказ показать методику, подмена resolution на deflection.
- Какая у вас латентность и как вы её измеряете?
- Хороший ответ: цифра в P95, а не «в среднем», с разложением по слоям. Ориентир естественности диалога — менее 500 мс P95; менее 300 мс воспринимается отлично, 300–600 мс приемлемо, свыше секунды собеседник опознаёт робота. По разложению Coval и Hamming: STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс, плюс сеть и телефония — каскадная система без оптимизации даёт 670–3200 мс.
- Красный флаг: «мгновенно», «как человек», средняя задержка вместо перцентиля, замер на веб-демо вместо телефонной линии.
- Какая архитектура, какие модели и где они физически работают?
- Хороший ответ: конкретно — каскад STT→LLM→TTS или native speech-to-speech, названия моделей, регион размещения. Заявленные вендорами менее 180 мс у speech-to-speech против 450–650 мс у каскада проверяются на своём канале.
- Красный флаг: «наша проприетарная нейросеть» без деталей, отказ назвать провайдеров STT и TTS.
- Где хранятся записи и транскрипты и как оформляется согласие?
- Хороший ответ: серверы в РФ, названный хостинг, готовность подписать поручение на обработку. Записи и транскрипты — персональные данные по 152-ФЗ с требованием локализации. С 1 сентября 2025 года (закон № 156-ФЗ от 24.06.2025) согласие оформляется отдельным документом, а не строкой в пользовательском соглашении. Подробнее — в статье «152-ФЗ и запись разговоров».
- Красный флаг: «данные в облаке, всё безопасно» без указания юрисдикции; предложение обойти согласие.
- Как устроена эскалация на человека?
- Хороший ответ: передача по низкой уверенности модели и по стоп-словам, перенос контекста оператору, понятное поведение в нерабочее время, гарантированный выход на человека по требованию клиента. По данным Solar Staff, 45% россиян хотят такую возможность, 83% предпочитают гибридную модель.
- Красный флаг: «агент справляется сам», эскалация только по явной фразе клиента, потеря контекста при переводе.
- Покажите парные метрики, а не только containment.
- Хороший ответ: repeat contact rate за 72 часа (ориентир Balto и Famulor — менее 15%), forced escalation rate менее 10%, transfer success rate более 90%, CSAT отдельно по contained- и escalated-бакетам с разрывом не более 3 пунктов от базового уровня.
- Красный флаг: этих метрик нет в отчётности. Containment без них накручивается тем, что клиента просто не выпускают к человеку.
- Что происходит, когда агент не знает ответа?
- Хороший ответ: ответ строго по базе знаний (RAG), явное «не знаю» с переводом, guardrails на темы про деньги и обязательства, логирование таких случаев. В бенчмарке τ-bench (Sierra и Princeton, препринт arXiv:2406.12045) GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми прогонах одной и той же задачи pass^8 падает ниже 25%: модель может справиться, но не гарантирует одинакового результата. Цена галлюцинации бывает юридической — в деле Air Canada чат-бот сообщил несуществующую политику возврата, и суд обязал компанию исполнить обещанное ботом.
- Красный флаг: «наша модель не галлюцинирует».
- Как агент ведёт себя при перебивании и в шуме?
- Хороший ответ: barge-in и endpointing обсуждаются как настройка с компромиссом. Типичная отсечка конца реплики 200–400 мс: короткая перебивает думающего клиента, длинная делает паузы неестественными. В препринте FireRedChat (arXiv) это измеряют через время реакции на перебивание T90 и false barge-in rate — долю ложных срабатываний от шума и поддакиваний.
- Красный флаг: тема не поднимается; демо записано в студийной тишине.
- Как именно считается счёт?
- Хороший ответ: прозрачная модель — минуты, секунды, подписка или оплата за результат — плюс что входит в минуту (телефония, STT, LLM, TTS) и что тарифицируется отдельно. По оценке gravitel, скриптовые решения стоят 3–8 ₽/мин, LLM-агенты — 10–25 ₽/мин; у Zvonobot публично указано около 0,32 ₽/сек. Полная себестоимость минуты качественного AI-звонка по расчёту LPTracker — около 14,15 ₽. Детали в статье «Сколько стоит голосовой AI-агент».
- Красный флаг: цена ниже себестоимости стека без объяснения, из чего она складывается; «всё включено» без тарифной сетки.
- Что входит в запуск, кто пишет сценарий и кому он принадлежит?
- Хороший ответ: названы сроки, объём работ, кто отвечает за базу знаний, и что промпты, сценарии и записи остаются вашими при расставании.
- Красный флаг: сценарий — «наше ноу-хау», выгрузка данных при уходе не предусмотрена.
- Какие интеграции с CRM и телефонией и на каком уровне?
- Хороший ответ: конкретные коннекторы к вашей связке (Битрикс24, amoCRM, RetailCRM, 1С; Mango Office, UIS, Телфин, Asterisk, МТС Exolve) и различение «агент пишет в карточку в момент разговора» и «выгрузка постфактум файлом» — там, где важна скорость реакции, разница принципиальная.
- Красный флаг: «интегрируемся с любой CRM через API» без примеров и сроков.
- Дайте два действующих клиента в моей отрасли, работающих дольше трёх месяцев.
- Хороший ответ: контакты или живой референс-звонок; готовность обсуждать, что не получилось.
- Красный флаг: только логотипы на сайте и кейсы возрастом в неделю. Air.ai вирусно взлетел на демо и не превратился в жизнеспособный продукт (по данным aiagents.wiki, дело дошло до урегулирования с FTC). Демо не равно продакшену.
Таблица красных флагов
| Красный флаг | Что за ним обычно стоит |
|---|---|
| «До 80% решённых» без определения | Считается deflection, а не resolution |
| Средняя латентность вместо P95 | Хвост задержек прячут; на линии будут паузы |
| Демо только в браузере, не по телефону | Не проверены узкая полоса телефонии, шум, эхо |
| Нет repeat contact rate и transfer success | Containment невозможно проверить на честность |
| «Модель не ошибается и не выдумывает» | Непонимание того, как работают LLM |
| Юрисдикция хранения записей не называется | Риск по требованию локализации 152-ФЗ |
| Эскалация только по просьбе клиента | Клиента будут удерживать в диалоге ради метрики |
| Цена сильно ниже себестоимости стека | Это скриптовый робот, а не LLM-агент |
| Сценарий и промпты не отдаются клиенту | Vendor lock при расставании |
| Референсы — только логотипы | Внедрений в продакшене может не быть |
Российская специфика: что спрашивать дополнительно
Здесь чек-лист расходится с американскими гайдами. По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских номеров и юрлиц ограничен. Прокси решает вопрос доступа, но добавляет задержку — а бюджет латентности и так меньше 500 мс — и создаёт юридические риски трансграничной передачи персональных данных.
Отсюда три дополнительных вопроса: через что вы получаете доступ к моделям, сколько добавляет прокси-хоп и что будет с сервисом, если канал закроется. Локальный стек — Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKit, GigaChat и YandexGPT, размещение в Yandex Cloud, VK Cloud или Cloud.ru — проигрывает в универсальности, но выигрывает в предсказуемости и легальности.
Уточните и маркировку звонков: с 1 сентября 2025 года юрлица обязаны передавать оператору связи название организации и категорию звонка (закон № 41-ФЗ, пункт 9.1 статьи 46 закона № 126-ФЗ «О связи», Постановление Правительства № 1300 от 28.08.2025). Спросите, поддерживает ли поставщик передачу этих данных.
По исследованию Just AI (публикация telesputnik), долю выручки более 5% на рынке разговорного ИИ имеют MTS Exolve, Ростелеком Контакт-центр, VS Robotics, BSS, Just AI, Twin24, Neuro.net, Zvonobot, Kvint.io, Tomoru; оценки объёма рынка расходятся в зависимости от учёта госзаказа. Сравнивать их имеет смысл по проверяемым признакам, а не по эпитетам: модель тарификации (посекундная, минутная, подписка, за результат), архитектура (жёсткий скрипт на интентах или контекстная LLM), где физически исполняются модели, есть ли платформа для самостоятельной сборки (Voximplant) и готовый коннектор в маркетплейсе вашей CRM (в Битрикс24 присутствуют, например, решения Tomoru и TWIN).
Как устроен честный пилот
Пилот — единственный способ получить свою цифру вместо чужой. Зафиксируйте до старта пять вещей.
- Определение успеха. Одно предложение, проверяемое по CRM. Написано до запуска, по ходу не меняется.
- Сегмент. Один тип обращений, а не «все звонки». Структурированные сценарии дают результат выше, чем сложные консультации, и смешивать их в одном замере бессмысленно.
- База сравнения. Как этот сегмент обрабатывается сейчас: скорость реакции, доля пропущенных, конверсия.
- Полный набор метрик. Не только containment, но и парные: repeat contact rate, forced escalation, transfer success, CSAT по бакетам. Плюс выборка записей, прослушанная руками, — метрики не показывают тон.
- Критерий остановки. При каком результате разворачиваете проект, при каком закрываете. Защита от пилота, который бесконечно «дорабатывается».
Разумный минимум по сроку — несколько недель на реальном потоке, а не два дня на тестовой базе. Вендоров сравнивают только на одинаковом сценарии, одинаковой базе знаний и одинаковом определении успеха.
Когда голосовой агент вам не нужен вообще
Честный ответ на вопрос «покупать ли» иногда «нет».
Мало звонков. Если поток — десяток звонков в день и администратор успевает их принимать, экономика не сойдётся: настройка и поддержка съедят выгоду. Порог считайте по своим цифрам, не по чужим кейсам.
Нет процесса, который агент мог бы исполнить. Без сценария разговора, актуального прайса и базы знаний агент унаследует беспорядок и озвучит его быстрее и громче. Сначала процесс, потом автоматизация.
Задача не звонковая. По данным CNews, 58% россиян ждут круглосуточной поддержки в мессенджерах, а 33% предпочли бы решать вопросы вообще без звонков. Иногда правильное решение — форма, личный кабинет или чат.
Деньги, споры и персональные ситуации. По данным CNews, ИИ доверяют информирование о статусе заказа (54%) и напоминания (50%), а доверие резко падает на задачах, связанных с деньгами и спорами. Агент первой линией на возвратах и претензиях ухудшит сервис.
Стратегия «заменить всех». По прогнозу Forrester (Predictions 2026), около 55% работодателей, сокративших персонал ради ИИ, сожалеют о решении, а примерно треть потратила на повторный найм больше, чем сэкономила. Как это выглядит на практике, разобрано в статье «Урок Klarna»: технология сработала на массовых простых обращениях, а полная замена без градуированной автономии обошлась падением CSAT.
Частые вопросы
Как понять, что вендор занимается agent washing?
Какой процент автоматизации считать нормальным?
Законно ли записывать разговоры с агентом в России?
Обязательно ли предупреждать клиента, что говорит робот?
Вывод
Выбор поставщика голосового агента — не сравнение процентов на лендингах, а проверка определений за этими процентами. Три вопроса отсеивают большую часть рынка: что считается решённым обращением, какая латентность в P95 и какие парные метрики есть в отчётности. Дальше — российские ограничения: где физически исполняются модели и где хранятся записи. Цифру всё равно даст только пилот на вашем потоке, а не чужой кейс.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.
