Тысячи вендоров, 130 настоящих: куда идут голосовые AI-агенты
Что Gartner и регуляторы говорят о будущем голосовых AI-агентов: отсев вендоров, containment 40–70% и обязательное раскрытие ИИ в звонках.
Куда идут голосовые AI-агенты — на этот вопрос честнее отвечать чужими цифрами, чем собственными предчувствиями. Самая отрезвляющая принадлежит Gartner: в пресс-релизе от 25 июня 2025 года (аналитик Anushree Verma) сказано, что из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130. Остальное в том же релизе названо agent washing — переименованием обычной автоматизации в «агента».
Короткий ответ на вопрос заголовка: рынок будет расти и одновременно чиститься. Тот же Gartner прогнозирует отмену более 40% проектов agentic AI к концу 2027 года — из-за роста затрат, неясной бизнес-ценности и недостаточного контроля рисков. Это прогноз аналитического агентства, а не установленный факт. Но опирается он на разрыв, который виден уже сейчас: между тем, что показывают на демо, и тем, что получается в продакшене.
Ниже — три тренда с проверяемым основанием, таблица «что делать уже сейчас» и раздел о том, что из этого может не случиться.
Тренд 1: денег в рынке больше, выживших проектов меньше
По прогнозу расходов Gartner, рынок purpose-built AI agent software оценивается примерно в 86,4 млрд долларов в 2025 году, около 206,5 млрд в 2026 и около 376,3 млрд в 2027. Это иллюстрация темпа, а не гарантия: прогнозы расходов — самая часто пересматриваемая часть аналитики.
Рост бюджетов и отмена 40% проектов не противоречат друг другу. Деньги концентрируются там, где внедрение довели до измеримого результата, а слой «агентов», которые на деле остаются скриптовыми сценариями, отваливается. Для покупателя это значит одно: цена ошибки при выборе поставщика растёт. Список вопросов поставщику — способ отличить одного из 130 от agent washing.
По исследованию Just AI (публикация telesputnik), долю выручки более 5% на российском рынке разговорного ИИ держат MTS Exolve, Ростелеком Контакт-центр, VS Robotics, BSS, Just AI, Twin24, Neuro.net, Zvonobot, Kvint.io и Tomoru. Оценки объёма рынка сильно расходятся в зависимости от того, учитывается ли госзаказ, — сопоставлять их с мировыми цифрами Gartner напрямую нельзя.
Тренд 2: рутина уходит к агентам, функция — нет
Самый живучий миф о будущем: «ИИ заменит операторов уже завтра». Планировать по нему нельзя. Прогноз Gartner про отмену 40% проектов — первый контр-аргумент. Второй: независимые оценки production-внедрений (dragapp) дают containment 40–70%, а не 100%. Вендорские заявления о 60–90% остаются заявлениями вендоров.
Рынок движется не к замене первой линии, а к её расслоению. Структурированные транзакционные интенты (статус заказа, запись, напоминание) закрываются автоматически с containment 70–90%, сложное и эмоциональное уходит человеку через эскалацию. Что при этом происходит с ролями в контакт-центре — в отдельной статье.
Куда идут голосовые AI-агенты технологически: каскад или speech-to-speech
Сегодня большинство решений — каскад: STT распознаёт речь, LLM думает, TTS синтезирует ответ. По разложению задержки на слои (Coval, Hamming) это STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс плюс сеть и телефония; неоптимизированный каскад суммарно укладывается в 670–3200 мс. Порог, за которым собеседник перестаёт слышать робота, — примерно 500 мс P95.
Альтернатива — native speech-to-speech, где модель работает с речью напрямую, без промежуточного текста. Вендоры таких моделей заявляют менее 180 мс против 450–650 мс у каскада. Это вендорское заявление, а не независимый замер, и в нём обычно не описано, что именно измерялось. Направление при этом реальное: убрать лишние преобразования — очевидный способ выиграть задержку.
Ждать новую архитектуру, впрочем, необязательно. Оптимизированный каскад уже укладывается в приемлемый диапазон, а speech-to-speech проигрывает в контроле: промежуточный текст — это то, за что цепляются guardrails, логи и проверка фактов.
Тренд 3: раскрытие «я робот» становится обязательным по закону
Мировой регуляторный вектор однозначен. California AB 2905 с 1 января 2025 года требует раскрывать использование ИИ-голоса в звонках. California BOT Act (SB 1001) действует с 2019 года и запрещает боту вводить собеседника в заблуждение относительно своей природы. FCC приравняла ИИ-сгенерированные голоса к robocalls в рамках TCPA. Texas TRAIGA вступает в силу 1 января 2026 года. EU AI Act добавляет требования прозрачности, а голос там пересекается с биометрией и GDPR.
Прямого требования раскрывать факт общения с ботом в российском законодательстве сейчас нет — это факт, а не прогноз. Прогноз здесь мой, а не Gartner: Россия к похожей норме, вероятно, придёт, и готовиться разумно заранее — тем более что честное представление агента и так снижает жалобы. Подробнее — нужно ли говорить, что это бот. Смежный и уже действующий блок требований — записи разговоров по 152-ФЗ.
Тренд — основание — что делать бизнесу уже сейчас
| Тренд | На чём основан | Что делать уже сейчас |
|---|---|---|
| Отсев вендоров | Gartner, 25.06.2025: около 130 реальных agentic-вендоров, более 40% проектов отменят к концу 2027 | Проверять поставщика по фактам, а не по демо: пилот на своих данных, свой критерий успеха |
| Расслоение первой линии | Независимые оценки production: containment 40–70%; на транзакционных интентах 70–90% | Отдать агенту структурированные сценарии, спроектировать эскалацию, а не полную замену |
| Снижение задержки | Разложение латентности по слоям (Coval, Hamming); заявления вендоров speech-to-speech | Замерять задержку на своей телефонии, а не в демо-стенде вендора |
| Обязательное раскрытие ИИ | AB 2905, BOT Act, FCC/TCPA, Texas TRAIGA, EU AI Act | Ввести честное представление агента сейчас, пока это добровольно |
Ограничения: чему из этого нельзя верить буквально
Прогнозы расходов — не деньги, а модель. Цифры Gartner в 86,4 / 206,5 / 376,3 млрд долларов означают ожидаемый темп, и пересматриваются такие модели ежегодно. Подставлять их в собственный бизнес-план нельзя. «Более 40% отменённых проектов» — тоже прогноз, а не наблюдение, и ошибиться он может в обе стороны.
Регуляторный тренд может не дойти до России в описанном виде или прийти в другой форме — через маркировку звонков и правила о рекламе, а не через отдельную норму о раскрытии ИИ. Сдвиг к speech-to-speech может остаться нишевым: в телефонии узкая полоса и шум бьют по качеству сильнее, чем архитектура.
Главное ограничение жанра: всё перечисленное — про рынок в целом. Ваш конкретный сценарий может вести себя иначе, и единственный честный предиктор для него — пилот на своей базе.
Частые вопросы
Какое будущее у голосовых AI-агентов в ближайшие 2–3 года
Правда ли, что настоящих agentic-вендоров всего около 130
Обязан ли бизнес в России предупреждать, что звонит робот
Стоит ли ждать speech-to-speech вместо привычного каскада STT-LLM-TTS
Что из этого следует
Будущее голосовых AI-агентов — это не вопрос «заменят или нет», а вопрос отбора. Растущие бюджеты и массовые отмены проектов будут идти одновременно, и решать будет не архитектура, а способность показать результат на конкретных сценариях. Требование раскрывать ИИ дойдёт до вас раньше, чем новая модель, и подготовить его дешевле сейчас. Всё остальное здесь — прогнозы, и помечены они так намеренно.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.
