Год назад это было игрушкой: голосовые ИИ-агенты в 2026
Голосовые ИИ-агенты 2026: прогнозы Gartner, латентность speech-to-speech, отсев вендоров и данные НАФИ о том, почему доверие за год снизилось.
Голосовые ИИ-агенты в 2026 году изменились не так, как год назад обещали лендинги. «Умнее» и «человечнее» — это не то, что видно по данным. Видно другое: рынок вырос в деньгах, задержка ответа сократилась, состав поставщиков начал чиститься, а отношение людей к разговору с машиной за год стало хуже.
Короткий ответ на вопрос заголовка такой. По данным НАФИ (опрос августа 2025 года, выборка 6213 человек), 88% россиян уже сталкивались с ИИ-ассистентами, при этом доля позитивных оценок составила 33% против 37% годом ранее. Опыта стало больше, удовольствия от него — меньше. Технический прогресс за тот же год реален, но он ушёл в места, которых клиент не видит: скорость реакции, устойчивость сценария, разбор записей.
Ниже — три изменения с названными источниками, таблица прогнозов с пометкой, что это именно прогнозы, и раздел о том, что из них может не сбыться.
Голосовые ИИ-агенты 2026: деньги растут, проекты отменяются
По прогнозу расходов Gartner, рынок purpose-built AI agent software оценивается примерно в 86,4 млрд долларов в 2025 году, около 206,5 млрд в 2026 и около 376,3 млрд в 2027. Это модель темпа роста, а не факт и не гарантия: прогнозы расходов пересматриваются ежегодно, и подставлять их в собственный бизнес-план нельзя.
Рядом стоит вторая цифра того же агентства. В пресс-релизе Gartner от 25 июня 2025 года (аналитик Anushree Verma) сказано, что более 40% проектов agentic AI будут отменены к концу 2027 года — из-за роста затрат, неясной бизнес-ценности и недостаточного контроля рисков. Там же: из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130, остальное аналитики называют agent washing.
Эти два прогноза не спорят друг с другом. Деньги идут туда, где внедрение довели до измеримого результата, а слой «агентов», которые на деле остаются скриптовыми сценариями, отваливается. За год это поменяло для покупателя ровно одну вещь — цену ошибки при выборе поставщика. Общая картина рынка и его развилки разобраны в статье куда идут голосовые AI-агенты, а из чего складывается ценник — в материале про стоимость голосового AI-агента.
Оценки объёма российского рынка разговорного ИИ при этом сильно расходятся в зависимости от того, учитывается ли госзаказ (исследование Just AI, публикация telesputnik). Сопоставлять их с мировыми цифрами Gartner напрямую некорректно.
Задержка: speech-to-speech обещает 180 мс, каскад уже укладывается
Второе изменение — техническое и самое заметное на слух. Ориентир естественности разговора — задержка менее 500 мс по P95: до 300 мс воспринимается отлично, 300–600 мс приемлемо, свыше секунды собеседник слышит робота.
Сегодняшняя массовая архитектура — каскад: распознавание речи, языковая модель, синтез. По разложению задержки на слои (замеры Coval и Hamming) это STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс плюс сеть и телефония; неоптимизированный каскад суммарно даёт 670–3200 мс. Год назад разговор об этом был теоретическим, сейчас оптимизированный каскад в приемлемый порог укладывается.
Альтернатива — native speech-to-speech, где модель работает с речью напрямую, без промежуточного текста. Вендоры таких моделей заявляют менее 180 мс против 450–650 мс у каскада. Это вендорское заявление, а не независимый замер: что именно измерялось, в таких публикациях обычно не описано. И у архитектуры есть цена — промежуточный текст это то, за что цепляются guardrails, логи и проверка фактов. Подробный разбор бюджета задержки — в статье про латентность голосового агента.
Практический вывод за год не изменился: замерять задержку нужно на своей телефонии и своём канале, а не на демо-стенде вендора.
Люди: 88% сталкивались, доволен каждый третий
Третье изменение — единственное, которое пошло против ожиданий рынка. Помимо падения позитивных оценок с 37% до 33%, тот же опрос НАФИ показывает, что 57% россиян не отличают бота от человека в разговоре. То есть технически маскировка уже работает, а доверие при этом снижается.
Что хотят люди, видно из смежных опросов. По данным Solar Staff, 33% против полной замены поддержки на ИИ, 45% хотят гарантированную возможность переключиться на человека, 83% предпочитают гибридную модель. По данным МТТ, 65% раздражает навязчивость роботизированных звонков. По данным CNews, 49% предпочитают общение с человеком.
Здесь же ломается расхожий миф, что «голосовые роботы всегда бесят». Раздражает не факт автоматизации, а бесполезный навязчивый звонок без внятного повода — иначе цифра НАФИ про 57% неразличимости была бы невозможна. Вывод для 2026 года получается неудобный для маркетинга: конкурентное преимущество лежит не в маскировке под человека, а в честном представлении плюс мгновенной эскалации. Почему клиенты кладут трубку — разобрано отдельно; о том, стоит ли называть себя роботом, — в этой статье.
Чего ждать дальше: три прогноза и на чём они стоят
| Прогноз | Кто и когда сказал | Статус |
|---|---|---|
| Более 40% проектов agentic AI отменят к концу 2027 года | Gartner, пресс-релиз от 25.06.2025 | Прогноз аналитического агентства, не наблюдение |
| Раскрытие факта общения с ИИ станет обязательным | Действующие нормы: California AB 2905 с 01.01.2025, BOT Act, FCC/TCPA, Texas TRAIGA с 01.01.2026, EU AI Act | За рубежом — факт; для России — предположение, прямой нормы нет |
| Сокращения ради ИИ будут откатываться назад | Forrester, Predictions 2026: около 55% работодателей сожалеют, примерно треть потратила на повторный найм больше сэкономленного | Опрос плюс прогноз; явление названо layoff boomerang |
Для России ближайшее по срокам — не раскрытие ИИ, а уже действующая с 1 сентября 2025 года маркировка звонков: юрлицо передаёт оператору связи название организации и категорию звонка. Что происходит с людьми в контакт-центре при переносе рутины на агента — в статье про то, что будет с операторами.
Что из этого может не сбыться
Прогноз про 40% отменённых проектов может ошибиться в обе стороны — это модель, а не замер. Прогнозы расходов пересматриваются чаще всего.
Способности агентов легко переоценить по демо. Независимые оценки production-внедрений (dragapp) дают containment 40–70%, тогда как вендорские заявления держатся на уровне 60–90%. Отдельно про устойчивость: препринт τ-bench (Sierra и Принстон, arXiv:2406.12045) показывает, что GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи pass^8 падает ниже 25%. Практический смысл в том, что агент может справиться, но не гарантирует одинакового результата каждый раз — поэтому нужны guardrails, тесты и эскалация, а не вера в очередную версию модели.
Регуляторный сценарий тоже может пойти иначе: в России тема раскрытия ИИ способна прийти не отдельной нормой, а через правила о рекламе и маркировку звонков. И главное ограничение жанра: всё перечисленное описывает рынок, а не ваш сценарий. Единственный честный предиктор для конкретного бизнеса — пилот на своей базе со своим определением успеха.
Частые вопросы
Что изменилось у голосовых ИИ-агентов в 2026 году
Стали ли голосовые агенты неотличимы от человека
Пора ли переходить на speech-to-speech вместо каскада STT-LLM-TTS
Какой containment реально ожидать от голосового агента
Вывод
Год для голосовых ИИ-агентов получился асимметричным: техника подтянулась, а доверие просело. Деньги в рынок идут, и одновременно Gartner ждёт отмены более 40% проектов — это не противоречие, а описание отсева. Задержка перестала быть главным ограничением, и на первый план вышли вещи скучнее: определение успеха, эскалация, разбор записей. Всё, что в этой статье названо прогнозом, прогнозом и остаётся. Если хотите проверить состояние технологии на своих звонках — можно собрать демо на вашем сценарии и послушать, как это звучит сейчас.
