реплика

Год назад это было игрушкой: голосовые ИИ-агенты в 2026

Голосовые ИИ-агенты 2026: прогнозы Gartner, латентность speech-to-speech, отсев вендоров и данные НАФИ о том, почему доверие за год снизилось.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·20 сентября 2026·7 минут чтения

Голосовые ИИ-агенты в 2026 году изменились не так, как год назад обещали лендинги. «Умнее» и «человечнее» — это не то, что видно по данным. Видно другое: рынок вырос в деньгах, задержка ответа сократилась, состав поставщиков начал чиститься, а отношение людей к разговору с машиной за год стало хуже.

Короткий ответ на вопрос заголовка такой. По данным НАФИ (опрос августа 2025 года, выборка 6213 человек), 88% россиян уже сталкивались с ИИ-ассистентами, при этом доля позитивных оценок составила 33% против 37% годом ранее. Опыта стало больше, удовольствия от него — меньше. Технический прогресс за тот же год реален, но он ушёл в места, которых клиент не видит: скорость реакции, устойчивость сценария, разбор записей.

Ниже — три изменения с названными источниками, таблица прогнозов с пометкой, что это именно прогнозы, и раздел о том, что из них может не сбыться.

Голосовые ИИ-агенты 2026: деньги растут, проекты отменяются

По прогнозу расходов Gartner, рынок purpose-built AI agent software оценивается примерно в 86,4 млрд долларов в 2025 году, около 206,5 млрд в 2026 и около 376,3 млрд в 2027. Это модель темпа роста, а не факт и не гарантия: прогнозы расходов пересматриваются ежегодно, и подставлять их в собственный бизнес-план нельзя.

Рядом стоит вторая цифра того же агентства. В пресс-релизе Gartner от 25 июня 2025 года (аналитик Anushree Verma) сказано, что более 40% проектов agentic AI будут отменены к концу 2027 года — из-за роста затрат, неясной бизнес-ценности и недостаточного контроля рисков. Там же: из тысяч вендоров, называющих себя agentic, реально таковыми являются лишь около 130, остальное аналитики называют agent washing.

Эти два прогноза не спорят друг с другом. Деньги идут туда, где внедрение довели до измеримого результата, а слой «агентов», которые на деле остаются скриптовыми сценариями, отваливается. За год это поменяло для покупателя ровно одну вещь — цену ошибки при выборе поставщика. Общая картина рынка и его развилки разобраны в статье куда идут голосовые AI-агенты, а из чего складывается ценник — в материале про стоимость голосового AI-агента.

Оценки объёма российского рынка разговорного ИИ при этом сильно расходятся в зависимости от того, учитывается ли госзаказ (исследование Just AI, публикация telesputnik). Сопоставлять их с мировыми цифрами Gartner напрямую некорректно.

Задержка: speech-to-speech обещает 180 мс, каскад уже укладывается

Второе изменение — техническое и самое заметное на слух. Ориентир естественности разговора — задержка менее 500 мс по P95: до 300 мс воспринимается отлично, 300–600 мс приемлемо, свыше секунды собеседник слышит робота.

Сегодняшняя массовая архитектура — каскад: распознавание речи, языковая модель, синтез. По разложению задержки на слои (замеры Coval и Hamming) это STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс плюс сеть и телефония; неоптимизированный каскад суммарно даёт 670–3200 мс. Год назад разговор об этом был теоретическим, сейчас оптимизированный каскад в приемлемый порог укладывается.

Альтернатива — native speech-to-speech, где модель работает с речью напрямую, без промежуточного текста. Вендоры таких моделей заявляют менее 180 мс против 450–650 мс у каскада. Это вендорское заявление, а не независимый замер: что именно измерялось, в таких публикациях обычно не описано. И у архитектуры есть цена — промежуточный текст это то, за что цепляются guardrails, логи и проверка фактов. Подробный разбор бюджета задержки — в статье про латентность голосового агента.

Практический вывод за год не изменился: замерять задержку нужно на своей телефонии и своём канале, а не на демо-стенде вендора.

Люди: 88% сталкивались, доволен каждый третий

Третье изменение — единственное, которое пошло против ожиданий рынка. Помимо падения позитивных оценок с 37% до 33%, тот же опрос НАФИ показывает, что 57% россиян не отличают бота от человека в разговоре. То есть технически маскировка уже работает, а доверие при этом снижается.

Что хотят люди, видно из смежных опросов. По данным Solar Staff, 33% против полной замены поддержки на ИИ, 45% хотят гарантированную возможность переключиться на человека, 83% предпочитают гибридную модель. По данным МТТ, 65% раздражает навязчивость роботизированных звонков. По данным CNews, 49% предпочитают общение с человеком.

Здесь же ломается расхожий миф, что «голосовые роботы всегда бесят». Раздражает не факт автоматизации, а бесполезный навязчивый звонок без внятного повода — иначе цифра НАФИ про 57% неразличимости была бы невозможна. Вывод для 2026 года получается неудобный для маркетинга: конкурентное преимущество лежит не в маскировке под человека, а в честном представлении плюс мгновенной эскалации. Почему клиенты кладут трубку — разобрано отдельно; о том, стоит ли называть себя роботом, — в этой статье.

Образование0:00
Разговор на пять минут: клиент сравнивает три магистерские программы, спрашивает про требования по математике и английскому, а потом, уже попрощавшись, возвращается с вопросом о цене — и получает 280 000 и 310 000 ₽ за семестр, а не «до свидания».

Чего ждать дальше: три прогноза и на чём они стоят

ПрогнозКто и когда сказалСтатус
Более 40% проектов agentic AI отменят к концу 2027 годаGartner, пресс-релиз от 25.06.2025Прогноз аналитического агентства, не наблюдение
Раскрытие факта общения с ИИ станет обязательнымДействующие нормы: California AB 2905 с 01.01.2025, BOT Act, FCC/TCPA, Texas TRAIGA с 01.01.2026, EU AI ActЗа рубежом — факт; для России — предположение, прямой нормы нет
Сокращения ради ИИ будут откатываться назадForrester, Predictions 2026: около 55% работодателей сожалеют, примерно треть потратила на повторный найм больше сэкономленногоОпрос плюс прогноз; явление названо layoff boomerang

Для России ближайшее по срокам — не раскрытие ИИ, а уже действующая с 1 сентября 2025 года маркировка звонков: юрлицо передаёт оператору связи название организации и категорию звонка. Что происходит с людьми в контакт-центре при переносе рутины на агента — в статье про то, что будет с операторами.

Что из этого может не сбыться

Прогноз про 40% отменённых проектов может ошибиться в обе стороны — это модель, а не замер. Прогнозы расходов пересматриваются чаще всего.

Способности агентов легко переоценить по демо. Независимые оценки production-внедрений (dragapp) дают containment 40–70%, тогда как вендорские заявления держатся на уровне 60–90%. Отдельно про устойчивость: препринт τ-bench (Sierra и Принстон, arXiv:2406.12045) показывает, что GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи pass^8 падает ниже 25%. Практический смысл в том, что агент может справиться, но не гарантирует одинакового результата каждый раз — поэтому нужны guardrails, тесты и эскалация, а не вера в очередную версию модели.

Регуляторный сценарий тоже может пойти иначе: в России тема раскрытия ИИ способна прийти не отдельной нормой, а через правила о рекламе и маркировку звонков. И главное ограничение жанра: всё перечисленное описывает рынок, а не ваш сценарий. Единственный честный предиктор для конкретного бизнеса — пилот на своей базе со своим определением успеха.

Частые вопросы

Что изменилось у голосовых ИИ-агентов в 2026 году
Три вещи с названными источниками: прогнозируемые расходы на agentic-решения выросли (Gartner: около 86,4 млрд долларов в 2025 году и около 206,5 млрд в 2026), задержка у оптимизированных решений опустилась в приемлемый диапазон менее 500 мс P95, а доля позитивных оценок ИИ-ассистентов у россиян снизилась с 37% до 33% (НАФИ, август 2025, выборка 6213 человек).
Стали ли голосовые агенты неотличимы от человека
По данным НАФИ, 57% россиян не отличают бота от человека в разговоре. Но это не преимущество, на которое стоит опираться: 45% опрошенных Solar Staff хотят гарантированную возможность переключиться на человека, а доля позитивных оценок за год снизилась. Работает честное представление агента плюс быстрая эскалация.
Пора ли переходить на speech-to-speech вместо каскада STT-LLM-TTS
Не обязательно. Вендоры speech-to-speech заявляют задержку менее 180 мс против 450–650 мс у каскада, но это их собственные заявления. Оптимизированный каскад уже укладывается в порог естественности и лучше поддаётся контролю: промежуточный текст нужен для guardrails и логов.
Какой containment реально ожидать от голосового агента
Независимые оценки production-внедрений (dragapp) дают 40–70%, на структурированных транзакционных сценариях — 70–90%. Вендорские 60–90% — это заявления вендоров, и определение «успешно закрытого» обращения в них обычно не раскрыто.

Вывод

Год для голосовых ИИ-агентов получился асимметричным: техника подтянулась, а доверие просело. Деньги в рынок идут, и одновременно Gartner ждёт отмены более 40% проектов — это не противоречие, а описание отсева. Задержка перестала быть главным ограничением, и на первый план вышли вещи скучнее: определение успеха, эскалация, разбор записей. Всё, что в этой статье названо прогнозом, прогнозом и остаётся. Если хотите проверить состояние технологии на своих звонках — можно собрать демо на вашем сценарии и послушать, как это звучит сейчас.

Проверить, как это звучит сейчас, можно за пять минут

Соберите агента по своему сайту и позвоните ему как клиент — это бесплатно. Один живой разговор про ваши услуги говорит о состоянии технологии больше, чем любой прогноз на три года вперёд.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.