реплика

Пилот прошёл отлично, а решение не приняли. Как считать иначе

Пилот голосового агента что-то доказывает, только если до старта записаны определение успеха, сегмент и сплит. Что зафиксировать заранее — чек-лист.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·4 февраля 2026·7 минут чтения

Пилот голосового агента почти всегда «проходит хорошо». Агент дозвонился, поговорил, никого не обидел, команда послушала десяток записей и осталась довольна. А через месяц решение не принято: никто не может внятно сказать, что этот пилот доказал.

Причина обычно не в агенте. Пилот даёт ответ только тогда, когда до старта зафиксированы четыре вещи: что считается успехом, на каком сегменте трафика проверяем, сколько это длится и с чем сравниваем. Без этого на выходе набор впечатлений, который поворачивается в любую сторону.

Короткий ответ: пилот — единственный честный предиктор вашего результата, но только в форме сплита. Часть трафика идёт на агента, часть на людей, одновременно, из одного источника, в одну неделю. Сравнение с прошлым годом, с ощущением РОПа или с обещанием вендора — это не пилот, а иллюстрация.

Почему вендорские 80–90% — это не ваша цифра

Заявленный containment у agentic-платформ — 60–90% (заявления вендоров, например Teneo). Независимые оценки реальных production-внедрений дают 40–70% (dragapp). Разрыв не от обмана: у вендора своё определение «решённого обращения» и своя выборка сценариев, а формулировки «up to 90%» это определение не приводят.

Важнее другое — стадия. По оценке платформы Balto, на ранней стадии внедрения containment держится в диапазоне 20–40%, на зрелой выходит на 40–70%. Пилот измеряет именно раннюю стадию. Цифра за три недели будет ниже той, на которую проект выйдет через полгода. Это нормально, если договориться заранее, а не объяснять постфактум.

Отсюда правило: сравнивать нужно не свою цифру с чужой, а свою со своей же альтернативой на том же трафике. Как устроены сами метрики, разобрано в статье про метрики голосового AI-агента.

Что зафиксировать до старта пилота голосового агента

Это согласуется с вендором до первого звонка и живёт в одном документе.

  1. Определение успеха одной строкой. Не «посмотрим, как пойдёт», а конкретно: доля обращений, закрытых без человека при выполнении парных условий, или конверсия «заявка → лид» не ниже такой-то.
  2. Что считается провалом. Порог, при котором пилот останавливают. Без него пилот не может закончиться отрицательным результатом — а значит, ничего не проверяет.
  3. Сегмент трафика. Какой источник, какой тип обращений, какой процент уходит агенту. Один источник, а не «всё подряд».
  4. Срок и дата решения. Календарная дата, когда стороны принимают решение по заранее оговорённым цифрам.
  5. Кто и как считает. Чьи данные — ваши или вендора, из какой системы выгружаются, кто имеет доступ к сырым записям и транскриптам.
  6. Контрольное плечо. Кто и как обрабатывает вторую часть трафика в те же дни, чтобы было с чем сравнивать.
  7. Что делают с пограничными случаями. Недозвон, молчание в трубку, повторный звонок того же клиента — считается это разговором или нет. Договориться дешевле, чем спорить по итогам.

Сплит вместо «было — стало»

Сравнение с прошлым годом или кварталом почти всегда бесполезно: за это время поменялись сезон, рекламные каналы, состав команды, цены и качество лидов. Разложить итоговую дельту на вклад агента и всего остального постфактум нельзя.

Рабочая конструкция простая: один источник трафика делится случайным образом, часть звонков принимает агент, часть — люди, в те же дни и те же часы. Тогда всё, что различается между плечами, различается из-за агента. Разворачивать такой сплит долго не нужно: Replica заявляет запуск за 2–3 дня и A/B-тест гипотезы за день, с атрибуцией результата к плечу (по данным компании). Механика самих сплит-проверок разобрана в материале про A/B-тесты сценариев.

Отдельный вопрос — сегмент. Самый сложный брать нельзя: споры, деньги и конфликты дадут низкий результат, и вы выбросите технологию, которая работала бы на других задачах. Самый простой — тоже нельзя. На структурированных транзакционных интентах (статус заказа, запись, напоминание) containment достигает 70–90%, а на appointment-сценариях — до 85–90% (оценка вендоров, leadlock). Такая цифра красиво ложится в презентацию и не воспроизводится на всём потоке. Берите средний по сложности сегмент с заметной долей реального трафика.

Сервисная компания0:00
Запись со сбором технических параметров и расчётом под конкретный объект — средний по сложности сегмент, на котором пилот действительно что-то показывает.
Что мерить в пилоте, кроме containment

Containment сам по себе не значит ничего: клиент мог положить трубку. Смотрите его с парными метриками — repeat contact за 72 часа менее 15%, forced escalation менее 10%, transfer success более 90% (ориентиры Balto/Famulor), CSAT отдельно по бакетам contained и escalated. Разрыв contained-бакета с базовым уровнем — не больше 3 пунктов.

Сколько разговоров нужно, чтобы цифра что-то значила

Частая тихая ошибка: решение принимают по 40 звонкам, потому что «и так всё видно».

Расчёт по стандартной модели сравнения двух долей (допущения: базовая конверсия около 50%, доверие 95%, мощность 80%). Чтобы уверенно поймать сдвиг в 10 процентных пунктов, нужно порядка 400 разговоров на каждое плечо. Чтобы поймать сдвиг в 5 пунктов — примерно вчетверо больше. Это порядок величины, а не точная цифра для вас: разница в пару пунктов на паре сотен звонков — шум.

Если сегмент даёт мало трафика, пилот либо длится дольше, либо проверяет более грубую гипотезу: «агент не хуже людей» вместо «агент лучше на 5%». Третий вариант — считать деньги, а не проценты: закрытые заявки, пропущенные звонки, время менеджеров. Как свести это в модель — в статье про ROI голосового AI-агента.

Когда пилот ничего не докажет

Бесконечный пилот. Если у пилота нет даты решения и порога провала, он превращается в способ не принимать решение. Gartner (пресс-релиз от 25.06.2025) прогнозирует отмену более 40% agentic-проектов к концу 2027 года, среди причин — неясная бизнес-ценность.

Пилот в тишине и на тестовых звонках. Демо в студийной акустике не предсказывает поведение в реальной телефонии — с шумом, узкой полосой, перебиваниями и людьми, которые говорят не по сценарию. Пример — Air.ai: вирусный взлёт на демо, за которым не последовало жизнеспособного продукта, и урегулирование с FTC (по данным aiagents.wiki). Пилот считается только на живых звонках живых клиентов.

Чего пилот не покажет в принципе. Три недели не измеряют долгие эффекты: влияние на LTV и повторные покупки, отношение клиентов к бренду, нагрузку на поддержку через полгода. Их отслеживают после внедрения, а на этапе решения держат как риск, а не как измеренную величину.

Частые вопросы

Сколько должен длиться пилот голосового агента
Столько, сколько нужно, чтобы набрать осмысленный объём разговоров на сегменте, — обычно 2–4 недели при заметном потоке звонков. Ключевое не срок, а дата решения, зафиксированная до старта.
Сколько стоит пилот и должен ли он быть бесплатным
Бесплатный пилот выгоден обеим сторонам ровно до момента, когда за него никто не отвечает. Важнее цены то, кто платит за трафик и настройку интеграций: эти затраты всплывают всегда.
Можно ли пилотировать сразу на всём потоке звонков
Можно, но тогда это уже не пилот, а внедрение без контрольного плеча. Без части трафика, которая идёт по-старому, сравнивать не с чем: останется только прошлый период, а он ничего не доказывает.
Что делать, если пилот показал результат хуже, чем обещал вендор
Сначала проверить определения: что вендор считал решённым обращением и что считали вы. Дальше — на каких интентах агент проваливался: часто проблема локальна и снимается доработкой сценария или базы знаний, а не сменой платформы.

Вывод

Пилот доказывает что-то ровно в той мере, в какой до старта записаны определение успеха, порог провала, сегмент, срок и способ сравнения. Ждите на пилоте раннюю стадию, а не зрелую: 20–40% containment на старте (оценка Balto) — не провал, а точка отсчёта. И заранее решите, что вы сделаете с отрицательным результатом, — иначе пилот превращается в дорогую форму отложенного решения. Какие вопросы задать вендору до этого этапа, разобрано в статье как выбрать голосового AI-агента.

Если хотите проверить это на своих звонках — можем собрать пилот на одном сегменте и посчитать его по вашему определению успеха.

Перед пилотом полезно услышать, о чём вообще речь

Введите адрес сайта — по нему бесплатно соберётся агент на ваших услугах. Позвоните ему и составьте своё представление до того, как обсуждать с вендором сегмент, сроки и пороги.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.