реплика

Поменяли первую фразу — конверсия выросла. Это ещё не A/B-тест

A/B-тест сценария голосового агента: что тестировать, как делить трафик и почему рост конверсии на малой выборке ничего не доказывает.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·26 ноября 2025·7 минут чтения

Поменяли первую фразу в сценарии агента, за неделю согласий стало больше — и команда решает, что нашла рабочую формулировку. Через месяц эффект растворяется. Дело обычно не во фразе: сравнивали разные недели, разный трафик и заодно поменяли в сценарии ещё три вещи.

Прямой ответ на вопрос заголовка: A/B-тест сценария даёт результат, на который можно опереться, только при четырёх условиях — трафик делится случайно, проверяется одна гипотеза за раз, метрика успеха выбрана до старта, объём выборки достаточен для той конверсии, с которой вы работаете. Всё, что не собрано так, — наблюдение, а не тест.

Хорошая новость в том, что у голосового агента эти условия выполнимы почти буквально. У живых менеджеров — почти никогда.

Почему сценарий агента вообще можно тестировать

С людьми чистый эксперимент не собирается. Два менеджера произносят один скрипт по-разному, и разница в настроении легко перекрывает разницу в формулировке. Переключение на новый вариант растягивается на недели: скрипт нужно донести, отработать, проконтролировать. И массив разговоров недоступен целиком — руководитель слушает десяток звонков и достраивает картину сам.

У агента все три пункта закрываются механикой:

  • Одинаковое исполнение. Вариант B звучит одинаково на первом звонке и на трёхтысячном. Различие между группами — ровно то, что вы в него заложили.
  • Мгновенное переключение. Правка сценария не требует переобучения команды. По собственным данным Replica, A/B-тест гипотезы разворачивается за день, с атрибуцией результатов — это заявление компании, а не отраслевой норматив.
  • Весь массив разговоров. Анализируется 100% диалогов (по данным компании), а не та выборка, до которой дошли руки. Сравниваются группы целиком.

Это тот случай, когда автоматизация даёт не экономию, а знание: гипотезы о том, как разговаривать с вашими клиентами, наконец становятся проверяемыми. Насколько жёстким должен быть сам сценарий — в статье про сценарий разговора агента.

Что тестировать в первую очередь

Начинать стоит с начала разговора: там теряется больше всего и там же эффект виден быстрее.

Первая фраза и обозначение повода звонка. Анализ Gong по массиву более 90 000 звонков показал: явное обозначение причины звонка («причина моего звонка в том, что...») повышает успешность примерно в 2,1 раза, а открытие с вопросом о том, как у собеседника дела, даёт успешность около 10% против базовых примерно 1,5%.

Порядок вопросов. Спросить бюджет вторым или предпоследним — разные разговоры: ранний неудобный вопрос экономит время, но повышает шанс, что человек закроется.

Длина квалификации. Три вопроса или семь. Длинная анкета даёт менеджеру больше данных и одновременно роняет долю дошедших до конца.

Момент эскалации. Переводить на человека при первом признаке интереса или после полной квалификации. Разница видна не в проценте переводов, а в конверсии переданных лидов в сделку.

Время звонка. Martal сообщает: звонки в середине недели во второй половине дня показывают заметно лучшую результативность — в одном из замеров плюс 71%.

Чужие цифры — это гипотезы, а не рецепт

Gong и Martal измеряли американские B2B-звонки на своей аудитории и в своей структуре продаж. Перенести формулировку дословно и ждать роста в 2,1 раза — то же самое, что верить вендорскому «up to 80%». Эти данные говорят, что тестировать первым, а не какой результат вы получите. Честный предиктор один: тот же тест на вашей базе, вашем оффере и вашем языке.

Франшиза0:00
Послушайте первые десять секунд: компания, имя, повод — «вы оставляли заявку» — и вопрос, актуально ли ещё. Эту связку и меняют в первом же тесте.

Как провести A/B-тест сценария и не обмануть себя

Пять правил, каждое из которых кто-нибудь регулярно нарушает.

Одна гипотеза за раз. Поменяли первую фразу и порядок вопросов — при любом исходе вы не знаете, что сработало. И не знаете, не вычло ли одно изменение эффект другого.

Случайное деление трафика. Не «понедельник — вариант A, вторник — вариант B» и не «на этой базе A, на той B». Звонок попадает в группу случайно, в один и тот же период.

Один источник и один период. Лиды с контекстной рекламы и из холодной базы ведут себя по-разному. Если A достался один источник, а B другой, вы сравнили источники, а не сценарии.

Метрика успеха выбрана заранее. До старта, письменно, одна. Иначе после теста всегда найдётся метрика, по которой победил вариант, который вам нравился. Что брать за метрику — в статье про метрики голосового AI-агента.

Минимальный объём посчитан до старта. Чем ниже базовая конверсия, тем больше нужно звонков. При конверсии набора в назначенную встречу около 2,3% (независимый бенчмарк B2B) разница между двумя и тремя процентами на двухстах звонках — это два-три разговора, которые могли уйти в любую сторону сами по себе.

Что тестируем, какая гипотеза, какая метрика

Что тестируемГипотезаМетрика успеха (одна)
Первая фразаЯвное «причина моего звонка» вместо общего приветствия удерживает собеседникаДоля звонков, дошедших до первого содержательного ответа
Повод звонкаКонкретный повод («вы оставляли заявку на замер») бьёт общий («по поводу нашего предложения»)Доля согласий на следующий шаг
Порядок вопросовВопрос о бюджете в конце даёт больше заполненных анкетДоля полностью квалифицированных лидов
Длина квалификацииТри вопроса вместо семи повышают долю доведённых до конца без потери качестваДоля лидов, принятых отделом продаж
Момент эскалацииРанний перевод при явном интересе даёт больше сделок, чем полная квалификацияКонверсия переданных лидов в сделку
Время дозвонаСередина недели, вторая половина дня результативнееДоля результативных контактов на попытку

Когда A/B-тест не сработает

На малом объёме он не работает вовсе. Пятьдесят звонков на вариант при конверсии в единицы процентов не отличают гипотезу от случайности. Если объёма нет, честнее слушать разговоры руками и править сценарий по смыслу, а не изображать эксперимент.

Пять изменений сразу — это не пять тестов. Это один тест с неизвестной причиной: разложить эффект обратно на составляющие потом не получится.

Промежуточная метрика может вырасти без роста денег. Доходимость до конца разговора реагирует быстро и потому соблазнительна. Но длинный разговор с вежливым человеком, который не купит, тоже доходит до конца. Проверяйте победителя по конверсии в сделку и по ROI, даже если ждать дольше.

Победителя надо перепроверять. Препринт τ-bench (Sierra и Принстон, arXiv:2406.12045) показал: модель решает одну и ту же задачу с первого раза примерно в 61% случаев, а при восьми повторных прогонах успех по всем восьми падает ниже 25%. Значит, выигрыш варианта B может частично объясняться разбросом самой модели. Повторный прогон на новом трафике — обязательная часть теста.

Частые вопросы

Сколько звонков нужно для A/B-теста сценария?
Универсального числа нет: объём зависит от базовой конверсии и от того, какую разницу вы хотите заметить. Чем ниже конверсия, тем больше выборка — при базовых процентах речь о тысячах звонков на вариант. Считать объём нужно до старта, иначе тест закончится спором о том, значима разница или нет.
Можно ли тестировать несколько изменений сценария одновременно?
Можно, но тогда вы узнаете только то, что новая версия целиком лучше или хуже старой. Какое изменение дало эффект и не погасило ли одно другое — останется неизвестным. Если нужен ответ про конкретную формулировку, гипотеза должна быть одна.
Как быстро разворачивается A/B-тест голосового агента?
Правка сценария не требует переобучения команды, поэтому переключение занимает часы, а не недели. Replica заявляет разворачивание теста гипотезы за день с атрибуцией результатов — это данные компании. Дольше всего идёт не запуск, а накопление выборки.
Можно ли взять формулировки из чужих исследований и не тестировать?
Нет. Данные Gong и Martal собраны на американских B2B-звонках, с другой аудиторией и другим циклом сделки. Их применение — выбрать, что проверять первым; результат всё равно измеряется у вас.

Что с этим делать

A/B-тест сценария отличает работающую формулировку от совпадения, и голосовой агент делает его технически доступным. Цена входа — дисциплина: одна гипотеза, случайное деление, заранее выбранная метрика, достаточный объём. Чужие цифры, включая цифры из этой статьи, задают порядок проверки, а не ожидаемый результат. Начинать разумно на пилоте, где звонков тысячи, а цена ошибки ещё низкая.

Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и обсудить, какую гипотезу тестировать первой.

Первую гипотезу удобнее послушать, чем обсудить

По адресу вашего сайта бесплатно соберётся голосовой агент на ваших услугах. Позвоните ему, послушайте первую фразу и порядок вопросов — и решите, что проверять тестом первым.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.