Поменяли первую фразу — конверсия выросла. Это ещё не A/B-тест
A/B-тест сценария голосового агента: что тестировать, как делить трафик и почему рост конверсии на малой выборке ничего не доказывает.
Поменяли первую фразу в сценарии агента, за неделю согласий стало больше — и команда решает, что нашла рабочую формулировку. Через месяц эффект растворяется. Дело обычно не во фразе: сравнивали разные недели, разный трафик и заодно поменяли в сценарии ещё три вещи.
Прямой ответ на вопрос заголовка: A/B-тест сценария даёт результат, на который можно опереться, только при четырёх условиях — трафик делится случайно, проверяется одна гипотеза за раз, метрика успеха выбрана до старта, объём выборки достаточен для той конверсии, с которой вы работаете. Всё, что не собрано так, — наблюдение, а не тест.
Хорошая новость в том, что у голосового агента эти условия выполнимы почти буквально. У живых менеджеров — почти никогда.
Почему сценарий агента вообще можно тестировать
С людьми чистый эксперимент не собирается. Два менеджера произносят один скрипт по-разному, и разница в настроении легко перекрывает разницу в формулировке. Переключение на новый вариант растягивается на недели: скрипт нужно донести, отработать, проконтролировать. И массив разговоров недоступен целиком — руководитель слушает десяток звонков и достраивает картину сам.
У агента все три пункта закрываются механикой:
- Одинаковое исполнение. Вариант B звучит одинаково на первом звонке и на трёхтысячном. Различие между группами — ровно то, что вы в него заложили.
- Мгновенное переключение. Правка сценария не требует переобучения команды. По собственным данным Replica, A/B-тест гипотезы разворачивается за день, с атрибуцией результатов — это заявление компании, а не отраслевой норматив.
- Весь массив разговоров. Анализируется 100% диалогов (по данным компании), а не та выборка, до которой дошли руки. Сравниваются группы целиком.
Это тот случай, когда автоматизация даёт не экономию, а знание: гипотезы о том, как разговаривать с вашими клиентами, наконец становятся проверяемыми. Насколько жёстким должен быть сам сценарий — в статье про сценарий разговора агента.
Что тестировать в первую очередь
Начинать стоит с начала разговора: там теряется больше всего и там же эффект виден быстрее.
Первая фраза и обозначение повода звонка. Анализ Gong по массиву более 90 000 звонков показал: явное обозначение причины звонка («причина моего звонка в том, что...») повышает успешность примерно в 2,1 раза, а открытие с вопросом о том, как у собеседника дела, даёт успешность около 10% против базовых примерно 1,5%.
Порядок вопросов. Спросить бюджет вторым или предпоследним — разные разговоры: ранний неудобный вопрос экономит время, но повышает шанс, что человек закроется.
Длина квалификации. Три вопроса или семь. Длинная анкета даёт менеджеру больше данных и одновременно роняет долю дошедших до конца.
Момент эскалации. Переводить на человека при первом признаке интереса или после полной квалификации. Разница видна не в проценте переводов, а в конверсии переданных лидов в сделку.
Время звонка. Martal сообщает: звонки в середине недели во второй половине дня показывают заметно лучшую результативность — в одном из замеров плюс 71%.
Gong и Martal измеряли американские B2B-звонки на своей аудитории и в своей структуре продаж. Перенести формулировку дословно и ждать роста в 2,1 раза — то же самое, что верить вендорскому «up to 80%». Эти данные говорят, что тестировать первым, а не какой результат вы получите. Честный предиктор один: тот же тест на вашей базе, вашем оффере и вашем языке.
Как провести A/B-тест сценария и не обмануть себя
Пять правил, каждое из которых кто-нибудь регулярно нарушает.
Одна гипотеза за раз. Поменяли первую фразу и порядок вопросов — при любом исходе вы не знаете, что сработало. И не знаете, не вычло ли одно изменение эффект другого.
Случайное деление трафика. Не «понедельник — вариант A, вторник — вариант B» и не «на этой базе A, на той B». Звонок попадает в группу случайно, в один и тот же период.
Один источник и один период. Лиды с контекстной рекламы и из холодной базы ведут себя по-разному. Если A достался один источник, а B другой, вы сравнили источники, а не сценарии.
Метрика успеха выбрана заранее. До старта, письменно, одна. Иначе после теста всегда найдётся метрика, по которой победил вариант, который вам нравился. Что брать за метрику — в статье про метрики голосового AI-агента.
Минимальный объём посчитан до старта. Чем ниже базовая конверсия, тем больше нужно звонков. При конверсии набора в назначенную встречу около 2,3% (независимый бенчмарк B2B) разница между двумя и тремя процентами на двухстах звонках — это два-три разговора, которые могли уйти в любую сторону сами по себе.
Что тестируем, какая гипотеза, какая метрика
| Что тестируем | Гипотеза | Метрика успеха (одна) |
|---|---|---|
| Первая фраза | Явное «причина моего звонка» вместо общего приветствия удерживает собеседника | Доля звонков, дошедших до первого содержательного ответа |
| Повод звонка | Конкретный повод («вы оставляли заявку на замер») бьёт общий («по поводу нашего предложения») | Доля согласий на следующий шаг |
| Порядок вопросов | Вопрос о бюджете в конце даёт больше заполненных анкет | Доля полностью квалифицированных лидов |
| Длина квалификации | Три вопроса вместо семи повышают долю доведённых до конца без потери качества | Доля лидов, принятых отделом продаж |
| Момент эскалации | Ранний перевод при явном интересе даёт больше сделок, чем полная квалификация | Конверсия переданных лидов в сделку |
| Время дозвона | Середина недели, вторая половина дня результативнее | Доля результативных контактов на попытку |
Когда A/B-тест не сработает
На малом объёме он не работает вовсе. Пятьдесят звонков на вариант при конверсии в единицы процентов не отличают гипотезу от случайности. Если объёма нет, честнее слушать разговоры руками и править сценарий по смыслу, а не изображать эксперимент.
Пять изменений сразу — это не пять тестов. Это один тест с неизвестной причиной: разложить эффект обратно на составляющие потом не получится.
Промежуточная метрика может вырасти без роста денег. Доходимость до конца разговора реагирует быстро и потому соблазнительна. Но длинный разговор с вежливым человеком, который не купит, тоже доходит до конца. Проверяйте победителя по конверсии в сделку и по ROI, даже если ждать дольше.
Победителя надо перепроверять. Препринт τ-bench (Sierra и Принстон, arXiv:2406.12045) показал: модель решает одну и ту же задачу с первого раза примерно в 61% случаев, а при восьми повторных прогонах успех по всем восьми падает ниже 25%. Значит, выигрыш варианта B может частично объясняться разбросом самой модели. Повторный прогон на новом трафике — обязательная часть теста.
Частые вопросы
Сколько звонков нужно для A/B-теста сценария?
Можно ли тестировать несколько изменений сценария одновременно?
Как быстро разворачивается A/B-тест голосового агента?
Можно ли взять формулировки из чужих исследований и не тестировать?
Что с этим делать
A/B-тест сценария отличает работающую формулировку от совпадения, и голосовой агент делает его технически доступным. Цена входа — дисциплина: одна гипотеза, случайное деление, заранее выбранная метрика, достаточный объём. Чужие цифры, включая цифры из этой статьи, задают порядок проверки, а не ожидаемый результат. Начинать разумно на пилоте, где звонков тысячи, а цена ошибки ещё низкая.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и обсудить, какую гипотезу тестировать первой.
