Первая неделя после запуска агента: сначала слушать, потом считать
Первая неделя после запуска голосового AI-агента по дням: что слушать, какие метрики включить сразу и почему цифрам ещё рано верить.
Первая неделя после запуска голосового агента — это не неделя отчётов. Дашборд уже рисует проценты, но разговоров за ним так мало, что любую цифру можно объяснить случайностью. Настоящую информацию в первые дни дают только записи.
Короткий ответ на вопрос заголовка. День 1 — слушаете все разговоры подряд и составляете список поломок. Дни 2–3 — вносите одну выверенную партию правок в базу знаний и сценарий, потом прогоняете заново. Дни 4–5 — впервые смотрите на цифры, помня, что они ещё ничего не доказывают. Конец недели — решаете, расширять ли поток звонков.
День 1: полтора часа, которые заменяют неделю отчётов
За первые сутки агент на первой линии малого бизнеса проводит порядка 20–60 разговоров (оценка по типичным объёмам входящего потока в SMB). Разговор первой линии редко длится дольше двух-трёх минут — итого около полутора часов, чтобы прослушать всё.
Именно всё, а не выборку и не «десять худших по автоматической оценке»: в первый день вы ещё не знаете, что система считает плохим разговором.
Главное правило дня 1: фиксируете поломки, а не впечатления. «Мне не понравился голос» — не задача, её нельзя ни починить, ни проверить. Задача выглядит так:
- агент назвал неверный факт — цену, адрес, срок, условие акции;
- клиент дважды-трижды попросил человека, а перевода не случилось;
- перевод сорвался: длинные гудки, сброс, попадание не в тот отдел;
- клиент ответил не по сценарию, и разговор ушёл на второй круг;
- поля в CRM пустые или заполнены не тем.
Каждый пункт — строка в списке правок с указанием минуты записи. Техника прослушивания подробно разобрана в статье «Метрики зелёные, а звонки плохие» — в первую неделю она важнее любой аналитики.
Дни 2–3: одна выверенная правка лучше десяти торопливых
Правки первой недели делятся на два слоя. База знаний — факты: цены, условия, наличие, регламенты. Сценарий — ветвления, формулировки, момент передачи человеку. Ломается чаще база: агент говорит уверенно, а данные в него загрузили неполные.
Соблазн — править каждый день и помногу. Проблема в том, что после массовой правки не понять, что сработало. Если во вторник поменять двенадцать мест, а в среду половина поломок останется, придётся разбирать всё заново.
Рабочий ритм: собрать замечания за день 1, отсортировать по частоте, взять 3–5 пунктов из одного слоя, внести и прогнать заново на живом потоке. Повторить через день: ответ на правку всё равно приносят следующие полсотни разговоров, а не скорость выкатки.
Дни 4–5: первые цифры и почему им ещё нельзя верить
К середине недели появляется что считать. Метрики, которые стоит держать на мониторинге с первого дня, — не containment, а те, что показывают, где агент ломает клиентский опыт:
- доходимость до конца разговора — какая доля звонков дошла до логического финала, а не до сброса;
- forced escalation rate — доля разговоров, где клиент сам требовал человека: ориентир менее 10%;
- transfer success rate — доля переводов, дошедших до живого сотрудника: ориентир более 90%;
- repeat contact rate за 72 часа — доля клиентов, обратившихся повторно: ориентир менее 15%.
Три последних ориентира приводят платформы Balto и Famulor — это оценки вендоров, а не независимое исследование. Точность заполнения полей в CRM в первую неделю не автоматизируется: берёте 20–30 карточек и сверяете руками с записями. Полный разбор — в статье «Containment 80%, а клиенты жалуются».
Верить этим числам на пятый день нельзя по арифметике. При 150 разговорах один сбойный сценарий на восьми звонках двигает любую долю на пять пунктов. А repeat contact за 72 часа физически невозможно измерить раньше четвёртого дня — до этого метрика просто пустая.
Retell AI заявляет 50–80% containment в течение 60 дней после запуска; в кейсе Decagon для WeightWatchers заявлено около 70% уже на первой неделе. Это цифры, измеренные самими поставщиками, и обычно без определения того, что считается закрытым обращением. Независимые оценки production-внедрений дают 40–70% (dragapp), а для ранней стадии Balto называет 20–40%. Тридцать процентов на пятый день — это нормальная ранняя стадия, а не провал проекта.
Что смотреть каждый день после запуска: таблица по дням
| День | Что делаем | Что считаем сигналом к правке |
|---|---|---|
| 1 | Слушаем все разговоры подряд, ведём список поломок с таймкодами | Любая фактическая ошибка; сорванный перевод; просьба о человеке без реакции |
| 2 | Сортируем список по частоте, чиним базу знаний | Один и тот же неверный факт в двух и более разговорах |
| 3 | Правим сценарий: 3–5 мест, не больше. Пускаем в поток | Клиент вышел за скрипт, и разговор рассыпался |
| 4 | Слушаем выборку 15–20 разговоров после правки | Старая поломка повторилась — правка не сработала |
| 5 | Первые цифры: доходимость, forced escalation, transfer success | Эскалация выше 10% или успешность перевода ниже 90% |
| 6–7 | Считаем руками поля на 20–30 карточках, смотрим repeat contact | Поля верны меньше чем в 9 карточках из 10 |
Решение о расширении трафика принимается не по календарю. Расширять поток разумно, если за последние два дня не появилось новых типов поломок, перевод на человека стабильно доходит, а карточки в CRM не приходится доводить руками. Если хотя бы одно условие не выполнено — ещё два дня на той же нагрузке дешевле, чем удвоенный поток с той же ошибкой.
Ограничения: чего первая неделя не покажет
ROI считать рано. На неделе агент — черновик: часть звонков ушла на поломки и проверку правок. Окупаемость считают на стабильной версии за месяц и дольше, а структуру затрат стоит разобрать заранее — «Сколько стоит голосовой AI-агент».
Неделя не покрывает сезонность. Понедельник и пятница дают разный поток, начало месяца отличается от конца.
Часть проблем вообще не в агенте. Лид передан вовремя, но менеджер перезвонил через три часа. Агент записал клиента, а свободного слота в графике не было. Эскалация ушла в отдел, где после 18:00 никто не берёт трубку. Здесь правка не в промпте, а в регламенте — и это тот же разрыв, из-за которого проваливаются внедрения целиком: «Как внедрить голосового AI-агента».
Автоматический анализ не заменяет уши. Replica заявляет анализ 100% диалогов (по данным компании) — на дистанции это снимает проблему выборки. Но в первую неделю сама разметка ещё не проверена человеком, и доверять ей как источнику правды преждевременно.
Частые вопросы
Сколько разговоров нужно прослушать в первую неделю после запуска?
Когда метрикам голосового агента уже можно верить?
Агент ошибся при клиенте в первый же день. Отключать?
Кто в компании должен слушать звонки первой недели?
Что в итоге
Первая неделя после запуска нужна не для отчёта, а для того, чтобы превратить черновик агента в рабочую версию. Работает это через прослушивание, короткий список конкретных поломок и правки раз в два дня, а не через ежедневное разглядывание процентов. Цифры на этой неделе годятся как сигнал «здесь смотри», но не как основание для выводов о качестве или окупаемости. И самая частая находка первой недели — не ошибка модели, а дыра в процессе на стороне людей.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.
