реплика

Голос агента выбирают первым, а решает он меньше всего

Голос агента и Brand Voice: почему синтез речи почти не влияет на «звучит как робот» и на что потратить время вместо выбора тембра.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·9 июля 2025·7 минут чтения

Голос агента — первое, что слушают на демо, и почти последнее, что определяет исход звонка. Современный синтез речи на русском давно звучит как запись живого человека: по данным НАФИ (опрос, август 2025, выборка 6213 человек), 57% россиян не отличают бота от человека в разговоре. Тембр перестал быть узким местом.

Ощущение «это робот» почти никогда не про синтез. Оно возникает из трёх вещей: агент не даёт себя перебить, отвечает не на то, что спросили, и повторяет одну и ту же формулировку дважды подряд. Ни одна из трёх не решается сменой голоса.

Типичное распределение усилий на старте: неделя на прослушивание голосов и три дня на базу знаний. Оно перевёрнуто.

Что даёт Brand Voice и когда это оправдано

Brand Voice в Яндекс SpeechKit — это создание цифровой копии конкретного голоса: диктор начитывает материал, дальше платформа синтезирует этим голосом любой текст. SpeechKit поддерживает синтез на 22 языках, включая кириллицу. Аналогичные локальные стеки — Salute Speech у Сбера и Tinkoff VoiceKit; у каждого есть набор готовых голосов из коробки.

Готового голоса хватает большинству сценариев. Кастомный оправдан в двух ситуациях. Первая: у бренда уже есть узнаваемый голос — тот же диктор звучит в рекламе, в IVR, в роликах, и разрыв между ними будет заметен. Вторая: премиальный сегмент, где голос воспринимается как часть продукта, а не как канал доставки информации.

Во всех остальных случаях кастомный голос — это отложенная задача. Он ничего не чинит в разговоре: агент с уникальным тембром, который перебивает клиента на середине фразы, звучит как робот с уникальным тембром.

Порядок работ

Сначала — сценарий, база знаний, эскалация и латентность. Голос последним. Обратный порядок даёт красивое демо и плохие звонки.

Почему голос агента звучит как робот, хотя синтез речи хороший

Разговор по телефону — это обмен репликами в реальном времени, и ощущение живого собеседника рождается в тайминге, а не в тембре. Три механики решают почти всё.

Barge-in — способность клиента перебить агента. Человек начинает говорить поверх — агент должен замолчать и начать слушать. Если он договаривает свою реплику до конца, разговор мгновенно опознаётся как машинный. Обратная крайность тоже вредна: в препринте FireRedChat (arXiv) отдельно измеряется false barge-in rate — доля ложных срабатываний, когда система замолкает от кашля, шума или обычного «угу».

Endpointing — момент, когда агент решает, что клиент договорил. Типичный диапазон 200–400 мс. Короткая отсечка перебивает человека, который задумался над номером заказа; длинная превращает каждую передачу хода в неловкую паузу.

Латентность. Целевой порог естественности — менее 500 мс P95; менее 300 мс оценивается как отлично, свыше 1 секунды воспринимается как робот. Каскадная схема STT → LLM → TTS без оптимизации даёт суммарно 670–3200 мс (разложение по слоям от Coval и Hamming), причём на сам синтез приходится только 100–500 мс. То есть TTS — самое маленькое слагаемое в бюджете задержки. Подробнее об этом — в разборе латентности голосового агента.

Четвёртая причина не техническая: агент отвечает мимо вопроса или повторяет ту же формулировку, потому что ему нечем ответить точнее. Это лечится базой знаний, а не голосом.

Сервисная компания0:00
Слушайте не тембр, а тайминг: паузу перед ответом и то, как агент подхватывает после короткой реплики клиента.

Что влияет на ощущение робота

ЧтоНасколько сильноЧто с этим делать
Пауза перед ответом больше секундыОчень сильноДержать латентность менее 500 мс P95, убрать лишние сетевые переходы и прокси
Агент не даёт себя перебитьОчень сильноВключить barge-in и отдельно следить за долей ложных срабатываний
Ответ не на заданный вопросОчень сильноБаза знаний и сценарий; голос тут ни при чём
Повтор одной формулировки подрядСильноВарианты реплик и учёт того, что уже было сказано в этом диалоге
Неверная отсечка конца репликиСильноНастроить endpointing в диапазоне 200–400 мс и проверить на медленно говорящих клиентах
Тупик на нестандартной репликеСильноЭскалация на человека вместо «не понял, повторите»
Пол и тембр голосаСлабоВыбрать один из готовых за час и идти дальше
Темп и интонацииУмеренноЗамедлить на цифрах, адресах и суммах; остальное — вкусовщина
Кастомный голос (Brand Voice)Слабо, кроме премиума и узнаваемого брендаПодключать после того, как всё выше работает

Про мужской и женский голос: публичных исследований с устойчивым преимуществом одного пола для российского рынка нет, так что выбирать честнее по соответствию бренду, а не по мифическим процентам конверсии. А вот темп — не вкусовщина. Номер заказа, адрес и сумма, произнесённые тем же темпом, что и приветствие, заставляют клиента переспрашивать.

Ограничения: где голос действительно важен и чем рискован клон

Есть сценарии, где голос перестаёт быть косметикой. Премиальный сегмент — недвижимость, частная медицина, дорогие услуги: там клиент оценивает уровень обслуживания с первой секунды, и дешёвый по звучанию голос обесценивает всё остальное. Второй случай — бренд с узнаваемым звучанием, где голос является активом наравне с логотипом.

Отдельная история — клонирование голоса конкретного сотрудника. Технически это делается легко, юридически — чувствительно. В США голос защищают прямо: в штате Теннесси действует ELVIS Act, относящий голос к охраняемым признакам личности. Это норма США, в России она не действует — прямого российского аналога сейчас нет. Но практический вывод одинаковый: письменное согласие человека на цифровую копию его голоса брать нужно, с указанием сценариев, срока и того, что происходит при увольнении.

Чего делать не стоит

Выдавать синтезированный голос за конкретного живого сотрудника. Клиент, который позже узнает, что «Марина из отдела продаж» — это синтез, воспринимает это как обман.

И ограничение сверху: неотличимость от человека — не то, что стоит продавать. Прямого требования раскрывать, что говорит бот, в российском законодательстве сейчас нет, но честное представление в первой фразе снижает жалобы. Подробнее — в статье о том, почему клиенты не любят ботов.

Миф: «голосовые роботы всегда бесят»

Раздражает не автоматизация, а бесполезный навязчивый звонок. По данным МТТ, 65% опрошенных раздражает навязчивость роботизированных звонков — но раздражает именно навязчивость. Те же 57% из опроса НАФИ спокойно доводят разговор до конца, когда у звонка есть внятный повод и он короткий. Голос в этой формуле не участвует: приятный тембр не спасает звонок без повода и не нужен, чтобы подтвердить запись за 30 секунд.

Частые вопросы

Какой голос выбрать для голосового агента — мужской или женский?
Публичных данных, подтверждающих устойчивое преимущество одного пола на российском рынке, нет. Выбирайте по соответствию бренду и сценарию, потратив на это часы, а не недели. На результат звонка сильнее влияют латентность, обработка перебиваний и качество базы знаний.
Отличит ли клиент синтез речи от живого человека?
По данным НАФИ (август 2025, выборка 6213 человек), 57% россиян не отличают бота от человека в разговоре. Но узнавание чаще происходит не по тембру, а по паузам, неумению принять перебивание и ответам мимо вопроса.
Нужен ли Brand Voice или хватит стандартного голоса?
Кастомный голос оправдан, если у бренда уже есть узнаваемое звучание в рекламе и IVR или если вы работаете в премиальном сегменте. В остальных случаях стандартного голоса Яндекс SpeechKit, Salute Speech или Tinkoff VoiceKit достаточно, а бюджет полезнее направить на сценарий и интеграции.
Законно ли клонировать голос сотрудника для агента?
Прямого запрета в российском законодательстве нет, но согласие человека на создание и использование цифровой копии голоса брать нужно — письменно, с указанием сценариев и срока. Нормы вроде Tennessee ELVIS Act, защищающие голос как признак личности, действуют в США и на Россию не распространяются; за точной формулировкой согласия стоит идти к юристу.

Что в итоге

Синтез речи давно перестал быть тем местом, где ломается разговор. Ломается он в таймингах: пауза больше секунды, проигнорированное перебивание, ответ не на тот вопрос. Голос стоит выбрать за час из готовых, а Brand Voice подключать тогда, когда бренд действительно этого требует и остальное уже работает — включая связку с CRM и телефонией, без которой любой голос говорит в пустоту. Если хотите проверить, как это звучит на ваших звонках — можем собрать демо на вашем сценарии.

Перебейте агента на середине фразы и послушайте

Соберите агента по адресу своего сайта — это бесплатно — и позвоните ему. Пауза перед ответом и реакция на перебивание слышны за минуту, и это ровно то, что читается как «робот».

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.