Голос агента выбирают первым, а решает он меньше всего
Голос агента и Brand Voice: почему синтез речи почти не влияет на «звучит как робот» и на что потратить время вместо выбора тембра.
Голос агента — первое, что слушают на демо, и почти последнее, что определяет исход звонка. Современный синтез речи на русском давно звучит как запись живого человека: по данным НАФИ (опрос, август 2025, выборка 6213 человек), 57% россиян не отличают бота от человека в разговоре. Тембр перестал быть узким местом.
Ощущение «это робот» почти никогда не про синтез. Оно возникает из трёх вещей: агент не даёт себя перебить, отвечает не на то, что спросили, и повторяет одну и ту же формулировку дважды подряд. Ни одна из трёх не решается сменой голоса.
Типичное распределение усилий на старте: неделя на прослушивание голосов и три дня на базу знаний. Оно перевёрнуто.
Что даёт Brand Voice и когда это оправдано
Brand Voice в Яндекс SpeechKit — это создание цифровой копии конкретного голоса: диктор начитывает материал, дальше платформа синтезирует этим голосом любой текст. SpeechKit поддерживает синтез на 22 языках, включая кириллицу. Аналогичные локальные стеки — Salute Speech у Сбера и Tinkoff VoiceKit; у каждого есть набор готовых голосов из коробки.
Готового голоса хватает большинству сценариев. Кастомный оправдан в двух ситуациях. Первая: у бренда уже есть узнаваемый голос — тот же диктор звучит в рекламе, в IVR, в роликах, и разрыв между ними будет заметен. Вторая: премиальный сегмент, где голос воспринимается как часть продукта, а не как канал доставки информации.
Во всех остальных случаях кастомный голос — это отложенная задача. Он ничего не чинит в разговоре: агент с уникальным тембром, который перебивает клиента на середине фразы, звучит как робот с уникальным тембром.
Сначала — сценарий, база знаний, эскалация и латентность. Голос последним. Обратный порядок даёт красивое демо и плохие звонки.
Почему голос агента звучит как робот, хотя синтез речи хороший
Разговор по телефону — это обмен репликами в реальном времени, и ощущение живого собеседника рождается в тайминге, а не в тембре. Три механики решают почти всё.
Barge-in — способность клиента перебить агента. Человек начинает говорить поверх — агент должен замолчать и начать слушать. Если он договаривает свою реплику до конца, разговор мгновенно опознаётся как машинный. Обратная крайность тоже вредна: в препринте FireRedChat (arXiv) отдельно измеряется false barge-in rate — доля ложных срабатываний, когда система замолкает от кашля, шума или обычного «угу».
Endpointing — момент, когда агент решает, что клиент договорил. Типичный диапазон 200–400 мс. Короткая отсечка перебивает человека, который задумался над номером заказа; длинная превращает каждую передачу хода в неловкую паузу.
Латентность. Целевой порог естественности — менее 500 мс P95; менее 300 мс оценивается как отлично, свыше 1 секунды воспринимается как робот. Каскадная схема STT → LLM → TTS без оптимизации даёт суммарно 670–3200 мс (разложение по слоям от Coval и Hamming), причём на сам синтез приходится только 100–500 мс. То есть TTS — самое маленькое слагаемое в бюджете задержки. Подробнее об этом — в разборе латентности голосового агента.
Четвёртая причина не техническая: агент отвечает мимо вопроса или повторяет ту же формулировку, потому что ему нечем ответить точнее. Это лечится базой знаний, а не голосом.
Что влияет на ощущение робота
| Что | Насколько сильно | Что с этим делать |
|---|---|---|
| Пауза перед ответом больше секунды | Очень сильно | Держать латентность менее 500 мс P95, убрать лишние сетевые переходы и прокси |
| Агент не даёт себя перебить | Очень сильно | Включить barge-in и отдельно следить за долей ложных срабатываний |
| Ответ не на заданный вопрос | Очень сильно | База знаний и сценарий; голос тут ни при чём |
| Повтор одной формулировки подряд | Сильно | Варианты реплик и учёт того, что уже было сказано в этом диалоге |
| Неверная отсечка конца реплики | Сильно | Настроить endpointing в диапазоне 200–400 мс и проверить на медленно говорящих клиентах |
| Тупик на нестандартной реплике | Сильно | Эскалация на человека вместо «не понял, повторите» |
| Пол и тембр голоса | Слабо | Выбрать один из готовых за час и идти дальше |
| Темп и интонации | Умеренно | Замедлить на цифрах, адресах и суммах; остальное — вкусовщина |
| Кастомный голос (Brand Voice) | Слабо, кроме премиума и узнаваемого бренда | Подключать после того, как всё выше работает |
Про мужской и женский голос: публичных исследований с устойчивым преимуществом одного пола для российского рынка нет, так что выбирать честнее по соответствию бренду, а не по мифическим процентам конверсии. А вот темп — не вкусовщина. Номер заказа, адрес и сумма, произнесённые тем же темпом, что и приветствие, заставляют клиента переспрашивать.
Ограничения: где голос действительно важен и чем рискован клон
Есть сценарии, где голос перестаёт быть косметикой. Премиальный сегмент — недвижимость, частная медицина, дорогие услуги: там клиент оценивает уровень обслуживания с первой секунды, и дешёвый по звучанию голос обесценивает всё остальное. Второй случай — бренд с узнаваемым звучанием, где голос является активом наравне с логотипом.
Отдельная история — клонирование голоса конкретного сотрудника. Технически это делается легко, юридически — чувствительно. В США голос защищают прямо: в штате Теннесси действует ELVIS Act, относящий голос к охраняемым признакам личности. Это норма США, в России она не действует — прямого российского аналога сейчас нет. Но практический вывод одинаковый: письменное согласие человека на цифровую копию его голоса брать нужно, с указанием сценариев, срока и того, что происходит при увольнении.
Выдавать синтезированный голос за конкретного живого сотрудника. Клиент, который позже узнает, что «Марина из отдела продаж» — это синтез, воспринимает это как обман.
И ограничение сверху: неотличимость от человека — не то, что стоит продавать. Прямого требования раскрывать, что говорит бот, в российском законодательстве сейчас нет, но честное представление в первой фразе снижает жалобы. Подробнее — в статье о том, почему клиенты не любят ботов.
Миф: «голосовые роботы всегда бесят»
Раздражает не автоматизация, а бесполезный навязчивый звонок. По данным МТТ, 65% опрошенных раздражает навязчивость роботизированных звонков — но раздражает именно навязчивость. Те же 57% из опроса НАФИ спокойно доводят разговор до конца, когда у звонка есть внятный повод и он короткий. Голос в этой формуле не участвует: приятный тембр не спасает звонок без повода и не нужен, чтобы подтвердить запись за 30 секунд.
Частые вопросы
Какой голос выбрать для голосового агента — мужской или женский?
Отличит ли клиент синтез речи от живого человека?
Нужен ли Brand Voice или хватит стандартного голоса?
Законно ли клонировать голос сотрудника для агента?
Что в итоге
Синтез речи давно перестал быть тем местом, где ломается разговор. Ломается он в таймингах: пауза больше секунды, проигнорированное перебивание, ответ не на тот вопрос. Голос стоит выбрать за час из готовых, а Brand Voice подключать тогда, когда бренд действительно этого требует и остальное уже работает — включая связку с CRM и телефонией, без которой любой голос говорит в пустоту. Если хотите проверить, как это звучит на ваших звонках — можем собрать демо на вашем сценарии.
