Клиент перешёл на казахский. Агент на нескольких языках
Голосовой агент на нескольких языках: чем «поддерживает язык» отличается от «работает на языке» и что проверить перед вторым языком.
Клиент начинает разговор по-русски, на середине переходит на казахский, а название тарифа произносит по-английски. Для оператора-человека это обычный звонок. Для голосового агента — три разные задачи, и на каждой он спотыкается по-своему.
Короткий ответ: агент на нескольких языках технически возможен и работает, но «платформа поддерживает язык» и «агент работает на этом языке» — разные утверждения. Распознавание, синтез и качество диалога деградируют на втором языке неравномерно. Поэтому многоязычный запуск планируется как отдельный проект со своей проверкой качества, а не как галочка в настройках.
Что на самом деле значит «поддерживает 22 языка»
Яндекс SpeechKit заявляет синтез на 22 языках с поддержкой кириллицы (по данным документации вендора). Это утверждение про TTS: агент сможет произнести фразу. Оно ничего не говорит о том, как агент вас услышит и что ответит.
Голосовой агент — это три слоя, и язык каждый из них держит по-своему.
Синтез (TTS) обычно самый крепкий слой. Голос звучит прилично почти везде, кроме редких языков: там речь становится «читающей», а не говорящей.
Распознавание (STT) — главный источник проблем. Точность падает на акцентах, особенно у неносителей языка, а также на фоновом шуме, узкополосной телефонии, отраслевых терминах и названиях. Русский с казахским акцентом или казахский с русскими вставками — ровно тот случай, где WER растёт сильнее всего. Как это мерить — в статье про WER и распознавание речи.
Логика диалога. Модель может знать язык, но хуже держать на нём нюансы: вежливые формы, отрицание, косвенный отказ. Точность распознавания интентов у зрелых систем оценивают в 90–97% (оценка платформы Balto) — и эта цифра получена не на смешанной речи и не на втором языке.
Отсюда правило. Язык «поддержан», когда работает самый простой слой. Язык «работает», когда собран весь стек и проверен на ваших реальных записях.
Акцент и смешение языков: главная проблема на постсоветском пространстве
В Казахстане, Кыргызстане, Узбекистане, Армении человек не выбирает язык на входе в разговор. Он переключается внутри фразы: русская грамматика, местное вежливое слово, английское название продукта. Для агента это реплика, у которой нет одного языка.
Автоопределение работает на уровне звонка или реплики. Внутри одной фразы оно ошибается почти всегда: модель выбирает доминирующий язык и теряет вставки. А вставки — это имена, адреса и названия, то есть данные, ради которых звонок и делался.
Второй слой проблемы — переключение по ходу разговора. Если агент зафиксировал язык на первой реплике, дальше диалог рассыпается.
Для исходящих звонков язык клиента чаще всего уже лежит в CRM: регион, прошлые обращения, язык заявки. Для входящих его задаёт номер, на который позвонили.
Может ли один агент говорить на нескольких языках сразу
Может — вопрос в том, нужно ли. Три рабочие конфигурации.
Один агент с автоопределением. Когда язык непредсказуем: входящая линия в городе со смешанной речью, розница, поддержка. Цена — риск ошибки на первой реплике и необходимость сценария «я не понял, на каком языке вы говорите».
Отдельные номера или ветки. Когда язык предсказуем по каналу: региональная реклама, филиал, обзвон сегмента базы. Язык берётся из карточки клиента или из номера, а не угадывается. Это вопрос интеграции с CRM и телефонией, а не настроек модели.
Отдельные сценарии. Когда на втором языке отличается не только речь: другой прайс, другой набор возражений, другие юридические формулировки. Тогда «перевод» агента бессмысленен — это второй агент, у которого совпадает только продукт.
Базу знаний переводить нельзя — её пишут заново
Самая частая ошибка второго языка — прогнать базу знаний через машинный перевод и считать задачу закрытой. Механически не переводятся три вещи.
Названия продуктов, тарифов, юрлиц: клиент произнесёт их в оригинале, даже говоря на другом языке. Агент должен распознать оба варианта и произнести правильный.
Отраслевые термины: у части из них нет устоявшегося местного эквивалента, и перевод создаёт слово, которого никто не употребляет.
Юридические формулировки — согласия, условия возврата, оговорки. Их пишет юрист под местное право, а не переводчик. Плюс тон: прямая калька русской фразы на другом языке нередко звучит грубее оригинала. Про устройство самой базы — в статье про базу знаний для агента.
Чек-лист: что проверить перед запуском второго языка
- Собрать 50–100 реальных записей с телефонной линии на целевом языке, включая акценты и смешанную речь.
- Посчитать по ним WER отдельно для чистой речи и для смешанной. Разрыв между двумя цифрами — ваш реальный риск.
- Проверить отдельным списком распознавание имён, адресов и названий тарифов.
- Дать синтез послушать носителю языка. Критерий не «понятно», а «так говорят».
- Прописать поведение при неопределённом языке и при переключении языка в середине разговора.
- Обеспечить эскалацию на человека, говорящего на этом языке. Перевод на оператора, не понимающего клиента, хуже, чем отсутствие второго языка.
- Убедиться, что транскрипты доезжают в CRM читаемыми и что аналитика различает звонки по языку.
- Заложить прослушивание звонков на новом языке в первые две недели после запуска.
Ограничения: второй язык — это второй проект
Вендорские сроки звучат обнадёживающе. Sierra в одном из кейсов сообщает о поддержке 19 языков за два месяца — это заявление компании о собственном проекте, а не независимо проверенный результат, и о качестве на каждом из девятнадцати оно не говорит ничего.
Здесь же разберём миф «ИИ понимает язык как человек». Препринт τ-bench (Sierra и Принстон, arXiv:2406.12045): GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми прогонах одной и той же задачи pass^8 падает ниже 25%. Это на английском, в тексте, без телефонной линии. Добавьте второй язык, акцент и узкую полосу — разброс станет шире, а не уже.
Второе ограничение — редкие языки. Чем меньше данных, на которых училась модель, тем ниже качество распознавания, и за пределами топовой двадцатки разрыв слышен без замеров. Выбор стека тут перестаёт быть чисто техническим: западные модели часто сильнее в редких языках, но упираются в доступность, латентность и трансграничную передачу данных.
Третье — экономика. Второй язык добавляет не минуты, а работу: свой набор тестов, свой цикл прослушивания, свою поддержку. Это отдельная строка бюджета — см. сколько стоит голосовой AI-агент.
Частые вопросы
Нужен ли отдельный голосовой агент на каждый язык
Сколько времени занимает запуск второго языка
Понимает ли агент, если клиент смешивает два языка в одной фразе
На каких языках качество распознавания хуже всего
Коротко
Многоязычный агент — не переключатель в интерфейсе, а второй проект со своей проверкой качества. Начинать стоит не с вопроса «поддерживается ли язык», а с замера на своих записях: WER на чистой речи, WER на смешанной и разрыв между ними. Если язык клиента известен заранее, берите его из CRM или из номера. И закладывайте эскалацию на человека, который на этом языке действительно говорит.
Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии и на вашем языке.
