GigaChat или OpenAI через прокси: три риска, о которых молчат
Российские модели или OpenAI через прокси: разбираем задержку, 152-ФЗ и риск потери доступа к API — и что ставить на каждый слой агента.
Голосовой агент на OpenAI или Google Gemini через прокси обычно обсуждают в одной плоскости: чья модель умнее. Это не тот вопрос, от которого зависит судьба проекта. Первыми ломаются три другие вещи — задержка, законность и доступ. Российские модели (GigaChat, YandexGPT, Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKit) проигрывают западным в универсальности, но выигрывают в предсказуемости именно по этим трём измерениям.
Короткий ответ такой. Прокси добавляет сетевое плечо к бюджету латентности, в котором и без него тесно. Персональные данные россиян по 152-ФЗ должны храниться в базах на территории РФ, а маршрут разговора через зарубежный API — это трансграничная передача. И доступ к аудио-API OpenAI и Google Gemini для российских номеров и юрлиц ограничен (по публикациям на Habr): сервис может отвалиться не по вашей вине и не в удобный момент.
Задержка: прокси тратит бюджет, которого нет
Порог, за которым разговор перестаёт звучать естественно, — менее 500 мс P95. Менее 300 мс считается отличным результатом, 300–600 мс приемлемым, а свыше секунды человек уже опознаёт робота и начинает говорить поверх агента. Что меняется, когда языков становится больше одного, — в отдельной статье.
Внутри этого бюджета уже сидит вся каскадная архитектура. Разложение по слоям (оценки платформ Coval и Hamming): STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс, плюс сеть и телефония. Суммарно каскад без оптимизации даёт 670–3200 мс — то есть значительная часть неоптимизированных сборок изначально не укладывается в порог.
Теперь добавьте к этому прокси. Каждый вызов LLM и каждый вызов синтеза идёт не в соседний дата-центр, а через промежуточный узел за границей — и туда, и обратно. Проблема не в среднем значении: прокси-плечо нестабильно, а латентность меряют по P95. Разговор рушится не тем, что агент медленный всегда, а тем, что он медленный на каждом двадцатом ответе. Подробный разбор того, из чего складывается задержка и как её мерить, — в статье про латентность голосового агента.
152-ФЗ: где физически лежит запись разговора
Запись звонка и его транскрипт — это персональные данные. 152-ФЗ (статьи 6 и 9 — условия обработки и согласие субъекта) требует, чтобы базы с персональными данными россиян находились на территории РФ. Когда аудио клиента и текст его реплик уходят в зарубежный API, вы совершаете трансграничную передачу — со всеми сопутствующими требованиями к её основаниям.
Второй пласт, о котором часто забывают при выборе стека: с 1 сентября 2025 года (закон № 156-ФЗ от 24.06.2025) согласие на обработку персональных данных должно оформляться отдельным документом, а не строкой в общем пользовательском соглашении. Это касается и форм захвата лидов, и сценариев обзвона, и того, что агент говорит в первые секунды разговора. Что именно можно записывать и на каких основаниях — разбираем в материале про 152-ФЗ и запись разговоров.
Это ориентир для технического решения, а не правовое заключение. Конфигурацию хранения данных, основания обработки и формулировки согласия нужно согласовывать с вашим юристом или DPO.
Устойчивость: доступ к API — не ваш актив
Третий риск самый неприятный, потому что он не про качество и не про деньги. По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских номеров и юридических лиц ограничен. Схема через прокси и зарубежное юрлицо работает ровно до тех пор, пока её не закроют с той стороны — и вы об этом узнаете от клиентов, а не от вендора.
Для первой линии продаж и поддержки это означает конкретную вещь: в цепочке появляется звено, на которое вы не влияете. У локального стека этой проблемы нет — но у него есть свои, о них ниже. Если вы всерьёз считаете риски владения архитектурой, это тот же разговор, что и своя разработка или готовая платформа.
Что ставить на каждый слой
Выбор делается не «моделью целиком», а послойно. Одна и та же система может использовать локальный STT и локальный TTS, а рассуждающую модель — какую угодно, если персональные данные до неё не доходят.
| Слой | Локальный вариант | Западный | Что решает выбор |
|---|---|---|---|
| STT (распознавание) | Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKit | аудио-API OpenAI, Google | Точность на русском в узкополосной телефонии, задержка, попадание аудио за границу |
| LLM (логика диалога) | GigaChat, YandexGPT | GPT, Gemini | Сложные рассуждения против предсказуемости доступа |
| TTS (синтез) | SpeechKit с Brand Voice, Salute Speech | зарубежные TTS | Голос бренда, качество кириллицы, задержка |
| Хранение записей и транскриптов | Yandex Cloud, VK Cloud, Cloud.ru | зарубежные облака | Локализация по 152-ФЗ |
| Телефония и SIP | Mango Office, UIS, Телфин, МТС Exolve, Asterisk | не применимо | Связность с российскими операторами и маркировка звонков |
Практический вывод из таблицы: два слоя из пяти (хранение и телефония) в России локальны по умолчанию, ещё два (STT и TTS) закрыты локальными сервисами вполне рабочего уровня. Спорным остаётся один слой — LLM. Именно там и стоит вести дискуссию, а не переносить её на весь стек.
Ограничения: в чём российские модели слабее западных?
- Редкие языки. Если в базе есть звонки на языках за пределами русского и основных языков СНГ, западные модели покрывают их шире.
- Сложные рассуждения. На длинных многошаговых задачах с расчётами и ветвлениями фронтирные западные модели пока сильнее.
- Экосистема инструментов. Библиотеки, фреймворки агентов, готовые интеграции, документация и сообщество вокруг западных API объёмнее — часть велосипедов придётся написать самим.
И встречный вопрос: сколько из этого нужно в звонке на 60–90 секунд, где агент квалифицирует заявку или подтверждает запись? Обычно — почти ничего.
Здесь же развенчаем распространённый миф: «взять самую сильную модель — и агент будет понимать как человек». Препринт τ-bench (Sierra совместно с Принстоном, arXiv:2406.12045) показывает, что GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи pass^8 падает ниже 25%. Сильная модель не даёт стабильности — стабильность дают сценарий, база знаний, guardrails и правила эскалации. По нашей оценке, порядка 80% качества разговора определяется именно этим слоем, а не тем, чей API стоит под капотом.
Вывод
Спор «российские модели или западные» в голосовых звонках решается не бенчмарками качества. Прокси съедает бюджет латентности, который и так тесный; трансграничная передача записей создаёт юридический риск по 152-ФЗ; доступ к зарубежным аудио-API для российских юрлиц ограничен и от вас не зависит. Локальный стек проигрывает в универсальности и выигрывает в предсказуемости — а для первой линии предсказуемость важнее. Начинать всё равно стоит не с модели, а со сценария, базы знаний и интеграции с CRM и телефонией. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.
