реплика

GigaChat или OpenAI через прокси: три риска, о которых молчат

Российские модели или OpenAI через прокси: разбираем задержку, 152-ФЗ и риск потери доступа к API — и что ставить на каждый слой агента.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·10 декабря 2025·7 минут чтения

Голосовой агент на OpenAI или Google Gemini через прокси обычно обсуждают в одной плоскости: чья модель умнее. Это не тот вопрос, от которого зависит судьба проекта. Первыми ломаются три другие вещи — задержка, законность и доступ. Российские модели (GigaChat, YandexGPT, Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKit) проигрывают западным в универсальности, но выигрывают в предсказуемости именно по этим трём измерениям.

Короткий ответ такой. Прокси добавляет сетевое плечо к бюджету латентности, в котором и без него тесно. Персональные данные россиян по 152-ФЗ должны храниться в базах на территории РФ, а маршрут разговора через зарубежный API — это трансграничная передача. И доступ к аудио-API OpenAI и Google Gemini для российских номеров и юрлиц ограничен (по публикациям на Habr): сервис может отвалиться не по вашей вине и не в удобный момент.

Задержка: прокси тратит бюджет, которого нет

Порог, за которым разговор перестаёт звучать естественно, — менее 500 мс P95. Менее 300 мс считается отличным результатом, 300–600 мс приемлемым, а свыше секунды человек уже опознаёт робота и начинает говорить поверх агента. Что меняется, когда языков становится больше одного, — в отдельной статье.

Внутри этого бюджета уже сидит вся каскадная архитектура. Разложение по слоям (оценки платформ Coval и Hamming): STT 100–400 мс, LLM 200–1000 мс, TTS 100–500 мс, плюс сеть и телефония. Суммарно каскад без оптимизации даёт 670–3200 мс — то есть значительная часть неоптимизированных сборок изначально не укладывается в порог.

Теперь добавьте к этому прокси. Каждый вызов LLM и каждый вызов синтеза идёт не в соседний дата-центр, а через промежуточный узел за границей — и туда, и обратно. Проблема не в среднем значении: прокси-плечо нестабильно, а латентность меряют по P95. Разговор рушится не тем, что агент медленный всегда, а тем, что он медленный на каждом двадцатом ответе. Подробный разбор того, из чего складывается задержка и как её мерить, — в статье про латентность голосового агента.

152-ФЗ: где физически лежит запись разговора

Запись звонка и его транскрипт — это персональные данные. 152-ФЗ (статьи 6 и 9 — условия обработки и согласие субъекта) требует, чтобы базы с персональными данными россиян находились на территории РФ. Когда аудио клиента и текст его реплик уходят в зарубежный API, вы совершаете трансграничную передачу — со всеми сопутствующими требованиями к её основаниям.

Второй пласт, о котором часто забывают при выборе стека: с 1 сентября 2025 года (закон № 156-ФЗ от 24.06.2025) согласие на обработку персональных данных должно оформляться отдельным документом, а не строкой в общем пользовательском соглашении. Это касается и форм захвата лидов, и сценариев обзвона, и того, что агент говорит в первые секунды разговора. Что именно можно записывать и на каких основаниях — разбираем в материале про 152-ФЗ и запись разговоров.

Юридическая часть здесь справочная

Это ориентир для технического решения, а не правовое заключение. Конфигурацию хранения данных, основания обработки и формулировки согласия нужно согласовывать с вашим юристом или DPO.

Устойчивость: доступ к API — не ваш актив

Третий риск самый неприятный, потому что он не про качество и не про деньги. По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских номеров и юридических лиц ограничен. Схема через прокси и зарубежное юрлицо работает ровно до тех пор, пока её не закроют с той стороны — и вы об этом узнаете от клиентов, а не от вендора.

Для первой линии продаж и поддержки это означает конкретную вещь: в цепочке появляется звено, на которое вы не влияете. У локального стека этой проблемы нет — но у него есть свои, о них ниже. Если вы всерьёз считаете риски владения архитектурой, это тот же разговор, что и своя разработка или готовая платформа.

Что ставить на каждый слой

Выбор делается не «моделью целиком», а послойно. Одна и та же система может использовать локальный STT и локальный TTS, а рассуждающую модель — какую угодно, если персональные данные до неё не доходят.

СлойЛокальный вариантЗападныйЧто решает выбор
STT (распознавание)Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKitаудио-API OpenAI, GoogleТочность на русском в узкополосной телефонии, задержка, попадание аудио за границу
LLM (логика диалога)GigaChat, YandexGPTGPT, GeminiСложные рассуждения против предсказуемости доступа
TTS (синтез)SpeechKit с Brand Voice, Salute Speechзарубежные TTSГолос бренда, качество кириллицы, задержка
Хранение записей и транскриптовYandex Cloud, VK Cloud, Cloud.ruзарубежные облакаЛокализация по 152-ФЗ
Телефония и SIPMango Office, UIS, Телфин, МТС Exolve, Asteriskне применимоСвязность с российскими операторами и маркировка звонков

Практический вывод из таблицы: два слоя из пяти (хранение и телефония) в России локальны по умолчанию, ещё два (STT и TTS) закрыты локальными сервисами вполне рабочего уровня. Спорным остаётся один слой — LLM. Именно там и стоит вести дискуссию, а не переносить её на весь стек.

Производство0:00
Звонок с фактурой, но без многошаговых рассуждений: уточнение параметров, расчёт по прайсу и фиксация договорённости — вот реальная нагрузка на модель.

Ограничения: в чём российские модели слабее западных?

  • Редкие языки. Если в базе есть звонки на языках за пределами русского и основных языков СНГ, западные модели покрывают их шире.
  • Сложные рассуждения. На длинных многошаговых задачах с расчётами и ветвлениями фронтирные западные модели пока сильнее.
  • Экосистема инструментов. Библиотеки, фреймворки агентов, готовые интеграции, документация и сообщество вокруг западных API объёмнее — часть велосипедов придётся написать самим.

И встречный вопрос: сколько из этого нужно в звонке на 60–90 секунд, где агент квалифицирует заявку или подтверждает запись? Обычно — почти ничего.

Здесь же развенчаем распространённый миф: «взять самую сильную модель — и агент будет понимать как человек». Препринт τ-bench (Sierra совместно с Принстоном, arXiv:2406.12045) показывает, что GPT-4o решает retail-задачу с первого раза примерно в 61% случаев, но при восьми повторных прогонах одной и той же задачи pass^8 падает ниже 25%. Сильная модель не даёт стабильности — стабильность дают сценарий, база знаний, guardrails и правила эскалации. По нашей оценке, порядка 80% качества разговора определяется именно этим слоем, а не тем, чей API стоит под капотом.

Вывод

Спор «российские модели или западные» в голосовых звонках решается не бенчмарками качества. Прокси съедает бюджет латентности, который и так тесный; трансграничная передача записей создаёт юридический риск по 152-ФЗ; доступ к зарубежным аудио-API для российских юрлиц ограничен и от вас не зависит. Локальный стек проигрывает в универсальности и выигрывает в предсказуемости — а для первой линии предсказуемость важнее. Начинать всё равно стоит не с модели, а со сценария, базы знаний и интеграции с CRM и телефонией. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.

Частые вопросы

Что лучше для голосового агента — GigaChat или GPT?
На абстрактных бенчмарках западные модели сильнее, но в звонке решают три другие вещи: задержка, легальность обработки данных и стабильность доступа к API. По этим трём GigaChat и YandexGPT предсказуемее. На типовых сценариях первой линии — квалификация, запись, статус заказа — разницы в качестве диалога вы, скорее всего, не заметите.
Законно ли использовать OpenAI через прокси в России?
152-ФЗ требует, чтобы персональные данные россиян хранились в базах на территории РФ, а записи разговоров и транскрипты — это персональные данные. Маршрут через зарубежный API означает трансграничную передачу, у которой должны быть свои основания. Это справочное пояснение, а не юридическая консультация: конфигурацию нужно согласовать с юристом.
Насколько прокси увеличивает задержку ответа агента?
Точная цифра зависит от маршрута, но важен не средний прирост, а нестабильность: латентность в звонке меряют по P95. Целевой порог естественности — менее 500 мс P95, при том что каскад STT–LLM–TTS без оптимизации даёт 670–3200 мс (оценки Coval и Hamming). Лишнее сетевое плечо тратит бюджет, которого в этой сумме уже нет.
Можно ли смешивать российские и западные модели в одном агенте?
Да, стек собирается послойно, и это частая схема. Обычно локальными делают STT, TTS, хранение записей и телефонию, а спорным остаётся только слой LLM. Ключевое условие — чтобы персональные данные клиента не уходили за пределы контура, в котором вы имеете право их обрабатывать.
Спор о моделях решается в первом же живом звонке

Соберите агента по своему сайту и позвоните ему — это бесплатно. Задержка, русская речь и поведение на уточнениях слышны в разговоре точнее, чем читаются в бенчмарках моделей.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.