реплика

Своя разработка или готовая платформа: где ломается расчёт

Своя разработка или платформа: три варианта, что берёте на себя и где скрытая стоимость. Разбор с цифрами по рынку РФ.

ИШИлья ШандульскийИлья Шандульскийco-founder & CTO «Реплика»·19 ноября 2025·7 минут чтения

Выбор «своя разработка или платформа» почти всегда приходит в одной формулировке: у нас есть разработчики, зачем платить за подписку. Короткий ответ: платформа продаёт скорость запуска и снятый с вас слой инфраструктуры, но оставляет зависимость от чужой дорожной карты. Своя разработка отдаёт контроль и забирает время команды — а минуту разговора дешевле она не делает.

Считать нужно не цену минуты, а стоимость владения. Полная себестоимость минуты качественного AI-звонка — около 14,15 ₽ по расчёту LPTracker: телефония примерно 1,65 ₽, распознавание речи до 5 ₽, LLM 4–6 ₽, синтез речи около 1,5 ₽. Эти слои не исчезают, когда вы пишете код сами. Вы покупаете те же STT, LLM и TTS у тех же поставщиков — только без объёма платформы и без её инженеров.

Вариантов при этом не два, а три. Разница между ними не в технологии, а в том, какую часть работы вы забираете себе.

Три варианта и чем вы за них платите

Готовая платформа под ключ. Вендор держит стек, телефонию, интеграции и качество разговора; вы описываете сценарий и запускаетесь. Порог входа низкий: подписки на платформы ИИ-агентов начинаются от 590 ₽/мес по обзору сервиса albato, дальше цена определяется объёмом разговоров. Платите вы зависимостью — приоритеты доработок ставит вендорский бэклог, а не ваш.

Конструктор. Voximplant и подобные среды дают телефонию, движок сценариев и подключение моделей, но агента вы собираете сами: инфраструктура связи чужая, логика и качество диалога — ваши. Здесь чаще всего происходит подмена понятий: «мы сделали своё» означает «мы собрали своё на чужой платформе». Зависимость никуда не делась, просто стала менее заметной.

Собственная разработка на API. Вы соединяете распознавание, LLM, синтез и SIP-телефонию самостоятельно. Разработка кастомного решения начинается от 150 000 ₽ по оценке интегратора gravitel — но это цена первой рабочей версии, а не системы, которая держит поток живых звонков. Дальше идут месяцы доводки, дежурство, обновления моделей и вся ответственность за качество диалога.

Что выбрать: свою разработку или платформу?

ВариантКогда подходитЧто берёте на себяГде скрытая стоимость
Платформа под ключРезультат нужен на горизонте недель, сценарии типовые для рынкаСценарий, данные, регламент эскалацииЗависимость от дорожной карты вендора и от его тарифов при росте объёма
КонструкторЕсть инженер и нестандартная логика, но нет желания держать телефониюДиалог, промпты, качество, тестированиеВаша команда становится вторым уровнем поддержки, а лицензия платформы всё равно оплачивается
Своя разработкаЗвонки — ядро продукта, а не подпоркаВесь стек: латентность, отказоустойчивость, доступ к моделям, хранение данных по 152-ФЗЗарплата команды и её время — вне «цены минуты»

Минута дешевле не станет: слои остаются те же

Обоснование своей разработки обычно звучит так: у вендора минута стоит X, по прайсу API — вдвое меньше, значит соберём сами. Сравнение некорректно по построению. В себестоимость собственной минуты не входит зарплата команды, дежурство при инцидентах, переписывание интеграций после обновления CRM и разбор жалоб. Сравнивать надо стоимость владения за год: подписка плюс внедрение против ФОТ, инфраструктуры и задач, которые команда за это время не сделала.

На этом же месте ломается миф «дёшево значит выгодно». Предложения по 1–3 ₽/мин — это не более выгодная версия того же продукта, а другая технология: скриптовый робот с ветвлением по ключевым словам. Разрыв с себестоимостью около 14 ₽/мин у полноценного LLM-агента (расчёт LPTracker) — не жадность вендоров, а разница в том, что происходит внутри звонка. Подробный разбор слоёв — в статье сколько стоит голосовой AI-агент, а то, что не попадает ни в один прайс, — в разборе скрытых затрат на внедрение.

500 мс и доступ к моделям: что придётся решать самим

Главный технический риск самостоятельной сборки — латентность. Порог естественности разговора — менее 500 мс в 95-м перцентиле; свыше секунды собеседник слышит робота. Разложение по слоям (оценки Coval и Hamming): распознавание 100–400 мс, LLM 200–1000 мс, синтез 100–500 мс, плюс сеть и телефония. Каскадная система без оптимизации суммарно даёт 670–3200 мс. То есть «просто соединить три API» по умолчанию даёт агента, которого клиент не дослушивает.

Вторая задача — доступ к моделям. По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских юрлиц и номеров ограничен, работа через прокси добавляет задержку и создаёт юридические риски трансграничной передачи данных. При бюджете менее 500 мс лишний прокси-хоп — это не мелочь. Остаётся локальный стек: Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKit, GigaChat, YandexGPT. Выбор между ними и западными API — отдельный разговор, но в своей разработке вы ведёте его сами, включая миграцию, когда доступ изменится снова.

Что здесь важно

Платформа эти проблемы не отменяет — она решила их один раз и амортизирует решение по всем клиентам. Своя разработка означает, что вы решаете их с нуля и поддерживаете дальше.

Сервисная компания0:00
Слушайте паузы и реакцию на встречные реплики: в своей сборке эти сотни миллисекунд придётся держать самим.

Ограничения: почему «у нас есть разработчики» — плохое основание

Наличие команды отвечает на вопрос, способны ли вы построить. Оно не отвечает на вопрос, стоит ли.

  • Разработчики уже заняты. Голосовой агент — не проект на пару спринтов, а система, которую надо держать в проде: следить за латентностью, обновлять модели, чинить интеграции. Эта нагрузка вычитается из вашего основного продукта.
  • Голос — не веб. Сильный бэкенд-опыт не даёт опыта в endpointing, обработке перебиваний и ошибках распознавания на узкополосной телефонии. Это набивается на живом трафике, а не читается в документации.
  • Цена минуты вводит в заблуждение. См. предыдущий раздел: в самосборной минуте не сидит ваш ФОТ.

Своя разработка оправдана, когда выполняются три условия одновременно: звонки — ядро вашего продукта, а не вспомогательная функция; объём такой, что подписка сопоставима с фондом оплаты труда выделенной команды; есть требование, которое платформы не закрывают, — закрытый контур, редкая телефония, своя дообученная модель. Если выполняется одно из трёх — это аргумент за конструктор, а не за разработку с нуля. Ни одно — берите готовое.

Частые вопросы

Что дешевле: своя разработка или платформа?
На горизонте одного проекта — почти всегда платформа: подписки начинаются от 590 ₽/мес (обзор albato), а разработка кастомного решения — от 150 000 ₽ (оценка gravitel), и это только первая версия. Своя разработка может выиграть на больших постоянных объёмах, но считать нужно полную стоимость владения за год вместе с зарплатой команды.
Можно ли собрать голосового агента на API самому?
Технически да: распознавание, LLM, синтез и телефония доступны по API. Сложность не в подключении, а в удержании латентности менее 500 мс P95 — каскад без оптимизации даёт 670–3200 мс по разложению Coval и Hamming.
Работают ли западные API в России?
По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских юрлиц и номеров ограничен, а прокси добавляет задержку и риски трансграничной передачи данных. Практическая альтернатива — локальный стек: Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKit, GigaChat, YandexGPT.
Чем конструктор отличается от платформы под ключ?
В конструкторе вендор даёт телефонию и среду, а сценарий, промпты и качество диалога делаете вы. Это даёт больше контроля, но поддержка агента после запуска ложится на вашу команду, при этом лицензия платформы всё равно оплачивается.

Что в итоге

Три варианта отличаются не ценой, а тем, где проходит граница вашей ответственности. Платформа берёт на себя стек и качество разговора, конструктор оставляет вам диалог, своя разработка — всё сразу. Цена минуты в этом сравнении почти бесполезна: слои одни и те же, разница в том, кто их обслуживает и чья зарплата за это платится. Прежде чем решать, пройдите 12 вопросов к любому решению — они показывают, какой из трёх вариантов вам вообще нужен. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.

Задача латентности, которая уже решена за вас

Прежде чем оценивать сборку на API, дайте адрес своего сайта: агент по нему собирается бесплатно, и готовому можно позвонить. Паузы, перебивания и ответы по вашим услугам — это и есть работа, которую предстоит повторить.

собрать агента бесплатноВведёте адрес сайта — агент соберётся сам. Ему можно позвонить и поговорить.