Своя разработка или готовая платформа: где ломается расчёт
Своя разработка или платформа: три варианта, что берёте на себя и где скрытая стоимость. Разбор с цифрами по рынку РФ.
Выбор «своя разработка или платформа» почти всегда приходит в одной формулировке: у нас есть разработчики, зачем платить за подписку. Короткий ответ: платформа продаёт скорость запуска и снятый с вас слой инфраструктуры, но оставляет зависимость от чужой дорожной карты. Своя разработка отдаёт контроль и забирает время команды — а минуту разговора дешевле она не делает.
Считать нужно не цену минуты, а стоимость владения. Полная себестоимость минуты качественного AI-звонка — около 14,15 ₽ по расчёту LPTracker: телефония примерно 1,65 ₽, распознавание речи до 5 ₽, LLM 4–6 ₽, синтез речи около 1,5 ₽. Эти слои не исчезают, когда вы пишете код сами. Вы покупаете те же STT, LLM и TTS у тех же поставщиков — только без объёма платформы и без её инженеров.
Вариантов при этом не два, а три. Разница между ними не в технологии, а в том, какую часть работы вы забираете себе.
Три варианта и чем вы за них платите
Готовая платформа под ключ. Вендор держит стек, телефонию, интеграции и качество разговора; вы описываете сценарий и запускаетесь. Порог входа низкий: подписки на платформы ИИ-агентов начинаются от 590 ₽/мес по обзору сервиса albato, дальше цена определяется объёмом разговоров. Платите вы зависимостью — приоритеты доработок ставит вендорский бэклог, а не ваш.
Конструктор. Voximplant и подобные среды дают телефонию, движок сценариев и подключение моделей, но агента вы собираете сами: инфраструктура связи чужая, логика и качество диалога — ваши. Здесь чаще всего происходит подмена понятий: «мы сделали своё» означает «мы собрали своё на чужой платформе». Зависимость никуда не делась, просто стала менее заметной.
Собственная разработка на API. Вы соединяете распознавание, LLM, синтез и SIP-телефонию самостоятельно. Разработка кастомного решения начинается от 150 000 ₽ по оценке интегратора gravitel — но это цена первой рабочей версии, а не системы, которая держит поток живых звонков. Дальше идут месяцы доводки, дежурство, обновления моделей и вся ответственность за качество диалога.
Что выбрать: свою разработку или платформу?
| Вариант | Когда подходит | Что берёте на себя | Где скрытая стоимость |
|---|---|---|---|
| Платформа под ключ | Результат нужен на горизонте недель, сценарии типовые для рынка | Сценарий, данные, регламент эскалации | Зависимость от дорожной карты вендора и от его тарифов при росте объёма |
| Конструктор | Есть инженер и нестандартная логика, но нет желания держать телефонию | Диалог, промпты, качество, тестирование | Ваша команда становится вторым уровнем поддержки, а лицензия платформы всё равно оплачивается |
| Своя разработка | Звонки — ядро продукта, а не подпорка | Весь стек: латентность, отказоустойчивость, доступ к моделям, хранение данных по 152-ФЗ | Зарплата команды и её время — вне «цены минуты» |
Минута дешевле не станет: слои остаются те же
Обоснование своей разработки обычно звучит так: у вендора минута стоит X, по прайсу API — вдвое меньше, значит соберём сами. Сравнение некорректно по построению. В себестоимость собственной минуты не входит зарплата команды, дежурство при инцидентах, переписывание интеграций после обновления CRM и разбор жалоб. Сравнивать надо стоимость владения за год: подписка плюс внедрение против ФОТ, инфраструктуры и задач, которые команда за это время не сделала.
На этом же месте ломается миф «дёшево значит выгодно». Предложения по 1–3 ₽/мин — это не более выгодная версия того же продукта, а другая технология: скриптовый робот с ветвлением по ключевым словам. Разрыв с себестоимостью около 14 ₽/мин у полноценного LLM-агента (расчёт LPTracker) — не жадность вендоров, а разница в том, что происходит внутри звонка. Подробный разбор слоёв — в статье сколько стоит голосовой AI-агент, а то, что не попадает ни в один прайс, — в разборе скрытых затрат на внедрение.
500 мс и доступ к моделям: что придётся решать самим
Главный технический риск самостоятельной сборки — латентность. Порог естественности разговора — менее 500 мс в 95-м перцентиле; свыше секунды собеседник слышит робота. Разложение по слоям (оценки Coval и Hamming): распознавание 100–400 мс, LLM 200–1000 мс, синтез 100–500 мс, плюс сеть и телефония. Каскадная система без оптимизации суммарно даёт 670–3200 мс. То есть «просто соединить три API» по умолчанию даёт агента, которого клиент не дослушивает.
Вторая задача — доступ к моделям. По публикациям на Habr, доступ к аудио-API OpenAI и Google Gemini для российских юрлиц и номеров ограничен, работа через прокси добавляет задержку и создаёт юридические риски трансграничной передачи данных. При бюджете менее 500 мс лишний прокси-хоп — это не мелочь. Остаётся локальный стек: Яндекс SpeechKit, Salute Speech, Tinkoff VoiceKit, GigaChat, YandexGPT. Выбор между ними и западными API — отдельный разговор, но в своей разработке вы ведёте его сами, включая миграцию, когда доступ изменится снова.
Платформа эти проблемы не отменяет — она решила их один раз и амортизирует решение по всем клиентам. Своя разработка означает, что вы решаете их с нуля и поддерживаете дальше.
Ограничения: почему «у нас есть разработчики» — плохое основание
Наличие команды отвечает на вопрос, способны ли вы построить. Оно не отвечает на вопрос, стоит ли.
- Разработчики уже заняты. Голосовой агент — не проект на пару спринтов, а система, которую надо держать в проде: следить за латентностью, обновлять модели, чинить интеграции. Эта нагрузка вычитается из вашего основного продукта.
- Голос — не веб. Сильный бэкенд-опыт не даёт опыта в endpointing, обработке перебиваний и ошибках распознавания на узкополосной телефонии. Это набивается на живом трафике, а не читается в документации.
- Цена минуты вводит в заблуждение. См. предыдущий раздел: в самосборной минуте не сидит ваш ФОТ.
Своя разработка оправдана, когда выполняются три условия одновременно: звонки — ядро вашего продукта, а не вспомогательная функция; объём такой, что подписка сопоставима с фондом оплаты труда выделенной команды; есть требование, которое платформы не закрывают, — закрытый контур, редкая телефония, своя дообученная модель. Если выполняется одно из трёх — это аргумент за конструктор, а не за разработку с нуля. Ни одно — берите готовое.
Частые вопросы
Что дешевле: своя разработка или платформа?
Можно ли собрать голосового агента на API самому?
Работают ли западные API в России?
Чем конструктор отличается от платформы под ключ?
Что в итоге
Три варианта отличаются не ценой, а тем, где проходит граница вашей ответственности. Платформа берёт на себя стек и качество разговора, конструктор оставляет вам диалог, своя разработка — всё сразу. Цена минуты в этом сравнении почти бесполезна: слои одни и те же, разница в том, кто их обслуживает и чья зарплата за это платится. Прежде чем решать, пройдите 12 вопросов к любому решению — они показывают, какой из трёх вариантов вам вообще нужен. Если хотите проверить это на своих звонках — можем собрать демо на вашем сценарии.
