Экономика единицы realtime- и аудио-API
Обновлено September 1, 2026 · впервые опубликовано September 1, 2026
Любая модель затрат, построенная для текстовых LLM, ломается на голосе. Текст тарифицируется токенами, а токены пропорциональны информации. Аудио тарифицируется по длительности, а длительность пропорциональна времени — включая все время, в которое ничего полезного не происходит.
За что вы платите на самом деле
Одно голосовое взаимодействие обычно складывается из трех-четырех оплачиваемых позиций. Распознавание речи входящего аудио. Сам вызов модели, который в realtime-API речь-в-речь тарифицируется за минуту входящего и исходящего аудио, а не за токены. Синтез речи на выходе, если стек не сквозной. И часто отдельная плата за то, что сессия остается открытой.
Последний пункт и есть ловушка. Сессия, открытая, пока пользователь думает, читает что-то на экране или отходит, остается сессией. По счетчику за минуты тишина — это продукт по полной цене.
Где оценки ошибаются
Команды считают стоимость голоса как время речи × тариф и попадают сильно ниже фактических расходов. Не учитываются четыре вещи. Задержки и паузы тарифицируются, но не моделируются. Перебивания означают, что сгенерированный и оплаченный звук так и не был услышан звонящим. Повторы и переспросы воспроизводят весь диалог, и повтор голоса обходится намного дороже текстового, потому что повторяется аудио, а не только токены. И брошенные звонки стоят полной длительности до момента отбоя и ничего не дают взамен.
Метрика, которая работает
Стоимость завершенного разговора, а не стоимость минуты. Поминутный счетчик — это измеритель, а не единица деловой ценности, и изменение, которое сокращает звонки за счет улучшения модели, может повысить стоимость минуты, но снизить стоимость того, чтобы довести звонящего до ответа.
Затем измеряйте те части, которые никто не видит: медианную и p95 длительность сессии, соотношение оплаченного и произнесенного времени, долю брошенных сессий и стоимость брошенных сессий в общей сумме. Агрессивно закрывайте простаивающие сессии: таймаут простоя обычно является самой большой экономией, доступной в голосовом стеке. И относитесь к поддержке перебивания (barge-in) как к функции экономии не меньше, чем к функции UX, ведь каждая секунда речи, поверх которой говорит пользователь, — это секунда, которую вы заплатили за генерацию.
Связанное
По теме
Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →