Перейти к содержанию

Экономика единицы realtime- и аудио-API

Обновлено September 1, 2026 · впервые опубликовано September 1, 2026

Краткий ответ: Любая модель затрат, построенная для текстовых LLM, ломается на голосе. Текст тарифицируется токенами, а токены пропорциональны информации. Аудио тарифицируется по длительности, а длительность...

Любая модель затрат, построенная для текстовых LLM, ломается на голосе. Текст тарифицируется токенами, а токены пропорциональны информации. Аудио тарифицируется по длительности, а длительность пропорциональна времени — включая все время, в которое ничего полезного не происходит.

За что вы платите на самом деле

Одно голосовое взаимодействие обычно складывается из трех-четырех оплачиваемых позиций. Распознавание речи входящего аудио. Сам вызов модели, который в realtime-API речь-в-речь тарифицируется за минуту входящего и исходящего аудио, а не за токены. Синтез речи на выходе, если стек не сквозной. И часто отдельная плата за то, что сессия остается открытой.

Последний пункт и есть ловушка. Сессия, открытая, пока пользователь думает, читает что-то на экране или отходит, остается сессией. По счетчику за минуты тишина — это продукт по полной цене.

Где оценки ошибаются

Команды считают стоимость голоса как время речи × тариф и попадают сильно ниже фактических расходов. Не учитываются четыре вещи. Задержки и паузы тарифицируются, но не моделируются. Перебивания означают, что сгенерированный и оплаченный звук так и не был услышан звонящим. Повторы и переспросы воспроизводят весь диалог, и повтор голоса обходится намного дороже текстового, потому что повторяется аудио, а не только токены. И брошенные звонки стоят полной длительности до момента отбоя и ничего не дают взамен.

Метрика, которая работает

Стоимость завершенного разговора, а не стоимость минуты. Поминутный счетчик — это измеритель, а не единица деловой ценности, и изменение, которое сокращает звонки за счет улучшения модели, может повысить стоимость минуты, но снизить стоимость того, чтобы довести звонящего до ответа.

Затем измеряйте те части, которые никто не видит: медианную и p95 длительность сессии, соотношение оплаченного и произнесенного времени, долю брошенных сессий и стоимость брошенных сессий в общей сумме. Агрессивно закрывайте простаивающие сессии: таймаут простоя обычно является самой большой экономией, доступной в голосовом стеке. И относитесь к поддержке перебивания (barge-in) как к функции экономии не меньше, чем к функции UX, ведь каждая секунда речи, поверх которой говорит пользователь, — это секунда, которую вы заплатили за генерацию.

Связанное

По теме


Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →

Вернуться на finopsllm.com