Quick answer: Todo modelo de coste pensado para texto se rompe con la voz. El texto se factura por tokens, proporcionales a la información. El audio se factura por duración, proporcional al tiempo — incluido...

Economía unitaria de las APIs de audio en tiempo real

Updated September 1, 2026 · first published September 1, 2026

Todo modelo de coste pensado para texto se rompe con la voz. El texto se factura por tokens, proporcionales a la información. El audio se factura por duración, proporcional al tiempo — incluido todo el tiempo en que no pasa nada útil.

Qué pagas de verdad

Una interacción de voz suele apilar tres o cuatro cargos: transcripción de entrada, la llamada al modelo (por minuto de audio en las APIs realtime), síntesis de salida y, a menudo, la sesión abierta. Ese último es la trampa: el silencio, a precio de minuto, es producto a tarifa completa.

Dónde fallan las estimaciones

Se modela tiempo hablado × tarifa y se queda corto. Faltan las pausas y la latencia, el audio generado que el usuario interrumpió, los reintentos (que repiten audio, no solo tokens) y las llamadas abandonadas.

La métrica que funciona

Coste por conversación completada, no por minuto. Y cierra las sesiones inactivas: suele ser el mayor ahorro disponible.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research