Economía unitaria de las APIs de audio en tiempo real
Updated September 1, 2026 · first published September 1, 2026
Todo modelo de coste pensado para texto se rompe con la voz. El texto se factura por tokens, proporcionales a la información. El audio se factura por duración, proporcional al tiempo — incluido todo el tiempo en que no pasa nada útil.
Qué pagas de verdad
Una interacción de voz suele apilar tres o cuatro cargos: transcripción de entrada, la llamada al modelo (por minuto de audio en las APIs realtime), síntesis de salida y, a menudo, la sesión abierta. Ese último es la trampa: el silencio, a precio de minuto, es producto a tarifa completa.
Dónde fallan las estimaciones
Se modela tiempo hablado × tarifa y se queda corto. Faltan las pausas y la latencia, el audio generado que el usuario interrumpió, los reintentos (que repiten audio, no solo tokens) y las llamadas abandonadas.
La métrica que funciona
Coste por conversación completada, no por minuto. Y cierra las sesiones inactivas: suele ser el mayor ahorro disponible.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →