Economia unitária das APIs de áudio em tempo real
Updated September 1, 2026 · first published September 1, 2026
Qualquer modelo de custo feito para texto parte-se na voz. O texto é faturado por tokens, proporcionais à informação. O áudio é faturado por duração, proporcional ao tempo — incluindo todo o tempo em que nada de útil acontece.
O que paga de facto
Uma interação de voz empilha três ou quatro cobranças: transcrição à entrada, a chamada ao modelo (ao minuto de áudio nas APIs realtime), síntese à saída e, muitas vezes, a sessão aberta. É esta a armadilha: ao minuto, o silêncio é produto a preço inteiro.
Onde as estimativas falham
Modela-se tempo falado × tarifa e fica-se muito abaixo. Faltam pausas e latência, áudio gerado que o utilizador interrompeu, repetições (que repetem áudio, não só tokens) e chamadas abandonadas.
A métrica que funciona
Custo por conversa concluída, não por minuto. E feche sessões inativas: costuma ser a maior poupança disponível.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →