Économie unitaire des API audio temps réel
Updated September 1, 2026 · first published September 1, 2026
Tout modèle de coût conçu pour le texte se casse sur la voix. Le texte se facture en tokens, proportionnels à l’information. L’audio se facture en durée, proportionnelle au temps — y compris tout le temps où rien d’utile ne se passe.
Ce que vous payez réellement
Une interaction vocale empile trois ou quatre facturations : transcription en entrée, appel modèle (à la minute d’audio sur les API temps réel), synthèse en sortie, et souvent la session ouverte. C’est ce dernier point le piège : au compteur à la minute, le silence est un produit à plein tarif.
Où les estimations dérapent
On modélise temps de parole × tarif et on tombe trop bas. Manquent les pauses et la latence, l’audio généré que l’appelant a interrompu, les reprises (qui rejouent l’audio, pas seulement les tokens) et les appels abandonnés.
La bonne métrique
Coût par conversation aboutie, pas par minute. Et fermez les sessions inactives : c’est en général la plus grosse économie disponible.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →