Quick answer: Tout modèle de coût conçu pour le texte se casse sur la voix. Le texte se facture en tokens, proportionnels à l’information. L’audio se facture en durée, proportionnelle au temps — y compris...

Économie unitaire des API audio temps réel

Updated September 1, 2026 · first published September 1, 2026

Tout modèle de coût conçu pour le texte se casse sur la voix. Le texte se facture en tokens, proportionnels à l’information. L’audio se facture en durée, proportionnelle au temps — y compris tout le temps où rien d’utile ne se passe.

Ce que vous payez réellement

Une interaction vocale empile trois ou quatre facturations : transcription en entrée, appel modèle (à la minute d’audio sur les API temps réel), synthèse en sortie, et souvent la session ouverte. C’est ce dernier point le piège : au compteur à la minute, le silence est un produit à plein tarif.

Où les estimations dérapent

On modélise temps de parole × tarif et on tombe trop bas. Manquent les pauses et la latence, l’audio généré que l’appelant a interrompu, les reprises (qui rejouent l’audio, pas seulement les tokens) et les appels abandonnés.

La bonne métrique

Coût par conversation aboutie, pas par minute. Et fermez les sessions inactives : c’est en général la plus grosse économie disponible.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research