L'economia unitaria delle API realtime e audio
Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026
Ogni modello di costo pensato per il testo si rompe con la voce. Il testo si fattura a token, proporzionali all'informazione. L'audio si fattura a durata, proporzionale al tempo — incluso tutto il tempo in cui non succede nulla di utile.
Cosa paghi davvero
Un'interazione vocale di solito somma tre o quattro voci fatturate: il riconoscimento vocale dell'audio in ingresso, la chiamata al modello (che sulle API speech-to-speech realtime si paga al minuto di audio in entrata e in uscita, non a token), la sintesi vocale in uscita se lo stack non è end-to-end, e spesso un addebito separato per la sessione che resta aperta.
Quest'ultimo è il tranello. Una sessione tenuta aperta mentre l'utente riflette, legge qualcosa sullo schermo o si allontana è comunque una sessione. Con un contatore al minuto, il silenzio è un prodotto a tariffa piena.
Dove le stime sbagliano
I team modellano il costo vocale come tempo di parlato × tariffa e finiscono ben sotto il reale. Mancano quattro cose. Latenza e pause sono fatturate ma non modellate. Le interruzioni comportano audio generato e pagato che il chiamante non ha mai sentito. Retry e ri-prompt riproducono l'intero scambio, e un retry vocale costa molto più di uno testuale perché ripete l'audio, non solo i token. E le chiamate abbandonate costano l'intera durata fino al riagganciamento senza produrre nulla.
La metrica che funziona
Costo per conversazione completata, non costo al minuto. Il minuto è il contatore, non l'unità di valore di business: una modifica che accorcia le chiamate migliorando il modello può far salire la tariffa al minuto e abbassare il costo per portare un chiamante a una risposta.
Poi strumenta le parti che nessuno vede: durata mediana e p95 delle sessioni, rapporto tra tempo fatturato e tempo parlato, tasso di abbandono, e costo delle sessioni abbandonate come quota del totale. Chiudi le sessioni inattive con decisione; un timeout di inattività è di solito il singolo risparmio più grande disponibile in uno stack vocale. E tratta il supporto al barge-in come una funzione di costo oltre che di UX, perché ogni secondo di parlato che l'utente copre è un secondo che hai pagato per generare.
Correlati
Correlati
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →