Il costo per task riuscito supera il semplice costo per richiesta
Updated August 27, 2026 · first published August 27, 2026
Il costo per richiesta è un parametro utile, ma non rappresenta l'unità acquistata dagli utenti. Una chiamata che fallisce, esegue tre retry o produce un output inutilizzabile non è lavoro completato. Per i sistemi AI in produzione, la metrica determinante è il costo per task completato con successo: tutta la spesa per modelli e tool divisa per i task che superano una soglia di qualità definita.
La formula di calcolo
Utilizzate costo_task_riuscito = spesa totale attribuibile / task con esito positivo. Includete token di input, output, cache, ragionamento, chiamate a tool e fallback. Definite il successo prima della misurazione: risposta accettata dal cliente o flusso eseguito senza interventi manuali.
Perché le medie per richiesta ingannano
Il costo medio per richiesta sembra migliorare quando aumentano i tentativi economici falliti. Inoltre nasconde la coda lunga: una funzionalità può avere un costo mediano basso ma generare casi limite che richiedono passaggi di ragionamento complessi e correzioni umane. Monitorate i percentili p50 e p95 del costo per task riuscito.
Strumentare il denominatore
Ogni span del modello necessita di un ID richiesta e di un tag funzionale; l'applicazione deve poi emettere un evento di completamento collegato a quell'ID. Riconciliate le fatture dei provider con il numeratore e campionate i task completati per convalidare il denominatore.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →