Quick answer: Il costo per richiesta è un parametro utile, ma non rappresenta l'unità acquistata dagli utenti. Una chiamata che fallisce, esegue tre retry o produce un output inutilizzabile non è lavoro completato....

Il costo per task riuscito supera il semplice costo per richiesta

Updated August 27, 2026 · first published August 27, 2026

Il costo per richiesta è un parametro utile, ma non rappresenta l'unità acquistata dagli utenti. Una chiamata che fallisce, esegue tre retry o produce un output inutilizzabile non è lavoro completato. Per i sistemi AI in produzione, la metrica determinante è il costo per task completato con successo: tutta la spesa per modelli e tool divisa per i task che superano una soglia di qualità definita.

La formula di calcolo

Utilizzate costo_task_riuscito = spesa totale attribuibile / task con esito positivo. Includete token di input, output, cache, ragionamento, chiamate a tool e fallback. Definite il successo prima della misurazione: risposta accettata dal cliente o flusso eseguito senza interventi manuali.

Perché le medie per richiesta ingannano

Il costo medio per richiesta sembra migliorare quando aumentano i tentativi economici falliti. Inoltre nasconde la coda lunga: una funzionalità può avere un costo mediano basso ma generare casi limite che richiedono passaggi di ragionamento complessi e correzioni umane. Monitorate i percentili p50 e p95 del costo per task riuscito.

Strumentare il denominatore

Ogni span del modello necessita di un ID richiesta e di un tag funzionale; l'applicazione deve poi emettere un evento di completamento collegato a quell'ID. Riconciliate le fatture dei provider con il numeratore e campionate i task completati per convalidare il denominatore.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research