Kosten per geslaagde taak versus kosten per verzoek
Updated August 27, 2026 · first published August 27, 2026
Kosten per API-verzoek zijn informatief, maar vertegenwoordigen niet de eenheid die gebruikers afnemen. Een aanroep die faalt, drie keer opnieuw probeert of een onbruikbaar antwoord oplevert, is geen voltooide taak. Voor AI-productiesystemen is de doorslaggevende metriek de kosten per geslaagde taak: alle toewijsbare model- en toolkosten gedeeld door het aantal taken dat aan een vooraf gedefinieerde kwaliteitsdrempel voldoet.
De berekening
Gebruik de formule: kosten_geslaagde_taak = totale toewijsbare uitgaven / geslaagde taken. Neem input-, output-, cache-, reasoning-, tool-, retry- en fallback-kosten mee. Definieer succes vooraf: een door de eindgebruiker geaccepteerd supportantwoord, een classificatie boven een betrouwbaarheidsdrempel of een workflow die zonder menselijke herstelactie is afgerond.
Waarom gemiddelden per verzoek misleidend zijn
Gemiddelden per verzoek lijken gunstiger te worden wanneer goedkope, mislukte pogingen worden meegeteld. Bovendien verbergen ze de dure lange staart: een functionaliteit kan een lage mediane aanroepkost hebben, terwijl mislukte gevallen dure redeneermodellen en handmatige reviews verslinden. Segmenteer op feature, model, klantcohort en uitkomst, en rapporteer p50- en p95-kosten per geslaagde taak naast het succespercentage.
Instrumenteer de noemer
Elke model-span heeft een request-ID en feature-tag nodig; de applicatie moet vervolgens een uitkomst-event uitzenden dat aan die ID is gekoppeld. Registreer succes, storingsreden, handmatige correcties, latentie en zakelijke waarde. Reconcilieer providerfacturen met de teller en neem steekproeven van voltooide taken om de noemer te valideren.
Gebruik de metriek voor gerichte optimalisatie
Als de aanroepkost hoog is maar het succespercentage optimaal, bieden caching of slimmere modelroutering uitkomst. Als de aanroepkost laag is maar de kosten per geslaagde taak hoog zijn, is kwaliteit het probleem: overmatige retries, ontoereikende modellen of slechte stopcondities. Optimaliseer altijd de metriek die faalkosten meerekent en bewaak de kwaliteits-SLO.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →