Quick answer: Kosten per API-verzoek zijn informatief, maar vertegenwoordigen niet de eenheid die gebruikers afnemen. Een aanroep die faalt, drie keer opnieuw probeert of een onbruikbaar antwoord oplevert, is geen...

Kosten per geslaagde taak versus kosten per verzoek

Updated August 27, 2026 · first published August 27, 2026

Kosten per API-verzoek zijn informatief, maar vertegenwoordigen niet de eenheid die gebruikers afnemen. Een aanroep die faalt, drie keer opnieuw probeert of een onbruikbaar antwoord oplevert, is geen voltooide taak. Voor AI-productiesystemen is de doorslaggevende metriek de kosten per geslaagde taak: alle toewijsbare model- en toolkosten gedeeld door het aantal taken dat aan een vooraf gedefinieerde kwaliteitsdrempel voldoet.

De berekening

Gebruik de formule: kosten_geslaagde_taak = totale toewijsbare uitgaven / geslaagde taken. Neem input-, output-, cache-, reasoning-, tool-, retry- en fallback-kosten mee. Definieer succes vooraf: een door de eindgebruiker geaccepteerd supportantwoord, een classificatie boven een betrouwbaarheidsdrempel of een workflow die zonder menselijke herstelactie is afgerond.

Waarom gemiddelden per verzoek misleidend zijn

Gemiddelden per verzoek lijken gunstiger te worden wanneer goedkope, mislukte pogingen worden meegeteld. Bovendien verbergen ze de dure lange staart: een functionaliteit kan een lage mediane aanroepkost hebben, terwijl mislukte gevallen dure redeneermodellen en handmatige reviews verslinden. Segmenteer op feature, model, klantcohort en uitkomst, en rapporteer p50- en p95-kosten per geslaagde taak naast het succespercentage.

Instrumenteer de noemer

Elke model-span heeft een request-ID en feature-tag nodig; de applicatie moet vervolgens een uitkomst-event uitzenden dat aan die ID is gekoppeld. Registreer succes, storingsreden, handmatige correcties, latentie en zakelijke waarde. Reconcilieer providerfacturen met de teller en neem steekproeven van voltooide taken om de noemer te valideren.

Gebruik de metriek voor gerichte optimalisatie

Als de aanroepkost hoog is maar het succespercentage optimaal, bieden caching of slimmere modelroutering uitkomst. Als de aanroepkost laag is maar de kosten per geslaagde taak hoog zijn, is kwaliteit het probleem: overmatige retries, ontoereikende modellen of slechte stopcondities. Optimaliseer altijd de metriek die faalkosten meerekent en bewaak de kwaliteits-SLO.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research