Quick answer: De meeste LLM-kostenmodellen hanteren één meter: tokens in, tokens uit, prijs per miljoen. Dat model volstond toen een verzoek uitsluitend tekst genereerde. Het werd ontoereikend op het moment dat...

Servertools vallen buiten de standaard tokenmeter

Updated September 1, 2026 · first published September 1, 2026

De meeste LLM-kostenmodellen hanteren één meter: tokens in, tokens uit, prijs per miljoen. Dat model volstond toen een verzoek uitsluitend tekst genereerde. Het werd ontoereikend op het moment dat server-side tools hun intrede deden.

Web search, web fetch en code-executie draaien op de infrastructuur van de provider, en verschillende tools brengen een vaste toeslag per aanroep in rekening bovenop de geproduceerde tokens. Eén enkele interactieronde kan daardoor dubbel factureren: eenmaal voor de zoekopdrachten zelf, en nogmaals voor de tokens die de zoekresultaten aan de context toevoegen.

Het compounding-effect

De tweede kostenpost wordt stelselmatig over het hoofd gezien. Elk toolresultaat wordt toegevoegd aan de conversatiehistorie, en elke volgende turn verstuurt die complete payload opnieuw als input-tokens. Tien zoekopdrachten vroeg in een agent-run zijn niet slechts tien tariefposten — het zijn tien toeslagen plus de payloads die bij elke volgende stap opnieuw worden belast.

Drie bewezen beheersmaatregelen

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research