Tokenprijzen daalden, maar de LLM-factuur steeg
Updated August 27, 2026 · first published August 27, 2026
Lagere tokenprijzen zijn geen garantie voor een lagere LLM-factuur. In productie groeit het verbruik vaak sneller dan tarieven dalen: langere contextvensters, meer agent-stappen, omvangrijkere outputs, retries en nieuwe features wissen een prijsdaling van 40% moeiteloos uit. De werkelijke diagnose draait niet om welke provider het goedkoopst is, maar om variantie over vier assen: tarief, volume, mix en efficiëntie.
Tarief is slechts één factor
Stel dat een provider de gemiddelde prijs verlaagt van $10 naar $6 per miljoen tokens. Als het maandelijkse verbruik stijgt van 100 miljoen naar 220 miljoen tokens, stijgt de factuur van $1.000 naar $1.320. De prijs daalde met 40%; de factuur steeg met 32%. Een dashboard dat louter de prijs per token toont noemt dit een overwinning, terwijl finance het tegenovergestelde ziet.
Volume, mix en efficiëntie
Volume weerspiegelt het totaal aantal verbruikte tokens. Mix toont waar de tokens naartoe gingen: een geavanceerd redeneermodel, een andere regio of een context-intensieve feature kan de factuur verhogen bij een gelijk aantal verzoeken. Efficiëntie is de kostprijs om één bruikbaar resultaat te leveren: retries, mislukte toolcalls, overmatige prompts en tekst die gebruikers nooit lezen.
Wekelijkse variantiebrug
Bouw wekelijks een brug vanaf de vorige factuurperiode. Pas tariefwijzigingen toe, vervolgens volume, modelmix en efficiëntieverschuivingen. Alarmeer op de verkeersgewogen kosten per geslaagde taak en optimaliseer de categorie waar de grootste absolute kostenstijging optreedt.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →