Ga naar inhoud

De tokenkosten van JSON-modus en schema's

Bijgewerkt September 1, 2026 · eerst gepubliceerd September 1, 2026

Kort antwoord: Een model om gestructureerde output vragen lijkt een opmaakkeuze. Op de rekening is het een volumekeuze, en die landt op drie plekken tegelijk.Het schema is een inputkost bij elk verzoekEen...

Een model om gestructureerde output vragen lijkt een opmaakkeuze. Op de rekening is het een volumekeuze, en die landt op drie plekken tegelijk.

Het schema is een inputkost bij elk verzoek

Een responseformaat of tooldefinitie wordt in het verzoek geserialiseerd. Een bescheiden schema — een dozijn velden, beschrijvingen bij elk, een paar geneste objecten — is enkele honderden tokens. Dat is klein totdat je het vermenigvuldigt met elke aanroep, bij elke beurt, voor de hele levensduur van de feature. Een schema van 400 tokens bij een miljoen aanroepen is 400 miljoen inputtokens waarvoor je betaalt om een vorm te beschrijven die nooit verandert.

Erger nog: in naïeve implementaties staan schema's meestal na het vluchtige deel van de prompt, wat het gecachete prefix breekt. Het schema kost dan elke keer volle prijs en vernietigt de korting op alles ervoor.

Syntaxis is een outputkost

Elke accolade, aanhalingsteken, komma en veldnaam in het antwoord is een gegenereerd token waarvoor je tegen het outputtarief wordt gefactureerd. Uitgebreide veldnamen zijn een terugkerende kostenpost: customer_shipping_address_line_one kost voor altijd meer dan addr1. Diep geneste objecten betalen voor hun eigen steigerwerk. Bij korte antwoorden in een grote envelop kan de structuur de inhoud echt overtreffen.

Retries zijn het dure deel

Constrained decoding bij de grote providers maakt schemaschendingen zeldzaam, maar validatiefouten komen nog voor — een veld dat het model niet eerlijk kan invullen, een enum zonder juist antwoord, een schema dat voor een lezer dubbelzinnig is. Elke fout kost een volledige retry: alle inputtokens opnieuw, alle outputtokens opnieuw, plus latentie. Een ongeldigheidspercentage van 2% op een endpoint met hoog volume is 2% hogere kosten zonder dat daar iets tegenover staat.

Wat je concreet moet doen

Zet het schema in het stabiele prefix zodat het gecachet wordt en houd het identiek over aanroepen heen. Vraag alleen om velden die je gebruikt — extra velden betaal je dubbel, eenmaal in het schema en eenmaal in het antwoord. Geef de voorkeur aan korte veldnamen en vlakke structuren. Waar de output één waarde is, verpak die dan helemaal niet in een object. En meet je percentage validatiefouten: dat is het enige deel hiervan dat pure verspilling is.

Gerelateerd

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com