Hoe promptstijl op de rekening terechtkomt
Bijgewerkt September 1, 2026 · eerst gepubliceerd September 1, 2026
Prompts groeien zoals configuratiebestanden groeien. Iemand voegt een instructie toe om een foutmodus op te lossen. Iemand anders voegt een voorbeeld toe. Een derde voegt een alinea toe die uitlegt waarom de tweede instructie ertoe doet. Er wordt nooit iets verwijderd, omdat verwijderen een bug kan terugbrengen die niemand kan reproduceren. Zes maanden later is de systeemprompt drieduizend tokens lang en kan niemand zeggen welke tweehonderd daarvan dragend zijn.
Waarom het zich opstapelt
In tegenstelling tot output, die met de taak varieert, wordt promptoverhead bij elk afzonderlijk verzoek betaald, identiek, voor altijd. Duizend verspilde tokens op een feature met tien miljoen aanroepen per maand is tien miljard tokens per maand aan pure opmaak.
In gesprekken met meerdere beurten is het erger: de systeemprompt wordt bij elke beurt opnieuw verstuurd, dus de kosten schalen met het aantal beurten, niet met het aantal verzoeken. En in agentlussen, waar één gebruikersactie een dozijn modelaanroepen kan veroorzaken, wordt dezelfde opgeblazen inleiding een dozijn keer gefactureerd voor één stuk werk.
Wat echt verspilling is
Niet beleefdheid, die een handvol tokens kost en soms de naleving verbetert. Het echte gewicht zit in: overbodige instructies die dezelfde regel op drie manieren herhalen, defensieve standaardtekst toegevoegd voor een modelgeneratie die het niet meer nodig heeft, voorbeelden die dupliceren in plaats van afzonderlijke gevallen te dekken, en uitleg gericht op menselijke lezers van het promptbestand in plaats van op het model.
Die derde categorie is in de praktijk de grootste. Few-shot-voorbeelden zijn per token duur en teams herzien zelden of vijf voorbeelden werk doen dat twee ook zouden doen.
Behandel de prompt als code met een budget
Meet de vaste promptoverhead als aandeel van de gemiddelde verzoekgrootte — als die boven de helft ligt, is het een kostenprobleem en geen stijlkwestie. Zet het stabiele deel vooraan zodat caching van toepassing is, wat de resterende opgeblazenheid veel goedkoper maakt zonder iets te verwijderen. Voer dan een ablatie uit: verwijder één blok, draai je evals en behoud de verwijdering als de kwaliteit standhoudt. Prompts inkorten zonder evalsuite is gokken, en de faalmodus — een kwaliteitsregressie die door klanten wordt ontdekt — kost meer dan de bespaarde tokens.
Gerelateerd
Gerelateerd
Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →