Ga naar inhoud

Claude Haiku 5.5 en de prijsdrempel van 100k tokens

Bijgewerkt October 8, 2026 · eerst gepubliceerd October 8, 2026

Kort antwoord: De kopprijs van Claude Haiku 5.5 hangt af van de lengte van de prompt. Anthropic bracht het model uit op 7 oktober 2026 voor werk met hoog volume, zoals classificatie, samenvattingen en...

De kopprijs van Claude Haiku 5.5 hangt af van de lengte van de prompt. Anthropic bracht het model uit op 7 oktober 2026 voor werk met hoog volume, zoals classificatie, samenvattingen en subagent-taken. Het contextvenster van 1 miljoen tokens is geen belofte dat al die tokens tegen het tarief voor korte prompts worden berekend: een prompt van meer dan 100,000 tokens valt in een duurdere prijstier. Daardoor wordt de omvang van een request een budgetbeslissing, vooral voor agents die documenten en toolresultaten opstapelen.

De prijslijst heeft twee kanten

Hieronder staan de gepubliceerde standaardprijzen van de Claude API van Anthropic in Amerikaanse dollars per miljoen tokens, gecontroleerd op 8 oktober. De grens ligt tussen tot 100,000 prompt-tokens en meer dan 100,000; het is dus geen prijs die alleen wordt berekend voor de tokens boven de drempel. Controleer de actuele prijsdocumentatie voordat je de cijfers in een prognose gebruikt.

TokencategoriePrompt tot 100kPrompt boven 100k
Ongecachete input$0.10$0.50
Output$0.50$2.50
Cache-schrijven (5 minuten)$0.125$0.625
Cache-schrijven (1 uur)$0.20$1.00
Cache-lezen$0.01$0.05

Elk genoemd tokentarief is boven de grens vijf keer zo hoog. Dat betekent niet dat elke applicatierekening vijfvoudig stijgt: de meeste calls blijven mogelijk kort, en outputvolume, caching, tools, batchverwerking, nieuwe pogingen en het slagingspercentage van taken bepalen allemaal de totale uitgaven. Gecachete context neemt nog steeds ruimte in de prompt in; een cache-hit maakt van een request van 120k tokens geen korte prompt.

Hoe de grens eruitziet bij één request

Neem twee illustratieve calls zonder caching of apart gefactureerde tools, elk met 1,000 output-tokens. Een prompt van 99,000 tokens kost ongeveer $0.0104 aan input plus output tegen de tarieven voor korte prompts. Een prompt van 101,000 tokens kost ongeveer $0.0530 tegen de tarieven voor lange prompts. Dat is ruwweg vijf keer zoveel voor een request dat slechts 2,000 input-tokens langer is. Het voorbeeld houdt de output constant om de prijsgrens te isoleren; het is geen gemeten besparing in productie. Echte prompts bevatten ook systeeminstructies, gespreksgeschiedenis, toolschema's en toolresultaten.

Tel opnieuw voordat je migreert

De migratienotities van Anthropic zeggen dat dezelfde tekst op Haiku 5.5 ongeveer 30% meer tokens oplevert dan op Haiku 4.5, afhankelijk van de inhoud. Een prompt die met oude tokentellingen ruim onder 100k leek te blijven, kan de nieuwe grens overschrijden. Vermenigvuldig niet elke oude telling met 1.3 om dat als factuurprognose te gebruiken; tel representatieve requests opnieuw met claude-haiku-5-5.

Het token-counting-endpoint van Anthropic accepteert het gestructureerde bericht, de systeemprompt en ondersteunde clienttools voordat je het generatie-request verstuurt. Tel tegen het doelmodel en log na de response het daadwerkelijke gebruik. De telling vooraf is een schatting en kan licht afwijken van de gefactureerde input; sommige servertools en URL-/bestandsblokken worden door de teller niet ondersteund. Vertrouw voor die paden op het waargenomen requestgebruik en houd een veiligheidsmarge aan bij de drempel.

Een promptbudgetregel voor subagents

  1. Meet de verdeling. Leg de prompt-tokentellingen van Haiku 5.5 vast per workload, model-ID en taakresultaat. Kijk hoeveel calls rond of boven 100k zitten in plaats van alleen naar het gemiddelde.
  2. Waarschuw vóór de grens. Markeer requests dicht bij de drempel in de agent-orchestrator. Zie het waarschuwingsniveau als je eigen operationele marge, niet als een prijsregel van Anthropic.
  3. Pak de oorzaak aan. Verwijder dubbele retrieval-chunks, begrens de grootte van toolresultaten of comprimeer verouderde geschiedenis waar kwaliteitstests dat toelaten. Gooi geen bewijs weg dat een agent nodig heeft alleen om tokens te besparen.
  4. Vergelijk de lange staart. Test voor onvermijdelijk lange prompts Haiku in de hogere tier tegen een andere route op dezelfde taken. Vergelijk kosten per geaccepteerd resultaat, latentie en de frequentie van fallbacks, niet alleen de listprijzen.
  5. Reconcilieer met de factuur. Reken de werkelijke input, output en cache-lees- en schrijfacties tegen de geldende tier, en tel daarna tools en nieuwe pogingen mee. Controleer de tarieven van de aanbieder of het cloudplatform en eventuele contractkortingen opnieuw.

Haiku 5.5 kan boven 100k nog steeds de beste keuze zijn, maar dat moet een gemeten routeringsbeslissing zijn. De belangrijkste controle is weten welke requests de grens passeren en waarom.

Vragen die teams stellen

Geldt de hogere prijs alleen voor tokens boven 100k?

Nee. Anthropic beschrijft Haiku 5.5 als geprijsd op basis van promptlengte: een prompt van meer dan 100,000 tokens betaalt voor dat request de hogere gepubliceerde tarieven.

Kan prompt caching een lang request in de goedkopere tier houden?

Nee. Hergebruikte tokens kunnen een cache-leestarief krijgen, maar gecachete context neemt nog steeds promptlengte in. Tel de volledige prompt mee bij het toetsen aan de drempel.

Is een toename van 30% in tokenisatie gegarandeerd?

Nee. Anthropic zegt ongeveer 30% meer tokens voor dezelfde tekst dan op Haiku 4.5, afhankelijk van de inhoud. Tel je eigen prompts op het doelmodel.

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com