Ga naar inhoud

Stille modeldowngrades en kostenmodellen

Bijgewerkt September 27, 2026 · eerst gepubliceerd September 27, 2026

Op 23 september 2026 wees een thread op r/GroundTruthAINews op een voetnoot, verstopt in de lanceringsnotities van Anthropic voor Opus 5.5: een Opus 5.5-verzoek kan door Opus 4.8 worden bediend. Anthropic en OpenAI kondigden dezelfde middag allebei prijsverlagingen aan. Beide labs verkochten hetzelfde idee: behoud de capaciteit, geef veel minder uit. De voetnoot is het deel dat voor FinOps telt.

Wat er echt gebeurde

Claude Opus 5.5 verscheen tegen $4/$20 per miljoen tokens, ruwweg 20% onder Opus 5, met cache-reads 60% omlaag naar $0.20. Anthropic stelt dat minder tokens per taak en 30% snellere output typische workloads ongeveer 40% goedkoper maken. Ongeveer 90 minuten later bracht OpenAI GPT-6 Sol uit tegen $2/$10 en Luna tegen $0.10/$0.50, beide de helft van de GPT-5.6-prijzen.

Elke lanceringspost uit deze periode heeft dezelfde soort voetnoot: het endpoint dat je aanroept is een alias, en die alias wordt tijdens een overgangsperiode over modelversies verdeeld. Dat is een normale capaciteitspraktijk. Het is ook een probleem voor kostenmodellering.

Waarom het de cijfers breekt

Hoe je de wissel detecteert

Elke grote provider geeft het opgeloste model terug in de response-body. Log het. Eén veld, vier regels code:

resolved = response.model  # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS

Splits daarna elke kostenmetriek op opgelost model, niet op het model dat je vroeg. Zodra een bucket gaat afwijken, heb je je antwoord: de alias mengt versies en je kosten per taak zijn een gewogen gemiddelde van twee verschillende producten.

De gevolgen voor het budget

Plan tijdens een overgang op de gemengde kosten, niet op de kop. Als 20% van de aanroepen terugvalt op een ouder model, is je effectieve inputtarief niet $4.00 per miljoen — het is wat het mengsel oplevert. Dezelfde logica geldt voor de besparing in de kop: de claim van 40% goedkoper is een gemiddelde voor een typische workload, dat al uitgaat van een verlaging van het aantal tokens die niet hoeft te gelden als het goedkopere maar oudere model de langere antwoorden genereert.

Regels om aan vast te houden

  1. Modelleer nooit op een alias. Pin een gedateerd model-ID voor alles wat je begroot of evalueert.
  2. Log het opgeloste model bij elk verzoek. Niet onderhandelbaar als je ooit een eval opnieuw draait.
  3. Stel de basislijn opnieuw vast na de overgangsperiode. De gebruikelijke duur is weken, geen kwartalen, maar controleer dat.
  4. Prijs een overgang als een mengsel. Vraag je provider om de verwachte verdeling, of meet die.

Conclusie

Een prijsverlaging en een stille downgrade kunnen dezelfde middag landen. De verlaging is de kop; de downgrade is de voetnoot die de prognose van vorige maand stilletjes ongeldig maakt. Log het opgeloste model, pin gedateerde ID's en prijs het mengsel.

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com