Stille modeldowngrades en kostenmodellen
Bijgewerkt September 27, 2026 · eerst gepubliceerd September 27, 2026
Op 23 september 2026 wees een thread op r/GroundTruthAINews op een voetnoot, verstopt in de lanceringsnotities van Anthropic voor Opus 5.5: een Opus 5.5-verzoek kan door Opus 4.8 worden bediend. Anthropic en OpenAI kondigden dezelfde middag allebei prijsverlagingen aan. Beide labs verkochten hetzelfde idee: behoud de capaciteit, geef veel minder uit. De voetnoot is het deel dat voor FinOps telt.
Wat er echt gebeurde
Claude Opus 5.5 verscheen tegen $4/$20 per miljoen tokens, ruwweg 20% onder Opus 5, met cache-reads 60% omlaag naar $0.20. Anthropic stelt dat minder tokens per taak en 30% snellere output typische workloads ongeveer 40% goedkoper maken. Ongeveer 90 minuten later bracht OpenAI GPT-6 Sol uit tegen $2/$10 en Luna tegen $0.10/$0.50, beide de helft van de GPT-5.6-prijzen.
Elke lanceringspost uit deze periode heeft dezelfde soort voetnoot: het endpoint dat je aanroept is een alias, en die alias wordt tijdens een overgangsperiode over modelversies verdeeld. Dat is een normale capaciteitspraktijk. Het is ook een probleem voor kostenmodellering.
Waarom het de cijfers breekt
- Kosten per taak verschuiven. Je prognose ging uit van Opus 5.5-outputprijzen. Als een deel van de aanroepen op 4.8 landt, bewegen zowel de eenheidsprijs als het aantal tokens, in tegengestelde richting.
- Evals meten een mengsel. Een evalsuite die tijdens een overgangsperiode draait, scoort een mix van versies. De score is later niet reproduceerbaar.
- Prijsverlagingen worden verkeerd toegeschreven. Als een besparing van 40% als 15% verschijnt, is het gat meestal versiemenging en geen kapotte optimalisatie.
- Latentiebasislijnen raken verouderd. 4.8 is niet zo snel als 5.5. Elke p50 die je midden in de overgang hebt vastgelegd, is niet je stabiele p50.
Hoe je de wissel detecteert
Elke grote provider geeft het opgeloste model terug in de response-body. Log het. Eén veld, vier regels code:
resolved = response.model # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKSSplits daarna elke kostenmetriek op opgelost model, niet op het model dat je vroeg. Zodra een bucket gaat afwijken, heb je je antwoord: de alias mengt versies en je kosten per taak zijn een gewogen gemiddelde van twee verschillende producten.
De gevolgen voor het budget
Plan tijdens een overgang op de gemengde kosten, niet op de kop. Als 20% van de aanroepen terugvalt op een ouder model, is je effectieve inputtarief niet $4.00 per miljoen — het is wat het mengsel oplevert. Dezelfde logica geldt voor de besparing in de kop: de claim van 40% goedkoper is een gemiddelde voor een typische workload, dat al uitgaat van een verlaging van het aantal tokens die niet hoeft te gelden als het goedkopere maar oudere model de langere antwoorden genereert.
Regels om aan vast te houden
- Modelleer nooit op een alias. Pin een gedateerd model-ID voor alles wat je begroot of evalueert.
- Log het opgeloste model bij elk verzoek. Niet onderhandelbaar als je ooit een eval opnieuw draait.
- Stel de basislijn opnieuw vast na de overgangsperiode. De gebruikelijke duur is weken, geen kwartalen, maar controleer dat.
- Prijs een overgang als een mengsel. Vraag je provider om de verwachte verdeling, of meet die.
Conclusie
Een prijsverlaging en een stille downgrade kunnen dezelfde middag landen. De verlaging is de kop; de downgrade is de voetnoot die de prognose van vorige maand stilletjes ongeldig maakt. Log het opgeloste model, pin gedateerde ID's en prijs het mengsel.
Gerelateerd
- Kostenmodel Claude Opus 5.5
- GPT-6-prijzen: Sol, Luna, Astra
- Modelprijsverlagingen en routingbudgetten
- Providerprijzen zijn niet vergelijkbaar
- Kostenbeheersing van evals
Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →