Ox Alpha was GLM-5.3
Bijgewerkt September 1, 2026 · eerst gepubliceerd September 1, 2026
Tussen 20 en 26 augustus 2026 werd een model dat op OpenRouter stond als stealth/ox-alpha gratis aangeboden. Inmiddels is bekend dat het GLM-5.3-Flash was: 320 miljard parameters in totaal met 18 miljard actief, hybride lineaire en sparse attention, native invoer van tekst, beeld en video, een contextvenster van 1.048.576 tokens, 131K maximale output en MIT-gelicenseerde gewichten.
Het gebruik was niet marginaal. Binnen drie dagen na de listing meldde OpenCode ongeveer 16 biljoen verwerkte tokens, 221.000 unieke gebruikers, meer dan vijf miljoen sessies en de tweede plek op recent gebruik. Dat is productieverkeer, geen evaluatieverkeer — en zes dagen lang kostte het niets.
Gratis is een tarief, geen afwezigheid
Het financiële probleem met een gratis stealth-endpoint is dat de meeste kostentelemetrie een regel van $0 behandelt alsof er geen regel is. Verzoeken die in die week naar Ox Alpha werden gerouteerd, staan in usage-dashboards als kosteloos, dus ze wegen niet mee in een uitgavenprognose, een budgetmelding of een weergave van unit economics per feature. Daarna sluit het venster, wordt het model hernoemd, wordt een tarief toegepast en verschijnt hetzelfde verkeer als een stapverandering die niemand heeft gemodelleerd.
De oplossing is elke aanroep te prijzen tegen een schaduwtarief, ook de gratis. Registreer de tokenaantallen zoals gewoonlijk en vermenigvuldig met de listprijs van het model dat je anders had gebruikt. Je dashboard laat dan zien wat de actie per maand waard is en wat de rekening wordt op de dag dat ze eindigt. Zestien biljoen tokens tegen een gebruikelijk flash-tarief is geen afrondingsfout.
Het tarief is inmiddels niet meer hypothetisch. GLM-5.3-Flash staat nu genoteerd op $0.15 per miljoen input-tokens en $0.50 per miljoen output. Zestien biljoen input-tokens tegen dat tarief is ongeveer $2,4 miljoen — dat is wat zes dagen gratis tokens waard waren, en de omvang van de stap als dat verkeer gewoon op hetzelfde niveau blijft.
De drie risico's om te controleren
| Risico | Vraag om te stellen | Beheersmaatregel |
|---|---|---|
| Tariefklif | Wat kost dit verkeer morgen tegen de listprijs? | Schaduwprijzen op gratis endpoints, met dezelfde budgetmeldingen. |
| Identiteitsverschuiving | Welk model zit deze week achter de alias? | Pin model-ID's; routeer productie nooit naar een stealth-alias zonder fallback. |
| Kwaliteitskoppeling | Zijn prompts afgestemd op een model dat je niet kunt houden? | Draai evals tegen de genoemde vervanger voordat het venster eindigt. |
MIT-gewichten veranderen de afweging tussen kopen en bouwen
De onthulling van de identiteit doet er om een tweede reden toe. GLM-5.3-Flash wordt geleverd onder een MIT-licentie, waardoor zelf hosten een echte optie is in plaats van een theoretische. Met 18 miljard actieve parameters van de 320 miljard in totaal ligt de servingkost dichter bij een middelgroot dense model dan het kopgetal doet vermoeden — maar alleen bij een consequent hoge benutting. Onder ruwweg 40–50% GPU-benutting wint de prijs per token via een API meestal nog, omdat stilstaande accelerators tegen het volle tarief factureren terwijl een stilstaande API-aanroep niets kost.
De keuze is dus niet open weights tegenover API. Het is een benuttingsdrempel. Meet je aanhoudende tokens per seconde over een volle week, inclusief nachten en weekenden, en vergelijk pas daarna een offerte voor gereserveerde capaciteit met hetzelfde volume tegen API-listtarieven. Neem engineeringtijd voor serving, evaluatie en upgrades op in de zelfgehoste kolom; dat is de regel die de meeste business cases vergeten.
Wat te doen als het volgende stealth-model verschijnt
Behandel elk gratis venster als een contract met bepaalde looptijd met een onbekende wederpartij. Evalueer het model serieus — gratis tokens zijn een echt goedkope manier om een evalsuite te draaien. Maar routeer productieverkeer er alleen naartoe achter een fallback, houd de schaduwprijs in je dashboards en plan het einde van het venster in als prognosegebeurtenis. Het model was uitstekend en de prijs was nul; slechts een van die twee feiten was duurzaam.
Gerelateerd
- Kosten van open-source versus gesloten modellen
- Provider-arbitrage
- Kosten van modeluitfasering en migratie
Gerelateerd
- Kosten van open-source versus gesloten modellen
- Provider-arbitrage
- Kosten van modeluitfasering en migratie
Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →