Ox Alpha war GLM-5.3
Updated September 1, 2026 · first published September 1, 2026
Vom 20. bis 26. August 2026 wurde auf OpenRouter ein Modell namens stealth/ox-alpha kostenlos ausgeliefert. Inzwischen ist klar: Es war GLM-5.3-Flash — 320 Milliarden Parameter insgesamt, 18 Milliarden aktiv, hybride lineare und dünn besetzte Attention, native Text-, Bild- und Videoeingabe, ein Kontextfenster von 1.048.576 Tokens und MIT-lizenzierte Gewichte.
Die Nutzung war erheblich: Innerhalb von drei Tagen meldete OpenCode rund 16 Billionen verarbeitete Tokens, 221.000 eindeutige Nutzer und über fünf Millionen Sitzungen. Das ist Produktionsverkehr — und er war sechs Tage lang kostenlos.
Kostenlos ist ein Tarif, keine Abwesenheit
Kostentelemetrie behandelt eine 0-Dollar-Zeile meist so, als gäbe es sie nicht. Dieser Verkehr fließt in keine Prognose und in keinen Budgetalarm ein. Schließt sich das Fenster und greift ein Tarif, erscheint derselbe Verkehr als nicht modellierter Sprung.
Bepreisen Sie deshalb jeden kostenlosen Aufruf mit einem Schattentarif: Tokens wie gewohnt erfassen und mit dem Listenpreis des sonst genutzten Modells multiplizieren. Das Dashboard zeigt dann den Monatswert der Aktion und die Rechnung nach ihrem Ende.
Der Tarif ist nicht mehr hypothetisch: GLM-5.3-Flash kostet 0,15 Dollar je Million Eingabe-Tokens und 0,50 je Million Ausgabe-Tokens. 16 Billionen Eingabe-Tokens zu diesem Satz sind rund 2,4 Millionen Dollar — der Wert von sechs kostenlosen Tagen und die Höhe des Sprungs, falls dieser Verkehr bleibt.
Drei zu prüfende Risiken
Tarifklippe: Was kostet dieser Verkehr morgen zum Listenpreis? Identitätsdrift: Welches Modell steckt diese Woche hinter dem Alias? Qualitätskopplung: Wurden Prompts auf ein Modell optimiert, das Sie nicht behalten können? Modell-IDs fest verdrahten und den Nachfolger vor Fensterende evaluieren.
MIT-Gewichte verändern die Make-or-Buy-Rechnung
Unter MIT-Lizenz ist Self-Hosting eine reale Option. Mit 18 Milliarden aktiven Parametern liegen die Servingkosten näher an einem mittelgroßen dichten Modell — aber nur bei dauerhaft hoher Auslastung. Unter etwa 40 bis 50% GPU-Auslastung gewinnt meist die API: Ein untätiger Beschleuniger kostet vollen Preis, ein nicht erfolgter Aufruf kostet nichts.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →