Ox Alpha était GLM-5.3
Updated September 1, 2026 · first published September 1, 2026
Du 20 au 26 août 2026, OpenRouter a servi gratuitement un modèle nommé stealth/ox-alpha. Il s’agissait de GLM-5.3-Flash : 320 milliards de paramètres au total dont 18 milliards actifs, attention hybride linéaire et éparse, entrée native texte, image et vidéo, fenêtre de 1 048 576 tokens et poids sous licence MIT.
L’adoption n’a rien eu de marginal : en trois jours, OpenCode a rapporté environ 16 000 milliards de tokens traités, 221 000 utilisateurs uniques et plus de cinq millions de sessions. C’est du trafic de production, et il n’a rien coûté pendant six jours.
Gratuit est un tarif, pas une absence
La télémétrie de coût traite une ligne à 0 dollar comme une ligne inexistante. Ce trafic ne pèse donc dans aucune prévision ni alerte budgétaire. Quand la fenêtre se ferme et qu’un tarif s’applique, le même trafic réapparaît sous forme de marche non modélisée.
Appliquez un prix fictif à chaque appel gratuit : enregistrez les tokens et multipliez-les par le tarif public du modèle que vous auriez utilisé. Le tableau de bord montre alors la valeur mensuelle de la promotion et la facture du jour où elle s’arrête.
Le tarif n’est plus hypothétique : GLM-5.3-Flash est facturé 0,15 dollar par million de tokens d’entrée et 0,50 en sortie. Seize mille milliards de tokens d’entrée à ce tarif représentent environ 2,4 millions de dollars — la valeur de six jours gratuits, et la hauteur de la marche si ce trafic reste en place.
Trois expositions à vérifier
La falaise tarifaire : combien coûte ce trafic demain au prix public? La dérive d’identité : quel modèle se cache derrière l’alias cette semaine? Le couplage qualité : les prompts ont-ils été ajustés à un modèle que vous ne pouvez pas garder? Épinglez les identifiants de modèle et évaluez le remplaçant avant la fin de la fenêtre.
Les poids MIT changent le calcul
Sous licence MIT, l’auto-hébergement devient une vraie option. Avec 18 milliards de paramètres actifs, le coût de service ressemble à celui d’un modèle dense moyen, mais uniquement à forte utilisation soutenue. En dessous de 40 à 50% d’utilisation GPU, l’API l’emporte généralement : un accélérateur inactif se facture plein tarif, un appel qui n’a pas lieu ne coûte rien.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →