Ox Alpha era GLM-5.3
Updated September 1, 2026 · first published September 1, 2026
Entre el 20 y el 26 de agosto de 2026, OpenRouter sirvió gratis un modelo llamado stealth/ox-alpha. Después se identificó como GLM-5.3-Flash: 320.000 millones de parámetros totales con 18.000 millones activos, atención híbrida lineal y dispersa, entrada nativa de texto, imagen y vídeo, contexto de 1.048.576 tokens y pesos con licencia MIT.
La adopción no fue marginal: en tres días, OpenCode informó de unos 16 billones de tokens procesados, 221.000 usuarios únicos y más de cinco millones de sesiones. Eso es tráfico de producción, y durante seis días no costó nada.
Gratis es una tarifa, no una ausencia
El problema financiero es que la telemetría trata una línea de 0 dólares como si no existiera. Ese tráfico no pesa en ninguna previsión ni alerta de presupuesto. Cuando la ventana se cierra y aparece una tarifa, el mismo tráfico se convierte en un salto que nadie modeló.
La solución es aplicar un precio sombra a cada llamada gratuita: registra los tokens y multiplícalos por la tarifa de lista del modelo que habrías usado. Así el panel muestra cuánto vale la promoción al mes y cuál será la factura el día que termine.
La tarifa ya no es hipotética: GLM-5.3-Flash cuesta 0,15 dólares por millón de tokens de entrada y 0,50 de salida. Dieciséis billones de tokens de entrada a ese precio son unos 2,4 millones de dólares: el valor de seis días gratis y el tamaño del salto si ese tráfico se queda.
Tres exposiciones que revisar
Precipicio de tarifa: ¿cuánto cuesta este tráfico mañana a precio de lista? Deriva de identidad: ¿qué modelo hay detrás del alias esta semana? Acoplamiento de calidad: ¿se ajustaron los prompts a un modelo que no puedes conservar? Fija identificadores de modelo y evalúa el sustituto antes de que acabe la ventana.
Los pesos MIT cambian el cálculo
Con licencia MIT, el autoalojamiento es una opción real. Con 18.000 millones de parámetros activos, el coste de servir se parece al de un modelo denso mediano, pero solo con utilización alta y sostenida. Por debajo del 40–50% de uso de GPU suele ganar la API: una GPU inactiva factura igual, una llamada que no ocurre no factura nada.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →