O Ox Alpha era o GLM-5.3
Updated September 1, 2026 · first published September 1, 2026
Entre 20 e 26 de agosto de 2026, o OpenRouter serviu gratuitamente um modelo chamado stealth/ox-alpha. Foi depois identificado como GLM-5.3-Flash: 320 mil milhões de parâmetros no total, 18 mil milhões activos, atenção híbrida linear e esparsa, entrada nativa de texto, imagem e vídeo, contexto de 1.048.576 tokens e pesos com licença MIT.
A adesão não foi marginal: em três dias, o OpenCode reportou cerca de 16 biliões de tokens processados, 221.000 utilizadores únicos e mais de cinco milhões de sessões. É tráfego de produção e, durante seis dias, não custou nada.
Grátis é uma tarifa, não uma ausência
A telemetria de custo trata uma linha de 0 dólares como se não existisse. Esse tráfego não pesa em previsões nem em alertas de orçamento. Quando a janela fecha e passa a haver tarifa, o mesmo tráfego surge como um degrau que ninguém modelou.
Aplique um preço-sombra a cada chamada gratuita: registe os tokens e multiplique pelo preço de tabela do modelo que usaria em alternativa. O painel passa a mostrar o valor mensal da promoção e a fatura no dia em que terminar.
A tarifa já não é hipotética: o GLM-5.3-Flash custa 0,15 dólares por milhão de tokens de entrada e 0,50 de saída. Dezasseis biliões de tokens de entrada a esse preço são cerca de 2,4 milhões de dólares — o valor de seis dias grátis e a altura do degrau se esse tráfego ficar.
Três exposições a verificar
Precipício tarifário: quanto custa este tráfego amanhã a preço de tabela? Deriva de identidade: que modelo está por trás do alias esta semana? Acoplamento de qualidade: os prompts foram afinados para um modelo que não pode manter? Fixe identificadores de modelo e avalie o substituto antes do fim da janela.
Os pesos MIT mudam a conta
Com licença MIT, alojar internamente é uma opção real. Com 18 mil milhões de parâmetros activos, o custo de serviço aproxima-se de um modelo denso médio, mas só com utilização alta e sustentada. Abaixo de 40 a 50% de utilização de GPU, a API costuma ganhar: um acelerador parado factura na mesma, uma chamada que não acontece não factura nada.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →