Ox Alpha era GLM-5.3
Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026
Tra il 20 e il 26 agosto 2026, un modello elencato su OpenRouter come stealth/ox-alpha è stato servito gratuitamente. È stato poi identificato come GLM-5.3-Flash: 320 miliardi di parametri totali con 18 miliardi attivi, attenzione ibrida lineare e sparsa, input nativo di testo, immagini e video, una finestra di contesto da 1,048,576 token, un output massimo di 131K e pesi con licenza MIT.
L'adozione non è stata marginale. Entro tre giorni dalla pubblicazione, OpenCode ha segnalato circa 16 trilioni di token elaborati, 221,000 utenti unici, più di cinque milioni di sessioni e la seconda posizione per utilizzo recente. È traffico di produzione, non di valutazione, e per sei giorni non è costato nulla.
Gratis è una tariffa, non un'assenza
Il problema finanziario di un endpoint stealth gratuito è che la maggior parte della telemetria dei costi tratta una riga a $0 come se non esistesse. Le richieste instradate su Ox Alpha in quella settimana compaiono nelle dashboard come a costo zero, quindi non pesano su nessuna previsione di spesa, alert di budget o vista di unit economics per funzione. Poi la finestra si chiude, il modello viene rinominato, si applica una tariffa, e lo stesso traffico ricompare come un salto che nessuno aveva modellato.
La soluzione è prezzare ogni chiamata a un prezzo ombra, comprese quelle gratuite. Registra i conteggi dei token come al solito e moltiplicali per il prezzo di listino del modello che avresti altrimenti usato. La dashboard mostrerà così quanto vale la promozione al mese e a quanto ammonterà la fattura il giorno in cui finisce. Sedici trilioni di token a una tariffa tipica da livello flash non sono un errore di arrotondamento.
La tariffa non è più ipotetica. GLM-5.3-Flash è ora in listino a $0.15 per milione di token di input e $0.50 per output. Sedici trilioni di token di input a questa tariffa valgono circa $2.4 milioni — ecco cosa valevano sei giorni di token gratuiti, e l'entità del salto se quel traffico restasse dov'è.
Tre esposizioni da verificare
| Esposizione | Domanda da porsi | Controllo |
|---|---|---|
| Salto tariffario | Quanto costa questo traffico domani a prezzo di listino? | Prezzo ombra sugli endpoint gratuiti, con gli stessi alert di budget. |
| Deriva dell'identità | Quale modello c'è dietro l'alias questa settimana? | Fissa gli ID dei modelli; non instradare mai la produzione su un alias stealth senza un fallback. |
| Accoppiamento di qualità | I prompt sono stati ottimizzati per un modello che non puoi mantenere? | Esegui le valutazioni sostitutivo indicato prima della fine della finestra. |
I pesi MIT cambiano il calcolo tra acquisto e costruzione
L'identità rivelata conta per una seconda ragione. GLM-5.3-Flash è distribuito con licenza MIT, il che rende l'auto-hosting un'opzione reale e non teorica. Con 18 miliardi di parametri attivi su 320 miliardi totali, il costo di servizio è più vicino a un modello denso di taglia media di quanto suggerisca il numero di titolo — ma solo con un utilizzo costantemente alto. Sotto il 40–50% circa di utilizzo GPU, il prezzo API per token di solito vince, perché gli acceleratori inattivi si fatturano a tariffa piena mentre una chiamata API inattiva non costa nulla.
Quindi la decisione non è tra open weights e API. È una soglia di utilizzo. Misura i token al secondo sostenuti su un'intera settimana, notti e weekend inclusi, e solo allora confronta un'offerta di capacità riservata con lo stesso volume ai prezzi API di listino. Includi nella colonna dell'auto-hosting il tempo di ingegneria per il serving, la valutazione e gli aggiornamenti: è la voce che molti business case dimenticano.
Cosa fare quando compare il prossimo modello stealth
Tratta ogni finestra gratuita come un contratto a termine con una controparte senza nome. Valuta il modello in modo serio: i token gratuiti sono un modo davvero economico per eseguire una suite di valutazione. Ma instrada il traffico di produzione verso di esso solo dietro un fallback, mantieni il prezzo ombra nelle dashboard e segna la fine della finestra come evento di previsione. Il modello era eccellente e il prezzo era zero; solo uno di questi due fatti era duraturo.
Correlati
- Costo dei modelli open source rispetto a quelli chiusi
- Arbitraggio tra provider
- Costi di deprecazione e migrazione dei modelli
Correlati
- Costo dei modelli open source rispetto a quelli chiusi
- Arbitraggio tra provider
- Costi di deprecazione e migrazione dei modelli
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →