Prezzo di un modello a pesi aperti
Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026
Qwen3.8-Flash-Next è arrivato il 26 agosto 2026 come anteprima a pesi aperti dell'architettura Qwen4: circa 6B di parametri attivi, un contesto nativo di 262,144 token e nessuna tariffa ospitata annunciata. Questa combinazione rompe il confronto abituale. Ogni modello chiuso ti dà un numero per milione di token; una release a pesi aperti ti dà un checkpoint e lascia il numero a te.
Il numero non è difficile da calcolare. Il fatto è che la maggior parte dei team non lo calcola mai, e confronta un download da $0 con un'API da $3.00/MTok concludendo che il download costa meno. Potrebbe essere vero. Decide l'aritmetica, e l'aritmetica ha esattamente un termine che la gente dimentica.
La formula
Il costo per milione di token è il prezzo orario dell'istanza diviso per quanti token quell'istanza produce in un'ora:
cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000A $2.00 l'ora e 1,500 token al secondo misurati, fa 2.00 / 5,400,000 * 1,000,000 = $0.37 per milione di token. Rispetto a un modello ospitato a $3.00/MTok di output, l'auto-hosting sembra un risparmio di otto volte. Anche questa cifra è sbagliata, perché presuppone che la GPU sia occupata ogni secondo che paghi.
Il termine che tutti dimenticano: l'utilizzo
Affitti l'ora; ne usi una frazione. Dividi per quella frazione:
| Utilizzo | Costo effettivo per MTok |
|---|---|
| 100% | $0.37 |
| 60% | $0.62 |
| 30% | $1.23 |
| 10% | $3.70 |
Al 10% di utilizzo, il modello self-hosted costa più dell'API ospitata che doveva sostituire. La maggior parte dei primi deployment sta tra il 10% e il 30%, perché il traffico è a raffiche e l'istanza è dimensionata sul picco. Il risparmio è reale, ma è un risparmio sull'utilizzo, non sui pesi.
Cos'altro entra nel numero
Storage ed egress per il checkpoint. Il tempo di inattività tra l'avvio dell'istanza e il modello pronto a girare — su un modello con contesto grande, il caricamento richiede minuti, e li paghi tutti. La ridondanza, se il carico richiede più di un'istanza per sopravvivere a un guasto di nodo. E il tempo di ingegneria, che non è fatturato a ore ma è la voce più grande nel primo anno.
Niente di tutto questo va contro l'auto-hosting. Va contro il confrontare un download gratuito con una tariffa a token senza fare la divisione.
Misura prima di impegnarti
Esegui il modello sull'istanza che affitteresti davvero, con le tue forme di prompt e le tue lunghezze di contesto, e registra i token al secondo sotto concorrenza — non il numero a flusso singolo della model card. Poi prendi il tuo profilo di traffico orario reale e calcola l'utilizzo. Due numeri, una divisione, e la decisione si prende da sola.
Il contesto lungo è dove il problema morde di più. Un contesto da 262K token è un'impronta di memoria prima ancora di essere una funzionalità: determina la classe di istanza, e la classe di istanza determina il prezzo orario in cima alla formula. Prezza il contesto che invii davvero, non quello che il modello supporta.
Correlati
- Costo dei modelli open source rispetto a quelli chiusi
- Costo per richiesta come KPI
- Arbitraggio tra provider
Correlati
- Costo dei modelli open source rispetto a quelli chiusi
- Costo per richiesta come KPI
- Arbitraggio tra provider
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →