Vai al contenuto

Prezzo di un modello a pesi aperti

Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026

Risposta rapida: Qwen3.8-Flash-Next è arrivato il 26 agosto 2026 come anteprima a pesi aperti dell'architettura Qwen4: circa 6B di parametri attivi, un contesto nativo di 262,144 token e nessuna tariffa ospitata...

Qwen3.8-Flash-Next è arrivato il 26 agosto 2026 come anteprima a pesi aperti dell'architettura Qwen4: circa 6B di parametri attivi, un contesto nativo di 262,144 token e nessuna tariffa ospitata annunciata. Questa combinazione rompe il confronto abituale. Ogni modello chiuso ti dà un numero per milione di token; una release a pesi aperti ti dà un checkpoint e lascia il numero a te.

Il numero non è difficile da calcolare. Il fatto è che la maggior parte dei team non lo calcola mai, e confronta un download da $0 con un'API da $3.00/MTok concludendo che il download costa meno. Potrebbe essere vero. Decide l'aritmetica, e l'aritmetica ha esattamente un termine che la gente dimentica.

La formula

Il costo per milione di token è il prezzo orario dell'istanza diviso per quanti token quell'istanza produce in un'ora:

cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000

A $2.00 l'ora e 1,500 token al secondo misurati, fa 2.00 / 5,400,000 * 1,000,000 = $0.37 per milione di token. Rispetto a un modello ospitato a $3.00/MTok di output, l'auto-hosting sembra un risparmio di otto volte. Anche questa cifra è sbagliata, perché presuppone che la GPU sia occupata ogni secondo che paghi.

Il termine che tutti dimenticano: l'utilizzo

Affitti l'ora; ne usi una frazione. Dividi per quella frazione:

UtilizzoCosto effettivo per MTok
100%$0.37
60%$0.62
30%$1.23
10%$3.70

Al 10% di utilizzo, il modello self-hosted costa più dell'API ospitata che doveva sostituire. La maggior parte dei primi deployment sta tra il 10% e il 30%, perché il traffico è a raffiche e l'istanza è dimensionata sul picco. Il risparmio è reale, ma è un risparmio sull'utilizzo, non sui pesi.

Cos'altro entra nel numero

Storage ed egress per il checkpoint. Il tempo di inattività tra l'avvio dell'istanza e il modello pronto a girare — su un modello con contesto grande, il caricamento richiede minuti, e li paghi tutti. La ridondanza, se il carico richiede più di un'istanza per sopravvivere a un guasto di nodo. E il tempo di ingegneria, che non è fatturato a ore ma è la voce più grande nel primo anno.

Niente di tutto questo va contro l'auto-hosting. Va contro il confrontare un download gratuito con una tariffa a token senza fare la divisione.

Misura prima di impegnarti

Esegui il modello sull'istanza che affitteresti davvero, con le tue forme di prompt e le tue lunghezze di contesto, e registra i token al secondo sotto concorrenza — non il numero a flusso singolo della model card. Poi prendi il tuo profilo di traffico orario reale e calcola l'utilizzo. Due numeri, una divisione, e la decisione si prende da sola.

Il contesto lungo è dove il problema morde di più. Un contesto da 262K token è un'impronta di memoria prima ancora di essere una funzionalità: determina la classe di istanza, e la classe di istanza determina il prezzo orario in cima alla formula. Prezza il contesto che invii davvero, non quello che il modello supporta.

Correlati

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com