Vai al contenuto

Modello di costo di GPT-6 Luna

Aggiornato September 23, 2026 · pubblicato inizialmente September 23, 2026

GPT-6 Luna è il modello economico della famiglia GPT-6 di OpenAI, rilasciato il 22 settembre 2026 insieme a GPT-6 Sol. OpenAI lo destina al lavoro ad alto volume con un obiettivo chiaro: riassumere, estrarre e rispondere a domande rapide. A $0.10 per 1M di token di input è il modello verso cui instradare per primo, e da cui spostarsi solo quando il compito dimostra di aver bisogno di più.

Prezzi di GPT-6 Luna

LivelloInputInput in cacheOutput
Standard$0.10$0.01$0.50
Batch o flex$0.05$0.005$0.25
Modalità veloce$0.20$0.02$1.00
Contesto lungo (oltre 272K di input)$0.20$0.02$0.75

Per 1M di token, dalla pagina dei prezzi di OpenAI. Una scrittura in cache costa $0.125. Luna ha la stessa finestra di contesto di 1,050,000 token del resto di GPT-6, una data di cutoff della conoscenza di maggio 2026 (la più recente delle tre) e l'intera gamma di sforzo da none a max.

Stesso punteggio di GPT-5.6 Luna, 61% più economico per attività

Artificial Analysis ha eseguito entrambe le generazioni di Luna sul suo Intelligence Index (v4.3.2) a sforzo massimo.

ModelloPunteggio indiceCosto per attivitàVelocità di output
GPT-6 Luna (max)37$0.07132.2 tokens/s
GPT-5.6 Luna (max)37$0.18142.3 tokens/s
GPT-6 Sol (low)33.9$0.13—

Il punteggio non è cambiato. Il costo per attività è sceso del 61%, soprattutto per il prezzo per token più basso. GPT-6 Luna a max batte anche GPT-6 Sol a sforzo low sia nel punteggio sia nel costo. Se usavi Sol a low per risparmiare, Luna a max è l'affare migliore su questo indice.

Quanto costa il volume alto

Un milione di richieste di classificazione al mese, ciascuna con 600 token di input e 100 di output, senza cache:

ModelloCosto mensile
GPT-6 Luna, batch$55
GPT-6 Luna$110
GPT-5.6 Luna$240
Claude Haiku 4.5$1,100
GPT-6 Sol$2,200
GPT-6 Astra$11,000

Claude Haiku 4.5 costa 10× di più per token e ha ottenuto 15 sullo stesso indice, essendo un modello senza ragionamento. Spostare lo stesso lavoro da Sol a Luna riduce la fattura del 95%, ed è il motivo per cui vale la pena costruire un router che invii a Sol solo i casi difficili.

Il rovescio della medaglia: latenza e verbosità

I numeri dell'indice sopra sono a sforzo massimo, e a sforzo massimo Luna è lento a partire. Artificial Analysis ha misurato 104 secondi al primo token. Ha inoltre usato 150M di token di output su tutto l'indice, contro una mediana di 84M, che Artificial Analysis descrive come piuttosto prolisso. Questa prolissità è già inclusa nei $0.07 per attività, quindi il dato di costo regge, ma l'attesa non è adatta a una chat rivolta agli utenti.

Per il traffico interattivo, usa Luna con none, low o il valore predefinito medium e misura l'accuratezza sui tuoi prompt. I punteggi di questa pagina valgono solo per lo sforzo massimo, quindi l'accuratezza a impostazioni più basse va verificata, non ricavata da qui. Riserva lo sforzo massimo ai job batch, dove la latenza non conta e il prezzo batch dimezza di nuovo la fattura.

I rate limit scalano più di Sol

Luna parte da 500K token al minuto nel Tier 1, come Sol, ma raggiunge 180M di token al minuto nel Tier 5 (Sol si ferma a 40M), con fino a 30,000 richieste al minuto. Per le pipeline di massa, questo margine conta quanto il prezzo.

Come usare Luna

Fonti: pagina del modello GPT-6 Luna di OpenAI, Artificial Analysis: GPT-6 Luna, Artificial Analysis: GPT-5.6 Luna, TechCrunch. Prezzi rilevati il 23 settembre 2026.

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com