Benchmark contesto lungo di GPT-6 Sol: cosa è stato misurato e cosa è GPT-5.6 Sol
Aggiornato September 27, 2026 · pubblicato inizialmente September 27, 2026
Al 27 settembre 2026, GPT-6 Sol ha esattamente un punteggio indipendente sul contesto lungo: l'84% sull'Artificial Analysis AA-LCR v1.1, pari a GPT-5.6 Sol. I documenti del test hanno in media circa 100K token. Nessuno ha ancora pubblicato come GPT-6 Sol regge a 256K, 512K o 1M di token. La maggior parte dei numeri sul contesto lungo di "Sol" in circolazione, incluso il punteggio MRCR del 91,5%, riguarda GPT-5.6 Sol. GPT-6 Sol è uscito il 22 settembre.
Questo conta per i costi perché è sul contesto lungo che i prezzi di GPT-6 salgono. Sopra i 272K token di input, l'intera richiesta viene fatturata alle tariffe a contesto lungo. Decidere quanto contesto mantiene un agente significa pesare quel prezzo contro dati di qualità che non esistono ancora.
Quali punteggi sul contesto lungo ha GPT-6 Sol?
Un solo punteggio aggregato, intorno ai 100K token.
| Modello | AA-LCR v1.1 | Posizione |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (primo, 24 set 2026) | 88.7% | 1 |
AA-LCR è composto da 100 domande scritte a mano su set di documenti che in media contano 99.325 token. Le risposte vanno ricostruite unendo più passaggi, non trovandole in uno solo. Il test misura il ragionamento su un input lungo. Non mostra come cambia l'accuratezza al crescere dell'input, perché tutte le domande hanno più o meno la stessa lunghezza.
Quali numeri sul contesto lungo sono di GPT-5.6 Sol e non di GPT-6 Sol?
I punteggi MRCR. La copertura del lancio di GPT-6 Astra lo confrontava con "Sol" sul test MRCR v2 a 8 needle di OpenAI. Quel Sol era GPT-5.6 Sol, come conferma anche l'analisi di Vellum.
| MRCR v2, 8 needle | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | non pubblicato | |
La recensione di GPT-6 Sol di OrcaRouter dice la stessa cosa: GPT-5.6 Sol ha un risultato pubblicato di recupero su contesto lungo, GPT-6 Sol non ha nulla di equivalente.
Dove abbiamo guardato?
I posti dove sarebbe pubblicato, tutti verificati il 27 settembre 2026:
- Context Arena, la classifica MRCR. La sua lista di modelli e i risultati a 8 needle non hanno voci GPT-6. Le sue voci OpenAI più recenti sono GPT-5.6 Sol, Terra e Luna.
- OpenAI: il post di lancio di GPT-6 e l'appendice della system card per Sol e Luna. Nessuno dei due riporta risultati di Sol per lunghezza del contesto.
- Artificial Analysis: solo AA-LCR, come sopra.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats e OrcaRouter: nessun risultato di contesto lungo per lunghezza per GPT-6 Sol.
Cosa devono fare i team finché non esistono dati per lunghezza?
Tieni le richieste a GPT-6 Sol sotto i 272K token di input e comprimi presto. La evidenza finora mostra GPT-6 Sol alla pari di GPT-5.6 Sol intorno ai 100K. GPT-5.6 Sol ha mantenuto il 91,5% fino a 512K su MRCR, ma è sceso al 73,8% oltre. È ragionevole aspettarsi che GPT-6 Sol sia utilizzabile fino a circa 250K, ma è una deduzione, non una misura. Oltre 272K paghi il doppio sull'input per una qualità che nessuno ha misurato.
In Codex questo è già il default. Dà a GPT-6 Sol una finestra di 272K e comprime a 244.800 token. Per i tuoi agenti, imposta un alert sulle richieste che superano 272K e tratta ogni aumento come qualcosa da testare. Esegui un tuo test di recupero sui tuoi documenti prima di affidarti a un contesto oltre 256K.
Aggiorneremo questa pagina quando Context Arena o un altro valutatore indipendente pubblicherà risultati di GPT-6 Sol per lunghezza del contesto.
Fonti
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis: annuncio di AA-LCR
- BenchLM: classifica AA-LCR
- Vellum: benchmark di GPT-6 Astra spiegati
- OrcaRouter: GPT-6 Sol vs GPT-5.6 Sol
- Context Arena: classifica MRCR
Correlati
- Auto-compact di Codex su GPT-6 Sol: i valori predefiniti reali
- Prezzi e modello di costo di GPT-6 Sol
- Prezzi di GPT-6 e il salto di prezzo del contesto lungo a 272K
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →