Vai al contenuto

Benchmark contesto lungo di GPT-6 Sol: cosa è stato misurato e cosa è GPT-5.6 Sol

Aggiornato September 27, 2026 · pubblicato inizialmente September 27, 2026

Risposta rapida: Al 27 settembre 2026, GPT-6 Sol ha esattamente un punteggio indipendente sul contesto lungo: l'84% sull'Artificial Analysis AA-LCR v1.1, pari a GPT-5.6 Sol. I documenti del test hanno in media circa...

Al 27 settembre 2026, GPT-6 Sol ha esattamente un punteggio indipendente sul contesto lungo: l'84% sull'Artificial Analysis AA-LCR v1.1, pari a GPT-5.6 Sol. I documenti del test hanno in media circa 100K token. Nessuno ha ancora pubblicato come GPT-6 Sol regge a 256K, 512K o 1M di token. La maggior parte dei numeri sul contesto lungo di "Sol" in circolazione, incluso il punteggio MRCR del 91,5%, riguarda GPT-5.6 Sol. GPT-6 Sol è uscito il 22 settembre.

Questo conta per i costi perché è sul contesto lungo che i prezzi di GPT-6 salgono. Sopra i 272K token di input, l'intera richiesta viene fatturata alle tariffe a contesto lungo. Decidere quanto contesto mantiene un agente significa pesare quel prezzo contro dati di qualità che non esistono ancora.

Quali punteggi sul contesto lungo ha GPT-6 Sol?

Un solo punteggio aggregato, intorno ai 100K token.

ModelloAA-LCR v1.1Posizione
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3 (primo, 24 set 2026)88.7%1

AA-LCR è composto da 100 domande scritte a mano su set di documenti che in media contano 99.325 token. Le risposte vanno ricostruite unendo più passaggi, non trovandole in uno solo. Il test misura il ragionamento su un input lungo. Non mostra come cambia l'accuratezza al crescere dell'input, perché tutte le domande hanno più o meno la stessa lunghezza.

Quali numeri sul contesto lungo sono di GPT-5.6 Sol e non di GPT-6 Sol?

I punteggi MRCR. La copertura del lancio di GPT-6 Astra lo confrontava con "Sol" sul test MRCR v2 a 8 needle di OpenAI. Quel Sol era GPT-5.6 Sol, come conferma anche l'analisi di Vellum.

MRCR v2, 8 needle256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Solnon pubblicato

La recensione di GPT-6 Sol di OrcaRouter dice la stessa cosa: GPT-5.6 Sol ha un risultato pubblicato di recupero su contesto lungo, GPT-6 Sol non ha nulla di equivalente.

Dove abbiamo guardato?

I posti dove sarebbe pubblicato, tutti verificati il 27 settembre 2026:

Cosa devono fare i team finché non esistono dati per lunghezza?

Tieni le richieste a GPT-6 Sol sotto i 272K token di input e comprimi presto. La evidenza finora mostra GPT-6 Sol alla pari di GPT-5.6 Sol intorno ai 100K. GPT-5.6 Sol ha mantenuto il 91,5% fino a 512K su MRCR, ma è sceso al 73,8% oltre. È ragionevole aspettarsi che GPT-6 Sol sia utilizzabile fino a circa 250K, ma è una deduzione, non una misura. Oltre 272K paghi il doppio sull'input per una qualità che nessuno ha misurato.

In Codex questo è già il default. Dà a GPT-6 Sol una finestra di 272K e comprime a 244.800 token. Per i tuoi agenti, imposta un alert sulle richieste che superano 272K e tratta ogni aumento come qualcosa da testare. Esegui un tuo test di recupero sui tuoi documenti prima di affidarti a un contesto oltre 256K.

Aggiorneremo questa pagina quando Context Arena o un altro valutatore indipendente pubblicherà risultati di GPT-6 Sol per lunghezza del contesto.

Fonti

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com