Benchmarks de contexte long de GPT-6 Sol : ce qui a vraiment été mesuré, et ce qui relève de GPT-5.6 Sol
Mis à jour September 27, 2026 · première publication September 27, 2026
Au 27 septembre 2026, GPT-6 Sol n’a qu’un seul score indépendant en contexte long : 84 % sur Artificial Analysis AA-LCR v1.1, à égalité avec GPT-5.6 Sol. Les documents du test font en moyenne environ 100K tokens. Personne n’a encore publié la tenue de GPT-6 Sol à 256K, 512K ou 1M de tokens. La plupart des chiffres de contexte long attribués à « Sol » en ligne, y compris le score de 91,5 % sur MRCR, concernent GPT-5.6 Sol. GPT-6 Sol est sorti le 22 septembre.
Cela compte pour les coûts, car c’est en contexte long que les prix de GPT-6 bondissent. Au-delà de 272K tokens d’entrée, toute la requête est facturée au tarif contexte long. Décider de la quantité de contexte qu’un agent conserve revient à comparer ce prix à des données de qualité qui n’existent pas encore.
Quels scores de contexte long GPT-6 Sol a-t-il ?
Un seul score agrégé, autour de 100K tokens.
| Modèle | AA-LCR v1.1 | Rang |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (leader, 24 sept. 2026) | 88.7% | 1 |
AA-LCR comporte 100 questions rédigées à la main sur des ensembles de documents de 99.325 tokens en moyenne. Les réponses doivent être reconstituées à partir de plusieurs passages, et non trouvées dans un seul. Le test mesure le raisonnement sur une longue entrée. Il ne montre pas comment la précision évolue quand l’entrée grandit, car toutes les questions ont à peu près la même longueur.
Quels chiffres de contexte long sont ceux de GPT-5.6 Sol, et non de GPT-6 Sol ?
Les scores MRCR. La couverture du lancement de GPT-6 Astra le comparait à « Sol » sur le test MRCR v2 à 8 aiguilles d’OpenAI. Ce Sol était GPT-5.6 Sol, et l’article de Vellum le confirme.
| MRCR v2, 8 aiguilles | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | non publié | |
Le test de GPT-6 Sol par OrcaRouter fait le même constat : GPT-5.6 Sol a un résultat publié de récupération en contexte long, GPT-6 Sol n’a rien d’équivalent.
Où avons-nous cherché ?
Les endroits où ces résultats seraient publiés, tous vérifiés le 27 septembre 2026 :
- Context Arena, le classement MRCR. Sa liste de modèles et ses résultats à 8 aiguilles ne comportent aucune entrée GPT-6. Ses modèles OpenAI les plus récents sont GPT-5.6 Sol, Terra et Luna.
- OpenAI : l’annonce de lancement de GPT-6 et l’annexe de la system card pour Sol et Luna. Aucun des deux ne donne de résultats de Sol par longueur de contexte.
- Artificial Analysis : AA-LCR uniquement, comme ci-dessus.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats et OrcaRouter : aucun résultat de contexte long par longueur pour GPT-6 Sol.
Que doivent faire les équipes en attendant des données par longueur ?
Garder les requêtes GPT-6 Sol sous 272K tokens d’entrée et compacter tôt. Les éléments disponibles montrent GPT-6 Sol à égalité avec GPT-5.6 Sol à environ 100K. GPT-5.6 Sol a tenu 91,5 % jusqu’à 512K sur MRCR, mais est tombé à 73,8 % au-delà. Il est raisonnable de s’attendre à ce que GPT-6 Sol soit utilisable jusqu’à environ 250K, mais c’est une inférence, pas une mesure. Au-delà de 272K, vous payez l’entrée le double pour une qualité que personne n’a mesurée.
Dans Codex, c’est déjà le comportement par défaut. Il donne à GPT-6 Sol une fenêtre de 272K et compacte à 244.800 tokens. Pour vos propres agents, déclenchez une alerte sur les requêtes qui dépassent 272K et traitez toute augmentation comme quelque chose à tester. Lancez votre propre test de récupération sur vos propres documents avant de vous fier à un contexte au-delà de 256K.
Nous mettrons cette page à jour lorsque Context Arena ou un autre évaluateur indépendant publiera des résultats de GPT-6 Sol par longueur de contexte.
Sources
- Artificial Analysis : GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis : présentation d’AA-LCR
- BenchLM : classement AA-LCR
- Vellum : les benchmarks de GPT-6 Astra expliqués
- OrcaRouter : GPT-6 Sol vs GPT-5.6 Sol
- Context Arena : classement MRCR
À lire aussi
- Auto-compact de Codex sur GPT-6 Sol : les vraies valeurs par défaut
- Tarifs et modèle de coûts de GPT-6 Sol
- Tarifs de GPT-6 et le saut de prix du contexte long à 272K
Vous souhaitez appliquer cela à votre plateforme ? Transmettez vos factures fournisseurs, journaux de passerelle et principaux workflows ; nous cartographierons les coûts et les économies possibles. Demander un audit gratuit →