GPT-6 Sol Langkontext-Benchmarks: Was tatsächlich gemessen wurde und was GPT-5.6 Sol ist
Aktualisiert September 27, 2026 · erstveröffentlicht September 27, 2026
Stand 27. September 2026 hat GPT-6 Sol genau einen unabhängigen Langkontext-Wert: 84 % bei Artificial Analysis AA-LCR v1.1, gleichauf mit GPT-5.6 Sol. Die Dokumente des Tests haben im Schnitt etwa 100K Tokens. Niemand hat bisher veröffentlicht, wie sich GPT-6 Sol bei 256K, 512K oder 1M Tokens schlägt. Die meisten Langkontext-Zahlen zu „Sol“ im Netz, darunter der MRCR-Wert von 91,5 %, gehören zu GPT-5.6 Sol. GPT-6 Sol erschien am 22. September.
Für die Kosten ist das wichtig, weil die GPT-6-Preise gerade beim langen Kontext springen. Oberhalb von 272K Eingabe-Tokens wird die gesamte Anfrage zu Langkontext-Tarifen abgerechnet. Wie viel Kontext ein Agent behält, ist also eine Abwägung zwischen diesem Preis und Qualitätsdaten, die es noch nicht gibt.
Welche Langkontext-Werte hat GPT-6 Sol?
Einen aggregierten Wert, bei rund 100K Tokens.
| Modell | AA-LCR v1.1 | Rang |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (Spitzenreiter, 24. Sep. 2026) | 88.7% | 1 |
AA-LCR besteht aus 100 handgeschriebenen Fragen zu Dokumentsätzen mit durchschnittlich 99.325 Tokens. Die Antworten müssen aus mehreren Textstellen zusammengesetzt werden, statt an einer Stelle zu stehen. Der Test misst das Schlussfolgern über eine lange Eingabe. Er zeigt nicht, wie sich die Genauigkeit mit wachsender Eingabe verändert, weil alle Fragen ungefähr gleich lang sind.
Welche Langkontext-Zahlen gehören zu GPT-5.6 Sol und nicht zu GPT-6 Sol?
Die MRCR-Werte. Die Berichte zum Launch von GPT-6 Astra verglichen es mit „Sol“ im MRCR-v2-8-Needle-Test von OpenAI. Dieses Sol war GPT-5.6 Sol, wie auch Vellums Beitrag bestätigt.
| MRCR v2, 8 Needles | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | nicht veröffentlicht | |
Der GPT-6-Sol-Test von OrcaRouter sagt dasselbe: Für GPT-5.6 Sol gibt es ein veröffentlichtes Ergebnis zum Abruf im langen Kontext, für GPT-6 Sol nichts Vergleichbares.
Wo haben wir nachgesehen?
An den Stellen, an denen es veröffentlicht würde, alle geprüft am 27. September 2026:
- Context Arena, die MRCR-Rangliste. Modellliste und 8-Needle-Ergebnisse enthalten keine GPT-6-Einträge. Die neuesten OpenAI-Modelle sind GPT-5.6 Sol, Terra und Luna.
- OpenAI: der GPT-6-Launch-Beitrag und der Anhang der System Card für Sol und Luna. Keiner nennt Sol-Ergebnisse nach Kontextlänge.
- Artificial Analysis: nur AA-LCR, wie oben.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats und OrcaRouter: keine Langkontext-Ergebnisse nach Länge für GPT-6 Sol.
Was sollten Teams tun, bis es Daten nach Länge gibt?
GPT-6-Sol-Anfragen unter 272K Eingabe-Tokens halten und früh komprimieren. Die bisherige Evidenz zeigt GPT-6 Sol bei etwa 100K gleichauf mit GPT-5.6 Sol. GPT-5.6 Sol hielt im MRCR bis 512K 91,5 %, fiel danach aber auf 73,8 %. Es ist vernünftig anzunehmen, dass GPT-6 Sol bis etwa 250K brauchbar ist, aber das ist eine Schlussfolgerung, keine Messung. Oberhalb von 272K zahlen Sie das Doppelte für die Eingabe, für eine Qualität, die niemand gemessen hat.
In Codex ist das bereits der Standard. Es gibt GPT-6 Sol ein Fenster von 272K und komprimiert bei 244.800 Tokens. Richten Sie für Ihre eigenen Agenten einen Alarm für Anfragen über 272K ein und behandeln Sie jede Erhöhung als etwas, das getestet werden muss. Führen Sie mit Ihren eigenen Dokumenten einen eigenen Retrieval-Test durch, bevor Sie sich auf Kontext jenseits von 256K verlassen.
Wir aktualisieren diese Seite, sobald Context Arena oder ein anderer unabhängiger Evaluator GPT-6-Sol-Ergebnisse nach Kontextlänge veröffentlicht.
Quellen
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis: Vorstellung von AA-LCR
- BenchLM: AA-LCR-Rangliste
- Vellum: GPT-6-Astra-Benchmarks erklärt
- OrcaRouter: GPT-6 Sol vs GPT-5.6 Sol
- Context Arena: MRCR-Rangliste
Weiterführend
- Codex Auto-Compact bei GPT-6 Sol: die tatsächlichen Standardwerte
- GPT-6 Sol: Preise und Kostenmodell
- GPT-6-Preise und der Langkontext-Preissprung bei 272K
Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →