Zum Inhalt springen

GPT-6 Sol Langkontext-Benchmarks: Was tatsächlich gemessen wurde und was GPT-5.6 Sol ist

Aktualisiert September 27, 2026 · erstveröffentlicht September 27, 2026

Kurzantwort: Stand 27. September 2026 hat GPT-6 Sol genau einen unabhängigen Langkontext-Wert: 84 % bei Artificial Analysis AA-LCR v1.1, gleichauf mit GPT-5.6 Sol. Die Dokumente des Tests haben im Schnitt etwa...

Stand 27. September 2026 hat GPT-6 Sol genau einen unabhängigen Langkontext-Wert: 84 % bei Artificial Analysis AA-LCR v1.1, gleichauf mit GPT-5.6 Sol. Die Dokumente des Tests haben im Schnitt etwa 100K Tokens. Niemand hat bisher veröffentlicht, wie sich GPT-6 Sol bei 256K, 512K oder 1M Tokens schlägt. Die meisten Langkontext-Zahlen zu „Sol“ im Netz, darunter der MRCR-Wert von 91,5 %, gehören zu GPT-5.6 Sol. GPT-6 Sol erschien am 22. September.

Für die Kosten ist das wichtig, weil die GPT-6-Preise gerade beim langen Kontext springen. Oberhalb von 272K Eingabe-Tokens wird die gesamte Anfrage zu Langkontext-Tarifen abgerechnet. Wie viel Kontext ein Agent behält, ist also eine Abwägung zwischen diesem Preis und Qualitätsdaten, die es noch nicht gibt.

Welche Langkontext-Werte hat GPT-6 Sol?

Einen aggregierten Wert, bei rund 100K Tokens.

ModellAA-LCR v1.1Rang
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3 (Spitzenreiter, 24. Sep. 2026)88.7%1

AA-LCR besteht aus 100 handgeschriebenen Fragen zu Dokumentsätzen mit durchschnittlich 99.325 Tokens. Die Antworten müssen aus mehreren Textstellen zusammengesetzt werden, statt an einer Stelle zu stehen. Der Test misst das Schlussfolgern über eine lange Eingabe. Er zeigt nicht, wie sich die Genauigkeit mit wachsender Eingabe verändert, weil alle Fragen ungefähr gleich lang sind.

Welche Langkontext-Zahlen gehören zu GPT-5.6 Sol und nicht zu GPT-6 Sol?

Die MRCR-Werte. Die Berichte zum Launch von GPT-6 Astra verglichen es mit „Sol“ im MRCR-v2-8-Needle-Test von OpenAI. Dieses Sol war GPT-5.6 Sol, wie auch Vellums Beitrag bestätigt.

MRCR v2, 8 Needles256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Solnicht veröffentlicht

Der GPT-6-Sol-Test von OrcaRouter sagt dasselbe: Für GPT-5.6 Sol gibt es ein veröffentlichtes Ergebnis zum Abruf im langen Kontext, für GPT-6 Sol nichts Vergleichbares.

Wo haben wir nachgesehen?

An den Stellen, an denen es veröffentlicht würde, alle geprüft am 27. September 2026:

Was sollten Teams tun, bis es Daten nach Länge gibt?

GPT-6-Sol-Anfragen unter 272K Eingabe-Tokens halten und früh komprimieren. Die bisherige Evidenz zeigt GPT-6 Sol bei etwa 100K gleichauf mit GPT-5.6 Sol. GPT-5.6 Sol hielt im MRCR bis 512K 91,5 %, fiel danach aber auf 73,8 %. Es ist vernünftig anzunehmen, dass GPT-6 Sol bis etwa 250K brauchbar ist, aber das ist eine Schlussfolgerung, keine Messung. Oberhalb von 272K zahlen Sie das Doppelte für die Eingabe, für eine Qualität, die niemand gemessen hat.

In Codex ist das bereits der Standard. Es gibt GPT-6 Sol ein Fenster von 272K und komprimiert bei 244.800 Tokens. Richten Sie für Ihre eigenen Agenten einen Alarm für Anfragen über 272K ein und behandeln Sie jede Erhöhung als etwas, das getestet werden muss. Führen Sie mit Ihren eigenen Dokumenten einen eigenen Retrieval-Test durch, bevor Sie sich auf Kontext jenseits von 256K verlassen.

Wir aktualisieren diese Seite, sobald Context Arena oder ein anderer unabhängiger Evaluator GPT-6-Sol-Ergebnisse nach Kontextlänge veröffentlicht.

Quellen

Weiterführend


Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →

Zurück zu finopsllm.com