Benchmarki długiego kontekstu GPT-6 Sol: co faktycznie zmierzono i czym jest GPT-5.6 Sol
Zaktualizowano September 27, 2026 · pierwsza publikacja September 27, 2026
Stan na 27 września 2026 roku: GPT-6 Sol ma dokładnie jeden niezależny wynik długiego kontekstu, 84% w Artificial Analysis AA-LCR v1.1, tyle samo co GPT-5.6 Sol. Dokumenty w tym teście mają średnio około 100K tokenów. Nikt jeszcze nie opublikował, jak GPT-6 Sol radzi sobie przy 256K, 512K czy 1M tokenów. Większość liczb dla „Sol” dotyczących długiego kontekstu w sieci, w tym wynik MRCR 91.5%, dotyczy GPT-5.6 Sol. GPT-6 Sol pojawił się 22 września.
Ma to znaczenie dla kosztów, bo właśnie w długim kontekście ceny GPT-6 skaczą. Powyżej 272K tokenów wejścia całe żądanie jest rozliczane według stawek długiego kontekstu. Decydując, ile kontekstu zachowuje agent, trzeba zważyć tę cenę z danymi jakościowymi, które jeszcze nie istnieją.
Jakie wyniki długiego kontekstu ma GPT-6 Sol?
Jeden zbiorczy wynik, przy około 100K tokenów.
| Model | AA-LCR v1.1 | Miejsce |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (lider, 24 wrz 2026) | 88.7% | 1 |
AA-LCR ma 100 ręcznie napisanych pytań nad zestawami dokumentów o średniej długości 99,325 tokenów. Odpowiedzi trzeba złożyć z kilku fragmentów, a nie znaleźć w jednym miejscu. Test sprawdza rozumowanie nad długim wejściem. Nie pokazuje jednak, jak zmienia się dokładność wraz ze wzrostem wejścia, bo wszystkie pytania dotyczą dokumentów o podobnej długości.
Które wyniki długiego kontekstu należą do GPT-5.6 Sol, a nie GPT-6 Sol?
Wyniki MRCR. Materiały launchowe GPT-6 Astra porównywały go z „Sol” w teście MRCR v2 8-needle od OpenAI. Chodziło o GPT-5.6 Sol, co potwierdza write-up Vellum.
| MRCR v2, 8-needle | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | nie opublikowano | |
Recenzja GPT-6 Sol w OrcaRouter mówi to samo: GPT-5.6 Sol ma opublikowany wynik wyszukiwania w długim kontekście, a GPT-6 Sol nie ma nic równoważnego.
Gdzie sprawdzano?
Miejsca, które mogłyby to opublikować, wszystkie sprawdzone 27 września 2026 roku:
- Context Arena, ranking MRCR. Lista modeli i wyniki 8-needle nie mają wpisów GPT-6. Najnowsze modele OpenAI tam to GPT-5.6 Sol, Terra i Luna.
- OpenAI: wpis z premierą GPT-6 i załącznik do karty systemowej dla Sol i Luna. Żaden z nich nie podaje wyników Sol według długości kontekstu.
- Artificial Analysis: tylko AA-LCR, jak wyżej.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats i OrcaRouter: brak wyników długiego kontekstu według długości dla GPT-6 Sol.
Co robić, dopóki nie ma danych według długości?
Trzymaj żądania GPT-6 Sol poniżej 272K tokenów wejścia i kompaktuj wcześnie. Dotychczasowe dane pokazują, że GPT-6 Sol dorównuje GPT-5.6 Sol przy około 100K. GPT-5.6 Sol utrzymał 91.5% do 512K w MRCR, ale poza tym spadł do 73.8%. Rozsądnie jest oczekiwać, że GPT-6 Sol będzie użyteczny do około 250K, ale to wniosek, a nie pomiar. Powyżej 272K płacisz podwójnie za wejście za jakość, której nikt nie zmierzył.
W Codex to już domyślne ustawienie. Daje GPT-6 Sol okno 272K i kompaktuje przy 244,800 tokenach. W swoich agentach ustaw alert na żądania przekraczające 272K i traktuj każdy wzrost jako coś do przetestowania. Przed poleganiem na kontekście powyżej 256K uruchom własny test wyszukiwania na własnych dokumentach.
Zaktualizujemy tę stronę, gdy Context Arena lub inny niezależny ewaluator opublikuje wyniki GPT-6 Sol według długości kontekstu.
Źródła
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis: zapowiedź AA-LCR
- BenchLM: ranking AA-LCR
- Vellum: GPT-6 Astra benchmarks explained
- OrcaRouter: GPT-6 Sol vs GPT-5.6 Sol
- Context Arena: ranking MRCR
Powiązane
- Auto-compact w Codex na GPT-6 Sol: prawdziwe ustawienia domyślne
- Ceny i model kosztów GPT-6 Sol
- Ceny GPT-6 i skok cen przy długim kontekście od 272K
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →