Przejdź do treści

Benchmarki długiego kontekstu GPT-6 Sol: co faktycznie zmierzono i czym jest GPT-5.6 Sol

Zaktualizowano September 27, 2026 · pierwsza publikacja September 27, 2026

Krótka odpowiedź: Stan na 27 września 2026 roku: GPT-6 Sol ma dokładnie jeden niezależny wynik długiego kontekstu, 84% w Artificial Analysis AA-LCR v1.1, tyle samo co GPT-5.6 Sol. Dokumenty w tym teście mają średnio...

Stan na 27 września 2026 roku: GPT-6 Sol ma dokładnie jeden niezależny wynik długiego kontekstu, 84% w Artificial Analysis AA-LCR v1.1, tyle samo co GPT-5.6 Sol. Dokumenty w tym teście mają średnio około 100K tokenów. Nikt jeszcze nie opublikował, jak GPT-6 Sol radzi sobie przy 256K, 512K czy 1M tokenów. Większość liczb dla „Sol” dotyczących długiego kontekstu w sieci, w tym wynik MRCR 91.5%, dotyczy GPT-5.6 Sol. GPT-6 Sol pojawił się 22 września.

Ma to znaczenie dla kosztów, bo właśnie w długim kontekście ceny GPT-6 skaczą. Powyżej 272K tokenów wejścia całe żądanie jest rozliczane według stawek długiego kontekstu. Decydując, ile kontekstu zachowuje agent, trzeba zważyć tę cenę z danymi jakościowymi, które jeszcze nie istnieją.

Jakie wyniki długiego kontekstu ma GPT-6 Sol?

Jeden zbiorczy wynik, przy około 100K tokenów.

ModelAA-LCR v1.1Miejsce
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3 (lider, 24 wrz 2026)88.7%1

AA-LCR ma 100 ręcznie napisanych pytań nad zestawami dokumentów o średniej długości 99,325 tokenów. Odpowiedzi trzeba złożyć z kilku fragmentów, a nie znaleźć w jednym miejscu. Test sprawdza rozumowanie nad długim wejściem. Nie pokazuje jednak, jak zmienia się dokładność wraz ze wzrostem wejścia, bo wszystkie pytania dotyczą dokumentów o podobnej długości.

Które wyniki długiego kontekstu należą do GPT-5.6 Sol, a nie GPT-6 Sol?

Wyniki MRCR. Materiały launchowe GPT-6 Astra porównywały go z „Sol” w teście MRCR v2 8-needle od OpenAI. Chodziło o GPT-5.6 Sol, co potwierdza write-up Vellum.

MRCR v2, 8-needle256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Solnie opublikowano

Recenzja GPT-6 Sol w OrcaRouter mówi to samo: GPT-5.6 Sol ma opublikowany wynik wyszukiwania w długim kontekście, a GPT-6 Sol nie ma nic równoważnego.

Gdzie sprawdzano?

Miejsca, które mogłyby to opublikować, wszystkie sprawdzone 27 września 2026 roku:

Co robić, dopóki nie ma danych według długości?

Trzymaj żądania GPT-6 Sol poniżej 272K tokenów wejścia i kompaktuj wcześnie. Dotychczasowe dane pokazują, że GPT-6 Sol dorównuje GPT-5.6 Sol przy około 100K. GPT-5.6 Sol utrzymał 91.5% do 512K w MRCR, ale poza tym spadł do 73.8%. Rozsądnie jest oczekiwać, że GPT-6 Sol będzie użyteczny do około 250K, ale to wniosek, a nie pomiar. Powyżej 272K płacisz podwójnie za wejście za jakość, której nikt nie zmierzył.

W Codex to już domyślne ustawienie. Daje GPT-6 Sol okno 272K i kompaktuje przy 244,800 tokenach. W swoich agentach ustaw alert na żądania przekraczające 272K i traktuj każdy wzrost jako coś do przetestowania. Przed poleganiem na kontekście powyżej 256K uruchom własny test wyszukiwania na własnych dokumentach.

Zaktualizujemy tę stronę, gdy Context Arena lub inny niezależny ewaluator opublikuje wyniki GPT-6 Sol według długości kontekstu.

Źródła

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com