Ga naar inhoud

Long-contextbenchmarks van GPT-6 Sol: wat is daadwerkelijk gemeten, en wat is GPT-5.6 Sol

Bijgewerkt September 27, 2026 · eerst gepubliceerd September 27, 2026

Kort antwoord: Per 27 september 2026 heeft GPT-6 Sol precies één onafhankelijke long-contextscore: 84% op Artificial Analysis AA-LCR v1.1, gelijk aan GPT-5.6 Sol. De documenten van de test zijn gemiddeld ongeveer...

Per 27 september 2026 heeft GPT-6 Sol precies één onafhankelijke long-contextscore: 84% op Artificial Analysis AA-LCR v1.1, gelijk aan GPT-5.6 Sol. De documenten van de test zijn gemiddeld ongeveer 100K tokens. Niemand heeft nog gepubliceerd hoe GPT-6 Sol presteert bij 256K, 512K of 1M tokens. De meeste long-contextcijfers van “Sol” die online staan, waaronder de MRCR-score van 91.5%, gelden voor GPT-5.6 Sol. GPT-6 Sol kwam uit op 22 september.

Dit telt voor de kosten, omdat de GPT-6-prijzen bij lange context een sprong maken. Boven 272K input-tokens wordt het hele request tegen lange-contexttarieven gefactureerd. Bepalen hoeveel context een agent bewaart, betekent die prijs afwegen tegen kwaliteitsdata die nog niet bestaat.

Welke long-contextscores heeft GPT-6 Sol?

Eén totaalscore, bij ongeveer 100K tokens.

ModelAA-LCR v1.1Rang
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3 (koploper, 24 sep 2026)88.7%1

AA-LCR heeft 100 met de hand geschreven vragen over documentsets die gemiddeld 99,325 tokens tellen. De antwoorden moeten uit meerdere passages worden samengesteld in plaats van op één plek te worden gevonden. Het test redeneren over een lange input. Het laat niet zien hoe de nauwkeurigheid verandert naarmate de input groeit, omdat elke vraag ongeveer even lang is.

Welke long-contextcijfers zijn GPT-5.6 Sol, niet GPT-6 Sol?

De MRCR-scores. In de berichtgeving bij de lancering van GPT-6 Astra werd het vergeleken met “Sol” op de MRCR v2 8-needle-test van OpenAI. Die Sol was GPT-5.6 Sol, en het artikel van Vellum bevestigt dat.

MRCR v2, 8-needle256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Solniet gepubliceerd

De review van GPT-6 Sol door OrcaRouter maakt hetzelfde punt: GPT-5.6 Sol heeft een gepubliceerd long-contextretrievalresultaat, en GPT-6 Sol heeft niets vergelijkbaars.

Waar hebben we gekeken?

De plekken waar het zou worden gepubliceerd, allemaal gecontroleerd op 27 september 2026:

Wat moeten teams doen zolang er geen data per lengte is?

Houd GPT-6 Sol-requests onder 272K input-tokens en compacteer vroeg. Het bewijs tot nu toe laat zien dat GPT-6 Sol bij ongeveer 100K gelijk presteert aan GPT-5.6 Sol. GPT-5.6 Sol hield 91.5% vast tot 512K op MRCR, maar zakte daarboven naar 73.8%. Het is redelijk te verwachten dat GPT-6 Sol bruikbaar is tot ongeveer 250K, maar dat is een gevolgtrekking, geen meting. Boven 272K betaal je dubbel voor input voor een kwaliteit die niemand heeft gemeten.

In Codex is dit al de standaard. Het geeft GPT-6 Sol een venster van 272K en compacteert bij 244,800 tokens. Stel voor je eigen agents een alert in op requests die 272K passeren en behandel elke verhoging als iets om te testen. Voer je eigen retrievalcontrole uit op je eigen documenten voordat je op context voorbij 256K vertrouwt.

We werken deze pagina bij zodra Context Arena of een andere onafhankelijke evaluator resultaten van GPT-6 Sol per contextlengte publiceert.

Bronnen

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com