跳至正文

GPT-6 Sol 长上下文基准:已测量的内容,以及哪些数字属于 GPT-5.6 Sol

更新于 September 27, 2026 · 首次发布 September 27, 2026

快速结论: 截至 2026 年 9 月 27 日,GPT-6 Sol 只有一个独立的长上下文得分:Artificial Analysis AA-LCR v1.1 上的 84%,与 GPT-5.6 Sol 持平。该测试的文档平均约为 100K token。目前还没有人公布 GPT-6 Sol 在 256K、512K 或 1M token 下的表现。网上大多数关于 “Sol” 的长上下文数字,包括 91.5% 的...

截至 2026 年 9 月 27 日,GPT-6 Sol 只有一个独立的长上下文得分:Artificial Analysis AA-LCR v1.1 上的 84%,与 GPT-5.6 Sol 持平。该测试的文档平均约为 100K token。目前还没有人公布 GPT-6 Sol 在 256K、512K 或 1M token 下的表现。网上大多数关于 “Sol” 的长上下文数字,包括 91.5% 的 MRCR 分数,实际上都是 GPT-5.6 Sol 的。GPT-6 Sol 于 9 月 22 日发布。

这对成本很重要,因为长上下文正是 GPT-6 价格跳升的地方。输入超过 272K token 后,整个请求都按长上下文价格计费。决定智能体保留多少上下文,需要在这一价格与尚不存在的质量数据之间权衡。

GPT-6 Sol 有哪些长上下文得分?

只有一个综合得分,对应约 100K token。

模型AA-LCR v1.1排名
GPT-6 Sol(max)84.0%7
GPT-5.6 Sol(max)84.0%7
GPT-6 Astra80.7%27
Kimi K3(领先者,2026 年 9 月 24 日)88.7%1

AA-LCR 包含 100 道人工撰写的问题,文档集平均为 99,325 token。答案需要综合多个段落,而不是从单一段落中找到。它测试的是对长输入的推理能力。它无法显示准确率如何随输入增长而变化,因为每道题涉及的长度基本相同。

哪些长上下文数字属于 GPT-5.6 Sol,而非 GPT-6 Sol?

MRCR 分数。GPT-6 Astra 的发布报道在 OpenAI 的 MRCR v2 8-needle 测试中,将其与 “Sol” 进行了比较。那里的 Sol 指的是 GPT-5.6 Sol,Vellum 的文章也证实了这一点。

MRCR v2,8-needle256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Sol未发布

OrcaRouter 对 GPT-6 Sol 的评测也得出同样的结论:GPT-5.6 Sol 有已发布的长上下文检索结果,而 GPT-6 Sol 没有对应的数据。

我们查过哪些地方?

以下都是可能发布此类数据的地方,均于 2026 年 9 月 27 日查询:

在按长度划分的数据出现之前,团队应该怎么做?

将 GPT-6 Sol 请求的输入控制在 272K token 以内,并尽早压缩上下文。现有证据显示,GPT-6 Sol 在约 100K token 时与 GPT-5.6 Sol 相当。GPT-5.6 Sol 在 MRCR 上可保持到 512K token 时的 91.5%,超过之后降到 73.8%。可以合理预期 GPT-6 Sol 在约 250K token 以内可用,但这只是推断,并非实测。超过 272K 时,你是在为一份无人测量过的质量支付双倍的输入费用。

在 Codex 中,这已经是默认设置。它为 GPT-6 Sol 提供 272K 的窗口,并在 244,800 token 时压缩。对于你自己的智能体,应对超过 272K 的请求设置告警,并把任何增长都视为需要测试的变化。在依赖 256K 以上的上下文之前,请先用你自己的文档运行一次检索检查。

当 Context Arena 或其他独立评测机构发布按上下文长度划分的 GPT-6 Sol 结果时,我们会更新本页。

来源

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com