GPT-6 Sol 长上下文基准:已测量的内容,以及哪些数字属于 GPT-5.6 Sol
更新于 September 27, 2026 · 首次发布 September 27, 2026
截至 2026 年 9 月 27 日,GPT-6 Sol 只有一个独立的长上下文得分:Artificial Analysis AA-LCR v1.1 上的 84%,与 GPT-5.6 Sol 持平。该测试的文档平均约为 100K token。目前还没有人公布 GPT-6 Sol 在 256K、512K 或 1M token 下的表现。网上大多数关于 “Sol” 的长上下文数字,包括 91.5% 的 MRCR 分数,实际上都是 GPT-5.6 Sol 的。GPT-6 Sol 于 9 月 22 日发布。
这对成本很重要,因为长上下文正是 GPT-6 价格跳升的地方。输入超过 272K token 后,整个请求都按长上下文价格计费。决定智能体保留多少上下文,需要在这一价格与尚不存在的质量数据之间权衡。
GPT-6 Sol 有哪些长上下文得分?
只有一个综合得分,对应约 100K token。
| 模型 | AA-LCR v1.1 | 排名 |
|---|---|---|
| GPT-6 Sol(max) | 84.0% | 7 |
| GPT-5.6 Sol(max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3(领先者,2026 年 9 月 24 日) | 88.7% | 1 |
AA-LCR 包含 100 道人工撰写的问题,文档集平均为 99,325 token。答案需要综合多个段落,而不是从单一段落中找到。它测试的是对长输入的推理能力。它无法显示准确率如何随输入增长而变化,因为每道题涉及的长度基本相同。
哪些长上下文数字属于 GPT-5.6 Sol,而非 GPT-6 Sol?
MRCR 分数。GPT-6 Astra 的发布报道在 OpenAI 的 MRCR v2 8-needle 测试中,将其与 “Sol” 进行了比较。那里的 Sol 指的是 GPT-5.6 Sol,Vellum 的文章也证实了这一点。
| MRCR v2,8-needle | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | 未发布 | |
OrcaRouter 对 GPT-6 Sol 的评测也得出同样的结论:GPT-5.6 Sol 有已发布的长上下文检索结果,而 GPT-6 Sol 没有对应的数据。
我们查过哪些地方?
以下都是可能发布此类数据的地方,均于 2026 年 9 月 27 日查询:
- Context Arena,MRCR 排行榜。其模型列表和 8-needle 结果中没有 GPT-6 条目。其最新的 OpenAI 模型是 GPT-5.6 Sol、Terra 和 Luna。
- OpenAI:GPT-6 发布文章,以及 Sol 和 Luna 的系统卡附录。两者都没有按上下文长度给出 Sol 的结果。
- Artificial Analysis:仅有上文提到的 AA-LCR。
- Vals、Vellum、DataCamp、emergent.sh、llm-stats 和 OrcaRouter:没有 GPT-6 Sol 按长度划分的长上下文结果。
在按长度划分的数据出现之前,团队应该怎么做?
将 GPT-6 Sol 请求的输入控制在 272K token 以内,并尽早压缩上下文。现有证据显示,GPT-6 Sol 在约 100K token 时与 GPT-5.6 Sol 相当。GPT-5.6 Sol 在 MRCR 上可保持到 512K token 时的 91.5%,超过之后降到 73.8%。可以合理预期 GPT-6 Sol 在约 250K token 以内可用,但这只是推断,并非实测。超过 272K 时,你是在为一份无人测量过的质量支付双倍的输入费用。
在 Codex 中,这已经是默认设置。它为 GPT-6 Sol 提供 272K 的窗口,并在 244,800 token 时压缩。对于你自己的智能体,应对超过 272K 的请求设置告警,并把任何增长都视为需要测试的变化。在依赖 256K 以上的上下文之前,请先用你自己的文档运行一次检索检查。
当 Context Arena 或其他独立评测机构发布按上下文长度划分的 GPT-6 Sol 结果时,我们会更新本页。
来源
- Artificial Analysis:GPT-6 Sol 对比 GPT-5.6 Sol
- Artificial Analysis:AA-LCR 发布公告
- BenchLM:AA-LCR 排行榜
- Vellum:GPT-6 Astra 基准详解
- OrcaRouter:GPT-6 Sol 对比 GPT-5.6 Sol
- Context Arena:MRCR 排行榜
相关文章
想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →