GPT-6 Solの長文脈ベンチマーク:実際に測定された内容と、GPT-5.6 Solの数値の見分け方
更新日 September 27, 2026 · 初回公開 September 27, 2026
2026年9月27日時点で、GPT-6 Solの独立した長文脈スコアはちょうど1つだけです。Artificial Analysis AA-LCR v1.1での84%で、GPT-5.6 Solと同点です。このテストの文書は平均約100Kトークンです。GPT-6 Solが256K、512K、1Mトークンでどの程度保てるかは、まだ誰も公表していません。MRCRの91.5%を含め、ネット上で見かける「Sol」の長文脈の数値の多くはGPT-5.6 Solのものです。GPT-6 Solは9月22日に登場しました。
これがコストに関わるのは、GPT-6の価格が長文脈で跳ね上がるためです。入力が272Kトークンを超えると、リクエスト全体が長文脈料金で課金されます。エージェントがどれだけコンテキストを保持するかは、この価格と、まだ存在しない品質データを比べて決めることになります。
GPT-6 Solにはどんな長文脈スコアがありますか?
約100Kトークンでの総合スコアが1つあります。
| モデル | AA-LCR v1.1 | 順位 |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3(首位、2026年9月24日) | 88.7% | 1 |
AA-LCRは、平均99,325トークンの文書セットに対する100問の手作り問題で構成されています。答えは1か所で見つかるのではなく、複数の箇所を組み合わせて導く必要があります。長い入力に対する推論力を測るテストです。どの問題も長さがほぼ同じなので、入力が長くなるにつれて精度がどう変わるかは分かりません。
GPT-6 Solではなく、GPT-5.6 Solの長文脈の数値はどれですか?
MRCRのスコアです。GPT-6 Astraの発表時の報道では、OpenAIのMRCR v2 8-needleテストで「Sol」と比較されていました。その「Sol」はGPT-5.6 Solで、Vellumの記事もそれを確認しています。
| MRCR v2、8-needle | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | 未公開 | |
OrcaRouterのGPT-6 Solレビューも同じ指摘をしています。GPT-5.6 Solには長文脈検索の公開結果がありますが、GPT-6 Solには同等のものがありません。
どこを確認しましたか?
公開されるはずの場所を、すべて2026年9月27日に確認しました。
- Context Arena(MRCRリーダーボード):モデル一覧と8-needleの結果にGPT-6のエントリはありません。OpenAIの最新モデルはGPT-5.6 Sol、Terra、Lunaです。
- OpenAI:GPT-6の発表記事と、SolおよびLunaのシステムカード付録。どちらにもコンテキスト長別のSolの結果はありません。
- Artificial Analysis:上記のAA-LCRのみです。
- Vals、Vellum、DataCamp、emergent.sh、llm-stats、OrcaRouter:GPT-6 Solの長さ別の長文脈結果はありません。
長さ別のデータが出るまで、チームは何をすべきですか?
GPT-6 Solへのリクエストは入力272Kトークン未満に抑え、早めにコンパクトしてください。現時点の証拠では、GPT-6 Solは約100KでGPT-5.6 Solと並んでいます。GPT-5.6 SolはMRCRで512Kまで91.5%を維持しましたが、それを超えると73.8%に落ちました。GPT-6 Solも約250Kまでは使えると考えるのは妥当ですが、それは測定ではなく推測です。272Kを超えると、誰も測定していない品質に対して入力に2倍を支払うことになります。
Codexではこれがすでにデフォルトです。GPT-6 Solには272Kのウィンドウを与え、244,800トークンでコンパクトします。自社のエージェントでは、272Kを超えるリクエストにアラートを設定し、引き上げる場合はテスト対象として扱ってください。256Kを超えるコンテキストに頼る前に、自社の文書で独自の検索テストを実施してください。
Context Arenaなどの独立した評価機関がGPT-6 Solのコンテキスト長別の結果を公開した時点で、このページを更新します。
出典
- Artificial Analysis:GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis:AA-LCRの発表
- BenchLM:AA-LCRリーダーボード
- Vellum:GPT-6 Astraのベンチマーク解説
- OrcaRouter:GPT-6 Sol vs GPT-5.6 Sol
- Context Arena:MRCRリーダーボード
関連記事
この方法を自社の環境にも適用しますか? プロバイダーの請求書、ゲートウェイログ、主要なワークフローをお持ちください。コスト要因と削減策を整理します。 無料監査を予約 →