本文へ移動

GPT-6 Solの長文脈ベンチマーク:実際に測定された内容と、GPT-5.6 Solの数値の見分け方

更新日 September 27, 2026 · 初回公開 September 27, 2026

要約: 2026年9月27日時点で、GPT-6 Solの独立した長文脈スコアはちょうど1つだけです。Artificial Analysis AA-LCR v1.1での84%で、GPT-5.6 Solと同点です。このテストの文書は平均約100Kトークンです。GPT-6...

2026年9月27日時点で、GPT-6 Solの独立した長文脈スコアはちょうど1つだけです。Artificial Analysis AA-LCR v1.1での84%で、GPT-5.6 Solと同点です。このテストの文書は平均約100Kトークンです。GPT-6 Solが256K、512K、1Mトークンでどの程度保てるかは、まだ誰も公表していません。MRCRの91.5%を含め、ネット上で見かける「Sol」の長文脈の数値の多くはGPT-5.6 Solのものです。GPT-6 Solは9月22日に登場しました。

これがコストに関わるのは、GPT-6の価格が長文脈で跳ね上がるためです。入力が272Kトークンを超えると、リクエスト全体が長文脈料金で課金されます。エージェントがどれだけコンテキストを保持するかは、この価格と、まだ存在しない品質データを比べて決めることになります。

GPT-6 Solにはどんな長文脈スコアがありますか?

約100Kトークンでの総合スコアが1つあります。

モデルAA-LCR v1.1順位
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3(首位、2026年9月24日)88.7%1

AA-LCRは、平均99,325トークンの文書セットに対する100問の手作り問題で構成されています。答えは1か所で見つかるのではなく、複数の箇所を組み合わせて導く必要があります。長い入力に対する推論力を測るテストです。どの問題も長さがほぼ同じなので、入力が長くなるにつれて精度がどう変わるかは分かりません。

GPT-6 Solではなく、GPT-5.6 Solの長文脈の数値はどれですか?

MRCRのスコアです。GPT-6 Astraの発表時の報道では、OpenAIのMRCR v2 8-needleテストで「Sol」と比較されていました。その「Sol」はGPT-5.6 Solで、Vellumの記事もそれを確認しています。

MRCR v2、8-needle256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Sol未公開

OrcaRouterのGPT-6 Solレビューも同じ指摘をしています。GPT-5.6 Solには長文脈検索の公開結果がありますが、GPT-6 Solには同等のものがありません。

どこを確認しましたか?

公開されるはずの場所を、すべて2026年9月27日に確認しました。

長さ別のデータが出るまで、チームは何をすべきですか?

GPT-6 Solへのリクエストは入力272Kトークン未満に抑え、早めにコンパクトしてください。現時点の証拠では、GPT-6 Solは約100KでGPT-5.6 Solと並んでいます。GPT-5.6 SolはMRCRで512Kまで91.5%を維持しましたが、それを超えると73.8%に落ちました。GPT-6 Solも約250Kまでは使えると考えるのは妥当ですが、それは測定ではなく推測です。272Kを超えると、誰も測定していない品質に対して入力に2倍を支払うことになります。

Codexではこれがすでにデフォルトです。GPT-6 Solには272Kのウィンドウを与え、244,800トークンでコンパクトします。自社のエージェントでは、272Kを超えるリクエストにアラートを設定し、引き上げる場合はテスト対象として扱ってください。256Kを超えるコンテキストに頼る前に、自社の文書で独自の検索テストを実施してください。

Context Arenaなどの独立した評価機関がGPT-6 Solのコンテキスト長別の結果を公開した時点で、このページを更新します。

出典

関連記事


この方法を自社の環境にも適用しますか? プロバイダーの請求書、ゲートウェイログ、主要なワークフローをお持ちください。コスト要因と削減策を整理します。 無料監査を予約 →

finopsllm.com に戻る