フロンティアモデルのタスク単価の実測

Updated September 22, 2026 · first published September 22, 2026

定価からわかるのはトークン1つの値段です。完了したタスク1件の値段はわかりません。同じ作業でも、モデルによって使うトークン数が大きく違うからです。このページでは、Claude Opus 5.5、Claude Opus 5、Claude Fable 5.1、GPT-6 Astra、GPT-6 Sol の全 effort レベルについて、実測のタスク単価と品質スコアを並べました。すべての数字に出典があり、推定値はありません。

結論:スコア 47.5 までなら、どの水準でも GPT-6 Sol が最安です。47.5 を超えると、どのレベルでも Opus 5.5 が最安です。low より上の GPT-6 Astra、Opus 5、Fable 5.1 はどの設定もコスト効率が悪く、いずれもスコアと価格の両方で Sol か Opus 5.5 のいずれかの設定に負けています。

方法

スコアとコストはすべて Artificial Analysis Intelligence Index v4.3.2(2026年9月22日閲覧)によるものです。この指標は AA-Briefcase、GDPval-AA、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR の10種類の評価で構成されています。Artificial Analysis は各モデルを各 effort 設定でプロバイダーの API から実行し、定価で支払った額を記録しています。タスク単価はそのタスクあたりの支出で、入力と出力に分けています。どの行も同じ評価セットで測っているので、行どうしをそのまま比較できます。

数字を読む前に、制約が2つあります。第一に、この指標は1つのタスク構成にすぎません。自社のタスク構成ではコストが変わるため、最後の節で自分で測る方法を説明しています。第二に、指標のバージョンが違うスコアは比較できません。以前に公表された数字と混ぜないでください。

全体の一覧:26 設定

タスクあたり出力トークンは、推論を含めてモデルが書いたトークン数です。GPT-6 Sol の中間4設定について Artificial Analysis は入力と出力の内訳を公表していないため、その欄は n/a としています。

モデルEffortIntelligence Indexタスク単価入力コスト出力コストタスクあたり出力トークンフロンティア上
GPT-6 Solnone28.1$0.33$0.28$0.054,900いいえ
GPT-6 Sollow33.9$0.13n/an/a3,400はい
GPT-6 Solmedium (デフォルト)39.8$0.25n/an/a6,500はい
GPT-6 Solhigh42.8$0.37n/an/a10,200はい
GPT-6 Solxhigh44.1$0.53n/an/a16,000はい
GPT-6 Solmax47.5$1.06$0.74$0.3131,200はい
GPT-6 Astralow45.8$0.82$0.60$0.224,400はい
GPT-6 Astramedium49.6$1.54$1.06$0.489,600いいえ
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800いいえ
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900いいえ
GPT-6 Astramax52.7$3.26$1.90$1.3627,200いいえ
Claude Opus 5low39.4$1.10$0.73$0.3714,700いいえ
Claude Opus 5medium44.8$2.19$1.47$0.7229,000いいえ
Claude Opus 5high (デフォルト)48.1$3.61$2.46$1.1646,200いいえ
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700いいえ
Claude Opus 5max50.8$5.86$4.05$1.8172,500いいえ
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200いいえ
Claude Opus 5.5medium (デフォルト)51.2$1.34$0.82$0.5125,700はい
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600はい
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700はい
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200はい
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600いいえ
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900いいえ
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100いいえ
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500いいえ
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100いいえ

「フロンティア上」とは、この表の中に、より安くてより高いスコアの設定が他にないことを意味します。

コストのフロンティア

26 設定のうち 10 設定がフロンティア上にあります。コスト順に並べると、価格だけで判断するなら検討に値するのはこの10設定だけです。それ以外は、同じかそれ以下のスコアにより多く払っています。

設定Intelligence Indexタスク単価1万タスクあたり
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

フロンティアには2つの領域があります。0.13ドルから1.06ドルまではほぼ GPT-6 Sol で、唯一の例外が 0.82ドルの GPT-6 Astra low です。1.34ドル以上は Opus 5.5 だけです。2つの領域の差は小さく、Opus 5.5 medium は Sol max より 3.7 ポイント高く、タスクあたりの差額は 0.28ドルです。

同等以上のスコアでの直接比較

各ペアは、安い設定と、それと同じかそれ以下のスコアの高い設定を比べています。

安い設定高い設定スコア差削減額
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61Opus 5.5で+3.163%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86Opus 5.5で+0.477%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91同点66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26Opus 5.5で+0.944%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63Opus 5.5で+0.276%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61Opus 5で+0.671%

Opus 5 の行は、まだ移行していないチームにとって重要です。Opus 5 のデフォルトは high でした。Opus 5.5 のデフォルトは medium で、その設定でタスク単価は 63% 安く、スコアは 3.1 ポイント高くなります。Anthropic は Opus 5.5 が Opus 5 より 40% 安いとしていますが、この指標での実測差はその主張より大きくなっています。

お金の行き先:出力ではなく入力

どのモデルでも、タスク単価の約半分から4分の3が入力です。Opus 5.5 medium では 1.34ドルのうち 0.82ドル、つまり 61% が入力です。GPT-6 Astra max では 58%、GPT-6 Sol max では 70%、Fable 5.1 max では 49% です。エージェントのタスクは、ステップごとに膨らんだコンテキストを送り直します。そのため入力コストは回答の長さだけでなく、ステップ数に比例して増えます。

GPT-6 Sol の推論なし設定が low より高いのはこのためです。出力は 4,900 トークンしかないのに、0.13ドルに対して 0.33ドルかかります。0.33ドルのうち 0.28ドルが入力です。おそらくステップ数が増え、そのたびにコンテキストを送り直しているのが原因です。推論をオフにしても、その分ターン数が増えればエージェントは安くなりません。

請求額の面では、キャッシュがモデル選びと同じくらい重要だということです。Opus 5.5 と GPT-6 Sol はキャッシュ済み入力100万トークンあたり 0.20ドルです。GPT-6 Astra は 1.00ドル、Opus 5 は 0.50ドルです。

トークン量と定価

ここで最もトークン効率がよいのは GPT-6 Astra です。max でもタスクあたりの出力は 27,200 トークンで、Opus 5.5 max の 119,200 トークンを大きく下回ります。しかし Astra の料金は100万トークンあたり 10ドルと 50ドルで、Opus 5.5 の 2.5× です。勝つのは定価のほうで、Opus 5.5 high はタスクあたり 1.82ドルでスコア 53.6、Astra max は 3.26ドルでスコア 52.7 です。

冗長さが効いてくるのは Opus 5.5 max だけです。出力 119,200 トークンだけで入力抜きでも 2.38ドル、タスク全体では 5.98ドルかかります。これで表の最高スコア 57.6 が得られますが、コストは medium の 4.5× です。

effort を上げたときの収穫逓減

各行は、effort を1段階上げたときに得られる指標ポイントと、タスクあたりの追加コストを示しています。

モデルmedium → highxhigh → max
GPT-6 Sol+48%で+3.0ポイント+100%で+3.4ポイント
GPT-6 Astra+12%で+1.3ポイント+41%で+0.3ポイント
Claude Opus 5+65%で+3.3ポイント+20%で+1.1ポイント
Claude Opus 5.5+36%で+2.4ポイント+73%で+1.6ポイント
Claude Fable 5.1+31%で+2.3ポイント+28%で+0.2ポイント

Fable 5.1 と GPT-6 Astra では、max にしてもほとんど何も得られません。28% と 41% 高くなって 0.2 と 0.3 ポイントです。Opus 5.5 では max に上げるとまだ 1.6 ポイント上がりますが、コストは 73% 増えます。max は、追加のポイントで結果が変わると実測で確かめたタスクだけに使ってください。

GPT-6 Sol max で足りる場面

指標は平均値であり、Sol max と Opus 5.5 medium の差は評価ごとに均一ではありません。Artificial Analysis による評価別スコア:

評価Opus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

AutomationBench と CritPt では、GPT-6 Sol がタスクあたり 1.34ドルに対して 1.06ドルで Opus 5.5 medium と同等以上です。Terminal-Bench、ナレッジワーク系の評価、Humanity's Last Exam では Opus 5.5 が大きくリードしています。ワークフローの自動化は Sol で回せます。ターミナルやコーディングのエージェント、文書の多いナレッジワークでは、Opus 5.5 が価格に見合う働きをします。

ベンダー公表値と独立測定値

ベンダーの公表値と独立機関の数字は、評価環境や設定が違うため、ずれることがよくあります。Anthropic は xhigh の Opus 5.5 について Terminal-Bench 4.0 で 66.4% と公表しています。Artificial Analysis の同じ effort での実測は 59.6% です。

EffortOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

順位も指標によって変わります。Vals AI Index では Fable 5.1 が 68.83% で1位、GPT-6 Astra が 66.61% で3位、Opus 5.5 が 66.16% で4位です。そこではタスク単価が同じ基準で公表されていないため、上のフロンティアは変わりません。1つの指標は1つの見方にすぎない、ということです。

定価とキャッシュ中心のタスク

Digital Applied は、キャッシュ中心のエージェントタスク1件の料金を各モデルで計算しました。キャッシュ読み取り 8M トークン、キャッシュなし入力 400K、キャッシュ書き込み 600K、出力 300K です。結果はフロンティアどおりで、GPT-6 Astra にだけ追加のペナルティがあります。

モデル入力 $/MTok出力 $/MTokキャッシュ読み取り $/MTokキャッシュ中心のタスク(Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra は、入力が 272K トークンを超えるとリクエスト全体に100万トークンあたり 20ドルと 75ドルを課金します。Opus 5.5 は 1M トークンのウィンドウ全体で単一価格です。Opus 5.5 のキャッシュ書き込みは 5分キャッシュで100万トークンあたり 5ドル、1時間キャッシュで 8ドル、バッチは 50% の料金、高速モードは2倍の料金です。詳しくはClaude Opus 5.5 のコストモデルOpus 5.5 高速モードの経済性をご覧ください。

自社のタスク単価を測る方法

  1. トークンはリクエスト単位ではなくタスク単位で記録します。キャッシュなし入力、キャッシュ済み入力、キャッシュ書き込み、出力を、タスクの全ステップにわたって合計します。
  2. 実際のタスクを数百件サンプルとして取り出し、Sol max、Opus 5.5 medium、Opus 5.5 high など候補の設定2〜3個で再実行します。
  3. 各結果を本番と同じチェックで採点し、合格したタスクの数を数えます。
  4. 総支出を合格タスク数で割ります。比べるべきなのは成功タスクあたりのコストです。安くても失敗が多い設定は、安くありません。
  5. 品質基準を満たす最も安い設定を選び、失敗したタスクだけを上位の設定に回します。
  6. 価格やデフォルトの effort が変わったら、再実行し直します。

1つのモデルで effort 設定が請求額をどう変えるかは、Opus 5.5 の effort レベルこそが本当の価格をご覧ください。

注意点

出典

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research