フロンティアモデルのタスク単価の実測
Updated September 22, 2026 · first published September 22, 2026
定価からわかるのはトークン1つの値段です。完了したタスク1件の値段はわかりません。同じ作業でも、モデルによって使うトークン数が大きく違うからです。このページでは、Claude Opus 5.5、Claude Opus 5、Claude Fable 5.1、GPT-6 Astra、GPT-6 Sol の全 effort レベルについて、実測のタスク単価と品質スコアを並べました。すべての数字に出典があり、推定値はありません。
結論:スコア 47.5 までなら、どの水準でも GPT-6 Sol が最安です。47.5 を超えると、どのレベルでも Opus 5.5 が最安です。low より上の GPT-6 Astra、Opus 5、Fable 5.1 はどの設定もコスト効率が悪く、いずれもスコアと価格の両方で Sol か Opus 5.5 のいずれかの設定に負けています。
方法
スコアとコストはすべて Artificial Analysis Intelligence Index v4.3.2(2026年9月22日閲覧)によるものです。この指標は AA-Briefcase、GDPval-AA、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR の10種類の評価で構成されています。Artificial Analysis は各モデルを各 effort 設定でプロバイダーの API から実行し、定価で支払った額を記録しています。タスク単価はそのタスクあたりの支出で、入力と出力に分けています。どの行も同じ評価セットで測っているので、行どうしをそのまま比較できます。
数字を読む前に、制約が2つあります。第一に、この指標は1つのタスク構成にすぎません。自社のタスク構成ではコストが変わるため、最後の節で自分で測る方法を説明しています。第二に、指標のバージョンが違うスコアは比較できません。以前に公表された数字と混ぜないでください。
全体の一覧:26 設定
タスクあたり出力トークンは、推論を含めてモデルが書いたトークン数です。GPT-6 Sol の中間4設定について Artificial Analysis は入力と出力の内訳を公表していないため、その欄は n/a としています。
| モデル | Effort | Intelligence Index | タスク単価 | 入力コスト | 出力コスト | タスクあたり出力トークン | フロンティア上 |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | いいえ |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | はい |
| GPT-6 Sol | medium (デフォルト) | 39.8 | $0.25 | n/a | n/a | 6,500 | はい |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | はい |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | はい |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | はい |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | はい |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | いいえ |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | いいえ |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | いいえ |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | いいえ |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | いいえ |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | いいえ |
| Claude Opus 5 | high (デフォルト) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | いいえ |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | いいえ |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | いいえ |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | いいえ |
| Claude Opus 5.5 | medium (デフォルト) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | はい |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | はい |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | はい |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | はい |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | いいえ |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | いいえ |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | いいえ |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | いいえ |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | いいえ |
「フロンティア上」とは、この表の中に、より安くてより高いスコアの設定が他にないことを意味します。
コストのフロンティア
26 設定のうち 10 設定がフロンティア上にあります。コスト順に並べると、価格だけで判断するなら検討に値するのはこの10設定だけです。それ以外は、同じかそれ以下のスコアにより多く払っています。
| 設定 | Intelligence Index | タスク単価 | 1万タスクあたり |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
フロンティアには2つの領域があります。0.13ドルから1.06ドルまではほぼ GPT-6 Sol で、唯一の例外が 0.82ドルの GPT-6 Astra low です。1.34ドル以上は Opus 5.5 だけです。2つの領域の差は小さく、Opus 5.5 medium は Sol max より 3.7 ポイント高く、タスクあたりの差額は 0.28ドルです。
同等以上のスコアでの直接比較
各ペアは、安い設定と、それと同じかそれ以下のスコアの高い設定を比べています。
| 安い設定 | 高い設定 | スコア差 | 削減額 |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | Opus 5.5で+3.1 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | Opus 5.5で+0.4 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | 同点 | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | Opus 5.5で+0.9 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | Opus 5.5で+0.2 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | Opus 5で+0.6 | 71% |
Opus 5 の行は、まだ移行していないチームにとって重要です。Opus 5 のデフォルトは high でした。Opus 5.5 のデフォルトは medium で、その設定でタスク単価は 63% 安く、スコアは 3.1 ポイント高くなります。Anthropic は Opus 5.5 が Opus 5 より 40% 安いとしていますが、この指標での実測差はその主張より大きくなっています。
お金の行き先:出力ではなく入力
どのモデルでも、タスク単価の約半分から4分の3が入力です。Opus 5.5 medium では 1.34ドルのうち 0.82ドル、つまり 61% が入力です。GPT-6 Astra max では 58%、GPT-6 Sol max では 70%、Fable 5.1 max では 49% です。エージェントのタスクは、ステップごとに膨らんだコンテキストを送り直します。そのため入力コストは回答の長さだけでなく、ステップ数に比例して増えます。
GPT-6 Sol の推論なし設定が low より高いのはこのためです。出力は 4,900 トークンしかないのに、0.13ドルに対して 0.33ドルかかります。0.33ドルのうち 0.28ドルが入力です。おそらくステップ数が増え、そのたびにコンテキストを送り直しているのが原因です。推論をオフにしても、その分ターン数が増えればエージェントは安くなりません。
請求額の面では、キャッシュがモデル選びと同じくらい重要だということです。Opus 5.5 と GPT-6 Sol はキャッシュ済み入力100万トークンあたり 0.20ドルです。GPT-6 Astra は 1.00ドル、Opus 5 は 0.50ドルです。
トークン量と定価
ここで最もトークン効率がよいのは GPT-6 Astra です。max でもタスクあたりの出力は 27,200 トークンで、Opus 5.5 max の 119,200 トークンを大きく下回ります。しかし Astra の料金は100万トークンあたり 10ドルと 50ドルで、Opus 5.5 の 2.5× です。勝つのは定価のほうで、Opus 5.5 high はタスクあたり 1.82ドルでスコア 53.6、Astra max は 3.26ドルでスコア 52.7 です。
冗長さが効いてくるのは Opus 5.5 max だけです。出力 119,200 トークンだけで入力抜きでも 2.38ドル、タスク全体では 5.98ドルかかります。これで表の最高スコア 57.6 が得られますが、コストは medium の 4.5× です。
effort を上げたときの収穫逓減
各行は、effort を1段階上げたときに得られる指標ポイントと、タスクあたりの追加コストを示しています。
| モデル | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +48%で+3.0ポイント | +100%で+3.4ポイント |
| GPT-6 Astra | +12%で+1.3ポイント | +41%で+0.3ポイント |
| Claude Opus 5 | +65%で+3.3ポイント | +20%で+1.1ポイント |
| Claude Opus 5.5 | +36%で+2.4ポイント | +73%で+1.6ポイント |
| Claude Fable 5.1 | +31%で+2.3ポイント | +28%で+0.2ポイント |
Fable 5.1 と GPT-6 Astra では、max にしてもほとんど何も得られません。28% と 41% 高くなって 0.2 と 0.3 ポイントです。Opus 5.5 では max に上げるとまだ 1.6 ポイント上がりますが、コストは 73% 増えます。max は、追加のポイントで結果が変わると実測で確かめたタスクだけに使ってください。
GPT-6 Sol max で足りる場面
指標は平均値であり、Sol max と Opus 5.5 medium の差は評価ごとに均一ではありません。Artificial Analysis による評価別スコア:
| 評価 | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
AutomationBench と CritPt では、GPT-6 Sol がタスクあたり 1.34ドルに対して 1.06ドルで Opus 5.5 medium と同等以上です。Terminal-Bench、ナレッジワーク系の評価、Humanity's Last Exam では Opus 5.5 が大きくリードしています。ワークフローの自動化は Sol で回せます。ターミナルやコーディングのエージェント、文書の多いナレッジワークでは、Opus 5.5 が価格に見合う働きをします。
ベンダー公表値と独立測定値
ベンダーの公表値と独立機関の数字は、評価環境や設定が違うため、ずれることがよくあります。Anthropic は xhigh の Opus 5.5 について Terminal-Bench 4.0 で 66.4% と公表しています。Artificial Analysis の同じ effort での実測は 59.6% です。
| Effort | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
順位も指標によって変わります。Vals AI Index では Fable 5.1 が 68.83% で1位、GPT-6 Astra が 66.61% で3位、Opus 5.5 が 66.16% で4位です。そこではタスク単価が同じ基準で公表されていないため、上のフロンティアは変わりません。1つの指標は1つの見方にすぎない、ということです。
定価とキャッシュ中心のタスク
Digital Applied は、キャッシュ中心のエージェントタスク1件の料金を各モデルで計算しました。キャッシュ読み取り 8M トークン、キャッシュなし入力 400K、キャッシュ書き込み 600K、出力 300K です。結果はフロンティアどおりで、GPT-6 Astra にだけ追加のペナルティがあります。
| モデル | 入力 $/MTok | 出力 $/MTok | キャッシュ読み取り $/MTok | キャッシュ中心のタスク(Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
GPT-6 Astra は、入力が 272K トークンを超えるとリクエスト全体に100万トークンあたり 20ドルと 75ドルを課金します。Opus 5.5 は 1M トークンのウィンドウ全体で単一価格です。Opus 5.5 のキャッシュ書き込みは 5分キャッシュで100万トークンあたり 5ドル、1時間キャッシュで 8ドル、バッチは 50% の料金、高速モードは2倍の料金です。詳しくはClaude Opus 5.5 のコストモデルとOpus 5.5 高速モードの経済性をご覧ください。
自社のタスク単価を測る方法
- トークンはリクエスト単位ではなくタスク単位で記録します。キャッシュなし入力、キャッシュ済み入力、キャッシュ書き込み、出力を、タスクの全ステップにわたって合計します。
- 実際のタスクを数百件サンプルとして取り出し、Sol max、Opus 5.5 medium、Opus 5.5 high など候補の設定2〜3個で再実行します。
- 各結果を本番と同じチェックで採点し、合格したタスクの数を数えます。
- 総支出を合格タスク数で割ります。比べるべきなのは成功タスクあたりのコストです。安くても失敗が多い設定は、安くありません。
- 品質基準を満たす最も安い設定を選び、失敗したタスクだけを上位の設定に回します。
- 価格やデフォルトの effort が変わったら、再実行し直します。
1つのモデルで effort 設定が請求額をどう変えるかは、Opus 5.5 の effort レベルこそが本当の価格をご覧ください。
注意点
- コストはすべて、Artificial Analysis のタスク構成での API 定価です。割引、バッチ料金、自社のキャッシュで変わります。
- Artificial Analysis は Opus 5.5 と Fable 5.1 の項目に Default Fallback と表示しています。すべての行を同じ API 構成とみなす前に、方法論の注記を確認してください。
- スコアは指標 v4.3.2 のものだけです。以前のバージョンは評価の構成が違うため、比較できません。
- Digital Applied のキャッシュ中心タスクは説明用の1つのワークロードで、実測値ではありません。
- プロバイダーが価格やデフォルトを変えると数字も変わります。閲覧日は2026年9月22日です。
出典
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →