GPT-5.6 料金ティアガイド:Luna、Terra、Sol
公開日:2026年7月19日
OpenAIは7月10日にGPT-5.6を3つの異なる料金ティアで発表しました:Lunaが$1/$6 per 1M tokens、Terraが$2.50/$15、Solが$5/$30。これは単なるスピード/品質のトレードオフではありません。各ティアは異なるクラスのワークロード向けに位置付けられています。質問は「どれが最高か」ではなく「このタスクには何が正しいか」です。このガイドはタスクをティアにマップし、タスクあたりのコスト例を説明し、安いティアが十分に確信できない場合に知的にカスケードする方法を示します。
- Luna($1/$6):分類、単純な抽出、大量ルーティング
- Terra($2.50/$15):バランスの取れた推論、エージェントループ、マルチターン会話
- Sol($5/$30):フロンティア推論、コード生成、困難な研究
- キャッシュ読み取りは90%節約;キャッシュ書き込みは入力の1.25倍 — 30分間に5回以上のヒットで損益分岐点
- バッチAPIは非対話型作業の場合、ティア料金に加えて50%割引を追加
1. 3つのティア:スピード、コスト、能力
| ティア | 入力 $/1M | 出力 $/1M | キャッシュ読取 $/1M | コンテキスト | 典型的なレイテンシ |
|---|---|---|---|---|---|
| Luna | $1.00 | $6.00 | $0.10 | 128K | 80–200 ms |
| Terra | $2.50 | $15.00 | $0.25 | 128K | 150–400 ms |
| Sol | $5.00 | $30.00 | $0.50 | 128K | 300–800 ms |
レイテンシが重要: Lunaは最速です。ストリーミング、リアルタイム分類、スループット用に最適化されているからです。Solは最遅です。より多くの内部推論を実行しているからです。対話的なユーザーフェーシング型ワークロードについて、Lunaも安いですそして速いです — ただし、タスクに対して十分に能力がある場合のみです。これが重要なルーティング決定です。
2. タスク型ルーティング表
この表は一般的なLLMタスクを、成功したレスポンスあたりのコストを最小化するティアにマップします:
| タスク型 | 例 | 推奨ティア | ティアでの成功率 | 推定コスト/1K タスク |
|---|---|---|---|---|
| 分類 | スパム/非スパム;感情(肯定/否定/中立) | Luna | 95–98% | $1.20–$1.50 |
| 構造化抽出 | テキストから名前、メール、電話を抽出 | Luna | 92–96% | $1.80–$2.40 |
| カテゴリ化(多クラス) | 50以上の製品カテゴリのいずれかを割り当て | Luna | 88–94% | $2.40–$3.20 |
| 要約 | 記事またはチャットログを凝縮 | Luna | 92–97% | $1.50–$2.00 |
| エージェント ループ(ツール利用) | マルチターン:検索、推論、精緻化 | Terra | 85–92% | $8.00–$12.00 |
| マルチターン会話 | 顧客サポート、アドバイザリーボット | Terra | 88–94% | $6.00–$10.00 |
| コード生成(単純) | SQLクエリ、Bashスニペット、正規表現 | Terra | 80–90% | $10.00–$15.00 |
| コード生成(複雑) | 完全なエンドポイント、ステートマシン、DSLコンパイラ | Sol | 75–88% | $25.00–$40.00 |
| 研究+統合 | 10以上の論文を分析、コンセンサスを統合 | Sol | 80–90% | $30.00–$50.00 |
| 困難な推論(新規問題) | 証明検証、新規アルゴリズム設計 | Sol | 70–85% | $40.00–$70.00 |
主要な洞察: タスクあたりのコストはAPIコストだけではなく、(APIコスト)/(成功率)です。95%の成功率のLuna分類は成功したレスポンスあたり~$1.26です。同じタスクをSolに98%の成功率でルーティングした場合、レスポンスあたり~$5.10支払いますが、ワークロードの3%多く解決しました。それが4倍のコストに見合う価値があるかどうかはわかりません。
3. タスクあたりのコスト実例
例1:スパム分類(Luna)
タスク: メールをスパム(はい/いいえバイナリ)として分類。
典型的なトークンプロファイル: 400入力(メール)+50出力(分類+確信度)=450トークン。
Lunaコスト: (400 × $1/1M) + (50 × $6/1M) = $0.00043/リクエスト。
96%が初回で成功した場合: $0.00043 / 0.96 = $0.00045 per successful classification。
月間100万メールで: $450/月(システムプロンプトを再利用する場合、キャッシュ割引プラス)。
誤ってSolにルーティングされた場合: (400 × $5 + 50 × $30) / 1M = $0.0025 per リクエスト。98%の成功:$0.00255/成功 = $2,550/月(5.7倍以上)。
例2:顧客サポートエージェント(Terra)
タスク: ツール利用を含むマルチターンサポート会話(チケット検索、ポリシー検索、エスカレーション決定)。
ターンあたりの典型的なトークンプロファイル: 2,000入力(コンテキスト+履歴)+400出力(応答+ツール呼び出し)=2,400トークン。解決までの平均3ターン=チケットあたり7,200トークン。
Terraコスト: (2,000 × $2.50/1M) + (400 × $15/1M) = $0.0080/ターン or $0.0240 per チケット。
90%がエスカレーションなしで解決した場合: $0.0240 / 0.90 = $0.0267 per 成功したチケット。
月間10Kチケットで: $267/月。
代わりにLunaを使用した場合: (2,000 × $1 + 400 × $6) / 1M = $0.0044 per ターン = $0.0132/チケット。しかしLunaのエージェントループ成功は65%に低下(ツール呼び出しが失敗、推論が浅い)。成功あたりのコスト:$0.0132 / 0.65 = $0.0203。純粋な節約:$29/月ですがチケットの25%が失敗してエスカレート、サポートコストが$400以上上昇。Lunaはここでは機能しません。
例3:コード生成(Terra vs Sol)
タスク: 要件文字列からPython関数を生成。
典型的なトークンプロファイル: 1,500入力(仕様+例)+600出力(コード+説明)=2,100トークン。
Terraコスト: (1,500 × $2.50 + 600 × $15) / 1M = $0.0134 per リクエスト。85%の初回成功(コードがコンパイル+基本テスト合格):$0.0158 per 動作する関数。
Solコスト: (1,500 × $5 + 600 × $30) / 1M = $0.0255 per リクエスト。90%の初回成功:$0.0283 per 動作する関数。
Terraでの節約: 動作する結果あたり44%安い。成功率の5%の差とコード品質が下流のデバッグコストを測定可能に削減した場合のみSolを使用してください。
4. カスケード & フォールバック ルーティング パターン
ほとんどのFinOpsチームはすべての作業に単一のティアを使用すべきではありません。代わりに、カスケードパターンを実装します:最も安いティアから始め、確信度を測定し、低い確信度でエスカレート。
| ステップ | モデル | 確信度の閾値 | 閾値を満たさない場合のアクション |
|---|---|---|---|
| 1 | Luna | 確信度 > 85% | 結果を返す |
| 2 | Terra | 確信度 > 75% | 結果を返す(エスカレート済み) |
| 3 | Sol | 確信度 > 60% | 結果を返すか明示的に失敗 |
| 4 | 人間による確認 | — | 人間にエスカレート |
実際のシナリオ: インボイスの文書分類(ベンダー別に分類)を行っています。Lunaは高い確信度の結果(~94%成功)を返し、1Kあたり~$1.20のコストです。Lunaが確信度<85%を返す曖昧なインボイスの6%では、Terra(困難な場合で~94%の成功)にエスカレート、1K エスカレーションあたり~$3.75のコスト。10Kドキュメントの6%がエスカレートした場合:600 × $3.75 = $2.25追加、合計$12 + $2.25 = $14.25/10K。純粋なTerraは~$37.50のコストになります。カスケードは62%節約しながら境界ケースでの精度を向上させます。
5. プロンプトキャッシュの経済学
GPT-5.6はキャッシュコストを変更しました:キャッシュ書き込みはキャッシュなしの入力レート1.25倍(フリーではない)、キャッシュ読み取りは入力の10%のコストです。
| シナリオ | プレフィックスサイズ | 書き込みコスト | 読み取りコスト(ヒットあたり) | 損益分岐点ヒット | 10ヒット/月での節約 |
|---|---|---|---|---|---|
| Lunaキャッシュ検索コンテキスト | 100Kトークン | $0.125 | $0.010 | 15 ヒット | -$0.025 (損失) |
| Lunaキャッシュシステムプロンプト + ドキュメント | 50Kトークン | $0.063 | $0.005 | 8 ヒット | $0.032 |
| Terraキャッシュエージェント コンテキスト | 80Kトークン | $0.250 | $0.020 | 14 ヒット | $0.030 |
| Solキャッシュ推論コンテキスト | 100Kトークン | $0.625 | $0.050 | 13 ヒット | $0.025 |
キャッシュをいつ: プロンプトに安定したプレフィックス(システム指示、ドキュメント、少数ショット例)が30分ウィンドウ内に5~10回以上再利用される場合、キャッシュは通常お金を節約します。バッチAPI(50%割引)はキャッシュのコストと競い合っています — ドキュメントをバッチで分類する場合、バッチ割引がキャッシュのオーバーヘッドを上回ります。
6. Claude Sonnet 5、Gemini 3.1 Pro、DeepSeek V4との比較
| モデル | 入力 $/1M | 出力 $/1M | スピード | 推論能力 | 選ぶべき場合 |
|---|---|---|---|---|---|
| GPT-5.6 Luna | $1.00 | $6.00 | 高速 | 指示追従、ルーティング | 分類、抽出、スループット |
| GPT-5.6 Terra | $2.50 | $15.00 | 中程度 | 中程度の推論、ツール利用 | エージェント、マルチターン、中コード |
| GPT-5.6 Sol | $5.00 | $30.00 | 低速 | フロンティア推論、研究 | 複雑なコード、困難な推論、新規問題 |
| Claude Sonnet 5 | $2.00–$3.00 | $10.00–$15.00 | 中-高速 | 強い推論、長い推論トークン | 推論、コーディング(Solと競争) |
| Gemini 3.1 Pro | $2.00 | $12.00 | 中程度 | マルチモーダル、研究能力 | マルチモーダルタスク、Terraと競争 |
| DeepSeek V4 Flash | $0.14 | $0.28 | 非常に高速 | 基本推論、キャッシュ入力フォーカス | 大量ルーティング、キャッシュ重視ワークロード(7~35倍安い) |
コスト仲裁: 単純な分類と抽出については、DeepSeek V4 Flashはlunaより7~20倍安いです。データに対してベンチマークしてください — 90%以上の精度を達成した場合、これを使用し差分を確保してください。Claude Sonnet 5はTerraより2倍高価ですが、モデル能力請求あたり強い推論を提供しています;Terraベンチマークが不十分な品質を示した場合は使用してください。Gemini 3.1 ProはLunaとTerraの間に位置しています — マルチモーダル入力が必要な場合またはVertex AIエコシステムに既にいる場合に有用。
7. GPT-5/5.5からの移行 & 非推奨ステータス
OpenAIはGPT-5.6と並んでGPT-5.5($5/$30、Solと同じ)およびGPT-5.4($2.50/$15、Terraと同じ)の提供を続けています。古いモデルに対する非推奨圧力はない — コードがそれを対象にしている場合、GPT-5.5を使い続けることができます。ただし、GPT-5.6は同じティアでパフォーマンス同等性(またはそれ以上)を主張しているため、新しいデプロイメント向けに5.6に移行してください。
ChatGPTインターフェースは古いモデルのローリング廃止を続けています(GPT-4o mini、GPT-4 turboは読み取り専用);API アクセスは安定しています。APIに対して構築する場合、モデル非推奨ステータスの年1回のレビューを計画してください。ただし急いで期待しないでください。
コスト測定フレームワーク
ステップ 1:ティア別にベースラインを確立
1週間のトラフィックを実行し、どのティアが各リクエストを処理したかをログします。これはベースライン分布とコストを提供します。
ステップ 2:確信度スコアとフォールバックレートを測定
各ティアについて、返された確信度をログします。計算:Luna呼び出しの何%が確信度>85%を持ちますか?何%がTerraにカスケードしますか?これはカスケードがバランスしているかを示します。
ステップ 3:ティア別成功/失敗を監査
モデル出力を1週間の真実と比較します。どのティアがあなたのデータで不十分なパフォーマンスを示しますか?OpenAI主張ではなく、実際の精度に基づいてしきい値またはティア選択を調整します。
ステップ 4:成功したレスポンスあたりの実際のコストを計算
実際のコスト = (tier_cost) / (success_rate)。Lunaが94%の成功で1Kあたり$1.20のコストの場合、動作するレスポンスあたりのコストは$1.28です。これは最適化する指標です。
クイックティア選択チェックリスト
- これは分類、抽出、またはルーティングタスクですか?→ 精度が重要でない限りLuna。
- タスクはツール利用またはマルチターン推論に関与しますか?→ Terra。
- これは新規推論、複雑なコード、またはマルチホップ分析ですか?→ Sol(または最初にClaude Sonnet 5をベンチマーク)。
- カスケード(Luna → Terra → Sol)を実装できますか?→ はい、これは通常最適です。
- 安定したプレフィックス(システムプロンプト、ドキュメント)が月に10回以上再利用されていますか?→ キャッシュし、損益分岐点(5~15ヒット)でROIを測定してください。
- これはバッチ処理か対話的か?→ バッチ作業は50%割引の対象;バッチAPIでROIを再計算してください。
- 代替品(Claude、DeepSeek、Gemini)をベンチマークしましたか?→ マーケティング主張ではなく、データで行ってください。
ティア選択は分類問題です:ワークロードプロパティをティア経済学にマッチさせます。理想はカスケードルーティング — 最初にLunaにルート、確信度を測定、不確実性でエスカレート。これはコストを最小化しながら品質を維持します。FinOps LLMはLLMトラフィックのコスト監査を実行し、ティアの不一致がテーブルにお金を残しているはどこかを示します。無料監査を予約。
参照してください:GPT-5 はいくらかかる? 完全なGPT価格設定状況のための、と 隠れたLLMコスト トークンあたりの手数料を超えたインフラストラクチャとフォールバックオーバーヘッド。