Guide de Tarification GPT-5.6 : Luna, Terra, Sol
Publié le 19 juillet 2026
OpenAI a lancé GPT-5.6 le 10 juillet avec trois niveaux de tarification distincts : Luna à $1/$6 par 1M tokens, Terra à $2.50/$15 et Sol à $5/$30. Ce n'est pas un simple compromis vitesse/qualité ; chaque niveau est positionné pour une classe différente de charge de travail. La question n'est pas « quel est le meilleur » — c'est « quel est le bon pour cette tâche ? » Ce guide cartographie les tâches aux niveaux, parcourt des exemples de coûts par tâche, et vous montre comment cascader intelligemment quand un niveau moins cher n'est pas assez confiant.
- Luna ($1/$6) : classification, extraction simple, routage haute volume
- Terra ($2.50/$15) : raisonnement équilibré, boucles d'agentes, conversations multi-tours
- Sol ($5/$30) : raisonnement frontalier, génération de code, recherche difficile
- Les lectures de cache économisent 90% ; les écritures de cache coûtent 1,25× l'entrée — seuil de rentabilité à 5+ accès en 30 min
- L'API batch ajoute 50% de réduction en plus de la tarification par niveau pour le travail non interactif
1. Les Trois Niveaux : Vitesse, Coût et Capacité
| Niveau | Entrée $/1M | Sortie $/1M | Lecture Cache $/1M | Contexte | Latence Typique |
|---|---|---|---|---|---|
| Luna | $1.00 | $6.00 | $0.10 | 128K | 80–200 ms |
| Terra | $2.50 | $15.00 | $0.25 | 128K | 150–400 ms |
| Sol | $5.00 | $30.00 | $0.50 | 128K | 300–800 ms |
La latence compte : Luna est plus rapide car il est optimisé pour le streaming, la classification en temps réel et le rendement. Sol est plus lent car il effectue plus de raisonnement interne. Pour les charges de travail interactives orientées vers l'utilisateur, Luna est aussi moins cher et plus rapide — mais seulement s'il est assez capable pour votre tâche. C'est la décision clé de routage.
2. Table de Routage par Type de Tâche
Ce tableau cartographie les tâches LLM communes au niveau qui minimise le coût par réponse réussie :
| Type de Tâche | Exemple | Niveau Recommandé | Taux de Succès au Niveau | Coût Est./1K Tâches |
|---|---|---|---|---|
| Classification | Spam / pas spam ; sentiment (pos/neg/neutre) | Luna | 95–98% | $1.20–$1.50 |
| Extraction structurée | Extraire nom, email, téléphone du texte | Luna | 92–96% | $1.80–$2.40 |
| Catégorisation (nombreuses classes) | Assigner une de 50+ catégories de produit | Luna | 88–94% | $2.40–$3.20 |
| Résumé | Condenser article ou journal de chat | Luna | 92–97% | $1.50–$2.00 |
| Boucles d'agentes (usage d'outils) | Multi-tour : recherche, raisonnement, affinage | Terra | 85–92% | $8.00–$12.00 |
| Conversation multi-tour | Bots de support client, conseil | Terra | 88–94% | $6.00–$10.00 |
| Génération de code (simple) | Requête SQL, snippet Bash, regex | Terra | 80–90% | $10.00–$15.00 |
| Génération de code (complexe) | Endpoint complet, machine d'état, compilateur DSL | Sol | 75–88% | $25.00–$40.00 |
| Recherche + synthèse | Analyser 10+ papiers, synthétiser consensus | Sol | 80–90% | $30.00–$50.00 |
| Raisonnement difficile (problème nouveau) | Vérification de preuve, conception d'algorithme nouveau | Sol | 70–85% | $40.00–$70.00 |
Insight clé : Le coût par tâche n'est pas juste le coût API — c'est (coût API) / (taux de succès). Une classification Luna avec 95% de succès coûte ~$1.26 par réponse réussie. Si vous routez la même tâche à Sol avec 98% de succès, vous payez ~$5.10 par réponse — mais vous avez résolu 3% de plus de votre charge de travail, ce qui peut ou peut ne pas valoir le coût 4×.
3. Exemples Résolus de Coût Par Tâche
Exemple 1 : Classification Spam (Luna)
Tâche : Classifier email comme spam (oui/non binaire).
Profil de tokens typique : 400 entrée (email) + 50 sortie (classification + confiance) = 450 tokens.
Coût Luna : (400 × $1/1M) + (50 × $6/1M) = $0.00043/requête.
Si 96% réussissent à la première tentative : $0.00043 / 0.96 = $0.00045 par classification réussie.
À 1M emails/mois : $450/mois (plus réduction de cache si vous réutilisez les prompts système).
Si routé incorrectement à Sol : (400 × $5 + 50 × $30) / 1M = $0.0025 par requête. Avec 98% de succès : $0.00255/réussie = $2,550/mois (5.7× plus).
Exemple 2 : Agent de Support Client (Terra)
Tâche : Conversation de support multi-tour avec usage d'outils (recherche de tickets, recherche de politiques, décision d'escalade).
Profil de tokens typique par tour : 2,000 entrée (contexte + historique) + 400 sortie (réponse + appels d'outils) = 2,400 tokens. Moyenne 3 tours pour résoudre = 7,200 tokens totaux par ticket.
Coût Terra : (2,000 × $2.50/1M) + (400 × $15/1M) = $0.0080/tour ou $0.0240 par ticket.
Si 90% sont résolus sans escalade : $0.0240 / 0.90 = $0.0267 par ticket réussi.
À 10K tickets/mois : $267/mois.
Si vous utilisiez Luna à la place : (2,000 × $1 + 400 × $6) / 1M = $0.0044 par tour = $0.0132/ticket. Mais le succès de la boucle d'agente Luna baisse à 65% (les appels d'outils échouent, le raisonnement est superficiel). Coût par réussie : $0.0132 / 0.65 = $0.0203. Économies nettes : $29/mois, mais 25% des tickets échouent et escaladent, augmentant le coût de support de $400+. Luna ne fonctionne pas ici.
Exemple 3 : Génération de Code (Terra vs Sol)
Tâche : Générer une fonction Python à partir d'une chaîne de requirement.
Profil de tokens typique : 1,500 entrée (spécification + exemples) + 600 sortie (code + explication) = 2,100 tokens.
Coût Terra : (1,500 × $2.50 + 600 × $15) / 1M = $0.0134 par requête. Avec 85% de succès au premier passage (code compile + passe les tests basiques) : $0.0158 par fonction qui fonctionne.
Coût Sol : (1,500 × $5 + 600 × $30) / 1M = $0.0255 par requête. Avec 90% de succès au premier passage : $0.0283 par fonction qui fonctionne.
Économies avec Terra : 44% moins cher par résultat qui fonctionne. Utilisez Sol seulement si la différence de 5% en taux de succès et qualité de code réduit sensiblement le coût de débogage en aval.
4. Modèle de Routage Cascade et Fallback
La plupart des équipes FinOps ne devraient pas utiliser un seul niveau pour tout le travail. Au lieu de cela, implémentez un modèle cascade : commencez par le niveau le moins cher, mesurez la confiance, escaladez en confiance basse.
| Étape | Modèle | Seuil de Confiance | Action si le Seuil n'est Pas Atteint |
|---|---|---|---|
| 1 | Luna | Confiance > 85% | Retourner résultat |
| 2 | Terra | Confiance > 75% | Retourner résultat (escaladé) |
| 3 | Sol | Confiance > 60% | Retourner résultat ou échouer explicitement |
| 4 | Révision humaine | — | Escalader à humain |
Scénario réel : Vous effectuez une classification de documents pour les factures (classifier par fournisseur). Luna retournera des résultats de haute confiance (~94% de succès) et coûtera ~$1.20 par 1K. Pour les 6% des factures ambiguës où Luna retourne une confiance < 85%, escaladez à Terra (~94% de succès pour les cas difficiles), coûtant ~$3.75 par 1K escalades. Si 6% de 10K documents escaladent : 600 × $3.75 = $2.25 extra, total $12 + $2.25 = $14.25/10K. Terra pur coûterait ~$37.50. La cascade économise 62% tout en améliorant la précision sur les cas limites.
5. Économie de Mise en Cache des Invites
GPT-5.6 a changé les coûts de mise en cache : les écritures de cache coûtent maintenant 1,25× le taux d'entrée sans cache (pas gratuit), et les lectures de cache coûtent 10% de l'entrée.
| Scénario | Taille du Préfixe | Coût d'Écriture | Coût de Lecture (par accès) | Accès de Seuil de Rentabilité | Économies @ 10 accès/mois |
|---|---|---|---|---|---|
| Contexte de récupération en cache Luna | 100K tokens | $0.125 | $0.010 | 15 accès | -$0.025 (perte) |
| Prompt système en cache Luna + docs | 50K tokens | $0.063 | $0.005 | 8 accès | $0.032 |
| Contexte d'agentes en cache Terra | 80K tokens | $0.250 | $0.020 | 14 accès | $0.030 |
| Contexte de raisonnement en cache Sol | 100K tokens | $0.625 | $0.050 | 13 accès | $0.025 |
Quand mettre en cache : Si votre invite inclut un préfixe stable (instructions système, documentation, exemples poches) qui est réutilisé plus de 5–10 fois dans une fenêtre de 30 minutes, la mise en cache économise généralement de l'argent. L'API batch (50% de réduction) rivalise maintenant avec la mise en cache en coût — si vous classifiez des documents en lot, la réduction de lot surpasse la surcharge de mise en cache.
6. Comparaison avec Claude Sonnet 5, Gemini 3.1 Pro et DeepSeek V4
| Modèle | Entrée $/1M | Sortie $/1M | Vitesse | Capacité de Raisonnement | Quand Choisir |
|---|---|---|---|---|---|
| GPT-5.6 Luna | $1.00 | $6.00 | Rapide | Suivi d'instructions, routage | Classification, extraction, rendement |
| GPT-5.6 Terra | $2.50 | $15.00 | Moyen | Raisonnement modéré, usage d'outils | Agentes, multi-tour, code moyen |
| GPT-5.6 Sol | $5.00 | $30.00 | Lent | Raisonnement frontalier, recherche | Code complexe, raisonnement difficile, problèmes nouveaux |
| Claude Sonnet 5 | $2.00–$3.00 | $10.00–$15.00 | Moyen–Rapide | Raisonnement fort, tokens de raisonnement long | Raisonnement, codage (compétitif avec Sol) |
| Gemini 3.1 Pro | $2.00 | $12.00 | Moyen | Multimodal, capacité de recherche | Tâches multimodales, compétitif avec Terra |
| DeepSeek V4 Flash | $0.14 | $0.28 | Très Rapide | Raisonnement basique, focus entrée en cache | Routage haute volume, charges de travail focus cache (7–35× moins cher) |
Arbitrage de coûts : Pour la classification simple et l'extraction, DeepSeek V4 Flash est 7–20× moins cher que Luna. Comparez-le contre vos données — s'il atteint 90%+ de précision, utilisez-le et conservez la différence. Claude Sonnet 5 est 2× plus cher que Terra mais fournit un raisonnement plus fort par prétention de capacité de modèle ; utilisez-le si votre benchmark Terra montre une qualité insuffisante. Gemini 3.1 Pro se situe entre Luna et Terra — utile si vous avez besoin d'entrée multimodale ou êtes déjà dans l'écosystème Vertex AI.
7. Migration depuis GPT-5/5.5 & Statut de Dépréciation
OpenAI continue à offrir GPT-5.5 ($5/$30, identique à Sol) et GPT-5.4 ($2.50/$15, identique à Terra) à côté de GPT-5.6. Il n'y a pas de pression de dépréciation sur les modèles plus anciens — vous pouvez continuer à utiliser GPT-5.5 si votre code le cible. Cependant, GPT-5.6 prétend à la parité de performances (ou mieux) au même niveau, alors migrez à 5.6 pour les nouveaux déploiements.
L'interface ChatGPT continue à retirer les modèles plus anciens sur une base roulante (GPT-4o mini, GPT-4 turbo sont maintenant en lecture seule) ; l'accès API est stable. Si vous construisez contre l'API, planifiez des révisions annuelles du statut de dépréciation du modèle mais n'attendez pas d'urgence.
Cadre de Mesure des Coûts
Étape 1 : Établir la ligne de base par niveau
Exécutez une semaine de trafic et enregistrez quel niveau a géré chaque requête. Cela vous donne la distribution de ligne de base et le coût.
Étape 2 : Mesurer les scores de confiance et les taux de fallback
Pour chaque niveau, enregistrez la confiance retournée. Calculez : quel % des appels Luna ont confiance > 85% ? Quel % escaladent à Terra ? Cela vous dit si votre cascade est équilibrée.
Étape 3 : Auditer le succès/l'échec par niveau
Comparez la sortie du modèle contre la vérité de base pour une semaine. Quel niveau sous-performe sur vos données ? Ajustez les seuils ou la sélection de niveau en fonction de la précision réelle, pas des prétentions d'OpenAI.
Étape 4 : Calculer le coût réel par réponse réussie
Coût réel = (coût_niveau) / (taux_succès). Si Luna coûte $1.20 par 1K avec 94% de succès, le coût par réponse qui fonctionne est $1.28. C'est la métrique à optimiser.
Liste de Vérification Rapide de Sélection de Niveau
- Est-ce une tâche de classification, extraction ou routage ? → Luna sauf si la précision est critique.
- La tâche implique-t-elle l'usage d'outils ou le raisonnement multi-tour ? → Terra.
- Est-ce un raisonnement nouveau, un code complexe ou une analyse multi-hop ? → Sol (ou comparez Claude Sonnet 5 d'abord).
- Pouvez-vous implémenter une cascade (Luna → Terra → Sol) ? → Oui, c'est généralement optimal.
- Y a-t-il un préfixe stable (prompt système, docs) réutilisé 10+ fois/mois ? → Mettez-le en cache, mesurez le ROI au seuil de rentabilité (5–15 accès).
- Est-ce un lot ou interactif ? → Le travail en lot se qualifie pour la réduction de 50% ; recalculez le ROI avec l'API batch.
- Avez-vous comparé les alternatives (Claude, DeepSeek, Gemini) ? → Faites-le sur vos données, pas les prétentions de marketing.
La sélection de niveau est un problème de classification : appariez les propriétés de charge de travail à l'économie de niveau. L'idéal est le routage cascade — routez à Luna d'abord, mesurez la confiance, escaladez en incertitude. Cela minimise les coûts tout en maintenant la qualité. FinOps LLM peut exécuter un audit de coûts sur votre trafic LLM et vous montrer où le désajustement de niveau laisse de l'argent sur la table. Réservez un audit gratuit.
Voir aussi : Combien Coûte GPT-5 ? pour le panorama complet de tarification de GPT et Coûts Cachés du LLM pour l'infrastructure et les frais généraux de fallback au-delà des frais par token.