Guide de Tarification GPT-5.6 : Luna, Terra, Sol

Publié le 19 juillet 2026

OpenAI a lancé GPT-5.6 le 10 juillet avec trois niveaux de tarification distincts : Luna à $1/$6 par 1M tokens, Terra à $2.50/$15 et Sol à $5/$30. Ce n'est pas un simple compromis vitesse/qualité ; chaque niveau est positionné pour une classe différente de charge de travail. La question n'est pas « quel est le meilleur » — c'est « quel est le bon pour cette tâche ? » Ce guide cartographie les tâches aux niveaux, parcourt des exemples de coûts par tâche, et vous montre comment cascader intelligemment quand un niveau moins cher n'est pas assez confiant.

Mise en garde critique : OpenAI positionne Terra et Sol comme ayant une capacité de raisonnement équivalente, se différenciant principalement par la vitesse et le rendement. Comparez les deux contre votre charge de travail réelle — la prétention de parité ne se maintient pas toujours à votre distribution de données. Voir GPT-5 vs alternatives pour la comparaison avec Claude et DeepSeek.

1. Les Trois Niveaux : Vitesse, Coût et Capacité

Niveau Entrée $/1M Sortie $/1M Lecture Cache $/1M Contexte Latence Typique
Luna $1.00 $6.00 $0.10 128K 80–200 ms
Terra $2.50 $15.00 $0.25 128K 150–400 ms
Sol $5.00 $30.00 $0.50 128K 300–800 ms

La latence compte : Luna est plus rapide car il est optimisé pour le streaming, la classification en temps réel et le rendement. Sol est plus lent car il effectue plus de raisonnement interne. Pour les charges de travail interactives orientées vers l'utilisateur, Luna est aussi moins cher et plus rapide — mais seulement s'il est assez capable pour votre tâche. C'est la décision clé de routage.

2. Table de Routage par Type de Tâche

Ce tableau cartographie les tâches LLM communes au niveau qui minimise le coût par réponse réussie :

Type de Tâche Exemple Niveau Recommandé Taux de Succès au Niveau Coût Est./1K Tâches
Classification Spam / pas spam ; sentiment (pos/neg/neutre) Luna 95–98% $1.20–$1.50
Extraction structurée Extraire nom, email, téléphone du texte Luna 92–96% $1.80–$2.40
Catégorisation (nombreuses classes) Assigner une de 50+ catégories de produit Luna 88–94% $2.40–$3.20
Résumé Condenser article ou journal de chat Luna 92–97% $1.50–$2.00
Boucles d'agentes (usage d'outils) Multi-tour : recherche, raisonnement, affinage Terra 85–92% $8.00–$12.00
Conversation multi-tour Bots de support client, conseil Terra 88–94% $6.00–$10.00
Génération de code (simple) Requête SQL, snippet Bash, regex Terra 80–90% $10.00–$15.00
Génération de code (complexe) Endpoint complet, machine d'état, compilateur DSL Sol 75–88% $25.00–$40.00
Recherche + synthèse Analyser 10+ papiers, synthétiser consensus Sol 80–90% $30.00–$50.00
Raisonnement difficile (problème nouveau) Vérification de preuve, conception d'algorithme nouveau Sol 70–85% $40.00–$70.00

Insight clé : Le coût par tâche n'est pas juste le coût API — c'est (coût API) / (taux de succès). Une classification Luna avec 95% de succès coûte ~$1.26 par réponse réussie. Si vous routez la même tâche à Sol avec 98% de succès, vous payez ~$5.10 par réponse — mais vous avez résolu 3% de plus de votre charge de travail, ce qui peut ou peut ne pas valoir le coût 4×.

3. Exemples Résolus de Coût Par Tâche

Exemple 1 : Classification Spam (Luna)

Tâche : Classifier email comme spam (oui/non binaire).

Profil de tokens typique : 400 entrée (email) + 50 sortie (classification + confiance) = 450 tokens.

Coût Luna : (400 × $1/1M) + (50 × $6/1M) = $0.00043/requête.

Si 96% réussissent à la première tentative : $0.00043 / 0.96 = $0.00045 par classification réussie.

À 1M emails/mois : $450/mois (plus réduction de cache si vous réutilisez les prompts système).

Si routé incorrectement à Sol : (400 × $5 + 50 × $30) / 1M = $0.0025 par requête. Avec 98% de succès : $0.00255/réussie = $2,550/mois (5.7× plus).

Exemple 2 : Agent de Support Client (Terra)

Tâche : Conversation de support multi-tour avec usage d'outils (recherche de tickets, recherche de politiques, décision d'escalade).

Profil de tokens typique par tour : 2,000 entrée (contexte + historique) + 400 sortie (réponse + appels d'outils) = 2,400 tokens. Moyenne 3 tours pour résoudre = 7,200 tokens totaux par ticket.

Coût Terra : (2,000 × $2.50/1M) + (400 × $15/1M) = $0.0080/tour ou $0.0240 par ticket.

Si 90% sont résolus sans escalade : $0.0240 / 0.90 = $0.0267 par ticket réussi.

À 10K tickets/mois : $267/mois.

Si vous utilisiez Luna à la place : (2,000 × $1 + 400 × $6) / 1M = $0.0044 par tour = $0.0132/ticket. Mais le succès de la boucle d'agente Luna baisse à 65% (les appels d'outils échouent, le raisonnement est superficiel). Coût par réussie : $0.0132 / 0.65 = $0.0203. Économies nettes : $29/mois, mais 25% des tickets échouent et escaladent, augmentant le coût de support de $400+. Luna ne fonctionne pas ici.

Exemple 3 : Génération de Code (Terra vs Sol)

Tâche : Générer une fonction Python à partir d'une chaîne de requirement.

Profil de tokens typique : 1,500 entrée (spécification + exemples) + 600 sortie (code + explication) = 2,100 tokens.

Coût Terra : (1,500 × $2.50 + 600 × $15) / 1M = $0.0134 par requête. Avec 85% de succès au premier passage (code compile + passe les tests basiques) : $0.0158 par fonction qui fonctionne.

Coût Sol : (1,500 × $5 + 600 × $30) / 1M = $0.0255 par requête. Avec 90% de succès au premier passage : $0.0283 par fonction qui fonctionne.

Économies avec Terra : 44% moins cher par résultat qui fonctionne. Utilisez Sol seulement si la différence de 5% en taux de succès et qualité de code réduit sensiblement le coût de débogage en aval.

4. Modèle de Routage Cascade et Fallback

La plupart des équipes FinOps ne devraient pas utiliser un seul niveau pour tout le travail. Au lieu de cela, implémentez un modèle cascade : commencez par le niveau le moins cher, mesurez la confiance, escaladez en confiance basse.

Étape Modèle Seuil de Confiance Action si le Seuil n'est Pas Atteint
1 Luna Confiance > 85% Retourner résultat
2 Terra Confiance > 75% Retourner résultat (escaladé)
3 Sol Confiance > 60% Retourner résultat ou échouer explicitement
4 Révision humaine Escalader à humain

Scénario réel : Vous effectuez une classification de documents pour les factures (classifier par fournisseur). Luna retournera des résultats de haute confiance (~94% de succès) et coûtera ~$1.20 par 1K. Pour les 6% des factures ambiguës où Luna retourne une confiance < 85%, escaladez à Terra (~94% de succès pour les cas difficiles), coûtant ~$3.75 par 1K escalades. Si 6% de 10K documents escaladent : 600 × $3.75 = $2.25 extra, total $12 + $2.25 = $14.25/10K. Terra pur coûterait ~$37.50. La cascade économise 62% tout en améliorant la précision sur les cas limites.

5. Économie de Mise en Cache des Invites

GPT-5.6 a changé les coûts de mise en cache : les écritures de cache coûtent maintenant 1,25× le taux d'entrée sans cache (pas gratuit), et les lectures de cache coûtent 10% de l'entrée.

Scénario Taille du Préfixe Coût d'Écriture Coût de Lecture (par accès) Accès de Seuil de Rentabilité Économies @ 10 accès/mois
Contexte de récupération en cache Luna 100K tokens $0.125 $0.010 15 accès -$0.025 (perte)
Prompt système en cache Luna + docs 50K tokens $0.063 $0.005 8 accès $0.032
Contexte d'agentes en cache Terra 80K tokens $0.250 $0.020 14 accès $0.030
Contexte de raisonnement en cache Sol 100K tokens $0.625 $0.050 13 accès $0.025

Quand mettre en cache : Si votre invite inclut un préfixe stable (instructions système, documentation, exemples poches) qui est réutilisé plus de 5–10 fois dans une fenêtre de 30 minutes, la mise en cache économise généralement de l'argent. L'API batch (50% de réduction) rivalise maintenant avec la mise en cache en coût — si vous classifiez des documents en lot, la réduction de lot surpasse la surcharge de mise en cache.

6. Comparaison avec Claude Sonnet 5, Gemini 3.1 Pro et DeepSeek V4

Modèle Entrée $/1M Sortie $/1M Vitesse Capacité de Raisonnement Quand Choisir
GPT-5.6 Luna $1.00 $6.00 Rapide Suivi d'instructions, routage Classification, extraction, rendement
GPT-5.6 Terra $2.50 $15.00 Moyen Raisonnement modéré, usage d'outils Agentes, multi-tour, code moyen
GPT-5.6 Sol $5.00 $30.00 Lent Raisonnement frontalier, recherche Code complexe, raisonnement difficile, problèmes nouveaux
Claude Sonnet 5 $2.00–$3.00 $10.00–$15.00 Moyen–Rapide Raisonnement fort, tokens de raisonnement long Raisonnement, codage (compétitif avec Sol)
Gemini 3.1 Pro $2.00 $12.00 Moyen Multimodal, capacité de recherche Tâches multimodales, compétitif avec Terra
DeepSeek V4 Flash $0.14 $0.28 Très Rapide Raisonnement basique, focus entrée en cache Routage haute volume, charges de travail focus cache (7–35× moins cher)

Arbitrage de coûts : Pour la classification simple et l'extraction, DeepSeek V4 Flash est 7–20× moins cher que Luna. Comparez-le contre vos données — s'il atteint 90%+ de précision, utilisez-le et conservez la différence. Claude Sonnet 5 est 2× plus cher que Terra mais fournit un raisonnement plus fort par prétention de capacité de modèle ; utilisez-le si votre benchmark Terra montre une qualité insuffisante. Gemini 3.1 Pro se situe entre Luna et Terra — utile si vous avez besoin d'entrée multimodale ou êtes déjà dans l'écosystème Vertex AI.

7. Migration depuis GPT-5/5.5 & Statut de Dépréciation

OpenAI continue à offrir GPT-5.5 ($5/$30, identique à Sol) et GPT-5.4 ($2.50/$15, identique à Terra) à côté de GPT-5.6. Il n'y a pas de pression de dépréciation sur les modèles plus anciens — vous pouvez continuer à utiliser GPT-5.5 si votre code le cible. Cependant, GPT-5.6 prétend à la parité de performances (ou mieux) au même niveau, alors migrez à 5.6 pour les nouveaux déploiements.

L'interface ChatGPT continue à retirer les modèles plus anciens sur une base roulante (GPT-4o mini, GPT-4 turbo sont maintenant en lecture seule) ; l'accès API est stable. Si vous construisez contre l'API, planifiez des révisions annuelles du statut de dépréciation du modèle mais n'attendez pas d'urgence.

Cadre de Mesure des Coûts

Étape 1 : Établir la ligne de base par niveau

Exécutez une semaine de trafic et enregistrez quel niveau a géré chaque requête. Cela vous donne la distribution de ligne de base et le coût.

Étape 2 : Mesurer les scores de confiance et les taux de fallback

Pour chaque niveau, enregistrez la confiance retournée. Calculez : quel % des appels Luna ont confiance > 85% ? Quel % escaladent à Terra ? Cela vous dit si votre cascade est équilibrée.

Étape 3 : Auditer le succès/l'échec par niveau

Comparez la sortie du modèle contre la vérité de base pour une semaine. Quel niveau sous-performe sur vos données ? Ajustez les seuils ou la sélection de niveau en fonction de la précision réelle, pas des prétentions d'OpenAI.

Étape 4 : Calculer le coût réel par réponse réussie

Coût réel = (coût_niveau) / (taux_succès). Si Luna coûte $1.20 par 1K avec 94% de succès, le coût par réponse qui fonctionne est $1.28. C'est la métrique à optimiser.

Liste de Vérification Rapide de Sélection de Niveau


La sélection de niveau est un problème de classification : appariez les propriétés de charge de travail à l'économie de niveau. L'idéal est le routage cascade — routez à Luna d'abord, mesurez la confiance, escaladez en incertitude. Cela minimise les coûts tout en maintenant la qualité. FinOps LLM peut exécuter un audit de coûts sur votre trafic LLM et vous montrer où le désajustement de niveau laisse de l'argent sur la table. Réservez un audit gratuit.

Voir aussi : Combien Coûte GPT-5 ? pour le panorama complet de tarification de GPT et Coûts Cachés du LLM pour l'infrastructure et les frais généraux de fallback au-delà des frais par token.

Retour à la recherche