Aller au contenu

Modèle de coûts de GPT-6 Luna

Mis à jour September 23, 2026 · première publication September 23, 2026

GPT-6 Luna est le modèle économique de la famille GPT-6 d'OpenAI, lancé le 22 septembre 2026 en même temps que GPT-6 Sol. OpenAI le destine aux charges à fort volume avec un objectif clair : résumer, extraire et répondre à des questions rapides. À $0.10 par 1M de tokens d'entrée, c'est le modèle vers lequel router en premier, et que l'on ne quitte que lorsque la tâche prouve qu'elle exige davantage.

Tarifs de GPT-6 Luna

NiveauEntréeEntrée en cacheSortie
Standard$0.10$0.01$0.50
Batch ou flex$0.05$0.005$0.25
Mode rapide$0.20$0.02$1.00
Contexte long (plus de 272K en entrée)$0.20$0.02$0.75

Par 1M de tokens, d'après la page de tarifs d'OpenAI. Une écriture en cache coûte $0.125. Luna dispose de la même fenêtre de contexte de 1,050,000 tokens que le reste de GPT-6, d'une date limite de connaissances de mai 2026 (la plus récente des trois) et de toute la plage d'effort, de none à max.

Même score que GPT-5.6 Luna, 61 % moins cher par tâche

Artificial Analysis a évalué les deux générations de Luna avec son Intelligence Index (v4.3.2) à effort maximal.

ModèleScore de l'indiceCoût par tâcheVitesse de sortie
GPT-6 Luna (max)37$0.07132.2 tokens/s
GPT-5.6 Luna (max)37$0.18142.3 tokens/s
GPT-6 Sol (low)33.9$0.13—

Le score n'a pas bougé. Le coût par tâche a chuté de 61 %, surtout grâce au prix par token plus bas. GPT-6 Luna à max dépasse aussi GPT-6 Sol à effort low, à la fois en score et en coût. Si vous faisiez tourner Sol en low pour économiser, Luna en max est un meilleur choix sur cet indice.

Ce que coûte un fort volume

Un million de requêtes de classification par mois, chacune avec 600 tokens d'entrée et 100 tokens de sortie, sans cache :

ModèleCoût mensuel
GPT-6 Luna, batch$55
GPT-6 Luna$110
GPT-5.6 Luna$240
Claude Haiku 4.5$1,100
GPT-6 Sol$2,200
GPT-6 Astra$11,000

Claude Haiku 4.5 coûte 10× plus cher par token et a obtenu 15 sur le même indice, étant un modèle sans raisonnement. Passer le même travail de Sol à Luna réduit la facture de 95 %, ce qui justifie de construire un routeur qui n'envoie que les cas difficiles à Sol.

Le piège : latence et verbosité

Les chiffres de l'indice ci-dessus sont à effort maximal, et à ce niveau Luna démarre lentement. Artificial Analysis a mesuré 104 secondes avant le premier token. Il a aussi consommé 150M de tokens de sortie sur l'ensemble de l'indice, contre une médiane de 84M, ce qu'Artificial Analysis qualifie de relativement verbeux. Cette verbosité est déjà comprise dans les $0.07 par tâche, donc le chiffre de coût tient, mais l'attente ne convient pas à un chat destiné aux utilisateurs.

Pour le trafic interactif, faites tourner Luna en none, low ou en medium par défaut, et mesurez la précision sur vos propres prompts. Les scores de cette page ne valent que pour l'effort maximal : la précision avec des réglages plus bas est à tester, pas à chercher dans un tableau. Gardez l'effort max pour les traitements batch, où la latence importe peu et où le tarif batch divise encore la facture par deux.

Des limites de débit plus larges que sur Sol

Luna démarre à 500K tokens par minute au Tier 1, comme Sol, mais atteint 180M de tokens par minute au Tier 5 (Sol plafonne à 40M), avec jusqu'à 30,000 requêtes par minute. Pour les pipelines en masse, cette marge compte autant que le prix.

Comment utiliser Luna

Sources : page du modèle GPT-6 Luna d'OpenAI, Artificial Analysis : GPT-6 Luna, Artificial Analysis : GPT-5.6 Luna, TechCrunch. Prix relevés le 23 septembre 2026.

À lire aussi


Vous souhaitez appliquer cela à votre plateforme ? Transmettez vos factures fournisseurs, journaux de passerelle et principaux workflows ; nous cartographierons les coûts et les économies possibles. Demander un audit gratuit →

Retour à finopsllm.com