Modèle de coût de l’API Decisions d’OpenAI : tarif sur l’entrée seule et sorties typées rapides
Mis à jour October 7, 2026 · première publication October 7, 2026
L'API Decisions d'OpenAI est un endpoint en bêta qui transforme des éléments de preuve partagés, sous forme de texte ou d'image, en classifications, choix ou scores typés. Avec GPT-6 Luna, elle facture $0.10 par million de tokens d'entrée, sans frais de cache ni de tokens de sortie. Considérez son affirmation « 10x plus rapide » comme un indicateur de latence, puis testez la qualité et le coût total de la tâche sur votre propre charge de travail.
Qu'a lancé OpenAI le 6 octobre 2026 ?
OpenAI a ajouté l'API Decisions en bêta publique le 6 octobre 2026. Le guide Decisions indique qu'elle renvoie des réponses typées environ 10 fois plus vite que l'API Responses. Au lancement, GPT-6 Luna est le seul modèle pris en charge et les requêtes utilisent POST /v1/decisions. Cette comparaison de vitesse est une affirmation publiée par OpenAI, et non la promesse que toutes les applications verront la même amélioration de bout en bout.
Une requête contient une entrée partagée et une ou plusieurs questions. Chaque question peut demander un prédicat (la probabilité qu'une condition soit vraie), un choix parmi un ensemble fourni ou un score sur des niveaux ordonnés. L'endpoint renvoie ces réponses sous forme typée, avec des probabilités ou des informations de confiance. Il convient donc à des décisions délimitées, comme l'acheminement d'un ticket de support, le signalement d'un dommage probable sur une photo de produit ou l'évaluation de la gravité d'un incident.
Comment fonctionne la facturation de l'API Decisions ?
Pour l'endpoint Decisions, OpenAI indique $0.10 par million de tokens d'entrée avec GPT-6 Luna. Le guide précise que seuls les tokens d'entrée sont facturés : aucun frais de lecture de cache, d'écriture de cache ni de tokens de sortie ne s'applique. Cela diffère d'une requête Responses ordinaire à GPT-6 Luna, dont les tarifs standard en contexte court sont de $0.10 par million de tokens d'entrée hors cache, $0.01 pour l'entrée en cache, $0.125 pour les écritures de cache et $0.50 pour les tokens de sortie. Utilisez les conditions tarifaires propres à Decisions pour cet endpoint, et non la grille complète du modèle.
Voici une estimation hypothétique, avant tout ajustement régional ou de contexte long applicable : si une requête moyenne utilise 1,200 tokens d'entrée, son coût en tokens est de 1,200 ÷ 1,000,000 × $0.10 = $0.00012. Un million de requêtes de ce type utiliserait 1.2 milliard de tokens d'entrée et coûterait environ $120. Il s'agit d'un exemple de planification et non d'un devis ; mesurez l'usage réel de tokens et confirmez le tarif en vigueur avant de fixer un budget.
Comme les tokens de sortie ne constituent pas une catégorie facturée ici, comptez soigneusement l'entrée complète : les éléments de preuve, le contexte système inclus dans la requête, ainsi que les instructions et les choix de chaque question. Posez, lorsque cela a du sens, des questions indépendantes sur la même entrée dans une seule requête. OpenAI documente que des questions indépendantes peuvent partager les mêmes éléments de preuve ; les questions qui dépendent de réponses précédentes doivent être envoyées dans des appels distincts. Gardez les questions courtes et observables afin que la requête ne dépense pas de tokens dans des grilles d'évaluation ambiguës.
Quand une équipe doit-elle utiliser Decisions plutôt que Responses ?
Utilisez Decisions lorsque le résultat est par nature délimité : « Cette image présente-t-elle des dommages visibles ? », « Laquelle de ces trois files est responsable de ce ticket ? » ou « Quelle est la gravité de cet incident selon ces niveaux explicites ? ». Il renvoie une réponse que l'application peut acheminer ou comptabiliser, sans demander à un modèle généraliste de rédiger un paragraphe puis d'analyser cette prose.
Gardez Responses pour les tâches qui exigent une explication, des schémas JSON arbitraires, du texte généré, des appels d'outils ou une décision nécessitant une conversation avec le modèle. Le guide d'OpenAI oriente explicitement les développeurs vers Structured Outputs lorsqu'ils ont besoin d'un objet JSON personnalisé, et vers le function calling lorsque le modèle doit demander un appel d'outil. Un choix typé ne remplace ni une explication argumentée ni une action exécutable.
La bonne comparaison est le coût par résultat métier correct, et non les tokens ou la latence pris isolément. Un classifieur rapide qui génère de coûteux faux positifs peut augmenter la charge de revue. Un endpoint à bas prix peut quand même perdre si les équipes compensent par des prompts répétés, une revue manuelle ou des corrections en aval. Suivez les champs d'usage et de réponse de Decisions, comparez un échantillon de résultats à des exemples étiquetés et intégrez la revue humaine et le traitement en aval dans le coût par cas acheminé avec succès.
Comment le FinOps peut-il valider l'affirmation d'économies ?
- Choisissez une charge de travail délimitée. Sélectionnez une étape de classification ou de scoring à fort volume, avec un ensemble de réponses clair et un coût d'erreur mesurable.
- Construisez un jeu de test étiqueté. Mesurez la précision par catégorie et examinez la calibration de la confiance ou des probabilités. Fixez les seuils de revue humaine d'après le coût des faux positifs et des faux négatifs, comme le recommande OpenAI.
- Menez un pilote comparable. Comparez le chemin de production actuel et Decisions sur des entrées équivalentes. Consignez la latence de l'endpoint, les tokens, les nouvelles tentatives, le taux de revue et le coût des erreurs corrigées.
- Budgétisez l'ensemble du parcours. Ajoutez le stockage, le calcul applicatif, le temps des relecteurs et tout appel ultérieur à Responses ou à des outils. La tarification par tokens de Decisions ne rend pas le reste du workflow gratuit.
- Gardez une voie de sortie. L'endpoint est en bêta publique. Figez l'endpoint et le modèle dans la configuration, surveillez le changelog et refaites des tests avant un déploiement large si le comportement ou la disponibilité évoluent.
OpenAI documente la prise en charge de Zero Data Retention et un usage conforme à HIPAA pour les clients éligibles, ainsi que des options de résidence aux États-Unis et en Europe (EEE et Suisse), soumises à des conditions d'éligibilité et d'accord. Vérifiez ces contrôles par rapport à la configuration réelle de votre organisation avant d'introduire des données réglementées dans un pilote.
Que doit retenir un acheteur sur la tarification de l'API Decisions ?
L'API Decisions propose une nouvelle combinaison de prix et de latence pour des décisions typées et compactes : au tarif publié de GPT-6 Luna, l'entrée coûte $0.10 par million de tokens et les tokens de sortie générés ne sont pas facturés. Ses meilleurs cas d'usage candidats disposent d'éléments de preuve réutilisables, de types de réponse clairs et de moyens peu coûteux de repérer les résultats incertains. Mesurez la qualité de la tâche et le coût d'exploitation total avant de basculer du volume de production.
Quelles recherches connexes les équipes devraient-elles lire ?
- La sortie structurée n'est pas gratuite
- Le coût par tâche réussie vaut mieux que le coût par requête
- Les baisses de prix des modèles ne réduisent pas automatiquement votre facture IA
À lire aussi
- La sortie structurée n'est pas gratuite
- Coût par tâche réussie
- Baisses de prix des modèles et budgets de routage
Vous souhaitez appliquer cela à votre plateforme ? Transmettez vos factures fournisseurs, journaux de passerelle et principaux workflows ; nous cartographierons les coûts et les économies possibles. Demander un audit gratuit →