Aller au contenu

Modèle de coût de l’agent toujours actif OpenAI O / AON

Mis à jour September 27, 2026 · première publication September 27, 2026

Des références ayant fuité révèlent « O » d'OpenAI (nom de code AON) : un assistant toujours actif conçu pour des tâches de long horizon. Contrairement aux modèles de chat qui répondent puis s'arrêtent, O dispose de son propre environnement cloud, peut mettre en place des contextes d'exécution, écrire du code, faire de la recherche et fonctionner en continu pendant des heures, des jours, voire des semaines. Plusieurs agents peuvent communiquer sur la même tâche. Dévoilement attendu : OpenAI Dev Day, le 29 septembre 2026.

Ce qui change pour la modélisation des coûts

Coût LLM traditionnel : jetons par requête × tarif. Coût O/AON : durée × calcul alloué + débit de jetons.

DimensionAPI chat/completionsO / AON (projeté)
Unité de facturationPar 1M de jetonsPar heure (calcul) + par 1M de jetons
Coût au repos$0>$0 (réservation de l'environnement)
Durée maximaleMinutes (timeout)Jours/semaines
ParallélismeRequêtes séquentiellesEssaims multi-agents
ÉtatTransmis dans le contexteEnvironnement persistant

Modèle de coût projeté (spéculatif, d'après les fuites)

OpenAI n'a publié aucun tarif. Deux structures probables :

Option A : heure de calcul + jetons (comme Codespaces)

Une exécution d'agent de 24 heures avec 5M de jetons en entrée / 2M en sortie :

ComposanteCoût (bas)Coût (haut)
Environnement 24 h ($1/h)$24$48
5M en entrée à $5/MTok$25$25
2M en sortie à $15/MTok$30$30
Total$79$103

Option B : abonnement forfaitaire (offre Pro Max)

Stratégies d'optimisation des coûts pour les agents toujours actifs

  1. Mettre en veille, ne pas arrêter. Si l'environnement persiste, mettez la boucle de l'agent en pause pendant les périodes d'inactivité au lieu de le désactiver : un démarrage à froid coûte plus cher que la réservation au repos.
  2. Regrouper les jetons des sous-tâches. Accumulez les résultats des sous-tâches et écrivez le contexte par blocs plus grands pour améliorer le taux de succès du cache sur l'environnement persistant.
  3. Router les sous-tâches vers des modèles moins chers. O/AON orchestre ; déléguez le code à Sonnet 5.5, la recherche aux modèles Flash, et ne passez à un modèle premium que pour les décisions critiques.
  4. Fixer des budgets stricts de temps et d'argent par objectif. « Corrige ce bug, max $10 / 2 heures » : à faire respecter par l'orchestrateur, sans compter sur la chance.

Quand utiliser O/AON plutôt qu'Opus 5.5 en exécution longue

Lectures associées

Voir l'économie de ChatGPT Pro Max, les tarifs de l'API Ultra Fast d'OpenAI, le coût de 25 heures d'agent avec Opus 5.5 et l'économie des agents.

À lire aussi


Vous souhaitez appliquer cela à votre plateforme ? Transmettez vos factures fournisseurs, journaux de passerelle et principaux workflows ; nous cartographierons les coûts et les économies possibles. Demander un audit gratuit →

Retour à finopsllm.com