Aller au contenu

98% des tokens d'entrée de Codex étaient en cache. Sans cache, la facture serait 12 fois plus élevée

Mis à jour October 9, 2026 · première publication October 9, 2026

Réponse rapide: En 12 jours d'utilisation intensive de Codex avec ChatGPT Pro $100, nous avons envoyé 13.0 milliards de tokens d'entrée et reçu 47 millions de tokens de sortie. 97.6% de cette entrée ont été servis...

En 12 jours d'utilisation intensive de Codex avec ChatGPT Pro $100, nous avons envoyé 13.0 milliards de tokens d'entrée et reçu 47 millions de tokens de sortie. 97.6% de cette entrée ont été servis depuis le cache. Au tarif API d'OpenAI, le travail représente $1,211. Avec les mêmes tokens sans aucun cache, il aurait coûté $14,198, soit 12 fois plus.

Valeur API de 12 jours de Codex par modèle : avec cache et sans cache$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraOrange : ce que nous avons payé en valeur API, avec cacheBleu : les mêmes tokens sans aucun cache
Valeur API de 12 jours de Codex par modèle : avec cache et sans cache

Pourquoi les agents de code ne sont presque que de l'entrée en cache

Une boucle d'agent renvoie toute la conversation à chaque étape : le prompt système, les définitions d'outils, les fichiers lus et chaque résultat d'outil précédent. Chaque étape ajoute un peu et relit tout. L'entrée croît donc avec le carré de la durée de session, alors que la sortie reste faible. Sur 12 jours, cela nous a donné un rapport de 279 pour 1 entre entrée et sortie.

Le cache de prompts est ce qui rend tout cela abordable. L'entrée en cache de l'API OpenAI coûte un dixième ou moins de l'entrée normale. GPT-6 Sol, qui a fait l'essentiel de notre travail, facture $2 par million de tokens d'entrée et $0.10 par million de tokens en cache.

Où est passé l'argent

ModèleTokens d'entréeEn cacheTokens de sortieValeur APISans cache
Sol6.56B98.1%17.5M$1,073$13,299
Luna6.41B97.2%29.0M$95$655
GPT-5.50.03B93.5%0.2M$27$144
Astra0.01B94.5%0.0M$16$99
Total13.01B97.6%47M$1,211$14,198
Poste de coûtValeur APIPart
Entrée en cache$72860%
Entrée sans cache$28824%
Sortie$19616%

Même avec une remise de 95%, l'entrée en cache reste le poste le plus important. C'est la signature d'une charge de travail d'agent : le type de token le moins cher, en volume énorme. Les totaux par modèle sont dans codex-pro-100-model-mix.csv.

Ce qui casse le cache

Un hit de cache exige un préfixe identique. Toute modification du début du contexte force une relecture au plein tarif de tout ce qui suit.

Pourquoi cela compte pour vos limites Codex

Si la jauge de Codex pondère l'entrée en cache proche de son prix API, une baisse de 1 point du taux de hit de cache coûte cher. À notre volume, passer de 98.1% à 90% de cache pour Sol ajouterait environ $1,004 rien que sur l'entrée de Sol, soit à peu près 6 fenêtres Pro $100 supplémentaires. La discipline de cache est une discipline de quota. Pour savoir ce qu'une fenêtre contient, voir notre mesure du multiplicateur Pro $100 ; pour comprendre comment nous avons obtenu huit fenêtres en 12 jours, voir le journal des réinitialisations.

Comment nous avons mesuré

Codex écrit un journal JSONL de chaque session dans ~/.codex/sessions/. Chaque requête enregistre l'entrée cumulée, l'entrée en cache et la sortie, ainsi que la jauge hebdomadaire (used_percent) et son heure resets_at. Nous avons valorisé le delta de tokens de chaque requête au tarif API catalogue du modèle utilisé, puis regroupé les requêtes par fenêtre hebdomadaire. Les montants en dollars sont une valeur équivalente API, pas de l'argent que nous avons réellement payé.

Sources

À lire aussi


Vous souhaitez appliquer cela à votre plateforme ? Transmettez vos factures fournisseurs, journaux de passerelle et principaux workflows ; nous cartographierons les coûts et les économies possibles. Demander un audit gratuit →

Retour à finopsllm.com