Saltar al contenido

El 98% de los tokens de entrada de Codex estaba en caché. Sin caché, la factura sería 12 veces mayor

Actualizado October 9, 2026 · publicado originalmente October 9, 2026

Respuesta rápida: En 12 días de uso intensivo de Codex con ChatGPT Pro $100 enviamos 13.0 mil millones de tokens de entrada y recibimos 47 millones de tokens de salida. El 97.6% de esa entrada fue un acierto de caché....

En 12 días de uso intensivo de Codex con ChatGPT Pro $100 enviamos 13.0 mil millones de tokens de entrada y recibimos 47 millones de tokens de salida. El 97.6% de esa entrada fue un acierto de caché. A precios de la API de OpenAI, el trabajo costó $1,211. Con esos mismos tokens sin ningún acierto de caché serían $14,198, 12 veces más.

Valor de API de 12 días de Codex por modelo: con caché frente a sin caché$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraNaranja: lo que pagamos en términos de API, con cachéAzul: los mismos tokens sin aciertos de caché
Valor de API de 12 días de Codex por modelo: con caché frente a sin caché

Por qué casi todo el input de los agentes de programación es caché

Un bucle de agente vuelve a enviar toda la conversación en cada paso: el prompt del sistema, las definiciones de herramientas, los archivos que ha leído y cada resultado anterior de herramienta. Cada paso añade un poco y vuelve a leer todo. Por eso el input crece con el cuadrado de la duración de la sesión mientras la salida se mantiene pequeña. En 12 días, eso nos dio una relación de 279:1 entre entrada y salida.

La caché de prompts es lo que lo mantiene asequible. El input en caché de la API de OpenAI cuesta una décima parte o menos del input normal. GPT-6 Sol, que hizo la mayor parte de nuestro trabajo, cobra $2 por millón de tokens de entrada y $0.10 por millón de tokens en caché.

Adónde fue el dinero

ModeloTokens de entradaEn cachéTokens de salidaValor de APISin caché
Sol6.56B98.1%17.5M$1,073$13,299
Luna6.41B97.2%29.0M$95$655
GPT-5.50.03B93.5%0.2M$27$144
Astra0.01B94.5%0.0M$16$99
Total13.01B97.6%47M$1,211$14,198
Componente del costeValor de APIPeso
Input en caché$72860%
Input sin caché$28824%
Output$19616%

Incluso con un descuento del 95%, el input en caché es la partida más grande. Esa es la firma de una carga de trabajo de agente: el tipo de token más barato, en un volumen enorme. Los totales por modelo están en codex-pro-100-model-mix.csv.

Qué rompe la caché

Un acierto de caché necesita un prefijo idéntico. Cualquier cambio al inicio del contexto obliga a releer a precio completo todo lo que viene después.

Por qué esto importa para tus límites de Codex

Si el medidor de Codex pondera el input en caché cerca de su precio de API, una caída de 1 punto en tu tasa de aciertos de caché sale cara. Con nuestro volumen, que Sol pasara del 98.1% al 90% en caché añadiría unos $1,004 solo de input de Sol, unas 6 ventanas extra de Pro $100. La disciplina con la caché es disciplina con la cuota. Para ver qué cabe en una ventana, consulta nuestra medición del multiplicador de Pro $100; para ver cómo conseguimos ocho ventanas en 12 días, consulta el registro de reinicios.

Cómo lo medimos

Codex escribe un registro JSONL de cada sesión en ~/.codex/sessions/. Cada petición registra el input acumulado, el input en caché y la salida, además del medidor semanal (used_percent) y su hora resets_at. Valoramos la variación de tokens de cada petición al precio de lista de la API del modelo con el que se ejecutó y agrupamos las peticiones por ventana semanal. Las cifras en dólares son valor equivalente de API, no dinero que hayamos pagado.

Fuentes

Relacionado


¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →

Volver a finopsllm.com