Saltar al contenido

El fallo de caché detrás de tu factura de OpenAI

Actualizado September 26, 2026 · publicado originalmente September 26, 2026

Respuesta rápida: Un panel de caché de prompts puede decirte que la reutilización cayó. Por sí solo no puede decirte qué cambio en la solicitud provocó la caída ni cuánto costó. El lanzamiento del 8 de septiembre de...

Un panel de caché de prompts puede decirte que la reutilización cayó. Por sí solo no puede decirte qué cambio en la solicitud provocó la caída ni cuánto costó. El lanzamiento del 8 de septiembre de 2026 de OpenAI hizo que Prompt Cache Diagnostics estuviera disponible de forma general en la Responses API para GPT-5.6 y los modelos compatibles posteriores. La jugada útil para FinOps es convertir una caída de tokens en caché en una investigación breve y repetible.

Compara la solicitud que falló

Guarda el ID de una respuesta reciente y completada cuyo prefijo esperabas reutilizar. En la siguiente solicitud comparable a la Responses API desde la misma organización, define prompt_cache_options.comparison_response_id con ese ID. Después lee prompt_cache_diagnostics en la nueva respuesta, junto con usage.input_tokens_details.cached_tokens. La opción de comparación solicita un diagnóstico; no carga la conversación anterior ni cambia el comportamiento de la caché. La guía de diagnósticos de OpenAI incluye ejemplos de solicitudes que funcionan.

const next = await client.responses.create({
  model: model,
  instructions: stableInstructions,
  input: nextInput,
  tools: stableTools,
  prompt_cache_options: { comparison_response_id: baseline.id }
});
console.log(next.prompt_cache_diagnostics);
console.log(next.usage.input_tokens_details.cached_tokens);

El fragmento supone que baseline es una respuesta reciente y completada, y que las demás variables son los datos de tu propia solicitud. Mantén un prefijo estable lo bastante largo para almacenarse en caché: OpenAI documenta un mínimo de 1,024 tokens para GPT-5.6 y posteriores. Un prompt pequeño o radicalmente distinto no es una prueba significativa de fallo de caché.

Corrige la causa, no la métrica

Un resultado cache_miss puede apuntar a un cambio de modelo, nivel de servicio, definiciones u orden de herramientas, clave de caché, formato de respuesta, esfuerzo de razonamiento, verbosidad o contexto compactado. Por ejemplo, renombrar un esquema de herramienta, algo aparentemente inofensivo, puede invalidar el prefijo reutilizable. Compara la configuración de la solicitud y los primeros bytes del prompt, restablece la estabilidad donde el cambio fue accidental y vuelve a ejecutar la comparación contra la misma referencia. OpenAI informa de la primera causa que encuentra, así que puede aparecer otra tras la primera corrección.

No fuerces un acierto si el cambio fue deliberado. Un modelo distinto puede reducir el costo total de la tarea aunque pierda reutilización de caché; la compactación puede reducir el contexto futuro. Evalúa la solicitud y la tarea completas, no el porcentaje de aciertos de caché de forma aislada. Una referencia caducada o un resultado unavailable es no concluyente, no una prueba de que la caché falló.

Traduce el hallazgo a dinero

cache_missed_tokens estima los tokens reutilizables perdidos respecto a la respuesta de comparación. No es un recuento de tokens facturados. Un resultado cache_hit tampoco establece un ahorro en dólares. Para el costo de entrada realizado, recopila el total de input_tokens, cached_tokens y cache_write_tokens de cada respuesta y aplica la tarifa vigente para ese modelo y nivel de procesamiento. Para GPT-5.6 y posteriores, la guía de prompt caching de OpenAI indica que las lecturas de caché cuestan 0.1 veces la tarifa de entrada sin caché y las escrituras de caché cuestan 1.25 veces esa tarifa.

ordinary = input_tokens - cached_tokens - cache_write_tokens
weighted_input = ordinary + 0.1 * cached_tokens + 1.25 * cache_write_tokens
input_cost = weighted_input * input_price_per_million / 1_000_000

Son categorías de tokens excluyentes: no sumes un recargo de escritura de caché a tokens que ya se contaron a la tarifa de escritura. Esta fórmula cubre solo la entrada; incluye la salida, las herramientas, los reintentos y otros cargos al calcular el costo por tarea exitosa. Usa la tabla de precios vigente del proveedor en lugar de un precio fijo copiado de este artículo.

Una revisión semanal útil

  1. Agrupa el tráfico comparable por carga de trabajo, modelo y nivel de servicio; grafica la proporción de tokens en caché y el costo de entrada por tarea completada.
  2. Toma una muestra de una regresión repentina, compárala con una referencia reciente y registra el motivo del diagnóstico y el cambio de código responsable.
  3. Corrige la deriva accidental de prefijo o configuración; conserva los cambios intencionales de calidad o enrutamiento si la economía total de la tarea mejora.
  4. Valida el resultado con tráfico de producción representativo y concilia el ahorro observado con la facturación.

Los diagnósticos en sí no tienen un cargo adicional por la función, pero las solicitudes de prueba extra se facturan normalmente. El beneficio no es un gráfico de tasa de aciertos más bonito. Es una explicación defendible de por qué cambió el costo de entrada de una carga de trabajo concreta, y de si la corrección propuesta realmente redujo su factura.

Preguntas que se hacen los equipos

¿Un diagnóstico de cache hit demuestra que una solicitud fue más barata?

No. Indica que no se detectó ningún fallo frente a la referencia seleccionada. Comprueba los cached_tokens reales y las categorías de tokens con precio de la solicitud antes de afirmar que hubo ahorro.

¿Pueden los diagnósticos comparar dos solicitudes cualesquiera de OpenAI?

No. Usa una referencia reciente y completada de la misma organización, y espera este flujo solo en modelos compatibles de la Responses API de GPT-5.6 y posteriores. Un registro de comparación puede caducar.

¿Hay que eliminar todos los fallos de caché?

No. Un cambio de modelo, un nivel de servicio distinto o un contexto compactado pueden ser intencionales. Compara calidad, latencia y costo por tarea exitosa antes de revertir el cambio.

Relacionado


¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →

Volver a finopsllm.com