Estrategias de caché comparadas
La caché es una de las tácticas de reducción de costes con mayor palanca para cargas de trabajo de LLM. La idea es directa: no pagues por inferencia si puedes devolver un resultado cacheado. Pero "caché" no es una sola técnica - son cuatro estrategias distintas con diferentes compensaciones en ahorro de costes, latencia, precisión y complejidad de implementación. Elegir la desperdicia esfuerzo de ingeniería; elegir la correcta puede reducir entre un 30 y un 70% tu factura.
Comparación de estrategias
| Estrategia | Cómo funciona | Ahorro de costes | Impacto en latencia | Esfuerzo de implementación | Ideal para | Proveedores |
|---|---|---|---|---|---|---|
| Caché de prompts (lado del proveedor) | El proveedor cachea el cálculo KV para prefijos de prompts repetidos. Las solicitudes posteriores con el mismo prefijo omiten el reprocesamiento. | 50% en tokens de entrada cacheados | 60-80% más rápido en latencia del primer token | Cero a bajo - automático en la mayoría de proveedores | Prompts de sistema largos, RAG con contexto compartido, bucles de agentes | OpenAI, Anthropic, Google |
| Caché semántica (basada en embeddings) | Genera embeddings de la consulta del usuario, busca en un almacén vectorial consultas pasadas similares. Si la similitud supera un umbral, devuelve la respuesta cacheada sin llamar al LLM. | 20-50% según la repetición de consultas | 50-90% más rápido (sin llamada al LLM) | Medio - necesita modelo de embeddings, almacén vectorial, ajuste del umbral de similitud | Bots de FAQ, soporte al cliente, consultas repetitivas | Cualquiera (autoalojado vía GPTCache, Redis con búsqueda vectorial) |
| Caché de contexto (estilo Google) | Cacha documentos de contexto grandes (PDFs, repositorios de código) en el servidor. Paga una vez por el procesamiento de contexto, reutiliza en muchas consultas a un coste reducido por consulta. | 70-90% en consultas con mucho contexto | Mejora moderada en procesamiento de contexto | Bajo a medio - sube contexto, gestiona TTL | Preguntas y respuestas sobre documentos, revisión de código sobre repos grandes, turnos múltiples con contexto estático | Google (Gemini), Anthropic (contexto de pensamiento extendido) |
| Caché a nivel de aplicación (Redis/CDN) | Hash determinista de la solicitud completa (prompt + parámetros). Almacena la respuesta en Redis o un CDN. Devuelve la respuesta cacheada en coincidencia exacta. | Hasta 100% en aciertos de caché | 90-99% más rápido (sin llamada al LLM) | Bajo - infraestructura de caché estándar | Consultas deterministas, clasificación, extracción con prompts fijos | Cualquiera (infraestructura que controlas) |
Caché de prompts en detalle
La caché de prompts es la ganancia más fácil. OpenAI cachea automáticamente prompts de más de 1.024 tokens. Anthropic cachea prefijos de 2.048+ tokens. La caché se indexa por el prefijo exacto - mismo prompt de sistema, mismos ejemplos few-shot, mismo contexto de documento. Cuando hay un acierto de caché, pagas un 50% menos por la parte cacheada de los tokens de entrada.
El inconveniente: la invalidación de caché la controla el proveedor. Si el prompt cambia aunque sea ligeramente - mensaje de sistema diferente, variable diferente en el prefijo - la caché falla. Diseña tus prompts para colocar contenido estable al inicio y contenido dinámico al final del prompt.
Caché semántica en detalle
La caché semántica omite el LLM por completo cuando se hizo una pregunta similar antes. El flujo: genera embeddings de la consulta, busca en un almacén vectorial (Pinecone, Qdrant, Redis con búsqueda vectorial), verifica si el resultado principal supera un umbral de similitud (típicamente 0,92-0,97) y devuelve la respuesta cacheada si es así.
El riesgo es devolver respuestas obsoletas o ligeramente incorrectas. Un umbral demasiado bajo devuelve resultados incorrectos; uno demasiado alto significa casi ningún acierto de caché. Ajústalo por caso de uso. Para recuperación factual de FAQ, 0,95+ es seguro. Para generación creativa, la caché semántica rara vez es apropiada - el punto es la novedad.
Caché de contexto en detalle
La caché de contexto de Google te permite subir un documento grande una vez y pagar una tarifa reducida para consultas posteriores sobre él. Esto es potente para preguntas y respuestas sobre documentos donde procesas el mismo PDF de 200 páginas cientos de veces. El modelo de costes: pagas la tarifa completa de tokens de entrada una vez para la escritura de caché, luego una tarifa reducida (a menudo el 25% de lo normal) para cada lectura de caché.
La compensación es el TTL. Los contextos cacheados expiran. Si tu carga de trabajo tiene patrones de acceso irregulares - 500 consultas en una hora, luego nada durante una semana - la caché puede expirar entre ráfagas. Dimensiona tu TTL para que coincida con tu patrón de acceso.
Caché a nivel de aplicación en detalle
La caché determinista es la estrategia más agresiva. Haz un hash de la carga completa de la solicitud (prompt, temperatura, tokens máximos, modelo, herramientas) y almacena la respuesta. En coincidencia exacta, devuelve la respuesta cacheada al instante - sin llamada al LLM, sin latencia, sin coste.
Esto solo funciona cuando la misma entrada siempre debe producir la misma salida. Clasificación, extracción de entidades, análisis de datos estructurados y generación basada en plantillas son buenos candidatos. Las tareas conversacionales o creativas no lo son - los usuarios esperan respuestas variadas.
Combinando estrategias
Las mejores implementaciones superponen múltiples estrategias. Una pila típica: caché a nivel de aplicación como primera verificación (más barata, más rápida), caché semántica como segunda verificación (captura casi-duplicados), luego la llamada al LLM con caché de prompts habilitada del lado del proveedor (reduce el coste incluso en fallos de caché). Este enfoque en capas puede reducir el gasto total en LLM entre un 40 y 70% en cargas de trabajo con cualquier grado de repetición.
Sigue las tasas de acierto de caché por separado para cada capa. Si tu tasa de acierto de caché semántica cae por debajo del 10%, la sobrecarga del almacén vectorial puede no valer la pena. Si tu tasa de acierto de caché de aplicación está por encima del 40%, probablemente tienes tareas deterministas que deberían optimizarse a nivel de prompt.
Relacionado
- Caché de prompts explicada - análisis más profundo de la caché del lado del proveedor.
- Economía de la caché semántica - análisis de ROI de la caché semántica.
- Optimización de costes de IA - estrategias de optimización más amplias.
¿Quieres esto aplicado a tu propio gasto en LLM? FinOps LLM ejecuta una auditoría gratuita de tus costes de IA y muestra dónde están los ahorros. Reserva auditoría gratuita →