Estrategias de caché comparadas

La caché es una de las tácticas de reducción de costes con mayor palanca para cargas de trabajo de LLM. La idea es directa: no pagues por inferencia si puedes devolver un resultado cacheado. Pero "caché" no es una sola técnica - son cuatro estrategias distintas con diferentes compensaciones en ahorro de costes, latencia, precisión y complejidad de implementación. Elegir la desperdicia esfuerzo de ingeniería; elegir la correcta puede reducir entre un 30 y un 70% tu factura.

Comparación de estrategias

EstrategiaCómo funcionaAhorro de costesImpacto en latenciaEsfuerzo de implementaciónIdeal paraProveedores
Caché de prompts (lado del proveedor)El proveedor cachea el cálculo KV para prefijos de prompts repetidos. Las solicitudes posteriores con el mismo prefijo omiten el reprocesamiento.50% en tokens de entrada cacheados60-80% más rápido en latencia del primer tokenCero a bajo - automático en la mayoría de proveedoresPrompts de sistema largos, RAG con contexto compartido, bucles de agentesOpenAI, Anthropic, Google
Caché semántica (basada en embeddings)Genera embeddings de la consulta del usuario, busca en un almacén vectorial consultas pasadas similares. Si la similitud supera un umbral, devuelve la respuesta cacheada sin llamar al LLM.20-50% según la repetición de consultas50-90% más rápido (sin llamada al LLM)Medio - necesita modelo de embeddings, almacén vectorial, ajuste del umbral de similitudBots de FAQ, soporte al cliente, consultas repetitivasCualquiera (autoalojado vía GPTCache, Redis con búsqueda vectorial)
Caché de contexto (estilo Google)Cacha documentos de contexto grandes (PDFs, repositorios de código) en el servidor. Paga una vez por el procesamiento de contexto, reutiliza en muchas consultas a un coste reducido por consulta.70-90% en consultas con mucho contextoMejora moderada en procesamiento de contextoBajo a medio - sube contexto, gestiona TTLPreguntas y respuestas sobre documentos, revisión de código sobre repos grandes, turnos múltiples con contexto estáticoGoogle (Gemini), Anthropic (contexto de pensamiento extendido)
Caché a nivel de aplicación (Redis/CDN)Hash determinista de la solicitud completa (prompt + parámetros). Almacena la respuesta en Redis o un CDN. Devuelve la respuesta cacheada en coincidencia exacta.Hasta 100% en aciertos de caché90-99% más rápido (sin llamada al LLM)Bajo - infraestructura de caché estándarConsultas deterministas, clasificación, extracción con prompts fijosCualquiera (infraestructura que controlas)

Caché de prompts en detalle

La caché de prompts es la ganancia más fácil. OpenAI cachea automáticamente prompts de más de 1.024 tokens. Anthropic cachea prefijos de 2.048+ tokens. La caché se indexa por el prefijo exacto - mismo prompt de sistema, mismos ejemplos few-shot, mismo contexto de documento. Cuando hay un acierto de caché, pagas un 50% menos por la parte cacheada de los tokens de entrada.

El inconveniente: la invalidación de caché la controla el proveedor. Si el prompt cambia aunque sea ligeramente - mensaje de sistema diferente, variable diferente en el prefijo - la caché falla. Diseña tus prompts para colocar contenido estable al inicio y contenido dinámico al final del prompt.

Caché semántica en detalle

La caché semántica omite el LLM por completo cuando se hizo una pregunta similar antes. El flujo: genera embeddings de la consulta, busca en un almacén vectorial (Pinecone, Qdrant, Redis con búsqueda vectorial), verifica si el resultado principal supera un umbral de similitud (típicamente 0,92-0,97) y devuelve la respuesta cacheada si es así.

El riesgo es devolver respuestas obsoletas o ligeramente incorrectas. Un umbral demasiado bajo devuelve resultados incorrectos; uno demasiado alto significa casi ningún acierto de caché. Ajústalo por caso de uso. Para recuperación factual de FAQ, 0,95+ es seguro. Para generación creativa, la caché semántica rara vez es apropiada - el punto es la novedad.

Caché de contexto en detalle

La caché de contexto de Google te permite subir un documento grande una vez y pagar una tarifa reducida para consultas posteriores sobre él. Esto es potente para preguntas y respuestas sobre documentos donde procesas el mismo PDF de 200 páginas cientos de veces. El modelo de costes: pagas la tarifa completa de tokens de entrada una vez para la escritura de caché, luego una tarifa reducida (a menudo el 25% de lo normal) para cada lectura de caché.

La compensación es el TTL. Los contextos cacheados expiran. Si tu carga de trabajo tiene patrones de acceso irregulares - 500 consultas en una hora, luego nada durante una semana - la caché puede expirar entre ráfagas. Dimensiona tu TTL para que coincida con tu patrón de acceso.

Caché a nivel de aplicación en detalle

La caché determinista es la estrategia más agresiva. Haz un hash de la carga completa de la solicitud (prompt, temperatura, tokens máximos, modelo, herramientas) y almacena la respuesta. En coincidencia exacta, devuelve la respuesta cacheada al instante - sin llamada al LLM, sin latencia, sin coste.

Esto solo funciona cuando la misma entrada siempre debe producir la misma salida. Clasificación, extracción de entidades, análisis de datos estructurados y generación basada en plantillas son buenos candidatos. Las tareas conversacionales o creativas no lo son - los usuarios esperan respuestas variadas.

Combinando estrategias

Las mejores implementaciones superponen múltiples estrategias. Una pila típica: caché a nivel de aplicación como primera verificación (más barata, más rápida), caché semántica como segunda verificación (captura casi-duplicados), luego la llamada al LLM con caché de prompts habilitada del lado del proveedor (reduce el coste incluso en fallos de caché). Este enfoque en capas puede reducir el gasto total en LLM entre un 40 y 70% en cargas de trabajo con cualquier grado de repetición.

Sigue las tasas de acierto de caché por separado para cada capa. Si tu tasa de acierto de caché semántica cae por debajo del 10%, la sobrecarga del almacén vectorial puede no valer la pena. Si tu tasa de acierto de caché de aplicación está por encima del 40%, probablemente tienes tareas deterministas que deberían optimizarse a nivel de prompt.

Relacionado


¿Quieres esto aplicado a tu propio gasto en LLM? FinOps LLM ejecuta una auditoría gratuita de tus costes de IA y muestra dónde están los ahorros. Reserva auditoría gratuita →

Volver a investigación