Lo que cuestan los guardrails y la moderación
Updated September 1, 2026 · first published September 1, 2026
Una función LLM en producción casi nunca hace una sola llamada. Hace la que diseñaste y luego las que añadiste por seguridad: clasificador de entrada, revisión de salida, juez de política, a veces un segundo modelo calificando al primero. Todo eso es inferencia, y la inferencia se factura.
El multiplicador es mayor de lo que parece
La moderación de entrada lee toda la entrada. La de salida lee toda la respuesta. Un juez lee ambas más el contexto recuperado y una rúbrica — con lo que la llamada del juez es mayor que la que juzga.
Dónde se acumula el gasto
Tres patrones: juzgar con un modelo frontera por comodidad (la clasificación es justo donde un modelo pequeño basta, y suele ser el mayor ahorro disponible); revisar en cada turno reescaneando historial ya aprobado; y guardrails en tráfico interno que hereda toda la pila de seguridad de cara al público sin necesitarla.
Presupuéstalo como una línea
No se trata de quitar los controles, sino de que pueden ser el 30–50% del coste de inferencia sin aparecer en ningún plan. Etiqueta las llamadas de guardrail por separado para ver la proporción.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →