Cómo el estilo de prompt aparece en la factura
Updated September 1, 2026 · first published September 1, 2026
Los prompts crecen como los ficheros de configuración: alguien añade una instrucción por un fallo, otro añade un ejemplo, un tercero explica por qué. Nada se quita nunca. Seis meses después el system prompt tiene tres mil tokens y nadie sabe cuáles doscientos sostienen el edificio.
Por qué se acumula
A diferencia de la salida, el sobrecoste del prompt se paga en cada petición, igual, para siempre. Mil tokens desperdiciados en una función con diez millones de llamadas al mes son diez mil millones de tokens mensuales de puro formato.
En conversaciones multivuelta es peor: el system prompt se reenvía en cada turno. En bucles de agente, una sola acción del usuario puede facturar el mismo preámbulo una docena de veces.
Qué desperdicia de verdad
No la cortesía. El peso está en instrucciones redundantes, boilerplate defensivo escrito para una generación de modelos anterior, ejemplos que se duplican en vez de cubrir casos distintos, y explicaciones dirigidas a humanos que leen el fichero.
Trátalo como código con presupuesto
Mide el prompt fijo como porcentaje del tamaño medio de petición. Pon la parte estable primero para que cachee. Y recorta por ablación contra tus evals: quita un bloque, mide, consérvalo fuera si la calidad aguanta.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →