Quick answer: La mayoría de los modelos de coste de LLM tienen un solo contador: tokens de entrada, tokens de salida, precio por millón. Eso era correcto cuando una petición solo generaba texto. Dejó de serlo...

Las herramientas de servidor son otra factura

Updated September 1, 2026 · first published September 1, 2026

La mayoría de los modelos de coste de LLM tienen un solo contador: tokens de entrada, tokens de salida, precio por millón. Eso era correcto cuando una petición solo generaba texto. Dejó de serlo cuando llegaron las herramientas del lado del servidor.

La búsqueda web, el fetch y la ejecución de código corren en la infraestructura del proveedor, y varias llevan su propio cargo por uso además de los tokens que producen. Un turno de agente puede cobrarte dos veces: por las búsquedas y por los tokens que sus resultados añadieron al contexto.

La parte que se acumula

El segundo cargo es el que se escapa. Cada resultado se añade a la conversación, y cada turno posterior reenvía todo como entrada. Diez búsquedas al principio de una ejecución larga no son diez cargos: son diez cargos más sus resultados releídos en cada turno siguiente.

Por eso los costes de agente parecen no lineales cuando la aritmética de tokens dice que deberían serlo. La tarifa por uso es la parte visible; el crecimiento del contexto es la mayor, y aterriza en tu línea de tokens de entrada sin ninguna etiqueta.

Atribúyelo o no podrás gestionarlo

Registra las invocaciones por petición junto al objeto de uso: qué herramienta, cuántas llamadas y el tamaño en tokens de lo que añadió cada resultado. Ese último campo es el que hace visible la acumulación.

Después calcula el coste por ejecución de agente, no por llamada a la API. La ejecución es lo que el usuario disparó de verdad.

Tres controles que funcionan

Limita las llamadas por ejecución. Un tope duro acota los dos cargos a la vez.

Recorta lo que entra en el contexto. Rara vez necesitas una página entera; resumir antes de añadir reduce todos los turnos siguientes.

Cachea el prefijo estable. Si el prompt de sistema y las definiciones de herramientas no cambian, el caché elimina el mayor coste repetido.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research