Quick answer: A maioria dos modelos de custo de LLM tem um só contador: tokens de entrada, tokens de saída, preço por milhão. Era correto enquanto um pedido apenas gerava texto. Deixou de o ser com as ferramentas...

As ferramentas de servidor são outra fatura

Updated September 1, 2026 · first published September 1, 2026

A maioria dos modelos de custo de LLM tem um só contador: tokens de entrada, tokens de saída, preço por milhão. Era correto enquanto um pedido apenas gerava texto. Deixou de o ser com as ferramentas do lado do servidor.

A pesquisa web, o fetch e a execução de código correm na infraestrutura do fornecedor, e várias têm um custo por utilização além dos tokens que produzem. Um turno de agente pode assim cobrar-lhe duas vezes.

A parte que se acumula

É a segunda cobrança que escapa. Cada resultado é acrescentado à conversa e cada turno seguinte reenvia tudo como entrada. Dez pesquisas no início de uma execução longa não são dez cobranças: são dez cobranças mais o seu conteúdo relido em todos os turnos seguintes.

É por isso que os custos de agente parecem não lineares quando a aritmética dos tokens diz que deviam ser lineares. A taxa por utilização é a parte visível; o crescimento do contexto é a maior, e cai na linha dos tokens de entrada sem etiqueta.

Sem atribuição não há gestão

Registe as invocações por pedido junto ao objeto de utilização: que ferramenta, quantas chamadas e o tamanho em tokens do que cada resultado acrescentou.

Depois calcule o custo por execução de agente, não por chamada à API.

Três controlos que funcionam

Limite as chamadas por execução — delimita as duas cobranças ao mesmo tempo.

Corte o que entra no contexto — resumir antes de acrescentar alivia todos os turnos seguintes.

Coloque o prefixo estável em cache — prompt de sistema e definições de ferramentas são constantes.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research