Quick answer: Toda a revisão FinOps começa pelo tráfego de produção, porque é o que tem painel. Depois alguém reparte por ambiente e descobre que uma fatia relevante da fatura — muitas vezes de dois dígitos...

Gasto de LLM fora de produção

Updated September 1, 2026 · first published September 1, 2026

Toda a revisão FinOps começa pelo tráfego de produção, porque é o que tem painel. Depois alguém reparte por ambiente e descobre que uma fatia relevante da fatura — muitas vezes de dois dígitos em percentagem — nunca tocou num cliente.

De onde vem

CI: cada pull request que corre uma suite de avaliação chama o modelo, milhares de vezes por dia, no modelo mais caro. Desenvolvimento local: iterar um prompt são dezenas de chamadas por hora, em chave partilhada e sem etiquetas. Staging e demos: configurados como produção, com modelo caro e sem cache. Retentativas e ciclos descontrolados em teste, que ninguém vigia.

Primeiro a atribuição

A mudança que se paga sozinha é uma chave de API por ambiente. Custa uma tarde e transforma uma rubrica inexplicada em quatro identificadas. Etiquete o ambiente em cada pedido e, na CI, o repositório e o workflow.

Seguem-se três coisas: fora de produção quase sempre basta um modelo mais barato; a cache rende aí mais do que em qualquer lado, porque a CI repete prompts quase idênticos; e os tetos rígidos de gasto são ali seguros — um ambiente de teste com teto quebra um build, um de produção quebra um cliente.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research