Quick answer: A maioria das surpresas de custo com agentes não vem do preço de um token. Vem de quantas vezes o agente decidiu tentar de novo. O DeepSeek Harness dá um vocabulário a esse comportamento, que é o...

DeepSeek Harness: objetivos, rodadas de objetivo e o loop Ralph

Updated August 16, 2026 · first published August 16, 2026

A maioria das surpresas de custo com agentes não vem do preço de um token. Vem de quantas vezes o agente decidiu tentar de novo. O DeepSeek Harness dá um vocabulário a esse comportamento, que é o primeiro passo para colocar um número nele.

Turno, passo, rodada

Três unidades, separadas com precisão no glossário do projeto:

UnidadeDefiniçãoSignificado de custo
PassoUm pedido ao modelo mais as execuções de ferramenta que ele produzO átomo de faturamento
TurnoUma drenagem da entrada, encerrada quando o modelo para ou uma política intervémA unidade voltada ao usuário
RodadaUma iteração externa de política, como uma rodada de objetivo ou nova tentativa com agente novoO multiplicador acima dos turnos

Rodadas são a camada que quase todo modelo de custo caseiro omite por inteiro. Se sua previsão conta requisições e seu sistema roda rodadas, sua previsão mede a coisa errada.

Objetivos são metas duráveis

Um objetivo é uma meta de conclusão durável com fase explícita: ativo, pausado, bloqueado ou completo. Diferente de uma mensagem, ele persiste entre turnos, então o agente carrega uma meta permanente. Cada ciclo de continuação admitido para esse objetivo é uma rodada de objetivo, materializada como um único turno originado do objetivo.

A admissão é regida por uma ativação de objetivo: uma permissão local ao processo para admitir mais uma rodada, que está armada ou desarmada. Esse único bit é o estrangulador do trabalho aberto.

Uma meta permanente somada a continuação automática é uma autorização de gasto sem teto. É exatamente por isso que está documentado que criar e editar objetivos exige autorização humana direta: alguém precisa ser dono do orçamento do trabalho aberto.

O loop Ralph é reinício deliberado

O loop Ralph é um fluxo em primeiro plano que itera rumo a um objetivo imutável iniciando sessões de agente novas, construído sobre as primitivas de fluxo e subagentes do harness. Uma rodada Ralph é uma sessão filha nova, sem semente de conversa do pai. A continuidade é carregada por um handoff Ralph: um relatório normalizado, limitado e estruturado com status, resumo, evidências e bloqueios.

A economia aqui é genuinamente interessante, e corta dos dois lados. Reiniciar limpo significa que cada rodada paga um custo de entrada pequeno em vez de arrastar uma conversa sempre maior, então o custo por rodada fica plano em vez de subir. Mas nada num começo novo garante progresso, e um loop que reinicia barato pode se dar ao luxo de reiniciar muitas vezes mais.

O handoff limitado é o controle que torna o padrão viável: é o único canal entre rodadas, então limita o crescimento de contexto por construção. Observe dois números — rodadas por objetivo, e se a lista de bloqueios do handoff se repete. Um bloqueio que aparece em três handoffs seguidos é um loop que não vai convergir, e cada rodada a mais é desperdício puro.

Comandos não são ferramentas

Vale separar, porque muda o que você mede. Um comando humano é uma instrução com prefixo de barra roteada pelo plano de comandos até adaptadores voltados ao humano: descoberta, parsing, despacho, cancelamento e renderização, sob responsabilidade dos adaptadores de UI. É explicitamente distinto de uma ferramenta de modelo. O comando de objetivo é um desses.

Na prática: um humano digitando um comando de barra não é o modelo gastando tokens. Atribua os dois em separado ou seu custo por sessão vai culpar o ator errado.

Quatro controles para trabalho aberto

  1. Um número máximo de rodadas por objetivo, aplicado antes da admissão em vez de revisado depois.
  2. Um orçamento cumulativo de tokens abrangendo todas as rodadas de um objetivo, não por rodada.
  3. Detecção de convergência sobre o handoff: bloqueios repetidos param o loop.
  4. Autorização humana explícita para criação de objetivo, guardada como registro de auditoria de quem autorizou o gasto.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research