DeepSeek Harness: objetivos, rodadas de objetivo e o loop Ralph
Updated August 16, 2026 · first published August 16, 2026
A maioria das surpresas de custo com agentes não vem do preço de um token. Vem de quantas vezes o agente decidiu tentar de novo. O DeepSeek Harness dá um vocabulário a esse comportamento, que é o primeiro passo para colocar um número nele.
Turno, passo, rodada
Três unidades, separadas com precisão no glossário do projeto:
| Unidade | Definição | Significado de custo |
|---|---|---|
| Passo | Um pedido ao modelo mais as execuções de ferramenta que ele produz | O átomo de faturamento |
| Turno | Uma drenagem da entrada, encerrada quando o modelo para ou uma política intervém | A unidade voltada ao usuário |
| Rodada | Uma iteração externa de política, como uma rodada de objetivo ou nova tentativa com agente novo | O multiplicador acima dos turnos |
Rodadas são a camada que quase todo modelo de custo caseiro omite por inteiro. Se sua previsão conta requisições e seu sistema roda rodadas, sua previsão mede a coisa errada.
Objetivos são metas duráveis
Um objetivo é uma meta de conclusão durável com fase explícita: ativo, pausado, bloqueado ou completo. Diferente de uma mensagem, ele persiste entre turnos, então o agente carrega uma meta permanente. Cada ciclo de continuação admitido para esse objetivo é uma rodada de objetivo, materializada como um único turno originado do objetivo.
A admissão é regida por uma ativação de objetivo: uma permissão local ao processo para admitir mais uma rodada, que está armada ou desarmada. Esse único bit é o estrangulador do trabalho aberto.
Uma meta permanente somada a continuação automática é uma autorização de gasto sem teto. É exatamente por isso que está documentado que criar e editar objetivos exige autorização humana direta: alguém precisa ser dono do orçamento do trabalho aberto.
O loop Ralph é reinício deliberado
O loop Ralph é um fluxo em primeiro plano que itera rumo a um objetivo imutável iniciando sessões de agente novas, construído sobre as primitivas de fluxo e subagentes do harness. Uma rodada Ralph é uma sessão filha nova, sem semente de conversa do pai. A continuidade é carregada por um handoff Ralph: um relatório normalizado, limitado e estruturado com status, resumo, evidências e bloqueios.
A economia aqui é genuinamente interessante, e corta dos dois lados. Reiniciar limpo significa que cada rodada paga um custo de entrada pequeno em vez de arrastar uma conversa sempre maior, então o custo por rodada fica plano em vez de subir. Mas nada num começo novo garante progresso, e um loop que reinicia barato pode se dar ao luxo de reiniciar muitas vezes mais.
O handoff limitado é o controle que torna o padrão viável: é o único canal entre rodadas, então limita o crescimento de contexto por construção. Observe dois números — rodadas por objetivo, e se a lista de bloqueios do handoff se repete. Um bloqueio que aparece em três handoffs seguidos é um loop que não vai convergir, e cada rodada a mais é desperdício puro.
Comandos não são ferramentas
Vale separar, porque muda o que você mede. Um comando humano é uma instrução com prefixo de barra roteada pelo plano de comandos até adaptadores voltados ao humano: descoberta, parsing, despacho, cancelamento e renderização, sob responsabilidade dos adaptadores de UI. É explicitamente distinto de uma ferramenta de modelo. O comando de objetivo é um desses.
Na prática: um humano digitando um comando de barra não é o modelo gastando tokens. Atribua os dois em separado ou seu custo por sessão vai culpar o ator errado.
Quatro controles para trabalho aberto
- Um número máximo de rodadas por objetivo, aplicado antes da admissão em vez de revisado depois.
- Um orçamento cumulativo de tokens abrangendo todas as rodadas de um objetivo, não por rodada.
- Detecção de convergência sobre o handoff: bloqueios repetidos param o loop.
- Autorização humana explícita para criação de objetivo, guardada como registro de auditoria de quem autorizou o gasto.
Related
- O que é DeepSeek Harness? Guia completo
- Subagentes e profundidade de delegação (EN)
- Limites de gasto no harness (EN)
- O log de sessão como registro de custos (EN)
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →