Quick answer: La mayoría de las sorpresas de coste con agentes no vienen del precio de un token. Vienen de cuántas veces el agente decidió volver a intentarlo. DeepSeek Harness le da un vocabulario a ese...

DeepSeek Harness: objetivos, rondas de objetivo y el bucle Ralph

Updated August 16, 2026 · first published August 16, 2026

La mayoría de las sorpresas de coste con agentes no vienen del precio de un token. Vienen de cuántas veces el agente decidió volver a intentarlo. DeepSeek Harness le da un vocabulario a ese comportamiento, que es el primer paso para ponerle un número.

Turno, paso, ronda

Tres unidades, separadas con precisión en el glosario del proyecto:

UnidadDefiniciónSignificado de coste
PasoUn pedido al modelo más las ejecuciones de herramienta que produceEl átomo de facturación
TurnoUn drenaje de la entrada, que termina cuando el modelo para o interviene una políticaLa unidad de cara al usuario
RondaUna iteración externa de política, como una ronda de objetivo o un intento con agente nuevoEl multiplicador por encima de los turnos

Las rondas son la capa que casi todos los modelos de coste caseros omiten por completo. Si su previsión cuenta peticiones y su sistema corre rondas, su previsión mide lo que no es.

Los objetivos son metas duraderas

Un objetivo es una meta de finalización duradera con una fase explícita: activo, en pausa, bloqueado o completo. A diferencia de un mensaje, persiste entre turnos, así que el agente carga una meta permanente. Cada ciclo de continuación admitido para ese objetivo es una ronda de objetivo, materializada como un único turno de origen de objetivo.

La admisión la controla una activación de objetivo: un permiso local al proceso para admitir otra ronda, que está armado o desarmado. Ese único bit es el estrangulador del trabajo abierto.

Una meta permanente más continuación automática es una autorización de gasto sin techo. Justo por eso está documentado que crear y editar objetivos exige autorización humana directa: alguien tiene que ser dueño del presupuesto del trabajo abierto.

El bucle Ralph es reinicio deliberado

El bucle Ralph es un flujo en primer plano que itera hacia un objetivo inmutable arrancando sesiones de agente nuevas, construido sobre las primitivas de flujo y subagentes del harness. Una ronda Ralph es una sesión hija nueva sin semilla de conversación del padre. La continuidad la lleva un handoff Ralph: un informe normalizado, acotado y estructurado con estado, resumen, evidencia y bloqueos.

La economía aquí es interesante de verdad, y corta en los dos sentidos. Reiniciar limpio significa que cada ronda paga un coste de entrada pequeño en vez de arrastrar una conversación siempre creciente, así que el coste por ronda se queda plano en lugar de escalar. Pero nada en un arranque fresco garantiza progreso, y un bucle que reinicia barato puede permitirse reiniciar muchas más veces.

El handoff acotado es el control que hace viable el patrón: es el único canal entre rondas, así que limita el crecimiento del contexto por construcción. Vigile dos números: rondas por objetivo, y si la lista de bloqueos del handoff se repite. Un bloqueo que aparece en tres handoffs seguidos es un bucle que no va a converger, y cada ronda adicional es puro desperdicio.

Los comandos no son herramientas

Vale la pena separarlo, porque afecta a lo que se mide. Un comando humano es una instrucción con prefijo de barra enrutada por el plano de comandos hacia adaptadores de cara al humano: descubrimiento, parseo, despacho, cancelación y renderizado, propiedad de los adaptadores de UI. Es explícitamente distinto de una herramienta de modelo. El comando de objetivo es uno de ellos.

En la práctica: un humano tecleando un comando de barra no es el modelo gastando tokens. Atribuya las dos cosas por separado o su coste por sesión culpará al actor equivocado.

Cuatro controles para el trabajo abierto

  1. Un número máximo de rondas por objetivo, aplicado antes de admitir en vez de revisado después.
  2. Un presupuesto acumulado de tokens que abarque todas las rondas de un objetivo, no por ronda.
  3. Detección de convergencia sobre el handoff: bloqueos repetidos detienen el bucle.
  4. Autorización humana explícita para crear objetivos, guardada como registro de auditoría de quién autorizó el gasto.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research