DeepSeek Harness: objetivos, rondas de objetivo y el bucle Ralph
Updated August 16, 2026 · first published August 16, 2026
La mayoría de las sorpresas de coste con agentes no vienen del precio de un token. Vienen de cuántas veces el agente decidió volver a intentarlo. DeepSeek Harness le da un vocabulario a ese comportamiento, que es el primer paso para ponerle un número.
Turno, paso, ronda
Tres unidades, separadas con precisión en el glosario del proyecto:
| Unidad | Definición | Significado de coste |
|---|---|---|
| Paso | Un pedido al modelo más las ejecuciones de herramienta que produce | El átomo de facturación |
| Turno | Un drenaje de la entrada, que termina cuando el modelo para o interviene una política | La unidad de cara al usuario |
| Ronda | Una iteración externa de política, como una ronda de objetivo o un intento con agente nuevo | El multiplicador por encima de los turnos |
Las rondas son la capa que casi todos los modelos de coste caseros omiten por completo. Si su previsión cuenta peticiones y su sistema corre rondas, su previsión mide lo que no es.
Los objetivos son metas duraderas
Un objetivo es una meta de finalización duradera con una fase explícita: activo, en pausa, bloqueado o completo. A diferencia de un mensaje, persiste entre turnos, así que el agente carga una meta permanente. Cada ciclo de continuación admitido para ese objetivo es una ronda de objetivo, materializada como un único turno de origen de objetivo.
La admisión la controla una activación de objetivo: un permiso local al proceso para admitir otra ronda, que está armado o desarmado. Ese único bit es el estrangulador del trabajo abierto.
Una meta permanente más continuación automática es una autorización de gasto sin techo. Justo por eso está documentado que crear y editar objetivos exige autorización humana directa: alguien tiene que ser dueño del presupuesto del trabajo abierto.
El bucle Ralph es reinicio deliberado
El bucle Ralph es un flujo en primer plano que itera hacia un objetivo inmutable arrancando sesiones de agente nuevas, construido sobre las primitivas de flujo y subagentes del harness. Una ronda Ralph es una sesión hija nueva sin semilla de conversación del padre. La continuidad la lleva un handoff Ralph: un informe normalizado, acotado y estructurado con estado, resumen, evidencia y bloqueos.
La economía aquí es interesante de verdad, y corta en los dos sentidos. Reiniciar limpio significa que cada ronda paga un coste de entrada pequeño en vez de arrastrar una conversación siempre creciente, así que el coste por ronda se queda plano en lugar de escalar. Pero nada en un arranque fresco garantiza progreso, y un bucle que reinicia barato puede permitirse reiniciar muchas más veces.
El handoff acotado es el control que hace viable el patrón: es el único canal entre rondas, así que limita el crecimiento del contexto por construcción. Vigile dos números: rondas por objetivo, y si la lista de bloqueos del handoff se repite. Un bloqueo que aparece en tres handoffs seguidos es un bucle que no va a converger, y cada ronda adicional es puro desperdicio.
Los comandos no son herramientas
Vale la pena separarlo, porque afecta a lo que se mide. Un comando humano es una instrucción con prefijo de barra enrutada por el plano de comandos hacia adaptadores de cara al humano: descubrimiento, parseo, despacho, cancelación y renderizado, propiedad de los adaptadores de UI. Es explícitamente distinto de una herramienta de modelo. El comando de objetivo es uno de ellos.
En la práctica: un humano tecleando un comando de barra no es el modelo gastando tokens. Atribuya las dos cosas por separado o su coste por sesión culpará al actor equivocado.
Cuatro controles para el trabajo abierto
- Un número máximo de rondas por objetivo, aplicado antes de admitir en vez de revisado después.
- Un presupuesto acumulado de tokens que abarque todas las rondas de un objetivo, no por ronda.
- Detección de convergencia sobre el handoff: bloqueos repetidos detienen el bucle.
- Autorización humana explícita para crear objetivos, guardada como registro de auditoría de quién autorizó el gasto.
Related
- ¿Qué es DeepSeek Harness? Guía completa
- Subagentes y profundidad de delegación (EN)
- Límites de gasto en el harness (EN)
- El registro de sesión como registro de costes (EN)
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →