Quick answer: La plupart des mauvaises surprises de coût avec les agents ne tiennent pas au prix d'un token. Elles tiennent au nombre de fois où l'agent a décidé de réessayer. DeepSeek Harness donne un vocabulaire...

DeepSeek Harness : objectifs, tours d'objectif et boucle Ralph

Updated August 16, 2026 · first published August 16, 2026

La plupart des mauvaises surprises de coût avec les agents ne tiennent pas au prix d'un token. Elles tiennent au nombre de fois où l'agent a décidé de réessayer. DeepSeek Harness donne un vocabulaire à ce comportement, premier pas pour y mettre un chiffre.

Tour, étape, round

Trois unités, nettement séparées dans le glossaire du projet :

UnitéDéfinitionSens économique
ÉtapeUne requête modèle plus les exécutions d'outils qu'elle produitL'atome de facturation
TourUne vidange de l'entrée, close quand le modèle s'arrête ou qu'une politique intervientL'unité visible de l'utilisateur
RoundUne itération de politique externe, tel un tour d'objectif ou une tentative avec agent neufLe multiplicateur au-dessus des tours

Les rounds sont la couche que les modèles de coût maison omettent presque toujours. Si votre prévision compte des requêtes et que votre système enchaîne des rounds, votre prévision mesure la mauvaise chose.

Les objectifs sont des cibles durables

Un objectif est une cible d'achèvement durable dotée d'une phase explicite : actif, en pause, bloqué ou terminé. Contrairement à un message, il persiste d'un tour à l'autre, si bien que l'agent porte une cible permanente. Chaque cycle de continuation admis pour cet objectif est un tour d'objectif, matérialisé par un unique tour issu de l'objectif.

L'admission est régie par une activation d'objectif : une permission locale au processus d'admettre un tour de plus, armée ou désarmée. Ce seul bit est l'étrangleur du travail ouvert.

Une cible permanente doublée d'une continuation automatique est une autorisation de dépense sans plafond. C'est précisément pourquoi il est documenté que créer et modifier un objectif exige une autorisation humaine directe : quelqu'un doit assumer le budget du travail ouvert.

La boucle Ralph est un redémarrage délibéré

La boucle Ralph est un flux au premier plan qui itère vers un objectif immuable en démarrant des sessions d'agent neuves, bâti sur les primitives de flux et de sous-agents du harness. Un round Ralph est une session enfant neuve, sans amorce de conversation du parent. La continuité est portée par un handoff Ralph : un rapport normalisé, borné et structuré contenant statut, résumé, preuves et blocages.

L'économie est ici réellement intéressante, et à double tranchant. Repartir propre veut dire que chaque round paie un petit coût d'entrée au lieu de traîner une conversation toujours plus grosse : le coût par round reste plat plutôt que de grimper. Mais rien dans un départ neuf ne garantit un progrès, et une boucle qui redémarre à bas prix peut s'offrir bien plus de redémarrages.

Le handoff borné est le contrôle qui rend le motif viable : il est le seul canal entre les rounds, donc il plafonne la croissance du contexte par construction. Surveillez deux chiffres — rounds par objectif, et répétition ou non de la liste de blocages du handoff. Un blocage présent dans trois handoffs consécutifs, c'est une boucle qui ne convergera pas, et chaque round de plus est du pur gaspillage.

Les commandes ne sont pas des outils

La distinction compte, car elle change ce que l'on mesure. Une commande humaine est une instruction préfixée d'un slash, routée par le plan de commandes vers les adaptateurs orientés humain : découverte, analyse, dispatch, annulation et rendu, sous la responsabilité des adaptateurs d'interface. Elle est explicitement distincte d'un outil de modèle. La commande d'objectif en fait partie.

Concrètement : un humain qui tape une commande slash n'est pas le modèle qui dépense des tokens. Imputez les deux séparément, sinon votre coût par session accusera le mauvais acteur.

Quatre contrôles pour le travail ouvert

  1. Un nombre maximal de rounds par objectif, appliqué avant admission plutôt que constaté après coup.
  2. Un budget de tokens cumulé couvrant tous les rounds d'un objectif, et non par round.
  3. Une détection de convergence sur le handoff : des blocages répétés arrêtent la boucle.
  4. Une autorisation humaine explicite pour la création d'objectif, conservée comme trace de qui a autorisé la dépense.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research