<- Tous les textes
8 min de lecture
IntermédiairePublic/dirigeants, équipes produit, métiers et profils techniques

Le modèle ne travaille jamais seul

À modèle égal, le logiciel qui l'entoure peut faire varier fortement la réussite, le coût et la sécurité. Le sujet n'est plus seulement l'intelligence du modèle, mais l'organisation de son travail.

Pendant longtemps, comparer deux agents revenait surtout à comparer leurs modèles. Ce cadre est devenu trop étroit : une part croissante de la performance se joue dans le logiciel qui organise leur travail.

FrontierHarness EvalUn benchmark open source qui compare douze harnesses sur les mêmes trente tâches, avec le même modèle et le même environnement. a fait travailler Kimi K3Un modèle open source de premier plan, créé par Moonshot AI. sur les mêmes trente tâches, dans le même environnement, avec douze configurations de harness. Le taux de réussite observé varie de 50 à 66,7 %. Le coût publié va de 1,05 à 18,34 dollars, soit un rapport de 17,5.

Ce qui change est le harness : le logiciel qui choisit ce que le modèle voit, les outils qu'il peut utiliser, ce qui est mémorisé, ses permissions et la preuve exigée avant de terminer. Le modèle décide de la prochaine action ; le harness organise l'exécution.

FrontierHarness Eval · Kimi K3 fixe

Douze configurations classées sur trente tâches

Source : FrontierHarness Eval v1, 21 tâches Terminal-Bench et 9 tâches DeepSWE.
50%55%60%65%$1$2$5$10$20ExoPiHermesOpenCodeDSH CreatorDSH StandardCodexKimi CodeDSH PTCDSH MinimalOh My PiClaude Codecoût effectif par réussite · échelle logarithmiquetaux de réussite
Classement observé avec une exécution par couple tâche-configuration. Une tâche fait varier le score de 3,3 points ; l'ordre entre résultats proches n'est donc pas un podium stable.

Huit harnesses, huit philosophies

Cette sélection n'est ni exhaustive ni classée. Elle montre huit manières d'organiser le travail d'un modèle.

Harness deck · 2026

Huit systèmes, huit choix

Produit intégré

Codex

01 / 08

Un poste de travail agentique déjà assemblé autour du dépôt, avec terminal, outils, permissions, exécution et revue dans le même environnement.

Périmètre

Du dépôt à la revue

Compromis

Boucle liée au produit

Bon choix si

Il faut déléguer vite

01 / 08 · Codex

Un harness, concrètement

Dans « Du prompt à la loop », je distinguais la loop, qui décide quand relancer un système, du harness, qui encadre l'exécution d'une tâche.

Un agent harness est l'ensemble des mécanismes placés entre une demande et un résultat vérifié.

Il prend six décisions :

  1. Boucle : quand relancer le modèle et quand arrêter ?
  2. Outils : que peut-il lire, appeler ou modifier ?
  3. Contexte : quelles informations restent visibles ?
  4. État durable : que conserve-t-on après une interruption ?
  5. Permissions : quelles limites ne peut-il pas franchir ?
  6. Vérification : quelle preuve permet de déclarer la tâche terminée ?

Vous avez probablement déjà un harness : un fichier d'instructions, quelques outils, des permissions, des tests et des habitudes de relance. Dans beaucoup d'équipes, cet ensemble s'est constitué au fil des usages. L'identifier permet ensuite d'en tester les règles, les permissions et les conditions d'arrêt.

À mesure que les tâches s'allongent et que les agents agissent sur des systèmes réels, la mémoire, les permissions, la reprise et la vérification deviennent elles aussi des variables de performance. OpenAI décrit ainsi des exécutions Codex de plus de six heures dans son retour sur le harness engineering. Les résultats doivent alors être attribués à la configuration complète — modèle et harness — plutôt qu'au modèle seul.

Ce que les benchmarks permettent d'isoler

Même modèle, harness différent

FrontierHarness Eval fixe le modèle, Kimi K3, et l'environnement : 21 tâches Terminal-Bench, 9 tâches DeepSWEDes tâches de génie logiciel où l'agent doit modifier un dépôt et faire valider son résultat par des tests., 12 configurations et 360 exécutions. Chaque configuration effectue une seule tentative par tâche. Codex obtient 20 réussites sur 30 pour 3,47 dollars selon la métrique publiée ; DSH Creator et Claude Code, 19 sur 30, pour respectivement 3,28 et 18,34 dollars ; Exo, 16 sur 30, pour 1,05 dollar.

Même harness, modèle différent

DeepSWE fait l'expérience inverse : 113 tâches dans le même mini-swe-agent. Au 2 septembre 2026, trois configurations obtiennent un score voisin :

  • Gemini 3.8 Flash : 74 %, 166 étapes, 2,36 dollars par tâche ;
  • Claude Opus 5 : 74 %, 99 étapes, 11,84 dollars ;
  • GPT-5.6 Sol : 73 %, 61 étapes, 6,46 dollars.

Les intervalles d'incertitude se chevauchent : il n'y a pas de podium solide. En revanche, les trajectoires diffèrent. Gemini utilise environ 2,7 fois plus d'étapes que GPT-5.6 Sol tout en coûtant moins cher. Dans ces configurations, le nombre d'étapes ne permet pas à lui seul de déduire l'efficacité, car le prix de chaque appel, le volume de tokens et le taux de réussite varient aussi.

Google présente ce comportement comme un choix de conception : 3.8 Flash avance par étapes de raisonnement plus petites et multiplie les appels d'outils. Son positionnement Flash et son faible coût peuvent suggérer un modèle plus léger, mais sa taille relative à Opus 5 ou GPT-5.6 Sol n'est pas publiée.

Même harness · modèles différents

Score, étapes et coût pour trois modèles

Source : DeepSWE v1.1, données consultées le 2 septembre 2026.
moins d’étapes →1801401006040Gemini 3.8 Flash74% · 166 étapes · 2,36 $Claude Opus 574% · 99 étapes · 11,84 $GPT-5.6 Sol73% · 61 étapes · 6,46 $nombre moyen d’étapes par tâche
Les étapes mesurent les interactions externes, pas la quantité de calcul interne. Ici, Gemini prend 2,7 fois plus d’étapes que GPT-5.6 Sol, tout en restant le moins cher des trois.

Étapes, outils et sous-agents : ne pas tout mélanger

  • Une étape agentique est un nouveau cycle de décision du modèle.
  • Un appel d'outil est une action demandée pendant ce cycle.
  • Un sous-agent est une autre instance du modèle, avec son propre contexte et sa propre boucle.
  • Le raisonnement interne est le calcul produit avant l'action observable.

Dire qu'un modèle « appelle beaucoup d'agents » est donc incomplet : le harness doit lui donner cette capacité, définir quand l'utiliser et réunir les résultats.

Deux approches coexistent. La première prolonge le travail d'un seul agent avec de meilleurs outils, une mémoire et moins de relances inutiles. La seconde ouvre plusieurs contextes en parallèle. Anthropic rapporte que son système de recherche multi-agent a dépassé de 90,2 % sa version mono-agent sur une évaluation interne, mais qu'il consomme environ quinze fois plus de tokens qu'un chat.

Le multi-agent est surtout utile lorsque plusieurs hypothèses peuvent être analysées indépendamment. Lorsque chaque décision dépend de la précédente, la coordination ajoute des tokens et du temps sans gain garanti. Beaucoup de tâches de code se prêtent moins bien à cette décomposition.

Le coût réel se mesure par tâche réussie

Le tarif au million de tokens ne suffit pas. Au 4 septembre 2026, GPT-5.6 Sol est affiché à 4 dollars en entrée et 20 en sortie, contre 0,20 et 1,20 dollar pour GPT-5.6 Luna. Cet écart de prix unitaire ne se transpose pas directement au coût d'une tâche : le volume de tokens, le nombre d'étapes, les reprises et le taux de réussite peuvent modifier l'ordre. Les tarifs viennent de la documentation OpenAI et peuvent évoluer. Artificial Analysis complète utilement ces tarifs par un coût moyen par tâche, calculé à partir de la consommation réellement observée dans ses propres évaluations.

coût de la tâche = tokens + outils + infrastructure + reprises

coût utile = dépense totale / tâches réellement réussies

Anthropic donne un exemple extrême : un agent seul a travaillé vingt minutes pour 9 dollars ; un harness séparant planification, construction et évaluation a travaillé six heures pour 200 dollars. Le second résultat fonctionnait nettement mieux. La bonne question n'est donc pas « quel modèle est le moins cher ? », mais « combien vaut une réussite supplémentaire sur cette tâche ? »

Économie agentique

Du tarif au coût par résultat vérifié

Étapes, sous-agents et reprises ne sont pas des postes successifs : ils font varier le numérateur ou le taux de réussite.
Le tarif par token n'est qu'une entrée du calcul. Le harness agit sur la consommation de chaque essai, le nombre de reprises et la part des tâches qui aboutissent.

Comparer les familles de harness

Les deux benchmarks précédents ne désignent pas un vainqueur général. Les huit produits du panorama se répartissent ici en cinq familles ; le multi-agent reste une capacité transversale, présente dans plusieurs d'entre elles.

01

Primitive à assembler

Pi

Meilleure quand…

Comprendre la boucle ou posséder chaque décision du harness.

Moins adaptée quand…

Chercher une expérience prête à l'emploi avec reprise et garde-fous.

02

Poste de travail intégré

Codex, Claude Code, Kimi Code

Meilleure quand…

Travailler immédiatement dans un dépôt déjà outillé.

Moins adaptée quand…

Rester indépendant d'un écosystème ou remplacer tout le runtime.

03

Ouvert et composable

OpenCode, DeepSeek Harness

Meilleure quand…

Changer de modèle, assembler des plugins ou tester des variantes.

Moins adaptée quand…

Vouloir une combinaison déjà validée avec peu d'intégration.

04

Infrastructure durable

Exo

Meilleure quand…

Reprendre, cloner ou modifier un agent sans perdre son historique.

Moins adaptée quand…

Chercher un produit mature et peu configurable.

05

Agent personnel persistant

Hermes

Meilleure quand…

Conserver mémoire et skills entre le code et les messageries.

Moins adaptée quand…

Limiter strictement l'agent à une tâche ou à un dépôt.

Les problèmes encore ouverts

  • Conserver le bon contexte. Tout garder coûte cher ; résumer peut supprimer la règle importante. Les informations critiques doivent parfois devenir des tests ou des contraintes mécaniques plutôt que rester dans un prompt.
  • Exposer les bons outils. Des centaines de schémas remplissent le contexte avant même le début du travail. La découverte à la demande et l'agrégation locale réduisent ce coût.
  • Donner de l'autonomie sans multiplier les validations. Anthropic indique que son sandboxing a réduit de 84 % les demandes de permission dans son usage interne. Des limites définies en amont ont ainsi remplacé une partie des validations ponctuelles.
  • Vérifier la trajectoire. Un résultat peut être juste après une action interdite ou inutilement risquée. HarnessAudit propose d'évaluer l'ensemble du parcours ; la condition d'arrêt doit elle aussi reposer sur une preuve externe au modèle.

Ces problèmes ajoutent trois critères au taux de réussite : la capacité de reprise, le contrôle des permissions et la traçabilité.

Ce qu'il faut retenir

Ces benchmarks montrent que la réussite et le coût dépendent de la configuration complète, et que des scores voisins peuvent correspondre à des trajectoires très différentes. Une entreprise doit donc tester le couple modèle-harness sur ses propres tâches, puis conserver plusieurs configurations si leurs usages diffèrent réellement.


Sources principales

Partager cette lecture

Continuer la lectureVeille

Du prompt à la loop

Avant de comparer les harnesses, revenez à la boucle élémentaire qui transforme une réponse en suite d'actions.

Lire la suite