Le modèle ne travaille jamais seul
À modèle égal, le logiciel qui l'entoure peut faire varier fortement la réussite, le coût et la sécurité. Le sujet n'est plus seulement l'intelligence du modèle, mais l'organisation de son travail.
Pendant longtemps, comparer deux agents revenait surtout à comparer leurs modèles. Ce cadre est devenu trop étroit : une part croissante de la performance se joue dans le logiciel qui organise leur travail.
FrontierHarness EvalUn benchmark open source qui compare douze harnesses sur les mêmes trente tâches, avec le même modèle et le même environnement. a fait travailler Kimi K3Un modèle open source de premier plan, créé par Moonshot AI. sur les mêmes trente tâches, dans le même environnement, avec douze configurations de harness. Le taux de réussite observé varie de 50 à 66,7 %. Le coût publié va de 1,05 à 18,34 dollars, soit un rapport de 17,5.
Ce qui change est le harness : le logiciel qui choisit ce que le modèle voit, les outils qu'il peut utiliser, ce qui est mémorisé, ses permissions et la preuve exigée avant de terminer. Le modèle décide de la prochaine action ; le harness organise l'exécution.
FrontierHarness Eval · Kimi K3 fixe
Douze configurations classées sur trente tâches
Huit harnesses, huit philosophies
Cette sélection n'est ni exhaustive ni classée. Elle montre huit manières d'organiser le travail d'un modèle.
Harness deck · 2026
Huit systèmes, huit choix
Glisser · cliquer · ← →
01 / 08 · Codex
Un harness, concrètement
Dans « Du prompt à la loop », je distinguais la loop, qui décide quand relancer un système, du harness, qui encadre l'exécution d'une tâche.
Un agent harness est l'ensemble des mécanismes placés entre une demande et un résultat vérifié.
Il prend six décisions :
- Boucle : quand relancer le modèle et quand arrêter ?
- Outils : que peut-il lire, appeler ou modifier ?
- Contexte : quelles informations restent visibles ?
- État durable : que conserve-t-on après une interruption ?
- Permissions : quelles limites ne peut-il pas franchir ?
- Vérification : quelle preuve permet de déclarer la tâche terminée ?
Vous avez probablement déjà un harness : un fichier d'instructions, quelques outils, des permissions, des tests et des habitudes de relance. Dans beaucoup d'équipes, cet ensemble s'est constitué au fil des usages. L'identifier permet ensuite d'en tester les règles, les permissions et les conditions d'arrêt.
À mesure que les tâches s'allongent et que les agents agissent sur des systèmes réels, la mémoire, les permissions, la reprise et la vérification deviennent elles aussi des variables de performance. OpenAI décrit ainsi des exécutions Codex de plus de six heures dans son retour sur le harness engineering. Les résultats doivent alors être attribués à la configuration complète — modèle et harness — plutôt qu'au modèle seul.
Ce que les benchmarks permettent d'isoler
Même modèle, harness différent
FrontierHarness Eval fixe le modèle, Kimi K3, et l'environnement : 21 tâches Terminal-Bench, 9 tâches DeepSWEDes tâches de génie logiciel où l'agent doit modifier un dépôt et faire valider son résultat par des tests., 12 configurations et 360 exécutions. Chaque configuration effectue une seule tentative par tâche. Codex obtient 20 réussites sur 30 pour 3,47 dollars selon la métrique publiée ; DSH Creator et Claude Code, 19 sur 30, pour respectivement 3,28 et 18,34 dollars ; Exo, 16 sur 30, pour 1,05 dollar.
Même harness, modèle différent
DeepSWE fait l'expérience inverse : 113 tâches dans le même mini-swe-agent. Au 2 septembre 2026, trois configurations obtiennent un score voisin :
- Gemini 3.8 Flash : 74 %, 166 étapes, 2,36 dollars par tâche ;
- Claude Opus 5 : 74 %, 99 étapes, 11,84 dollars ;
- GPT-5.6 Sol : 73 %, 61 étapes, 6,46 dollars.
Les intervalles d'incertitude se chevauchent : il n'y a pas de podium solide. En revanche, les trajectoires diffèrent. Gemini utilise environ 2,7 fois plus d'étapes que GPT-5.6 Sol tout en coûtant moins cher. Dans ces configurations, le nombre d'étapes ne permet pas à lui seul de déduire l'efficacité, car le prix de chaque appel, le volume de tokens et le taux de réussite varient aussi.
Google présente ce comportement comme un choix de conception : 3.8 Flash avance par étapes de raisonnement plus petites et multiplie les appels d'outils. Son positionnement Flash et son faible coût peuvent suggérer un modèle plus léger, mais sa taille relative à Opus 5 ou GPT-5.6 Sol n'est pas publiée.
Même harness · modèles différents
Score, étapes et coût pour trois modèles
Étapes, outils et sous-agents : ne pas tout mélanger
- Une étape agentique est un nouveau cycle de décision du modèle.
- Un appel d'outil est une action demandée pendant ce cycle.
- Un sous-agent est une autre instance du modèle, avec son propre contexte et sa propre boucle.
- Le raisonnement interne est le calcul produit avant l'action observable.
Dire qu'un modèle « appelle beaucoup d'agents » est donc incomplet : le harness doit lui donner cette capacité, définir quand l'utiliser et réunir les résultats.
Deux approches coexistent. La première prolonge le travail d'un seul agent avec de meilleurs outils, une mémoire et moins de relances inutiles. La seconde ouvre plusieurs contextes en parallèle. Anthropic rapporte que son système de recherche multi-agent a dépassé de 90,2 % sa version mono-agent sur une évaluation interne, mais qu'il consomme environ quinze fois plus de tokens qu'un chat.
Le multi-agent est surtout utile lorsque plusieurs hypothèses peuvent être analysées indépendamment. Lorsque chaque décision dépend de la précédente, la coordination ajoute des tokens et du temps sans gain garanti. Beaucoup de tâches de code se prêtent moins bien à cette décomposition.
Le coût réel se mesure par tâche réussie
Le tarif au million de tokens ne suffit pas. Au 4 septembre 2026, GPT-5.6 Sol est affiché à 4 dollars en entrée et 20 en sortie, contre 0,20 et 1,20 dollar pour GPT-5.6 Luna. Cet écart de prix unitaire ne se transpose pas directement au coût d'une tâche : le volume de tokens, le nombre d'étapes, les reprises et le taux de réussite peuvent modifier l'ordre. Les tarifs viennent de la documentation OpenAI et peuvent évoluer. Artificial Analysis complète utilement ces tarifs par un coût moyen par tâche, calculé à partir de la consommation réellement observée dans ses propres évaluations.
coût de la tâche = tokens + outils + infrastructure + reprises
coût utile = dépense totale / tâches réellement réussies
Anthropic donne un exemple extrême : un agent seul a travaillé vingt minutes pour 9 dollars ; un harness séparant planification, construction et évaluation a travaillé six heures pour 200 dollars. Le second résultat fonctionnait nettement mieux. La bonne question n'est donc pas « quel modèle est le moins cher ? », mais « combien vaut une réussite supplémentaire sur cette tâche ? »
Économie agentique
Du tarif au coût par résultat vérifié
Dépense de tous les essais
Σ (tokens × tarifs)
+ outils et infrastructure
+ échecs et reprises
Résultats vérifiés
Tâches qui passent le critère externe
Coût utile
Coût par résultat vérifié
Comparer les familles de harness
Les deux benchmarks précédents ne désignent pas un vainqueur général. Les huit produits du panorama se répartissent ici en cinq familles ; le multi-agent reste une capacité transversale, présente dans plusieurs d'entre elles.
Primitive à assembler
Pi
Meilleure quand…
Comprendre la boucle ou posséder chaque décision du harness.
Moins adaptée quand…
Chercher une expérience prête à l'emploi avec reprise et garde-fous.
Poste de travail intégré
Codex, Claude Code, Kimi Code
Meilleure quand…
Travailler immédiatement dans un dépôt déjà outillé.
Moins adaptée quand…
Rester indépendant d'un écosystème ou remplacer tout le runtime.
Ouvert et composable
OpenCode, DeepSeek Harness
Meilleure quand…
Changer de modèle, assembler des plugins ou tester des variantes.
Moins adaptée quand…
Vouloir une combinaison déjà validée avec peu d'intégration.
Infrastructure durable
Exo
Meilleure quand…
Reprendre, cloner ou modifier un agent sans perdre son historique.
Moins adaptée quand…
Chercher un produit mature et peu configurable.
Agent personnel persistant
Hermes
Meilleure quand…
Conserver mémoire et skills entre le code et les messageries.
Moins adaptée quand…
Limiter strictement l'agent à une tâche ou à un dépôt.
Les problèmes encore ouverts
- Conserver le bon contexte. Tout garder coûte cher ; résumer peut supprimer la règle importante. Les informations critiques doivent parfois devenir des tests ou des contraintes mécaniques plutôt que rester dans un prompt.
- Exposer les bons outils. Des centaines de schémas remplissent le contexte avant même le début du travail. La découverte à la demande et l'agrégation locale réduisent ce coût.
- Donner de l'autonomie sans multiplier les validations. Anthropic indique que son sandboxing a réduit de 84 % les demandes de permission dans son usage interne. Des limites définies en amont ont ainsi remplacé une partie des validations ponctuelles.
- Vérifier la trajectoire. Un résultat peut être juste après une action interdite ou inutilement risquée. HarnessAudit propose d'évaluer l'ensemble du parcours ; la condition d'arrêt doit elle aussi reposer sur une preuve externe au modèle.
Ces problèmes ajoutent trois critères au taux de réussite : la capacité de reprise, le contrôle des permissions et la traçabilité.
Ce qu'il faut retenir
Ces benchmarks montrent que la réussite et le coût dépendent de la configuration complète, et que des scores voisins peuvent correspondre à des trajectoires très différentes. Une entreprise doit donc tester le couple modèle-harness sur ses propres tâches, puis conserver plusieurs configurations si leurs usages diffèrent réellement.
Sources principales
- FrontierHarness Eval — méthodologie, configurations et données
- DeepSWE — leaderboard v1.1 et métriques par modèle
- Google — Gemini 3.8 Flash et ses étapes de raisonnement plus courtes
- Artificial Analysis — méthodologie du coût moyen par tâche
- OpenAI — Harness engineering
- OpenAI — guide du modèle le plus récent et prix
- Anthropic — How we built our multi-agent research system
- Anthropic — Harness design for long-running application development
- Anthropic — Code execution with MCP
- Anthropic — Beyond permission prompts: sandboxing
- Liu et al. — Auditing Agent Harness Safety
Du prompt à la loop
Avant de comparer les harnesses, revenez à la boucle élémentaire qui transforme une réponse en suite d'actions.
Lire la suite