Navigation principale

Meta-Harness : des workflows d’IA d’entreprise auto-améliorés et plus sûrs

Un méta-harnais rigoureux aide les équipes d’entreprise à améliorer en toute sécurité les workflows d’agents sur des tâches de programmation de longue durée.

Synthèse

  • Les systèmes actuels d’amélioration autonome ont obtenu d’excellents résultats sur les tâches de programmation, mais leur capacité à améliorer des workflows d’IA complexes et de longue durée, comparables aux déploiements réels en entreprise, reste incertaine.

  • Nos travaux sur Meta-Harness appliquent l’auto-amélioration autonome aux workflows de recherche agentique, de recherche approfondie et de veille stratégique, tout en intégrant des exigences d’entreprise telles que l’évaluation sur données réservées, l’auditabilité, le contrôle des budgets et l’approbation humaine.

  • Sur trois charges de travail représentatives, Meta-Harness a nettement amélioré les performances, avec notamment une hausse de 84 % des performances sur le jeu de test réservé pour Signal Engine, ainsi qu’une précision supérieure et une exécution 16 fois plus rapide pour la recherche multimodale agentique.

  • Contrairement à la plupart des approches antérieures, Meta-Harness mesure autant que possible la réussite sur des jeux de données réservés afin de déterminer si les améliorations se généralisent au-delà des données utilisées pendant l’optimisation.

  • Ces résultats suggèrent que l’amélioration autonome des workflows peut dépasser les benchmarks de programmation et s’appliquer à de véritables systèmes d’IA d’entreprise, ouvrant une voie concrète vers l’amélioration continue des applications d’IA.

Les travaux récents sur la recherche autonome en IA, notamment l’article Meta-Harness, le framework CORAL et karpathy/autoresearch, ont montré que les agents de programmation peuvent améliorer une solution de manière itérative à partir d’une métrique d’évaluation. Reste à savoir si ces méthodes s’appliquent aux workflows d’IA de longue durée, comme la recherche multimodale agentique, où un agent doit parcourir de façon itérative des corpus métier multimodaux pour répondre à une question, ou aux pipelines complexes de traitement des données qui nécessitent de nombreuses étapes interdépendantes, des appels d’outils et des décisions de gestion des exceptions. La question fondamentale est de savoir si les gains se maintiennent sur des données que l’optimiseur ne voit jamais.

Nos travaux de R&D sur Meta-Harness répondent à cette question. Ils reprennent des idées issues de recherches récentes et les adaptent aux besoins des entreprises : évaluation sur données réservées, pistes d’audit, plafonds de coûts et transfert clairement défini à un examinateur humain avant tout déploiement.

Nous l’avons testé sur trois tâches de longue durée inspirées de missions réelles pour des clients. Signal Engine surveille un flux en direct de publications X sur le marché de l’IA et produit des rapports de tendances structurés et bien sourcés. La recherche multimodale agentique raisonne sur des requêtes mêlant texte et images afin de renvoyer les pages de documents les plus pertinentes. La recherche approfondie orchestre plusieurs agents pour effectuer des recherches sur le Web, recouper les sources et rédiger des rapports de recherche détaillés.

Les résultats en bref

  • Signal Engine : score composite sur le test réservé de 0,456 → 0,841, soit une hausse relative de 84 %. CORAL et karpathy/autoresearch sont restés sous 0,50 avec le même budget.

  • Recherche multimodale agentique : NDCG@10 réservé de 0,705 → 0,744, tandis que le temps réel par évaluation est passé de 869 s à 54 s. Soit une accélération par 16 avec une précision supérieure.

  • Recherche approfondie : score composite de qualité des rapports de 0,449 → 0,802 sur 10 questions de référence, contre environ 0,52 pour les méthodes de référence. Cette tâche ne comportait aucune partition réservée ; nous considérons donc ce résultat comme limité à l’échantillon.

  • Efficacité de la recherche : grâce au reclassement prédictif des hypothèses, Signal Engine a atteint 91 % du meilleur score de l’exécution de référence en 3 itérations au lieu de 20, avec le même budget d’évaluation.

La plupart des systèmes de recherche autonome optimisent et évaluent sur le même jeu de données, ce qui empêche de savoir si le résultat se généralise. Pour Signal Engine et la recherche multimodale agentique, nous imposons une séparation stricte : un jeu d’entraînement sur lequel les candidats peuvent être notés, un jeu de développement pour les contrôles de cohérence et un jeu de test réservé que l’optimiseur ne voit jamais. Chaque résultat publié provient d’une version précise du code évaluée sur toutes les partitions : nous ne combinons donc jamais le meilleur score d’entraînement d’un candidat avec le meilleur score de test d’un autre.

Fonctionnement

À chaque cycle, le harnais génère un lot d’hypothèses structurées pour modifier le code. Chaque hypothèse indique le mécanisme qu’elle veut modifier, la version antérieure sur laquelle elle s’appuie et le mode de défaillance qu’elle cible. Une étape de classement filtre le lot avant d’engager toute évaluation coûteuse. Les hypothèses retenues sont confiées à des agents d’exécution parallèles qui partagent une base de connaissances commune, mais modifient le code dans des espaces de travail totalement isolés, afin que chaque candidat soit évalué équitablement et indépendamment. À la fin du cycle, l’exécuteur promeut un gagnant : le candidat ayant obtenu le meilleur score tout en réussissant chaque contrôle sur les partitions visibles. Ce gagnant devient la version de pointe sur laquelle s’appuie le cycle suivant. Chaque essai écrit un ensemble fixe dans un référentiel de preuves en ajout seul : son correctif de code, ses scores par partition, un journal d’événements et quatre courtes analyses rédigées par un LLM couvrant sa trace, ses erreurs, son coût et une réflexion. Le générateur de propositions du cycle suivant relit cet historique : le harnais capitalise ainsi sur ses acquis au lieu de reprendre les mêmes voies sans issue.

Schéma du workflow Meta-Harness montrant les entrées, l’évaluation initiale, la recherche d’hypothèses, les équipes d’agents en parallèle, un espace de travail d’évaluation, les résultats des revues, un référentiel de preuves et les contrôles de sécurité et de coûts.

Trois garde-fous assurent la sécurité de la boucle. Une politique de périmètre limite les fichiers qu’un candidat peut modifier et annule toute modification extérieure. Les budgets de tokens et de temps réel arrêtent l’exécution lorsque les dépenses dépassent un plafond, tandis que les limites de concurrence maintiennent le harnais dans les limites de débit du modèle et des GPU. Et le harnais ne déploie jamais rien lui-même. Il produit un candidat classé et entièrement documenté, puis un ingénieur examine le diff et décide de sa mise en production.

Sous le capot

Dans une pile locale, cinq primitives d’ingénierie sous-tendent chaque cycle de la boucle ci-dessus.

  • Isolation des espaces de travail. Un arbre de travail git par candidat. Les forks partagent une base de données d’objets, mais jamais leurs fichiers. Les candidats peuvent ainsi s’exécuter en parallèle avec un coût disque presque constant, et la comparaison avec la version de pointe actuelle devient triviale.

  • Bac à sable d’exécution. Deux modes selon la configuration : sous-processus natif pour une itération rapide ou environnement d’exécution entièrement isolé. Les corpus sont montés en lecture seule et le répertoire temporaire de chaque essai est supprimé après l’évaluation. Ainsi, un essai ne peut ni modifier le jeu de données ni transmettre son état au suivant.

  • Politique de périmètre. Une liste blanche de chemins déclarée dans la configuration de l’expérience. Toute modification extérieure est annulée avant l’évaluation de l’essai, qui est alors signalé. Le diff présenté à l’examinateur reste donc nécessairement dans le périmètre déclaré.

  • Application des budgets. Trois niveaux : plafonds de tokens et de temps réel par essai, plafond cumulé par exécution et limite de concurrence. Ensemble, ils rendent les dépenses prévisibles et maintiennent le harnais dans les limites de débit du modèle et de l’infrastructure.

  • Référentiel de preuves. Un fichier JSONL en ajout seul contenant le correctif de code, les scores par partition, le journal d’événements et les quatre analyses rédigées par un LLM. Les vues matérialisées (classement, version de pointe, index des échecs) sont régénérées après chaque essai. Les cycles suivants peuvent ainsi s’appuyer sur l’historique, tandis que chaque exécution reste reproductible à l’octet près.

Aucune de ces primitives n’est facultative. Le harnais doit fournir à l’examinateur, en fin d’exécution, un résultat qu’il puisse réellement approuver : un candidat gagnant, un diff délimité, un relevé complet des essais et un coût connu. Retirez l’une des cinq et l’une de ces garanties disparaît.

Reclassement prédictif des hypothèses

Les trois expériences utilisent la même stratégie d’hypothèses. À chaque itération, le générateur de propositions produit plus d’hypothèses que le budget ne permet d’en exécuter : M = 8 candidats pour un budget d’envoi de K = 4. Un LLM de classement distinct ordonne ensuite les huit candidats en un seul appel de trente secondes, avec une vue d’ensemble complète : le meilleur score actuel et ses dimensions faibles, les analyses des échecs récents et les huit propositions côte à côte. Les quatre premiers sont envoyés à l’exécuteur, pour un coût de 15 à 30 minutes chacun. Les quatre autres sont éliminés avant d’engager la moindre dépense.

Évaluations

Les modèles sous-jacents sont restés inchangés pendant toute l’expérience ; le harnais n’a modifié que le code qui les entoure. Signal Engine et la recherche approfondie ont été exécutés sur gpt-5.5. La recherche multimodale agentique utilisait le modèle à poids ouverts Qwen3.6-35B-A3B, servi localement via vLLM et associé au moteur de recherche d’images ColQwen3-4B, une combinaison choisie pour son coût prévisible sur site.

Le graphique ci-dessous montre l’évolution des scores pour nos trois tâches principales. « Version initiale » désigne le code de départ écrit par un ingénieur. « Meta-Harness » désigne la meilleure version trouvée par Meta-Harness. Nous constatons une amélioration des performances pour les trois tâches sur le jeu de test réservé.

Graphique à barres comparant les performances de la version initiale et de Meta-Harness sur Signal Engine, la recherche multimodale agentique et la recherche approfondie, Meta-Harness étant supérieur sur tous les tests réservés.

Signal Engine a été évalué par un LLM juge selon l’actualité, l’exactitude factuelle, la granularité et le ton, à partir de 150 tweets d’entraînement et de 150 tweets de test réservés. Au fil de l’exécution, la meilleure version a fait passer le score composite d’entraînement de 0,431 à 0,756 et le score réservé de 0,456 à 0,841. Les gains provenaient de modifications du harnais lui-même, pas seulement d’ajustements des prompts : les itérations gagnantes ont appris à filtrer le bruit des réseaux sociaux, ajouté des étapes de recoupement des faits et exigé que chaque sortie s’appuie sur des preuves explicites. Le schéma ci-dessous illustre le processus d’itération.

Graphique linéaire des essais d’entraînement de Signal Engine montrant l’amélioration du meilleur score courant et des scores réservés, depuis la référence initiale jusqu’à la cible, au fil des tentatives itératives d’exploration et d’affinage.

L’historique des essais montre comment ces gains se sont accumulés. Une première modification structurelle a porté le meilleur score courant à 0,625 ; une gestion plus fine des preuves l’a élevé à 0,679 ; puis une boucle affinée de réflexion et de critères l’a hissé à 0,819. Environ la moitié des exécutions candidates ont obtenu de moins bons résultats ou ont complètement échoué, sans toutefois contaminer le classement : chaque fork s’exécutait de manière isolée, les diffs perdants étaient supprimés et les échecs consignés dans le référentiel de réflexion afin que le générateur de propositions suivant n’emprunte pas la même voie sans issue.

Surtout, la courbe réservée a progressé parallèlement à celle de l’entraînement pendant toute l’exécution. Cela suggère que le harnais améliorait le workflow au lieu de mémoriser le corpus d’entraînement. Les scores réservés étaient légèrement supérieurs à ceux de l’entraînement, ce que nous interprétons comme un bruit d’échantillonnage normal entre deux petites partitions distinctes.

La recherche multimodale agentique est mesurée avec NDCG@10 sur la partition publique Computer Science de ViDoRe V3, organisée en 20 requêtes d’entraînement, 10 de développement et 20 de test réservées. Le harnais a fait passer le NDCG@10 réservé de 0,705 à 0,744, tout en réduisant le temps réel total de l’évaluation de 869 secondes à 54 secondes.

La recherche approfondie est notée selon un score composite évalué par un LLM, combinant qualité du fond et qualité des références, conformément à DeepResearch-Eval, sur 10 questions de référence. Le code amélioré a fait passer la moyenne de 0,449 à 0,802. Les modifications gagnantes étaient faciles à identifier dans le diff : une étape de planification initiale comparant les approches avant l’envoi des agents de recherche, et une étape de revue finale ciblant les dimensions dans lesquelles les rapports avaient historiquement obtenu de mauvais résultats. Ce jeu étant petit et coûteux à évaluer, nous ne l’avons pas partitionné et considérons le résultat comme limité à l’échantillon.

Comparaison avec CORAL et karpathy/autoresearch

Graphiques à barres comparant Meta-Harness, CORAL et karpathy/autoresearch selon les scores de Signal Engine, de la recherche multimodale agentique et de la recherche approfondie, ainsi que la latence d’évaluation.

Nous avons comparé les trois méthodes avec le même budget : mêmes jeux de données, mêmes modèles sous-jacents, même plafond d’itérations et même nombre total d’évaluations de candidats. Sur Signal Engine, Meta-Harness atteint 0,841 sur le test réservé, tandis que les deux méthodes de référence restent sous 0,50. Sur la recherche multimodale agentique, notre équipe obtient le meilleur NDCG@10 réservé (0,744, contre 0,700 pour CORAL et 0,738 pour karpathy) et exécute l’évaluation officielle douze à quatorze fois plus vite : 54 s contre 786 s et 650 s. Sur la recherche approfondie, notre équipe atteint 0,802, tandis que les deux méthodes de référence restent proches de 0,52. Une réserve s’applique à l’ensemble : nous avons réimplémenté CORAL et karpathy/autoresearch à partir de leurs descriptions publiées. Une partie de l’écart peut donc provenir de différences d’implémentation, et pas seulement de méthode.

Quatre choix de conception expliquent cet écart. Premièrement, notre équipe génère une spécification de conception structurée avant toute modification du code, ce qui favorise les changements structurels, tels que de nouvelles étapes de pipeline, plutôt que de simples ajustements des prompts. Deuxièmement, elle exécute des forks simultanés ancrés sur un candidat de pointe partagé : les améliorations s’accumulent ainsi plus vite qu’avec les agents indépendants de CORAL ou la boucle strictement séquentielle de karpathy. Troisièmement, chaque essai produit des artefacts structurés (scores, journaux d’événements et quatre analyses rédigées par un LLM) que le générateur de propositions suivant relit, alors que les méthodes de référence ne conservent que de simples journaux de tentatives. Quatrièmement, un contrôleur adaptatif pousse le générateur de propositions vers l’exploration après une stagnation et vers l’affinage après un succès, tandis que le reclassement prédictif des hypothèses élimine en amont les idées faibles avant qu’elles ne consomment le budget.

Ce que nous n’avons pas démontré

Les courbes réservées démontrent une généralisation dans le domaine, et non un transfert entre domaines : un workflow optimisé pour extraire des signaux du marché de l’IA ne devrait pas être efficace sur des textes juridiques ou biomédicaux sans réexécuter le harnais. Le harnais ne gravit en outre que la pente définie par l’évaluateur : un jeu d’entraînement bruité ou un juge mal calibré entraînera fidèlement un surajustement. Avant une exécution sérieuse, nous recommandons au moins 20 éléments d’entraînement soigneusement sélectionnés et une partition de développement distincte. Le coût constitue la principale contrainte pratique. Chaque évaluation réexécute l’intégralité du pipeline sur toutes les partitions. Le seul candidat de recherche sélectionné a consommé environ 2,2 millions de tokens d’entrée, et une optimisation sérieuse sur un modèle de classe gpt-5.5 coûte de quelques centaines à un peu plus de mille dollars par tâche. Enfin, ces chiffres proviennent d’exécutions uniques plutôt que d’essais répétés ; c’est pourquoi nous les publions dans un article de blog technique et non dans une étude formelle.

Conclusion

Meta-Harness montre que l’amélioration autonome du code peut être suffisamment rigoureuse pour une utilisation en entreprise. Les ingrédients sont des hypothèses structurelles, un préfiltrage prédictif, une évaluation isolée, des tests sur données réservées lorsque celles-ci le permettent et une piste d’audit complète pour chaque modification promue. Ensemble, ils offrent à l’équipe d’ingénierie un parcours prévisible, d’un pipeline initial fonctionnel à un pipeline sensiblement meilleur. Ils fournissent aussi au responsable des opérations un modèle simple : les avantages de l’exploration autonome, encadrés par un cadre strict tenant compte du budget, avec une intervention humaine avant tout déploiement.

Auteurs

David Huang, Bjorn Jee