Les systèmes actuels d’amélioration autonome ont obtenu d’excellents résultats pour les tâches de programmation, mais on ignore encore s’ils peuvent améliorer les flux de travail d’IA complexes et de longue durée qui ressemblent aux déploiements réels en entreprise.
Nos travaux de recherche sur Meta-Harness appliquent l’autoamélioration autonome aux flux de récupération agentique, de recherche approfondie et de renseignement sur les signaux, tout en ajoutant des exigences d’entreprise comme l’évaluation sur des données réservées, l’auditabilité, les contrôles budgétaires et l’approbation humaine.
Pour trois charges de travail représentatives, Meta-Harness a nettement amélioré les performances, notamment avec une amélioration de 84 % aux tests sur données réservées pour Signal Engine et une précision accrue accompagnée d’une exécution 16 fois plus rapide pour la récupération multimodale agentique.
Contrairement à la plupart des approches antérieures, Meta-Harness mesure autant que possible la réussite sur des jeux de données réservés afin de déterminer si les améliorations se généralisent au-delà des données utilisées pendant l’optimisation.
Ces résultats indiquent que l’amélioration autonome des flux de travail peut dépasser les bancs d’essai de programmation et s’appliquer aux systèmes d’IA d’entreprise réels, ouvrant une voie pratique vers l’amélioration continue des applications d’IA.
De récents travaux sur la recherche autonome en IA, dont l’article sur Meta-Harness, le cadre CORAL et karpathy/autoresearch, ont montré que des agents de programmation peuvent améliorer une solution de façon itérative à partir d’une mesure d’évaluation. Il reste à déterminer si ces méthodes conviennent aux flux de travail d’IA de longue durée, comme la récupération multimodale agentique, où un agent doit effectuer des recherches itératives dans des corpus multimodaux spécialisés pour répondre à une question, ou aux pipelines complexes de traitement de données exigeant de nombreuses étapes interdépendantes, des appels d’outils et des décisions de gestion des exceptions. La question fondamentale est de savoir si les gains se maintiennent sur des données que l’optimiseur ne voit jamais.
Nos travaux de R-D sur Meta-Harness répondent à cette question. Ils reprennent des idées issues de recherches récentes et les adaptent aux besoins des entreprises : évaluation sur données réservées, pistes d’audit, plafonds de coûts et transfert clair à un évaluateur humain avant tout déploiement.
Nous l’avons testé sur trois tâches de longue durée inspirées de mandats réels de clients. Signal Engine surveille un flux en direct de publications sur X au sujet du marché de l’IA et produit des rapports de tendances structurés et bien documentés. La récupération multimodale agentique raisonne à partir de requêtes combinant texte et images afin de retourner les pages de documents les plus pertinentes. La recherche approfondie orchestre plusieurs agents pour parcourir le Web, recouper les sources et rédiger des rapports de recherche détaillés.
Signal Engine : score composite au test réservé de 0,456 → 0,841, soit une hausse relative de 84 %. CORAL et karpathy/autoresearch sont demeurés sous 0,50 avec le même budget.
Récupération multimodale agentique : NDCG@10 réservé de 0,705 → 0,744, tandis que le temps réel par évaluation est passé de 869 s à 54 s. Cela représente une accélération de 16× avec une précision accrue.
Recherche approfondie : score composite de qualité des rapports de 0,449 → 0,802 pour 10 questions de référence, contre environ 0,52 pour les méthodes de référence. Cette tâche n’avait aucune partition réservée; nous considérons donc ce résultat comme étant uniquement dans l’échantillon.
Efficacité de la recherche : grâce au reclassement prédictif des hypothèses, Signal Engine a atteint 91 % du meilleur score de l’exécution de référence en 3 itérations plutôt qu’en 20, avec le même budget d’évaluation.
La plupart des systèmes de recherche autonome optimisent et évaluent sur le même jeu de données, ce qui empêche de déterminer si le résultat se généralise. Pour Signal Engine et la récupération multimodale agentique, nous imposons une séparation stricte : un ensemble d’entraînement sur lequel les candidats peuvent être évalués, un ensemble de développement pour les contrôles de cohérence et un ensemble de test réservé que l’optimiseur ne voit jamais. Chaque résultat présenté provient d’une version précise du code évaluée sur toutes les partitions; nous ne combinons donc jamais le meilleur score d’entraînement d’un candidat avec le meilleur score de test d’un autre.
À chaque cycle, le harnais génère un lot d’hypothèses structurées pour modifier le code. Chaque hypothèse précise le mécanisme à modifier, la version antérieure sur laquelle elle s’appuie et le mode de défaillance qu’elle cible. Une étape de classement filtre le lot avant d’engager des évaluations coûteuses. Les hypothèses retenues sont confiées à des agents d’exécution parallèles qui partagent une base de connaissances commune, mais modifient le code dans des espaces de travail entièrement isolés, afin que chaque candidat soit évalué équitablement et indépendamment. À la fin du cycle, le système d’exécution désigne un gagnant : le candidat ayant obtenu le meilleur score parmi ceux qui ont aussi réussi toutes les vérifications sur les partitions visibles. Ce gagnant devient la version de pointe sur laquelle s’appuie le cycle suivant. Chaque essai écrit un ensemble fixe dans un référentiel de preuves à ajout seulement : son correctif de code, ses scores par partition, un journal d’événements et quatre brèves analyses rédigées par un LLM sur sa trace, ses erreurs, son coût et une réflexion. Le générateur de propositions du cycle suivant relit cet historique; le harnais peut ainsi tirer parti de ses apprentissages au lieu de reprendre les mêmes pistes sans issue.


Trois mesures de protection assurent l’exécution sécuritaire de la boucle. Une politique de portée limite les fichiers qu’un candidat peut modifier et annule tout changement hors de cette portée. Les budgets de tokens et de temps réel interrompent l’exécution dès que les dépenses dépassent un plafond, tandis que les limites de concurrence maintiennent le harnais dans les limites de débit du modèle et des processeurs graphiques. De plus, le harnais ne déploie jamais rien lui-même. Il produit un candidat classé et entièrement documenté; un ingénieur examine les différences et décide de sa mise en production.
Dans une pile locale, cinq composants techniques fondamentaux sous-tendent chaque cycle de la boucle ci-dessus.
Isolation des espaces de travail. Une arborescence de travail git par candidat. Les forks partagent une base de données d’objets, mais jamais leurs fichiers. Les candidats peuvent ainsi s’exécuter en parallèle avec un coût de stockage presque constant, et la comparaison avec la version de pointe actuelle devient triviale.
Bac à sable d’exécution. Deux modes configurables : un sous-processus natif pour itérer rapidement ou un environnement d’exécution entièrement isolé. Les corpus sont montés en lecture seule, et le répertoire de travail temporaire de chaque essai est supprimé après l’évaluation. Ainsi, un essai ne peut ni modifier le jeu de données ni transmettre son état au suivant.
Politique de portée. Une liste de chemins autorisés définie dans la configuration de l’expérience. Tout changement effectué à l’extérieur de cette liste est annulé avant l’évaluation de l’essai, qui est alors signalé. Par conséquent, les différences présentées à l’évaluateur demeurent assurément dans la portée déclarée.
Application des budgets. Trois niveaux : des plafonds de tokens et de temps réel par essai, un plafond global par exécution et une limite de concurrence. Ensemble, ils rendent les dépenses prévisibles et assurent que le harnais respecte les limites de débit du modèle et de l’infrastructure.
Référentiel de preuves. Un fichier JSONL à ajout seulement contenant le correctif de code, les scores par partition, le journal d’événements et les quatre analyses rédigées par un LLM. Les vues matérialisées — classement, version de pointe et index des échecs — sont régénérées après chaque essai. Les cycles suivants peuvent ainsi s’appuyer sur l’historique, tandis que chaque exécution demeure reproductible à l’octet près.
Aucun de ces composants fondamentaux n’est facultatif. Le harnais vise à fournir à l’évaluateur, au terme d’une exécution, quelque chose qu’il peut réellement approuver : un candidat gagnant, des différences délimitées, un dossier complet des essais et un coût connu. Retirez l’un des cinq, et l’une de ces garanties disparaît.
Les trois expériences utilisent la même stratégie d’hypothèses. À chaque itération, le générateur de propositions produit plus d’hypothèses que le budget ne permet d’en exécuter : M = 8 candidats pour un budget de répartition de K = 4. Un LLM de classement ordonne ensuite les huit candidats en un seul appel de trente secondes, avec une vue d’ensemble complète : le meilleur score actuel et ses dimensions faibles, les analyses des échecs récents et les huit propositions côte à côte. Les quatre premiers sont confiés au système d’exécution, au coût de 15 à 30 minutes chacun. Les quatre autres sont écartés avant d’engager la moindre dépense.
Les modèles sous-jacents sont demeurés inchangés tout au long des expériences; le harnais n’a modifié que le code qui les entoure. Signal Engine et la recherche approfondie ont utilisé gpt-5.5. La récupération multimodale agentique a utilisé le modèle à poids ouverts Qwen3.6-35B-A3B, servi localement par vLLM et jumelé au système de récupération d’images ColQwen3-4B, une combinaison choisie pour son coût prévisible sur place.
Le graphique ci-dessous montre l’évolution des scores pour nos trois principales tâches. « Version initiale » désigne le code de départ rédigé par un ingénieur. « Meta-Harness » désigne la meilleure version trouvée par Meta-Harness. Nous observons une amélioration des performances pour les trois tâches dans l’ensemble de test réservé.


Signal Engine a été évalué par un LLM juge selon l’actualité, l’exactitude factuelle, la granularité et le ton, à partir de 150 publication sur X pour ’entraînement et de 150 publications sur X réservées aux tests. Au cours de l’exécution, la meilleure version a fait passer le score composite d’entraînement de 0,431 à 0,756 et le score réservé de 0,456 à 0,841. Les gains provenaient de changements apportés au harnais lui-même, et non de simples ajustements d’invites : les itérations gagnantes ont appris à filtrer le bruit des médias sociaux, ajouté des étapes de recoupement des faits et exigé que chaque résultat s’appuie sur des preuves explicites. Le schéma ci-dessous illustre le processus d’itération.


L’historique des essais montre comment ces gains se sont accumulés. Une première modification structurelle a porté le meilleur score courant à 0,625; une gestion plus fine des preuves l’a fait passer à 0,679; puis une boucle améliorée de réflexion et de critères l’a élevé à 0,819. Environ la moitié des exécutions candidates ont obtenu de moins bons résultats ou ont carrément échoué, mais elles n’ont pas contaminé le classement : chaque fork s’exécutait de façon isolée, les différences perdantes étaient supprimées et les échecs étaient consignés dans le référentiel de réflexion afin que le générateur suivant ne reprenne pas la même piste sans issue.
Surtout, la courbe des données réservées a progressé parallèlement à celle des données d’entraînement tout au long de l’exécution. Cela indique que le harnais améliorait le flux de travail plutôt que de mémoriser le corpus d’entraînement. Les scores réservés étaient légèrement supérieurs aux scores d’entraînement, ce que nous interprétons comme un bruit d’échantillonnage normal entre deux petites partitions distinctes.
La récupération multimodale agentique est mesurée au moyen de NDCG@10 sur la partition publique d’informatique de ViDoRe V3, organisée en 20 requêtes d’entraînement, 10 de développement et 20 de test réservées. Le harnais a fait passer le NDCG@10 réservé de 0,705 à 0,744, tout en réduisant le temps réel total d’évaluation de 869 secondes à 54 secondes.
La recherche approfondie est évaluée, suivant DeepResearch-Eval, au moyen d’un score composite attribué par un LLM juge selon la qualité du contenu et des références, pour 10 questions de référence. Le code amélioré a fait passer la moyenne de 0,449 à 0,802. Les modifications gagnantes étaient faciles à repérer dans les différences : une étape de planification initiale comparant les approches avant de déployer les agents de recherche, et une étape finale d’examen ciblant les dimensions pour lesquelles les rapports avaient historiquement obtenu de faibles scores. Comme cet ensemble est petit et coûteux à évaluer, nous ne l’avons pas partitionné et considérons le résultat comme étant dans l’échantillon.


Nous avons comparé les trois méthodes avec le même budget : mêmes jeux de données, mêmes modèles sous-jacents, même limite d’itérations et même nombre total d’évaluations de candidats. Pour Signal Engine, Meta-Harness atteint 0,841 au test réservé, tandis que les deux méthodes de référence sont demeurées sous 0,50. Pour la récupération multimodale agentique, notre équipe obtient le meilleur NDCG@10 réservé (0,744, contre 0,700 pour CORAL et 0,738 pour karpathy) et exécute l’évaluation officielle de douze à quatorze fois plus rapidement : 54 s contre 786 s et 650 s. Pour la recherche approfondie, notre équipe atteint 0,802, tandis que les deux méthodes de référence sont demeurées près de 0,52. Une réserve s’applique à tous les résultats : nous avons réimplémenté CORAL et karpathy/autoresearch à partir de leurs descriptions publiées; une partie de l’écart pourrait donc provenir des différences de mise en œuvre plutôt que des seules différences de méthode.
Quatre choix de conception expliquent cet écart. Premièrement, notre équipe produit une spécification de conception structurée avant toute modification du code, ce qui favorise les changements structurels, comme l’ajout d’étapes au pipeline, plutôt que les ajustements d’invites. Deuxièmement, elle exécute des forks simultanés ancrés à un candidat de pointe commun, de sorte que les améliorations s’accumulent plus rapidement qu’avec les agents indépendants de CORAL ou la boucle strictement séquentielle de karpathy. Troisièmement, chaque essai produit des artefacts structurés — scores, journaux d’événements et quatre analyses rédigées par un LLM — que relit le générateur suivant, alors que les méthodes de référence ne conservent que de simples journaux de tentatives. Quatrièmement, un contrôleur adaptatif pousse le générateur vers l’exploration après une période de stagnation et vers l’amélioration après une réussite, tandis que le reclassement prédictif des hypothèses élimine les idées faibles avant qu’elles ne dépensent le budget.
Les courbes sur données réservées démontrent une généralisation dans le domaine, et non un transfert entre domaines : on ne devrait pas s’attendre à ce qu’un flux de travail optimisé pour extraire des signaux sur le marché de l’IA fonctionne sur des textes juridiques ou biomédicaux sans réexécuter le harnais. Le harnais ne gravit également que la pente définie par l’évaluateur : un ensemble d’entraînement bruité ou un juge mal étalonné entraînera fidèlement un surajustement. Nous recommandons au moins 20 éléments d’entraînement soigneusement sélectionnés et une partition de développement distincte avant une exécution sérieuse. Le coût constitue la principale contrainte pratique. Chaque évaluation réexécute l’ensemble du pipeline sur toutes les partitions; le candidat de récupération sélectionné a consommé à lui seul environ 2,2 millions de tokens d’entrée, et une optimisation sérieuse sur un modèle de la catégorie de gpt-5.5 coûte de quelques centaines à quelques milliers de dollars par tâche. Enfin, ces chiffres proviennent d’exécutions uniques plutôt que d’essais répétés; c’est pourquoi nous les présentons dans un billet de blogue technique plutôt que dans une étude formelle.
Meta-Harness montre que l’amélioration autonome du code peut être suffisamment rigoureuse pour une utilisation en entreprise. Les éléments clés sont des hypothèses structurelles, un préfiltrage prédictif, une évaluation isolée, des tests sur données réservées lorsque les données le permettent et une piste d’audit complète pour chaque changement retenu. Ensemble, ils offrent à une équipe technique une démarche prévisible pour transformer un pipeline initial fonctionnel en un pipeline mesurablement meilleur. Ils fournissent aussi au responsable des opérations un modèle simple : les avantages de l’exploration autonome, maintenus dans un cadre strict et soucieux du budget, avec une intervention humaine avant tout déploiement.