Meta-Harness: fluxos d'IA empresarial segurs i automillorables

Un metaentorn rigorós ajuda els equips empresarials a millorar amb seguretat els fluxos de treball dels agents en tasques de programació de llarg abast.

Resum executiu

  • Els sistemes actuals de millora autònoma han obtingut resultats sòlids en tasques de programació, però encara no és clar si poden millorar fluxos de treball d'IA complexos i de llarg abast semblants als desplegaments empresarials reals.

  • La nostra recerca sobre Meta-Harness aplica l'automillora autònoma als fluxos de recuperació agentiva, recerca profunda i intel·ligència de senyals, a la vegada que incorpora requisits empresarials com l'avaluació reservada, l'auditabilitat, els controls pressupostaris i l'aprovació humana.

  • En tres càrregues de treball representatives, Meta-Harness va millorar substancialment el rendiment, amb una millora del 84% en les proves reservades de Signal Engine i més precisió amb una execució 16 vegades més ràpida en Recuperació multimodal agentiva.

  • A diferència de la majoria d'enfocaments anteriors, Meta-Harness mesura l'èxit amb conjunts de dades reservats sempre que és possible, per comprovar si les millores es generalitzen més enllà de les dades emprades durant l'optimització.

  • Aquests resultats indiquen que la millora autònoma dels fluxos de treball pot anar més enllà dels bancs de proves de programació i aplicar-se a sistemes empresarials d'IA reals, cosa que ofereix una via pràctica per millorar contínuament les aplicacions d'IA.

La recerca recent sobre investigació autònoma amb IA, incloent-hi l'article de Meta-Harness, l'entorn de treball CORAL i karpathy/autoresearch, ha demostrat que els agents de programació poden millorar iterativament una solució a partir d'una mètrica d'avaluació. La qüestió pendent és si aquests mètodes funcionen en fluxos de treball d'IA de llarg abast, com ara la recuperació multimodal agentiva, en què un agent ha de cercar iterativament en corpus especialitzats multimodals per respondre a una pregunta, o en processos complexos de tractament de dades que requereixen molts passos dependents, crides a eines i decisions sobre la gestió d'excepcions. La pregunta de fons és si els guanys es mantenen amb dades que l'optimitzador no ha vist mai.

La nostra recerca i desenvolupament de Meta-Harness és la resposta a aquesta pregunta. Recull idees de recerques recents i les adapta a les necessitats empresarials: avaluacions reservades, pistes d'auditoria, límits de costos i un punt clar de traspàs a un revisor humà abans de qualsevol desplegament.

El vam provar en tres tasques de llarg abast basades en projectes reals de clients. Signal Engine supervisa un flux en directe de publicacions d'X sobre el mercat de la IA i genera informes de tendències estructurats i ben documentats. Recuperació multimodal agentiva raona sobre consultes que combinen text i imatges per retornar les pàgines de documents més rellevants. Recerca profunda coordina diversos agents perquè cerquin al web, contrastin fonts i redactin informes de recerca extensos.

Resum dels resultats

  • Signal Engine: la puntuació composta de la prova reservada passa de 0,456 a 0,841, una millora relativa del 84%. CORAL i karpathy/autoresearch es van mantenir per sota de 0,50 amb el mateix pressupost.

  • Recuperació multimodal agentiva: l'NDCG@10 reservat passa de 0,705 a 0,744, mentre que el temps real per avaluació baixa de 869 s a 54 s. Això suposa una acceleració de 16 vegades amb més precisió.

  • Recerca profunda: la puntuació composta de qualitat dels informes passa de 0,449 a 0,802 en 10 preguntes de referència, davant d'aproximadament 0,52 per als sistemes de referència. Aquesta tasca no tenia cap partició reservada, així que considerem que la xifra només és vàlida dins de la mostra.

  • Eficiència de la cerca: amb la reclassificació predictiva d'hipòtesis, Signal Engine va assolir el 91% de la millor puntuació de l'execució de referència en 3 iteracions en comptes de 20, amb el mateix pressupost d'avaluació.

La majoria de sistemes de recerca autònoma optimitzen i avaluen amb el mateix conjunt de dades, fet que impedeix saber si el resultat es generalitza. Per a Signal Engine i Recuperació multimodal agentiva apliquem una divisió estricta: un conjunt d'entrenament amb què es poden puntuar els candidats, un conjunt de desenvolupament per a comprovacions de coherència i un conjunt de proves reservat que l'optimitzador no veu mai. Cada resultat publicat correspon a una versió concreta del codi puntuada en totes les particions; per tant, mai no combinem la millor puntuació d'entrenament d'un candidat amb la millor puntuació de prova d'un altre.

Com funciona

A cada ronda, l'entorn d'execució genera un lot d'hipòtesis estructurades per modificar el codi. Cada hipòtesi indica el mecanisme que vol canviar, la versió anterior en què es basa i el tipus d'error que pretén corregir. Un pas de classificació filtra el lot abans de destinar recursos a avaluacions costoses. Les hipòtesis seleccionades passen a agents executors en paral·lel que comparteixen una base de coneixement, però editen el codi en espais de treball totalment aïllats, de manera que cada candidat s'avalua de manera justa i independent. Al final de la ronda, l'executor promou un guanyador: el candidat amb més puntuació que també ha superat totes les comprovacions de les particions visibles. Aquest guanyador esdevé la base sobre la qual treballa la ronda següent. Cada prova desa un paquet fix en un repositori d'evidències només d'addició: el pedaç de codi, les puntuacions de cada partició, un registre d'esdeveniments i quatre anàlisis breus escrites per un LLM sobre la traça, els errors, el cost i una reflexió. El generador de propostes de la ronda següent torna a consultar aquest historial; així, l'entorn d'execució acumula el que ha après en lloc de repetir els mateixos camins sense sortida.

Diagrama del flux de treball de Meta-Harness amb les entrades, l'avaluació inicial, la cerca d'hipòtesis, els equips d'agents en paral·lel, un espai de treball d'avaluació, els resultats de la revisió, un repositori d'evidències i controls de seguretat i costos.

Tres mesures de protecció permeten executar el bucle amb seguretat. Una política d'abast limita els fitxers que pot modificar un candidat i reverteix qualsevol canvi que en quedi fora. Els pressupostos de segments i temps real aturen l'execució quan la despesa supera el límit, mentre que els límits de concurrència mantenen l'entorn d'execució dins les quotes del model i les GPU. A més, l'entorn d'execució no desplega mai res pel seu compte. Genera un candidat classificat i completament documentat; després, un enginyer humà revisa les diferències i decideix si es desplega en producció.

Aspectes interns

En una infraestructura local, cinc components bàsics d'enginyeria sustenten cada ronda del bucle anterior.

  • Aïllament dels espais de treball. Un arbre de treball de Git per candidat. Les bifurcacions comparteixen una base de dades d'objectes, però mai els fitxers de les altres. Això permet executar els candidats en paral·lel amb un cost de disc gairebé constant i facilita molt comparar-los amb el candidat de referència actual.

  • Entorn d'execució aïllat. Dos modes configurables: un subprocés natiu per iterar ràpidament o un entorn d'execució totalment aïllat. Els corpus es munten en mode de només lectura i el directori temporal de cada prova s'elimina després de l'avaluació. Per tant, una prova no pot modificar el conjunt de dades ni filtrar el seu estat a la següent.

  • Política d'abast. Una llista de rutes permeses declarada a la configuració de l'experiment. Qualsevol canvi que en quedi fora es reverteix abans d'avaluar la prova, que queda marcada. Així, es garanteix que les diferències que veu el revisor es mantenen dins de l'abast declarat.

  • Aplicació dels pressupostos. Tres nivells: límits de segments i temps real per prova, un màxim agregat per execució i un límit de concurrència. En conjunt, fan que la despesa continuï sent previsible i garanteixen que l'entorn d'execució respecti les quotes del model i de la infraestructura.

  • Repositori d'evidències. Un fitxer JSONL només d'addició amb el pedaç de codi, les puntuacions de cada partició, el registre d'esdeveniments i les quatre anàlisis escrites per un LLM. Les vistes materialitzades (classificació, candidat de referència i índex d'errors) es regeneren després de cada prova. Així, les rondes posteriors poden aprofitar l'historial i cada execució continua sent reproduïble byte per byte.

Cap d'aquests components no és opcional. L'objectiu de l'entorn d'execució és que, al final, el revisor disposi d'alguna cosa que realment pugui aprovar: un candidat guanyador, unes diferències delimitades, un registre complet de tot el que s'ha provat i un cost conegut. Si se n'elimina qualsevol dels cinc, desapareix una d'aquestes garanties.

Reclassificació predictiva d'hipòtesis

Els tres experiments utilitzen la mateixa estratègia d'hipòtesis. A cada iteració, el generador de propostes crea més hipòtesis de les que permet executar el pressupost: M = 8 candidats per a un pressupost d'enviament de K = 4. A continuació, un LLM classificador independent ordena els 8 candidats en una única crida de trenta segons, amb tota la informació disponible: la millor puntuació actual i els seus punts febles, les anàlisis dels errors de proves recents i les 8 propostes comparades. Els 4 primers passen a l'executor, amb un cost d'entre 15 i 30 minuts cadascun. Els altres 4 es descarten abans que consumeixin cap recurs.

Avaluacions

Els models subjacents es van mantenir fixos durant tot el procés; l'entorn d'execució només va editar el codi que els envoltava. Signal Engine i Recerca profunda es van executar amb gpt-5.5. La recuperació multimodal agentiva es va executar amb el model de pesos oberts Qwen3.6-35B-A3B, servit localment mitjançant vLLM i combinat amb el recuperador d'imatges ColQwen3-4B; es va triar aquesta combinació pel seu cost local previsible.

El gràfic següent mostra l'evolució de les puntuacions de les tres tasques principals. "Inicial" és el codi de partida escrit per un enginyer humà. "Meta-Harness" és la millor versió que va trobar Meta-Harness. Observem una millora del rendiment en el conjunt de proves reservat de les tres tasques.

Gràfic de barres que compara el rendiment inicial i el de Meta-Harness a Signal Engine, Recuperació multimodal agentiva i recerca profunda; Meta-Harness obté valors superiors en totes les proves reservades.

Signal Engine es va avaluar amb un LLM jutge segons l'actualitat, la veracitat, el grau de detall i el to, a partir de 150 tuits d'entrenament i 150 tuits de prova reservats. Durant l'execució, la millor versió va augmentar la puntuació composta d'entrenament de 0,431 a 0,756 i la puntuació reservada de 0,456 a 0,841. Els guanys van provenir de canvis en el mateix entorn d'execució, no només de retocs a les indicacions: les iteracions guanyadores van aprendre a filtrar el soroll de les xarxes socials, van afegir passos per contrastar els fets i van exigir que cada resultat es basés en proves explícites. El diagrama següent mostra el procés d'iteració.

Gràfic de línies de les proves d'entrenament de Signal Engine que mostra com les millors puntuacions acumulades i les reservades milloren des del valor inicial cap a l'objectiu mitjançant intents iteratius d'exploració i perfeccionament.

L'historial de proves mostra com es van acumular aquests guanys. Un primer canvi estructural va elevar el millor resultat acumulat a 0,625; un tractament més detallat de les evidències el va portar a 0,679; i un bucle perfeccionat de reflexió i criteris d'avaluació el va augmentar fins a 0,819. Aproximadament la meitat de les execucions candidates van rendir per sota del previst o van fallar completament, però no van contaminar la classificació: cada bifurcació s'executava aïllada, es descartaven les diferències perdedores i els errors s'escrivien al repositori de reflexions perquè el generador següent no repetís el mateix camí sense sortida.

El més important és que la corba reservada va augmentar al mateix temps que la corba d'entrenament durant tota l'execució. Això indica que l'entorn d'execució millorava el flux de treball en comptes de memoritzar el corpus d'entrenament. Les puntuacions reservades van ser lleugerament superiors a les d'entrenament, cosa que interpretem com el soroll de mostreig habitual entre dues particions petites i disjuntes.

Recuperació multimodal agèntica es mesura amb NDCG@10 a la partició pública d'informàtica ViDoRe V3, organitzada en 20 consultes d'entrenament, 10 de desenvolupament i 20 de prova reservades. L'entorn d'execució va augmentar l'NDCG@10 reservat de 0,705 a 0,744 i va reduir el temps real total d'avaluació de 869 segons a 54 segons.

Recerca profunda es puntua mitjançant una mètrica composta, avaluada per un LLM, que combina la qualitat del contingut i de les referències, seguint DeepResearch-Eval, en 10 preguntes de referència. El codi millorat va elevar la mitjana de 0,449 a 0,802. Els canvis guanyadors eren fàcils d'identificar en les diferències: un pas inicial de planificació que compara enfocaments abans d'assignar cap agent de recerca i un pas final de revisió centrat en els aspectes en què els informes havien obtingut puntuacions baixes. Com que aquest conjunt és petit i costós d'avaluar, no el vam dividir i considerem que el resultat només és vàlid dins de la mostra.

Comparació amb CORAL i karpathy/autoresearch

Gràfics de barres que comparen Meta-Harness, CORAL i karpathy/autoresearch segons les puntuacions de Signal Engine, Recuperació multimodal agentiva i recerca profunda, i la latència d'avaluació.

Vam comparar els tres mètodes amb el mateix pressupost: els mateixos conjunts de dades, els mateixos models subjacents, el mateix límit d'iteracions i el mateix nombre total d'avaluacions de candidats. En Signal Engine, Meta-Harness assoleix 0,841 en la prova reservada, mentre que els dos sistemes de referència es mantenen per sota de 0,50. En la recuperació multimodal agentiva, el nostre equip obté l'NDCG@10 reservat més alt (0,744, davant de 0,700 per a CORAL i 0,738 per a karpathy) i executa l'avaluació oficial entre dotze i catorze vegades més ràpid: 54 s davant de 786 s i 650 s. En la recerca profunda, el nostre equip assoleix 0,802, mentre que els dos sistemes de referència es mantenen prop de 0,52. Cal tenir present una limitació general: vam tornar a implementar CORAL i karpathy/autoresearch a partir de les descripcions publicades, de manera que part de la diferència podria deure's a les implementacions i no només als mètodes.

Quatre decisions de disseny expliquen aquesta diferència. En primer lloc, el nostre equip genera una especificació de disseny estructurada abans d'editar el codi, fet que afavoreix canvis estructurals, com ara noves etapes del procés, en comptes de simples retocs a les indicacions. En segon lloc, executa bifurcacions simultànies basades en un candidat de referència compartit, de manera que les millores s'acumulen més ràpidament que amb els agents independents de CORAL o el bucle estrictament seqüencial de karpathy. En tercer lloc, cada prova deixa artefactes estructurats (puntuacions, registres d'esdeveniments i quatre anàlisis escrites per un LLM) que consulta el generador de propostes següent, mentre que els sistemes de referència només conserven registres plans dels intents. En quart lloc, un controlador adaptatiu orienta el generador cap a l'exploració després d'un estancament i cap al perfeccionament després d'un èxit. A més, la reclassificació predictiva d'hipòtesis descarta les idees febles abans que consumeixin pressupost.

El que no hem demostrat

Les corbes reservades demostren generalització dins del domini, no transferència entre dominis: no es pot esperar que un flux de treball ajustat per extreure senyals del mercat de la IA funcioni igual de bé amb textos jurídics o biomèdics sense tornar a executar l'entorn d'execució. L'entorn d'execució només optimitza el que defineix l'avaluador; per tant, s'adaptarà fidelment en excés a un conjunt d'entrenament sorollós o a un jutge mal calibrat. Recomanem almenys 20 elements d'entrenament ben seleccionats i una partició de desenvolupament independent abans d'una execució seriosa. El cost és la principal limitació pràctica. Cada avaluació torna a executar tot el procés amb totes les particions; només el candidat de recuperació seleccionat va consumir aproximadament 2,2 milions de segments d'entrada, i una optimització seriosa amb un model de la categoria de gpt-5.5 costa entre diversos centenars i poc més d'un miler de dòlars per tasca. Finalment, aquestes xifres provenen d'execucions úniques i no de proves repetides; per això les compartim en una entrada tècnica del blog i no en un estudi formal.

Conclusió

Meta-Harness demostra que la millora autònoma del codi es pot fer prou rigorosa per a l'ús empresarial. Els ingredients són hipòtesis estructurals, prefiltratge predictiu, avaluacions aïllades, proves reservades sempre que les dades ho permetin i una pista d'auditoria completa per a cada canvi promogut. En conjunt, ofereixen a l'equip d'enginyeria una via previsible per passar d'un procés inicial funcional a un de mesurablement millor, i proporcionen al responsable d'operacions un model senzill: els avantatges de l'exploració autònoma dins d'un marc estricte i conscient del pressupost, amb una persona que supervisa el procés abans de qualsevol desplegament.

Autors

David Huang i Bjorn Jee