Navigimi kryesor

Meta-Harness: fluks i sigurt, vetëpërsosës me IA për ndërmarrje

Një meta-strukturë e disiplinuar i ndihmon ekipet e ndërmarrjeve të përmirësojnë në mënyrë të sigurt flukset e agjentëve në detyra afatgjata programimi.

Përmbledhje ekzekutive

  • Sistemet ekzistuese të përmirësimit autonom kanë dhënë rezultate të forta në detyrat e programimit, por ende nuk është e qartë nëse mund të përmirësojnë flukse komplekse e afatgjata pune me IA, të ngjashme me zbatimet reale në ndërmarrje.

  • Kërkimi ynë mbi Meta-Harness e zbaton vetëpërmirësimin autonom në flukset e punës për rikthimin agjentik, kërkimin e thelluar dhe inteligjencën e sinjaleve, duke shtuar kërkesa të ndërmarrjeve si vlerësimi me të dhëna të veçuara, auditueshmëria, kontrollet buxhetore dhe miratimi njerëzor.

  • Në tri ngarkesa pune përfaqësuese, Meta-Harness e përmirësoi ndjeshëm performancën, përfshirë një përmirësim prej 84% në testin me të dhëna të veçuara për Motorin e sinjaleve dhe saktësi më të lartë me ekzekutim 16 herë më të shpejtë për Rikthimin multimodal agjentik.

  • Ndryshe nga shumica e qasjeve të mëparshme, Meta-Harness e mat suksesin me grupe të dhënash të veçuara sa herë që është e mundur, për të vlerësuar nëse përmirësimet përgjithësohen përtej të dhënave të përdorura gjatë optimizimit.

  • Këto rezultate tregojnë se përmirësimi autonom i fluksit të punës mund të shkojë përtej standardeve të programimit dhe të zbatohet në sisteme reale IA-je për ndërmarrje, duke ofruar një rrugë praktike drejt përmirësimit të vazhdueshëm të aplikacioneve me IA.

Puna e fundit mbi kërkimin autonom me IA, përfshirë studimin Meta-Harness, strukturën CORAL dhe karpathy/autoresearch, ka treguar se agjentët e programimit mund ta përmirësojnë në mënyrë përsëritëse një zgjidhje kur u jepet një metrikë vlerësimi. Mbetet ende e paqartë nëse këto metoda funksionojnë për flukse afatgjata pune me IA, si rikthimi multimodal agjentor, ku një agjent duhet të kërkojë në mënyrë përsëritëse nëpër korpuse multimodale të fushës për t’iu përgjigjur një pyetjeje ose për procese komplekse të përpunimit të të dhënave që kërkojnë shumë hapa të ndërvarur, thirrje mjetesh dhe vendime për trajtimin e përjashtimeve. Pyetja më e thellë është nëse përfitimet qëndrojnë edhe në të dhënat që optimizuesi nuk i sheh kurrë.

Kërkimi dhe zhvillimi ynë për Meta-Harness është përgjigjja jonë ndaj kësaj pyetjeje. Ai merr ide nga kërkimet e fundit dhe i përshtat me nevojat e ndërmarrjeve: vlerësim me të dhëna të veçuara, gjurmë auditimi, kufij kostosh dhe një pikë të qartë dorëzimi te shqyrtuesi njerëzor para se diçka të kalojë në prodhim.

E testuam në tri detyra afatgjata, të modeluara sipas punës reale me klientët. Motori i sinjaleve monitoron një rrjedhë të drejtpërdrejtë postimesh në X për tregun e IA-së dhe prodhon raporte të strukturuara tendencash, të mbështetura mirë me burime. Rikthimi multimodal agjentik arsyeton mbi pyetje të përziera me tekst dhe imazhe për të kthyer faqet më të rëndësishme të dokumenteve. Kërkimi i thelluar bashkërendon disa agjentë për të kërkuar në ueb, për të verifikuar burimet dhe për të shkruar raporte të gjata kërkimore.

Rezultatet me një vështrim

  • Motori i sinjaleve: rezultati i përbërë në testin me të dhëna të veçuara 0,456 → 0,841, një rritje relative prej 84%. CORAL dhe karpathy/autoresearch mbetën nën 0,50 me të njëjtin buxhet.

  • Rikthimi multimodal agjentik: NDCG@10 në testin e veçuar 0,705 → 0,744, ndërsa koha reale për vlerësim ra nga 869 s në 54 s. Kjo do të thotë shpejtësi 16 herë më e lartë, krahas saktësisë më të mirë.

  • Kërkimi i thelluar: rezultati i përbërë për cilësinë e raportit 0,449 → 0,802 në 10 pyetje referimi, kundrejt rreth 0,52 për bazat krahasuese. Kjo detyrë nuk kishte ndarje të veçuar, ndaj rezultatin e trajtojmë vetëm si brenda kampionit.

  • Efikasiteti i kërkimit: me Rirenditjen parashikuese të hipotezave, Motori i sinjaleve arriti 91% të rezultatit më të mirë të ekzekutimit referues në 3 përsëritje, në vend të 20, me të njëjtin buxhet vlerësimi.

Shumica e sistemeve autonome të kërkimit optimizojnë dhe vlerësojnë në të njëjtin grup të dhënash, çka e bën të pamundur të përcaktohet nëse rezultati përgjithësohet. Për Motorin i sinjaleve dhe Rikthimin multimodal agjentik zbatojmë një ndarje të rreptë: një grup trajnimi ku kandidatët mund të marrin rezultate, një grup zhvillimi për kontrolle logjike dhe një grup testimi të veçuar që optimizuesi nuk e sheh kurrë. Çdo rezultat i raportuar vjen nga një version i caktuar i kodit, i vlerësuar në çdo ndarje, ndaj nuk përziejmë kurrë rezultatin më të mirë të trajnimit të një kandidati me rezultatin më të mirë të testit të një tjetri.

Si funksionon

Në çdo raund, struktura krijon një grup hipotezash të strukturuara për ndryshimin e kodit. Çdo hipotezë përcakton mekanizmin që synon të ndryshojë, versionin e mëparshëm mbi të cilin mbështetet dhe llojin e dështimit që synon. Një hap renditjeje filtron grupin para se të shpenzohen burime për vlerësime të kushtueshme. Hipotezat e mbetura u kalojnë agjentëve punues paralelë, të cilët ndajnë një bazë të përbashkët njohurish, por e redaktojnë kodin brenda hapësirave të punës plotësisht të izoluara, që çdo kandidat të vlerësohet drejt dhe në mënyrë të pavarur. Në fund të raundit, sistemi përzgjedh një fitues: kandidatin me rezultatin më të lartë që ka kaluar edhe çdo kontroll në ndarjet e dukshme. Ky fitues bëhet baza avangardë mbi të cilën ndërtohet raundi tjetër. Çdo provë shkruan një paketë fikse në një depo provash vetëm për shtim: arnimin e kodit, rezultatet për çdo ndarje, regjistrin e ngjarjeve dhe katër analiza të shkurtra të shkruara nga LLM-ja mbi gjurmën, gabimet, kostot dhe reflektimin. Propozuesi i raundit vijues e rilexon këtë historik; kështu struktura ndërton mbi ato që ka mësuar, në vend që të përsëritë të njëjtat rrugë pa krye.

Diagrami i fluksit të punës së Meta-Harness që paraqet hyrjet, vlerësimin fillestar, kërkimin e hipotezave, ekipet paralele të agjentëve, hapësirën e punës për vlerësim, rezultatet e shqyrtimit, depon e provave dhe kontrollet e sigurisë e të kostos.

Tri masa mbrojtëse e bëjnë ciklin të sigurt për ekzekutim. Një politikë e fushëveprimit kufizon skedarët që mund të prekë kandidati dhe zhbën çdo ndryshim jashtë tij. Buxhetet e tokenëve dhe të kohës reale e ndalin ekzekutimin sapo shpenzimi kalon kufirin, ndërsa kufijtë e njëkohshmërisë e mbajnë strukturën brenda kufirit të normës së shpejtësisë së modelit dhe GPU-së. Dhe struktura nuk vendos kurrë asgjë vetë në prodhim. Ajo prodhon një kandidat të renditur dhe të dokumentuar plotësisht; një inxhinier shqyrton ndryshimet dhe vendos nëse kalon në prodhim.

Në prapaskenë

Në një arkitekturë lokale, çdo raund i ciklit të mësipërm mbështetet në pesë elemente bazë inxhinierike.

  • Izolimi i hapësirës së punës. Një git worktree për çdo kandidat. Bigëzimet ndajnë një bazë objektesh, por kurrë skedarët e njëri-tjetrit. Kjo u lejon kandidatëve të ekzekutohen paralelisht me kosto disku pothuajse konstante dhe e bën fare të thjeshtë krahasimin e ndryshimeve me versionin aktual avangardë.

  • Ekzekutimi në mjedisin e izoluar. Dy mënyra sipas konfigurimit: nënproces vendas për përsëritje të shpejta ose mjedis ekzekutimi plotësisht i izoluar. Korpuset montohen vetëm për lexim dhe drejtoria e përkohshme e çdo prove fshihet pas vlerësimit. Si rrjedhojë, një provë nuk mund të ndryshojë grupin e të dhënave dhe as të transferojë gjendjen te prova pasuese.

  • Politika e fushës së veprimit. Një listë shtigjesh të lejuara, të deklaruar në konfigurimin e eksperimentit. Çdo ndryshim jashtë saj zhbëhet para vlerësimit dhe prova shënohet për kontroll. Prandaj, ndryshimet që sheh shqyrtuesi garantohen se mbeten brenda fushëveprimit të deklaruar.

  • Zbatimi i kufijve buxhetorë. Tri shtresa: kufijtë e tokenëve dhe të kohës reale për çdo provë, kufiri i përgjithshëm për çdo ekzekutim dhe kufiri i njëkohshmërisë. Së bashku, ato e bëjnë shpenzimin të parashikueshëm dhe e mbajnë strukturën brenda kufirit të normës së shpejtësisë së modelit dhe infrastrukturës.

  • Depoja e provave. Një skedar JSONL vetëm për shtim, me arnimin e kodit, rezultatet për çdo ndarje, regjistrin e ngjarjeve dhe katër analizat e shkruara nga LLM-ja. Pamjet e materializuara (tabela e renditjes, versioni avangardë dhe indeksi i dështimeve) rigjenerohen pas çdo prove. Kështu, raundet pasuese ndërtojnë mbi historikun e mëparshëm, ndërsa çdo ekzekutim mbetet i riprodhueshëm bajt për bajt.

Asnjë prej këtyre elementeve bazë nuk është opsional. Qëllimi i strukturës është që, në fund të ekzekutimit, shqyrtuesi të ketë diçka që mund ta miratojë realisht: një kandidat fitues, ndryshime me kufij të qartë, dokumentimin e plotë të çdo prove dhe një kosto të njohur. Hiq cilindo nga të pestët dhe një prej këtyre garancive zhduket.

Rirenditja parashikuese e hipotezave

Të tri eksperimentet përdorin të njëjtën strategji hipotezash. Në çdo përsëritje, propozuesi krijon më shumë hipoteza sesa lejon buxheti të ekzekutohen: M = 8 kandidatë për një buxhet dërgimi prej K = 4. Më pas, një LLM i veçantë renditës i liston të tetë në një thirrje të vetme tridhjetësekondëshe, duke pasur pamjen e plotë: rezultatin më të mirë aktual dhe dimensionet e tij të dobëta, analizat e dështimeve nga provat e fundit dhe të tetë propozimet krah për krah. Katër më të mirët i kalojnë ekzekutuesit, me një kosto prej 15 deri në 30 minuta secili. Katër të tjerët hiqen para se të shpenzojnë ndonjë gjë.

Vlerësimet

Modelet bazë mbetën të pandryshuara gjatë gjithë procesit; struktura redaktoi vetëm kodin përreth tyre. Motori i sinjaleve dhe Kërkimi i thelluar u ekzekutuan në gpt-5.5. Rikthimi multimodal agjentik u ekzekutua në modelin me pesha të hapura Qwen3.6-35B-A3B, të shërbyer lokalisht përmes vLLM-së dhe të kombinuar me rikthyesin e imazheve ColQwen3-4B; ky kombinim u zgjodh për koston e parashikueshme në infrastrukturën e vetë organizatës.

Grafiku më poshtë tregon si ndryshuan rezultatet për tri detyrat tona kryesore. "Fillestar" është kodi fillestar i shkruar nga një inxhinier. "Meta-Harness" është versioni më i mirë që gjeti Meta-Harness. Në grupin e testit me të dhëna të veçuara shohim përmirësim të performancës në të tri detyrat.

Grafik me shtylla që krahason performancën e Seed dhe Meta-Harness në Motorin e sinjaleve, Rikthimin multimodal agjentik dhe Kërkimin e thelluar, ku Meta-Harness ka rezultate më të larta në të gjitha testet e mbajtura jashtë grupit të trajnimit.

Motori i sinjaleve u vlerësua nga një LLM-gjykues sipas aktualitetit, saktësisë faktike, hollësisë dhe tonit, duke përdorur 150 postime trajnimi në X dhe 150 postime testi të veçuara. Gjatë ekzekutimit, versioni më i mirë e rriti rezultatin e përbërë të trajnimit nga 0,431 në 0,756 dhe rezultatin e veçuar nga 0,456 në 0,841. Përfitimet erdhën nga ndryshimet në vetë strukturën, jo vetëm nga rregullimet e kërkesave: përsëritjet fituese mësuan të filtronin zhurmën e rrjeteve sociale, shtuan hapa për verifikimin e fakteve dhe kërkuan që çdo rezultat të mbështetej në prova të qarta. Diagrami më poshtë paraqet procesin e përsëritjes.

Grafiku linear i provave të trajnimit të Motorit të sinjaleve, që tregon përmirësimin e rezultatit më të mirë të deriatëhershëm dhe atij të veçuar, nga baza fillestare drejt objektivit, gjatë përpjekjeve përsëritëse të eksplorimit dhe të përpunimit.

Historiku i provave tregon si u grumbulluan këto përfitime. Një ndryshim i hershëm strukturor e ngriti rezultatin më të mirë të deriatëhershëm në 0,625; trajtimi më i imët i provave e çoi në 0,679; ndërsa një cikël i përmirësuar reflektimi dhe rubrike e ngriti në 0,819. Afërsisht gjysma e të gjitha ekzekutimeve të kandidatëve patën performancë më të dobët ose dështuan plotësisht, por nuk e ndotën tabelën e renditjes: çdo bigëzim u ekzekutua i izoluar, ndryshimet humbëse u hodhën poshtë dhe dështimet u shkruan në depon e reflektimeve, që propozuesi pasues të mos përsëriste të njëjtën rrugë pa krye.

Më e rëndësishmja, kurba e rezultateve të veçuara u rrit përkrah kurbës së trajnimit gjatë gjithë ekzekutimit. Kjo tregon se struktura po përmirësonte fluksin e punës, në vend që të memorizonte korpusin e trajnimit. Rezultatet e veçuara ishin pak më të larta se ato të trajnimit, gjë që e interpretojmë si zhurmë normale kampionimi mes dy ndarjeve të vogla dhe pa mbivendosje.

Rikthimi multimodal agjentik matet me NDCG@10 në ndarjen publike Shkenca kompjuterike të ViDoRe V3, të kuruar në 20 pyetje trajnimi, 10 zhvillimi dhe 20 pyetje testi të veçuara. Struktura e rriti NDCG@10 në të dhënat e veçuara nga 0,705 në 0,744, ndërsa e uli kohën reale të vlerësimit të plotë nga 869 sekonda në 54 sekonda.

Kërkimi i thelluar vlerësohet nga një LLM sipas një rezultati të përbërë për cilësinë thelbësore dhe cilësinë e referencave, duke ndjekur DeepResearch-Eval, në 10 pyetje referimi. Kodi i përmirësuar e ngriti mesataren nga 0,449 në 0,802. Ndryshimet fituese dalloheshin lehtë në diferencën e kodit: një hap planifikimi paraprak që krahason akses para dërgimit të agjentëve kërkimorë dhe një hap përfundimtar shqyrtimi, i përqendruar në dimensionet ku raportet kishin marrë më parë rezultate të dobëta. Meqë ky grup është i vogël dhe i kushtueshëm për t’u vlerësuar, nuk e ndamë dhe rezultatin e trajtojmë si brenda kampionit.

Krahasimi me CORAL dhe karpathy/autoresearch

Grafikë me shtylla që krahasojnë Meta-Harness, CORAL dhe karpathy/autoresearch sipas rezultateve në Motorin e sinjaleve, Rikthimin multimodal agjentik dhe Kërkimin e thelluar, si dhe sipas vonesës së vlerësimit.

I krahasuam të tri metodat me të njëjtin buxhet: të njëjtat grupe të dhënash, të njëjtat modele bazë, të njëjtin kufi përsëritjesh dhe të njëjtin numër të përgjithshëm vlerësimesh të kandidatëve. Në Motorin e sinjaleve, Meta-Harness arrin 0,841 në testin e veçuar, ndërsa të dyja bazat krahasuese mbetën nën 0,50. Në Rikthimin multimodal agjentik, ekipi ynë ka NDCG@10 më të lartë në testin e veçuar (0,744, kundrejt 0,700 për CORAL dhe 0,738 për karpathy) dhe e ekzekuton vlerësimin zyrtar 12 deri në 14 herë më shpejt: 54 s kundrejt 786 s dhe 650 s. Në Kërkimin e thelluar, ekipi ynë arrin 0,802, ndërsa të dyja bazat krahasuese mbetën pranë 0,52. Duhet pasur parasysh një kufizim: i rizbatuam CORAL dhe karpathy/autoresearch sipas përshkrimeve të tyre të publikuara, ndaj një pjesë e diferencës mund të vijë nga ndryshimet në zbatim dhe jo vetëm nga metodat.

Diferenca shpjegohet nga katër zgjedhje projektimi. Së pari, ekipi ynë krijon një specifikim të strukturuar projektimi para se të redaktohet kodi, çka e orienton drejt ndryshimeve strukturore, si faza të reja të procesit, dhe jo drejt rregullimeve të kërkesave. Së dyti, ai ekzekuton bigëzime njëkohësisht, të mbështetura në një kandidat të përbashkët avangardë, ndaj përmirësimet grumbullohen më shpejt sesa me agjentët e pavarur të CORAL-it ose ciklin rreptësisht vijues të karpathy-t. Së treti, çdo provë lë artefakte të strukturuara (rezultate, regjistra ngjarjesh dhe katër analiza të hartuara nga LLM-ja), të cilat propozuesi pasues i rilexon, ndërsa bazat krahasuese ruajnë vetëm regjistra të thjeshtë përpjekjesh. Së katërti, një kontrollues përshtatës e orienton propozuesin drejt eksplorimit pas një ngecjeje dhe drejt përpunimit pas një fitoreje, ndërsa Rirenditja Parashikuese e Hipotezave filtron idetë e dobëta para se të shpenzojnë buxhetin.

Çfarë nuk kemi treguar

Kurbat e të dhënave të veçuara tregojnë përgjithësim brenda fushës, jo transferim ndërmjet fushave: një fluks pune i përshtatur për nxjerrjen e sinjaleve të tregut të IA-së nuk pritet të funksionojë po aq mirë me tekste juridike ose biomjekësore pa e riekzekutuar strukturën. Struktura ngjitet vetëm në drejtimin që përcakton vlerësuesi, ndaj një grup trajnimi me zhurmë ose një gjykues i kalibruar keq do të mbipërshtatet me përpikëri; para një ekzekutimi serioz rekomandojmë të paktën 20 elemente trajnimi të kuruara mirë dhe një ndarje të veçantë zhvillimi. Kostoja është kufizimi më i madh praktik. Çdo vlerësim e riekzekuton të gjithë procesin në të gjitha ndarjet; vetëm kandidati i përzgjedhur për rikthim konsumoi rreth 2,2 milionë tokenë hyrës dhe një optimizim serioz në një model të klasës gpt-5.5 kushton nga disa qindra deri në pak mijëra dollarë për detyrë. Së fundi, këto shifra vijnë nga ekzekutime të vetme dhe jo nga prova të përsëritura, prandaj po i ndajmë në një artikull teknik blogu dhe jo si studim formal.

Përfundimi

Meta-Harness tregon se përmirësimi autonom i kodit mund të strukturohet dhe kontrollohet në një nivel të përshtatshëm për përdorim në ndërmarrje. Elementet kyçe janë hipotezat strukturore, filtrimi paraprak parashikues, vlerësimi i izoluar, testimi me të dhëna të mbajtura veç sa herë që të dhënat e lejojnë dhe një gjurmë e plotë audituese për çdo ndryshim të përzgjedhur. Së bashku, ato i japin ekipit inxhinierik një rrugë të parashikueshme nga një proces fillestar funksional te një proces dukshëm më i mirë, ndërsa drejtuesit të operacioneve i japin një model të thjeshtë: përfitimet e eksplorimit autonom, të mbajtura brenda një strukture të rreptë që merr parasysh buxhetin, me ndërhyrjen e një personi përpara se diçka të kalojë në prodhim.

Autorë

David Huang dhe Bjorn Jee