Olemasolevad autonoomse täiustamise süsteemid on näidanud häid tulemusi programmeerimisülesannetes, kuid pole selge, kas need suudavad parandada keerukaid ja pikaajalisi AI-töövooge, mis sarnanevad ettevõtete tegelike juurutustega.
Meie Meta-Harnessi teadustöö rakendab autonoomset enesetäiustamist agentsele otsingule, süvauuringule ja signaaliluure töövoogudele, lisades ettevõtete nõuded, nagu eraldatud hindamine, auditeeritavus, eelarvekontroll ja inimese heakskiit.
Meta-Harness parandas oluliselt kõigi kolme tüüpilise töökoormuse tulemusi. Signal Engine’i eraldatud testi tulemus paranes 84% ning agentne multimodaalne otsing saavutas suurema täpsuse ja 16 korda kiirema käituse.
Erinevalt enamikust varasematest lähenemistest mõõdab Meta-Harness võimaluse korral edu eraldatud andmestikel, et hinnata, kas täiustused üldistuvad ka optimeerimisel kasutamata andmetele.
Tulemused näitavad, et töövoogude autonoomne täiustamine võib ulatuda programmeerimise võrdlustest tegelike ettevõtte AI-süsteemideni ja pakkuda praktilist viisi AI-rakenduste pidevaks parandamiseks.
Hiljutised autonoomse AI-uurimistöö tulemused, sealhulgas artikkel Meta-Harness, raamistik CORAL ja karpathy/autoresearch, on näidanud, et programmeerimisagendid saavad hindamismõõdiku alusel lahendust iteratiivselt täiustada. Lahtiseks jääb küsimus, kas need meetodid sobivad ka pikaajaliste AI-töövoogude jaoks. Näiteks peab agent agentse multimodaalse otsingu puhul küsimusele vastamiseks korduvalt otsima multimodaalsetest valdkonnakorpustest, keerukad andmetöötluskonveierid aga nõuavad paljusid üksteisest sõltuvaid samme, tööriistakutseid ja erandite käsitlemise otsuseid. Põhiküsimus on, kas saavutatud edu püsib ka andmetel, mida optimeerija pole kunagi näinud.
Meie Meta-Harnessi teadus- ja arendustöö on sellele küsimusele vastus. See võtab aluseks hiljutise teadustöö ideed ja kohandab need ettevõtete vajadustele: eraldatud hindamine, auditijäljed, kululaed ning selge inimesele üleandmise hetk enne millegi juurutamist.
Testisime seda kolmel tegeliku klienditöö põhjal modelleeritud pikaajalisel ülesandel. Signal Engine jälgib AI-turgu käsitlevate X-i postituste reaalajavoogu ning koostab hästi allikastatud ja struktureeritud trendiaruandeid. Agentne multimodaalne otsing analüüsib teksti ja pilte ühendavaid päringuid, et tagastada kõige asjakohasemad dokumendilehed. Süvauuring juhib mitut agenti, et otsida veebist teavet, kontrollida allikaid ja koostada põhjalikke uurimisaruandeid.
Signal Engine: eraldatud testi koondtulemus 0,456 → 0,841, suhteline kasv 84%. CORAL ja karpathy/autoresearch jäid sama eelarvega alla 0,50.
Agentne multimodaalne otsing: eraldatud testi NDCG@10 0,705 → 0,744 ning ühe hindamise tegelik käitusaeg vähenes 869 sekundilt 54 sekundile. See tähendab 16-kordset kiirendust koos suurema täpsusega.
Süvauuring: aruande kvaliteedi koondtulemus 0,449 → 0,802 kümne võrdlusküsimuse põhjal; baasmeetodite tulemus oli ligikaudu 0,52. Sellel ülesandel polnud eraldatud andmejaotist, mistõttu käsitleme tulemust ainult valimisisese tulemusena.
Otsingu tõhusus: hüpoteeside ennustava ümberjärjestamise abil saavutas Signal Engine võrdluskäituse parimast tulemusest 91% kolme iteratsiooniga, mitte 20-ga, kasutades sama hindamiseelarvet.
Enamik autonoomseid uurimissüsteeme optimeerib ja hindab samal andmestikul, mistõttu pole võimalik kindlaks teha, kas tulemus üldistub. Signal Engine’i ja agentse multimodaalse otsingu puhul rakendame ranget jaotust: treeningkogum, mille põhjal kandidaadid saavad tulemusi arvutada, arenduskogum mõistlikkuse kontrolliks ning eraldatud testikogum, mida optimeerija kunagi ei näe. Iga esitatud tulemus pärineb ühest konkreetsest koodiversioonist, mida hinnati kõigis jaotistes. Nii ei ühenda me kunagi ühe kandidaadi parimat treeningtulemust teise kandidaadi parima testitulemusega.
Igas voorus loob täitmiskeskkond koodi muutmiseks hulga struktureeritud hüpoteese. Iga hüpotees nimetab mehhanismi, mida soovitakse muuta, varasema versiooni, millele see tugineb, ja tõrketüübi, mida see lahendab. Enne kulukate hindamiste alustamist filtreeritakse hüpoteesid järjestamise teel. Sõelale jäänud hüpoteesid edastatakse paralleelsetele tööagentidele, kes jagavad ühist teadmusbaasi, kuid muudavad koodi täielikult eraldatud tööjaamades. Nii hinnatakse iga kandidaati õiglaselt ja sõltumatult. Vooru lõpus valib käitaja ühe võitja: parima tulemusega kandidaadi, mis läbis ka kõik nähtavate andmejaotiste kontrollid. Sellest võitjast saab tipptase, millele järgmine voor tugineb. Iga katse kirjutab ainult lisatavasse tõendihoidlasse kindla kogumi: koodipaiga, jaotiste tulemused, sündmuselogi ning neli lühikest LLM-i (large language model, suur keelemudel) koostatud analüüsi jälje, vigade, kulu ja järelduste kohta. Järgmise vooru ettepanekute koostaja loeb selle ajaloo uuesti läbi. Nii saab täitmiskeskkond õpitut võimendada, selle asemel et samu ummikteid uuesti proovida.


Kolm kaitsemeedet tagavad tsükli ohutu käitamise. Ulatusreegel piirab faile, mida kandidaat võib muuta, ja tühistab kõik ulatusevälised muudatused. Tokenite ja tegeliku käitusaja eelarved peatavad protsessi ülempiiri ületamisel ning paralleelsuspiirangud hoiavad täitmiskeskkonna mudeli ja GPU päringusageduse piirides. Täitmiskeskkond ei juuruta kunagi ise midagi. See loob järjestatud ja täielikult dokumenteeritud kandidaadi, misjärel vaatab insener muudatuste erinevuse üle ning otsustab, kas see läheb tootmisse.
Kohalikus tehnoloogiapinus toetavad iga ülalkirjeldatud tsükli vooru viis tehnilist põhikomponenti.
Tööjaamade eraldamine. Iga kandidaadi jaoks eraldi Giti tööpuu. Harud jagavad objektide andmebaasi, kuid mitte üksteise faile. Seetõttu saab kandidaate käitada paralleelselt peaaegu muutumatu kettakuluga ja neid on lihtne praeguse tipptasemega võrrelda.
Käituse liivakast. Konfiguratsiooniga valitav kahe režiimiga lahendus: kiireks iteratsiooniks omasüsteemi alamprotsess või täielikult eraldatud käituskeskkond. Korpused ühendatakse kirjutuskaitstult ja iga katse ajutine kataloog kustutatakse pärast hindamist. Seetõttu ei saa katse andmestikku muuta ega olekut järgmisse katsesse lekitada.
Ulatusreegel. Katse konfiguratsioonis määratud lubatud asukohtade loend. Kõik loendivälised muudatused tühistatakse enne katse hindamist ja katse märgistatakse. Seega jääb ülevaatajale kuvatav erinevus kindlasti määratud ulatuse piiresse.
Eelarve jõustamine. Kolm tasandit: iga katse tokenite ja tegeliku käitusaja piirangud, käituse kogulimiit ning paralleelsuspiirang. Koos hoiavad need kulud prognoositavana ning täitmiskeskkonna mudeli ja taristu päringusageduse piirides.
Tõendihoidla. Ainult lisatav JSONL-fail, mis sisaldab koodipaika, jaotiste tulemusi, sündmuselogi ja nelja LLM-i koostatud analüüsi. Materialiseeritud vaated (edetabel, tipptase ja tõrkeindeks) luuakse pärast iga katset uuesti. Nii saavad järgmised voorud varasemale ajaloole tugineda, säilitades samal ajal iga käituse bait-baidilise reprodutseeritavuse.
Ükski neist põhikomponentidest pole valikuline. Täitmiskeskkonna eesmärk on anda ülevaatajale käituse lõpus midagi, mille saab päriselt heaks kiita: võitnud kandidaat, piiritletud muudatuste erinevus, täielik katsete ajalugu ja teadaolev kulu. Kui üks neist viiest eemaldada, kaob ka üks neist garantiidest.
Kõigis kolmes katses kasutatakse sama hüpoteesistrateegiat. Igas iteratsioonis loob ettepanekute koostaja rohkem hüpoteese, kui eelarve võimaldab käitada: M = 8 kandidaati, millest saab käitada K = 4. Eraldi LLM-järjestaja seab kõik kaheksa ühe 30-sekundilise kutsega pingeritta, võttes arvesse tervikpilti: praegust parimat tulemust ja selle nõrku mõõtmeid, hiljutiste katsete tõrkeanalüüse ning kõiki kaheksat ettepanekut kõrvuti. Neli parimat edastatakse täitjale, kus igaühe käitamine võtab 15–30 minutit. Ülejäänud neli jäetakse enne kulude tekkimist kõrvale.
Aluseks olevad mudelid jäid kogu protsessi vältel samaks; täitmiskeskkond muutis ainult neid ümbritsevat koodi. Signal Engine ja süvauuring töötasid mudelil gpt-5.5. Agentne multimodaalne otsing töötas avatud kaaludega mudelil Qwen3.6-35B-A3B, mida teenindati kohapeal vLLM-i kaudu ja kasutati koos pildiotsijaga ColQwen3-4B. See kombinatsioon valiti prognoositava kohapealse kulu tõttu.
Allolev diagramm näitab meie kolme põhiülesande tulemuste muutumist. „Algversioon” on inseneri kirjutatud lähtekood. „Meta-Harness” on parim versioon, mille Meta-Harness leidis. Kõigi kolme ülesande tulemused paranesid eraldatud testikogumis.


Signal Engine’it hindas LLM-kohtunik värskuse, faktilisuse, detailsuse ja tooni põhjal, kasutades 150 treeningpostitust ning 150 eraldatud testipostitust X-ist. Käituse jooksul parandas parim versioon treeningu koondtulemust tasemelt 0,431 tasemele 0,756 ja eraldatud testi tulemust tasemelt 0,456 tasemele 0,841. Edu tuli täitmiskeskkonna enda muudatustest, mitte ainult viipade kohandamisest: võitnud iteratsioonid õppisid sotsiaalmeedia müra filtreerima, lisasid faktide ristkontrolli etapid ja nõudsid, et iga väljund tugineks selgetele tõenditele. Allolev skeem näitab iteratsiooniprotsessi.


Katsete ajalugu näitab, kuidas täiustused kuhjusid. Varajane struktuurimuudatus tõstis senise parima tulemuse tasemele 0,625, tõendite üksikasjalikum käsitlus viis selle tasemele 0,679 ning täiustatud järeldus- ja hindamiskriteeriumide tsükkel tasemele 0,819. Ligikaudu pooled kandidaadikäitustest andsid halvema tulemuse või nurjusid täielikult, kuid ei rikkunud edetabelit: iga haru töötas eraldi, kaotanud muudatused jäeti kõrvale ja tõrked kirjutati järelduste hoidlasse, et järgmine ettepanekute koostaja sama ummikteed ei kordaks.
Kõige tähtsam on see, et eraldatud testi tulemuskõver tõusis kogu käituse vältel koos treeningkõveraga. See viitab sellele, et täitmiskeskkond parandas töövoogu, mitte ei jätnud treeningkorpust meelde. Eraldatud testi tulemused olid treeningtulemustest veidi paremad. Tõlgendame seda tavapärase valimimürana kahe väikese ja kattumatu jaotise vahel.
Agentset multimodaalset otsingut mõõdetakse NDCG@10 abil avaliku ViDoRe V3 arvutiteaduse jaotise põhjal, mis on kureeritud 20 treening-, 10 arendus- ja 20 eraldatud testpäringuks. Täitmiskeskkond tõstis eraldatud testi NDCG@10 tasemelt 0,705 tasemele 0,744, vähendades samal ajal hindamise tegelikku kogukäitusaega 869 sekundilt 54 sekundile.
Süvauuringut hinnatakse kümne võrdlusküsimuse põhjal sisulise kvaliteedi ja viidete kvaliteedi LLM-hinnangute koondtulemusena, järgides raamistikku DeepResearch-Eval. Täiustatud kood tõstis keskmise tulemuse tasemelt 0,449 tasemele 0,802. Võitnud muudatused olid erinevusest hõlpsasti nähtavad: algne plaanimisetapp, mis võrdleb lähenemisi enne uurimisagentide käivitamist, ja lõplik ülevaatus, mis keskendub mõõtmetele, kus aruanded olid varem saanud kehva tulemuse. Kuna selle kogumi hindamine on väiksuse tõttu kulukas, ei jaganud me seda osadeks ja käsitleme tulemust valimisisesena.


Võrdlesime kõiki kolme meetodit sama eelarvega: samad andmestikud, aluseks olevad mudelid, iteratsioonide ülempiir ja kandidaatide hindamiste koguarv. Signal Engine’i eraldatud testis saavutas Meta-Harness tulemuse 0,841, samas kui mõlemad baasmeetodid jäid alla 0,50. Agentse multimodaalse otsingu puhul saavutas meie meeskond parima eraldatud testi NDCG@10 tulemuse (0,744, võrreldes CORALi 0,700 ja karpathy 0,738-ga) ning läbis ametliku hindamise 12–14 korda kiiremini: 54 sekundiga võrreldes 786 ja 650 sekundiga. Süvauuringus saavutas meie meeskond tulemuse 0,802, samas kui mõlemad baasmeetodid jäid ligikaudu tasemele 0,52. Kõigi tulemuste puhul kehtib üks mööndus: rakendasime CORALi ja karpathy/autoresearchi uuesti nende avaldatud kirjelduste põhjal, mistõttu võib osa erinevusest tuleneda rakenduste, mitte ainult meetodite erinevustest.
Erinevust selgitavad neli disainivalikut. Esiteks koostab meie meeskond enne koodi muutmist struktureeritud disainispetsifikatsiooni. See suunab lahendust viipade kohandamise asemel struktuurimuudatuste, näiteks uute konveierietappide poole. Teiseks käitab see paralleelseid harusid, mis lähtuvad ühisest tipptasemel kandidaadist. Nii kuhjuvad täiustused kiiremini kui CORALi sõltumatute agentide või karpathy rangelt järjestikuse tsükli puhul. Kolmandaks jätab iga katse maha struktureeritud artefaktid – tulemused, sündmuselogid ja neli LLM-i koostatud analüüsi –, mille järgmine ettepanekute koostaja uuesti läbi loeb. Baasmeetodid säilitavad ainult lihtsad katselogid. Neljandaks suunab kohanduv juhtseade ettepanekute koostajat pärast seisakut rohkem uurima ja pärast edu lahendust viimistlema. Sellele lisandub hüpoteeside ennustav ümberjärjestamine, mis eemaldab nõrgad ideed enne eelarve kulutamist.
Eraldatud testi kõverad näitavad valdkonnasisest üldistumist, mitte valdkondadevahelist ülekannet. AI-turu signaalide eraldamiseks kohandatud töövoog ei pruugi õigus- või biomeditsiiniteksti puhul toimida ilma täitmiskeskkonda uuesti käitamata. Täitmiskeskkond optimeerib ainult hindaja määratud eesmärki, mistõttu sobitub see ustavalt üle mürarikka treeningkogumi või valesti kalibreeritud kohtuniku järgi. Tõsise käituse eel soovitame vähemalt 20 hoolikalt kureeritud treeningüksust ja eraldi arendusjaotist. Suurim praktiline piirang on kulu. Iga hindamine käitab kogu konveieri kõigil jaotistel uuesti. Ainuüksi valitud otsingukandidaat kasutas ligikaudu 2,2 miljonit sisendtokenit ning tõsine optimeerimine gpt-5.5-klassi mudelil maksab ülesande kohta mõnesajast mõne tuhande dollarini. Need arvud pärinevad üksikutest käitustest, mitte korduskatsetest. Seetõttu jagame neid tehnilise blogipostitusena, mitte ametliku uurimusena.
Meta-Harness näitab, et koodi autonoomset täiustamist saab muuta piisavalt metoodiliseks, et see sobiks ettevõtetele. Põhikomponendid on struktuursed hüpoteesid, ennustav eelfiltreerimine, eraldatud hindamine, võimaluse korral eraldatud testimine ning iga edutatud muudatuse täielik auditijälg. Koos annavad need insenerimeeskonnale prognoositava tee toimivast algkonveierist mõõdetavalt parema lahenduseni. Tegevuste eest vastutajale pakuvad need lihtsa mudeli: autonoomse uurimise eelised ranges ja eelarvet arvestavas raamistikus, kus inimene vaatab kõik enne juurutamist üle.