Núverandi kerfi til sjálfvirkra umbóta hafa náð góðum árangri í forritunarverkefnum, en enn er óljóst hvort þau geti bætt flókin og langvinn gervigreindarverkflæði sem líkjast raunverulegum innleiðingum fyrirtækja.
Rannsókn okkar á Meta-Harness beitir sjálfvirkum sjálfsumbótum á fulltrúamiðaða leit, djúprannsókn og upplýsingaöflun merkja, en bætir jafnframt við fyrirtækjakröfum á borð við blindmat, rekjanleika, kostnaðarstýringu og mannlegt samþykki.
Meta-Harness bætti árangur verulega í þremur dæmigerðum verkefnum, þar á meðal með 84% bætingu í blindprófi fyrir Signal Engine og meiri nákvæmni með 16× hraðari keyrslu fyrir fulltrúamiðaða margmiðlunarleit.
Ólíkt flestum fyrri aðferðum mælir Meta-Harness árangur á blindgagnasöfnum þegar því verður við komið, til að meta hvort umbætur alhæfist út fyrir gögnin sem voru notuð við bestun.
Niðurstöðurnar benda til þess að sjálfvirkar umbætur verkflæða geti náð út fyrir forritunarviðmið og yfir í raunveruleg gervigreindarkerfi fyrirtækja og þannig skapað raunhæfa leið að sífellt betri gervigreindarforritum.
Nýlegar rannsóknir á sjálfvirkum gervigreindarrannsóknum, þar á meðal greinin um Meta-Harness, umgjörðin CORAL og karpathy/autoresearch, hafa sýnt að forritunarfulltrúar geta endurtekið bætt lausn út frá matsmælikvarða. Enn er ósvarað hvort þessar aðferðir nýtist í langvinnum gervigreindarverkflæðum, svo sem fulltrúamiðaðri margmiðlunarleit þar sem fulltrúi þarf að leita ítrekað í margmiðlunargögnum sérsviðs til að svara spurningu, eða í flóknum gagnavinnslukeðjum sem krefjast margra háðra skrefa, verkfærakalla og ákvarðana um meðhöndlun undantekninga. Dýpri spurningin er hvort ávinningurinn haldist á gögnum sem bestarinn sér aldrei.
Rannsóknar- og þróunarstarf okkar með Meta-Harness er svar okkar við þeirri spurningu. Það sækir hugmyndir í nýlegar rannsóknir og mótar þær að þörfum fyrirtækja: blindmati, endurskoðunarferlum, kostnaðarþaki og skýrum afhendingarpunkti til mannlegs yfirferðarfulltrúa áður en nokkuð fer í rekstur.
Við prófuðum það í þremur langvinnum verkefnum sem voru mótuð eftir raunverulegum verkefnum viðskiptavina. Signal Engine fylgist með lifandi straumi X-færslna um gervigreindarmarkaðinn og býr til skipulagðar þróunarskýrslur með traustum heimildum. Fulltrúamiðuð margmiðlunarleit vinnur úr fyrirspurnum sem blanda saman texta og myndum og skilar þeim skjalasíðum sem eiga best við. Djúprannsókn samhæfir marga fulltrúa til að leita á vefnum, sannreyna heimildir og skrifa ítarlegar rannsóknarskýrslur.
Signal Engine: samsett einkunn í blindprófi 0,456 → 0,841, sem er 84% hlutfallsleg aukning. CORAL og karpathy/autoresearch héldust undir 0,50 með sama kostnaðarramma.
Fulltrúamiðuð margmiðlunarleit: NDCG@10 í blindprófi 0,705 → 0,744, en heildarklukktími hvers mats lækkaði úr 869 sek. í 54 sek. Það er 16× hraðaaukning með meiri nákvæmni.
Djúprannsókn: samsett einkunn fyrir gæði skýrslna 0,449 → 0,802 yfir 10 viðmiðunarspurningar, samanborið við um 0,52 hjá grunnlausnunum. Þetta verkefni hafði enga blindgagnaskiptingu og því lítum við aðeins á töluna sem niðurstöðu innan úrtaks.
Leitarhagkvæmni: með forspárbundinni endurröðun tilgátna náði Signal Engine 91% af bestu einkunn viðmiðunarkeyrslunnar í 3 ítrunum í stað 20, með sama matskostnað.
Flest sjálfvirk rannsóknarkerfi besta og meta á sama gagnasafni, sem gerir ómögulegt að segja til um hvort niðurstaðan alhæfist. Fyrir Signal Engine og fulltrúamiðaða margmiðlunarleit framfylgjum við strangri skiptingu: þjálfunarsafni sem framlög mega fá einkunn á, þróunarsafni fyrir einfaldar sannprófanir og blindprófunarsafni sem bestarinn sér aldrei. Allar birtar niðurstöður koma frá einni tiltekinni kóðaútgáfu sem var metin á öllum gagnaskiptingum. Við blöndum því aldrei bestu þjálfunareinkunn eins framlags við bestu prófunareinkunn annars.
Í hverri umferð býr Meta-Harness-kerfið til safn skipulagðra tilgátna um breytingar á kóðanum. Í hverri tilgátu kemur fram hvaða virkni á að breyta, á hvaða fyrri útgáfu hún byggir og hvaða bilunarmynstri hún beinist að. Röðunarskref síar safnið áður en kostnaðarsamt mat fer fram. Tilgáturnar sem standast síunina fara til samhliða vinnufulltrúa. Þeir deila sameiginlegum þekkingargrunni en breyta kóða á fullkomlega einangruðum vinnusvæðum, svo hvert framlag fái sanngjarnt og óháð mat. Í lok umferðarinnar velur keyrslustjórinn einn sigurvegara: stigahæsta framlagið sem jafnframt stóðst öll próf á sýnilegu gagnaskiptingunum. Sigurvegarinn verður viðmiðið sem næsta umferð byggir á. Hver tilraun skrifar fastan gagnapakka í gagnasafn sem aðeins er bætt við: kóðabótina, einkunnir fyrir hverja gagnaskiptingu, atvikaskrá og fjórar stuttar greiningar sem LLM skrifar um keyrsluspor, villur, kostnað og ígrundun. Tillögugerð næstu umferðar les þessa sögu, þannig að kerfið byggir áfram á fyrri lærdómi í stað þess að feta sömu blindgöturnar aftur.


Þrjár öryggisráðstafanir tryggja örugga keyrslu lykkjunnar. Umfangsregla takmarkar hvaða skrám framlag má breyta og afturkallar allt sem fellur utan hennar. Hámark á fjölda tóka og keyrslutíma stöðvar keyrsluna þegar kostnaður fer yfir sett mörk, en samhliðatakmarkanir halda kerfinu innan hraðatakmarkana líkans og GPU. Kerfið setur heldur aldrei neitt sjálft í rekstur. Það skilar röðuðu og fullskráðu framlagi. Mannlegur hugbúnaðarverkfræðingur fer yfir breytingarnar og ákveður hvort það fari í rekstur.
Í staðbundnu kerfi liggja fimm grunneiningar hugbúnaðarverkfræðinnar að baki hverri umferð lykkjunnar hér að ofan.
Einangrun vinnusvæða. Eitt git-vinnugreinasafn fyrir hvert framlag. Greinarnar deila hlutagagnagrunni en aldrei skrám hver annarrar. Því geta framlög keyrt samhliða með nánast föstum diskakostnaði og einfalt er að bera breytingarnar saman við núverandi viðmið.
Keyrslusandkassi. Tvær stillanlegar keyrsluleiðir: innbyggt undirferli fyrir hraðar ítranir eða fullkomlega einangrað keyrsluumhverfi. Gagnasöfn eru tengd inn sem skrifvarin og tímabundinni möppu hverrar tilraunar er eytt að mati loknu. Tilraun getur því hvorki breytt gagnasafninu né látið stöðu leka yfir í þá næstu.
Umfangsregla. Listi yfir leyfðar slóðir sem skilgreindur er í tilraunastillingunum. Allar breytingar utan listans eru afturkallaðar áður en tilraunin er metin og tilraunin er merkt. Því er tryggt að breytingarnar sem yfirferðarfulltrúinn sér haldist innan skilgreinds umfangs.
Framfylgd kostnaðarmarka. Þrjú lög: hámark tóka og keyrslutíma fyrir hverja tilraun, heildarhámark fyrir hverja keyrslu og hámark samhliða keyrslna. Saman gera þau kostnað fyrirsjáanlegan og tryggja að kerfið haldist innan hraðatakmarkana líkans og innviða.
Gagnasafn sönnunargagna. JSONL-skrá sem aðeins er bætt við og geymir kóðabótina, einkunnir fyrir hverja gagnaskiptingu, atvikaskrá og greiningarnar fjórar sem LLM skrifar. Efnisgerðar sýnir (stigatafla, viðmið og bilanaskrá) eru endurgerðar eftir hverja tilraun. Þannig geta síðari umferðir byggt á fyrri sögu og allar keyrslur eru endurgeranlegar bæti fyrir bæti.
Engin þessara grunneininga er valfrjáls. Markmið Meta-Harness-kerfisins er að í lok keyrslu hafi yfirferðarfulltrúinn eitthvað sem raunverulega er hægt að samþykkja: sigurframlag, afmarkaðar breytingar, fulla skrá yfir allt sem var prófað og þekktan kostnað. Sé ein af þessum fimm einingum fjarlægð hverfur ein þessara trygginga.
Allar þrjár tilraunirnar nota sömu tilgátuaðferð. Í hverri ítrun býr tillögugerðin til fleiri tilgátur en kostnaðarramminn leyfir að keyra: M = 8 framlög fyrir úthlutunarramma K = 4. Sérstakur LLM-raðari raðar síðan öllum átta í einu þrjátíu sekúndna kalli með heildarmyndina fyrir framan sig: núverandi hæstu einkunn og veiku þætti hennar, bilanagreiningar nýlegra tilrauna og allar átta tillögurnar hlið við hlið. Fjögur efstu fara til keyrslukerfisins og kosta 15 til 30 mínútur hvert. Hin fjögur eru felld út áður en þau valda nokkrum kostnaði.
Undirliggjandi líkönum var haldið óbreyttum allan tímann; Meta-Harness breytti aðeins kóðanum í kringum þau. Signal Engine og djúprannsókn keyrðu á gpt-5.5. Fulltrúamiðuð margmiðlunarleit keyrði á opna vægilíkaninu Qwen3.6-35B-A3B, sem var keyrt staðbundið með vLLM og parað við ColQwen3-4B-myndaleit. Þessi samsetning var valin vegna fyrirsjáanlegs kostnaðar við keyrslu á eigin innviðum.
Myndritið hér að neðan sýnir hvernig einkunnir þriggja helstu verkefnanna þróuðust. "Upphafslausn" er upphafskóðinn sem mannlegur hugbúnaðarverkfræðingur skrifaði. "Meta-Harness" er besta útgáfan sem Meta-Harness fann. Við sjáum betri árangur í öllum þremur verkefnunum á blindprófunarsafninu.


Signal Engine var metið af LLM-dómara út frá nýleika, staðreyndanákvæmni, nákvæmni smáatriða og tón, með 150 þjálfunartístum og 150 blindprófunartístum. Á meðan keyrslunni stóð bætti besta útgáfan samsettu þjálfunareinkunnina úr 0,431 í 0,756 og blindprófunareinkunnina úr 0,456 í 0,841. Ávinningurinn kom af breytingum á Meta-Harness-kerfinu sjálfu, ekki aðeins lagfæringum á kvaðningum: sigursælar ítranir lærðu að sía út suð á samfélagsmiðlum, bættu við skrefum til að sannreyna staðreyndir og kröfðust þess að sérhvert úttak byggðist á skýrum sönnunargögnum. Skýringarmyndin hér að neðan sýnir ítrunarferlið.


Tilraunasagan sýnir hvernig ávinningurinn safnaðist upp. Snemmbær breyting á uppbyggingu hækkaði bestu hlaupandi einkunn í 0,625; nákvæmari meðhöndlun sönnunargagna ýtti henni í 0,679; og endurbætt lykkja ígrundunar og matsramma hækkaði hana í 0,819. Um helmingur allra framlagskeyrslna stóð sig verr eða mistókst með öllu, en þær menguðu ekki stigatöfluna: hver grein keyrði einangruð, breytingum taplausna var hent og bilanir skráðar í ígrundunarsafnið svo næsta tillögugerð endurtæki ekki sömu blindgötuna.
Mikilvægast er að blindprófunarferillinn hækkaði samhliða þjálfunarferlinum alla keyrsluna. Það bendir til þess að Meta-Harness-kerfið hafi bætt verkflæðið fremur en að leggja þjálfunargögnin á minnið. Blindprófunareinkunnirnar voru örlítið hærri en þjálfunareinkunnirnar, sem við túlkum sem eðlilegan úrtakshávaða milli tveggja lítilla, aðskilinna gagnaskiptinga.
Fulltrúamiðuð margmiðlunarleit er mæld með NDCG@10 á opinberu tölvunarfræðiskiptingunni í ViDoRe V3, sem var sett saman í 20 þjálfunarfyrirspurnir, 10 þróunarfyrirspurnir og 20 blindprófunarfyrirspurnir. Meta-Harness hækkaði NDCG@10 í blindprófi úr 0,705 í 0,744 og stytti um leið heildarklukktíma mats úr 869 sekúndum í 54 sekúndur.
Djúprannsókn fær samsetta einkunn frá LLM-dómara fyrir efnisleg gæði og gæði heimilda, samkvæmt DeepResearch-Eval, yfir 10 viðmiðunarspurningar. Endurbætti kóðinn hækkaði meðaltalið úr 0,449 í 0,802. Auðvelt var að sjá sigurbæturnar í breytingunum: skipulagsskref í upphafi sem ber saman aðferðir áður en rannsóknarfulltrúar eru sendir af stað og lokayfirferð sem beinist að þeim þáttum þar sem skýrslur höfðu áður fengið lágar einkunnir. Þar sem þetta safn er lítið og dýrt í mati skiptum við því ekki og lítum á niðurstöðuna sem niðurstöðu innan úrtaks.


Við bárum allar þrjár aðferðirnar saman innan sama kostnaðarramma: sömu gagnasöfn, sömu undirliggjandi líkön, sama hámark ítrana og sami heildarfjöldi matskeyrslna framlaga. Í Signal Engine nær Meta-Harness 0,841 í blindprófi en báðar grunnlausnirnar héldust undir 0,50. Í fulltrúamiðaðri margmiðlunarleit er teymið okkar með hæsta NDCG@10 í blindprófi (0,744 á móti 0,700 hjá CORAL og 0,738 hjá karpathy) og keyrir opinbera matið tólf til fjórtán sinnum hraðar: 54 sek. á móti 786 sek. og 650 sek. Í djúprannsókn nær teymið okkar 0,802 en báðar grunnlausnirnar héldust nálægt 0,52. Einn fyrirvari gildir alls staðar: við endurgerðum CORAL og karpathy/autoresearch út frá birtum lýsingum þeirra. Hluti munarins kann því að stafa af ólíkri útfærslu, ekki aðeins ólíkum aðferðum.
Fjórar hönnunarákvarðanir skýra muninn. Í fyrsta lagi býr teymið okkar til skipulagða hönnunarforskrift áður en kóða er breytt. Það beinir vinnunni að breytingum á uppbyggingu, svo sem nýjum þrepum í vinnslukeðju, fremur en lagfæringum á kvaðningum. Í öðru lagi keyrir það samhliða greinar sem miðast við sameiginlegt viðmiðunarframlag. Umbætur safnast því hraðar upp en hjá óháðum fulltrúum CORAL eða stranglega raðbundinni lykkju karpathy. Í þriðja lagi skilur hver tilraun eftir skipulögð gögn (einkunnir, atvikaskrár og fjórar greiningar skrifaðar af LLM) sem næsta tillögugerð les, en grunnlausnirnar geyma aðeins einfaldar tilraunaskrár. Í fjórða lagi beinir aðlagandi stýring tillögugerðinni að könnun eftir stöðnun og fínstillingu eftir sigur. Þar ofan á situr forspárbundin endurröðun tilgátna sem fellir veikar hugmyndir út áður en þær eyða kostnaðarramma.
Blindprófunarferlarnir sýna alhæfingu innan sama sviðs, ekki yfirfærslu milli sviða: ekki ætti að búast við að verkflæði sem er stillt fyrir merkjaútdrátt á gervigreindarmarkaði virki jafn vel á lagalegan eða líflæknisfræðilegan texta án þess að Meta-Harness-kerfið sé keyrt aftur. Kerfið klífur líka aðeins þá brekku sem matsaðilinn skilgreinir. Því verður hávaðasamt þjálfunarsafn eða illa kvarðaður dómari samviskusamlega oflært; við mælum með að minnsta kosti 20 vel völdum þjálfunaratriðum og sérstakri þróunarskiptingu áður en alvöru keyrsla hefst. Kostnaður er stærsta hagnýta takmörkunin. Í hverju mati er öll vinnslukeðjan keyrð aftur á öllum gagnaskiptingum. Valda leitarframlagið eitt og sér notaði um 2,2 milljónir inntakstóka og alvöru bestun á líkani í flokki gpt-5.5 kostar frá nokkrum hundruðum upp í fáein þúsund dollara fyrir hvert verkefni. Að lokum koma þessar tölur úr stökum keyrslum en ekki endurteknum tilraunum. Þess vegna birtum við þær í bloggfærslu um hugbúnaðarverkfræði en ekki sem formlega rannsókn.
Meta-Harness sýnir að hægt er að aga sjálfvirkar kóðaumbætur nægilega til notkunar hjá fyrirtækjum. Lykilþættirnir eru tilgátur um uppbyggingu, forspárbundin forsíun, einangrað mat, blindprófanir þegar gögnin leyfa og full endurskoðunarslóð fyrir hverja breytingu sem er tekin áfram. Saman skapa þessir þættir fyrirsjáanlega leið fyrir hugbúnaðarteymi frá virkri upphafskeðju að mælanlega betri keðju. Rekstrarábyrgðaraðili fær jafnframt einfalt líkan: ávinning sjálfvirkrar könnunar innan strangs kostnaðarramma, með mannlega yfirferð áður en nokkuð fer í rekstur.