Postojeći sistemi za autonomno poboljšavanje ostvarili su dobre rezultate na programerskim zadacima, ali još nije jasno mogu li unaprijediti složene, dugotrajne AI tokove rada nalik stvarnim poslovnim implementacijama.
Naše istraživanje Meta-Harnessa primjenjuje autonomno samopoboljšavanje na agentsko pretraživanje, duboko istraživanje i tokove rada za analizu signala, uz poslovne zahtjeve kao što su evaluacija na izdvojenim podacima, mogućnost revizije, kontrola budžeta i ljudsko odobrenje.
Meta-Harness je znatno poboljšao rezultate na tri reprezentativna radna opterećenja, uključujući poboljšanje od 84% na izdvojenom testu za Signal Engine te veću preciznost uz 16 puta brže izvršavanje za agentsko multimodalno pretraživanje.
Za razliku od većine ranijih pristupa, Meta-Harness uspjeh mjeri na izdvojenim skupovima podataka kad god je to moguće kako bi procijenio mogu li se poboljšanja generalizirati izvan podataka korištenih tokom optimizacije.
Ovi rezultati pokazuju da autonomno poboljšavanje tokova rada može nadići programerske referentne testove i primijeniti se na stvarne poslovne AI sisteme, pružajući praktičan put ka stalnom unapređivanju AI aplikacija.
Nedavna istraživanja autonomnog AI istraživanja, uključujući rad Meta-Harness, okvir CORAL i karpathy/autoresearch, pokazala su da agenti za programiranje mogu iterativno poboljšavati rješenje na osnovu metrike evaluacije. Otvoreno je pitanje mogu li se te metode primijeniti na dugotrajne AI tokove rada, poput agentskog multimodalnog pretraživanja, gdje agent mora iterativno pretraživati multimodalne stručne korpuse da bi odgovorio na pitanje, ili na složene tokove obrade podataka koji zahtijevaju mnogo zavisnih koraka, poziva alata i odluka o obradi izuzetaka. Važnije je pitanje zadržavaju li se poboljšanja na podacima koje optimizator nikada ne vidi.
Naše istraživanje i razvoj Meta-Harnessa odgovor je na to pitanje. Preuzima ideje iz novijih istraživanja i prilagođava ih poslovnim potrebama: evaluaciji na izdvojenim podacima, revizijskim tragovima, gornjim granicama troškova i jasnoj tački predaje ljudskom pregledatelju prije puštanja u produkciju.
Testirali smo ga na tri dugotrajna zadatka oblikovana prema stvarnom radu za klijente. Signal Engine prati tok objava o tržištu umjetne inteligencije na platformi X u stvarnom vremenu i izrađuje strukturirane izvještaje o trendovima, potkrijepljene pouzdanim izvorima. Agentsko multimodalno pretraživanje zaključuje na osnovu kombiniranih tekstualnih i slikovnih upita kako bi vratilo najrelevantnije stranice dokumenata. Duboko istraživanje koordinira više agenata koji pretražuju web, međusobno provjeravaju izvore i pišu opsežne istraživačke izvještaje.
Signal Engine: zbirni rezultat na izdvojenom testu 0,456 → 0,841, što je relativno povećanje od 84%. CORAL i karpathy/autoresearch ostali su ispod 0,50 uz isti budžet.
Agentsko multimodalno pretraživanje: NDCG@10 na izdvojenom testu porastao je s 0,705 na 0,744, dok je ukupno vrijeme po evaluaciji palo s 869 s na 54 s. To je 16 puta brže uz veću preciznost.
Duboko istraživanje: zbirni rezultat kvaliteta izvještaja porastao je s 0,449 na 0,802 na 10 referentnih pitanja, dok su početne metode ostvarile oko 0,52. Ovaj zadatak nije imao izdvojenu podjelu, pa rezultat smatramo isključivo rezultatom unutar uzorka.
Efikasnost pretrage: uz prediktivno ponovno rangiranje hipoteza Signal Engine je za 3 iteracije umjesto 20 dostigao 91% najboljeg rezultata referentnog izvršavanja, uz isti budžet za evaluaciju.
Većina sistema za autonomno istraživanje optimizira i evaluira na istom skupu podataka, zbog čega nije moguće utvrditi može li se rezultat generalizirati. Za Signal Engine i agentsko multimodalno pretraživanje primjenjujemo strogu podjelu: skup za obuku na kojem se kandidati mogu ocjenjivati, razvojni skup za osnovne provjere i izdvojeni testni skup koji optimizator nikada ne vidi. Svaki prijavljeni rezultat potječe iz jedne konkretne verzije koda ocijenjene na svim podjelama, pa nikada ne kombiniramo najbolji rezultat obuke jednog kandidata s najboljim testnim rezultatom drugog.
U svakom krugu harness generira skup strukturiranih hipoteza za izmjenu koda. Svaka hipoteza navodi mehanizam koji želi promijeniti, prethodnu verziju na kojoj se zasniva i vrstu greške koju nastoji otkloniti. Korak rangiranja filtrira skup prije nego što se sredstva utroše na skupe evaluacije. Preostale hipoteze preuzimaju paralelni izvršni agenti koji dijele zajedničku bazu znanja, ali uređuju kod u potpuno izoliranim radnim prostorima, pa se svaki kandidat ocjenjuje pravično i nezavisno. Na kraju kruga izvršni sistem promovira jednog pobjednika: kandidata s najboljim rezultatom koji je prošao i sve provjere na vidljivim podjelama podataka. Taj pobjednik postaje vodeća verzija na kojoj se zasniva sljedeći krug. Svaki pokušaj upisuje nepromjenjiv paket u spremište dokaza u koje se podaci samo dodaju: zakrpu koda, rezultate po podjelama, dnevnik događaja i četiri kratke analize koje je napisao LLM, a obuhvataju tok izvršavanja, greške, troškove i osvrt. Predlagač u sljedećem krugu ponovo čita tu historiju, pa harness nadograđuje naučeno umjesto da ponavlja iste neuspješne pokušaje.


Tri zaštitne mjere omogućavaju sigurno izvršavanje petlje. Pravila opsega ograničavaju datoteke koje kandidat smije mijenjati i poništavaju sve izmjene izvan tog opsega. Ograničenja broja tokena i ukupnog vremena zaustavljaju izvršavanje kada trošak pređe gornju granicu, dok ograničenja istovremenog rada drže harness unutar ograničenja učestalosti za model i GPU. Pritom harness nikada sam ništa ne pušta u produkciju. On daje rangiranog i potpuno dokumentiranog kandidata, a inženjer pregleda razliku u kodu i odlučuje hoće li kandidat biti pušten u produkciju.
Na lokalnoj infrastrukturi svaki krug prethodno opisane petlje počiva na pet osnovnih inženjerskih mehanizama.
Izolacija radnih prostora. Po jedno git radno stablo za svakog kandidata. Forkovi dijele bazu objekata, ali nikada međusobno ne dijele datoteke. Zato se kandidati mogu izvršavati paralelno uz gotovo nepromijenjenu potrošnju prostora na disku, a poređenje s trenutnom vodećom verzijom vrlo je jednostavno.
Izolirano okruženje za izvršavanje. Konfiguracija nudi dva načina rada: izvorni podproces za brze iteracije ili potpuno izolirano okruženje za izvršavanje. Korpusi se montiraju samo za čitanje, a privremeni direktorij svakog pokušaja briše se nakon ocjenjivanja. Zato pokušaj ne može izmijeniti skup podataka niti prenijeti stanje u sljedeći pokušaj.
Pravila opsega. Lista dozvoljenih putanja definirana u konfiguraciji eksperimenta. Sve izmjene izvan nje poništavaju se prije ocjenjivanja, a pokušaj se označava. Tako se garantira da razlika u kodu koju pregledatelj vidi ostaje unutar definiranog opsega.
Provođenje budžetskih ograničenja. Tri nivoa: ograničenja tokena i ukupnog vremena po pokušaju, ukupna gornja granica po izvršavanju i ograničenje istovremenog rada. Zajedno čine troškove predvidljivim i osiguravaju da harness ostane unutar ograničenja učestalosti modela i infrastrukture.
Spremište dokaza. JSONL datoteka u koju se podaci samo dodaju, a sadrži zakrpu koda, rezultate po podjelama, dnevnik događaja i četiri analize koje je napisao LLM. Materijalizirani prikazi (rang-lista, vodeća verzija i indeks grešaka) obnavljaju se nakon svakog pokušaja. Tako se naredni krugovi mogu oslanjati na prethodnu historiju, dok svako izvršavanje ostaje ponovljivo do posljednjeg bajta.
Nijedan od ovih mehanizama nije opcionalan. Svrha harnessa jeste da pregledatelj na kraju izvršavanja dobije nešto što zaista može odobriti: pobjedničkog kandidata, ograničenu razliku u kodu, potpun zapis svih pokušaja i poznat trošak. Ako se ukloni bilo koji od tih pet mehanizama, nestaje i jedna od navedenih garancija.
Sva tri eksperimenta koriste istu strategiju za hipoteze. U svakoj iteraciji predlagač generira više hipoteza nego što ih budžet dopušta izvršiti: M = 8 kandidata za budžet slanja K = 4. Zasebni LLM za rangiranje zatim poredava svih 8 jednim pozivom u trajanju od trideset sekundi, imajući potpunu sliku: trenutni najbolji rezultat i njegove slabe dimenzije, analize grešaka iz nedavnih pokušaja i svih 8 prijedloga prikazanih uporedo. Najbolja 4 šalju se izvršitelju, a svaki košta od 15 do 30 minuta. Preostala 4 odbacuju se prije nego što išta potroše.
Osnovni modeli ostali su nepromijenjeni tokom cijelog procesa; harness je uređivao samo okolni kod. Signal Engine i duboko istraživanje izvršavali su se na modelu gpt-5.5. Agentsko multimodalno pretraživanje izvršavalo se na modelu otvorenih težina Qwen3.6-35B-A3B, lokalno posluživanom putem vLLM-a i uparenom sa sistemom ColQwen3-4B za pretraživanje slika. Ta kombinacija odabrana je zbog predvidljivih troškova lokalne infrastrukture.
Grafikon u nastavku prikazuje kretanje rezultata za naša tri glavna zadatka. "Početna verzija" je početni kod koji je napisao inženjer. "Meta-Harness" je najbolja verzija koju je Meta-Harness pronašao. Na izdvojenom testnom skupu vidimo poboljšanje rezultata za sva tri zadatka.


Signal Engine evaluirao je LLM ocjenjivač prema aktuelnosti, činjeničnoj tačnosti, detaljnosti i tonu, koristeći 150 objava za obuku i 150 izdvojenih testnih objava s platforme X. Tokom izvršavanja najbolja verzija povećala je zbirni rezultat obuke s 0,431 na 0,756, a rezultat na izdvojenom skupu s 0,456 na 0,841. Poboljšanja su proizašla iz promjena samog harnessa, a ne samo dorade upita: uspješne iteracije naučile su filtrirati buku s društvenih mreža, dodale korake za unakrsnu provjeru činjenica i zahtijevale da se svaki izlaz zasniva na izričitim dokazima. Dijagram u nastavku prikazuje proces iteracije.


Historija pokušaja pokazuje kako su se ta poboljšanja akumulirala. Rana strukturna promjena podigla je dotad najbolji rezultat na 0,625; detaljnija obrada dokaza povećala ga je na 0,679; a dorađena petlja osvrta i kriterija ocjenjivanja podigla ga je na 0,819. Otprilike polovina svih izvršavanja kandidata ostvarila je slabije rezultate ili potpuno zakazala, ali nisu utjecala na rang-listu: svaki fork izvršavao se izolirano, neuspješne razlike u kodu bile su odbačene, a greške zapisane u spremište osvrta kako sljedeći predlagač ne bi ponovio isti neuspješan pokušaj.
Najvažnije je da je tokom cijelog izvršavanja krivulja izdvojenog skupa rasla zajedno s krivuljom obuke. To ukazuje da je harness poboljšavao tok rada umjesto da pamti korpus za obuku. Rezultati na izdvojenom skupu bili su neznatno viši od rezultata obuke, što tumačimo kao uobičajeni šum uzorkovanja između dvije male, odvojene podjele.
Agentsko multimodalno pretraživanje mjeri se pomoću NDCG@10 na javnoj podjeli Computer Science skupa ViDoRe V3, organiziranoj u 20 upita za obuku, 10 razvojnih i 20 izdvojenih testnih upita. Harness je povećao NDCG@10 na izdvojenom skupu s 0,705 na 0,744, dok je ukupno vrijeme evaluacije skratio s 869 sekundi na 54 sekunde.
Duboko istraživanje ocjenjuje se zbirnom ocjenom LLM-a za sadržajni kvalitet i kvalitet referenci, prema metodi DeepResearch-Eval, na 10 referentnih pitanja. Poboljšani kod povećao je prosjek s 0,449 na 0,802. Pobjedničke promjene jasno su se vidjele u razlici koda: početni korak planiranja koji poredi pristupe prije slanja istraživačkih agenata i završni korak pregleda usmjeren na dimenzije u kojima su izvještaji ranije ostvarivali slabe rezultate. Budući da je ovaj skup mali i skup za evaluaciju, nismo ga dijelili i rezultat smatramo rezultatom unutar uzorka.


Sve tri metode testirali smo uz isti budžet: iste skupove podataka, iste osnovne modele, isti maksimalni broj iteracija i isti ukupan broj evaluacija kandidata. Na zadatku Signal Engine Meta-Harness na izdvojenom testu postiže 0,841, dok su obje početne metode ostale ispod 0,50. Na agentskom multimodalnom pretraživanju naš tim ima najviši NDCG@10 na izdvojenom skupu (0,744 naspram 0,700 za CORAL i 0,738 za karpathy) i službenu evaluaciju izvršava od dvanaest do četrnaest puta brže: 54 s naspram 786 s i 650 s. Na dubokom istraživanju naš tim postiže 0,802, dok su obje početne metode ostale blizu 0,52. Važna je jedna ograda: CORAL i karpathy/autoresearch ponovo smo implementirali prema njihovim objavljenim opisima, pa dio razlike možda potječe iz različitih implementacija, a ne samo iz razlika među metodama.
Razliku objašnjavaju četiri projektne odluke. Prvo, naš tim izrađuje strukturiranu projektnu specifikaciju prije bilo kakve izmjene koda, što ga usmjerava na strukturne promjene, poput novih faza toka, umjesto na dorade upita. Drugo, istovremeno izvršava forkove zasnovane na zajedničkom vodećem kandidatu, pa se poboljšanja akumuliraju brže nego kod nezavisnih agenata CORAL-a ili strogo sekvencijalne petlje karpathyja. Treće, svaki pokušaj ostavlja strukturirane artefakte (rezultate, dnevnike događaja i četiri analize koje je izradio LLM) koje sljedeći predlagač ponovo čita, dok početne metode čuvaju samo jednostavne dnevnike pokušaja. Četvrto, prilagodljivi kontroler nakon zastoja usmjerava predlagača prema istraživanju, a nakon uspjeha prema doradi. Povrh toga, prediktivno ponovno rangiranje hipoteza odbacuje slabe ideje prije nego što potroše budžet.
Krivulje izdvojenih rezultata pokazuju generalizaciju unutar domene, a ne prijenos među domenama: ne treba očekivati da će tok rada prilagođen izdvajanju signala s AI tržišta jednako dobro raditi na pravnim ili biomedicinskim tekstovima bez ponovnog izvršavanja harnessa. Harness napreduje samo prema cilju koji definira ocjenjivač, pa će se vjerno prekomjerno prilagoditi bučnom skupu za obuku ili loše kalibriranom ocjenjivaču. Prije ozbiljnog izvršavanja preporučujemo najmanje 20 pažljivo odabranih stavki za obuku i zasebnu razvojnu podjelu. Trošak je najveće praktično ograničenje. Svaka evaluacija ponovo izvršava cijeli tok na svim podjelama, samo je odabrani kandidat za pretraživanje potrošio oko 2,2 miliona ulaznih tokena, a ozbiljna optimizacija na modelu klase gpt-5.5 košta od nekoliko stotina do nešto više od hiljadu dolara po zadatku. Konačno, ovi brojevi potječu iz pojedinačnih izvršavanja, a ne iz ponovljenih pokušaja, zbog čega ih objavljujemo kao inženjerski blog, a ne kao formalnu studiju.
Meta-Harness pokazuje da autonomno poboljšavanje koda može biti dovoljno disciplinirano za poslovnu upotrebu. Ključni sastojci su strukturne hipoteze, prediktivno prethodno filtriranje, izolirana evaluacija, testiranje na izdvojenim podacima kad god to podaci dopuštaju i potpun revizijski trag svake promovirane promjene. Zajedno inženjerskom timu pružaju predvidljiv put od funkcionalnog početnog toka do mjerljivo boljeg rješenja, a voditelju operacija nude jednostavan model: prednosti autonomnog istraživanja zadržane unutar strogog okvira koji uvažava budžet i uključuje čovjeka prije puštanja bilo čega u produkciju.