Navigasi utama

Meta-Harness: alur AI perusahaan sing ngapikake dhiri kanthi aman

Meta-harness sing disiplin mbantu tim perusahaan ngapikake alur kerja agen kanthi aman ing tugas coding jangka dawa.

Ringkesan eksekutif

  • Sistem perbaikan otonom sing wis ana nuduhake asil apik ing tugas coding, nanging durung cetha apa sistem kasebut bisa ngapikake alur kerja AI rumit lan jangka dawa sing padha karo implementasi nyata ing perusahaan.

  • Riset Meta-Harness kita ngetrapake perbaikan dhiri otonom kanggo alur kerja retrieval agentik, panaliten jero, lan intelijen sinyal, karo nambahake syarat perusahaan kayata evaluasi data sing dipisahake, kemampuan audit, kontrol anggaran, lan persetujuan manungsa.

  • Ing telung beban kerja wakil, Meta-Harness ningkatake kinerja kanthi gedhe, kalebu paningkatan 84% ing kinerja tes data sing dipisahake kanggo Signal Engine lan akurasi luwih dhuwur kanthi eksekusi 16× luwih cepet kanggo Agentic Multimodal Retrieval.

  • Beda karo akèh pendekatan sadurunge, Meta-Harness ngukur kasil ing dataset sing dipisahake yen bisa, kanggo mbiji apa perbaikane bisa digeneralisasi ngluwihi data sing digunakake sajrone optimasi.

  • Asil kasebut nuduhake yen perbaikan alur kerja otonom bisa ngluwihi benchmark coding lan ditrapake ing sistem AI perusahaan nyata, minangka cara praktis kanggo terus ngapikake aplikasi AI.

Riset anyar babagan riset AI otonom, kalebu makalah Meta-Harness, framework CORAL, lan karpathy/autoresearch, nuduhake yen agen coding bisa ngapikake solusi kanthi iteratif adhedhasar metrik evaluasi. Sing isih dadi pitakon yaiku apa cara kasebut bisa ditrapake ing alur kerja AI jangka dawa, kayata retrieval multimodal agentik, nalika agen kudu nggoleki korpus domain multimodal kanthi iteratif kanggo mangsuli pitakon, utawa ing pipeline pangolahan data rumit sing mbutuhake akèh tahap gumantung, panggilan alat, lan keputusan nangani pangecualian. Pitakon sing luwih jero yaiku apa paningkatan kasebut tetep ana ing data sing ora tau dideleng pangoptimal.

R&D Meta-Harness kita minangka jawaban kanggo pitakon kasebut. Sistem iki njupuk gagasan saka riset anyar lan ngowahi supaya cocog karo kabutuhan perusahaan: evaluasi data sing dipisahake, jejak audit, wates biaya, lan titik serah-terima sing cetha marang paninjau manungsa sadurunge apa wae diterbitake.

Kita nguji sistem iki ing telung tugas jangka dawa sing dimodelake saka pakaryan klien nyata. Signal Engine ngawasi aliran langsung kiriman X babagan pasar AI lan ngasilake laporan tren terstruktur kanthi sumber sing cetha. Agentic Multimodal Retrieval ngolah pitakon campuran teks lan gambar kanggo ngasilake kaca dokumen sing paling relevan. Panaliten Jero ngoordinasi pirang-pirang agen kanggo nggoleki web, mriksa silang sumber, lan nulis laporan riset dawa.

Ringkesan asil

  • Signal Engine: skor gabungan tes data sing dipisahake 0.456 → 0.841, mundhak relatif 84%. CORAL lan karpathy/autoresearch tetep ing ngisor 0.50 nganggo anggaran sing padha.

  • Agentic Multimodal Retrieval: NDCG@10 data sing dipisahake 0.705 → 0.744, kanthi wektu nyata saben evaluasi mudhun saka 869 detik dadi 54 detik. Tegese, 16× luwih cepet kanthi akurasi luwih dhuwur.

  • Panaliten Jero: skor gabungan kualitas laporan 0.449 → 0.802 ing 10 pitakon referensi, dibandhingake watara 0.52 kanggo baseline. Tugas iki ora nduweni pembagian data sing dipisahake, mula angka kasebut mung dianggep minangka asil in-sample.

  • Efisiensi panelusuran: nganggo Predictive Hypothesis Reranking, Signal Engine nggayuh 91% saka skor paling apik proses referensi sajrone 3 iterasi, dudu 20, kanthi anggaran evaluasi sing padha.

Akèh sistem riset otonom ngoptimalake lan ngevaluasi ing dataset sing padha, mula ora bisa dingerteni apa asile bisa digeneralisasi. Kanggo Signal Engine lan Agentic Multimodal Retrieval, kita ngetrapake pembagian ketat: set latihan sing bisa digunakake kandidat kanggo ngukur skor, set pangembangan kanggo pamriksa kewajaran, lan set tes sing dipisahake sing ora tau dideleng pangoptimal. Saben asil sing dilapurake asale saka siji versi kode tartamtu sing dinilai ing saben pembagian, mula kita ora tau nyampur skor latihan paling apik saka siji kandidat karo skor tes paling apik saka kandidat liyane.

Cara kerjane

Ing saben puteran, harness ngasilake sakumpulan hipotesis terstruktur kanggo ngowahi kode. Saben hipotesis nyebutake mekanisme sing arep diowahi, versi sadurunge sing dadi dhasar, lan mode kegagalan sing dadi sasaran. Tahap pemeringkatan nyaring kumpulan kasebut sadurunge biaya evaluasi sing larang digunakake. Hipotesis sing lolos dikirim menyang agen pekerja paralel sing nganggo basis kawruh bebarengan, nanging nyunting kode ing papan kerja sing kapisah sakabehe, supaya saben kandidat dinilai kanthi adil lan mandhiri. Ing pungkasan puteran, runner milih siji pemenang: kandidat kanthi skor paling dhuwur sing uga lolos kabeh pamriksa ing pembagian data sing katon. Pemenang kasebut dadi versi tercanggih sing dadi dhasar puteran sabanjure. Saben uji coba nulis paket tetep menyang panyimpenan bukti sing mung bisa ditambahi: patch kode, skor saben pembagian, log prastawa, lan patang analisis ringkes gaweyane LLM ngenani jejak, kaluputan, biaya, lan refleksi. Pengusul ing puteran sabanjure maca maneh riwayat iki, mula harness bisa nglumpukake kawruh sing wis disinaoni tinimbang mbaleni dalan buntu sing padha.

Diagram alur kerja Meta-Harness sing nuduhake input, evaluasi seed, panelusuran hipotesis, tim agen paralel, papan kerja evaluasi, output tinjauan, panyimpenan bukti, lan kontrol keamanan sarta biaya.

Telung pager pengaman njaga supaya loop bisa dilakokake kanthi aman. Kabijakan cakupan mbatesi berkas sing bisa diowahi kandidat lan mbalekake kabeh owah-owahan ing njaba cakupan kasebut. Anggaran token lan wektu nyata mungkasi proses nalika biaya ngluwihi wates, dene wates konkurensi njaga harness tetep manut wates laju model lan GPU. Lan harness ora tau nerbitake apa-apa dhewe. Harness ngasilake kandidat sing wis diperingkat lan didokumentasikake kanthi jangkep, banjur insinyur manungsa mriksa diff lan mutusake apa kandidat kasebut bisa mlebu produksi.

Ing balik layar

Ing stack lokal, ana limang komponen rekayasa dhasar sing nyengkuyung saben puteran loop ing ndhuwur.

  • Isolasi Papan Kerja. Siji git worktree kanggo saben kandidat. Saben cabang nganggo basis data objek sing padha, nanging ora tau nganggo berkas cabang liyane. Iki ngidini kandidat mlaku paralel kanthi biaya disk sing meh tetep lan nggampangake mbandhingake diff karo versi tercanggih saiki.

  • Sandbox Eksekusi. Rong mode liwat konfigurasi: subproses native kanggo iterasi cepet utawa runtime sing kapisah sakabehe. Korpus dipasang mung-waca, lan direktori sementara saben uji coba dibuwang sawise penilaian. Mula, uji coba ora bisa ngowahi dataset utawa mbocorake status menyang uji coba sabanjure.

  • Kabijakan Cakupan. Dhaptar path sing diidini lan ditetepake ing konfigurasi eksperimen. Kabeh sing diowahi ing njaba dhaptar kasebut dibalekake sadurunge uji coba dinilai, lan uji coba kasebut diwenehi tandha. Mula, diff sing dideleng paninjau dijamin tetep ana ing cakupan sing wis ditetepake.

  • Penegakan Anggaran. Telung lapisan: wates token lan wektu nyata saben uji coba, wates total saben proses, lan wates konkurensi. Kabeh iki njaga supaya biaya bisa diprakirakake lan harness tetep manut wates laju model lan infrastruktur.

  • Panyimpenan Bukti. JSONL sing mung bisa ditambahi, ngemot patch kode, skor saben pembagian, log prastawa, lan patang analisis gaweyane LLM. Tampilan termaterialisasi (leaderboard, versi tercanggih, indeks kegagalan) digawe maneh sawise saben uji coba. Iki ngidini puteran sabanjure nggunakake riwayat sadurunge, kanthi saben proses tetep bisa direproduksi persis saben byte.

Ora ana komponen dhasar iki sing opsional. Tujuan harness yaiku menehi asil sing pancen bisa disetujoni paninjau ing pungkasan proses: kandidat pemenang, diff sing diwatesi, cathetan jangkep kabeh sing wis dicoba, lan biaya sing cetha. Yen salah siji saka limang komponen kasebut dicopot, salah siji jaminan kasebut bakal ilang.

Pemeringkatan ulang hipotesis prediktif

Katelu eksperimen nggunakake strategi hipotesis sing padha. Ing saben iterasi, pengusul ngasilake hipotesis luwih akèh tinimbang sing bisa dilakokake kanthi anggaran sing ana: M = 8 kandidat kanggo anggaran pengiriman K = 4. LLM pemeringkat kapisah banjur ngurutake kabeh 8 kandidat sajrone siji panggilan telung puluh detik, kanthi informasi jangkep: skor paling apik saiki lan dimensi sing isih ringkih, analisis kegagalan saka uji coba anyar, lan kabeh 8 usulan sing ditampilake bebarengan. Patang kandidat paling apik dikirim menyang eksekutor kanthi biaya wektu 15 nganti 30 menit saben kandidat. Patang kandidat liyane dibuwang sadurunge nggunakake biaya apa wae.

Evaluasi

Model dhasare ora diowahi sajrone proses; harness mung nyunting kode ing sakupenge. Signal Engine lan Panaliten Jero dilakokake nganggo gpt-5.5. Agentic Multimodal Retrieval dilakokake nganggo Qwen3.6-35B-A3B open-weight sing dilayani sacara lokal liwat vLLM, dipasangake karo retriever gambar ColQwen3-4B. Kombinasi iki dipilih supaya biaya on-prem bisa diprakirakake.

Grafik ing ngisor iki nuduhake owah-owahan skor kanggo telung tugas utama kita. "Seed" yaiku kode wiwitan sing ditulis insinyur manungsa. "Meta-Harness" yaiku versi paling apik sing ditemokake Meta-Harness. Kita ndeleng paningkatan kinerja kanggo kabeh telung tugas ing set tes sing dipisahake.

Grafik batang sing mbandhingake kinerja seed lan Meta-Harness ing Signal Engine, Agentic Multimodal Retrieval, lan Panaliten Jero, kanthi Meta-Harness luwih unggul ing kabeh tes sing dipisahake.

Signal Engine dievaluasi dening juri LLM adhedhasar aktualitas, akurasi fakta, kerincian, lan nada, nganggo 150 tweet latihan lan 150 tweet tes sing dipisahake. Sajrone proses, versi paling apik ningkatake skor gabungan latihan saka 0.431 dadi 0.756 lan skor data sing dipisahake saka 0.456 dadi 0.841. Paningkatan kasebut asale saka owah-owahan ing harness, ora mung pangaturan prompt: iterasi pemenang sinau nyaring gangguan media sosial, nambah tahap pamriksa silang fakta, lan mbutuhake saben output adhedhasar bukti eksplisit. Diagram ing ngisor iki nuduhake proses iterasi.

Grafik garis uji coba latihan Signal Engine sing nuduhake skor paling apik sajrone proses lan skor data sing dipisahake mundhak saka baseline seed menyang target liwat upaya explorer lan refiner kanthi iteratif.

Riwayat uji coba nuduhake carane paningkatan kasebut nglumpuk. Owah-owahan struktural awal ningkatake skor paling apik nalika iku dadi 0.625; pangolahan bukti sing luwih rinci nyurung dadi 0.679; lan loop refleksi lan rubrik sing disempurnakake ningkatake dadi 0.819. Watara separo saka kabeh proses kandidat nduweni kinerja luwih ala utawa gagal babar pisan, nanging ora ngrusak leaderboard: saben cabang mlaku kanthi kapisah, diff sing kalah dibuwang, lan kegagalan ditulis menyang panyimpenan refleksi supaya pengusul sabanjure ora mbaleni dalan buntu sing padha.

Sing paling penting, kurva data sing dipisahake mundhak bebarengan karo kurva latihan sajrone proses. Iki nuduhake yen harness ngapikake alur kerja, dudu ngapalake korpus latihan. Skor data sing dipisahake rada luwih dhuwur tinimbang skor latihan. Iki kita tafsirake minangka noise sampling lumrah antarane rong pembagian cilik sing ora tumpang tindih.

Agentic Multimodal Retrieval diukur nganggo NDCG@10 ing pembagian Computer Science ViDoRe V3 publik, sing dikurasi dadi 20 pitakon latihan, 10 pangembangan, lan 20 tes sing dipisahake. Harness ningkatake NDCG@10 data sing dipisahake saka 0.705 dadi 0.744, karo nyuda total wektu nyata evaluasi saka 869 detik dadi 54 detik.

Panaliten Jero dinilai nganggo skor gabungan kualitas substansi lan kualitas referensi dening LLM, manut DeepResearch-Eval, ing 10 pitakon referensi. Kode sing wis diapikake ningkatake rata-rata saka 0.449 dadi 0.802. Owah-owahan pemenang gampang diwaca saka diff: tahap perencanaan awal sing mbandhingake pendekatan sadurunge agen riset dikirim, lan tahap tinjauan pungkasan sing nyasar dimensi sing sadurunge kerep entuk skor kurang apik. Amarga set iki cilik lan larang kanggo dievaluasi, kita ora mbagi set kasebut lan nganggep asile minangka in-sample.

Perbandingan karo CORAL lan karpathy/autoresearch

Grafik batang sing mbandhingake Meta-Harness, CORAL, lan karpathy/autoresearch adhedhasar skor Signal Engine, Agentic Multimodal Retrieval, lan Panaliten Jero, uga latensi evaluasi.

Kita mbandhingake katelu metode nganggo anggaran sing padha: dataset padha, model dhasar padha, wates iterasi padha, lan total evaluasi kandidat padha. Ing Signal Engine, Meta-Harness nggayuh 0.841 ing tes data sing dipisahake, dene baseline loro-lorone tetep ing ngisor 0.50. Ing Agentic Multimodal Retrieval, tim kita nduweni NDCG@10 data sing dipisahake paling dhuwur (0.744, dibandhingake 0.700 kanggo CORAL lan 0.738 kanggo karpathy) lan nglakokake evaluasi resmi rolas nganti patbelas kaping luwih cepet: 54 detik, dibandhingake 786 lan 650 detik. Ing Panaliten Jero, tim kita nggayuh 0.802, dene baseline loro-lorone tetep watara 0.52. Ana siji cathetan sing ditrapake kanggo kabeh asil: kita ngimplementasikake maneh CORAL lan karpathy/autoresearch saka katrangan sing diterbitake, mula sapérangan prabédan bisa uga asale saka implementasi, ora mung saka bedane metode.

Ana patang pilihan desain sing njalari prabédan kasebut. Kaping pisan, tim kita nggawe spesifikasi desain terstruktur sadurunge kode diowahi. Iki ngarahake sistem menyang owah-owahan struktural, kayata tahap pipeline anyar, tinimbang mung pangaturan prompt. Kaping pindho, sistem nglakokake cabang paralel kanthi kandidat tercanggih bareng minangka dhasar, mula perbaikan bisa nglumpuk luwih cepet tinimbang agen mandhiri CORAL utawa loop karpathy sing pancen sekuensial. Kaping telu, saben uji coba ninggalake artefak terstruktur (skor, log prastawa, lan patang analisis gaweyane LLM) sing diwaca maneh dening pengusul sabanjure, dene baseline mung nyimpen log upaya biasa. Kaping papat, kontroler adaptif ngarahake pengusul supaya njelajah sawise mandheg lan nyempurnakake sawise menang, kanthi Predictive Hypothesis Reranking ing ndhuwure kanggo mbuwang gagasan ringkih sadurunge ngentekake anggaran.

Bab sing durung kita buktekake

Kurva data sing dipisahake nuduhake generalisasi ing domain sing padha, dudu transfer lintas domain: alur kerja sing dioptimalake kanggo njupuk sinyal pasar AI ora bisa diarepake tetep apik ing teks hukum utawa biomedis tanpa nglakokake harness maneh. Harness uga mung ngoptimalake sasaran sing ditetepake penilai, mula set latihan sing akeh noise utawa juri sing ora terkalibrasi bakal di-overfit kanthi setya. Kita nyaranake paling ora 20 item latihan sing dikurasi apik lan pembagian pangembangan kapisah sadurunge proses serius. Biaya minangka kendala praktis paling gedhe. Saben evaluasi nglakokake maneh kabeh pipeline ing kabeh pembagian. Kandidat retrieval sing dipilih wae nggunakake watara 2,2 yuta token input, lan optimasi serius nganggo model kelas gpt-5.5 mbutuhake biaya atusan nganti sawetara ewu dolar saben tugas. Pungkasan, angka kasebut asale saka proses tunggal, dudu uji coba bola-bali. Mula, kita nuduhake minangka kiriman blog rekayasa, dudu studi formal.

Dudutan

Meta-Harness nuduhake yen perbaikan kode otonom bisa digawe cukup disiplin kanggo digunakake ing perusahaan. Komponen utamane yaiku hipotesis struktural, panyaringan awal prediktif, evaluasi sing kapisah, tes data sing dipisahake yen kahanane ngidini, lan jejak audit jangkep kanggo saben owah-owahan sing dipilih. Kabeh iki menehi tim rekayasa jalur sing bisa diprakirakake saka pipeline seed sing wis bisa digunakake menyang pipeline sing kabukten luwih apik. Iki uga menehi model prasaja kanggo pemilik operasi: entuk manfaat saka eksplorasi otonom, nanging tetep ana ing framework ketat sing nggatekake anggaran lan mbutuhake keterlibatan manungsa sadurunge apa wae diterbitake.

Para panulis

David Huang, Bjorn Jee