Meta-Harness: аюулгүй сайжрах байгууллагын AI ажлын урсгал

Сахилга баттай мета-хамгаалалт нь байгууллагын багуудад урт хугацааны кодчиллын даалгавар дахь агентын ажлын урсгалыг аюулгүй сайжруулахад тусална.

Удирдлагад зориулсан хураангуй

  • Одоогийн бие даан сайжрах системүүд кодчиллын даалгаварт өндөр үр дүн үзүүлсэн ч байгууллагын бодит нэвтрүүлэлттэй төстэй, урт хугацаанд үргэлжлэх нарийн төвөгтэй AI ажлын урсгалыг сайжруулж чадах эсэх нь тодорхойгүй хэвээр байна.

  • Манай Meta-Harness судалгаа агентлаг хайлт, гүн судалгаа, дохионы тагнуулын ажлын урсгалд бие даан сайжрах аргыг ашиглахын зэрэгцээ тусгаарласан үнэлгээ, аудит хийх боломж, төсвийн хяналт, хүний зөвшөөрөл зэрэг байгууллагын шаардлагыг нэмсэн.

  • Meta-Harness төлөөлөхүйц гурван ачаалал дээр гүйцэтгэлийг мэдэгдэхүйц сайжруулсан. Үүнд Signal Engine-ийн тусгаарласан тестийн гүйцэтгэл 84%-иар сайжирсан бөгөөд агентлаг олон горимт хайлтын нарийвчлал нэмэгдэж, гүйцэтгэл 16 дахин хурдассан.

  • Өмнөх ихэнх аргаас ялгаатай нь Meta-Harness сайжруулалт нь оновчлолд ашигласан өгөгдлөөс давж ерөнхийших эсэхийг тогтоохын тулд боломжтой бүх тохиолдолд амжилтыг тусгаарласан өгөгдлийн багцаар хэмждэг.

  • Эдгээр үр дүн бие даасан ажлын урсгалын сайжруулалтыг кодчиллын жишиг үнэлгээнээс бодит байгууллагын AI системд өргөжүүлж, AI хэрэглээг тасралтгүй сайжруулах бодит зам бий болгож болохыг харуулж байна.

Meta-Harness өгүүлэл, CORAL фреймворк, karpathy/autoresearch зэрэг бие даасан AI судалгааны сүүлийн үеийн ажлууд үнэлгээний хэмжүүр өгсөн нөхцөлд кодчиллын агентууд шийдлийг давтан сайжруулж чаддагийг харуулсан. Харин эдгээр арга урт хугацааны AI ажлын урсгалд тохирох эсэх нь нээлттэй хэвээр. Жишээлбэл, агент асуултад хариулахын тулд олон горимт салбарын өгөгдлийн сангуудаас давтан хайх агентлаг олон горимт хайлт, эсвэл харилцан хамааралтай олон алхам, хэрэгслийн дуудлага, онцгой тохиолдлыг зохицуулах шийдвэр шаарддаг өгөгдөл боловсруулах нарийн дамжлагад хэрэгжих эсэх нь тодорхойгүй. Үүнээс ч чухал асуулт нь оновчлогчийн огт хараагүй өгөгдөл дээр ахиц хэвээр хадгалагдах эсэх юм.

Манай Meta-Harness судалгаа, хөгжүүлэлт энэ асуултад өгсөн хариулт юм. Энэ нь сүүлийн үеийн судалгааны санааг байгууллагын хэрэгцээнд нийцүүлэн өөрчилсөн: тусгаарласан үнэлгээ, аудитын мөр, зардлын дээд хязгаар, мөн аливаа зүйлийг нэвтрүүлэхээс өмнө хянагчид шилжүүлэх тодорхой үе шат.

Бид үүнийг үйлчлүүлэгчдийн бодит ажилд загварчилсан урт хугацааны гурван даалгаварт туршсан. Signal Engine нь AI зах зээлийн тухай X нийтлэлийн шууд урсгалыг хянаж, эх сурвалжаар баталгаажсан зохион байгуулалттай чиг хандлагын тайлан гаргадаг. Агентлаг олон горимт хайлт нь текст, зургийн холимог асуулгыг дүгнэж, хамгийн хамааралтай баримт бичгийн хуудсуудыг буцаана. Гүн судалгаа нь вэбээс хайх, эх сурвалжийг тулган шалгах, дэлгэрэнгүй судалгааны тайлан бичих олон агентыг зохицуулдаг.

Үр дүнгийн тойм

  • Signal Engine: тусгаарласан тестийн нийлмэл оноо 0.456 → 0.841, харьцангуй өсөлт 84%. Ижил төсөвт CORAL болон karpathy/autoresearch 0.50-аас доогуур хэвээр байв.

  • Агентлаг олон горимт хайлт: тусгаарласан NDCG@10 0.705 → 0.744 болж, үнэлгээ бүрийн бодит хугацаа 869 секундээс 54 секунд болсон. Энэ нь нарийвчлалыг нэмэгдүүлэхийн зэрэгцээ 16 дахин хурдасгасан үзүүлэлт юм.

  • Гүн судалгаа: 10 жишиг асуултын тайлангийн чанарын нийлмэл оноо 0.449 → 0.802 болсон бол суурь аргуудынх ойролцоогоор 0.52 байв. Энэ даалгаварт тусгаарласан хуваалт байгаагүй тул уг үзүүлэлтийг зөвхөн түүврийн доторх үр дүн гэж үзсэн.

  • Хайлтын үр ашиг: таамаглалыг урьдчилан тооцоолж дахин эрэмбэлэхэд Signal Engine ижил үнэлгээний төсвөөр жишиг ажиллагааны шилдэг онооны 91%-д 20 биш, 3 давталтаар хүрсэн.

Ихэнх бие даасан судалгааны систем нэг өгөгдлийн багц дээр оновчилж, үнэлдэг тул үр дүн ерөнхийших эсэхийг тогтоох боломжгүй. Signal Engine болон агентлаг олон горимт хайлтад бид хатуу хуваалт мөрдсөн: хувилбарууд оноогоо шалгах сургалтын багц, үндэслэлтэй эсэхийг шалгах хөгжүүлэлтийн багц, оновчлогчийн огт харахгүй тусгаарласан тестийн багц. Тайлагнасан үр дүн бүр бүх хуваалтаар үнэлсэн нэг тодорхой кодын хувилбараас гарсан. Тиймээс нэг хувилбарын шилдэг сургалтын оноог нөгөөгийн шилдэг тестийн оноотой хэзээ ч хольдоггүй.

Хэрхэн ажилладаг вэ

Мөчлөг бүрд хамгаалалт кодыг өөрчлөх зохион байгуулалттай таамаглалуудын багц үүсгэнэ. Таамаглал бүр өөрчлөх механизмаа, суурилж буй өмнөх хувилбараа, шийдвэрлэхээр зорьж буй алдааны төрлөө нэрлэнэ. Өртөг өндөртэй үнэлгээ хийхээс өмнө эрэмбэлэх шат багцыг шүүнэ. Шалгарсан таамаглалууд нэгдсэн мэдлэгийн сан ашигладаг ч бүрэн тусгаарласан ажлын талбарт код засварладаг зэрэгцээ гүйцэтгэгч агентуудад очно. Ингэснээр хувилбар бүрийг шударга, хараат бусаар үнэлнэ. Мөчлөгийн төгсгөлд гүйцэтгэгч нэг ялагчийг дэвшүүлнэ: харагдах өгөгдлийн хуваалтуудын бүх шалгалтыг давсан, хамгийн өндөр оноотой хувилбар. Тэр ялагч нь дараагийн мөчлөгийн суурь хил хязгаар болно. Туршилт бүр кодын нөхөөс, хуваалт тус бүрийн оноо, үйл явдлын бүртгэл, мөр, алдаа, зардал болон эргэцүүллийг хамарсан Том хэлний загвар (LLM)-ын бичсэн дөрвөн богино шинжилгээг зөвхөн нэмэлт бичлэг хүлээн авдаг нотолгооны санд тогтмол багцаар хадгална. Дараагийн мөчлөгийн санал гаргагч энэ түүхийг эргэн уншдаг. Иймээс хамгаалалт нэг мухардлыг дахин туршихын оронд сурсан зүйлээ шатлан хуримтлуулна.

Оролт, эх хувилбарын үнэлгээ, таамаглалын хайлт, зэрэгцээ агентын багууд, үнэлгээний ажлын талбар, хяналтын үр дүн, нотолгооны сан, аюулгүй байдал болон зардлын хяналтыг харуулсан Meta-Harness-ийн ажлын урсгалын бүдүүвч.

Гурван хамгаалалтын хязгаарлалт давталтыг аюулгүй ажиллуулна. Хамрах хүрээний бодлого нь хувилбарын өөрчилж болох файлуудыг хязгаарлаж, гадуурх аливаа өөрчлөлтийг буцаана. Токен болон бодит хугацааны төсөв зардал дээд хязгаараас давахад ажиллагааг зогсооно. Зэрэгцээ ажиллагааны хязгаар хамгаалалтыг загвар болон GPU-гийн хүсэлтийн давтамжийн хязгаарт багтаана. Мөн хамгаалалт өөрөө юуг ч хэрэглээнд нэвтрүүлдэггүй. Энэ нь бүрэн баримтжуулж эрэмбэлсэн хувилбар гаргах бөгөөд инженер өөрчлөлтийн зөрүүг хянаж, үйлдвэрлэлийн орчинд нэвтрүүлэх эсэхийг шийднэ.

Дотоод бүтэц

Дотоод дэд бүтцэд дээрх давталтын мөчлөг бүрийг инженерчлэлийн таван үндсэн бүрэлдэхүүн дэмждэг.

  • Ажлын талбарын тусгаарлалт. Хувилбар бүрд нэг git worktree. Салаалсан хувилбарууд объектын нэг санг хуваалцдаг ч бие биеийнхээ файлыг огт хуваалцахгүй. Ингэснээр дискний зардлыг бараг тогтмол байлгаж зэрэгцүүлэн ажиллуулах бөгөөд одоогийн хил хязгаар хувилбартай зөрүүг нь хялбархан харьцуулна.

  • Гүйцэтгэлийн тусгаарлагдсан орчин. Тохиргоогоор хоёр горимтой: хурдан давталтад үндсэн дэд процесс, эсвэл бүрэн тусгаарласан ажиллах орчин. Өгөгдлийн сангуудыг зөвхөн унших эрхтэй холбож, туршилт бүрийн түр хавтсыг үнэлсний дараа устгана. Ингэснээр туршилт өгөгдлийн багцыг өөрчилж, дараагийн туршилтад төлөв дамжуулж чадахгүй.

  • Хамрах хүрээний бодлого. Туршилтын тохиргоонд зарласан зөвшөөрөгдсөн замын жагсаалт. Түүний гаднах аливаа өөрчлөлтийг туршилтыг үнэлэхээс өмнө буцааж, туршилтыг тэмдэглэнэ. Тиймээс хянагчийн харах өөрчлөлтийн зөрүү зарласан хамрах хүрээнд багтсан байх баталгаатай.

  • Төсвийн мөрдүүлэлт. Гурван түвшинтэй: туршилт бүрийн токен ба бодит хугацааны дээд хязгаар, ажиллагаа бүрийн нийт дээд хязгаар, зэрэгцээ ажиллагааны хязгаар. Эдгээр нь зардлыг урьдчилан тооцоолох боломжтой байлгаж, хамгаалалтыг загвар болон дэд бүтцийн хүсэлтийн давтамжийн хязгаарт багтаана.

  • Нотолгооны сан. Кодын нөхөөс, хуваалт тус бүрийн оноо, үйл явдлын бүртгэл болон Том хэлний загвар (LLM)-ын бичсэн дөрвөн шинжилгээг агуулсан, зөвхөн нэмэлт бичлэг хүлээн авах JSONL. Материалжуулсан харагдацуудыг (тэргүүлэгчдийн хүснэгт, хил хязгаар, алдааны индекс) туршилт бүрийн дараа дахин үүсгэнэ. Ингэснээр дараагийн мөчлөгүүд өмнөх түүхэд тулгуурлахын зэрэгцээ ажиллагаа бүрийг байт бүрээр нь давтан гаргах боломжтой.

Эдгээр үндсэн бүрэлдэхүүний аль нь ч заавал бус биш. Хамгаалалтын зорилго нь ажиллагааны төгсгөлд хянагчид үнэхээр баталж болох зүйл үлдээх юм: ялагч хувилбар, хязгаарлагдсан өөрчлөлтийн зөрүү, туршсан бүх зүйлийн бүрэн бүртгэл, тодорхой зардал. Энэ таваас аль нэгийг нь хасвал эдгээр баталгааны нэг алга болно.

Таамаглалыг урьдчилан тооцоолж дахин эрэмбэлэх

Гурван туршилт бүгд таамаглалын ижил стратеги ашигласан. Давталт бүрд санал гаргагч төсвөөр ажиллуулах боломжтойгоос олон таамаглал үүсгэнэ: K = 4 илгээх төсөвт M = 8 хувилбар. Дараа нь тусдаа Том хэлний загвар (LLM)-ын эрэмбэлэгч одоогийн шилдэг оноо ба сул үзүүлэлтүүд, сүүлийн туршилтуудын алдааны шинжилгээ, 8 саналыг зэрэгцүүлсэн бүрэн мэдээлэлд үндэслэн 30 секундын нэг дуудлагаар бүх 8-ыг эрэмбэлнэ. Шилдэг 4-ийг тус бүр 15–30 минутын зардалтайгаар гүйцэтгэгчид илгээнэ. Үлдсэн 4-ийг зардал гаргахаас нь өмнө хасна.

Үнэлгээ

Суурь загваруудыг бүх хугацаанд тогтмол байлгаж, хамгаалалт зөвхөн тэдгээрийг тойрсон кодыг зассан. Signal Engine болон гүн судалгаа gpt-5.5 дээр ажилласан. Агентлаг олон горимт хайлт нь vLLM-ээр дотоод орчинд үйлчилсэн нээлттэй жинтэй Qwen3.6-35B-A3B болон ColQwen3-4B зураг хайгчийг хослуулан ажилласан. Дотоод байршуулалтын зардлыг урьдчилан тооцоолох боломжтой тул энэ хослолыг сонгосон.

Доорх график манай үндсэн гурван даалгаврын оноо хэрхэн өөрчлөгдсөнийг харуулна. "Эх хувилбар" гэдэг нь инженерийн бичсэн анхны код юм. "Meta-Harness" гэдэг нь Meta-Harness-ийн олсон шилдэг хувилбар юм. Тусгаарласан тестийн багцад гурван даалгавар бүгд сайжирсан.

Signal Engine, агентлаг олон горимт хайлт, гүн судалгааны гүйцэтгэлээр эх хувилбар болон Meta-Harness-ийг харьцуулсан баганан график. Meta-Harness бүх тусгаарласан тестэд илүү өндөр үзүүлэлттэй.

Signal Engine-ийг 150 сургалтын, 150 тусгаарласан тестийн жиргээнд шинэлэг байдал, баримтын үнэн зөв, нарийвчлал, өнгө аясаар Том хэлний загвар (LLM)-ын шүүгчээр үнэлсэн. Ажиллагааны явцад шилдэг хувилбар сургалтын нийлмэл оноог 0.431-ээс 0.756, тусгаарласан оноог 0.456-аас 0.841 болгож сайжруулсан. Ахиц нь зөвхөн өгөгдлийн жижиг засвараас бус, хамгаалалтын өөрийн өөрчлөлтөөс гарсан: амжилттай давталтууд олон нийтийн сүлжээний шуугианыг шүүж сурсан, баримтыг тулган шалгах алхам нэмсэн, гаралт бүрийг тодорхой нотолгоонд үндэслэхийг шаардсан. Доорх бүдүүвч давталтын үйл явцыг харуулна.

Давталттай судлагч болон сайжруулагчийн оролдлогуудаар тухайн үеийн шилдэг болон тусгаарласан оноо эх хувилбарын түвшнээс зорилтот түвшин рүү сайжирсныг харуулсан Signal Engine-ийн сургалтын туршилтуудын шугаман график.

Туршилтын түүх эдгээр ахиц хэрхэн хуримтлагдсаныг харуулна. Эхний бүтцийн өөрчлөлт тухайн үеийн шилдэг оноог 0.625 болгож, нотолгоог илүү нарийвчлан боловсруулах нь 0.679-д хүргэж, сайжруулсан эргэцүүлэл ба шалгуурын давталт 0.819 болгосон. Нийт хувилбарын ажиллагааны тал орчим нь доогуур үзүүлэлттэй эсвэл бүрэн бүтэлгүйтсэн ч тэргүүлэгчдийн хүснэгтэд нөлөөлөөгүй: салаалсан хувилбар бүр тусгаарлагдан ажиллаж, ялагдсан өөрчлөлтийг устган, алдааг эргэцүүллийн санд бичсэн тул дараагийн санал гаргагч ижил мухардлыг давтаагүй.

Хамгийн чухал нь ажиллагааны турш тусгаарласан өгөгдлийн муруй сургалтын муруйтай хамт өссөн. Энэ нь хамгаалалт сургалтын өгөгдлийн санг цээжлэхийн оронд ажлын урсгалыг сайжруулсныг илтгэнэ. Тусгаарласан оноо сургалтын онооноос ялимгүй өндөр байсан. Үүнийг бид жижиг, давхцалгүй хоёр хуваалтын ердийн түүврийн хэлбэлзэл гэж тайлбарласан.

Агентлаг олон горимт хайлт-ыг нийтийн ViDoRe V3 Computer Science хуваалтын NDCG@10-аар хэмжсэн бөгөөд үүнийг сургалтын 20, хөгжүүлэлтийн 10, тусгаарласан тестийн 20 асуулгатай болгон бүрдүүлсэн. Хамгаалалт тусгаарласан NDCG@10-ыг 0.705-аас 0.744 болгож, үнэлгээний нийт бодит хугацааг 869 секундээс 54 секунд болгон бууруулсан.

Гүн судалгааDeepResearch-Eval-ийн аргачлалаар 10 жишиг асуултад агуулгын болон эшлэлийн чанарыг нэгтгэсэн Том хэлний загвар (LLM)-ын үнэлгээгээр дүгнэсэн. Сайжруулсан код дунджийг 0.449-өөс 0.802 болгосон. Ялагч өөрчлөлтүүд зөрүүний харьцуулалтаас тодорхой харагдсан: судалгааны агентуудыг илгээхээс өмнө аргуудыг харьцуулах эхний төлөвлөлтийн алхам, мөн тайлангийн түүхэн үзүүлэлт муу байсан хэмжүүрүүдэд чиглэсэн эцсийн хяналтын алхам. Энэ багц жижиг бөгөөд үнэлэхэд өндөр өртөгтэй тул бид хуваагаагүй, үр дүнг түүврийн доторх гэж үзсэн.

CORAL болон karpathy/autoresearch-тэй хийсэн харьцуулалт

Signal Engine, агентлаг олон горимт хайлт, гүн судалгааны оноо болон үнэлгээний саатлаар Meta-Harness, CORAL, karpathy/autoresearch-ийг харьцуулсан баганан графикууд.

Бид гурван аргыг ижил төсвөөр жишиг үнэлсэн: ижил өгөгдлийн багц, ижил суурь загвар, ижил давталтын дээд хязгаар, ижил нийт хувилбарын үнэлгээ. Signal Engine дээр Meta-Harness тусгаарласан тестэд 0.841-д хүрсэн бол хоёр суурь арга 0.50-аас доогуур байв. Агентлаг олон горимт хайлтад манай багийн тусгаарласан NDCG@10 хамгийн өндөр (0.744; CORAL 0.700, karpathy 0.738) бөгөөд албан ёсны үнэлгээг 12–14 дахин хурдан ажиллуулсан: 786 болон 650 секундтэй харьцуулахад 54 секунд. Гүн судалгаанд манай баг 0.802-д хүрсэн бол хоёр суурь арга 0.52 орчимд үлдсэн. Нэг анхаарах зүйл бий: бид CORAL болон karpathy/autoresearch-ийг нийтэлсэн тайлбараас нь дахин хэрэгжүүлсэн тул зөрүүний зарим хэсэг нь зөвхөн аргын бус, хэрэгжүүлэлтийн ялгаанаас шалтгаалсан байж болно.

Энэ зөрүүг дизайны дөрвөн сонголт тайлбарлана. Нэгдүгээрт, манай баг код засахаас өмнө зохион байгуулалттай дизайны тодорхойлолт үүсгэдэг. Ингэснээр өгөгдлийн жижиг засвар бус, дамжлагын шинэ шат зэрэг бүтцийн өөрчлөлтийг илүүд үздэг. Хоёрдугаарт, нэгдсэн хил хязгаар хувилбарт тулгуурласан зэрэгцээ салааллууд ажиллуулдаг тул сайжруулалтууд CORAL-ын бие даасан агентууд эсвэл karpathy-ийн хатуу дараалсан давталтаас хурдан хуримтлагдана. Гуравдугаарт, туршилт бүр дараагийн санал гаргагчийн эргэн унших зохион байгуулалттай баримтуудыг (оноо, үйл явдлын бүртгэл, Том хэлний загвар (LLM)-ын бичсэн дөрвөн шинжилгээ) үлдээдэг бол суурь аргууд зөвхөн энгийн оролдлогын бүртгэл хадгалдаг. Дөрөвдүгээрт, дасан зохицох хянагч зогсонги үед санал гаргагчийг эрэл хайгуул руу, амжилтын дараа нарийвчилсан сайжруулалт руу чиглүүлдэг. Үүн дээр таамаглалыг урьдчилан тооцоолж дахин эрэмбэлэх арга сул санааг төсөв зарцуулахаас нь өмнө хасна.

Бидний хараахан нотлоогүй зүйлс

Тусгаарласан муруйнууд нь салбар доторх ерөнхийшлийг харуулдаг болохоос салбар хоорондын шилжилтийг биш. AI зах зээлийн дохио ялгахад тохируулсан ажлын урсгал хамгаалалтыг дахин ажиллуулахгүйгээр хууль зүй эсвэл биоанагаахын текстэд адил үр дүнтэй байна гэж үзэх ёсгүй. Хамгаалалт зөвхөн үнэлэгчийн тодорхойлсон зорилго руу ахина. Тиймээс шуугиантай сургалтын багц эсвэл буруу тохируулсан шүүгчид ягштал хэт тохирно. Томоохон ажиллагааны өмнө нямбай сонгосон дор хаяж 20 сургалтын зүйл, тусдаа хөгжүүлэлтийн хуваалт ашиглахыг зөвлөж байна. Зардал бол бодит хэрэглээний хамгийн том хязгаарлалт. Үнэлгээ бүр бүх хуваалт дээр бүрэн дамжлагыг дахин ажиллуулна. Сонгосон хайлтын хувилбар дангаараа ойролцоогоор 2.2 сая оролтын токен хэрэглэсэн бөгөөд gpt-5.5 зэрэглэлийн загвар дээрх томоохон оновчлол даалгавар бүрд хэдэн зуугаас мянга гаруй ам.долларын зардалтай. Эцэст нь, эдгээр тоо давтан туршилтаас бус, нэг удаагийн ажиллагаанаас гарсан. Тиймээс бид үүнийг албан ёсны судалгаа бус, инженерчлэлийн блог нийтлэл хэлбэрээр хуваалцаж байна.

Дүгнэлт

Meta-Harness нь кодыг бие даан сайжруулах үйл явцыг байгууллагад ашиглахад хангалттай сахилга баттай болгож болохыг харууллаа. Үүний бүрэлдэхүүн нь бүтцийн таамаглал, урьдчилан тооцоолсон анхан шатны шүүлт, тусгаарласан үнэлгээ, өгөгдөл боломжтой үед тусгаарласан тест, дэвшүүлсэн өөрчлөлт бүрийн бүрэн аудитын мөр юм. Эдгээр нь инженерчлэлийн багт ажилладаг эх дамжлагаас хэмжигдэхүйц илүү сайн хувилбарт хүрэх урьдчилан тооцоолох боломжтой зам өгнө. Мөн үйл ажиллагаа хариуцсан эзэнд энгийн загвар санал болгоно: бие даасан эрэл хайгуулын давуу талыг төсөвт мэдрэмжтэй, хатуу хүрээнд барьж, аливаа зүйлийг нэвтрүүлэхээс өмнө хүнийг шийдвэрт оролцуулах.

Зохиогчид

David Huang, Bjorn Jee