Негізгі навигация

Meta-Harness: қауіпсіз, өзін жетілдіретін кәсіпорын ЖИ үдерістері

Тәртіпке негізделген мета-тапсырма ортасы кәсіпорын командаларына ұзақ бағдарламалау тапсырмаларында агенттердің жұмыс үдерістерін қауіпсіз жетілдіруге көмектеседі.

Басшылыққа арналған түйін

  • Қолданыстағы автономды жетілдіру жүйелері бағдарламалау тапсырмаларында жақсы нәтиже көрсетті. Алайда олардың кәсіпорындағы нақты қолданысқа ұқсайтын, ұзақ кезеңді күрделі ЖИ жұмыс үдерістерін жетілдіре алатыны әлі анық емес.

  • Meta-Harness зерттеуіміз автономды өзін-өзі жетілдіруді агенттерге негізделген іздеу, терең зерттеу және сигналдық талдау үдерістеріне қолданып, жасырын бағалау, аудит мүмкіндігі, бюджет бақылауы мен адамның мақұлдауы сияқты кәсіпорын талаптарын қосады.

  • Үш үлгілік жүктеменің бәрінде Meta-Harness нәтижені едәуір жақсартты: Signal Engine жүйесінің жасырын тест нәтижесі 84% өсті, ал агенттерге негізделген мультимодальды іздеудің дәлдігі артып, орындалуы 16 есе жылдамдады.

  • Алдыңғы тәсілдердің көбінен өзгеше, Meta-Harness оңтайландыру кезінде пайдаланылған деректерден тыс жақсартулардың жалпылануын тексеру үшін, мүмкін болған жерде нәтижені жасырын деректер жиындарымен өлшейді.

  • Бұл нәтижелер жұмыс үдерісін автономды жетілдірудің бағдарламалау бенчмарктерімен шектелмей, кәсіпорынның нақты ЖИ жүйелеріне де қолданылатынын көрсетеді және ЖИ қолданбаларын үздіксіз жақсартудың практикалық жолын ұсынады.

Автономды ЖИ зерттеулері жөніндегі соңғы жұмыстар, соның ішінде Meta-Harness мақаласы, CORAL фреймворкі және karpathy/autoresearch, бағалау метрикасы берілсе, бағдарламалаушы агенттер шешімді итерация сайын жақсарта алатынын көрсетті. Бұл әдістердің ұзақ мерзімді ЖИ жұмыс үдерістеріне қаншалықты жарайтыны әлі белгісіз. Мысалы, агенттерге негізделген мультимодальды іздеуде агент сұраққа жауап беру үшін әртүрлі форматтағы салалық корпустарды қайта-қайта іздейді. Ал күрделі дерек өңдеу конвейерлері бір-біріне тәуелді көптеген қадамды, құрал шақыруын және ерекше жағдайларды өңдеу шешімдерін талап етеді. Ең маңызды сұрақ — оңтайландырғыш көрмеген деректерде де бұл өсім сақтала ма?

Meta-Harness бойынша зерттеу және әзірлеу жұмысымыз — осы сұраққа берген жауабымыз. Ол соңғы зерттеулердегі идеяларды кәсіпорын қажеттіліктеріне бейімдейді: жасырын бағалау, аудит іздері, шығын шектері және ештеңе өндіріске жіберілмей тұрып адам тексерушіге берілетін нақты кезең.

Біз оны клиенттердің нақты жұмысына негізделген үш ұзақ мерзімді тапсырмада сынадық. Signal Engine ЖИ нарығы туралы X жазбаларының тікелей ағынын бақылап, дереккөздері көрсетілген құрылымды тренд есептерін жасайды. Агенттерге негізделген мультимодальды іздеу мәтін мен кескін аралас сұрауларды талдап, ең сәйкес құжат беттерін қайтарады. Терең зерттеу бірнеше агенттің вебтен іздеуін, дереккөздерді өзара тексеруін және көлемді зерттеу есептерін жазуын үйлестіреді.

Нәтижелерге қысқаша шолу

  • Signal Engine: жасырын тесттің жиынтық көрсеткіші 0.456 → 0.841, салыстырмалы өсім — 84%. Дәл осы бюджетпен CORAL және karpathy/autoresearch нәтижелері 0.50-ден төмен болды.

  • Агенттерге негізделген мультимодальды іздеу: жасырын NDCG@10 көрсеткіші 0.705 → 0.744, ал бір бағалаудың нақты уақыты 869 секундтан 54 секундқа қысқарды. Яғни дәлдік жоғарылап, жылдамдық 16 есе артты.

  • Терең зерттеу: 10 эталондық сұрақ бойынша есеп сапасының жиынтық көрсеткіші 0.449 → 0.802, ал бастапқы әдістердің нәтижесі шамамен 0.52 болды. Бұл тапсырмада жасырын бөлік болған жоқ, сондықтан көрсеткішті тек іріктеме ішіндегі нәтиже деп есептейміз.

  • Іздеу тиімділігі: гипотезаларды болжамды қайта рейтингтеу арқылы Signal Engine бірдей бағалау бюджетімен 20 итерацияның орнына 3 итерацияда эталондық орындалымның үздік ұпайының 91%-ына жетті.

Автономды зерттеу жүйелерінің көбі бір деректер жиынында оңтайландырылып әрі бағаланады. Сондықтан нәтиженің жалпыланатынын анықтау мүмкін емес. Signal Engine және агенттерге негізделген мультимодальды іздеу үшін деректерді қатаң бөлеміз: үміткерлер ұпай ала алатын оқыту жиыны, дұрыстықты тексеруге арналған әзірлеу жиыны және оңтайландырғыш ешқашан көрмейтін жасырын тест жиыны. Жарияланған әр нәтиже барлық бөлікте бағаланған бір нақты код нұсқасынан алынады. Сондықтан бір үміткердің үздік оқыту ұпайын екіншісінің үздік тест ұпайымен араластырмаймыз.

Қалай жұмыс істейді

Әр айналымда тапсырма ортасы кодты өзгертуге арналған құрылымды гипотезалар топтамасын жасайды. Әр гипотезада өзгертілетін тетік, негізге алынатын алдыңғы нұсқа және түзетілетін ақау түрі көрсетіледі. Қымбат бағалаулар басталмай тұрып, топтама рейтингтеу кезеңінде сүзгіден өтеді. Іріктелген гипотезалар ортақ білім қорын пайдаланатын, бірақ кодты толық оқшауланған жұмыс кеңістіктерінде өңдейтін қатарлас орындаушы агенттерге беріледі. Осылайша әр үміткер әділ әрі тәуелсіз бағаланады. Айналым соңында орындаушы бір жеңімпазды таңдайды: ол — ең жоғары ұпай жинап, ашық бөліктердегі барлық тексеруден өткен үміткер. Сол жеңімпаз келесі айналымға негіз болады. Әр сынақ тек толықтырылатын дәлелдер қоймасына тұрақты деректер топтамасын жазады: код түзетуі, әр бөлік бойынша ұпайлар, оқиғалар журналы және орындалу ізін, қателерді, шығынды әрі рефлексияны қамтитын LLM (үлкен тілдік модель) жазған төрт қысқа талдау. Келесі айналымның ұсыныс жасаушысы осы тарихты қайта оқиды. Соның арқасында тапсырма ортасы бұрынғы тұйық жолдарды қайталамай, үйренгенін жинақтайды.

Кірістерді, бастапқы бағалауды, гипотеза іздеуді, қатар жұмыс істейтін агенттер топтарын, бағалау жұмыс кеңістігін, тексеру нәтижелерін, дәлелдер қоймасын, қауіпсіздік пен шығынды бақылау тетіктерін көрсететін Meta-Harness жұмыс үдерісінің сызбасы.

Үш қорғаныс тетігі циклдің қауіпсіз орындалуын қамтамасыз етеді. Қолданылу аясы саясаты үміткер өзгерте алатын файлдарды шектеп, аядан тыс өзгерістердің бәрін қайтарады. Токен және орындалу уақыты бюджеттері шығын белгіленген шектен асқанда орындалуды тоқтатады, ал қатар орындау лимиттері тапсырма ортасының модель мен GPU-ға қойылған шектеулерден аспауын қамтамасыз етеді. Тапсырма ортасы ештеңені өздігінен өндіріске шығармайды. Ол рейтингтелген, толық құжатталған үміткерді ұсынады, ал инженер өзгерістерді тексеріп, оны өндіріске шығару-шығармауды шешеді.

Ішкі құрылымы

Жергілікті стек деңгейінде жоғарыдағы циклдің әр айналымына негіз болатын бес инженерлік тетік бар.

  • Жұмыс кеңістігін оқшаулау. Әр үміткер үшін жеке git worktree пайдаланылады. Тармақтар ортақ нысандар дерекқорын пайдаланады, бірақ бір-бірінің файлдарына қол жеткізбейді. Бұл үміткерлерді дискілік шығынды айтарлықтай арттырмай қатар іске қосуға және оларды қазіргі озық нұсқамен оңай салыстыруға мүмкіндік береді.

  • Орындау құмсалғышы. Конфигурация бойынша екі режим бар: жылдам итерацияға арналған жергілікті ішкі процесс немесе толық оқшауланған орындау ортасы. Корпустар тек оқу режимінде тіркеледі, ал әр сынақтың уақытша каталогы бағалаудан кейін жойылады. Сондықтан сынақ деректер жиынын өзгерте де, өз күйін келесі сынаққа өткізе де алмайды.

  • Қолданылу аясы саясаты. Эксперимент конфигурациясында жарияланған рұқсат етілген жолдар тізімі. Одан тыс жасалған барлық өзгеріс сынақ бағаланбай тұрып қайтарылады, ал сынаққа белгі қойылады. Осылайша тексеруші көретін өзгерістердің жарияланған аядан шықпайтынына кепілдік беріледі.

  • Бюджет шектеулерін сақтау. Үш деңгейден тұрады: әр сынаққа арналған токен және орындалу уақытының шектері, әр орындалымға арналған жалпы шек және қатар орындау лимиті. Олар шығынды болжамды деңгейде ұстап, тапсырма ортасының модель мен инфрақұрылымға қойылған сұраныс шектеулерінен аспауын қамтамасыз етеді.

  • Дәлелдер қоймасы. Код түзетуі, әр бөлік бойынша ұпайлар, оқиғалар журналы және LLM (үлкен тілдік модель) жазған төрт талдау сақталатын, тек толықтырылатын JSONL файлы. Материалдандырылған көріністер (көшбасшылар кестесі, озық нұсқа, сәтсіздіктер индексі) әр сынақтан кейін қайта жасалады. Соның арқасында келесі айналымдар бұрынғы тарихқа сүйенеді, ал әр орындалымды байт-байтымен дәл қайталауға болады.

Бұл тетіктердің ешқайсысын алып тастауға болмайды. Тапсырма ортасының мақсаты — орындалым соңында тексерушіге шынымен мақұлдай алатын нәтиже беру: жеңімпаз үміткер, шектеулі өзгерістер, барлық сынақтың толық жазбасы және нақты шығын. Бес тетіктің бірін алып тастасаңыз, осы кепілдіктердің бірі жоғалады.

Гипотезаларды болжамды қайта рейтингтеу

Үш экспериментте де бір гипотеза стратегиясы қолданылады. Әр итерацияда ұсыныс жасаушы бюджет көтеретін мөлшерден көп гипотеза жасайды: K = 4 жіберу бюджетіне M = 8 үміткер. Содан кейін бөлек LLM (үлкен тілдік модель) рейтингтеушісі 30 секундтық бір шақыруда сегізінің бәрін реттейді. Оның алдында толық көрініс болады: қазіргі үздік ұпай мен оның әлсіз өлшемдері, соңғы сынақтардың сәтсіздік талдаулары және қатар қойылған 8 ұсыныс. Үздік 4 нұсқа орындаушыға жіберіледі, олардың әрқайсысына 15–30 минут кетеді. Қалған 4 нұсқа еш шығын жұмсалмай тұрып алынып тасталады.

Бағалаулар

Негізгі модельдер бүкіл жұмыс бойы өзгеріссіз қалды; тапсырма ортасы тек олардың айналасындағы кодты өңдеді. Signal Engine және терең зерттеу gpt-5.5 моделінде орындалды. Агенттерге негізделген мультимодальды іздеу жергілікті ортада vLLM арқылы іске қосылған ашық салмақты Qwen3.6-35B-A3B моделінде, ColQwen3-4B кескін іздеу жүйесімен бірге орындалды. Бұл жұп жергілікті инфрақұрылымдағы болжамды шығын үшін таңдалды.

Төмендегі диаграмма үш негізгі тапсырманың ұпайлары қалай өзгергенін көрсетеді. «Бастапқы нұсқа» — инженер жазған бастапқы код. «Meta-Harness» — Meta-Harness тапқан ең үздік нұсқа. Жасырын тест жиынында үш тапсырманың да нәтижесі жақсарғанын көрдік.

Signal Engine, Агенттерге негізделген мультимодальды іздеу және терең зерттеу бойынша бастапқы нұсқа мен Meta-Harness нәтижелерін салыстыратын бағандық диаграмма. Барлық жасырын тестіде Meta-Harness нәтижесі жоғары.

Signal Engine 150 оқыту твиті мен 150 жасырын тест твитін пайдаланып, ақпараттың жаңалығы, деректердің дұрыстығы, егжей-тегжейлілік және мәнер бойынша LLM (үлкен тілдік модель) төрешісімен бағаланды. Орындалым барысында үздік нұсқа оқыту жиынтығының жиынтық көрсеткішін 0.431-ден 0.756-ға, ал жасырын ұпайды 0.456-дан 0.841-ге көтерді. Өсім тек көмексөзді түзетуден емес, тапсырма ортасының өзін өзгертуден алынды: жеңімпаз итерациялар әлеуметтік желідегі шуды сүзуді үйренді, деректерді өзара тексеру қадамдарын қосты және әр нәтиженің нақты дәлелге сүйенуін талап етті. Төмендегі сызба итерация үдерісін көрсетеді.

Signal Engine оқыту сынақтарының сызықтық диаграммасы: үздік ағымдағы және жасырын ұпайлар зерттеу мен жетілдіру итерациялары барысында бастапқы деңгейден мақсатты көрсеткішке қарай өседі.

Сынақтар тарихы осы өсімнің қалай жинақталғанын көрсетеді. Ерте жасалған құрылымдық өзгеріс сол сәттегі үздік нәтижені 0.625-ке жеткізді; дәлелдерді егжей-тегжейлі өңдеу оны 0.679-ға көтерді; ал жетілдірілген рефлексия мен бағалау критерийлерінің циклі көрсеткішті 0.819-ға арттырды. Үміткер орындалымдарының шамамен жартысы нашар нәтиже көрсетті немесе толық сәтсіз аяқталды, бірақ көшбасшылар кестесіне әсер етпеді: әр тармақ оқшау орындалды, жеңілген өзгерістер жойылды, ал келесі ұсыныс жасаушы сол тұйық жолды қайталамауы үшін сәтсіздіктер рефлексия қоймасына жазылды.

Ең бастысы, бүкіл орындалым бойы жасырын деректер қисығы оқыту қисығымен қатар өсті. Бұл тапсырма ортасының оқыту корпусын жаттап алмай, жұмыс үдерісін шынымен жетілдіргенін көрсетеді. Жасырын ұпайлар оқыту ұпайларынан сәл жоғары болды. Біз мұны шағын әрі бөлек екі бөліктің арасындағы қалыпты іріктеу ауытқуы деп түсіндіреміз.

Агенттерге негізделген мультимодальды іздеу жалпыға ашық ViDoRe V3 Computer Science бөлігінде NDCG@10 арқылы өлшенді. Ол 20 оқыту, 10 әзірлеу және 20 жасырын тест сұрауына бөлінді. Тапсырма ортасы жасырын NDCG@10 көрсеткішін 0.705-тен 0.744-ке көтеріп, бағалаудың жалпы нақты уақытын 869 секундтан 54 секундқа қысқартты.

Терең зерттеу 10 эталондық сұрақ бойынша DeepResearch-Eval әдісіне сай мазмұн сапасы мен сілтемелер сапасының жиынтық көрсеткіші арқылы LLM (үлкен тілдік модель) төрешісімен бағаланды. Жетілдірілген код орташа көрсеткішті 0.449-дан 0.802-ге көтерді. Жеңімпаз өзгерістер код айырмасынан анық көрінді: зерттеу агенттері жіберілмей тұрып тәсілдерді салыстыратын бастапқы жоспарлау кезеңі және есептердің бұрын төмен бағаланған өлшемдерін жақсартуға бағытталған соңғы тексеру кезеңі. Бұл жиын шағын әрі бағалауы қымбат болғандықтан, оны бөліктерге бөлмедік және нәтижені іріктеме ішіндегі көрсеткіш деп есептейміз.

CORAL және karpathy/autoresearch жүйелерімен салыстыру

Signal Engine, Агенттерге негізделген мультимодальды іздеу және терең зерттеу ұпайлары мен бағалау кідірісі бойынша Meta-Harness, CORAL және karpathy/autoresearch жүйелерін салыстыратын бағандық диаграммалар.

Үш әдісті де бірдей бюджетпен салыстырдық: бірдей деректер жиындары, негізгі модельдер, итерация шегі және үміткерлерді бағалаудың жалпы саны. Signal Engine жүйесінде Meta-Harness жасырын тесте 0.841 нәтижесіне жетті, ал екі бастапқы әдістің көрсеткіші 0.50-ден төмен болды. Агенттерге негізделген мультимодальды іздеуде біздің топ жасырын NDCG@10 бойынша ең жоғары нәтижеге жетті (CORAL жүйесіндегі 0.700 және karpathy жүйесіндегі 0.738 көрсеткішіне қарсы 0.744) әрі ресми бағалауды 12–14 есе жылдам орындады: 786 және 650 секундқа қарсы 54 секунд. Терең зерттеуде біздің топ 0.802 нәтижесіне жетті, ал екі бастапқы әдістің көрсеткіші 0.52 шамасында қалды. Маңызды ескерту: CORAL мен karpathy/autoresearch жүйелерін жарияланған сипаттамалары бойынша өзіміз қайта жасадық. Сондықтан айырманың бір бөлігі тек әдістерден емес, іске асыру ерекшеліктерінен туындауы мүмкін.

Айырманы төрт жобалау шешімі түсіндіреді. Біріншіден, топ кодты өзгертпей тұрып құрылымды жобалық сипаттама жасайды. Сондықтан ол көмексөзді түзетумен шектелмей, конвейердің жаңа кезеңдері сияқты құрылымдық өзгерістерге озық басымдық береді. Екіншіден, ол ортақ үздік үміткерге негізделген қатарлас тармақтарды орындайды. Сондықтан жақсартулар CORAL жүйесінің тәуелсіз агенттеріне немесе karpathy/autoresearch жүйесінің қатаң тізбекті цикліне қарағанда жылдамырақ жинақталады. Үшіншіден, әр сынақтан кейін келесі ұсыныс жасаушы оқитын құрылымды материалдар қалады (ұпайлар, оқиғалар журналдары және LLM (үлкен тілдік модель) жазған төрт талдау). Төртіншіден, бейімделетін контроллер ілгерілеу тоқтағанда ұсыныс жасаушыны жаңа бағыттарды зерттеуге, ал сәтті нәтижеден кейін нақтылауға бағыттайды.

Біз нені көрсеткен жоқпыз

Жасырын деректер қисықтары домен ішіндегі жалпылануды көрсетеді, бірақ домендер арасындағы тасымалды дәлелдемейді: ЖИ нарығындағы сигналдарды алуға бейімделген жұмыс үдерісі тапсырма ортасын қайта іске қоспайынша заң немесе биомедицина мәтіндерінде дәл солай жұмыс істейді деп күтуге болмайды. Тапсырма ортасы бағалаушы белгілеген мақсатты ғана оңтайландырады. Сондықтан шулы оқыту жиынына немесе дұрыс калибрленбеген төрешіге шамадан тыс бейімделеді. Күрделі орындалым алдында мұқият іріктелген кемінде 20 оқыту элементін және бөлек әзірлеу бөлігін пайдалануды ұсынамыз. Шығын — ең үлкен практикалық шектеу. Әр бағалау толық конвейерді барлық бөлікте қайта орындайды. Таңдалған іздеу үміткерінің өзі шамамен 2,2 миллион кіріс токенін жұмсады, ал gpt-5.5 санатындағы модельде күрделі оңтайландыру бір тапсырмаға бірнеше жүзден мыңнан сәл асатын долларға дейін тұрады. Соңында, бұл көрсеткіштер қайталанған сынақтардан емес, бір реттік орындалымдардан алынды. Сондықтан оларды ресми зерттеу ретінде емес, инженерлік блог жазбасы ретінде жариялап отырмыз.

Қорытынды

Meta-Harness кодты автономды жетілдіруді кәсіпорында қолдануға жеткілікті дәрежеде тәртіпке келтіруге болатынын көрсетеді. Оның негізгі құрамдастары: құрылымдық гипотезалар, болжамды алдын ала сүзу, оқшауланған бағалау, дерек мүмкіндік берген жердегі жасырын тестілеу және әр қабылданған өзгерістің толық аудит ізі. Олар инженерлік топқа жұмыс істейтін бастапқы конвейерден өлшенетіндей жақсы нұсқаға өтудің болжамды жолын береді. Ал операциялық үдерістерге жауапты тұлғаға түсінікті модель ұсынады: автономды зерттеудің артықшылықтары қатаң әрі бюджетті ескеретін шеңберде сақталып, өндіріске шығару алдында адам бақылауынан өтеді.

Авторлар

David Huang және Bjorn Jee