Հիմնական նավիգացիա

Meta-Harness․ ավելի անվտանգ ինքնակատարելագործվող կորպորատիվ ԱԲ աշխատանքային հոսքեր

Կարգապահ Meta-Harness-ը կորպորատիվ թիմերին օգնում է երկարատև ծրագրավորման առաջադրանքներում անվտանգ բարելավել ագենտների աշխատանքային հոսքերը։

Համառոտ ամփոփում

  • Ինքնավար կատարելագործման ներկայիս համակարգերը ծրագրավորման առաջադրանքներում բարձր արդյունքներ են ցույց տվել, սակայն պարզ չէ՝ կարո՞ղ են դրանք բարելավել իրական կորպորատիվ տեղակայումներին նմանվող բարդ և երկարատև ԱԲ աշխատանքային հոսքերը։

  • Meta-Harness-ի մեր հետազոտությունը ինքնավար ինքնակատարելագործումը կիրառում է ագենտային որոնման, խորքային ուսումնասիրության և ազդանշանային տվյալների վերլուծության աշխատանքային հոսքերում՝ միաժամանակ ավելացնելով կորպորատիվ պահանջներ, օրինակ` առանձնացված գնահատումը, աուդիտի հնարավորությունը, բյուջեի վերահսկումը և մարդու կողմից հաստատումը։

  • Երեք ներկայացուցչական ծանրաբեռնվածություններում Meta-Harness-ը զգալիորեն բարելավել է արդյունքները՝ ներառյալ Signal Engine-ի առանձնացված թեստի արդյունավետության 84% աճը և ագենտային բազմամոդալ որոնման ավելի բարձր ճշգրտությունը՝ 16 անգամ արագ կատարմամբ։

  • Ի տարբերություն նախորդ մոտեցումների մեծ մասի՝ Meta-Harness-ը, հնարավորության դեպքում, հաջողությունը չափում է առանձնացված թեստային տվյալների հավաքածուներով՝ պարզելու համար, թե արդյոք բարելավումները պահպանվում են նաև օպտիմալացման ժամանակ չօգտագործված տվյալների վրա։

  • Այս արդյունքները ցույց են տալիս, որ աշխատանքային հոսքերի ինքնավար կատարելագործումը կարող է ծրագրավորման չափորոշիչներից անցնել իրական կորպորատիվ ԱԲ համակարգերին՝ ստեղծելով ԱԲ հավելվածների շարունակական բարելավման գործնական ուղի։

Ինքնավար ԱԲ հետազոտությունների վերջին աշխատանքները, այդ թվում՝ Meta-Harness հոդվածը, CORAL համակարգը և karpathy/autoresearch-ը, ցույց են տվել, որ ծրագրավորող ագենտները կարող են գնահատման չափանիշի հիման վրա պարբերաբար բարելավել լուծումը։ Դեռևս բաց է այն հարցը, թե արդյոք այդ մեթոդները կիրառելի են երկարատև ԱԲ աշխատանքային հոսքերի համար, օրինակ՝ ագենտային բազմամոդալ որոնման, որտեղ ագենտը հարցին պատասխանելու համար պետք է բազմամոդալ ոլորտային կորպուսներում կրկնվող որոնումներ կատարի, կամ տվյալների մշակման բարդ խողովակաշարերի, որոնք պահանջում են բազմաթիվ փոխկապակցված քայլեր, գործիքների կանչեր և բացառությունների մշակման որոշումներ։ Ավելի խորքային հարցն այն է, թե արդյոք ձեռքբերումները պահպանվում են օպտիմալացնողին անհասանելի տվյալների վրա։

Meta-Harness-ի մեր հետազոտությունն ու մշակումը այդ հարցի պատասխանն է։ Այն վերջին հետազոտությունների գաղափարները վերաձևավորում է կորպորատիվ կարիքներին համապատասխան՝ առանձնացված գնահատում, աուդիտի հետքեր, ծախսերի առավելագույն շեմեր և մինչև թողարկելը մարդկային վերանայողին հանձնելու հստակ փուլ:

Մենք այն փորձարկել ենք իրական հաճախորդների աշխատանքին նմանեցված երեք երկարաժամկետ առաջադրանքներում։ Signal Engine-ը հետևում է AI շուկայի մասին X-ի գրառումների ուղիղ հոսքին և կազմում աղբյուրներով հիմնավորված, կառուցվածքային միտումների զեկույցներ։ Ագենտային բազմամոդալ որոնումը վերլուծում է տեքստից ու պատկերներից կազմված հարցումները և վերադարձնում փաստաթղթերի առավել համապատասխան էջերը։ Խորքային ուսումնասիրությունը համակարգում է բազմաթիվ ագենտների՝ համացանցում որոնելու, աղբյուրները խաչաձև ստուգելու և ծավալուն հետազոտական զեկույցներ գրելու համար։

Արդյունքները՝ մեկ հայացքով

  • Signal Engine․ առանձնացված թեստի համակցված միավորը՝ 0.456 → 0.841, հարաբերական աճը՝ 84%։ Նույն բյուջեով CORAL-ը և karpathy/autoresearch-ը մնացել են 0.50-ից ցածր։

  • Ագենտային բազմամոդալ որոնում․ առանձնացված NDCG@10-ը՝ 0.705 → 0.744, իսկ մեկ գնահատման իրական ժամանակը 869 վ-ից նվազել է մինչև 54 վ։ Այսինքն՝ 16 անգամ արագացում՝ ավելի բարձր ճշգրտությամբ։

  • Խորքային ուսումնասիրություն․ զեկույցի որակի համակցված միավորը՝ 0.449 → 0.802՝ 10 հեղումային հարցերի համար, մինչդեռ ելակետային լուծումների ցուցանիշը մոտ 0.52 էր։ Այս առաջադրանքը չուներ առանձնացված բաժանում, ուստի ցուցանիշը համարում ենք միայն ընտրանքի ներսում ստացված արդյունք։

  • Որոնման արդյունավետություն․ վարկածների կանխատեսական վերադասակարգմամբ Signal Engine-ը նույն գնահատման բյուջեով 3 կրկնափուլում հասել է 91%-ի` հղումային գործարկման լավագույն միավորի՝ 20-ի փոխարեն։

Ինքնավար հետազոտական համակարգերի մեծ մասն օպտիմալացումն ու գնահատումը կատարում է նույն տվյալների հավաքածուի վրա, ինչի պատճառով հնարավոր չէ պարզել՝ արդյոք արդյունքն ընդհանրացվում է։ Signal Engine-ի և ագենտային բազմամոդալ որոնման համար կիրառում ենք խիստ բաժանում՝ ուսուցման հավաքածու, որով թեկնածուները կարող են գնահատվել, մշակման հավաքածու՝ տրամաբանական ստուգումների համար, և առանձնացված թեստային հավաքածու, որը օպտիմալացնողը երբեք չի տեսնում։ Ներկայացված յուրաքանչյուր արդյունք ստացվել է կոդի մեկ որոշակի տարբերակը տվյալների բոլոր բաժանումներում գնահատելով, ուստի երբեք չենք համադրում մի թեկնածուի ուսուցման լավագույն միավորը մյուսի թեստային լավագույն միավորի հետ։

Ինչպես է այն աշխատում

Յուրաքանչյուր փուլում հարնեսը ստեղծում է կոդը փոխելու կառուցվածքային վարկածների փաթեթ։ Յուրաքանչյուր վարկած նշում է փոխվող մեխանիզմը, հիմք ծառայող նախորդ տարբերակը և թիրախային խափանման տեսակը։ Դասակարգման փուլը զտում է փաթեթը՝ նախքան թանկարժեք գնահատումների իրականացումը։ Մնացած վարկածները փոխանցվում են զուգահեռ աշխատող ագենտներին, որոնք օգտվում են ընդհանուր գիտելիքների բազայից, բայց կոդը խմբագրում են լիովին մեկուսացված աշխատատարածքներում, որպեսզի յուրաքանչյուր թեկնածու գնահատվի արդար և անկախ։ Փուլի վերջում գործարկիչն առաջ է մղում մեկ հաղթողի՝ ամենաբարձր միավորով թեկնածուին, որը նաև անցել է տեսանելի բաժանումների բոլոր ստուգումները։ Այդ հաղթողը դառնում է հաջորդ փուլի հիմք հանդիսացող առաջադեմ տարբերակը։ Յուրաքանչյուր փորձ անփոփոխ փաթեթ է գրանցում միայն հավելումներ ընդունող ապացույցների պահոցում՝ կոդի փոփոխությունը, յուրաքանչյուր բաժանման միավորները, իրադարձությունների մատյանը և LLM-ի գրած չորս կարճ վերլուծությունները՝ կատարման հետագծի, սխալների, ծախսի ու անդրադարձի մասին։ Հաջորդ փուլի առաջարկողը վերընթերցում է այս պատմությունը, ինչի շնորհիվ հարնեսը կուտակում է սովորածը՝ նույն անհաջող ուղիները կրկին փորձելու փոխարեն։

Meta-Harness-ի աշխատանքային հոսքի սխեմա՝ մուտքային տվյալներով, սկզբնական գնահատմամբ, վարկածների որոնմամբ, ագենտների զուգահեռ թիմերով, գնահատման աշխատատարածքով, ստուգման արդյունքներով, ապացույցների պահոցով և անվտանգության ու ծախսերի վերահսկիչներով։

Երեք պաշտպանիչ սահմանափակում ապահովում են ցիկլի անվտանգ գործարկումը։ Կիրառման շրջանակի կանոնը սահմանափակում է, թե թեկնածուն որ ֆայլերը կարող է փոխել, և հետ է շրջում շրջանակից դուրս բոլոր փոփոխությունները։ Թոքենների և իրական ժամանակի բյուջեները դադարեցնում են գործարկումը սահմանաչափը գերազանցելիս, իսկ զուգահեռության սահմանափակումները հարնեսը պահում են մոդելի ու GPU-ի հաճախականության սահմաններում։ Հարնեսն ինքնուրույն երբեք ոչինչ չի թողարկում։ Այն տրամադրում է դասակարգված ու ամբողջությամբ փաստագրված թեկնածու, իսկ ինժեները ստուգում է տարբերությունը և որոշում՝ արդյոք այն պետք է ներդրվի արտադրական միջավայրում։

Ներքին կառուցվածքը

Տեղային տեխնոլոգիական փաթեթում վերը նկարագրված ցիկլի յուրաքանչյուր փուլի հիմքում ինժեներական հինգ բաղադրիչ կա։

  • Աշխատատարածքի մեկուսացում։ Յուրաքանչյուր թեկնածուի համար՝ մեկ git worktree։ Պատճեններն օգտագործում են օբյեկտների ընդհանուր տվյալների բազա, բայց միմյանց ֆայլերը` երբեք։ Սա թույլ է տալիս թեկնածուները զուգահեռ գործարկել՝ սկավառակի գրեթե անփոփոխ ծախսով, և հեշտությամբ համեմատել ընթացիկ առաջադեմ տարբերակի հետ։

  • Կատարման սանդբոքս։ Կարգավորմամբ ընտրվող երկու ռեժիմ՝ արագ փորձարկումների համար տեղային ենթագործընթաց կամ լիովին մեկուսացված կատարման միջավայր։ Կորպուսները միացվում են միայն ընթերցման ռեժիմով, իսկ յուրաքանչյուր փորձի ժամանակավոր պանակը գնահատումից հետո ջնջվում է։ Արդյունքում փորձը չի կարող փոխել տվյալների հավաքածուն կամ իր վիճակը փոխանցել հաջորդ փորձին։

  • Կիրառման շրջանակի կանոն։ Փորձի կարգավորումներում սահմանված թույլատրելի ուղիների ցանկ։ Դրանից դուրս կատարված ցանկացած փոփոխություն հետ է շրջվում մինչև փորձի գնահատումը, իսկ փորձը նշվում է որպես խախտում։ Այսպիսով, ստուգողին ցուցադրվող տարբերությունը երաշխավորված մնում է հայտարարված շրջանակում։

  • Բյուջեի սահմանափակումների կիրառում։ Երեք շերտ՝ յուրաքանչյուր փորձի թոքենների ու իրական ժամանակի սահմանաչափեր, մեկ գործարկման ընդհանուր առավելագույն շեմ և զուգահեռության սահմանափակում։ Միասին դրանք ծախսերը կանխատեսելի են պահում և ապահովում, որ հարնեսը չգերազանցի մոդելի ու ենթակառուցվածքի հարցումների հաճախականության սահմանաչափերը։

  • Ապացույցների պահոց։ Միայն հավելման համար նախատեսված JSONL՝ կոդի փոփոխությամբ, յուրաքանչյուր բաժանման միավորներով, իրադարձությունների մատյանով և LLM-ի գրած չորս վերլուծություններով։ Նյութականացված ներկայացումները (առաջատարների աղյուսակը, առաջադեմ տարբերակը և խափանումների ինդեքսը) վերաստեղծվում են յուրաքանչյուր փորձից հետո։ Այդպես հաջորդ փուլերը հիմնվում են նախորդ պատմության վրա, իսկ յուրաքանչյուր գործարկում վերարտադրվում է բայթ առ բայթ։

Այս բաղադրիչներից ոչ մեկն ընտրովի չէ։ Հարնեսի նպատակը գործարկման վերջում վերանայողին իսկապես հաստատելի արդյունք տալն է՝ հաղթող թեկնածու, սահմանափակ փոփոխությունների տարբերություն, կատարված բոլոր փորձերի ամբողջական գրառում և հայտնի ծախս։ Այս հինգից որևէ մեկը հեռացնելիս երաշխիքներից մեկը վերանում է։

Վարկածների կանխատեսական վերադասակարգում

Երեք փորձերն էլ օգտագործում են վարկածների նույն ռազմավարությունը։ Յուրաքանչյուր կրկնափուլում առաջարկողը ստեղծում է ավելի շատ վարկածներ, քան թույլ է տալիս բյուջեն՝ M = 8 թեկնածու K = 4 գործարկման բյուջեի համար։ Այնուհետև առանձին LLM դասակարգիչը մեկ երեսունվայրկյանանոց կանչով դասավորում է բոլոր 8-ը՝ ամբողջ պատկերը տեսնելով՝ ընթացիկ լավագույն միավորն ու դրա թույլ կողմերը, վերջին փորձերի խափանումների վերլուծությունները և բոլոր 8 առաջարկները կողք կողքի։ Լավագույն 4-ը փոխանցվում են կատարողին՝ յուրաքանչյուրի համար 15-30 րոպե ծախսով։ Մյուս 4-ը հեռացվում են՝ նախքան որևէ ռեսուրս ծախսելը։

Գնահատումներ

Հիմքում ընկած մոդելներն ամբողջ ընթացքում անփոփոխ էին․ հարնեսը խմբագրում էր միայն դրանց հետ կապված կոդը։ Signal Engine-ը և խորքային ուսումնասիրությունն աշխատել են gpt-5.5-ով։ Ագենտային բազմամոդալ որոնումն աշխատել է բաց կշիռներով Qwen3.6-35B-A3B մոդելով, որը տեղային սպասարկվում էր vLLM-ի միջոցով և զուգակցված էր ColQwen3-4B պատկերների որոնման մոդուլի հետ։ Այս համադրությունն ընտրվել էր ներքին ենթակառուցվածքում կանխատեսելի ծախսեր ապահովելու համար։

Ստորև բերված գծապատկերը ցույց է տալիս մեր երեք հիմնական առաջադրանքների միավորների փոփոխությունը։ "Սկզբնական տարբերակը" մարդու՝ ինժեների գրած մեկնարկային կոդն է։ "Meta-Harness"-ը Meta-Harness-ի գտած լավագույն տարբերակն է։ Առանձնացված թեստային հավաքածուում տեսնում ենք արդյունավետության աճ բոլոր երեք առաջադրանքների համար։

Սյունակային գծապատկեր, որը համեմատում է սկզբնական տարբերակի և Meta-Harness-ի արդյունավետությունը Signal Engine-ի, ագենտային բազմամոդալ որոնման ու խորքային ուսումնասիրության համար․ բոլոր առանձնացված թեստերում Meta-Harness-ի արդյունքներն ավելի բարձր են։

Signal Engine-ը LLM դատավորի միջոցով գնահատվել է թարմության, փաստական ճշտության, մանրամասնության և տոնայնության չափանիշներով՝ օգտագործելով ուսուցման 150 և առանձնացված թեստի 150 թվիթ։ Գործարկման ընթացքում լավագույն տարբերակի ուսուցման համակցված միավորը 0.431-ից աճել է մինչև 0.756, իսկ առանձնացված միավորը՝ 0.456-ից մինչև 0.841։ Առաջընթացը պայմանավորված էր հենց հարնեսի փոփոխություններով, ոչ միայն հարցումների ճշգրտմամբ․ հաղթող կրկնափուլերը սովորեցին զտել սոցիալական մեդիայի աղմուկը, ավելացրին փաստերի խաչաձև ստուգման քայլեր և պահանջեցին, որ յուրաքանչյուր արդյունք հիմնված լինի հստակ ապացույցների վրա։ Ստորև բերված սխեման ցույց է տալիս կրկնափուլային գործընթացը։

Signal Engine-ի ուսուցման փորձերի գծային գծապատկեր, որտեղ ընթացիկ լավագույն և առանձնացված միավորները կրկնվող հետազոտման ու կատարելագործման փորձերի ընթացքում սկզբնական մակարդակից մոտենում են նպատակային ցուցանիշին։

Փորձերի պատմությունը ցույց է տալիս, թե ինչպես են այդ ձեռքբերումները կուտակվել։ Վաղ փուլում կատարված կառուցվածքային փոփոխությունը ընթացիկ լավագույն միավորը հասցրեց 0.625-ի, ապացույցների ավելի մանրամասն մշակումը՝ 0.679-ի, իսկ անդրադարձի և գնահատման չափորոշիչների կատարելագործված ցիկլը՝ 0.819-ի։ Թեկնածուների գործարկումների մոտ կեսը ավելի վատ արդյունք տվեց կամ ամբողջությամբ ձախողվեց, բայց դրանք չազդեցին առաջատարների աղյուսակի վրա․ յուրաքանչյուր պատճեն աշխատում էր մեկուսացված, չհաղթած տարբերակների փոփոխությունները հեռացվում էին, իսկ խափանումները գրանցվում էին անդրադարձի պահոցում, որպեսզի հաջորդ առաջարկողը չկրկնի նույն անհաջող ուղին։

Ամենակարևորը՝ ամբողջ գործարկման ընթացքում առանձնացված թեստի կորը բարձրացել է ուսուցման կորին զուգահեռ։ Սա ցույց է տալիս, որ հարնեսը բարելավում էր աշխատանքային հոսքը, այլ ոչ թե մտապահում ուսուցման կորպուսը։ Առանձնացված թեստի միավորները փոքր-ինչ բարձր էին ուսուցման միավորներից, ինչը մեկնաբանում ենք որպես երկու փոքր և չհատվող բաժանումների սովորական ընտրանքային աղմուկ։

Ագենտային բազմամոդալ որոնումը չափվում է NDCG@10-ով՝ հանրային ViDoRe V3 Computer Science բաժանման վրա, որը կազմվել է ուսուցման 20, մշակման 10 և առանձնացված թեստի 20 հարցումներից։ Հարնեսը առանձնացված NDCG@10-ը 0.705-ից բարձրացրել է մինչև 0.744՝ միաժամանակ գնահատման ընդհանուր իրական ժամանակը 869 վայրկյանից կրճատելով մինչև 54 վայրկյան։

Խորքային ուսումնասիրությունը գնահատվում է բովանդակային և հղումների որակի՝ LLM դատավորով որոշվող համակցված միավորով՝ հետևելով DeepResearch-Eval-ին, 10 հղումային հարցերի հիման վրա։Բարելավված կոդը միջին միավորը 0.449-ից բարձրացրել է մինչև 0.802։ Հաղթող փոփոխությունները հեշտ էր տեսնել տարբերությունում․ նախնական պլանավորման քայլ, որը համեմատում է մոտեցումները մինչև հետազոտող ագենտների ուղարկումը, և վերջնական ստուգման քայլ՝ ուղղված այն չափանիշներին, որոնցով զեկույցները նախկինում ցածր միավորներ էին ստացել։ Քանի որ այս հավաքածուն փոքր է, իսկ գնահատումը՝ թանկ, մենք այն չենք բաժանել և արդյունքը համարում ենք ընտրանքի ներսում ստացված։

Համեմատություն CORAL-ի և karpathy/autoresearch-ի հետ

Սյունակային գծապատկերներ, որոնք համեմատում են Meta-Harness-ի, CORAL-ի և karpathy/autoresearch-ի ցուցանիշներն ու գնահատման ուշացումը Signal Engine-ի, ագենտային բազմամոդալ որոնման և խորքային ուսումնասիրության համար։

Երեք մեթոդներն էլ համեմատել ենք նույն բյուջեով՝ նույն տվյալների հավաքածուներով, նույն հիմքային մոդելներով, կրկնափուլերի նույն սահմանաչափով և թեկնածուների գնահատումների նույն ընդհանուր քանակով։ Signal Engine-ի առանձնացված թեստում Meta-Harness-ը հասնում է 0.841-ի, մինչդեռ երկու ելակետային լուծումներն էլ մնացել են 0.50-ից ցածր։ Ագենտային բազմամոդալ որոնման դեպքում մեր թիմն ունի առանձնացված NDCG@10-ի ամենաբարձր ցուցանիշը (0.744CORAL-ի 0.700-ի և karpathy-ի 0.738-ի համեմատ) և պաշտոնական գնահատումն իրականացնում է 12-14 անգամ ավելի արագ՝ 54 վայրկյանում՝ 786 և 650 վայրկյանի համեմատ։ Խորքային ուսումնասիրության դեպքում մեր թիմը հասնում է 0.802-ի, մինչդեռ երկու ելակետային լուծումներն էլ մնացել են մոտ 0.52-ի սահմանում։ Մի վերապահում վերաբերում է բոլոր արդյունքներին․ CORAL-ը և karpathy/autoresearch-ը վերաիրականացրել ենք դրանց հրապարակված նկարագրությունների հիման վրա, ուստի տարբերության մի մասը կարող է պայմանավորված լինել իրականացման, ոչ միայն մեթոդների տարբերությամբ։

Տարբերությունը բացատրվում է նախագծման չորս ընտրությամբ։ Նախ՝ մեր թիմը մինչև կոդի որևէ փոփոխություն ստեղծում է կառուցվածքային նախագծման տեխնիկական բնութագիր, ինչը նպաստում է նոր խողովակաշարային փուլերի նման կառուցվածքային փոփոխություններին՝ հարցումների ճշգրտումների փոխարեն։ Երկրորդ՝ այն զուգահեռ գործարկում է ընդհանուր առաջադեմ թեկնածուի վրա հիմնված պատճեններ, ուստի բարելավումներն ավելի արագ են կուտակվում, քան CORAL-ի անկախ ագենտների կամ karpathy-ի խիստ հաջորդական ցիկլի դեպքում։ Երրորդ՝ յուրաքանչյուր փորձ թողնում է կառուցվածքային արտեֆակտներ. (միավորներ, իրադարձությունների մատյաններ և LLM-ի հեղինակած չորս վերլուծություններ), որոնք կարդում է հաջորդ առաջարկողը, մինչդեռ ելակետային լուծումները պահպանում են միայն փորձերի պարզ մատյանները։ Չորրորդ՝ հարմարվող վերահսկիչը լճացումից հետո առաջարկողին ուղղում է դեպի հետազոտում, իսկ հաղթանակից հետո՝ կատարելագործում։ Դրա վերևում վարկածների կանխատեսական վերադասակարգումը հեռացնում է թույլ գաղափարները՝ նախքան դրանց վրա բյուջե ծախսելը։

Ինչ չենք ապացուցել

Առանձնացված կորերը ցույց են տալիս ընդհանրացում նույն տիրույթում, ոչ թե փոխանցում այլ տիրույթներ․ ԱԲ շուկայի ազդանշանների արդյունահանման համար կարգավորված աշխատանքային հոսքից չպետք է ակնկալել նույն արդյունքը իրավական կամ կենսաբժշկական տեքստերի վրա՝ առանց հարնեսը կրկին գործարկելու։ Հարնեսը նաև շարժվում է միայն գնահատողի սահմանած ուղղությամբ, ուստի աղմկոտ ուսուցման հավաքածուին կամ սխալ չափաբերված դատավորին ճշգրտորեն գերհարմարեցում տեղի կունենա։ Լուրջ գործարկումից առաջ խորհուրդ ենք տալիս ունենալ առնվազն 20 խնամքով ընտրված ուսուցման տարր և մշակման առանձին բաժանում։ Ծախսը գործնական ամենամեծ սահմանափակումն է։ Յուրաքանչյուր գնահատում ամբողջ խողովակաշարը կրկին գործարկում է բոլոր բաժանումների վրա։ Միայն ընտրված որոնման թեկնածուն սպառել է մոտ 2.2 միլիոն մուտքային թոքեն, իսկ gpt-5.5 դասի մոդելով լուրջ օպտիմալացման արժեքը մեկ առաջադրանքի համար տատանվում է մի քանի հարյուրից մինչև հազարից փոքր-ինչ ավելի դոլար։ Վերջապես, այս թվերը ստացվել են մեկական գործարկումներից, ոչ թե կրկնվող փորձերից, ուստի դրանք ներկայացնում ենք ինժեներական բլոգային գրառման, այլ ոչ պաշտոնական հետազոտության տեսքով։

Եզրակացություն

Meta-Harness-ը ցույց է տալիս, որ կոդի ինքնավար կատարելագործումը կարող է բավական կարգապահ դառնալ կորպորատիվ կիրառման համար։ Հիմնական բաղադրիչներն են կառուցվածքային վարկածները, կանխատեսական նախնական զտումը, մեկուսացված գնահատումը, տվյալների հնարավորության դեպքում առանձնացված թեստավորումը և առաջ մղված յուրաքանչյուր փոփոխության ամբողջական աուդիտի հետքը։ Միասին դրանք ինժեներական թիմին տալիս են աշխատող սկզբնական խողովակաշարից դեպի չափելիորեն ավելի լավ տարբերակ անցնելու կանխատեսելի ուղի, իսկ գործառնական պատասխանատուին՝ պարզ մոդել․ ինքնավար հետազոտման առավելությունները պահվում են խիստ, բյուջեն հաշվի առնող շրջանակում, և մինչև որևէ թողարկում մարդը մասնակցում է որոշմանը։

Հեղինակներ

David Huang, Bjorn Jee