ነባር የራስ-ሰር ማሻሻያ ስርዓቶች በኮድ ስራዎች ላይ ጠንካራ ውጤት አሳይተዋል፤ ሆኖም ከእውነተኛ የድርጅት ትግበራዎች ጋር የሚመሳሰሉ ውስብስብና ረጅም ሂደት ያላቸውን የAI የስራ ፍሰቶች ማሻሻል ይችሉ እንደሆነ ገና ግልጽ አይደለም።
የMeta-Harness ምርምራችን ራስ-ሰር ራስን ማሻሻልን በወኪል-ተኮር ሰነድ ፍለጋ፣ በጥልቅ ምርምር እና በምልክት አስተውሎት የስራ ፍሰቶች ላይ ይተገብራል። በተጨማሪም ተለይቶ የተያዘ ግምገማን፣ ኦዲት ማድረግ መቻልን፣ የበጀት ቁጥጥርን እና የሰው ፈቃድን የመሳሰሉ የድርጅት መስፈርቶችን ይጨምራል።
በሦስት ተወካይ የስራ ጫናዎች ላይ Meta-Harness አፈጻጸምን በእጅጉ አሻሽሏል። ይህም ለSignal Engine በተለይቶ የተያዘ ፈተና የ84% የአፈጻጸም ማሻሻያ እና ለወኪል-ተኮር ባለብዙ ሞዳል ሰነድ ፍለጋ ከፍተኛ ትክክለኛነትን ከ16× ፈጣን አፈጻጸም ጋር ያካትታል።
ከአብዛኞቹ ቀደምት አቀራረቦች በተለየ Meta-Harness ማሻሻያዎቹ በማመቻቸት ወቅት ከተጠቀመበት ውሂብ ውጭ ጠቅለል ብለው መስራታቸውን ለመገምገም፣ በሚቻልበት ሁሉ ስኬትን በተለይተው በተያዙ የውሂብ ስብስቦች ላይ ይለካል።
እነዚህ ውጤቶች የራስ-ሰር የስራ ፍሰት ማሻሻያ ከኮድ መለኪያዎች አልፎ ወደ እውነተኛ የድርጅት AI ስርዓቶች ሊስፋፋ እንደሚችልና የAI መተግበሪያዎችን በቀጣይነት ለማሻሻል ተግባራዊ መንገድ እንደሚሰጥ ያመለክታሉ።
የMeta-Harness ጽሑፍን፣ የCORAL ማዕቀፍን እና karpathy/autoresearchን ጨምሮ በቅርቡ በራስ-ሰር AI ምርምር ላይ የተሰሩ ስራዎች፣ የግምገማ መለኪያ ሲሰጣቸው የኮድ ወኪሎች አንድን መፍትሔ በተደጋጋሚ ማሻሻል እንደሚችሉ አሳይተዋል። ገና መልስ ያላገኘው ጥያቄ እነዚህ ዘዴዎች ረጅም ሂደት ባላቸው የAI የስራ ፍሰቶች ላይ ይሰሩ እንደሆነ ነው። ለምሳሌ፣ ወኪሉ ለጥያቄ መልስ ለመስጠት ባለብዙ ሞዳል የዘርፍ ኮርፐሶችን በተደጋጋሚ የሚፈልግበት ወኪል-ተኮር ባለብዙ ሞዳል ሰነድ ፍለጋ፣ ወይም በርካታ ተያያዥ ደረጃዎችን፣ የመሣሪያ ጥሪዎችን እና የልዩ ሁኔታ አያያዝ ውሳኔዎችን የሚጠይቁ ውስብስብ የውሂብ ማቀናበሪያ ሂደቶች። ይበልጥ ጥልቅ የሆነው ጥያቄ ማመቻቸቱ ፈጽሞ ባላየው ውሂብ ላይም ማሻሻያዎቹ ጸንተው ይቆዩ እንደሆነ ነው።
የMeta-Harness ምርምርና ልማታችን ለዚህ ጥያቄ የሰጠነው መልስ ነው። ከቅርብ ጊዜ ምርምሮች ሐሳቦችን ወስዶ በድርጅት ፍላጎቶች ዙሪያ እንደገና ይቀርጻቸዋል፤ ተለይቶ የተያዘ ግምገማ፣ የኦዲት አሻራ፣ የወጪ ጣሪያ እና ምንም ነገር ወደ ምርት ከመላኩ በፊት ለሰው ገምጋሚ የሚተላለፍበት ግልጽ ደረጃ።
በእውነተኛ የደንበኞች ስራ ላይ በተቀረጹ ሦስት የረጅም ጊዜ ተግባራት ላይ ፈትነነዋል። Signal Engine ስለAI ገበያ የሚወጡ የX ልጥፎችን ቀጥታ ፍሰት ይከታተላል፤ ምንጫቸው በሚገባ የተጠቀሰና የተዋቀረ የአዝማሚያ ሪፖርቶችንም ያዘጋጃል። ወኪል-ተኮር ባለብዙ ሞዳል ሰነድ ፍለጋ በተቀላቀሉ የጽሑፍና የምስል ጥያቄዎች ላይ በማመዛዘን በጣም ተዛማጅ የሆኑትን የሰነድ ገጾች ይመልሳል። ጥልቅ ምርምር በርካታ ወኪሎች ድሩን እንዲፈልጉ፣ ምንጮችን እንዲያመሳክሩ እና ረጅም የምርምር ሪፖርቶችን እንዲጽፉ ያስተባብራል።
Signal Engine፦ የተለይቶ የተያዘ ፈተና ድምር ውጤት 0.456 → 0.841፤ በአንጻራዊነት የ84% ጭማሪ። CORAL እና karpathy/autoresearch በተመሳሳይ በጀት ከ0.50 በታች ቀርተዋል።
ወኪል-ተኮር ባለብዙ ሞዳል ሰነድ ፍለጋ፦ የተለይቶ የተያዘ NDCG@10 0.705 → 0.744፤ የእያንዳንዱ ግምገማ አጠቃላይ ጊዜም ከ869 ሰከንድ ወደ 54 ሰከንድ ቀንሷል። ይህ ከፍ ካለ ትክክለኛነት ጋር የ16× ፍጥነት ጭማሪ ነው።
ጥልቅ ምርምር፦ በ10 የማጣቀሻ ጥያቄዎች ላይ የሪፖርት ጥራት ድምር ውጤት 0.449 → 0.802፤ የመነሻ ዘዴዎቹ ውጤት ወደ 0.52 ገደማ ነበር። ይህ ተግባር ተለይቶ የተያዘ የውሂብ ክፍል ስላልነበረው ውጤቱን በናሙናው ውስጥ ብቻ እንደተገኘ እንቆጥረዋለን።
የፍለጋ ቅልጥፍና፦ ትንበያዊ የመላምት ደረጃ ዳግም አሰጣጥን በመጠቀም Signal Engine በተመሳሳይ የግምገማ በጀት፣ ከ20 ይልቅ በ3 ድግግሞሾች የማጣቀሻው ሂደት ምርጥ ውጤት 91% ላይ ደርሷል።
አብዛኞቹ የራስ-ሰር ምርምር ስርዓቶች የሚያመቻቹትና የሚገመግሙት በተመሳሳይ የውሂብ ስብስብ ላይ በመሆኑ ውጤቱ ጠቅለል ብሎ ይሰራ እንደሆነ ማወቅ አይቻልም። ለSignal Engine እና ለወኪል-ተኮር ባለብዙ ሞዳል ሰነድ ፍለጋ ጥብቅ ክፍፍል እናስፈጽማለን፤ እጩዎች የሚመዘኑበት የስልጠና ስብስብ፣ መሠረታዊ ማረጋገጫ የሚደረግበት የልማት ስብስብ እና አመቻቹ ፈጽሞ የማያየው ተለይቶ የተያዘ የፈተና ስብስብ። እያንዳንዱ የቀረበ ውጤት በሁሉም የውሂብ ክፍሎች ላይ ከተመዘነ አንድ የተወሰነ የኮድ ስሪት የመጣ ነው። ስለዚህ የአንድን እጩ ምርጥ የስልጠና ውጤት ከሌላ እጩ ምርጥ የፈተና ውጤት ጋር አናቀላቅልም።
በእያንዳንዱ ዙር መደበቂያው ኮዱን ለመቀየር የተዋቀሩ መላምቶችን በቡድን ያመነጫል። እያንዳንዱ መላምት ሊቀይረው የሚፈልገውን ዘዴ፣ መሠረት የሚያደርገውን ቀዳሚ ስሪት እና የሚያነጣጥረውን የብልሽት አይነት ይገልጻል። ውድ የሆኑ ግምገማዎች ከመካሄዳቸው በፊት የደረጃ አሰጣጥ ደረጃው ስብስቡን ያጣራል። ማጣሪያውን ያለፉት መላምቶች የጋራ የእውቀት ማዕከል ለሚጠቀሙ፣ ነገር ግን ኮድን ሙሉ በሙሉ በተለዩ የስራ ቦታዎች ውስጥ ለሚያርቱ በትይዩ የሚሰሩ ወኪሎች ይላካሉ። ይህም እያንዳንዱ እጩ በፍትሐዊነትና በተናጥል እንዲመዘን ያደርጋል። በዙሩ መጨረሻ አስኬጁ አንድ አሸናፊ ይመርጣል፤ ይህም በሚታዩት የውሂብ ክፍሎች ላይ ሁሉንም ማረጋገጫዎች ያለፈው ከፍተኛ ውጤት ያለው እጩ ነው። ያ አሸናፊ ቀጣዩ ዙር የሚመሠረትበት ግንባር ቀደም እጩ ይሆናል። እያንዳንዱ ሙከራ የኮድ ማስተካከያውን፣ የእያንዳንዱን የውሂብ ክፍል ውጤት፣ የክስተት ምዝግብ እና አሻራውን፣ ስህተቶቹን፣ ወጪውንና ነጸብራቁን የሚሸፍኑ በLLM የተጻፉ አራት አጭር ትንታኔዎችን በመረጃ ብቻ የሚጨመርበት የማስረጃ ማከማቻ ውስጥ ያስቀምጣል። የቀጣዩ ዙር አቅራቢ ይህን ታሪክ መልሶ ያነባል፤ በዚህም መደበቂያው ያልሰሩ ተመሳሳይ ሙከራዎችን ከመድገም ይልቅ የተማረውን እያከማቸ ይሄዳል።


ሦስት መከላከያዎች ዑደቱን በደህና ማስኬድ ያስችላሉ። የወሰን ፖሊሲ እጩው ሊነካቸው የሚችላቸውን ፋይሎች ይገድባል፤ ከወሰኑ ውጭ የተደረገን ለውጥም ይመልሳል። የቶክን እና የጊዜ በጀቶች ወጪው ከጣሪያው ሲያልፍ ሂደቱን ያቆማሉ፤ የትይዩ ስራ ገደቦችም መደበቂያው በሞዴልና በGPU የአጠቃቀም ፍጥነት ገደቦች ውስጥ እንዲቆይ ያደርጋሉ። በተጨማሪም መደበቂያው ራሱ ምንም ነገር ወደ ምርት አይልክም። በደረጃ የተደረደረና ሙሉ ሰነድ ያለው እጩ ያቀርባል፤ የሰው መሐንዲስም ልዩነቱን ገምግሞ ወደ ምርት ይግባ ወይም አይግባ ይወስናል።
በአካባቢያዊ ስርዓት ላይ ከላይ ላለው ዑደት እያንዳንዱ ዙር መሠረት የሚሆኑ አምስት የምሕንድስና መርሆች አሉ።
የስራ ቦታ መለያየት። ለእያንዳንዱ እጩ አንድ git worktree። ቅጂ ቅርንጫፎቹ የኦብጀክት ውሂብ ጎታ ይጋራሉ፣ ነገር ግን የእርስ በርሳቸውን ፋይሎች አይጋሩም። ይህም እጩዎች የዲስክ ወጪው ሳይጨምር በትይዩ እንዲሰሩና ከአሁኑ ግንባር ቀደም እጩ ጋር ልዩነታቸውን በቀላሉ ለማየት ያስችላል።
የማስፈጸሚያ ማግለያ። በውቅሩ መሠረት ሁለት ሁነታዎች አሉት፤ ለፈጣን ድግግሞሽ ቤተኛ ንዑስ ሂደት ወይም ሙሉ በሙሉ የተለየ የማስኬጃ አካባቢ። ኮርፐሶቹ ለንባብ ብቻ ተጭነው ይቀርባሉ፤ የእያንዳንዱ ሙከራ ጊዜያዊ ማውጫም ከውጤት አሰጣጥ በኋላ ይሰረዛል። በዚህም ሙከራው የውሂብ ስብስቡን መቀየር ወይም ሁኔታውን ወደ ቀጣዩ ሙከራ ማስተላለፍ አይችልም።
የወሰን ፖሊሲ። በሙከራው ውቅር የተገለጸ የተፈቀዱ ዱካዎች ዝርዝር። ከዚህ ውጭ የተነካ ማንኛውም ነገር ሙከራው ከመመዘኑ በፊት ይመለሳል፤ ሙከራውም ምልክት ይደረግበታል። ስለዚህ ገምጋሚው የሚያየው ልዩነት በተገለጸው ወሰን ውስጥ እንደሚቆይ ዋስትና አለው።
የበጀት ገደብ ማስከበር። ሦስት ደረጃዎች አሉ፤ ለእያንዳንዱ ሙከራ የቶክንና የጊዜ ገደብ፣ ለእያንዳንዱ ሂደት አጠቃላይ ጣሪያ እና የትይዩ ስራ ገደብ። እነዚህ በአንድነት ወጪውን ሊተነበይ የሚችል ያደርጉታል፤ መደበቂያውም በሞዴልና በመሠረተ ልማት የአጠቃቀም ፍጥነት ገደቦች ውስጥ እንዲቆይ ያረጋግጣሉ።
የማስረጃ ማከማቻ። የኮድ ማስተካከያውን፣ የእያንዳንዱን የውሂብ ክፍል ውጤት፣ የክስተት ምዝግብ እና በLLM የተጻፉትን አራት ትንታኔዎች የያዘ፣ መረጃ ብቻ የሚጨመርበት JSONL። የተዘጋጁ እይታዎች—የውጤት ሰሌዳ፣ ግንባር ቀደም እጩ እና የብልሽት ማውጫ—ከእያንዳንዱ ሙከራ በኋላ እንደገና ይፈጠራሉ። ይህም ቀጣይ ዙሮች በቀደመው ታሪክ ላይ እንዲገነቡና እያንዳንዱ ሂደት ባይት በባይት እንደገና ሊፈጠር እንዲችል ያደርጋል።
ከእነዚህ መርሆች አንዱም አማራጭ አይደለም። የመደበቂያው ዓላማ በሂደቱ መጨረሻ ገምጋሚው በእርግጥ ሊያጸድቀው የሚችል ነገር ማቅረብ ነው፤ አሸናፊ እጩ፣ የተወሰነ ልዩነት፣ የተሞከሩት ነገሮች ሙሉ መዝገብ እና የታወቀ ወጪ። ከአምስቱ አንዱን ብታስወግዱ ከእነዚህ ዋስትናዎች አንዱ ይጠፋል።
ሦስቱም ሙከራዎች ተመሳሳይ የመላምት ስልት ይጠቀማሉ። በእያንዳንዱ ድግግሞሽ አቅራቢው በጀቱ ሊያስኬደው ከሚችለው በላይ መላምቶችን ያመነጫል፤ ለK = 4 የማሰማራት በጀት M = 8 እጩዎች። ከዚያ የተለየ LLM ደረጃ ሰጪ ሙሉ መረጃውን በማየት ስምንቱንም በአንድ የ30 ሰከንድ ጥሪ ያደራጃል፤ የአሁኑን ምርጥ ውጤትና ደካማ ገጽታዎቹን፣ ከቅርብ ሙከራዎች የተገኙ የብልሽት ትንታኔዎችን እና ስምንቱንም ሐሳቦች ጎን ለጎን። ከፍተኛ ደረጃ ያገኙት 4 እጩዎች ለእያንዳንዳቸው ከ15 እስከ 30 ደቂቃ በሚፈጅ ወጪ ወደ አስፈጻሚው ይላካሉ። ሌሎቹ 4 እጩዎች ምንም ወጪ ከማስከተላቸው በፊት ይወገዳሉ።
መሠረታዊዎቹ ሞዴሎች በሂደቱ በሙሉ ሳይቀየሩ ቆይተዋል፤ መደበቂያው ያርትዕ የነበረው በዙሪያቸው ያለውን ኮድ ብቻ ነው። Signal Engine እና ጥልቅ ምርምር በgpt-5.5 ላይ ተካሂደዋል። ወኪል-ተኮር ባለብዙ ሞዳል ሰነድ ፍለጋ በvLLM አማካይነት በአካባቢው በሚቀርበው ክፍት-ክብደት Qwen3.6-35B-A3B ላይ ተካሂዷል፤ ከColQwen3-4B የምስል ፈላጊ ጋርም ተጣምሯል። ይህ ጥምረት የተመረጠው በተቋሙ ውስጥ ያለው ወጪ ሊተነበይ እንዲችል ነው።
ከታች ያለው ገበታ የሦስቱ ዋና ተግባራችን ውጤቶች እንዴት እንደተለወጡ ያሳያል። "መነሻ" የሰው መሐንዲስ የጻፈው መጀመሪያ ኮድ ነው። "Meta-Harness" በMeta-Harness የተገኘው ምርጥ ስሪት ነው። በተለይቶ የተያዘው የፈተና ስብስብ ላይ በሦስቱም ተግባራት የአፈጻጸም ማሻሻያ ታይቷል።


Signal Engine 150 የስልጠና ትዊቶችንና 150 ተለይተው የተያዙ የፈተና ትዊቶችን በመጠቀም፣ ትኩስነትን፣ እውነታዊነትን፣ ዝርዝርነትንና ቃናን በሚመዝን LLM ዳኛ ተገምግሟል። በሂደቱ ውስጥ ምርጡ ስሪት የስልጠና ድምር ውጤቱን ከ0.431 ወደ 0.756፣ ተለይቶ የተያዘውን ውጤት ደግሞ ከ0.456 ወደ 0.841 አሻሽሏል። ማሻሻያዎቹ የመጡት ከእርምጃ ማስተካከያዎች ብቻ ሳይሆን በመደበቂያው ላይ ከተደረጉ ለውጦች ነው። አሸናፊዎቹ ድግግሞሾች የማኅበራዊ ሚዲያ ጫጫታን ማጣራት ተምረዋል፣ የእውነታ ማመሳከሪያ ደረጃዎችን ጨምረዋል፣ እያንዳንዱ ውጤትም በግልጽ ማስረጃ ላይ እንዲመሠረት አድርገዋል። ከታች ያለው ንድፍ የድግግሞሹን ሂደት ያሳያል።


የሙከራዎቹ ታሪክ እነዚህ ማሻሻያዎች እንዴት እየተከማቹ እንደሄዱ ያሳያል። ቀደም ብሎ የተደረገ መዋቅራዊ ለውጥ በሂደት ላይ ያለውን ምርጥ ውጤት ወደ 0.625 ከፍ አደረገው፤ ይበልጥ ዝርዝር የማስረጃ አያያዝ ወደ 0.679 አደረሰው፤ የተጣራ የነጸብራቅና የመስፈርት ዑደትም ወደ 0.819 ከፍ አደረገው። ከእጩዎቹ ሂደቶች ግማሽ ያህሉ ደካማ አፈጻጸም አሳይተዋል ወይም ሙሉ በሙሉ ከሽፈዋል፤ ነገር ግን የውጤት ሰሌዳውን አላበላሹም። እያንዳንዱ ቅጂ ቅርንጫፍ በተናጥል ተካሂዷል፣ ያልተሳኩ ልዩነቶች ተሰርዘዋል፣ ብልሽቶቹም ቀጣዩ አቅራቢ ተመሳሳይ የማይሰራ መንገድ እንዳይደግም በነጸብራቅ ማከማቻው ውስጥ ተመዝግበዋል።
ከሁሉም በላይ ተለይቶ የተያዘው ኩርባ በሂደቱ በሙሉ ከስልጠናው ኩርባ ጋር አብሮ ከፍ ብሏል። ይህም መደበቂያው የስልጠና ኮርፐሱን ከመሸምደድ ይልቅ የስራ ፍሰቱን እያሻሻለ እንደነበር ያመለክታል። ተለይተው የተያዙት ውጤቶች ከስልጠና ውጤቶቹ በትንሹ ከፍ ያሉ ነበሩ። ይህን በሁለት ትናንሽና ተለያይተው በተያዙ የውሂብ ክፍሎች መካከል እንደሚከሰት የተለመደ የናሙና ጫጫታ እንተረጉመዋለን።
ወኪል-ተኮር ባለብዙ ሞዳል ሰነድ ፍለጋ በይፋዊው ViDoRe V3 Computer Science ክፍል ላይ NDCG@10ን በመጠቀም ይለካል፤ ክፍሉም 20 የስልጠና፣ 10 የልማት እና 20 ተለይተው የተያዙ የፈተና ጥያቄዎች እንዲኖሩት ተዘጋጅቷል። መደበቂያው ተለይቶ የተያዘውን NDCG@10 ከ0.705 ወደ 0.744 ከፍ ሲያደርግ፣ የግምገማውን አጠቃላይ ጊዜ ከ869 ሰከንድ ወደ 54 ሰከንድ ቀንሷል።
ጥልቅ ምርምር በ10 የማጣቀሻ ጥያቄዎች ላይ DeepResearch-Evalን በመከተል፣ በLLM በሚዳኝ የይዘት ጥራትና የማጣቀሻ ጥራት ድምር ውጤት ይመዘናል። የተሻሻለው ኮድ አማካዩን ከ0.449 ወደ 0.802 ከፍ አድርጎታል። አሸናፊዎቹ ለውጦች ከልዩነቱ በቀላሉ ሊታዩ ይችላሉ፤ ማንኛውም የምርምር ወኪል ከመሰማራቱ በፊት አቀራረቦችን የሚያነጻጽር የቅድመ ዕቅድ ደረጃ፣ እና ሪፖርቶች ቀደም ሲል ዝቅተኛ ውጤት ባገኙባቸው ገጽታዎች ላይ የሚያተኩር የመጨረሻ ግምገማ ደረጃ። ይህ ስብስብ አነስተኛና ለመገምገም ውድ በመሆኑ አልከፈልነውም፤ ውጤቱንም በናሙናው ውስጥ እንደተገኘ እንቆጥረዋለን።


ሦስቱንም ዘዴዎች በተመሳሳይ በጀት ላይ አነጻጽረናል፤ ተመሳሳይ የውሂብ ስብስቦች፣ ተመሳሳይ መሠረታዊ ሞዴሎች፣ ተመሳሳይ የድግግሞሽ ገደብ እና ተመሳሳይ አጠቃላይ የእጩዎች ግምገማ ብዛት። በSignal Engine ላይ Meta-Harness በተለይቶ በተያዘው ፈተና 0.841 ላይ ደርሷል፤ ሁለቱም የመነሻ ዘዴዎች ግን ከ0.50 በታች ቀርተዋል። በወኪል-ተኮር ባለብዙ ሞዳል ሰነድ ፍለጋ ላይ ቡድናችን ከፍተኛውን ተለይቶ የተያዘ NDCG@10 አግኝቷል፤ 0.744፣ ከCORAL 0.700 እና ከkarpathy 0.738 ጋር ሲነጻጸር። ይፋዊውን ግምገማም ከ12 እስከ 14 እጥፍ በፍጥነት ያካሂዳል፤ 54 ሰከንድ፣ ከ786 እና 650 ሰከንድ ጋር ሲነጻጸር። በጥልቅ ምርምር ላይ ቡድናችን 0.802 ላይ ሲደርስ፣ ሁለቱም የመነሻ ዘዴዎች በ0.52 አካባቢ ቀርተዋል። በሁሉም ውጤቶች ላይ አንድ ጥንቃቄ ያስፈልጋል፤ CORALን እና karpathy/autoresearchን ከታተሙ መግለጫዎቻቸው ተነስተን እንደገና ተግብረናቸዋል። ስለዚህ ከልዩነቱ የተወሰነው የዘዴዎቹን ብቻ ሳይሆን የትግበራ ልዩነቶችንም ሊያንጸባርቅ ይችላል።
ልዩነቱን የፈጠሩት አራት የንድፍ ምርጫዎች ናቸው። በመጀመሪያ፣ ቡድናችን ማንኛውም ኮድ ከመታረሙ በፊት የተዋቀረ የንድፍ ዝርዝር ያመነጫል። ይህም ከእርምጃ ማስተካከያዎች ይልቅ እንደ አዳዲስ የሂደት ደረጃዎች ያሉ መዋቅራዊ ለውጦችን እንዲመርጥ ያደርገዋል። ሁለተኛ፣ በጋራ ግንባር ቀደም እጩ ላይ የተመሠረቱ ቅጂ ቅርንጫፎችን በአንድ ጊዜ ያስኬዳል። በዚህም ማሻሻያዎቹ ከCORAL ነጻ ወኪሎች ወይም ከkarpathy ጥብቅ ተከታታይ ዑደት ይልቅ በፍጥነት ይከማቻሉ። ሦስተኛ፣ እያንዳንዱ ሙከራ ቀጣዩ አቅራቢ መልሶ የሚያነባቸውን የተዋቀሩ ቅርሶች—ውጤቶች፣ የክስተት ምዝግቦች እና በLLM የተጻፉ አራት ትንታኔዎች—ይተዋል፤ የመነሻ ዘዴዎቹ ግን ቀላል የሙከራ ምዝግቦችን ብቻ ያስቀምጣሉ። አራተኛ፣ ተለዋዋጭ ተቆጣጣሪው መሻሻል ሲቆም አቅራቢውን ወደ አሰሳ፣ ስኬት ከተገኘ በኋላ ደግሞ ወደ ማጥራት ይመራዋል። ትንበያዊ የመላምት ደረጃ ዳግም አሰጣጥም ደካማ ሐሳቦች በጀት ከማውጣታቸው በፊት ከላይ ሆኖ ያስወግዳቸዋል።
ተለይተው የተያዙት ኩርባዎች በተመሳሳይ ዘርፍ ውስጥ ጠቅለል ብሎ መስራትን እንጂ ወደ ሌላ ዘርፍ መሸጋገርን አያሳዩም። ለAI ገበያ ምልክት ማውጣት የተስተካከለ የስራ ፍሰት፣ መደበቂያው እንደገና ሳይካሄድ በሕግ ወይም በባዮሜዲካል ጽሑፍ ላይ ውጤታማ ይሆናል ተብሎ መጠበቅ የለበትም። መደበቂያው የሚወጣውም ገምጋሚው የገለጸውን ኮረብታ ብቻ ነው። ስለዚህ ጫጫታ ያለበት የስልጠና ስብስብ ወይም በትክክል ያልተመጠነ ዳኛ በታማኝነት ከመጠን በላይ ይስማማል። ከባድ ሂደት ከመጀመሩ በፊት ቢያንስ 20 በጥንቃቄ የተዘጋጁ የስልጠና ንጥሎችን እና የተለየ የልማት ክፍልን እንመክራለን። ወጪ ትልቁ ተግባራዊ ገደብ ነው። እያንዳንዱ ግምገማ ሙሉውን የስራ ሂደት በሁሉም የውሂብ ክፍሎች ላይ እንደገና ያስኬዳል። የተመረጠው የሰነድ ፍለጋ እጩ ብቻ ወደ 2.2 ሚሊዮን የግብዓት ቶክኖች ተጠቅሟል፤ በgpt-5.5 ደረጃ ሞዴል ላይ የሚካሄድ ከባድ ማመቻቸትም ለእያንዳንዱ ተግባር ከመቶዎች እስከ ጥቂት ሺህ ዶላሮች ያስወጣል። በመጨረሻም እነዚህ ቁጥሮች የመጡት ከተደጋጋሚ ሙከራዎች ሳይሆን ከአንድ ሂደት ነው። ለዚህም ነው እንደ መደበኛ ጥናት ሳይሆን እንደ የምሕንድስና የብሎግ ልጥፍ የምናጋራቸው።
Meta-Harness የራስ-ሰር ኮድ ማሻሻያን ለድርጅት አጠቃቀም በቂ ሥርዓት ያለው ማድረግ እንደሚቻል ያሳያል። ዋናዎቹ ክፍሎች መዋቅራዊ መላምቶች፣ ትንበያዊ ቅድመ ማጣሪያ፣ የተለየ ግምገማ፣ ውሂቡ በሚፈቅድበት ሁሉ ተለይቶ የተያዘ ፈተና እና ከእያንዳንዱ ወደፊት ከተላለፈ ለውጥ በስተጀርባ ያለ ሙሉ የኦዲት አሻራ ናቸው። እነዚህ በአንድነት የምሕንድስና ቡድኑ ከሚሰራ የመነሻ ሂደት ወደ በሚለካ ደረጃ የተሻለ ሂደት የሚደርስበትን ሊተነበይ የሚችል መንገድ ይሰጣሉ። ለኦፕሬሽን ኃላፊውም ቀላል ሞዴል ይሰጣሉ፤ የራስ-ሰር አሰሳ ጥቅም፣ በጥብቅና በጀትን በሚያገናዝብ ማዕቀፍ ውስጥ ተገድቦ፣ ምንም ነገር ወደ ምርት ከመላኩ በፊት ሰው በዑደቱ ውስጥ እንዲኖር።