मुख्य नेव्हिगेशन

Meta-Harness: सुरक्षित स्वयं-सुधारक एंटरप्राइझ एआय कार्यप्रवाह

शिस्तबद्ध मेटा-हार्नेसमुळे एंटरप्राइझ संघ दीर्घकालीन कोडिंग कामांतील एजंट कार्यप्रवाह सुरक्षितपणे सुधारू शकतात.

कार्यकारी सारांश

  • विद्यमान स्वायत्त सुधारणा प्रणालींनी कोडिंग कामांमध्ये चांगले परिणाम दाखवले आहेत. मात्र प्रत्यक्ष एंटरप्राइझ उपयोजनांसारखे गुंतागुंतीचे, दीर्घकालीन एआय कार्यप्रवाह त्या सुधारू शकतात का, हे अद्याप स्पष्ट नाही.

  • आमचे Meta-Harness संशोधन राखीव मूल्यमापन, लेखापरीक्षणक्षमता, अंदाजपत्रक नियंत्रणे आणि मानवी मंजुरी अशा एंटरप्राइझ गरजा जोडून एजंट-आधारित पुनर्प्राप्ती, डीप रिसर्च व संकेत बुद्धिमत्ता कार्यप्रवाहांवर स्वायत्त स्वयं-सुधारणा लागू करते.

  • तीन प्रातिनिधिक कार्यभारांमध्ये Meta-Harness ने कामगिरीत लक्षणीय सुधारणा केली. यात Signal Engine च्या राखीव चाचणी कामगिरीत 84% सुधारणा आणि एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्तीसाठी अधिक अचूकतेसह 16 पट जलद कार्यान्वयन यांचा समावेश आहे.

  • आधीच्या बहुतांश पद्धतींप्रमाणे काम न करता, सुधारणांचे परिणाम अनुकूलनासाठी वापरलेल्या डेटापलीकडेही लागू होतात का हे तपासण्यासाठी Meta-Harness शक्य तिथे राखीव डेटासंचांवर यश मोजतो.

  • या परिणामांवरून स्वायत्त कार्यप्रवाह सुधारणा कोडिंग मानदंडांपलीकडे जाऊन प्रत्यक्ष एंटरप्राइझ एआय प्रणालींना लागू होऊ शकते आणि एआय अनुप्रयोगांच्या सातत्यपूर्ण सुधारणेसाठी व्यवहार्य मार्ग देऊ शकते.

Meta-Harness शोधनिबंध, CORAL चौकट आणि karpathy/autoresearch यांसह स्वायत्त एआय संशोधनातील अलीकडील कामाने दाखवले आहे की मूल्यमापन मापदंड दिल्यास कोडिंग एजंट्स एखाद्या उपायात टप्प्याटप्प्याने सुधारणा करू शकतात. या पद्धती दीर्घकालीन एआय कार्यप्रवाहांना लागू होतात का, हा प्रश्न अद्याप अनुत्तरित आहे. उदाहरणार्थ, प्रश्नाचे उत्तर देण्यासाठी एजंटला बहुमाध्यमीय क्षेत्रीय मजकूरसंग्रहांत वारंवार शोध घ्यावा लागणारी एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्ती किंवा अनेक परस्परावलंबी टप्पे, साधन कॉल आणि अपवाद हाताळण्याचे निर्णय आवश्यक असलेल्या गुंतागुंतीच्या डेटा-प्रक्रिया मालिका. अनुकूलकाने कधीही न पाहिलेल्या डेटावर हे लाभ टिकतात का, हा अधिक मूलभूत प्रश्न आहे.

आमचे Meta-Harness संशोधन व विकास हे त्या प्रश्नाचे उत्तर आहे. हे अलीकडील संशोधनातील कल्पना घेऊन त्यांना एंटरप्राइझ गरजांनुसार बदलते: राखीव मूल्यमापन, लेखापरीक्षण मागोवा, खर्चाची कमाल मर्यादा आणि काहीही जारी होण्यापूर्वी मानवी पुनरावलोकनकर्त्याकडे स्पष्ट हस्तांतरण.

आम्ही प्रत्यक्ष ग्राहकांच्या कामावर आधारित तीन दीर्घकालीन टास्क्सवर त्याची चाचणी केली. Signal Engine एआय बाजाराविषयीच्या X पोस्टच्या थेट प्रवाहावर लक्ष ठेवतो आणि सुयोग्य स्रोतांसह संरचित कल अहवाल तयार करतो. एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्ती सर्वाधिक संबंधित दस्तऐवज पृष्ठे देण्यासाठी मिश्र मजकूर व प्रतिमा प्रश्नांवर तर्क करते. डीप रिसर्च वेबवर शोधणे, स्रोतांची परस्पर पडताळणी करणे आणि सविस्तर संशोधन अहवाल लिहिणे यांसाठी अनेक एजंट्सचे समन्वयन करते.

निकालांचा संक्षिप्त आढावा

  • Signal Engine: राखीव चाचणी संयुक्त गुण 0.456 → 0.841, म्हणजे तुलनात्मकदृष्ट्या 84% वाढ. त्याच अंदाजपत्रकात CORAL आणि karpathy/autoresearch यांचे गुण 0.50 पेक्षा कमी राहिले.

  • एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्ती: राखीव NDCG@10 0.705 → 0.744, तर प्रत्येक मूल्यमापनाचा प्रत्यक्ष कालावधी 869 सेकंदांवरून 54 सेकंदांपर्यंत कमी झाला. म्हणजे अधिक अचूकतेसह 16 पट वेगवाढ.

  • डीप रिसर्च: 10 संदर्भ प्रश्नांसाठी अहवाल-गुणवत्तेचे संयुक्त गुण 0.449 → 0.802, तर आधाररेषांचे गुण सुमारे 0.52 होते. या कामासाठी राखीव विभाजन नसल्याने आम्ही हा आकडा केवळ नमुन्यांतर्गत मानतो.

  • शोध कार्यक्षमता: पूर्वानुमानित गृहीतक पुनर्क्रमवारीसह Signal Engine ने त्याच मूल्यमापन अंदाजपत्रकात संदर्भ रनच्या सर्वोत्तम गुणांपैकी 91% गुण 20 ऐवजी 3 पुनरावृत्त्यांत मिळवले.

बहुतांश स्वायत्त संशोधन प्रणाली एकाच डेटासंचावर अनुकूलन आणि मूल्यमापन करतात. त्यामुळे परिणामाचे सामान्यीकरण होते का हे ठरवणे अशक्य होते. Signal Engine आणि एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्तीसाठी आम्ही काटेकोर विभाजन लागू करतो: उमेदवारांना गुण तपासता येणारा प्रशिक्षण संच, सुसंगतता तपासण्यासाठी विकास संच आणि अनुकूलकाला कधीही न दिसणारा राखीव चाचणी संच. प्रत्येक नोंदवलेला परिणाम सर्व विभाजनांवर गुण दिलेल्या एका विशिष्ट कोड आवृत्तीचा असतो. त्यामुळे एका उमेदवाराचे सर्वोत्तम प्रशिक्षण गुण आणि दुसऱ्याचे सर्वोत्तम चाचणी गुण आम्ही कधीही मिसळत नाही.

हे कसे कार्य करते

प्रत्येक फेरीत हार्नेस कोड बदलण्यासाठी संरचित गृहीतकांचा एक संच तयार करतो. प्रत्येक गृहीतकात बदलायची यंत्रणा, आधार म्हणून वापरलेली आधीची आवृत्ती आणि लक्ष्य केलेला अपयशाचा प्रकार नमूद केला जातो. महागड्या मूल्यमापनांवर खर्च करण्यापूर्वी क्रमवारीचा टप्पा या संचाची छाननी करतो. निवडलेली गृहीतके समान ज्ञानभांडार वापरणाऱ्या, पण पूर्णपणे विलग वर्कस्पेसमध्ये कोड संपादित करणाऱ्या समांतर कार्यकारी एजंट्सकडे जातात. त्यामुळे प्रत्येक उमेदवाराचे न्याय्य आणि स्वतंत्र मूल्यमापन होते. फेरीच्या शेवटी रनर एका विजेत्याला पुढे नेतो: सर्वाधिक गुण मिळवलेला आणि दृश्यमान विभाजनांवरील प्रत्येक तपासणी उत्तीर्ण झालेला उमेदवार. हा विजेता पुढील फेरीचा आधार बनतो. प्रत्येक चाचणी केवळ नोंदी जोडता येणाऱ्या पुरावा संग्रहात कोड पॅच, प्रत्येक विभाजनाचे गुण, घटना नोंद आणि कार्यमागोवा, चुका, खर्च व आत्मपरीक्षण यांवरील LLM-लिखित चार लघु विश्लेषणे असा निश्चित संच लिहिते. पुढील फेरीतील प्रस्तावक हा इतिहास पुन्हा वाचतो. त्यामुळे हार्नेस त्याच निष्फळ मार्गांवर पुन्हा जाण्याऐवजी आधीच्या शिकवणीवर पुढे काम करतो.

इनपुट, सीड मूल्यमापन, गृहीतक शोध, समांतर एजंट संघ, मूल्यमापन वर्कस्पेस, पुनरावलोकन निष्पत्ती, पुरावा संग्रह आणि सुरक्षितता व खर्च नियंत्रणे दाखवणारा Meta-Harness कार्यप्रवाह आकृतीबंध.

तीन सुरक्षाकवचांमुळे हे चक्र सुरक्षितपणे चालवता येते. व्याप्ती धोरण उमेदवाराला कोणत्या फायली बदलता येतील हे मर्यादित करते आणि व्याप्तीबाहेरील सर्व बदल पूर्ववत करते. टोकन व प्रत्यक्ष कालावधीची अंदाजपत्रके खर्चाने कमाल मर्यादा ओलांडताच रन थांबवतात, तर समवर्तीतेच्या मर्यादा हार्नेसला मॉडेल व GPU रेट मर्यादांत ठेवतात. आणि हार्नेस स्वतःहून काहीही प्रत्यक्ष वापरासाठी जारी करत नाही. तो क्रमवारी लावलेला, पूर्ण दस्तऐवजीकरण असलेला उमेदवार तयार करतो. मानवी अभियंता बदलांचा फरक तपासून तो प्रत्यक्ष वापरात आणायचा की नाही हे ठरवतो.

अंतर्गत रचना

स्थानिक तंत्रसंचात वरील चक्राच्या प्रत्येक फेरीमागे पाच अभियांत्रिकी मूलघटक कार्यरत असतात.

  • वर्कस्पेस विलगीकरण. प्रत्येक उमेदवारासाठी एक git कार्यवृक्ष. फोर्क्स समान ऑब्जेक्ट डेटाबेस वापरतात, पण परस्परांच्या फायली कधीच वापरत नाहीत. त्यामुळे जवळपास स्थिर डिस्क खर्चात उमेदवार समांतर चालतात आणि सध्याच्या आघाडीच्या उमेदवाराशी बदलांची तुलना करणे सोपे होते.

  • कार्यान्वयन सॅंडबॉक्स. संरचनेनुसार दोन पद्धती: जलद पुनरावृत्तीसाठी मूळ उपप्रक्रिया किंवा पूर्णपणे विलग रनटाइम. मजकूरसंग्रह केवळ-वाचन पद्धतीने जोडले जातात आणि प्रत्येक चाचणीची तात्पुरती निर्देशिका श्रेणीकरणानंतर हटवली जाते. त्यामुळे चाचणी डेटासंच बदलू शकत नाही किंवा तिची स्थिती पुढील चाचणीत झिरपू शकत नाही.

  • व्याप्ती धोरण. प्रयोगाच्या संरचनेत घोषित केलेली अनुमत पथांची सूची. चाचणीचे श्रेणीकरण होण्यापूर्वी या सूचीबाहेर केलेले सर्व बदल पूर्ववत केले जातात आणि चाचणीला ध्वजांकित केले जाते. त्यामुळे पुनरावलोकनकर्त्याला दिसणारे बदल घोषित व्याप्तीतच राहतील याची खात्री असते.

  • अंदाजपत्रकाची अंमलबजावणी. तीन स्तर: प्रत्येक चाचणीसाठी टोकन व प्रत्यक्ष कालावधीच्या मर्यादा, प्रत्येक रनसाठी एकत्रित कमाल मर्यादा आणि समवर्तीतेची मर्यादा. एकत्रितपणे ते खर्च अंदाजयोग्य ठेवतात आणि हार्नेस मॉडेल व पायाभूत सुविधांच्या रेट मर्यादांत राहील याची खात्री करतात.

  • पुरावा संग्रह. कोड पॅच, प्रत्येक विभाजनाचे गुण, घटना नोंद आणि LLM-लिखित चार विश्लेषणे असलेली केवळ नोंदी जोडता येणारी JSONL फाइल. प्रत्येक चाचणीनंतर साकार दृश्ये (गुणतालिका, आघाडीचा उमेदवार, अपयश अनुक्रमणिका) पुन्हा तयार होतात. त्यामुळे प्रत्येक रनची अक्षरशः पुनरुत्पादकता कायम ठेवून पुढील फेऱ्यांना मागील इतिहासावर काम करता येते.

यापैकी एकही मूलघटक ऐच्छिक नाही. रनच्या शेवटी पुनरावलोकनकर्ता प्रत्यक्ष मंजूर करू शकेल असे काहीतरी देणे हा हार्नेसचा उद्देश आहे: विजेता उमेदवार, मर्यादित बदल, केलेल्या प्रत्येक प्रयत्नाची संपूर्ण नोंद आणि ज्ञात खर्च. या पाचांपैकी कोणताही घटक काढल्यास यांपैकी एक हमी नाहीशी होते.

पूर्वानुमानित गृहीतक पुनर्क्रमवारी

तिन्ही प्रयोगांत समान गृहीतक धोरण वापरले आहे. प्रत्येक पुनरावृत्तीत प्रस्तावक अंदाजपत्रकात चालवता येतील त्यापेक्षा जास्त गृहीतके तयार करतो: K = 4 एवढ्या वितरण अंदाजपत्रकासाठी M = 8 उमेदवार. त्यानंतर स्वतंत्र LLM क्रमवारीकर्ता सर्व आठ उमेदवारांना तीस सेकंदांच्या एका कॉलमध्ये क्रम देतो. त्याच्यासमोर सध्याचे सर्वोत्तम गुण व त्यांतील कमकुवत पैलू, अलीकडील चाचण्यांतील अपयश विश्लेषणे आणि आठही प्रस्तावांची तुलनात्मक माहिती असते. सर्वोत्तम चार उमेदवार कार्यान्वयकाकडे जातात आणि प्रत्येकासाठी 15 ते 30 मिनिटे खर्च होतात. उरलेले चार उमेदवार कोणताही खर्च होण्यापूर्वी वगळले जातात.

मूल्यमापने

संपूर्ण प्रक्रियेत अंतर्निहित मॉडेल बदलली नाहीत. हार्नेसने केवळ त्यांच्या भोवतालचा कोड संपादित केला. Signal Engine आणि डीप रिसर्च gpt-5.5 वर चालवले गेले. एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्ती स्थानिकरीत्या vLLM द्वारे पुरवल्या जाणाऱ्या मुक्त-वजन Qwen3.6-35B-A3B वर चालली आणि तिच्यासोबत ColQwen3-4B प्रतिमा पुनर्प्राप्तक वापरला. स्थानिक खर्च अंदाजयोग्य ठेवण्यासाठी हे संयोजन निवडले.

खालील आलेख आमच्या तीन मुख्य कामांचे गुण कसे बदलले हे दाखवतो. “सीड” म्हणजे मानवी अभियंत्याने लिहिलेला प्रारंभिक कोड. “Meta-Harness” म्हणजे Meta-Harness ला सापडलेली सर्वोत्तम आवृत्ती. राखीव चाचणी संचात तिन्ही कामांची कामगिरी सुधारलेली दिसते.

Signal Engine, एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्ती आणि डीप रिसर्चमध्ये सीड व Meta-Harness यांच्या कामगिरीची तुलना करणारा स्तंभ आलेख. सर्व राखीव चाचण्यांत Meta-Harness वर आहे.

Signal Engine चे ताजेपणा, तथ्यात्मकता, सूक्ष्मता आणि भाषाशैली या निकषांवर LLM निर्णायकाने मूल्यमापन केले. त्यासाठी 150 प्रशिक्षण ट्वीट आणि 150 राखीव चाचणी ट्वीट वापरली. रनदरम्यान सर्वोत्तम आवृत्तीने प्रशिक्षणाचे संयुक्त गुण 0.431 वरून 0.756 आणि राखीव गुण 0.456 वरून 0.841 केले. हे लाभ केवळ प्रॉम्प्टमधील किरकोळ बदलांमुळे नव्हे, तर हार्नेसमधील बदलांमुळे मिळाले. विजयी पुनरावृत्त्यांनी समाजमाध्यमांतील गोंगाट गाळायला शिकवले, तथ्यांची परस्पर पडताळणी करणारे टप्पे जोडले आणि प्रत्येक निष्पत्ती स्पष्ट पुराव्यावर आधारित असणे आवश्यक केले. खालील आकृती पुनरावृत्तीची प्रक्रिया दाखवते.

Signal Engine च्या प्रशिक्षण चाचण्यांचा रेषालेख. पुनरावृत्तीने केलेल्या शोधक व सुधारक प्रयत्नांत चालू सर्वोत्तम आणि राखीव गुण सीड आधाररेषेपासून लक्ष्याकडे सुधारताना दाखवले आहेत.

चाचणी इतिहासातून हे लाभ कसे एकत्रित होत गेले ते दिसते. सुरुवातीच्या एका संरचनात्मक बदलाने त्या वेळचे सर्वोत्तम गुण 0.625 केले. अधिक सूक्ष्म पुरावा हाताळणीने ते 0.679 पर्यंत नेले आणि सुधारित आत्मपरीक्षण व निकष चक्राने ते 0.819 केले. सुमारे निम्म्या उमेदवार रनची कामगिरी कमी होती किंवा ते पूर्णपणे अपयशी ठरले, पण त्यांनी गुणतालिका दूषित केली नाही. प्रत्येक शाखा विलगपणे चालली, पराभूत बदल वगळले गेले आणि पुढील प्रस्तावकाने तोच निष्फळ मार्ग पुन्हा निवडू नये म्हणून अपयशांची नोंद आत्मपरीक्षण संग्रहात झाली.

सर्वांत महत्त्वाचे म्हणजे, संपूर्ण रनमध्ये राखीव गुणांचा आलेख प्रशिक्षण गुणांच्या आलेखासोबत वर गेला. यावरून हार्नेस प्रशिक्षण मजकूरसंग्रह पाठ करण्याऐवजी कार्यप्रवाह सुधारत होता असे दिसते. राखीव गुण प्रशिक्षण गुणांपेक्षा किंचित जास्त होते. दोन लहान व पूर्णपणे स्वतंत्र विभाजनांमधील सामान्य नमुना-गोंगाट म्हणून आम्ही त्याचा अर्थ लावतो.

एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्ती सार्वजनिक ViDoRe V3 संगणकशास्त्र विभाजनावर NDCG@10 ने मोजली जाते. त्यात निवडलेले 20 प्रशिक्षण, 10 विकास आणि 20 राखीव चाचणी प्रश्न आहेत. हार्नेसने राखीव NDCG@10 0.705 वरून 0.744 केला आणि मूल्यमापनाचा एकूण प्रत्यक्ष कालावधी 869 सेकंदांवरून 54 सेकंदांपर्यंत कमी केला.

डीप रिसर्च चे DeepResearch-Eval पद्धतीनुसार 10 संदर्भ प्रश्नांवर आशयाची गुणवत्ता आणि संदर्भांची गुणवत्ता यांच्या LLM-निर्णित संयुक्त गुणांनी श्रेणीकरण केले जाते. सुधारित कोडने सरासरी 0.449 वरून 0.802 केली. विजयी बदल फरकामधून सहज दिसत होते: कोणतेही संशोधन एजंट्स पाठवण्यापूर्वी पद्धतींची तुलना करणारा प्रारंभिक नियोजन टप्पा आणि ज्या पैलूंवर अहवालांना ऐतिहासिकदृष्ट्या कमी गुण मिळाले होते त्यांना लक्ष्य करणारा अंतिम पुनरावलोकन टप्पा. हा संच लहान असून त्याचे मूल्यमापन महाग असल्याने आम्ही त्याचे विभाजन केले नाही आणि परिणाम नमुन्यांतर्गत मानतो.

CORAL आणि karpathy/autoresearch यांच्याशी तुलना

Signal Engine, एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्ती आणि डीप रिसर्च यांमधील गुण व मूल्यमापन विलंबासाठी Meta-Harness, CORAL आणि karpathy/autoresearch यांची तुलना करणारे स्तंभ आलेख.

आम्ही समान डेटासंच, समान अंतर्निहित मॉडेल, समान पुनरावृत्ती मर्यादा आणि उमेदवार मूल्यमापनांची समान एकूण संख्या अशा एकाच अंदाजपत्रकात तिन्ही पद्धतींची मानदंड चाचणी केली. Signal Engine वर Meta-Harness ने राखीव चाचणीत 0.841 गुण मिळवले, तर दोन्ही आधाररेषा 0.50 पेक्षा कमी राहिल्या. एजंट-आधारित बहुमाध्यमीय पुनर्प्राप्तीमध्ये आमच्या संघाचा राखीव NDCG@10 सर्वाधिक आहे (CORAL च्या 0.700 आणि karpathy च्या 0.738 च्या तुलनेत 0.744). तसेच अधिकृत मूल्यमापन बारा ते चौदा पट जलद चालते: 786 आणि 650 सेकंदांच्या तुलनेत 54 सेकंद. डीप रिसर्चमध्ये आमच्या संघाने 0.802 गुण मिळवले, तर दोन्ही आधाररेषा 0.52 च्या आसपास राहिल्या. एक मर्यादा सर्वत्र लागू होते: आम्ही CORAL आणि karpathy/autoresearch त्यांच्या प्रकाशित वर्णनांवरून पुन्हा अंमलात आणले. त्यामुळे काही फरक केवळ पद्धतींऐवजी अंमलबजावणीतील तफावत दर्शवू शकतो.

चार संरचना निवडी हा फरक स्पष्ट करतात. पहिले, कोणताही कोड संपादित करण्यापूर्वी आमचा संघ संरचित रचना विनिर्देश तयार करतो. त्यामुळे प्रॉम्प्टमधील किरकोळ बदलांऐवजी नवीन प्रक्रिया टप्प्यांसारख्या संरचनात्मक बदलांना प्राधान्य मिळते. दुसरे, तो समान आघाडीच्या उमेदवारावर आधारित समवर्ती शाखा चालवतो. त्यामुळे CORAL चे स्वतंत्र एजंट्स किंवा karpathy चे काटेकोर क्रमिक चक्र यांच्यापेक्षा सुधारणा जलद एकत्रित होतात. तिसरे, प्रत्येक चाचणी संरचित निर्मित सामग्री (गुण, घटना नोंदी आणि LLM-लिखित चार विश्लेषणे) मागे ठेवते. पुढील प्रस्तावक ती पुन्हा वाचतो, तर आधाररेषा केवळ साध्या प्रयत्न नोंदी ठेवतात. चौथे, काम अडकल्यानंतर अनुकूल नियंत्रक प्रस्तावकाला शोधाकडे आणि यशानंतर परिष्करणाकडे वळवतो. त्यावर असलेली पूर्वानुमानित गृहीतक पुनर्क्रमवारी कमकुवत कल्पनांवर अंदाजपत्रक खर्च होण्यापूर्वी त्यांना वगळते.

आम्ही काय सिद्ध केलेले नाही

राखीव आलेख क्षेत्रांतर्गत सामान्यीकरण दाखवतात, क्षेत्रांदरम्यानचे हस्तांतरण नाही. एआय बाजारातील संकेत काढण्यासाठी जुळवलेला कार्यप्रवाह हार्नेस पुन्हा न चालवता कायदेशीर किंवा जैववैद्यकीय मजकुरावर टिकेल अशी अपेक्षा करू नये. हार्नेस केवळ श्रेणीकाराने ठरवलेले लक्ष्यच गाठतो. त्यामुळे गोंगाटयुक्त प्रशिक्षण संच किंवा चुकीने समायोजित निर्णायकावर तो अचूकपणे अतिजुळवणी करेल. गंभीर रनपूर्वी किमान 20 काळजीपूर्वक निवडलेले प्रशिक्षण घटक आणि स्वतंत्र विकास विभाजन वापरण्याची आम्ही शिफारस करतो. खर्च ही सर्वांत मोठी व्यावहारिक मर्यादा आहे. प्रत्येक मूल्यमापन सर्व पूर्ण विभाजनांवर संपूर्ण प्रक्रिया पुन्हा चालवते. केवळ निवडलेल्या पुनर्प्राप्ती उमेदवाराने सुमारे 22 लाख इनपुट टोकन वापरले आणि gpt-5.5 श्रेणीच्या मॉडेलवरील गंभीर अनुकूलनासाठी प्रत्येक कामामागे शेकडो ते एक-दोन हजार डॉलर खर्च होतात. शेवटी, हे आकडे वारंवार केलेल्या चाचण्यांऐवजी एकेकट्या रनमधून आले आहेत. म्हणूनच आम्ही ते औपचारिक अभ्यासाऐवजी अभियांत्रिकी ब्लॉग पोस्ट म्हणून सामायिक करत आहोत.

निष्कर्ष

Meta-Harness दाखवतो की स्वायत्त कोड सुधारणा एंटरप्राइझ वापरासाठी पुरेशी शिस्तबद्ध करता येते. संरचनात्मक गृहीतके, पूर्वानुमानित पूर्वगाळणी, विलग मूल्यमापन, डेटाने शक्य होईल तिथे राखीव चाचणी आणि पुढे नेलेल्या प्रत्येक बदलामागील संपूर्ण लेखापरीक्षण मागोवा हे त्याचे मुख्य घटक आहेत. एकत्रितपणे ते अभियांत्रिकी संघाला कार्यरत सीड प्रक्रियेपासून मोजता येईल इतक्या चांगल्या प्रक्रियेपर्यंत जाण्याचा अंदाजयोग्य मार्ग देतात. तसेच परिचालन मालकाला एक सोपे प्रारूप देतात: स्वायत्त शोधाचे लाभ, पण कठोर व अंदाजपत्रक-जागरूक चौकटीत मर्यादित आणि काहीही जारी होण्यापूर्वी प्रक्रियेत मानवी सहभाग.

लेखक

David Huang आणि Bjorn Jee