Meta-Harness: વધુ સુરક્ષિત સ્વ-સુધારક એન્ટરપ્રાઇઝ AI કાર્યપ્રવાહ

શિસ્તબદ્ધ Meta-Harness એન્ટરપ્રાઇઝ ટીમોને લાંબા ગાળાનાં કોડિંગ કાર્યોમાં એજન્ટ કાર્યપ્રવાહો સુરક્ષિત રીતે સુધારવામાં મદદ કરે છે.

કારોબારી સારાંશ

  • હાલની સ્વાયત્ત સુધારણા પ્રણાલીઓએ કોડિંગ કાર્યોમાં મજબૂત પરિણામો દર્શાવ્યાં છે, પરંતુ વાસ્તવિક એન્ટરપ્રાઇઝ અમલીકરણ જેવા જટિલ અને લાંબા ગાળાના AI કાર્યપ્રવાહોને તે સુધારી શકે છે કે નહીં તે હજી સ્પષ્ટ નથી.

  • અમારું Meta-Harness સંશોધન સ્વાયત્ત સ્વ-સુધારણાને Agentic Retrieval, Deep Research અને Signal ઇન્ટેલિજન્સના કાર્યપ્રવાહોમાં લાગુ કરે છે. સાથે જ અલગ રાખેલું મૂલ્યાંકન, ઑડિટક્ષમતા, બજેટ નિયંત્રણ અને માનવ મંજૂરી જેવી એન્ટરપ્રાઇઝ જરૂરિયાતો ઉમેરે છે.

  • ત્રણ પ્રતિનિધિ કાર્યભાર પર Meta-Harnessએ કામગીરીમાં નોંધપાત્ર સુધારો કર્યો. તેમાં Signal Engine માટે અલગ રાખેલા પરીક્ષણની કામગીરીમાં 84% સુધારો અને Agentic Multimodal Retrieval માટે વધુ ચોકસાઈ સાથે 16× ઝડપી અમલ સામેલ છે.

  • અગાઉના મોટા ભાગના અભિગમોથી વિપરીત, Meta-Harness શક્ય હોય ત્યાં અલગ રાખેલા ડેટાસેટ પર સફળતા માપે છે, જેથી સુધારા ઑપ્ટિમાઇઝેશનમાં વપરાયેલા ડેટાથી આગળ પણ સામાન્ય બને છે કે નહીં તે જાણી શકાય.

  • આ પરિણામો સૂચવે છે કે સ્વાયત્ત કાર્યપ્રવાહ સુધારણા કોડિંગ માપદંડોથી આગળ વધીને વાસ્તવિક એન્ટરપ્રાઇઝ AI પ્રણાલીઓ સુધી પહોંચી શકે છે અને સતત સુધરતી AI ઍપ્લિકેશનો માટે વ્યવહારુ માર્ગ આપે છે.

Meta-Harness સંશોધનપત્ર, CORAL માળખું અને karpathy/autoresearch સહિત સ્વાયત્ત AI સંશોધનના તાજેતરના કાર્યે દર્શાવ્યું છે કે મૂલ્યાંકન માપદંડ આપવામાં આવે તો કોડિંગ એજન્ટો ઉકેલને પુનરાવર્તિત રીતે સુધારી શકે છે. હજી એ જોવાનું બાકી છે કે આ પદ્ધતિઓ લાંબા ગાળાના AI કાર્યપ્રવાહોમાં અસરકારક બને છે કે નહીં. ઉદાહરણ તરીકે, Agentic Multimodal Retrievalમાં એજન્ટે પ્રશ્નનો જવાબ આપવા મલ્ટિમોડલ વિષયસંગ્રહોમાં વારંવાર શોધવું પડે છે, જ્યારે જટિલ ડેટા-પ્રક્રિયા શૃંખલાઓમાં અનેક પરસ્પર આધારિત પગલાં, સાધન કૉલ અને અપવાદ સંભાળવાના નિર્ણયો જરૂરી હોય છે. વધુ ઊંડો પ્રશ્ન એ છે કે ઑપ્ટિમાઇઝરે ક્યારેય ન જોયેલા ડેટા પર પણ આ લાભ જળવાય છે કે નહીં.

અમારું Meta-Harness સંશોધન અને વિકાસ એ પ્રશ્નનો અમારો જવાબ છે. તે તાજેતરના સંશોધનના વિચારોને એન્ટરપ્રાઇઝ જરૂરિયાતો અનુસાર ઢાળે છે: અલગ રાખેલું મૂલ્યાંકન, ઑડિટ રેકોર્ડ, ખર્ચ મર્યાદા અને કશું મોકલાય તે પહેલાં માનવ સમીક્ષકને સોંપવાનો સ્પષ્ટ તબક્કો.

અમે વાસ્તવિક ગ્રાહકકાર્ય પર આધારિત ત્રણ લાંબા ગાળાનાં કાર્યો પર તેનું પરીક્ષણ કર્યું. Signal Engine AI બજાર વિશેની X પોસ્ટના જીવંત પ્રવાહ પર નજર રાખે છે અને વિશ્વસનીય સ્રોતો ધરાવતા સુવ્યવસ્થિત વલણ અહેવાલો બનાવે છે. Agentic Multimodal Retrieval લખાણ અને છબીના મિશ્ર પ્રશ્નો પર તર્ક કરીને સૌથી સુસંગત દસ્તાવેજી પૃષ્ઠો આપે છે. Deep Research વેબ પર શોધવા, સ્રોતોની પરસ્પર ચકાસણી કરવા અને વિસ્તૃત સંશોધન અહેવાલો લખવા માટે અનેક એજન્ટોનું સંકલન કરે છે.

પરિણામોની ઝલક

  • Signal Engine: અલગ રાખેલા પરીક્ષણનો સંયુક્ત સ્કોર 0.456 → 0.841, એટલે કે સાપેક્ષ રીતે 84% વધારો. એ જ બજેટમાં CORAL અને karpathy/autoresearchનો સ્કોર 0.50થી નીચે રહ્યો.

  • Agentic Multimodal Retrieval: અલગ રાખેલો NDCG@10 સ્કોર 0.705 → 0.744, જ્યારે દરેક મૂલ્યાંકનનો વાસ્તવિક સમય 869 સેકંડથી ઘટીને 54 સેકંડ થયો. એટલે વધુ ચોકસાઈ સાથે ગતિમાં 16× વધારો.

  • Deep Research: 10 સંદર્ભ પ્રશ્નોમાં અહેવાલની ગુણવત્તાનો સંયુક્ત સ્કોર 0.449 → 0.802, જ્યારે આધારરેખાઓનો સ્કોર આશરે 0.52 હતો. આ કાર્યમાં અલગ રાખેલું વિભાજન નહોતું, તેથી અમે આ આંકડાને માત્ર નમૂનાની અંદરનું પરિણામ ગણીએ છીએ.

  • શોધ કાર્યક્ષમતા: અનુમાનાત્મક પરિકલ્પના પુનઃક્રમાંકનથી Signal Engineએ સમાન મૂલ્યાંકન બજેટમાં 20ને બદલે 3 પુનરાવર્તનમાં સંદર્ભ રનના શ્રેષ્ઠ સ્કોરનો 91% હિસ્સો મેળવ્યો.

મોટા ભાગની સ્વાયત્ત સંશોધન પ્રણાલીઓ એ જ ડેટાસેટ પર ઑપ્ટિમાઇઝેશન અને મૂલ્યાંકન કરે છે, તેથી પરિણામ સામાન્ય બને છે કે નહીં તે નક્કી કરવું અશક્ય બને છે. Signal Engine અને Agentic Multimodal Retrieval માટે અમે કડક વિભાજન લાગુ કરીએ છીએ: ઉમેદવારો સ્કોર મેળવી શકે એવો તાલીમ સમૂહ, મૂળભૂત ચકાસણી માટે વિકાસ સમૂહ અને ઑપ્ટિમાઇઝરે ક્યારેય ન જોયેલો અલગ પરીક્ષણ સમૂહ. દરેક નોંધાયેલું પરિણામ તમામ વિભાજનો પર મૂલ્યાંકિત કોડના એક ચોક્કસ સંસ્કરણમાંથી આવે છે. તેથી અમે એક ઉમેદવારનો શ્રેષ્ઠ તાલીમ સ્કોર બીજા ઉમેદવારના શ્રેષ્ઠ પરીક્ષણ સ્કોર સાથે ક્યારેય ભેળવતા નથી.

તે કેવી રીતે કાર્ય કરે છે

દરેક ચક્રમાં, કાર્યપ્રણાલી કોડ બદલવા માટે સુવ્યવસ્થિત પરિકલ્પનાઓનો સમૂહ બનાવે છે. દરેક પરિકલ્પના કઈ કાર્યપદ્ધતિ બદલવાની છે, તે કયા અગાઉના સંસ્કરણ પર આધારિત છે અને કઈ નિષ્ફળતાને લક્ષ્ય બનાવે છે તે જણાવે છે. કોઈ ખર્ચાળ મૂલ્યાંકન થાય તે પહેલાં ક્રમાંકનનું પગલું આ સમૂહને ફિલ્ટર કરે છે. પસંદ થયેલી પરિકલ્પનાઓ સમાંતર કાર્યકર એજન્ટો પાસે જાય છે. તેઓ સહિયારો જ્ઞાનભંડાર વાપરે છે, પરંતુ સંપૂર્ણપણે અલગ વર્કસ્પેસમાં કોડ સંપાદિત કરે છે, જેથી દરેક ઉમેદવારનું ન્યાયી અને સ્વતંત્ર મૂલ્યાંકન થાય. ચક્રના અંતે, રનર એક વિજેતાને આગળ વધારે છે: દૃશ્યમાન વિભાજનોની દરેક તપાસમાં પાસ થયેલો સર્વોચ્ચ સ્કોર ધરાવતો ઉમેદવાર. તે વિજેતા આગામી ચક્ર માટેનો અત્યાધુનિક આધાર બને છે. દરેક અજમાયશ ફક્ત ઉમેરો કરી શકાય એવા પુરાવા ભંડારમાં નિશ્ચિત સમૂહ લખે છે: તેનો કોડ પૅચ, દરેક વિભાજનના સ્કોર, ઇવેન્ટ લૉગ અને તેના ટ્રેસ, ભૂલો, ખર્ચ તથા આત્મચિંતનને આવરી લેતાં LLM દ્વારા લખાયેલા ચાર ટૂંકા વિશ્લેષણ. આગામી ચક્રનો પ્રસ્તાવક આ ઇતિહાસ ફરી વાંચે છે, જેથી કાર્યપ્રણાલી એ જ નિષ્ફળ રસ્તાઓ ફરી અજમાવવાને બદલે શીખેલી બાબતોને સંચિત કરે છે.

ઇનપુટ, સીડ મૂલ્યાંકન, પરિકલ્પના શોધ, સમાંતર એજન્ટ ટીમો, મૂલ્યાંકન વર્કસ્પેસ, સમીક્ષા પરિણામો, પુરાવા ભંડાર તથા સલામતી અને ખર્ચ નિયંત્રણો દર્શાવતો Meta-Harness કાર્યપ્રવાહ આલેખ.

ત્રણ સુરક્ષા ઉપાયો આ ચક્રને સુરક્ષિત રીતે ચલાવે છે. કાર્યક્ષેત્ર નીતિ ઉમેદવાર કઈ ફાઇલોને સ્પર્શી શકે તે મર્યાદિત કરે છે અને તેની બહારના કોઈપણ ફેરફાર પાછા ફેરવે છે. ટોકન અને વાસ્તવિક સમયના બજેટ ખર્ચ મર્યાદા વટાવે ત્યારે પ્રક્રિયા રોકે છે, જ્યારે સમકાલીનતાની મર્યાદા કાર્યપ્રણાલીને મોડલ અને GPUની દર મર્યાદામાં રાખે છે. અને કાર્યપ્રણાલી પોતે કશું જ પ્રોડક્શનમાં મોકલતી નથી. તે સંપૂર્ણ દસ્તાવેજીકરણ સાથે ક્રમાંકિત ઉમેદવાર રજૂ કરે છે, પછી માનવ ઇજનેર તફાવતની સમીક્ષા કરીને તેને પ્રોડક્શનમાં મોકલવો કે નહીં તે નક્કી કરે છે.

આંતરિક કાર્યપદ્ધતિ

સ્થાનિક માળખામાં, ઉપરના ચક્રના દરેક રાઉન્ડને પાંચ ઇજનેરી આધારભૂત ઘટકો ટેકો આપે છે.

  • વર્કસ્પેસ અલગીકરણ. દરેક ઉમેદવાર માટે એક git વર્કટ્રી. ફોર્ક કરેલી આવૃત્તિઓ એક ઑબ્જેક્ટ ડેટાબેઝ વહેંચે છે, પરંતુ એકબીજાની ફાઇલો નહીં. તેથી ઉમેદવારો લગભગ સ્થિર ડિસ્ક ખર્ચે સમાંતર ચાલી શકે છે અને વર્તમાન અત્યાધુનિક આધાર સાથે તફાવત કરવો સરળ બને છે.

  • એક્ઝિક્યુશન સૅન્ડબૉક્સ. ગોઠવણી મુજબ બે સ્થિતિ: ઝડપી પુનરાવર્તન માટે મૂળ સબપ્રોસેસ અથવા સંપૂર્ણપણે અલગ રનટાઇમ. ડેટાસંગ્રહ ફક્ત વાંચી શકાય તેવી રીતે માઉન્ટ થાય છે અને દરેક અજમાયશની અસ્થાયી નિર્દેશિકા ગ્રેડિંગ પછી કાઢી નાખવામાં આવે છે. પરિણામે, કોઈ અજમાયશ ડેટાસેટ બદલી શકતી નથી કે તેની સ્થિતિ આગામી અજમાયશમાં પહોંચાડી શકતી નથી.

  • કાર્યક્ષેત્ર નીતિ. પ્રયોગની ગોઠવણીમાં જાહેર કરેલી માન્ય પાથની યાદી. અજમાયશને ગ્રેડ આપતાં પહેલાં તેની બહાર થયેલો કોઈપણ ફેરફાર પાછો ફેરવાય છે અને અજમાયશને ચિહ્નિત કરવામાં આવે છે. આથી સમીક્ષકને દેખાતો તફાવત જાહેર કરેલા કાર્યક્ષેત્રમાં જ રહેવાની ખાતરી મળે છે.

  • બજેટનું અમલીકરણ. ત્રણ સ્તર: દરેક અજમાયશ માટે ટોકન અને વાસ્તવિક સમયની મર્યાદા, દરેક રન માટે કુલ મર્યાદા અને સમકાલીનતાની મર્યાદા. આ બધાં ખર્ચને અનુમાનયોગ્ય રાખે છે અને કાર્યપ્રણાલી મોડલ તથા માળખાકીય સુવિધાની દર મર્યાદામાં રહે તેની ખાતરી કરે છે.

  • પુરાવા ભંડાર. કોડ પૅચ, દરેક વિભાજનના સ્કોર, ઇવેન્ટ લૉગ અને LLM દ્વારા લખાયેલા ચાર વિશ્લેષણ ધરાવતી ફક્ત ઉમેરો કરી શકાય એવી JSONL ફાઇલ. દરેક અજમાયશ પછી તૈયાર દૃશ્યો (અગ્રતાક્રમ, અત્યાધુનિક આધાર અને નિષ્ફળતા સૂચિ) ફરી બને છે. તેથી પછીના ચક્ર અગાઉના ઇતિહાસ પર આગળ વધી શકે છે અને દરેક રનને બાઇટ-દર-બાઇટ ફરી બનાવી શકાય છે.

આ આધારભૂત ઘટકોમાંથી એક પણ વૈકલ્પિક નથી. કાર્યપ્રણાલીનો હેતુ રનના અંતે સમીક્ષકને ખરેખર મંજૂર કરી શકાય એવું પરિણામ આપવાનો છે: વિજેતા ઉમેદવાર, મર્યાદિત તફાવત, અજમાવેલી દરેક બાબતનો સંપૂર્ણ રેકોર્ડ અને જાણીતો ખર્ચ. પાંચમાંથી કોઈ એકને દૂર કરતાં આ ખાતરીઓમાંથી એક અદૃશ્ય થઈ જાય છે.

અનુમાનાત્મક પરિકલ્પના પુનઃક્રમાંકન

ત્રણેય પ્રયોગો સમાન પરિકલ્પના વ્યૂહરચના વાપરે છે. દરેક પુનરાવર્તનમાં પ્રસ્તાવક બજેટથી ચલાવી શકાય તેના કરતાં વધુ પરિકલ્પનાઓ બનાવે છે: K = 4ના ડિસ્પેચ બજેટ માટે M = 8 ઉમેદવાર. પછી એક અલગ LLM ક્રમાંકકર્તા ત્રીસ સેકંડના એક જ કૉલમાં તમામ 8ને ગોઠવે છે. તેની સામે સંપૂર્ણ ચિત્ર હોય છે: વર્તમાન શ્રેષ્ઠ સ્કોર અને તેના નબળા પરિમાણો, તાજેતરની અજમાયશોના નિષ્ફળતા વિશ્લેષણ અને સાથે મૂકેલા તમામ 8 પ્રસ્તાવ. ટોચના 4 ઉમેદવાર અમલકર્તા પાસે જાય છે, જેમાં પ્રત્યેકને 15થી 30 મિનિટનો ખર્ચ થાય છે. બાકીના 4 કોઈ ખર્ચ કરે તે પહેલાં જ કાઢી નાખવામાં આવે છે.

મૂલ્યાંકનો

આધારભૂત મોડલ સમગ્ર પ્રક્રિયા દરમિયાન સ્થિર રાખવામાં આવ્યાં હતાં. કાર્યપ્રણાલીએ ફક્ત તેમની આસપાસનો કોડ સંપાદિત કર્યો. Signal Engine અને Deep Research gpt-5.5 પર ચાલ્યાં. Agentic Multimodal Retrieval સ્થાનિક રીતે vLLM દ્વારા ઉપલબ્ધ કરાયેલા ઓપન-વેઇટ Qwen3.6-35B-A3B પર ચાલ્યું અને તેની સાથે ColQwen3-4B છબી રિટ્રીવર જોડાયું. સ્થળ પર અનુમાનયોગ્ય ખર્ચ માટે આ સંયોજન પસંદ કરાયું હતું.

નીચેનો આલેખ અમારા ત્રણ મુખ્ય કાર્યોના સ્કોર કેવી રીતે બદલાયા તે દર્શાવે છે. “સીડ” એટલે માનવ ઇજનેરે લખેલો પ્રારંભિક કોડ. “Meta-Harness” એટલે Meta-Harnessને મળેલું શ્રેષ્ઠ સંસ્કરણ. અલગ રાખેલા પરીક્ષણ સમૂહમાં ત્રણેય કાર્યોની કામગીરી સુધરેલી જોવા મળે છે.

Signal Engine, Agentic Multimodal Retrieval અને Deep Researchમાં સીડ તથા Meta-Harnessની કામગીરી સરખાવતો સ્તંભ આલેખ, જેમાં તમામ અલગ રાખેલા પરીક્ષણોમાં Meta-Harness આગળ છે.

Signal Engineનું મૂલ્યાંકન LLM નિર્ણાયક દ્વારા નવીનતા, તથ્યાત્મકતા, સૂક્ષ્મતા અને ભાષાશૈલીના આધારે થયું. તેમાં 150 તાલીમ ટ્વીટ અને 150 અલગ રાખેલી પરીક્ષણ ટ્વીટ વપરાઈ. રન દરમિયાન શ્રેષ્ઠ સંસ્કરણે તાલીમનો સંયુક્ત સ્કોર 0.431થી 0.756 અને અલગ રાખેલો સ્કોર 0.456થી 0.841 કર્યો. આ લાભ ફક્ત પ્રોમ્પ્ટમાં નાના ફેરફારોથી નહીં, પરંતુ કાર્યપ્રણાલીમાં થયેલા બદલાવથી મળ્યા. વિજેતા પુનરાવર્તનો સામાજિક માધ્યમનો ઘોંઘાટ ફિલ્ટર કરવાનું શીખ્યાં, તથ્યોની પરસ્પર ચકાસણીનાં પગલાં ઉમેર્યાં અને દરેક પરિણામને સ્પષ્ટ પુરાવા પર આધારિત રાખ્યું. નીચેનો આલેખ પુનરાવર્તનની પ્રક્રિયા દર્શાવે છે.

Signal Engineની તાલીમ અજમાયશોનો રેખા આલેખ, જેમાં પુનરાવર્તિત શોધક અને સુધારક પ્રયાસો દરમિયાન અત્યાર સુધીના શ્રેષ્ઠ અને અલગ રાખેલા સ્કોર સીડ આધારરેખાથી લક્ષ્ય તરફ સુધરતા દેખાય છે.

અજમાયશનો ઇતિહાસ આ લાભ કેવી રીતે સંચિત થયા તે દર્શાવે છે. શરૂઆતના એક માળખાકીય ફેરફારે તે સમયનો શ્રેષ્ઠ સ્કોર 0.625 કર્યો. પુરાવાની વધુ સૂક્ષ્મ સંભાળે તેને 0.679 સુધી પહોંચાડ્યો અને સુધારેલા આત્મચિંતન તથા માપદંડ ચક્રે તેને 0.819 કર્યો. લગભગ અડધા ઉમેદવારોની રનની કામગીરી નબળી રહી અથવા તે સંપૂર્ણ નિષ્ફળ ગયા, પરંતુ તેમણે અગ્રતાક્રમને દૂષિત કર્યો નહીં. દરેક ફોર્ક કરેલી આવૃત્તિ અલગ ચાલી, હારેલા તફાવતો કાઢી નાખવામાં આવ્યા અને નિષ્ફળતાઓ આત્મચિંતન ભંડારમાં લખાઈ, જેથી આગામી પ્રસ્તાવક એ જ નિષ્ફળ રસ્તો ન અજમાવે.

સૌથી મહત્ત્વનું એ છે કે સમગ્ર રન દરમિયાન અલગ રાખેલો વક્ર તાલીમ વક્રની સાથે વધ્યો. આ સૂચવે છે કે કાર્યપ્રણાલી તાલીમ ડેટાસંગ્રહ યાદ રાખવાને બદલે કાર્યપ્રવાહ સુધારી રહી હતી. અલગ રાખેલા સ્કોર તાલીમ સ્કોર કરતાં થોડા વધુ હતા, જેને અમે બે નાના અને સંપૂર્ણ અલગ વિભાજનો વચ્ચેનો સામાન્ય નમૂનાકીય ઘોંઘાટ માનીએ છીએ.

Agentic Multimodal Retrievalને જાહેર ViDoRe V3 કમ્પ્યુટર સાયન્સ વિભાજન પર NDCG@10 વડે માપવામાં આવે છે. તેને 20 તાલીમ, 10 વિકાસ અને 20 અલગ રાખેલા પરીક્ષણ પ્રશ્નોમાં ગોઠવવામાં આવ્યું છે. કાર્યપ્રણાલીએ અલગ રાખેલો NDCG@10 સ્કોર 0.705થી વધારીને 0.744 કર્યો, જ્યારે મૂલ્યાંકનનો કુલ વાસ્તવિક સમય 869 સેકંડથી ઘટાડીને 54 સેકંડ કર્યો.

Deep Researchને 10 સંદર્ભ પ્રશ્નો પર DeepResearch-Eval અનુસાર, LLM દ્વારા નક્કી કરાતા વિષયવસ્તુની ગુણવત્તા અને સંદર્ભ ગુણવત્તાના સંયુક્ત સ્કોરથી ગ્રેડ આપવામાં આવે છે. સુધારેલા કોડે સરેરાશ સ્કોર 0.449થી વધારીને 0.802 કર્યો. વિજેતા ફેરફારો તફાવતમાં સરળતાથી દેખાતા હતા: કોઈ સંશોધન એજન્ટ મોકલાય તે પહેલાં અભિગમોની સરખામણી કરતું પ્રારંભિક આયોજન પગલું અને અહેવાલોએ અગાઉ નબળો સ્કોર મેળવ્યો હોય તે પરિમાણોને લક્ષ્ય બનાવતું અંતિમ સમીક્ષા પગલું. આ સમૂહ નાનો અને મૂલ્યાંકન માટે ખર્ચાળ હોવાથી અમે તેનું વિભાજન કર્યું નથી અને પરિણામને નમૂનાની અંદરનું ગણીએ છીએ.

CORAL અને karpathy/autoresearch સાથે સરખામણી

Signal Engine, Agentic Multimodal Retrieval અને Deep Researchના સ્કોર તથા મૂલ્યાંકન વિલંબમાં Meta-Harness, CORAL અને karpathy/autoresearchની સરખામણી કરતા સ્તંભ આલેખો.

અમે ત્રણેય પદ્ધતિને સમાન બજેટમાં માપી: સમાન ડેટાસેટ, સમાન આધારભૂત મોડલ, સમાન પુનરાવર્તન મર્યાદા અને ઉમેદવારોનાં સમાન કુલ મૂલ્યાંકન. Signal Engine પર Meta-Harnessએ અલગ રાખેલા પરીક્ષણમાં 0.841 મેળવ્યો, જ્યારે બંને આધારરેખા 0.50થી નીચે રહી. Agentic Multimodal Retrievalમાં અમારી ટીમનો અલગ રાખેલો NDCG@10 સર્વોચ્ચ છે (CORALના 0.700 અને karpathyના 0.738 સામે 0.744) અને સત્તાવાર મૂલ્યાંકન બારથી ચૌદ ગણું ઝડપી ચાલે છે: 786 અને 650 સેકંડ સામે 54 સેકંડ. Deep Researchમાં અમારી ટીમે 0.802 મેળવ્યો, જ્યારે બંને આધારરેખા લગભગ 0.52 પર રહી. સમગ્ર સરખામણી માટે એક સાવચેતી જરૂરી છે: અમે CORAL અને karpathy/karpathyના તેમના પ્રકાશિત વર્ણનો પરથી ફરી અમલમાં મૂક્યાં હતાં. તેથી અંતરનો થોડો ભાગ માત્ર પદ્ધતિના નહીં, પરંતુ અમલીકરણના તફાવતોને કારણે હોઈ શકે છે.

આ અંતર માટે રચનાની ચાર પસંદગીઓ જવાબદાર છે. પ્રથમ, અમારી ટીમ કોઈ કોડ સંપાદિત થાય તે પહેલાં સુવ્યવસ્થિત રચના-વિશિષ્ટતા બનાવે છે. તેથી તે પ્રોમ્પ્ટના નાના ફેરફારો કરતાં શૃંખલાના નવા તબક્કા જેવા માળખાકીય ફેરફારો તરફ વધુ ઝુકે છે. બીજું, તે સહિયારા અત્યાધુનિક ઉમેદવારને આધાર બનાવી સમકાલીન ફોર્ક ચલાવે છે. તેથી CORALના સ્વતંત્ર એજન્ટો અથવા karpathyના કડક ક્રમિક ચક્ર કરતાં સુધારા વધુ ઝડપથી સંચિત થાય છે. ત્રીજું, દરેક અજમાયશ સુવ્યવસ્થિત સામગ્રી (સ્કોર, ઇવેન્ટ લૉગ અને LLM દ્વારા લખાયેલાં ચાર વિશ્લેષણ) મૂકે છે, જેને આગામી પ્રસ્તાવક ફરી વાંચે છે. તેની સામે આધારરેખાઓ માત્ર સરળ પ્રયાસ લૉગ રાખે છે. ચોથું, અવરોધ પછી અનુકૂલનશીલ નિયંત્રક પ્રસ્તાવકને શોધ તરફ અને જીત પછી સુધારણા તરફ દોરે છે. તેની ઉપર અનુમાનાત્મક પરિકલ્પના પુનઃક્રમાંકન નબળા વિચારો બજેટ વાપરે તે પહેલાં તેમને દૂર કરે છે.

અમે શું દર્શાવ્યું નથી

અલગ રાખેલા વક્ર વિષયક્ષેત્રની અંદર સામાન્યકરણ દર્શાવે છે, અન્ય વિષયક્ષેત્રમાં સ્થાનાંતરણ નહીં. AI બજારના સંકેતો કાઢવા માટે અનુકૂલિત કાર્યપ્રવાહ પાસે કાર્યપ્રણાલી ફરી ચલાવ્યા વિના કાનૂની અથવા જૈવચિકિત્સકીય લખાણ પર સમાન કામગીરીની અપેક્ષા ન રાખવી જોઈએ. કાર્યપ્રણાલી પણ ગ્રેડરે નિર્ધારિત કરેલી દિશામાં જ સુધરે છે. તેથી ખામીયુક્ત તાલીમ સમૂહ અથવા ખોટી રીતે માપાંકિત નિર્ણાયકને તે ચોકસાઈથી અતિશય અનુરૂપ બની જશે. ગંભીર રન પહેલાં અમે ઓછામાં ઓછી 20 સારી રીતે પસંદ કરેલી તાલીમ વસ્તુઓ અને અલગ વિકાસ વિભાજનની ભલામણ કરીએ છીએ. ખર્ચ સૌથી મોટી વ્યવહારુ મર્યાદા છે. દરેક મૂલ્યાંકન સંપૂર્ણ વિભાજનો સામે આખી શૃંખલા ફરી ચલાવે છે. ફક્ત પસંદ થયેલા રિટ્રીવલ ઉમેદવારે આશરે 22 લાખ ઇનપુટ ટોકન વાપર્યા અને gpt-5.5 શ્રેણીના મોડલ પર સઘન ઑપ્ટિમાઇઝેશનનો ખર્ચ દરેક કાર્ય માટે સેંકડોથી લઈને થોડા હજાર ડૉલર થાય છે. છેલ્લે, આ આંકડા વારંવાર કરેલી અજમાયશોને બદલે એકલ રનમાંથી આવ્યા છે. તેથી અમે તેમને ઔપચારિક અભ્યાસ તરીકે નહીં, પરંતુ ઇજનેરી બ્લૉગ લેખ તરીકે રજૂ કરી રહ્યા છીએ.

નિષ્કર્ષ

Meta-Harness દર્શાવે છે કે સ્વાયત્ત કોડ સુધારણાને એન્ટરપ્રાઇઝ ઉપયોગ માટે પૂરતી શિસ્તબદ્ધ બનાવી શકાય છે. તેના મુખ્ય ઘટકો છે માળખાકીય પરિકલ્પનાઓ, અનુમાનાત્મક પૂર્વ-ગાળણ, અલગ મૂલ્યાંકન, ડેટા શક્ય બનાવે ત્યાં અલગ રાખેલું પરીક્ષણ અને આગળ વધારેલા દરેક ફેરફાર પાછળનો સંપૂર્ણ ઑડિટ રેકોર્ડ. આ બધાં સાથે મળીને ઇજનેરી ટીમને કાર્યરત સીડ શૃંખલાથી માપી શકાય તેવી વધુ સારી શૃંખલા સુધીનો અનુમાનયોગ્ય માર્ગ આપે છે. તે સંચાલનના માલિકને પણ સરળ માળખું આપે છે: સ્વાયત્ત શોધનો લાભ, કડક અને બજેટ પ્રત્યે સજાગ માળખાની અંદર નિયંત્રિત, તથા કશું મોકલાય તે પહેલાં માનવીની ભાગીદારી સાથે.

લેખકો

David Huang, Bjorn Jee