കോഡിംഗ് രംഗത്ത് നിലവിലുള്ള സ്വയംനിയന്ത്രിത മെച്ചപ്പെടുത്തൽ സംവിധാനങ്ങൾ മികച്ച ഫലങ്ങൾ കാണിക്കുന്നുണ്ടെങ്കിലും പ്രായോഗിക തലത്തിൽ കമ്പനികളിലെ വലിയ പ്രോജക്റ്റുകൾ പോലെ സങ്കീർണ്ണവും ദീർഘകാലയളവിലുള്ളതുമായ AI പ്രവർത്തനരീതികൾ മെച്ചപ്പെടുത്താൻ അവയ്ക്കാകുമോ എന്നത് ഇപ്പോഴും വ്യക്തമല്ല.
ഞങ്ങളുടെ Meta-ഹാർനെസ് ഗവേഷണം, ഏജൻ്റിക് റിട്രീവൽ, ഡീപ് റിസർച്ച്, സിഗ്നൽ ഇൻ്റലിജൻസ് തുടങ്ങിയ പ്രവർത്തനരീതികൾക്ക് സ്വയം മെച്ചപ്പെടാനുള്ള ശേഷി നൽകുന്നു. ഇതോടൊപ്പം നീട്ടിവെക്കപ്പെട്ട മൂല്യനിർണ്ണയം, ഓഡിറ്റ് സൗകര്യം, ബജറ്റ് നിയന്ത്രണങ്ങൾ, മനുഷ്യ അംഗീകാരം തുടങ്ങിയ എൻ്റർപ്രൈസ് ആവശ്യകതകളും ഇതിൽ ഉൾപ്പെടുത്തിയിരിക്കുന്നു.
മൂന്ന് പ്രധാന ജോലികളിലുടനീളം, Meta-ഹാർനെസ് പ്രകടനത്തിൽ വലിയ മുന്നേറ്റം ഉണ്ടാക്കി. സിഗ്നൽ എഞ്ചിൻ്റെ മാറ്റിവെച്ച പരിശോധനാ പ്രകടനം 84% മെച്ചപ്പെട്ടു; ഏജൻ്റിക് മൾട്ടിമോഡൽ റിട്രീവലിൽ 16 മടങ്ങ് വേഗതയോടെ ഉയർന്ന കൃത്യതയും ഇത് കൈവരിച്ചു.
മറ്റ് മിക്ക മുൻകാല സമീപനങ്ങളിൽ നിന്നും വ്യത്യസ്തമായി, ഒപ്റ്റിമൈസേഷനിൽ ഉപയോഗിച്ച ഡാറ്റയ്ക്കപ്പുറം ഈ പുരോഗതികൾക്ക് പൊതുവായ സ്വഭാവമുണ്ടോ എന്ന് വിലയിരുത്താൻ സാധ്യമാകുന്നിടത്തെല്ലാം Meta-ഹാർനെസ് വിജയം അളക്കുന്നത് മാറ്റിവെച്ച ഡാറ്റാസെറ്റുകൾ ഉപയോഗിച്ചാണ്.
ഈ ഫലങ്ങൾ സൂചിപ്പിക്കുന്നത്, കോഡിംഗ് മാനദണ്ഡങ്ങൾക്ക് അപ്പുറം പ്രായോഗിക തലത്തിൽ എൻ്റർപ്രൈസ് AI സംവിധാനങ്ങളിലേക്ക് സ്വയം ഭരണ പ്രവർത്തനരീതി മെച്ചപ്പെടുത്തൽ വ്യാപിപ്പിക്കാൻ കഴിയും എന്നാണ്. ഇത് AI ആപ്ലിക്കേഷനുകൾ നിരന്തരമായി മെച്ചപ്പെടുത്തുന്നതിനുള്ള ഒരു പ്രായോഗിക മാർഗ്ഗം നൽകുന്നു.
Meta-ഹാർനെസ് പ്രബന്ധം, CORAL ചട്ടക്കൂട്, karpathy/autoresearch എന്നിവയുൾപ്പെടെ സ്വയം ഭരണാധികാരമുള്ള AI ഗവേഷണങ്ങളിൽ അടുത്തിടെ നടന്ന ജോലികൾ കാണിക്കുന്നത്, ഒരു മൂല്യനിർണ്ണയ മാനദണ്ഡം നൽകിയാൽ കോഡിംഗ് ഏജൻ്റുകൾക്ക് ഒരു പരിഹാരം ആവർത്തിച്ച് മെച്ചപ്പെടുത്താൻ കഴിയും എന്നാണ്. എന്നാൽ, ഒരു ചോദ്യത്തിന് ഉത്തരം നൽകാൻ ഒന്നിലധികം മാധ്യമങ്ങളിലുള്ള വിവരശേഖരങ്ങളിൽ ഒരു ഏജൻ്റ് ആവർത്തിച്ച് തിരയേണ്ടി വരുന്ന 'ഏജൻ്റിക് മൾട്ടിമോഡൽ റിട്രീവൽ' പോലുള്ള ദീർഘകാല AI പ്രവർത്തനരീതികളിലേക്കോ അല്ലെങ്കിൽ പരസ്പരം ആശ്രയിച്ചിരുന്ന നിരവധി ഘട്ടങ്ങളും ടൂൾ കോളുകളും എക്സെപ്ഷൻ-ഹാൻഡ്ലിംഗ് തീരുമാനങ്ങളും ആവശ്യമായ സങ്കീർണ്ണമായ ഡാറ്റാ പ്രോസസ്സിംഗ് പൈപ്പ്ലൈനുകളിലേക്കോ ഈ രീതികൾ മാറ്റാൻ കഴിയുമോ എന്നത് ഇപ്പോഴും ഒരു തുറന്ന ചോദ്യമായി അവശേഷിക്കുന്നു. ഒപ്റ്റിമൈസർ ഒരിക്കലും കാണാത്ത ഡാറ്റയിലും ഈ നേട്ടങ്ങൾ നിലനിൽക്കുമോ എന്നതാണ് ഇതിലെ കൂടുതൽ ഗൗരവമുള്ള ചോദ്യം.
ആ ചോദ്യത്തിനുള്ള ഞങ്ങളുടെ മറുപടിയാണ് Meta-ഹാർനെസ് R&D. അത്യാധുനിക ഗവേഷണങ്ങളിൽ നിന്നുള്ള ആശയങ്ങൾ ഉൾക്കൊണ്ട് അവയെ കോർപ്പറേറ്റ് ആവശ്യങ്ങൾക്കനുസരിച്ച് ഞങ്ങൾ മാറ്റിയെടുത്തിരിക്കുന്നു; പ്രത്യേകിച്ചും, മാറ്റിവെച്ച മൂല്യനിർണ്ണയങ്ങൾ, ഓഡിറ്റ് രേഖകൾ, ചെലവുപരിധികൾ എന്നിവ ഇതിലൂടെ ഉറപ്പാക്കുന്നു. അതോടൊപ്പം, ഏതൊരു കാര്യവും പുറത്തുവിടുന്നതിന് മുമ്പ് അത് ഒരു മാനുഷിക നിരൂപകന് കൈമാറാനുള്ള കൃത്യമായ സംവിധാനവും ഇതിലുണ്ട്.
പ്രായോഗിക തലത്തിലുള്ള ക്ലയൻ്റ് ജോലികളെ അടിസ്ഥാനമാക്കി തയ്യാറാക്കിയ, ദീർഘനേരം നീണ്ടുനിൽക്കുന്ന മൂന്ന് മോഡൽ ടാസ്കുകളിൽ ഞങ്ങൾ ഇത് പരീക്ഷിച്ച് നോക്കി. AI വിപണിയുമായി ബന്ധപ്പെട്ട X പോസ്റ്റുകൾ തൽസമയം നിരീക്ഷിക്കുകയും വിശ്വസനീയമായ വിവരങ്ങൾ ഉൾപ്പെടുത്തിയുള്ള കൃത്യമായ പ്രവണതാ റിപ്പോർട്ടുകൾ തയ്യാറാക്കുകയും ചെയ്യുകയാണ് സിഗ്നൽ എഞ്ചിൻ ചെയ്യുന്നത്. ഏജൻ്റിക് മൾട്ടിമോഡൽ റിട്രീവൽ എഴുത്തും ചിത്രങ്ങളും കലർന്ന ചോദ്യങ്ങൾ വിശകലനം ചെയ്ത് ഏറ്റവും പ്രസക്തമായ ഡോക്യുമെൻ്റ് പേജുകൾ കണ്ടെത്തുന്നു. വെബിൽ തിരയാനും വിവരങ്ങളുടെ ഉറവിടങ്ങൾ പരിശോധിക്കാനും വലിയ ഗവേഷണ റിപ്പോർട്ടുകൾ തയ്യാറാക്കാനുമായി ഒന്നിലധികം ഏജൻ്റുകളെ ഒരേസമയം വിന്യസിക്കുകയാണ് ഡീപ് റിസർച്ച് ചെയ്യുന്നത്.
സിഗ്നൽ എഞ്ചിൻ: മാറ്റിവെച്ച പരിശോധനയിലെ സംയുക്ത സ്കോർ 0.456 → 0.841; ആപേക്ഷിക വർധന 84%. അതേ ബജറ്റിൽ CORAL, karpathy/autoresearch എന്നിവ 0.50-ൽ താഴെയായിരുന്നു.
ഏജൻ്റിക് മൾട്ടിമോഡൽ റിട്രീവൽ: മാറ്റിവെച്ച പരിശോധനയിലെ NDCG@10 0.705 → 0.744; ഓരോ മൂല്യനിർണയത്തിൻ്റെയും പ്രവർത്തനസമയം 869 സെക്കൻഡിൽനിന്ന് 54 സെക്കൻഡായി കുറഞ്ഞു. ഉയർന്ന കൃത്യത ഉറപ്പാക്കുന്നതോടൊപ്പം പ്രക്രിയ 16 മടങ്ങ് വേഗത്തിലാക്കാൻ സാധിച്ചു.
ഡീപ് റിസർച്ച്: 10 റഫറൻസ് ചോദ്യങ്ങളിലെ റിപ്പോർട്ട് ഗുണനിലവാര സംയുക്ത സ്കോർ 0.449 → 0.802; അടിസ്ഥാനരീതികൾക്ക് ഏകദേശം 0.52. ഈ ടാസ്കിൽ പ്രത്യേക മാറ്റിവെച്ച ഘടകം ഇല്ലാതിരുന്നതിനാൽ, ഈ സംഖ്യയെ സാമ്പിളിനുള്ളിലെ ഫലമായി മാത്രമാണ് ഞങ്ങൾ കണക്കാക്കുന്നത്.
തിരയൽ കാര്യക്ഷമത: പ്രെഡിക്റ്റീവ് ഹൈപ്പോതിസിസ് പുനർറാങ്കിങ്ങിലൂടെ, ഒരേ മൂല്യനിർണ്ണയ ബജറ്റിൽ സിഗ്നൽ എഞ്ചിന് 20 ലക്ഷ്യങ്ങൾക്ക് പകരം വെറും 3 ശ്രമങ്ങൾ കൊണ്ട് റഫറൻസ് റണ്ണിൻ്റെ ഏറ്റവും മികച്ച സ്കോറിൻ്റെ 91% കൈവരിക്കാൻ കഴിഞ്ഞു.
മിക്ക സ്വയംനിയന്ത്രിത ഗവേഷണ സംവിധാനങ്ങളും ഒരേ ഡാറ്റാസെറ്റിലാണ് ഒപ്റ്റിമൈസേഷനും മൂല്യനിർണയവും നടത്തുന്നത്. അതിനാൽ ഫലം സാമാന്യവൽക്കരിക്കപ്പെടുന്നുണ്ടോ എന്ന് കണ്ടെത്താനാകില്ല. സിഗ്നൽ എഞ്ചിനും ഏജൻ്റിക് മൾട്ടിമോഡൽ റിട്രീവലിനും ഞങ്ങൾ കർശന വിഭജനം നടപ്പാക്കുന്നു: കാൻഡിഡേറ്റുകൾക്ക് സ്കോർ ചെയ്യാൻ ഒരു പരിശീലനസെറ്റ്, കൃത്യത ഉറപ്പുവരുത്താൻ ഒരു ഡെവലപ്മെൻ്റ് സെറ്റ്, ഒപ്റ്റിമൈസർ ഒരിക്കലും കാണാത്ത മാറ്റിവെച്ച പരിശോധനാസെറ്റ് എന്നിവയാണവ. റിപ്പോർട്ട് ചെയ്യുന്ന ഓരോ ഫലവും എല്ലാ വിഭജനങ്ങളിലും സ്കോർ ചെയ്ത ഒരേയൊരു നിർദിഷ്ട കോഡ് പതിപ്പിൽനിന്നാണ്. അതിനാൽ ഒരു കാൻഡിഡേറ്റിൻ്റെ മികച്ച പരിശീലന സ്കോറും മറ്റൊന്നിൻ്റെ മികച്ച പരിശോധനാ സ്കോറും ഞങ്ങൾ ഒരിക്കലും കൂട്ടിക്കലർത്തുന്നില്ല.
ഓരോ ഘട്ടത്തിലും, കോഡ് മാറ്റാനുള്ള ഘടനാപരമായ അനുമാനങ്ങളുടെ ഒരു കൂട്ടം ഹാർനെസ് സൃഷ്ടിക്കുന്നു. ഓരോ അനുമാനത്തിലും അത് മാറ്റാൻ ഉദ്ദേശിക്കുന്ന പ്രവർത്തന രീതി, അതിനായി അടിസ്ഥാനമാക്കിയ മുമ്പത്തെ പതിപ്പ്, ലക്ഷ്യമിടുന്ന പരാജയ സാധ്യത എന്നിവ കൃത്യമായി രേഖപ്പെടുത്തിയിരിക്കും. ചെലവേറിയ വിലയിരുത്തലുകളിലേക്ക് കടക്കുന്നതിന് മുമ്പ് തന്നെ, ഒരു റാങ്കിംഗ് ഘട്ടത്തിലൂടെ ഇവയിൽ മികച്ചവയെ മാത്രം വേർതിരിച്ചെടുക്കുന്നു. ഇതിൽ നിന്നും ശേഷിക്കുന്ന അനുമാനങ്ങൾ സമാന്തരമായി പ്രവർത്തിക്കുന്ന വർക്കർ ഏജൻ്റുകളിലേക്ക് കൈമാറുന്നു. ഇവർക്ക് പൊതുവായ ഒരു വിജ്ഞാനശേഖരം ഉണ്ടെങ്കിലും ഓരോ കോഡും എഡിറ്റ് ചെയ്യുന്നത് പൂർണ്ണമായും വേർതിരിച്ച വർക്ക്സ്പേസുകളിൽ വെച്ചാണ്, അതിനാൽ ഓരോ കാൻഡിഡേറ്റും സ്വതന്ത്രമായും നിക്ഷ്പക്ഷമായും വിലയിരുത്തപ്പെടുന്നു. അവസാന ഘട്ടത്തിൽ റണ്ണർ ഒരു വിജയിയെ തിരഞ്ഞെടുക്കുന്നു: ദൃശ്യമായ ഘട്ടങ്ങളിലെ എല്ലാ പരിശോധനകളും വിജയിച്ച ഏറ്റവും ഉയർന്ന സ്കോർ നേടിയ കാൻഡിഡേറ്റായിരിക്കും അത്. ആ വിജയിയാണ് അടുത്ത അത്യാധുനിക ഘട്ടത്തിന് അടിസ്ഥാനമായി മാറുന്നത്. ഓരോ പരീക്ഷണവും അതിൻ്റെ കോഡ് പാച്ച്, ഓരോ ഘട്ടത്തിലെയും സ്കോറുകൾ, ഇവൻ്റ് ലോഗ്, കൂടാതെ അതിൻ്റെ പ്രവർത്തന ഗതി, പിഴവുകൾ, ചെലവ്, ഒരു പുനർ വിചിന്തനം എന്നിവ ഉൾക്കൊള്ളുന്ന LLM തയ്യാറാക്കിയ നാല് ചുരുക്ക വിവരണങ്ങൾ എന്നിവയടങ്ങിയ വിവരങ്ങൾ മാറ്റം വരുത്താൻ സാധിക്കാത്ത ഒരു എവിഡൻ്റ് സ്റ്റോറിലേക്ക് രേഖപ്പെടുത്തുന്നു. അടുത്ത ഘട്ടം നിർദേശിക്കുന്നയാൾ ഈ പഴയ വിവരങ്ങൾ വായിച്ചെടുക്കുന്നു; ഒരേ തെറ്റുകൾ ആവർത്തിക്കുന്നതിന് പകരം, തങ്ങൾ പഠിച്ച കാര്യങ്ങൾ വീണ്ടും പ്രയോജനപ്പെടുത്താൻ ഹാർനെസിനെ സഹായിക്കുന്നത് ഈ പ്രക്രിയയാണ്.


ഈ ലൂപ്പ് സുരക്ഷിതമായി പ്രവർത്തിപ്പിക്കുന്നതിനായി മൂന്ന് സുരക്ഷാ നിയന്ത്രണങ്ങളുണ്ട്. ഒരു സ്കോപ്പ് പോളിസി കാൻഡിഡേറ്റിന് മാറ്റം വരുത്താൻ സാധിക്കുന്ന ഫയലുകളെ പരിമിതപ്പെടുത്തുകയും അതിനു പുറത്തുള്ള എന്തും പഴയപടിയാക്കുകയും ചെയ്യുന്നു. ചിലവുകൾ പരിധി കടന്നാൽ ടോക്കൺ, വാൾ-ക്ലോക്ക് ബഡ്ജറ്റുകൾ ഈ റണ്ണിനെ തടയുന്നു; കൂടാതെ, കൺകറൻസി ലിമിറ്റുകൾ ഹാർനെസിനെ മോഡലിൻ്റെയും GPU-ൻ്റെയും നിശ്ചിത നിരക്ക് പരിധികൾക്കുള്ളിൽ തന്നെ നിലനിർത്തുകയും ചെയ്യുന്നു. ഹാർനെസ് ഒരിക്കലും ഒരുകാര്യവും സ്വയം പുറത്തുവിടുന്നില്ല. പകരം, റാങ്ക് ചെയ്തതും പൂർണ്ണമായി ഡോക്യുമെൻ്റ് ചെയ്തതുമായ ഒരു കാൻഡിഡേറ്റിനെ ഇത് തയ്യാറാക്കുന്നു; തുടർന്ന് ഒരു എഞ്ചിനീയർ ഇതിൻ്റെ മാറ്റങ്ങൾ പരിശോധിച്ച്, അത് പ്രൊഡക്ഷനിലേക്ക് വിടണമോ എന്ന് തീരുമാനിക്കുന്നു.
ഒരു ലോക്കൽ സ്റ്റാക്കിൽ മുകളിലെ ലൂപ്പിലെ ഓരോ ഘട്ടത്തിൻ്റെയും അടിസ്ഥാനമായി അഞ്ച് എഞ്ചിനീയറിംഗ് ഘടകങ്ങൾ പ്രവർത്തിക്കുന്നുണ്ട്.
വർക്ക്സ്പേസ് വേർതിരിക്കൽ. ഓരോ കാൻഡിഡേറ്റിനും ഒരു git worktree. ഫോർക്കുകൾ ഒരേ ഒബ്ജക്റ്റ് ഡാറ്റാബേസ് പങ്കിടുമെങ്കിലും, അവ പരസ്പരം ഫയലുകൾ പങ്കിടുന്നില്ല. അതിനാൽ ഏതാണ്ട് സ്ഥിരമായ ഡിസ്ക് ചിലവിൽ തന്നെ കാൻഡിഡേറ്റുകൾ സമാന്തരമായി പ്രവർത്തിപ്പിക്കാനും നിലവിലെ അത്യാധുനിക നിലയുമായി താരതമ്യം ചെയ്ത് വ്യത്യാസം കണ്ടെത്താനും എളുപ്പമാണ്.
Execution Sandbox. കോൺഫിഗറേഷൻ അനുസരിച്ച് രണ്ട് രീതികൾ: വേഗത്തിലുള്ള ആവർത്തന പരീക്ഷണങ്ങൾക്കായി നേറ്റീവ് സബ് പ്രോസസ്സ് ഉപയോഗിക്കാം, അല്ലെങ്കിൽ പൂർണ്ണമായും വേർതിരിച്ചുള്ള റൺ ടൈം ഉപയോഗിക്കാം. Corpora റീഡ്-ഒൺളിയായി മാത്രം ബന്ധിപ്പിക്കുന്നു, കൂടാതെ ഓരോ പരീക്ഷണത്തിനുമുള്ള സ്ക്രാച്ച് ഡയറക്ടറി ഗ്രേഡിംഗ് പൂർത്തിയായ ശേഷം നീക്കം ചെയ്യുന്നു. അതിനാൽ ഒരു പരീക്ഷണത്തിന് ഡാറ്റാസെറ്റിൽ മാറ്റം വരുത്താനോ അടുത്ത പരീക്ഷണത്തിലേക്ക് വിവരങ്ങൾ ചോർന്നുപോകാനോ കഴിയില്ല.
Scope Policy. പരീക്ഷണ കോൺഫിഗറേഷനിൽ മുൻകൂട്ടി നിശ്ചയിച്ചിട്ടുള്ള അനുമതിയുള്ള പാതകളുടെ ഒരു ലിസ്റ്റാണിത്. ഇതിന് പുറത്തുള്ള ഏതെങ്കിലും ഭാഗത്ത് മാറ്റങ്ങൾ വരുത്തിയാൽ ട്രയൽ വിലയിരുത്തുന്നതിന് മുമ്പ് തന്നെ ആ മാറ്റങ്ങൾ പഴയപടിയാക്കുകയും ആ ട്രയൽ ഫ്ലാഗ് ചെയ്യപ്പെടുകയും ചെയ്യും. തൽഫലമായി ഒരു റിവ്യൂവർ കാണുന്ന മാറ്റങ്ങൾ മുൻകൂട്ടി നിശ്ചയിച്ച പരിധിക്കുള്ളിൽ തന്നെയായിരിക്കുമെന്ന് ഉറപ്പുനൽകുന്നു.
ബജറ്റ് പാലിക്കൽ. ഇതിന് മൂന്ന് തലങ്ങളുണ്ട്: ഓരോ പരീക്ഷണത്തിനുമുള്ള ടോക്കൺ, പ്രവർത്തനസമയ പരിധികൾ, ഓരോ റണ്ണിനുമുള്ള മൊത്തം പരിധി, കൺകറൻസി ലിമിറ്റ്. ഇവയെല്ലാം ചേർന്ന് ചെലവുകൾ പ്രവചിക്കാനാകുന്ന തരത്തിൽ നിയന്ത്രിക്കുകയും ഹാർനെസ് മോഡലിൻ്റെയും അടിസ്ഥാന സൗകര്യത്തിൻ്റെയും നിരക്ക് പരിധികൾക്കുള്ളിൽ തന്നെ പ്രവർത്തിക്കുന്നുവെന്ന് ഉറപ്പാക്കുകയും ചെയ്യുന്നു.
തെളിവുകളുടെ ശേഖരം. കോഡ് പാച്ച്, ഓരോ ഘട്ടത്തിലെയും സ്കോറുകൾ, ഇവൻ്റ് ലോഗ് കൂടാതെ LLM തയ്യാറാക്കിയ നാല് വിശകലനങ്ങൾ എന്നിവ ഉൾപ്പെടുന്ന പുതിയ വിവരങ്ങൾ മാത്രം ചേർക്കാവുന്ന JSONL ആണ് ഇത്. ഓരോ പരീക്ഷണത്തിനുശേഷവും മെറ്റീരിയലൈസ്ഡ് വ്യൂകൾ (ലീഡർബോർഡ്, അത്യാധുനിക, പരാജയ സൂചിക) പുനഃസൃഷ്ടിക്കപ്പെടുന്നു. അതിനാൽ തുടർന്നുള്ള ഘട്ടങ്ങൾക്ക് മുൻകാല ചരിത്രത്തെ അടിസ്ഥാനമാക്കി മുന്നോട്ട് പോകാനും ഓരോ റണ്ണും ബൈറ്റ് തലത്തിൽ ഒരേ രീതിയിൽ പുനരാവർത്തിക്കാമെന്നും ഉറപ്പാക്കുന്നു.
ഈ ആദ്യഘട്ടങ്ങളിലൊന്നുപോലും ഒഴിവാക്കാനാകുന്നതല്ല. ഒരു റണ്ണിൻ്റെ ഒടുവിൽ നിരൂപകന് നിസ്സംശയം അംഗീകരിക്കാൻ പാകത്തിലുള്ള കാര്യങ്ങൾ മുന്നിലെത്തിക്കുക എന്നതാണ് ഈ ഹാർനെസിൻ്റെ പ്രധാന ലക്ഷ്യം: അതായത് വിജയിച്ച ഒരു കാൻഡിഡേറ്റ്, പരിധിക്കുള്ളിൽ നിൽക്കുന്ന ഒരു വ്യത്യാസം, ഇത് വരെ പരീക്ഷിച്ച കാര്യങ്ങളുടെ പൂർണ്ണമായ രേഖ ഒപ്പം കൃത്യമായി കണക്കാക്കിയ ചിലവ് എന്നിവ. ഇതിലെ അഞ്ചിൽ ഏതെങ്കിലും ഒന്ന് ഒഴിവാക്കിയാൽ മേൽപ്പറഞ്ഞ ഏതെങ്കിലും ഒരു ഉറപ്പ് ഇല്ലാതാകും.
മൂന്ന് പരീക്ഷണങ്ങളും ഒരേ ഹൈപ്പോതെസിസ് തന്ത്രമാണ് ഉപയോഗിക്കുന്നത്. ഓരോ ഘട്ടത്തിലും, അനുവദിച്ച ബഡ്ജറ്റിൽ ഒതുങ്ങുന്നതിനേക്കാൾ കൂടുതൽ ഹൈപ്പോതെസിസുകൾ പ്രൊപ്പോസർ ഉണ്ടാക്കുന്നു. അതായത്, 4 സബ്മിഷനുകൾക്കുമുള്ള K = 4 ബഡ്ജറ്റ് ഉള്ളപ്പോൾ 8 കാൻഡിഡേറ്റുകളെ ഇത് നിർമ്മിക്കുന്നു. തുടർന്ന്, മറ്റൊരു LLM റാങ്കർ മുപ്പത് സെക്കൻഡ് മാത്രം ദൈർഘ്യമുല്ല ഒരൊറ്റ കോളിലൂടെ ഈ 8 എണ്ണത്തെയും മുൻഗണനാക്രമത്തിൽ അടുക്കുന്നു. ഈ സമയം നിലവിലെ ഏറ്റവും മികച്ച സ്കോറും അതിൻ്റെ പോരായ്മകളും സമീപകാല പരീക്ഷണങ്ങളിൽ നിന്നുള്ള പരാജയ വിശകലനങ്ങളും കൂടാതെ 8 പ്രൊപ്പോസലുകളും ഒന്നിച്ച് റാങ്കറിന് മൂന്നിലുണ്ടാകും. ഇതിൽ നിന്ന് തിരഞ്ഞെടുക്കുന്ന ആദ്യത്തെ 4 എണ്ണം എക്സിക്യൂട്ടറിലേക്ക് അയയ്ക്കുന്നു. ഇവയോരോന്നും 15 മുതൽ 30 മിനിറ്റ് വരെ സമയം എടുക്കും. ബാക്കി 4 എണ്ണവും മറ്റ് ചിലവുകളൊന്നും ഉണ്ടാകുന്നതിന് മുമ്പ് തന്നെ ഒഴിവാക്കുകയും ചെയ്യുന്നു.
അടിസ്ഥാന മോഡലുകൾ ഉടനീളം മാറ്റമില്ലാതെ നിലനിർത്തി; അവയ്ക്ക് ചുറ്റുമുള്ള കോഡ് മാത്രമാണ് ഹാർനെസ് എഡിറ്റ് ചെയ്തത്. Signal Engine, ഡീപ് റിസർച്ച് എന്നിവ gpt-5.5-ലാണ് പ്രവർത്തിച്ചത്. Agentic Multimodal Retrieval, ഓപ്പൺ-വെയ്റ്റ് Qwen3.6-35B-A3B മോഡൽ vLLM വഴി ലോക്കലായി പ്രവർത്തിപ്പിച്ചും അതിനൊപ്പം ColQwen3-4B ഇമേജ് റിട്രീവർ ഉപയോഗിച്ചുമാണ് പ്രവർത്തിച്ചത്. സ്വന്തം പരിതസ്ഥിതിയിലെ ചെലവ് മുൻകൂട്ടി കണക്കാക്കാനാകുമെന്നതിനാലാണ് ഈ സംയോജനം തിരഞ്ഞെടുത്തത്.
താഴെ നൽകിയിരിക്കുന്ന ചാർട്ട് ഞങ്ങളുടെ മൂന്ന് പ്രധാന ടാസ്കുകളുടെ സ്കോറുകളിൽ വന്ന മാറ്റങ്ങൾ കാണിക്കുന്നു. ഒരു മനുഷ്യ എഞ്ചിനീയർ എഴുതിയ തുടക്ക കോഡ് ആണ് "Seed". "Meta-ഹാർനെസ്" കണ്ടെത്തിയതിൽ വച്ച് ഏറ്റവും മികച്ച പതിപ്പാണ് "Meta-ഹാർനെസ്". മാറ്റിനിർത്തിയ ടെസ്റ്റ് സെറ്റിൽ മൂന്ന് ടാസ്കുകളുടെയും പ്രകടനത്തിൽ പുരോഗതി ഉണ്ടായതായി നമുക്ക് കാണാം.


Signal Engine-ൻ്റെ പ്രവർത്തനം ഒരു LLM വിധികർത്താവ് വിലയിരുത്തി. ഇതിനായി പുതുമ, വസ്തുതാപരത, സൂക്ഷ്മത, ശൈലി എന്നിവയാണ് മാനദണ്ഡമാക്കിയത്. പരിശോധനയ്ക്കായി 150 പരിശീലന ട്വീറ്റുകളും 150 മാറ്റിവെച്ച പരിശോധനാ ട്വീറ്റുകളും ഉപയോഗിച്ചു. ഈ പ്രക്രിയയിലുടനീളം, ഇതിൻ്റെ ഏറ്റവും മികച്ച പതിപ്പ് പരിശീലന സംയുക്ത സ്കോർ 0.431-ൽനിന്ന് 0.756-ആയും മാറ്റിവെച്ച സ്കോർ 0.456-ൽനിന്ന് 0.841-ആയും ഉയർത്തി. കേവലം പ്രോംപ്റ്റുകളിൽ വരുത്തിയ മാറ്റങ്ങൾ കൊണ്ട് മാത്രമല്ല ഈ നേട്ടമുണ്ടായത്, ഹാർനെസിൽ വരുത്തിയ മാറ്റങ്ങൾ കൂടിയാണ് ഇതിന് സഹായിച്ചത്. സമൂഹ മാധ്യമത്തിലെ അനാവശ്യ വിവരങ്ങൾ ഫിൽറ്റർ ചെയ്യാനും വസ്തുതകൾ പരിശോധിച്ചുറപ്പിക്കാനും ഓരോ ഉത്തരവും വ്യക്തമായ തെളിവുകളുടെ അടിസ്ഥാനത്തിലാണെന്ന് ഉറപ്പുവരുത്താനും മെച്ചപ്പെടുത്തിയ പതിപ്പുകൾക്ക് സാധിച്ചു. ഇതിൻ്റെ ആവർത്തന പ്രക്രിയ താഴെയുള്ള ഡയഗ്രമിൽ കാണാം.


ഈ നേട്ടങ്ങൾ എങ്ങനെ ക്രമേണ സമാഹരിക്കപ്പെട്ടുവെന്ന് ട്രയൽ ഹിസ്റ്ററി കാണിക്കുന്നു. തുടക്കത്തിൽ സിസ്റ്റത്തിൻ്റെ ഘടനയിൽ വരുത്തിയ മാറ്റം സ്കോർ 0.625-ലേക്ക് ഉയർത്തി. തെളിവുകൾ കൂടുതൽ സൂക്ഷ്മമായി കൈകാര്യം ചെയ്തതോടെ ഇത് 0.679 ആയി മാറി. പിന്നീട്, റിഫ്ലെക്ഷൻ ആൻഡ് റൂബ്റിക് ലൂപ്പ് പരിഷ്കരിച്ചതോടെ സ്കോർ 0.819-ലേക്ക് എത്തിക്കാൻ സാധിച്ചു. പരീക്ഷണാടിസ്ഥാനത്തിൽ നടത്തിയ പകുതിയോളം റണ്ണുകൾ പ്രതീക്ഷിച്ച ഫലം തന്നില്ല അല്ലെങ്കിൽ പൂർണ്ണമായും പരാജയപ്പെട്ടു. എന്നാൽ ഇവ ലീഡർബോർഡിനെ ഒട്ടും ബാധിച്ചില്ല; കാരണം ഓരോ ഫോർക്കും വേറിട്ടാണ് പ്രവർത്തിച്ചിരുന്നത്. പരാജയപ്പെട്ട മാറ്റങ്ങൾ ഒഴിവാക്കുകയും ആ പരാജയങ്ങൾ റിഫ്ലെക്ഷൻ സ്റ്റോറിൽ രേഖപ്പെടുത്തുകയും ചെയ്തു. ഇത് അടുത്ത നിർദ്ദേശങ്ങൾ സമർപ്പിക്കുന്നവർക്ക് അതേ തെറ്റുകൾ ആവർത്തിക്കാതിരിക്കാൻ സഹായകരമായി.
എല്ലാറ്റിനുമപരിയായി, പരീക്ഷണത്തിലുടനീളം ട്രെയിനിംഗ് കർവിനൊപ്പം തന്നെ ടെസ്റ്റ് കർവും ഉയർന്നു വന്നു. സിസ്റ്റത്തിൻ്റെ ഈ ഹാർനെസ് ട്രെയിനിംഗ് ഡാറ്റ അതേപടി മനപഠമാക്കുകയല്ല, മറിച്ച് അതിൻ്റെ പ്രവർത്തനരീതി മെച്ചപ്പെടുത്തുകയാണ് ചെയ്തതെന്ന് ഇത് വ്യക്തമാക്കുന്നു. കൂടാതെ, ടെസ്റ്റ് സ്കോറുകൾ ട്രെയിനിംഗ് സ്കോറുകളെക്കാൾ നേരിയ തോതിൽ മുന്നിലായിരുന്നു; പരസ്പരം ബന്ധമില്ലാത്ത രണ്ട് ചെറിയ ഡാറ്റാ ഗ്രൂപ്പുകൾ തമ്മിലുള്ള പരീക്ഷണങ്ങളിൽ സാധാരണയായി ഉണ്ടാകാറുള്ള ചെറിയൊരു വ്യതിയാനം മാത്രമായാണ് ഞങ്ങൾ ഇതിനെ കണക്കാക്കുന്നത്.
Agentic Multimodal Retrieval-ൻ്റെ പ്രവർത്തനം അളന്നത് പൊതുവായ ViDoRe V3 കമ്പ്യൂട്ടർ സയൻസ് ഘട്ടത്തിലെ NDCG@10 മാനദണ്ഡം ഉപയോഗിച്ചാണ്. ഇതിനായി 20 പരിശീലന, 10 വികസന, 20 മാറ്റിവെച്ച പരിശോധനാ ചോദ്യങ്ങൾ എന്നിവയാണ് തയ്യാറാക്കിയത്. ഈ ഹാർനെസ് ടെസ്റ്റ് NDCG@10 സ്കോർ 0.705-ൽനിന്ന് 0.744 ആയി ഉയർത്തുകയുണ്ടായി; അതോടൊപ്പം തന്നെ ആകെ മൂല്യനിർണ്ണയ സമയ ദൈർഘ്യം 869 സെക്കൻഡിൽ നിന്ന് 54 സെക്കൻഡ് ആയി കുറയ്ക്കുകയും ചെയ്തു.
ഡീപ് റിസർച്ച്-ൻ്റെ മൂല്യനിർണ്ണയം നടത്തിയത് 10 റഫറൻസ് ചോദ്യങ്ങൾ ഉപയോഗിച്ചാണ്. DeepResearch-Eval മാതൃക പിന്തുടർന്ന്, ഉള്ളടക്കത്തിൻ്റെ ഗുണനിലവാരവും അവലംബങ്ങളുടെ ഗുണനിലവാരവും ഒരുമിച്ച് ചേർത്തുള്ള ഒരു LLM വിധിനിർണ്ണയ മാനദണ്ഡം വഴിയാണ് ഇത് വിലയിരുത്തിയത്. കോഡ് മെച്ചപ്പെടുത്തിയതോടെ ഇതിൻ്റെ ശരാശരി സ്കോർ 0.449-ൽനിന്ന് 0.802 ആയി ഉയർന്നു. കോഡിലെ വ്യത്യാസങ്ങൾ പരിശോധിച്ചപ്പോൾ തന്നെ ഈ വിജയകരമായ മാറ്റങ്ങൾ എളുപ്പത്തിൽ മനസ്സിലാക്കാമായിരുന്നു: ഗവേഷണ ഏജൻ്റുകളെ അയയ്ക്കുന്നതിന് മുമ്പ് തന്നെ വിവിധ സമീപനങ്ങളെ താരതമ്യം ചെയ്യുന്ന ഒരു മുൻകൂർ പ്ലാനിംഗ് ഘട്ടവും റിപ്പോർട്ടുകൾ മുൻകാലങ്ങളിൽ മോശം സ്കോർ വാങ്ങിയിരുന്ന ഭാഗങ്ങളെ പ്രത്യേകം ലക്ഷ്യമിട്ടുള്ള ഒരു അവസാന റിവ്യൂ ഘട്ടവും ഇതിൽ ഉൾപ്പെടുത്തിയിരുന്നു. ഈ ഡാറ്റാ സെറ്റ് വളരെ ചെറുതും വിലയിരുത്താൻ വലിയ ചിലവുള്ളതുമായതിനാൽ ഞങ്ങൾ ഇതിനെ വേർതിരിച്ചില്ല; അതുകൊണ്ട് തന്നെ ഈ ഫലത്തെ ഒരു ഇൻ-സാമ്പിൾ വിജയമായാണ് ഞങ്ങൾ കണക്കാക്കുന്നത്.


ഒരേ ഡാറ്റാസെറ്റുകൾ, ഒരേ അടിസ്ഥാന മോഡലുകൾ, ഒരേ ആവർത്തനപരിധി, ഒരേ മൊത്തം കാൻഡിഡേറ്റ് മൂല്യനിർണയങ്ങൾ എന്നിങ്ങനെ ഒരേ ബജറ്റിലാണ് മൂന്ന് രീതികളും ഞങ്ങൾ താരതമ്യം ചെയ്തത്. Signal Engine-ൻ്റെ മാറ്റിവെച്ച പരിശോധനയിൽ Meta-ഹാർനെസ് 0.841 നേടിയപ്പോൾ രണ്ട് അടിസ്ഥാനരീതികളും 0.50-ൽ താഴെയായിരുന്നു. Agentic Multimodal Retrieval-ലിൽ ഞങ്ങളുടെ ടീമിനാണ് ഏറ്റവും ഉയർന്ന മാറ്റിവെച്ച NDCG@10: (CORAL-ൻ്റെ 0.700, karpathy-യുടെ 0.738 എന്നിവയിന്മേൽ 0.744). ഔദ്യോഗിക മൂല്യനിർണയം 12 മുതൽ 14 മടങ്ങ് വരെ വേഗത്തിലുമാണ്: 786, 650 സെക്കൻഡുകൾക്കെതിരെ 54 സെക്കൻഡ്. ഡീപ് റിസർച്ചിൽ ഞങ്ങളുടെ ടീം 0.802 നേടിയപ്പോൾ രണ്ട് അടിസ്ഥാനരീതികളും ഏകദേശം 0.52-ൽ തുടർന്നു. എല്ലാ ഫലങ്ങൾക്കും ഒരു പരിമിതിയുണ്ട്: പ്രസിദ്ധീകരിച്ച വിവരണങ്ങളിൽനിന്ന് CORAL, karpathy/autoresearch എന്നിവ ഞങ്ങൾ പുനർനിർമിച്ചതിനാൽ, വ്യത്യാസത്തിൻ്റെ ഒരു ഭാഗം രീതികളിലെ വ്യത്യാസം മാത്രമല്ല, നടപ്പാക്കലിലെ വ്യത്യാസവും ആയിരിക്കാം.
ഈ വ്യത്യാസത്തിന് കാരണം നാല് പ്രധാന ഡിസൈൻ ചോയിസുകളാണ്. ഒന്നാമതായി, ഞങ്ങളുടെ ടീം കോഡിൽ എന്തെങ്കിലും മാറ്റം വരുത്തുന്നതിന് മുമ്പ് തന്നെ ഒരു ഘടനാപരമായ ഡിസൈൻ സ്പെസിഫിക്കേഷൻ തയ്യാറാക്കുന്നു; ഇത് കേവലം പ്രോംപ്റ്റുകളിൽ മാറ്റം വരുത്തുന്നതിന് പകരം പൈപ്പ്ലൈനിൽ പുതിയ ഘട്ടങ്ങൾ ചേർക്കുന്നത് പോലുള്ള ഘടനാപരമായ മാറ്റങ്ങളിലേക്ക് വഴിതിരിച്ചുവിടാൻ സഹായിക്കുന്നു. രണ്ടാമതായി, ഇത് ഒരു പൊതു അത്യാധുനിക കാൻഡിഡേറ്റുമായി ബന്ധിപ്പിച്ച് ഒരേസമയം പല ഫോർക്കുകളായി പ്രവർത്തിക്കുന്നു; അതിനാൽ CORAL-ൻ്റെ ഇൻഡിപെൻഡൻ്റ് ഏജൻ്റുകളേക്കാളും karpathy-യുടെ സീക്വൻഷ്യൽ ലൂപ്പിനേക്കാളും വേഗത്തിൽ മെച്ചപ്പെടുത്തലുകൾ ഒന്നിനുപുറകെ ഒന്നായി കൂട്ടിച്ചേർക്കാൻ ഇതിന് സാധിക്കുന്നു. മൂന്നാമതായി, ഓരോ ട്രയലും കൃത്യമായ ഘടനയുള്ള വിവരങ്ങൾ (scores, event logs, നാല് LLM വിശകലനങ്ങൾ എന്നിവ) ബാക്കി വെക്കുന്നു, ഇത് അടുത്ത നിർദ്ദേശം സമർപ്പിക്കുന്നയാൾക്ക് റഫർ ചെയ്യാൻ സാധിക്കും; എന്നാൽ ബേസ് ലൈനുകൾ വെറും സാധാരണ അറ്റംപ്റ്റ് ലോഗുകൾ മാത്രമാണ് സൂക്ഷിക്കുന്നത്. നാലാമതായി, ഒരു അഡാപ്റ്റീവ് കൺട്രോളർ, സിസ്റ്റം എവിടെയെങ്കിലും തടസ്സപ്പെടുമ്പോൾ പുതിയ വഴികൾ പര്യവേഷണം ചെയ്യാനും വിജയം കാണുമ്പോൾ അതിനെ കൂടുതൽ മെച്ചപ്പെടുത്താനും പ്രൊപ്പോസറെ പ്രേരിപ്പിക്കുന്നു; അതോടൊപ്പം തന്നെ ബഡ്ജറ്റ് നഷ്ടപ്പെടുത്തുന്നതിന് മുമ്പ് തന്നെ ദുർബലമായ ആശയങ്ങളെ ഒഴിവാക്കാൻ പ്രെഡിക്റ്റീവ് ഹൈപ്പോതീസിസ് റീറാങ്കിംഗ് സംവിധാനവും ഇതിലുണ്ട്.
മാറ്റിവെച്ച ടെസ്റ്റ് ഡാറ്റയിലെ സ്കോറുകൾ കാണിക്കുന്നത് ഈ സിസ്റ്റത്തിന് ഒരേ മേഖലയിലെ വിവരങ്ങൾ കൃത്യമായി മനസ്സിലാക്കാൻ സാധിക്കുന്നുണ്ടെന്നാണ്, അല്ലാതെ മറ്റൊരു മേഖലയിലേക്ക് ഇത് നേരിട്ട് പ്രയോഗിക്കാൻ കഴിയില്ല: അതായത്, AI വിപണി വിവരങ്ങൾ വിശകലനം ചെയ്യാൻ പാകപ്പെടുത്തിയ ഒരു പ്രവർത്തനരീതി, ഈ ഹാർനെസ് വീണ്ടും റൺ ചെയ്യാതെ നിയമപരമോ ബയോമെഡിക്കലോ ആയ ടെക്സ്റ്റുകളിൽ കൃത്യമായ ഫലം തരുമെന്ന് പ്രതീക്ഷിക്കരുത്. കൂടാതെ, നമ്മൾ നിശ്ചയിക്കുന്ന മൂല്യനിർണ്ണയ മാനദണ്ഡങ്ങളെ അടിസ്ഥാനമാക്കി മാത്രമാണ് ഈ സിസ്റ്റം മുന്നേറുന്നത്; അതുകൊണ്ട് തന്നെ കൃത്യമല്ലാത്ത ട്രെയിനിംഗ് സെറ്റോ തെറ്റായ രീതിയിലുള്ള ജഡ്ജ്മെൻ്റോ ആണെങ്കിൽ, സിസ്റ്റം ആ തെറ്റുകളെ അതേപടി അനുകരിക്കാൻ സാധ്യതയുണ്ട്. അതിനാൽ ഒരു പ്രധാന പരീക്ഷണത്തിന് മുമ്പ് നന്നായി തയ്യാറാക്കിയ കുറഞ്ഞത് 20 ട്രെയിനിംഗ് ഐറ്റങ്ങളും വേറിട്ടൊരു ഡെവലപ്മെൻ്റ് ഘട്ടങ്ങളും ഉപയോഗിക്കാൻ ഞങ്ങൾ നിർദ്ദേശിക്കുന്നു. ഇതിൻ്റെ ഏറ്റവും വലിയ പ്രായോഗിക തടസ്സം ഇതിൻ്റെ ചിലവാണ്. ഓരോ തവണ മൂല്യനിർണ്ണയം നടത്തുമ്പോഴും മുഴുവൻ പൈപ്പ്ലൈനും ഡാറ്റാ സെറ്റുകളിൽ വീണ്ടും റൺ ചെയ്യേണ്ടി വരുന്നു; റിട്രീവലിനായി തിരഞ്ഞെടുത്ത ഒരൊറ്റ കാൻഡിഡേറ്റ് മാത്രം ഏകദേശം 2.2 ദശലക്ഷം ഇൻപുട്ട് ടോക്കണുകൾ ഉപയോഗിച്ചു. ഒരു gpt-5.5-class മോഡലിൽ ഇത്തരം ഒപ്റ്റിമൈസേഷൻ നടത്തണമെങ്കിൽ ഓരോ ടാസ്കിനും നൂറ് കണക്കിന് മുതൽ രണ്ടായിരത്തോളം ഡോളർ വരെ ചിലവ് വരും. അവസാനമായി, ഈ കണക്കുകൾ ആവർത്തിച്ചുള്ള പരീക്ഷണങ്ങളിൽ നിന്നല്ല, മറിച്ച് ഒറ്റത്തവണ റൺ ചെയ്തതിൽ നിന്നും ലഭിച്ചതാണ്; അതുകൊണ്ടാണ് ഞങ്ങൾ ഇത് ഒരു ഔദ്യോഗിക പഠന റിപ്പോർട്ടിന് പകരം ഒരു എഞ്ചിനീയറിംഗ് ബ്ലോഗ് പോസ്റ്റായി പങ്കുവെക്കുന്നത്.
Meta-ഹാർനെസ് തെളിയിക്കുന്നത്, സ്വയംഭരണാധികാരമുള്ള കോഡ് മെച്ചപ്പെടുത്തൽ പ്രക്രിയകൾ കോർപ്പറേറ്റ്/സംരഭക ആവശ്യങ്ങൾക്ക് അനുയോജ്യമായ രീതിയിൽ അച്ചടക്കമുള്ളതാക്കാൻ സാധിക്കുമെന്നാണ്. സ്ട്രക്ചറൽ ഹൈപ്പോതെസിസ്, പ്രെഡിക്റ്റീവ് പ്രീ-ഫിൽട്ടറിംഗ്, ഐസോലേറ്റഡ് ഇവാലുവേഷൻ. ഡാറ്റ അനുവദിക്കുന്നിടത്തെല്ലാം ടെസ്റ്റ് ഡാറ്റ ഉപയോഗിച്ചുള്ള പരിശോധന, അംഗീകരിക്കപ്പെട്ട ഓരോ മാറ്റത്തിന് പിന്നിലുമുള്ള കൃത്യമായ ഓഡിറ്റ് വിവരങ്ങൾ എന്നിവയാണ് ഇതിലെ പ്രധാന ഘടകങ്ങൾ. ഇവയെല്ലാം ചേർന്ന് ഒരു എഞ്ചിനീയറിംഗ് ടീമിന് നിലവിലുള്ള ഒരു അടിസ്ഥാന പൈപ്പ്ലൈനിൽ നിന്ന് കൃത്യമായി അളക്കാവുന്ന അത്രയും മികച്ച മറ്റൊന്നിലേക്ക് കൃത്യമായ പാതയൊരുക്കുന്നു. കൂടാതെ ബിസിനസ്സ് ഉടമയ്ക് ലളിതമായ ഒരു മോഡൽ ഇത് നൽകുന്നു: സ്വയംഭരണാധികാരമുള്ള് പര്യവേഷണം വഴിയുള്ള നേട്ടങ്ങൾ, ബദജറ്റിന് അനുയോജ്യമായ ഒരു കർശനമായ ചട്ടക്കൂടിനുള്ളിൽ നിർത്താനും പ്രൊഡക്ഷനിലേക്ക് അയയ്ക്കുന്നതിന് മുമ്പ് ഒരു മനുഷ്യൻ്റെ മേൽനോട്ടം ഉറപ്പാക്കാനും ഇതിലൂടെ സാധിക്കുന്നു.