தற்போதுள்ள தன்னாட்சி மேம்பாட்டு முறைமைகள், நிரலாக்கப் பணிகளில் சிறந்த முடிவுகளைக் காட்டியுள்ளன. ஆனால் உண்மையான நிறுவனச் செயலாக்கங்களை ஒத்த, சிக்கலான நீண்டகால AI பணிப்பாய்வுகளை அவற்றால் மேம்படுத்த முடியுமா என்பது இன்னும் தெளிவாகவில்லை.
எங்களின் Meta-Harness ஆராய்ச்சி, ஏஜென்ட் சார்ந்த மீட்டெடுப்பு, டீப் ரிசர்ச், சிக்னல் நுண்ணறிவுப் பணிப்பாய்வுகளில் தன்னாட்சி சுயமேம்பாட்டைப் பயன்படுத்துகிறது. அத்துடன் ஒதுக்கிவைக்கப்பட்ட மதிப்பீடு, தணிக்கை வசதி, செலவுக் கட்டுப்பாடுகள், மனித ஒப்புதல் போன்ற நிறுவனத் தேவைகளையும் சேர்க்கிறது.
மூன்று பிரதிநிதித்துவப் பணிச்சுமைகளிலும் செயல்திறனைப் பெரிதும் Meta-Harness மேம்படுத்தியது. Signal Engine-இன் ஒதுக்கிவைக்கப்பட்ட சோதனைச் செயல்திறன் 84% மேம்பட்டது; Agentic Multimodal Retrieval-இல் 16 மடங்கு வேகமான இயக்கத்துடன் துல்லியமும் உயர்ந்தது.
முந்தைய பெரும்பாலான அணுகுமுறைகளைப் போலல்லாமல், உகப்பாக்கத்திற்குப் பயன்படுத்திய தரவுக்கு அப்பாலும் மேம்பாடுகள் பொதுமைப்படுகின்றனவா என்பதை மதிப்பிட, சாத்தியமான இடங்களிலெல்லாம் வெற்றியை ஒதுக்கிவைக்கப்பட்ட தரவுத்தொகுப்புகளில் Meta-Harness அளவிடுகிறது.
தன்னாட்சி பணிப்பாய்வு மேம்பாடு, நிரலாக்க அளவுகோல்களைக் கடந்து நிஜ உலக நிறுவன AI முறைமைகளுக்கும் விரிவடைய முடியும் என்பதை இந்த முடிவுகள் சுட்டுகின்றன. தொடர்ந்து மேம்படும் AI பயன்பாடுகளை உருவாக்குவதற்கான நடைமுறைப் பாதையையும் இவை வழங்குகின்றன.
Meta-Harness ஆய்வுக் கட்டுரை, CORAL கட்டமைப்பு, karpathy/autoresearch உள்ளிட்ட தன்னாட்சி AI ஆராய்ச்சியின் அண்மைப் பணிகள், ஒரு மதிப்பீட்டு அளவீடு வழங்கப்பட்டால் நிரலாக்க ஏஜென்ட்களால் தீர்வைத் தொடர்ச்சியாக மேம்படுத்த முடியும் என்பதைக் காட்டியுள்ளன. ஆனால் நீண்டகால AI பணிப்பாய்வுகளுக்கு இந்த முறைகள் பொருந்துமா என்பது விடை காணப்படாத கேள்வியாக உள்ளது. எடுத்துக்காட்டாக, ஏஜென்ட் சார்ந்த பல்வடிவ மீட்டெடுப்பில் ஒரு கேள்விக்குப் பதிலளிக்கப் பல்வடிவத் துறைசார் தரவுத் தொகுதிகளில் ஏஜென்ட் மீண்டும் மீண்டும் தேட வேண்டும். சிக்கலான தரவுச் செயலாக்கத் தொடரமைப்புகளில் ஒன்றையொன்று சார்ந்த பல படிநிலைகள், கருவி அழைப்புகள், விதிவிலக்குகளைக் கையாளும் முடிவுகள் தேவைப்படுகின்றன. உகப்பாக்கி ஒருபோதும் காணாத தரவிலும் இந்த மேம்பாடுகள் நீடிக்குமா என்பதே ஆழமான கேள்வி ஆகும்.
அந்தக் கேள்விக்கான எங்கள் பதிலே Meta-Harness ஆராய்ச்சி மற்றும் மேம்பாடு ஆகும். அண்மை ஆராய்ச்சியின் கருத்துகளை எடுத்துக்கொண்டு, ஒதுக்கிவைக்கப்பட்ட மதிப்பீடு, தணிக்கைத் தடங்கள், செலவு உச்சவரம்புகள், எதையும் வெளியிடுவதற்கு முன் மனித ஆய்வாளரிடம் தெளிவாக ஒப்படைக்கும் கட்டம் ஆகிய நிறுவனத் தேவைகளுக்கேற்ப இது அவற்றை மறுவடிவமைக்கிறது.
உண்மையான வாடிக்கையாளர் பணிகளை மாடலாகக் கொண்ட மூன்று நீண்டகாலப் பணிகளில் இதைச் சோதித்தோம். Signal Engine, AI சந்தை பற்றிய X பதிவுகளின் நேரலை ஓட்டத்தைக் கண்காணித்து, நம்பகமான ஆதாரங்களுடன் கட்டமைக்கப்பட்ட போக்கு அறிக்கைகளை உருவாக்குகிறது. Agentic Multimodal Retrieval, கலப்பு உரை மற்றும் பட வினவல்களை ஆராய்ந்து, மிகவும் தொடர்புடைய ஆவணப் பக்கங்களை வழங்குகிறது. டீப் ரிசர்ச், இணையத்தில் தேடவும், ஆதாரங்களைச் சரிபார்க்கவும், விரிவான ஆராய்ச்சி அறிக்கைகளை எழுதவும் பல ஏஜென்ட்களை ஒருங்கிணைக்கிறது.
Signal Engine: ஒதுக்கிவைக்கப்பட்ட சோதனையின் கூட்டளவு 0.456 → 0.841; ஒப்பீட்டளவில் 84% உயர்வு. அதே செலவு வரம்பில் CORAL மற்றும் karpathy/autoresearch இரண்டும் 0.50-க்குக் கீழேயே இருந்தன.
Agentic Multimodal Retrieval: ஒதுக்கிவைக்கப்பட்ட NDCG@10 0.705 → 0.744; ஒவ்வொரு மதிப்பீட்டிற்குமான மொத்த நேரம் 869 வினாடிகளிலிருந்து 54 வினாடிகளாகக் குறைந்தது. அதிகத் துல்லியத்துடன் கிடைத்த 16 மடங்கு வேக உயர்வு இதுவாகும்.
டீப் ரிசர்ச்: 10 மாதிரிக் கேள்விகளில் அறிக்கைத் தரக் கூட்டளவு 0.449 → 0.802; அடிப்படை முறைகளின் மதிப்பெண் ஏறத்தாழ 0.52. ஒதுக்கிவைக்கப்பட்ட பிரிவு இந்தப் பணியில் இல்லை. எனவே இந்த மதிப்பை மாதிரிக்குள் கிடைத்த முடிவாக மட்டுமே கருதுகிறோம்.
தேடல் திறன்: முன்கணிப்புக் கருதுகோள் மறுதரவரிசையுடன், அதே மதிப்பீட்டுச் செலவு வரம்பில் 20 மறுசெய்கைகளுக்குப் பதிலாக 3 மறுசெய்கைகளிலேயே Signal Engine, மாதிரி இயக்கத்தின் சிறந்த மதிப்பெண்ணில் 91%-ஐ எட்டியது.
பெரும்பாலான தன்னாட்சி ஆராய்ச்சி முறைமைகள் ஒரே தரவுத்தொகுப்பில் உகப்பாக்கி மதிப்பிடுகின்றன. இதனால் முடிவு பொதுமைப்படுகிறதா என்பதைத் தீர்மானிக்க முடியாது. Signal Engine மற்றும் Agentic Multimodal Retrieval ஆகியவற்றுக்கு நாங்கள் கடுமையான பிரிவை அமல்படுத்துகிறோம்: தேர்வுகளில் மதிப்பெண் பெறக்கூடிய பயிற்சித் தொகுப்பு, அடிப்படைச் சரிபார்ப்புகளுக்கான உருவாக்கத் தொகுப்பு, உகப்பாக்கி ஒருபோதும் காணாத ஒதுக்கிவைக்கப்பட்ட சோதனைத் தொகுப்பு. அறிக்கையிடப்படும் ஒவ்வொரு முடிவும் அனைத்துப் பிரிவுகளிலும் மதிப்பிடப்பட்ட ஒரே குறிப்பிட்ட நிரலாக்கப் பதிப்பிலிருந்து வருகிறது. எனவே ஒரு தேர்வின் சிறந்த பயிற்சி மதிப்பெண்ணை மற்றொரு தேர்வின் சிறந்த சோதனை மதிப்பெண்ணுடன் நாங்கள் ஒருபோதும் கலப்பதில்லை.
ஒவ்வொரு சுற்றிலும், நிரலாக்கத்தை மாற்றுவதற்கான கட்டமைக்கப்பட்ட கருதுகோள்களின் தொகுப்பைச் சூழல் பணி அமைவு உருவாக்குகிறது. ஒவ்வொரு கருதுகோளும் தான் மாற்ற விரும்பும் செயல்முறை, தான் அடிப்படையாகக் கொள்ளும் முந்தைய பதிப்பு, தான் தீர்க்க இலக்கு வைக்கும் தோல்வி வகை ஆகியவற்றைக் குறிப்பிடுகிறது. அதிகச் செலவுள்ள மதிப்பீடுகள் எதையும் நடத்துவதற்கு முன், தரவரிசைப் படிநிலை அந்தத் தொகுப்பை வடிகட்டுகிறது. தேர்வான கருதுகோள்கள், பொதுவான அறிவுத் தளத்தைப் பகிர்ந்தாலும் முற்றிலும் தனிமைப்படுத்தப்பட்ட வர்க்ஸ்பேஸ்களில் நிரலாக்கத்தைத் திருத்தும் இணையான பணியாளர் ஏஜென்ட்களிடம் செல்கின்றன. இதனால் ஒவ்வொரு தேர்வும் நியாயமாகவும் தனித்தனியாகவும் மதிப்பிடப்படுகிறது. சுற்றின் முடிவில், காட்சிப்படுத்தப்பட்ட அனைத்துப் பிரிவுகளின் சோதனைகளிலும் தேர்ச்சி பெற்ற, அதிக மதிப்பெண் பெற்ற ஒரே தேர்வை இயக்கி வெற்றியாளராக முன்னிறுத்துகிறது. அந்த வெற்றியாளரே அடுத்த சுற்றுக்கான முன்னணி அடித்தளமாகிறது. ஒவ்வொரு சோதனை முயற்சியும் அதன் நிரலாக்கத் திருத்தம், பிரிவுவாரி மதிப்பெண்கள், நிகழ்வுப் பதிவு, தடம், பிழைகள், செலவு மற்றும் சுயபரிசீலனை குறித்த நான்கு சுருக்கமான LLM பகுப்பாய்வுகள் ஆகிய நிலையான தொகுப்பை, இணைப்பதற்கு மட்டுமே அனுமதிக்கும் ஆதாரக் களஞ்சியத்தில் எழுதுகிறது. அடுத்த சுற்றின் முன்மொழிவாளர் இந்த வரலாற்றைப் படிக்கிறார். இதனால் சூழல் பணி அமைவு அதே பயனற்ற வழிகளை மீண்டும் முயல்வதற்குப் பதிலாக, தான் கற்றவற்றைத் தொடர்ந்து ஒருங்கிணைக்கிறது.


மூன்று பாதுகாப்புக் கட்டுப்பாடுகள் இந்தச் சுழற்சியைப் பாதுகாப்பாக இயக்க உதவுகின்றன. ஒரு தேர்வு எந்தக் கோப்புகளை மாற்றலாம் என்பதை வரம்புக் கொள்கை கட்டுப்படுத்தி, அதற்கு வெளியே செய்யப்பட்ட மாற்றங்களை மீட்டமைக்கிறது. உச்சவரம்பைச் செலவு தாண்டியவுடன் இயக்கத்தை டோக்கன் மற்றும் மொத்த இயக்கநேர வரம்புகள் நிறுத்துகின்றன. சூழல் பணி அமைவை மாடல் மற்றும் GPU பயன்பாட்டு விகித வரம்புகளுக்குள் ஒருங்குநிகழ்வு வரம்புகள் வைத்திருக்கின்றன. மேலும், சூழல் பணி அமைவு தானாக எதையும் வெளியிடுவதில்லை. அது தரவரிசையிடப்பட்ட, முழுமையாக ஆவணப்படுத்தப்பட்ட தேர்வை உருவாக்குகிறது. மாற்ற வேறுபாட்டை மனிதப் பொறியாளர் ஆய்வுசெய்து, அதை உற்பத்திச் சூழலுக்குக் கொண்டுசெல்வதா என்று முடிவெடுக்கிறார்.
உள் தொழில்நுட்ப அடுக்கில், மேலுள்ள சுழற்சியின் ஒவ்வொரு சுற்றுக்கும் ஆதாரமாக ஐந்து அடிப்படைப் பொறியியல் கூறுகள் உள்ளன.
வர்க்ஸ்பேஸ் தனிமைப்படுத்தல். ஒவ்வொரு தேர்வுக்கும் ஒரு git பணிமரம். ஃபோர்க் செய்யப்பட்ட பதிப்புகள் ஒரே பொருள் தரவுத்தளத்தைப் பகிர்ந்தாலும் ஒன்றின் கோப்புகளை மற்றொன்று பகிர்வதில்லை. இதனால் பெரிதாக மாறாத வட்டுச் செலவில் தேர்வுகளை இணையாக இயக்கவும், தற்போதைய முன்னணி தேர்வுடன் மாற்ற வேறுபாட்டை எளிதாகக் காணவும் முடிகிறது.
இயக்கத் தனிச்சூழல். உள்ளமைவின்படி இரண்டு முறைகள் உள்ளன: விரைவான மறுசெய்கைக்கு இயல்பான துணைச் செயல்முறை அல்லது முழுமையாகத் தனிமைப்படுத்தப்பட்ட இயக்கச் சூழல். வாசிப்பதற்கு மட்டும் தரவுத் தொகுதிகள் ஏற்றப்படுகின்றன; ஒவ்வொரு சோதனை முயற்சிக்குமான தற்காலிகக் கோப்பகம், மதிப்பீட்டுக்குப் பிறகு நீக்கப்படுகிறது. இதனால் ஒரு சோதனை முயற்சியால் தரவுத்தொகுப்பை மாற்றவோ, அடுத்த முயற்சிக்குள் நிலைத் தகவலைக் கசியவிடவோ முடியாது.
வரம்புக் கொள்கை. பரிசோதனை உள்ளமைவில் அறிவிக்கப்படும் அனுமதிக்கப்பட்ட பாதைகளின் பட்டியல். அதற்கு வெளியே மாற்றப்பட்ட எதுவும் சோதனை முயற்சி மதிப்பிடப்படுவதற்கு முன் மீட்டமைக்கப்பட்டு, அந்த முயற்சி குறியிடப்படுகிறது. எனவே, ஆய்வாளர் காணும் மாற்ற வேறுபாடு அறிவிக்கப்பட்ட வரம்புக்குள்ளேயே இருக்கும் என்பது உறுதிசெய்யப்படுகிறது.
செலவு வரம்பு அமலாக்கம். மூன்று அடுக்குகள் உள்ளன: ஒவ்வொரு சோதனை முயற்சிக்குமான டோக்கன் மற்றும் மொத்த நேர வரம்புகள், ஒவ்வொரு இயக்கத்திற்குமான மொத்த உச்சவரம்பு, ஒருங்குநிகழ்வு வரம்பு. இவை இணைந்து செலவை முன்கணிக்கக்கூடியதாக வைத்திருப்பதுடன், மாடல் மற்றும் உள்கட்டமைப்பின் பயன்பாட்டு விகித வரம்புகளுக்குள் சூழல் பணி அமைவு இருப்பதையும் உறுதிசெய்கின்றன.
ஆதாரக் களஞ்சியம். நிரலாக்கத் திருத்தம், பிரிவுவாரி மதிப்பெண்கள், நிகழ்வுப் பதிவு, LLM எழுதிய நான்கு பகுப்பாய்வுகள் ஆகியவற்றை இணைப்பதற்கு மட்டுமே அனுமதிக்கும் JSONL பதிவு. ஒவ்வொரு சோதனை முயற்சிக்குப் பிறகும் உருவாக்கப்பட்ட காட்சிகள்—தரவரிசைப் பட்டியல், முன்னணி தேர்வு, தோல்விக் குறியீடு—மீண்டும் உருவாக்கப்படுகின்றன. இதனால் ஒவ்வொரு இயக்கத்தையும் எழுத்தெழுத்தாக மறுஉருவாக்க முடிவதுடன், அடுத்தடுத்த சுற்றுகள் முந்தைய வரலாற்றை அடிப்படையாகக் கொள்ள முடிகிறது.
இந்த அடிப்படைக் கூறுகளில் எதுவும் விருப்பத்தேர்வு அல்ல. ஓர் இயக்கத்தின் முடிவில் ஆய்வாளர் உண்மையாகவே ஒப்புதல் அளிக்கக்கூடிய ஒன்றை வழங்குவதே சூழல் பணி அமைவின் நோக்கம்: வெற்றிபெற்ற தேர்வு, வரம்புக்குட்பட்ட மாற்ற வேறுபாடு, முயன்ற அனைத்தின் முழுப் பதிவு, அறியப்பட்ட செலவு. இந்த ஐந்தில் எதை நீக்கினாலும், அந்த உத்தரவாதங்களில் ஒன்று மறைந்துவிடும்.
மூன்று பரிசோதனைகளும் ஒரே கருதுகோள் உத்தியைப் பயன்படுத்துகின்றன. ஒவ்வொரு மறுசெய்கையிலும், செலவு வரம்பிற்குள் இயக்கக்கூடியதைவிட அதிகமான கருதுகோள்களை முன்மொழிவாளர் உருவாக்குகிறார்: K = 4 என்ற அனுப்பீட்டுச் செலவு வரம்புக்கு M = 8 தேர்வுகள். பிறகு தனி LLM தரவரிசையாளர், தற்போதைய சிறந்த மதிப்பெண்ணும் அதன் பலவீனமான பரிமாணங்களும், அண்மை முயற்சிகளின் தோல்விப் பகுப்பாய்வுகளும், 8 முன்மொழிவுகளும் அருகருகே கொண்ட முழுமையான பார்வையின் அடிப்படையில், முப்பது வினாடிகள் நீடிக்கும் ஒரே அழைப்பில் எட்டையும் வரிசைப்படுத்துகிறார். முதல் 4 தேர்வுகள், ஒவ்வொன்றுக்கும் 15 முதல் 30 நிமிடச் செலவில் செயல்படுத்தியிடம் செல்கின்றன. மற்ற 4 தேர்வுகள் எந்தச் செலவும் ஏற்படுத்துவதற்கு முன்பே கைவிடப்படுகின்றன.
செயல்முறை முழுவதும் மாற்றமின்றி அடிப்படை மாடல்கள் வைக்கப்பட்டன; அவற்றைச் சுற்றியுள்ள நிரலாக்கத்தை மட்டுமே சூழல் பணி அமைவு திருத்தியது. Signal Engine மற்றும் டீப் ரிசர்ச் ஆகியவை gpt-5.5-இல் இயங்கின. Agentic Multimodal Retrieval, vLLM வழியாக அகத்தில் வழங்கப்பட்ட திறந்த எடைகளைக் கொண்ட Qwen3.6-35B-A3B-இல், ColQwen3-4B பட மீட்டெடுப்பியுடன் இணைந்து இயங்கியது. வளாகத்திற்குள்ளான செலவை முன்கணிக்க முடியும் என்பதால் இந்தக் கலவை தேர்ந்தெடுக்கப்பட்டது.
எங்கள் மூன்று முக்கியப் பணிகளின் மதிப்பெண்கள் மாறிய விதத்தைக் கீழுள்ள விளக்கப்படம் காட்டுகிறது. “தொடக்கநிலை” என்பது மனிதப் பொறியாளர் எழுதிய ஆரம்ப நிரலாக்கம் ஆகும். “Meta-Harness” என்பது Meta-Harness கண்டறிந்த சிறந்த பதிப்பு ஆகும். ஒதுக்கிவைக்கப்பட்ட சோதனைத் தொகுப்பில் மூன்று பணிகளின் செயல்திறனும் மேம்பட்டதைக் காண்கிறோம்.


Signal Engine, 150 பயிற்சி X பதிவுகளையும் 150 ஒதுக்கிவைக்கப்பட்ட சோதனை X பதிவுகளையும் கொண்டு, நிகழ்நிலைத் தன்மை, உண்மைத் தன்மை, நுண்விவரம், தொனி ஆகியவற்றில் LLM நடுவரால் மதிப்பிடப்பட்டது. இயக்கத்தின் போது, பயிற்சிக் கூட்டளவை 0.431-இலிருந்து 0.756-ஆகவும், ஒதுக்கிவைக்கப்பட்ட மதிப்பெண்ணை 0.456-இலிருந்து 0.841-ஆகவும் சிறந்த பதிப்பு உயர்த்தியது. ப்ராம்ப்ட் திருத்தங்களிலிருந்து மட்டுமல்லாமல், சூழல் பணி அமைவிலேயே செய்யப்பட்ட மாற்றங்களிலிருந்து மேம்பாடுகள் வந்தன. வெற்றிபெற்ற மறுசெய்கைகள், சமூக ஊடக இரைச்சலை வடிகட்டக் கற்றன, உண்மைகளை மறுசரிபார்க்கும் படிகளைச் சேர்த்தன, ஒவ்வொரு வெளியீடும் வெளிப்படையான ஆதாரத்தை அடிப்படையாகக் கொள்ள வேண்டும் எனக் கட்டாயப்படுத்தின. மறுசெய்கைச் செயல்முறையைக் கீழுள்ள வரைபடம் காட்டுகிறது.


அந்த மேம்பாடுகள் திரண்ட விதத்தைச் சோதனை முயற்சி வரலாறு காட்டுகிறது. தொடக்கக் கட்டமைப்பு மாற்றம் இதுவரையிலான சிறந்த மதிப்பை 0.625-ஆக உயர்த்தியது; இன்னும் நுணுக்கமான ஆதாரக் கையாளுதல் அதை 0.679-ஆக உயர்த்தியது; செம்மைப்படுத்தப்பட்ட சுயபரிசீலனை மற்றும் அளவுகோல் சுழற்சி அதை 0.819-ஆக உயர்த்தியது. அனைத்துத் தேர்வு இயக்கங்களிலும் ஏறத்தாழ பாதி மோசமாகச் செயல்பட்டன அல்லது முழுமையாகத் தோல்வியடைந்தன. ஆனால் அவை தரவரிசைப் பட்டியலைப் பாதிக்கவில்லை: ஒவ்வொரு ஃபோர்க்கும் தனிமையில் இயங்கியது, தோல்வியடைந்த மாற்ற வேறுபாடுகள் கைவிடப்பட்டன, அடுத்த முன்மொழிவாளர் அதே பயனற்ற வழியை மீண்டும் முயலாதிருக்க தோல்விகள் சுயபரிசீலனைக் களஞ்சியத்தில் எழுதப்பட்டன.
மிக முக்கியமாக, இயக்கம் முழுவதும் பயிற்சி வளைவுடன் சேர்ந்து ஒதுக்கிவைக்கப்பட்ட மதிப்பெண் வளைவும் உயர்ந்தது. பயிற்சித் தரவுத் தொகுதியை மனப்பாடம் செய்வதற்குப் பதிலாக, பணிப்பாய்வையே சூழல் பணி அமைவு மேம்படுத்தியதை இது சுட்டுகிறது. ஒதுக்கிவைக்கப்பட்ட மதிப்பெண்கள் பயிற்சி மதிப்பெண்களைவிடச் சற்றே அதிகமாக இருந்தன. சிறிய, தனித்தனியான இரு பிரிவுகளுக்கு இடையிலான வழக்கமான மாதிரி இரைச்சலாக இதைப் புரிந்துகொள்கிறோம்.
Agentic Multimodal Retrieval, பொது ViDoRe V3 கணினி அறிவியல் பிரிவில் NDCG@10 கொண்டு அளவிடப்படுகிறது. இது 20 பயிற்சி, 10 உருவாக்கம், 20 ஒதுக்கிவைக்கப்பட்ட சோதனை வினவல்களாகத் தொகுக்கப்பட்டுள்ளது. மொத்த மதிப்பீட்டு நேரத்தை 869 வினாடிகளிலிருந்து 54 வினாடிகளாகக் குறைத்தபோதும், ஒதுக்கிவைக்கப்பட்ட NDCG@10-ஐ 0.705-இலிருந்து 0.744-ஆகச் சூழல் பணி அமைவு உயர்த்தியது.
டீப் ரிசர்ச், 10 மாதிரிக் கேள்விகளில் DeepResearch-Eval முறையைப் பின்பற்றி, உள்ளடக்கத் தரம் மற்றும் ஆதாரத் தரத்தின் LLM மதிப்பீட்டுக் கூட்டளவில் மதிப்பிடப்படுகிறது. சராசரியை 0.449-இலிருந்து 0.802-ஆக மேம்படுத்தப்பட்ட நிரலாக்கம் உயர்த்தியது. வெற்றிபெற்ற மாற்றங்களை மாற்ற வேறுபாட்டிலிருந்து எளிதாக அறிய முடிந்தது: ஆராய்ச்சி ஏஜென்ட்கள் எதையும் அனுப்புவதற்கு முன் அணுகுமுறைகளை ஒப்பிடும் ஆரம்பத் திட்டமிடல் படி, வரலாற்றில் அறிக்கைகள் குறைவாக மதிப்பெண் பெற்ற பரிமாணங்களைக் குறிவைக்கும் இறுதி ஆய்வுப் படி ஆகும். இந்தத் தொகுப்பு சிறியது, மதிப்பிட அதிகச் செலவாகும் என்பதால் அதைப் பிரிக்கவில்லை; முடிவை மாதிரிக்குள் கிடைத்ததாகவே கருதுகிறோம்.


மூன்று முறைகளையும் ஒரே செலவு வரம்பில் ஒப்பிட்டோம்: ஒரே தரவுத்தொகுப்புகள், ஒரே அடிப்படை மாடல்கள், ஒரே மறுசெய்கை உச்சவரம்பு, ஒரே மொத்தத் தேர்வு மதிப்பீடுகள். Signal Engine-இன் ஒதுக்கிவைக்கப்பட்ட சோதனையில் 0.841-ஐ Meta-Harness எட்டியது; இரண்டு அடிப்படை முறைகளும் 0.50-க்குக் கீழேயே இருந்தன. Agentic Multimodal Retrieval-இல் எங்கள் குழு மிக உயர்ந்த ஒதுக்கிவைக்கப்பட்ட NDCG@10 மதிப்பைப் பெற்றது: CORAL-க்கு 0.700, karpathy-க்கு 0.738 என்பதுடன் ஒப்பிடும்போது 0.744. அதிகாரப்பூர்வ மதிப்பீட்டையும் 12 முதல் 14 மடங்கு வேகமாக இயக்குகிறது: 786 மற்றும் 650 வினாடிகளுக்குப் பதிலாக 54 வினாடிகள். டீப் ரிசர்ச்சில் 0.802-ஐ எங்கள் குழு எட்டியது; இரண்டு அடிப்படை முறைகளும் 0.52 அருகிலேயே இருந்தன. முழுவதற்கும் ஒரு வரம்பு உண்டு: வெளியிடப்பட்ட விளக்கங்களிலிருந்து CORAL மற்றும் karpathy/autoresearch ஆகியவற்றை நாங்கள் மீண்டும் செயல்படுத்தினோம். எனவே வேறுபாட்டின் ஒரு பகுதி முறைகளின் வேறுபாட்டை மட்டுமல்லாமல் செயல்படுத்தல் வேறுபாடுகளையும் பிரதிபலிக்கலாம்.
நான்கு வடிவமைப்புத் தேர்வுகள் இந்த வேறுபாட்டை விளக்குகின்றன. முதலில், எந்த நிரலாக்கமும் திருத்தப்படுவதற்கு முன் கட்டமைக்கப்பட்ட வடிவமைப்பு விவரக்குறிப்பை எங்கள் குழு உருவாக்குகிறது. இதனால் ப்ராம்ப்ட் திருத்தங்களைவிடப் புதிய தொடரமைப்புப் படிநிலைகள் போன்ற கட்டமைப்பு மாற்றங்களுக்கு முன்னுரிமை கிடைக்கிறது. இரண்டாவதாக, பகிரப்பட்ட முன்னணி தேர்வை அடிப்படையாகக் கொண்ட ஒருங்குநிகழ் ஃபோர்க்குகளை இது இயக்குகிறது. எனவே CORAL-இன் தனித்தனி ஏஜென்ட்கள் அல்லது karpathy-இன் கண்டிப்பான தொடர் சுழற்சியைவிட மேம்பாடுகள் வேகமாகக் குவிகின்றன. மூன்றாவதாக, ஒவ்வொரு சோதனை முயற்சியும் அடுத்த முன்மொழிவாளர் மீண்டும் படிக்கும் கட்டமைக்கப்பட்ட பதிவுகளை—மதிப்பெண்கள், நிகழ்வுப் பதிவுகள், LLM எழுதிய நான்கு பகுப்பாய்வுகள்—விட்டுச்செல்கிறது. ஆனால் அடிப்படை முறைகள் எளிய முயற்சிப் பதிவுகளை மட்டுமே வைத்திருக்கின்றன. நான்காவதாக, தேக்கம் ஏற்பட்ட பிறகு முன்மொழிவாளரை ஆராய்வை நோக்கியும், வெற்றிக்குப் பிறகு செம்மைப்படுத்தலை நோக்கியும் தகவமைப்புக் கட்டுப்படுத்தி செலுத்துகிறது. செலவு வரம்பைப் பலவீனமான கருத்துகள் பயன்படுத்துவதற்கு முன் அவற்றை நீக்க, முன்கணிப்புக் கருதுகோள் மறுதரவரிசை இதற்கு மேலாகச் செயல்படுகிறது.
ஒதுக்கிவைக்கப்பட்ட வளைவுகள் ஒரே துறைக்குள்ளான பொதுமைப்படுத்தலைக் காட்டுகின்றன; துறைகளுக்கு இடையிலான பரிமாற்றத்தை அல்ல. AI சந்தை சிக்னல்களைப் பிரித்தெடுக்க உகப்பாக்கப்பட்ட பணிப்பாய்வு, சூழல் பணி அமைவை மீண்டும் இயக்காமல் சட்ட அல்லது உயிரிமருத்துவ உரைகளிலும் சிறப்பாகச் செயல்படும் என எதிர்பார்க்கக் கூடாது. மதிப்பீட்டாளர் வரையறுக்கும் இலக்கை நோக்கி மட்டுமே சூழல் பணி அமைவு முன்னேறும். எனவே இரைச்சலுள்ள பயிற்சித் தொகுப்பு அல்லது சரியாக அளவிடப்படாத நடுவருக்குத் துல்லியமாக மிகைப் பொருத்தம் ஏற்படும். முக்கியமான இயக்கத்திற்கு முன் நன்கு தொகுக்கப்பட்ட குறைந்தது 20 பயிற்சி உருப்படிகளையும் தனி உருவாக்கப் பிரிவையும் பரிந்துரைக்கிறோம். செலவே மிகப் பெரிய நடைமுறைக் கட்டுப்பாடு ஆகும். ஒவ்வொரு மதிப்பீடும் முழுத் தொடரமைப்பை அனைத்துப் பிரிவுகளிலும் மீண்டும் இயக்குகிறது. தேர்ந்தெடுக்கப்பட்ட மீட்டெடுப்புத் தேர்வு மட்டும் ஏறத்தாழ 22 லட்சம் உள்ளீட்டு டோக்கன்களைப் பயன்படுத்தியது. gpt-5.5 வகை மாடலில் முக்கியமான உகப்பாக்கத்திற்கு ஒவ்வொரு பணிக்கும் நூற்றுக்கணக்கிலிருந்து சில ஆயிரம் டாலர்கள் வரை செலவாகும். இறுதியாக, இந்த மதிப்புகள் மீண்டும் நடத்தப்பட்ட சோதனைகளிலிருந்து அல்லாமல் ஒற்றை இயக்கங்களிலிருந்து கிடைத்தவை ஆகும். அதனால்தான் முறையான ஆய்வாக அல்லாமல் பொறியியல் வலைப்பதிவாக இவற்றைப் பகிர்கிறோம்.
நிறுவனப் பயன்பாட்டிற்கு ஏற்ற அளவுக்குக் கட்டுப்பாடுடன் தன்னாட்சி நிரலாக்க மேம்பாட்டை மேற்கொள்ள முடியும் என்பதை Meta-Harness காட்டுகிறது. கட்டமைப்புக் கருதுகோள்கள், முன்கணிப்பு முன்வடிகட்டல், தனிமைப்படுத்தப்பட்ட மதிப்பீடு, தரவு அனுமதிக்கும் இடங்களிலெல்லாம் ஒதுக்கிவைக்கப்பட்ட சோதனை, முன்னிறுத்தப்படும் ஒவ்வொரு மாற்றத்திற்குமான முழுத் தணிக்கைத் தடம் ஆகியவையே இதன் முக்கியக் கூறுகள் ஆகும். இவை இணைந்து, செயல்படும் தொடக்கத் தொடரமைப்பிலிருந்து அளவிடத்தக்க வகையில் மேம்பட்ட ஒன்றை அடைவதற்கான முன்கணிக்கக்கூடிய பாதையைப் பொறியியல் குழுவுக்கு வழங்குகின்றன. செயல்பாட்டு உரிமையாளருக்கு எளிய முறையையும் தருகின்றன: தன்னாட்சி ஆராய்வின் பலன்கள், கடுமையான செலவுணர்வுள்ள கட்டமைப்புக்குள் கட்டுப்படுத்தப்பட்டு, எதையும் வெளியிடுவதற்கு முன் மனிதரின் மேற்பார்வையுடன் பயன்படுத்தப்படுகின்றன.