လက်ရှိ အလိုအလျောက်တိုးတက်ရေးစနစ်များသည် ကုဒ်ရေးသားခြင်းလုပ်ငန်းများတွင် ရလဒ်ကောင်းများ ပြသခဲ့သော်လည်း လက်တွေ့လုပ်ငန်းသုံးဖြန့်ချိအသုံးချမှုများနှင့် ဆင်တူသည့် ရှုပ်ထွေးပြီး အချိန်ကြာမြင့်စွာလုပ်ဆောင်ရသော AI လုပ်ငန်းစဉ်များကို တိုးတက်စေနိုင်ခြင်း ရှိမရှိမှာ မရှင်းလင်းသေးပါ။
ကျွန်ုပ်တို့၏ Meta-Harness သုတေသနသည် agentic ရှာဖွေရယူမှု၊ နက်နဲစွာ ရှာဖွေခြင်းနှင့် signal intelligence လုပ်ငန်းစဉ်များတွင် အလိုအလျောက် ကိုယ်တိုင်တိုးတက်မှုကို အသုံးချပြီး သီးခြားဖယ်ထားသည့် အကဲဖြတ်မှု၊ စာရင်းစစ်နိုင်မှု၊ ဘတ်ဂျက်ထိန်းချုပ်မှုနှင့် လူသားအတည်ပြုမှုကဲ့သို့ လုပ်ငန်းသုံးလိုအပ်ချက်များကို ဖြည့်စွက်ထားသည်။
ကိုယ်စားပြုလုပ်ငန်းသုံးမျိုးလုံးတွင် Meta-Harness က စွမ်းဆောင်ရည်ကို သိသိသာသာ မြှင့်တင်ခဲ့သည်။ Signal Engine ၏ သီးခြားဖယ်ထားသည့် စမ်းသပ်မှုစွမ်းဆောင်ရည် 84% တိုးတက်ခြင်းနှင့် Agentic Multimodal Retrieval တွင် ပိုမိုတိကျပြီး လုပ်ဆောင်မှု 16 ဆ ပိုမြန်ခြင်းတို့ ပါဝင်သည်။
ယခင်နည်းလမ်းအများစုနှင့်မတူဘဲ Meta-Harness သည် ဖြစ်နိုင်သမျှနေရာတိုင်းတွင် သီးခြားဖယ်ထားသည့် dataset များဖြင့် အောင်မြင်မှုကို တိုင်းတာကာ ပိုမိုကောင်းမွန်လာမှုများသည် အကောင်းဆုံးဖြစ်အောင် ချိန်ညှိရာတွင် အသုံးပြုသည့်ဒေတာကို ကျော်လွန်၍ ယေဘုယျအသုံးချနိုင်ခြင်း ရှိမရှိ အကဲဖြတ်သည်။
ဤရလဒ်များအရ အလိုအလျောက် လုပ်ငန်းစဉ်တိုးတက်ရေးသည် ကုဒ်ရေးသားမှု စံနှုန်းတိုင်းတာချက်များကို ကျော်လွန်၍ လက်တွေ့လုပ်ငန်းသုံး AI စနစ်များအထိ အသုံးချနိုင်ပြီး AI အပလီကေးရှင်းများကို စဉ်ဆက်မပြတ် တိုးတက်စေရန် လက်တွေ့ကျသောလမ်းကြောင်းတစ်ခု ပေးနိုင်ကြောင်း တွေ့ရသည်။
Meta-Harness စာတမ်း၊ CORAL မူဘောင်နှင့် karpathy/autoresearch အပါအဝင် မကြာသေးမီက အလိုအလျောက် AI သုတေသနများက အကဲဖြတ်မက်ထရစ်တစ်ခု ပေးထားလျှင် ကုဒ်ရေး အေးဂျင့်များသည် ဖြေရှင်းချက်တစ်ခုကို အကြိမ်ကြိမ် တိုးတက်စေနိုင်ကြောင်း ပြသခဲ့သည်။ ဖြေရှင်းရန်ကျန်နေသေးသည်မှာ ထိုနည်းလမ်းများကို အချိန်ရှည်လုပ်ဆောင်ရသော AI လုပ်ငန်းစဉ်များတွင် အသုံးချနိုင်ခြင်း ရှိမရှိဖြစ်သည်။ ဥပမာ အေးဂျင့်တစ်ခုက မေးခွန်းဖြေရန် ပုံစံမျိုးစုံပါဝင်သော နယ်ပယ်ဒေတာအစုများတစ်လျှောက် အကြိမ်ကြိမ်ရှာဖွေရသည့် အေးဂျင့်အခြေပြု ပုံစံမျိုးစုံ ရှာဖွေရယူမှု သို့မဟုတ် အပြန်အလှန်မှီခိုသည့် အဆင့်များ၊ ကိရိယာခေါ်ယူမှုများနှင့် ခြွင်းချက်ကိုင်တွယ်ရေး ဆုံးဖြတ်ချက်များစွာ လိုအပ်သည့် ရှုပ်ထွေးသော ဒေတာစီမံလုပ်ဆောင်မှု pipeline များဖြစ်သည်။ ပိုမိုအရေးကြီးသော မေးခွန်းမှာ အကောင်းဆုံးဖြစ်အောင် ချိန်ညှိသူ မမြင်ဖူးသည့် ဒေတာတွင်ပါ တိုးတက်မှုများ ဆက်လက်တည်တံ့ခြင်း ရှိမရှိဖြစ်သည်။
ကျွန်ုပ်တို့၏ Meta-Harness R&D သည် ထိုမေးခွန်းအတွက် အဖြေဖြစ်သည်။ ၎င်းသည် မကြာသေးမီက သုတေသနအယူအဆများကို ရယူပြီး လုပ်ငန်းသုံးလိုအပ်ချက်များနှင့် ကိုက်ညီအောင် ပြန်လည်ဖွဲ့စည်းထားသည်—သီးခြားဖယ်ထားသည့် အကဲဖြတ်မှု၊ စာရင်းစစ်မှတ်တမ်းများ၊ ကုန်ကျစရိတ်အများဆုံးပမာဏနှင့် ထုတ်လွှင့်အသုံးမပြုမီ လူသားသုံးသပ်သူထံ ရှင်းလင်းစွာ လွှဲပြောင်းပေးသည့်အဆင့်တို့ဖြစ်သည်။
လက်တွေ့ဖောက်သည်လုပ်ငန်းများကို အခြေခံဖန်တီးထားသည့် အချိန်ရှည်လုပ်ဆောင်ရသော လုပ်ငန်းသုံးမျိုးတွင် ၎င်းကို စမ်းသပ်ခဲ့သည်။ Signal Engine သည် AI ဈေးကွက်နှင့်ပတ်သက်သည့် X ပို့စ်များ၏ တိုက်ရိုက်စီးကြောင်းကို စောင့်ကြည့်ပြီး အရင်းအမြစ်ခိုင်မာကာ စနစ်တကျဖွဲ့စည်းထားသည့် လမ်းကြောင်းအစီရင်ခံစာများ ထုတ်ပေးသည်။ Agentic Multimodal Retrieval သည် စာသားနှင့်ပုံ ရောနှောပါဝင်သော ရှာဖွေချက်များကို ဆင်ခြင်သုံးသပ်ပြီး အဆီလျော်ဆုံး စာရွက်စာတမ်းစာမျက်နှာများကို ပြန်ပေးသည်။ နက်နဲစွာ ရှာဖွေခြင်းသည် ဝဘ်ပေါ်တွင်ရှာဖွေရန်၊ အရင်းအမြစ်များကို အပြန်အလှန်စစ်ဆေးရန်နှင့် သုတေသနအစီရင်ခံစာရှည်များ ရေးသားရန် အေးဂျင့်များစွာကို ပေါင်းစပ်ညှိနှိုင်းသည်။
Signal Engine—သီးခြားဖယ်ထားသည့် စမ်းသပ်မှု ပေါင်းစပ်ရမှတ် 0.456 → 0.841၊ နှိုင်းယှဉ်တိုးတက်မှု 84%။ တူညီသောဘတ်ဂျက်အောက်တွင် CORAL နှင့် karpathy/autoresearch တို့သည် 0.50 အောက်၌သာ ရှိခဲ့သည်။
Agentic Multimodal Retrieval—သီးခြားဖယ်ထားသည့် NDCG@10 0.705 → 0.744၊ အကဲဖြတ်မှုတစ်ခုလျှင် အမှန်တကယ်ကြာချိန် 869s မှ 54s သို့ လျော့ကျခဲ့သည်။ တိကျမှု ပိုမြင့်လာသည့်အပြင် မြန်နှုန်း 16 ဆ တိုးလာခြင်းဖြစ်သည်။
နက်နဲစွာ ရှာဖွေခြင်း—ကိုးကားမေးခွန်း 10 ခုအတွက် အစီရင်ခံစာအရည်အသွေး ပေါင်းစပ်ရမှတ် 0.449 → 0.802၊ အခြေခံနည်းလမ်းများမှာ 0.52 ခန့်ဖြစ်သည်။ ဤလုပ်ငန်းတွင် သီးခြားဖယ်ထားသည့် ဒေတာခွဲမရှိသောကြောင့် ရလဒ်ကို နမူနာအတွင်း ရလဒ်အဖြစ်သာ သတ်မှတ်သည်။
ရှာဖွေမှုထိရောက်မှု—Predictive Hypothesis Reranking ဖြင့် Signal Engine သည် တူညီသော အကဲဖြတ်ဘတ်ဂျက်အောက်တွင် အကြိမ် 20 အစား 3 ကြိမ်အတွင်း ကိုးကားလုပ်ဆောင်မှု၏ အကောင်းဆုံးရမှတ် 91% ကို ရရှိခဲ့သည်။
အလိုအလျောက်သုတေသနစနစ်အများစုသည် ဒေတာအစုတစ်ခုတည်းပေါ်တွင် အကောင်းဆုံးဖြစ်အောင် ချိန်ညှိပြီး အကဲဖြတ်ကြသဖြင့် ရလဒ်ကို ယေဘုယျအသုံးချနိုင်ခြင်း ရှိမရှိ မခွဲခြားနိုင်ပါ။ Signal Engine နှင့် Agentic Multimodal Retrieval အတွက် တင်းကျပ်စွာ ခွဲထားသည်—ရွေးချယ်စရာများ အမှတ်ရယူနိုင်သည့် လေ့ကျင့်ရေးဒေတာအစု၊ အခြေခံမှန်ကန်မှုစစ်ဆေးရန် ဖွံ့ဖြိုးရေးဒေတာအစုနှင့် အကောင်းဆုံးဖြစ်အောင် ချိန်ညှိသူ လုံးဝမမြင်ရသည့် သီးခြားဖယ်ထားသော စမ်းသပ်ဒေတာအစုတို့ဖြစ်သည်။ ဖော်ပြထားသော ရလဒ်တိုင်းသည် ဒေတာခွဲအားလုံးတွင် အမှတ်ပေးထားသည့် သီးခြားကုဒ်ဗားရှင်းတစ်ခုမှ ရရှိသည်။ ထို့ကြောင့် ရွေးချယ်စရာတစ်ခု၏ အကောင်းဆုံးလေ့ကျင့်ရေးရမှတ်ကို အခြားတစ်ခု၏ အကောင်းဆုံးစမ်းသပ်ရမှတ်နှင့် မည်သည့်အခါမျှ ရောနှောမထားပါ။
အကြိမ်တစ်ကြိမ်စီတွင် အကဲဖြတ်စမ်းသပ်မှု စနစ်က ကုဒ်ပြောင်းလဲရန် စနစ်တကျဖွဲ့စည်းထားသော ယူဆချက်တစ်စုကို ထုတ်ပေးသည်။ ယူဆချက်တိုင်းတွင် ပြောင်းလဲလိုသည့် ယန္တရား၊ အခြေခံအသုံးပြုထားသည့် ယခင်ဗားရှင်းနှင့် ဖြေရှင်းရည်ရွယ်သည့် ချို့ယွင်းမှုပုံစံတို့ကို သတ်မှတ်ထားသည်။ ကုန်ကျစရိတ်မြင့်သော အကဲဖြတ်မှုများ မလုပ်မီ အဆင့်သတ်မှတ်ခြင်းဖြင့် ယူဆချက်အစုကို စစ်ထုတ်သည်။ စစ်ထုတ်ပြီး ကျန်သည့်ယူဆချက်များကို ဘုံအသိပညာအခြေခံတစ်ခု မျှဝေသော်လည်း လုံးဝသီးခြားထားသည့် အလုပ်နေရာများအတွင်း ကုဒ်ပြင်ဆင်သော အပြိုင်လုပ်သား အေးဂျင့်များထံ ပို့သည်။ ထို့ကြောင့် ရွေးချယ်စရာတစ်ခုချင်းစီကို မျှတလွတ်လပ်စွာ အမှတ်ပေးနိုင်သည်။ အကြိမ်ပြီးဆုံးချိန်တွင် runner က မြင်နိုင်သော ဒေတာခွဲများရှိ စစ်ဆေးမှုအားလုံးကို အောင်မြင်ပြီး ရမှတ်အမြင့်ဆုံးရသည့် ရွေးချယ်စရာတစ်ခုကို အနိုင်ရသူအဖြစ် မြှင့်တင်သည်။ ထိုအနိုင်ရသူသည် နောက်အကြိမ်အတွက် ရှေ့တန်းအခြေခံ ဖြစ်လာသည်။ စမ်းသပ်မှုတိုင်းက ပြင်ဆင်သည့်ကုဒ်၊ ဒေတာခွဲအလိုက်ရမှတ်များ၊ ဖြစ်ရပ်မှတ်တမ်းနှင့် လုပ်ဆောင်မှုလမ်းကြောင်း၊ အမှား၊ ကုန်ကျစရိတ်၊ ပြန်လည်သုံးသပ်ချက်တို့ကို ဖော်ပြသည့် LLM ရေးသားသော ဆန်းစစ်ချက်တိုလေးခုပါဝင်သည့် သတ်မှတ်အစုကို ထပ်ဖြည့်ရုံသာလုပ်နိုင်သော အထောက်အထားသိုလှောင်ရာတွင် ရေးသွင်းသည်။ နောက်အကြိမ်၏ အဆိုပြုသူက ဤမှတ်တမ်းကို ပြန်ဖတ်သည်။ ထို့ကြောင့် အကဲဖြတ်စမ်းသပ်မှု စနစ်သည် အလားတူ မအောင်မြင်သည့်လမ်းများကို ထပ်လုပ်မည့်အစား သင်ယူထားသမျှကို အဆင့်ဆင့် တိုးပွားစေသည်။


ကာကွယ်ရေးစည်းမျဉ်းသုံးခုက ဤလုပ်ငန်းစက်ဝန်းကို ဘေးကင်းစွာ လည်ပတ်နိုင်စေသည်။ လုပ်ဆောင်ခွင့်နယ်ပယ် မူဝါဒက ရွေးချယ်စရာတစ်ခု ပြင်ဆင်နိုင်သည့် ဖိုင်များကို ကန့်သတ်ပြီး နယ်ပယ်ပြင်ပရှိ ပြောင်းလဲမှုမှန်သမျှကို ပြန်ပြင်သည်။ တိုကင်နှင့် အမှန်တကယ်ကြာချိန် ဘတ်ဂျက်များက အသုံးစရိတ်သတ်မှတ်ချက်ကျော်သည်နှင့် လုပ်ဆောင်မှုကို ရပ်တန့်စေပြီး တစ်ပြိုင်တည်းလုပ်ဆောင်မှု ကန့်သတ်ချက်များက အကဲဖြတ်စမ်းသပ်မှု စနစ်ကို မော်ဒယ်နှင့် GPU အသုံးပြုနှုန်းကန့်သတ်ချက်များအတွင်း ထိန်းထားသည်။ ထို့အပြင် အကဲဖြတ်စမ်းသပ်မှု စနစ်သည် မည်သည့်အရာကိုမျှ ကိုယ်တိုင် ထုတ်လွှင့်အသုံးချခြင်းမပြုပါ။ ၎င်းက အဆင့်သတ်မှတ်ပြီး အပြည့်အစုံမှတ်တမ်းတင်ထားသော ရွေးချယ်စရာကို ထုတ်ပေးကာ လူသားအင်ဂျင်နီယာတစ်ဦးက ကုဒ်ကွာခြားချက်ကို သုံးသပ်ပြီး လက်တွေ့အသုံးချမည်၊ မပြုမည် ဆုံးဖြတ်သည်။
စက်တွင်းနည်းပညာအစုတွင် အထက်ပါလုပ်ငန်းစက်ဝန်း၏ အကြိမ်တိုင်းကို အင်ဂျင်နီယာဆိုင်ရာ အခြေခံအစိတ်အပိုင်းငါးခုက ပံ့ပိုးထားသည်။
အလုပ်နေရာ သီးခြားခွဲထားခြင်း။ ရွေးချယ်စရာတစ်ခုလျှင် git worktree တစ်ခု။ မူကွဲများသည် object database တစ်ခုကို မျှဝေသော်လည်း အချင်းချင်း၏ဖိုင်များကို မမျှဝေပါ။ ထို့ကြောင့် disk ကုန်ကျစရိတ် များစွာမပြောင်းလဲဘဲ ရွေးချယ်စရာများကို အပြိုင်လုပ်ဆောင်နိုင်ပြီး လက်ရှိစွမ်းဆောင်ရည်အမြင့်ဆုံးနှင့် ကုဒ်ကွာခြားချက် နှိုင်းယှဉ်ရန် အလွန်လွယ်ကူသည်။
လုပ်ဆောင်မှု Sandbox။ ပြင်ဆင်သတ်မှတ်ချက်အရ နည်းလမ်းနှစ်မျိုး အသုံးပြုနိုင်သည်—လျင်မြန်စွာ ထပ်ခါတလဲလဲ စမ်းရန် native subprocess သို့မဟုတ် လုံးဝသီးခြားထားသည့် runtime။ ဒေတာအစုများကို ဖတ်ရှုခွင့်သာဖြင့် mount လုပ်ပြီး စမ်းသပ်မှုတစ်ခုချင်းစီ၏ ယာယီလမ်းညွှန်ကို အမှတ်ပေးပြီးနောက် ဖျက်ပစ်သည်။ ထို့ကြောင့် စမ်းသပ်မှုတစ်ခုက ဒေတာအစုကို ပြောင်းလဲခြင်း သို့မဟုတ် နောက်စမ်းသပ်မှုသို့ အခြေအနေအချက်အလက် ပေါက်ကြားစေခြင်း မပြုနိုင်ပါ။
လုပ်ဆောင်ခွင့်နယ်ပယ် မူဝါဒ။ စမ်းသပ်မှု ပြင်ဆင်သတ်မှတ်ချက်တွင် ကြေညာထားသော ခွင့်ပြုသည့် path စာရင်း။ ထိုစာရင်းပြင်ပရှိ ပြောင်းလဲမှုမှန်သမျှကို စမ်းသပ်မှုအား အမှတ်မပေးမီ ပြန်ပြင်ပြီး စမ်းသပ်မှုကိုလည်း သတိပေးအမှတ်အသား ပြုသည်။ ထို့ကြောင့် သုံးသပ်သူမြင်ရသည့် ကုဒ်ကွာခြားချက်သည် သတ်မှတ်ထားသော နယ်ပယ်အတွင်းသာ ရှိမည်ဟု အာမခံနိုင်သည်။
ဘတ်ဂျက်ကန့်သတ်ချက် အကောင်အထည်ဖော်ခြင်း။ အလွှာသုံးခုရှိသည်—စမ်းသပ်မှုတစ်ခုချင်းအလိုက် တိုကင်နှင့် အမှန်တကယ်ကြာချိန် ကန့်သတ်ချက်များ၊ လုပ်ဆောင်မှုတစ်ခုလုံး၏ စုစုပေါင်းအများဆုံးပမာဏနှင့် တစ်ပြိုင်တည်းလုပ်ဆောင်မှု ကန့်သတ်ချက်။ ၎င်းတို့က အသုံးစရိတ်ကို ကြိုတင်ခန့်မှန်းနိုင်စေပြီး အကဲဖြတ်စမ်းသပ်မှု စနစ်ကို မော်ဒယ်နှင့် အခြေခံအဆောက်အအုံ၏ အသုံးပြုနှုန်းကန့်သတ်ချက်များအတွင်း ထိန်းထားသည်။
အထောက်အထား သိုလှောင်ရာ။ ပြင်ဆင်သည့်ကုဒ်၊ ဒေတာခွဲအလိုက် ရမှတ်များ၊ ဖြစ်ရပ်မှတ်တမ်းနှင့် LLM ရေးသားသော ဆန်းစစ်ချက်လေးခုပါဝင်သည့် ထပ်ဖြည့်ရုံသာလုပ်နိုင်သော JSONL။ အဆင်သင့်တွက်ချက်ထားသော မြင်ကွင်းများ (ဦးဆောင်ရမှတ်စာရင်း၊ စွမ်းဆောင်ရည်အမြင့်ဆုံး၊ ချို့ယွင်းမှုအညွှန်း) ကို စမ်းသပ်မှုတိုင်းပြီးနောက် ပြန်လည်ထုတ်ပေးသည်။ ထို့ကြောင့် နောက်ပိုင်းအကြိမ်များက ယခင်မှတ်တမ်းကို အခြေခံတိုးတက်နိုင်သလို လုပ်ဆောင်မှုတိုင်းကို byte တစ်လုံးချင်းအထိ ထပ်တူပြန်လုပ်နိုင်သည်။
ဤအခြေခံအစိတ်အပိုင်းများအနက် မည်သည့်တစ်ခုကိုမျှ ချန်လှပ်၍မရပါ။ အကဲဖြတ်စမ်းသပ်မှု စနစ်၏ ရည်ရွယ်ချက်မှာ လုပ်ဆောင်မှုပြီးဆုံးချိန်၌ အနိုင်ရရွေးချယ်စရာ၊ ကန့်သတ်နယ်ပယ်အတွင်းရှိ ကုဒ်ကွာခြားချက်၊ စမ်းသပ်ခဲ့သမျှ၏ မှတ်တမ်းအပြည့်အစုံနှင့် သိရှိပြီးသော ကုန်ကျစရိတ်တို့ပါဝင်သည့် အမှန်တကယ် အတည်ပြုနိုင်သောအရာကို သုံးသပ်သူထံ ပေးအပ်ရန်ဖြစ်သည်။ အခြေခံအစိတ်အပိုင်းငါးခုအနက် တစ်ခုခုကို ဖယ်ရှားလျှင် ထိုအာမခံချက်များထဲမှ တစ်ခု ပျောက်ဆုံးသွားမည်။
စမ်းသပ်မှုသုံးခုလုံးတွင် တူညီသော ယူဆချက်မဟာဗျူဟာကို အသုံးပြုသည်။ အကြိမ်တစ်ကြိမ်စီတွင် အဆိုပြုသူက ဘတ်ဂျက်ဖြင့် လုပ်ဆောင်နိုင်သည်ထက် ပိုများသော ယူဆချက်များကို ထုတ်ပေးသည်—ပို့လွှတ်ဘတ်ဂျက် K = 4 အတွက် ရွေးချယ်စရာ M = 8။ ထို့နောက် သီးခြား LLM အဆင့်သတ်မှတ်သူက စက္ကန့်သုံးဆယ်ကြာ ခေါ်ယူမှုတစ်ကြိမ်အတွင်း 8 ခုလုံးကို လက်ရှိအကောင်းဆုံးရမှတ်နှင့် အားနည်းသည့်အတိုင်းအတာများ၊ မကြာသေးမီ စမ်းသပ်မှုများ၏ ချို့ယွင်းမှုဆန်းစစ်ချက်များနှင့် အဆိုပြုချက် 8 ခုလုံးကို ယှဉ်လျက်ကြည့်ကာ အစဉ်လိုက်သတ်မှတ်သည်။ ထိပ်ဆုံး 4 ခုကို တစ်ခုလျှင် 15 မိနစ်မှ 30 မိနစ်အထိ ကုန်ကျသည့် executor ထံ ပို့သည်။ ကျန် 4 ခုကို ကုန်ကျစရိတ်တစ်စုံတစ်ရာ မဖြစ်ပေါ်မီ ပယ်ဖျက်သည်။
အခြေခံ မော်ဒယ်များကို လုပ်ဆောင်မှုတစ်လျှောက် မပြောင်းလဲဘဲထားပြီး အကဲဖြတ်စမ်းသပ်မှု စနစ်က ၎င်းတို့ပတ်လည်ရှိ ကုဒ်ကိုသာ ပြင်ဆင်ခဲ့သည်။ Signal Engine နှင့် နက်နဲစွာ ရှာဖွေခြင်းကို gpt-5.5 ဖြင့် လုပ်ဆောင်ခဲ့သည်။ Agentic Multimodal Retrieval ကို vLLM မှတစ်ဆင့် စက်တွင်း၌ ဝန်ဆောင်မှုပေးထားသော open-weight Qwen3.6-35B-A3B ဖြင့် လုပ်ဆောင်ပြီး ColQwen3-4B ပုံရှာဖွေရယူစနစ်နှင့် တွဲဖက်ထားသည်။ ကုမ္ပဏီတွင်းအသုံးပြုရာ ကုန်ကျစရိတ်ကို ခန့်မှန်းနိုင်ရန် ဤပေါင်းစပ်မှုကို ရွေးချယ်ခဲ့သည်။
အောက်ပါဇယားက ကျွန်ုပ်တို့၏ အဓိကလုပ်ငန်းသုံးခုအတွက် ရမှတ်များ ပြောင်းလဲလာပုံကို ပြသသည်။ "Seed" ဆိုသည်မှာ လူသားအင်ဂျင်နီယာ ရေးသားထားသော အစပြုကုဒ်ဖြစ်သည်။ "Meta-Harness" ဆိုသည်မှာ Meta-Harness ရှာတွေ့ခဲ့သော အကောင်းဆုံးဗားရှင်းဖြစ်သည်။ သီးခြားဖယ်ထားသည့် စမ်းသပ်ဒေတာအစုတွင် လုပ်ငန်းသုံးခုလုံး၏ စွမ်းဆောင်ရည် တိုးတက်လာသည်ကို တွေ့ရသည်။


Signal Engine ကို လတ်ဆတ်မှု၊ အချက်အလက်မှန်ကန်မှု၊ အသေးစိတ်ကျမှုနှင့် အသံနေအသံထားတို့အလိုက် LLM အကဲဖြတ်သူဖြင့် တိုင်းတာခဲ့ပြီး လေ့ကျင့်ရေး tweet 150 ခုနှင့် သီးခြားဖယ်ထားသည့် စမ်းသပ် tweet 150 ခုကို အသုံးပြုခဲ့သည်။ လုပ်ဆောင်မှုတစ်လျှောက် အကောင်းဆုံးဗားရှင်းသည် လေ့ကျင့်ရေးပေါင်းစပ်ရမှတ်ကို 0.431 မှ 0.756 သို့၊ သီးခြားဖယ်ထားသည့် ရမှတ်ကို 0.456 မှ 0.841 သို့ မြှင့်တင်ခဲ့သည်။ တိုးတက်မှုများသည် တုံ့ပြန်ညွှန်ကြားချက် အနည်းငယ်ပြင်ဆင်ခြင်းကြောင့်သာမဟုတ်ဘဲ အကဲဖြတ်စမ်းသပ်မှု စနစ်ကိုယ်တိုင် ပြောင်းလဲခြင်းမှ ရရှိသည်။ အနိုင်ရအကြိမ်များက လူမှုမီဒီယာဆူညံချက်များကို စစ်ထုတ်ရန် သင်ယူခဲ့ပြီး အချက်အလက်အပြန်အလှန်စစ်ဆေးသည့် အဆင့်များ ထည့်သွင်းကာ ရလဒ်တိုင်းကို တိကျသောအထောက်အထားဖြင့် အခြေခံရန် သတ်မှတ်ခဲ့သည်။ အောက်ပါပုံကြမ်းက အကြိမ်ကြိမ်လုပ်ဆောင်သည့် လုပ်ငန်းစဉ်ကို ပြသသည်။


စမ်းသပ်မှုမှတ်တမ်းက ထိုတိုးတက်မှုများ စုဆောင်းလာပုံကို ပြသသည်။ အစောပိုင်း ဖွဲ့စည်းပုံပြောင်းလဲမှုတစ်ခုက လက်ရှိအကောင်းဆုံးရမှတ်ကို 0.625 သို့ မြှင့်တင်ခဲ့သည်။ ပိုမိုအသေးစိတ်သော အထောက်အထားကိုင်တွယ်မှုက 0.679 သို့ တိုးစေပြီး ပြန်လည်သုံးသပ်မှုနှင့် အမှတ်ပေးစံနှုန်း လုပ်ငန်းစက်ဝန်းကို မွမ်းမံခြင်းက 0.819 သို့ မြှင့်တင်ခဲ့သည်။ ရွေးချယ်စရာလုပ်ဆောင်မှုအားလုံး၏ ထက်ဝက်ခန့်သည် စွမ်းဆောင်ရည်ကျဆင်းခြင်း သို့မဟုတ် လုံးဝမအောင်မြင်ခြင်း ဖြစ်ခဲ့သော်လည်း ဦးဆောင်ရမှတ်စာရင်းကို မထိခိုက်စေခဲ့ပါ။ မူကွဲတစ်ခုချင်းစီကို သီးခြားလုပ်ဆောင်ကာ ရှုံးနိမ့်သည့် ကုဒ်ကွာခြားချက်များကို ပယ်ဖျက်ပြီး ချို့ယွင်းမှုများကို ပြန်လည်သုံးသပ်မှု သိုလှောင်ရာတွင် ရေးသွင်းထားသဖြင့် နောက်အဆိုပြုသူက အလားတူ မအောင်မြင်သည့်လမ်းကို ထပ်မလုပ်ပါ။
အရေးအကြီးဆုံးမှာ လုပ်ဆောင်မှုတစ်လျှောက် သီးခြားဖယ်ထားသည့်ရမှတ်မျဉ်းသည် လေ့ကျင့်ရေးရမှတ်မျဉ်းနှင့်အတူ မြင့်တက်လာခြင်းဖြစ်သည်။ ထို့ကြောင့် အကဲဖြတ်စမ်းသပ်မှု စနစ်သည် လေ့ကျင့်ရေးဒေတာအစုကို မှတ်သားနေခြင်းမဟုတ်ဘဲ လုပ်ငန်းစဉ်ကို အမှန်တကယ် တိုးတက်စေခဲ့ကြောင်း ယူဆနိုင်သည်။ သီးခြားဖယ်ထားသည့် ရမှတ်များသည် လေ့ကျင့်ရေးရမှတ်များထက် အနည်းငယ်မြင့်ခဲ့ပြီး ယင်းကို သေးငယ်ကာ မထပ်နေသည့် ဒေတာခွဲနှစ်ခုကြား ပုံမှန်နမူနာကောက်ယူမှု ဆူညံချက်အဖြစ် ကျွန်ုပ်တို့ သတ်မှတ်သည်။
Agentic Multimodal Retrieval ကို အများပြည်သူသုံး ViDoRe V3 Computer Science ဒေတာခွဲတွင် NDCG@10 ဖြင့် တိုင်းတာပြီး လေ့ကျင့်ရေးရှာဖွေချက် 20 ခု၊ ဖွံ့ဖြိုးရေးရှာဖွေချက် 10 ခုနှင့် သီးခြားဖယ်ထားသည့် စမ်းသပ်ရှာဖွေချက် 20 ခုအဖြစ် စီစဉ်ထားသည်။ အကဲဖြတ်စမ်းသပ်မှု စနစ်သည် သီးခြားဖယ်ထားသည့် NDCG@10 ကို 0.705 မှ 0.744 သို့ မြှင့်တင်ခဲ့ပြီး စုစုပေါင်းအကဲဖြတ်မှု အမှန်တကယ်ကြာချိန်ကို 869 စက္ကန့်မှ 54 စက္ကန့်သို့ လျှော့ချခဲ့သည်။
နက်နဲစွာ ရှာဖွေခြင်းကို ကိုးကားမေးခွန်း 10 ခုတွင် DeepResearch-Eval အတိုင်း အကြောင်းအရာအရည်အသွေးနှင့် ကိုးကားချက်အရည်အသွေးတို့၏ LLM အကဲဖြတ် ပေါင်းစပ်ရမှတ်ဖြင့် အမှတ်ပေးသည်။ ပိုမိုကောင်းမွန်သောကုဒ်က ပျမ်းမျှရမှတ်ကို 0.449 မှ 0.802 သို့ မြှင့်တင်ခဲ့သည်။ အနိုင်ရပြောင်းလဲမှုများကို ကုဒ်ကွာခြားချက်မှ အလွယ်တကူ သိနိုင်သည်—သုတေသန အေးဂျင့်များ မပို့လွှတ်မီ နည်းလမ်းများကို နှိုင်းယှဉ်သည့် ကနဦးစီမံကိန်းအဆင့်နှင့် ယခင်က အစီရင်ခံစာများ ရမှတ်နည်းခဲ့သည့် အတိုင်းအတာများကို ပစ်မှတ်ထားသော နောက်ဆုံးသုံးသပ်မှုအဆင့်တို့ဖြစ်သည်။ ဤဒေတာအစုသည် သေးငယ်ပြီး အကဲဖြတ်ရန် ကုန်ကျစရိတ်မြင့်သောကြောင့် ဒေတာမခွဲခဲ့ဘဲ ရလဒ်ကို နမူနာအတွင်း ရလဒ်အဖြစ် သတ်မှတ်သည်။


နည်းလမ်းသုံးခုလုံးကို တူညီသောဘတ်ဂျက်အောက်တွင် စံနှုန်းတိုင်းတာခဲ့သည်—တူညီသော dataset များ၊ အခြေခံ မော်ဒယ်များ၊ အကြိမ်အရေအတွက် အများဆုံးသတ်မှတ်ချက်နှင့် ရွေးချယ်စရာအကဲဖြတ်မှု စုစုပေါင်းအရေအတွက်တို့ဖြစ်သည်။ Signal Engine တွင် Meta-Harness သည် သီးခြားဖယ်ထားသည့် စမ်းသပ်မှု၌ ၀.၈၄၁ ရရှိခဲ့ပြီး အခြေခံနည်းလမ်းနှစ်ခုလုံးမှာ ၀.၅၀ အောက်၌သာ ရှိခဲ့သည်။ Agentic Multimodal Retrieval တွင် ကျွန်ုပ်တို့အဖွဲ့က သီးခြားဖယ်ထားသည့် NDCG@10 အမြင့်ဆုံး (၀.၇၄၄၊ CORAL ၀.၇၀၀ နှင့် karpathy ၀.၇၃၈) ရရှိပြီး တရားဝင်အကဲဖြတ်မှုကို ၁၂ ဆမှ ၁၄ ဆအထိ ပိုမြန်စွာ လုပ်ဆောင်သည်— ၅၄ စက္ကန့် သာကြာပြီး အခြားနည်းလမ်းများမှာ ၇၈၆ စက္ကန့် နှင့် ၆၅၀ စက္ကန့် ကြာသည်။ နက်နဲစွာ ရှာဖွေခြင်းတွင် ကျွန်ုပ်တို့အဖွဲ့က ၀.၈၀၂ ရရှိခဲ့ပြီး အခြေခံနည်းလမ်းနှစ်ခုလုံးမှာ ၀.၅၂ ခန့်၌သာ ရှိခဲ့သည်။ ခြွင်းချက်တစ်ခုရှိသည်—ကျွန်ုပ်တို့သည် CORAL နှင့် karpathy/autoresearch ကို ၎င်းတို့၏ ထုတ်ဝေထားသော ဖော်ပြချက်များအတိုင်း ပြန်လည်အကောင်အထည်ဖော်ခဲ့သောကြောင့် ကွာဟချက်အချို့သည် နည်းလမ်းကွာခြားမှုသက်သက်မဟုတ်ဘဲ အကောင်အထည်ဖော်ပုံ ကွာခြားမှုကြောင့် ဖြစ်နိုင်သည်။
ဤကွာဟချက်ကို ဖြစ်ပေါ်စေသည့် ဒီဇိုင်းရွေးချယ်မှု လေးခုရှိသည်။ ပထမ၊ ကျွန်ုပ်တို့အဖွဲ့သည် ကုဒ်မပြင်ဆင်မီ စနစ်တကျဖွဲ့စည်းထားသည့် ဒီဇိုင်းသတ်မှတ်ချက်ကို ထုတ်ပေးသည်။ ထို့ကြောင့် တုံ့ပြန်ညွှန်ကြားချက် အနည်းငယ်ပြင်ဆင်ခြင်းထက် pipeline အဆင့်အသစ်များကဲ့သို့ ဖွဲ့စည်းပုံဆိုင်ရာ ပြောင်းလဲမှုများကို ဦးစားပေးသည်။ ဒုတိယ၊ မျှဝေထားသည့် စွမ်းဆောင်ရည်အမြင့်ဆုံးရွေးချယ်စရာကို အခြေခံသည့် မူကွဲများကို တစ်ပြိုင်တည်း လုပ်ဆောင်သဖြင့် CORAL ၏ သီးခြား အေးဂျင့်များ သို့မဟုတ် karpathy ၏ တစ်ဆင့်ပြီးတစ်ဆင့်သာ လုပ်ဆောင်သော စက်ဝန်းထက် တိုးတက်မှုများ ပိုမိုလျင်မြန်စွာ စုပေါင်းလာသည်။ တတိယ၊ စမ်းသပ်မှုတိုင်းသည် နောက်အဆိုပြုသူ ပြန်ဖတ်နိုင်သည့် စနစ်တကျဖွဲ့ထားသော ရလဒ်ပစ္စည်းများ (ရမှတ်များ၊ ဖြစ်ရပ်မှတ်တမ်းများနှင့် LLM ရေးသားသော ဆန်းစစ်ချက်လေးခု) ကို ချန်ထားပြီး အခြေခံနည်းလမ်းများကမူ ရိုးရှင်းသော ကြိုးပမ်းမှုမှတ်တမ်းများကိုသာ သိမ်းထားသည်။ စတုတ္ထ၊ အလိုက်သင့်ထိန်းချုပ်စနစ်က တိုးတက်မှုရပ်တန့်ပြီးနောက် အဆိုပြုသူကို နည်းလမ်းသစ်ရှာဖွေစေကာ အနိုင်ရပြီးနောက် အသေးစိတ်မွမ်းမံစေသည်။ ထို့အပြင် Predictive Hypothesis Reranking က အားနည်းသောအယူအဆများကို ဘတ်ဂျက်မသုံးမီ ပယ်ဖျက်ပေးသည်။
သီးခြားဖယ်ထားသည့် ရမှတ်မျဉ်းများက နယ်ပယ်အတွင်း ယေဘုယျအသုံးချနိုင်မှုကို ပြသခြင်းသာဖြစ်ပြီး နယ်ပယ်တစ်ခုမှတစ်ခုသို့ လွှဲပြောင်းအသုံးချနိုင်မှုကို မပြသပါ။ AI ဈေးကွက် signal ထုတ်ယူရန် ချိန်ညှိထားသော လုပ်ငန်းစဉ်သည် အကဲဖြတ်စမ်းသပ်မှု စနစ်ကို ပြန်မလုပ်ဘဲ ဥပဒေ သို့မဟုတ် ဇီဝဆေးပညာ စာသားများတွင် ကောင်းစွာအလုပ်လုပ်မည်ဟု မမျှော်လင့်သင့်ပါ။ အကဲဖြတ်စမ်းသပ်မှု စနစ်သည် အမှတ်ပေးသူ သတ်မှတ်ထားသည့် ပန်းတိုင်ကိုသာ တက်လှမ်းနိုင်သဖြင့် ဆူညံချက်များသော လေ့ကျင့်ရေးဒေတာအစု သို့မဟုတ် ချိန်ညှိမှုမမှန်သော အကဲဖြတ်သူရှိလျှင် ထိုအားနည်းချက်များနှင့် တိကျစွာ လွန်ကဲကိုက်ညီသွားမည်။ အရေးကြီးသောလုပ်ဆောင်မှု မစတင်မီ ကောင်းစွာရွေးချယ်ထားသည့် လေ့ကျင့်ရေးအချက်အလက် အနည်းဆုံး 20 ခုနှင့် သီးခြားဖွံ့ဖြိုးရေးဒေတာခွဲတစ်ခု အသုံးပြုရန် အကြံပြုသည်။ ကုန်ကျစရိတ်သည် အကြီးမားဆုံး လက်တွေ့ကန့်သတ်ချက်ဖြစ်သည်။ အကဲဖြတ်မှုတိုင်းက ဒေတာခွဲအားလုံးအတွက် pipeline အပြည့်အစုံကို ပြန်လည်လုပ်ဆောင်သည်။ ရွေးချယ်ထားသော ရှာဖွေရယူမှုရွေးချယ်စရာတစ်ခုတည်းက input တိုကင် 2.2 သန်းခန့် အသုံးပြုခဲ့ပြီး gpt-5.5 အဆင့် မော်ဒယ်တစ်ခုဖြင့် အလေးအနက် အကောင်းဆုံးဖြစ်အောင် ချိန်ညှိရာတွင် လုပ်ငန်းတစ်ခုလျှင် ဒေါ်လာရာဂဏန်းမှ ထောင်ဂဏန်းအစပိုင်းအထိ ကုန်ကျသည်။ နောက်ဆုံးအနေဖြင့် ဤကိန်းဂဏန်းများသည် ထပ်ခါတလဲလဲ စမ်းသပ်မှုများမှမဟုတ်ဘဲ တစ်ကြိမ်တည်းလုပ်ဆောင်မှုများမှ ရရှိထားသည်။ ထို့ကြောင့် တရားဝင်သုတေသနတစ်ခုအဖြစ်မဟုတ်ဘဲ အင်ဂျင်နီယာဘလော့ဂ်ပို့စ်အဖြစ် မျှဝေခြင်းဖြစ်သည်။
Meta-Harness က အလိုအလျောက်ကုဒ်တိုးတက်ရေးကို လုပ်ငန်းသုံးအတွက် လုံလောက်စွာ စနစ်တကျ လုပ်ဆောင်နိုင်ကြောင်း ပြသသည်။ အဓိကအစိတ်အပိုင်းများမှာ ဖွဲ့စည်းပုံဆိုင်ရာ ယူဆချက်များ၊ ကြိုတင်ခန့်မှန်းစစ်ထုတ်မှု၊ သီးခြားခွဲထားသည့် အကဲဖြတ်မှု၊ ဒေတာအခြေအနေပေးသည့်နေရာတိုင်းတွင် သီးခြားဖယ်ထားသည့် စမ်းသပ်မှုနှင့် မြှင့်တင်ထားသော ပြောင်းလဲမှုတိုင်း၏ နောက်ကွယ်ရှိ စာရင်းစစ်မှတ်တမ်းအပြည့်အစုံတို့ဖြစ်သည်။ ၎င်းတို့အားလုံးပေါင်းစပ်ခြင်းဖြင့် အင်ဂျင်နီယာအဖွဲ့သည် အလုပ်လုပ်သော seed pipeline မှ တိုင်းတာ၍ရအောင် ပိုကောင်းသည့် pipeline သို့ ကြိုတင်ခန့်မှန်းနိုင်သော လမ်းကြောင်းတစ်ခု ရရှိသည်။ လုပ်ငန်းလည်ပတ်မှုတာဝန်ခံအတွက်လည်း ရိုးရှင်းသောပုံစံတစ်ခု ရရှိသည်—အလိုအလျောက်ရှာဖွေမှု၏ အကျိုးကျေးဇူးကို တင်းကျပ်ပြီး ဘတ်ဂျက်ကို ထည့်သွင်းစဉ်းစားသည့် မူဘောင်အတွင်း ထိန်းထားကာ မည်သည့်အရာကိုမျှ ထုတ်လွှင့်အသုံးမပြုမီ လူတစ်ဦးက စစ်ဆေးဆုံးဖြတ်ခြင်းဖြစ်သည်။