လွန်ခဲ့သောနှစ်နှစ်အတွင်း “RAG” (Retrieval-Augmented Generation) သည် စာသားနှင့်သာ သက်ဆိုင်သကဲ့သို့ ဖြစ်နေခဲ့သည်။ စံလုပ်နည်းက ရိုးရှင်းသည်။ စာရွက်စာတမ်းများကိုယူ၊ စာသားထုတ်၊ အပိုင်းခွဲပြီး အညွှန်းတပ်ခြင်းဖြစ်သည်။
သို့သော် လုပ်ငန်းလောကသည် ရိုးရိုးစာသားဖိုင်များဖြင့် လည်ပတ်နေခြင်းမဟုတ်ပါ။ ၎င်းသည် ရှုပ်ထွေးသော PDF များ၊ ဇယားသိပ်သည်းသည့် ဆလိုက်များ၊ CAD ပုံများ၊ စကန်ဖတ်ထားသော ပြေစာများနှင့် တိုးပွားလာနေသည့် ဗီဒီယိုမှတ်တမ်းအစုအဝေးကြီးများဖြင့် လည်ပတ်နေသည်။
ပုံတစ်ပုံကို embedding မလုပ်မီ OCR သို့မဟုတ် Vision LLM များဖြင့် စာသား “စာတန်းထိုး” ပြောင်းသည့် လက်ရှိစက်မှုစံနည်းလမ်းသည် အကြီးမားဆုံး အဟန့်အတားဖြစ်သည်။ ၎င်းသည် နှေးကွေးပြီး ကုန်ကျစရိတ်မြင့်ကာ မူရင်းဒေတာ၏ ကြွယ်ဝသော နေရာချထားမှုနှင့် မြင်ကွင်းဆိုင်ရာအကြောင်းအရာများ မလွဲမသွေ ဆုံးရှုံးစေသည်။ သင့် AI က ရှုပ်ထွေးသောပုံတစ်ပုံကို “အသေးစိတ်ပုံကြမ်းတစ်ခု” ဟုသာ ဖော်ပြပါက ယင်းအတွင်းရှိ သီးခြားဗားလ် သို့မဟုတ် ဝါယာကြိုးပုံစံကို ရှာနိုင်စွမ်း ဆုံးရှုံးသွားပြီဖြစ်သည်။
ယနေ့တွင် ဤပြဿနာကို အစမှအဆုံး မြင်ကွင်းရှာဖွေထုတ်ယူမှု ဖြင့် ဖြေရှင်းရန် ဒီဇိုင်းထုတ်ထားပြီး ColPali ဗိသုကာပေါ် အခြေခံတည်ဆောက်ထားသော ခေတ်မီဆုံး ဘက်စုံမီဒီယာ embedding မော်ဒယ်မိသားစုကို ထုတ်ပြန်လိုက်သည်။
အမှန်တကယ် ထိရောက်သော ဘက်စုံမီဒီယာရှာဖွေစနစ်ကို တည်ဆောက်ခြင်းသည် အသင့်သုံး Vision-Language Model (VLM) တစ်ခုကိုယူ၍ ရှာခိုင်းရုံမျှ မလွယ်ကူပါ။ ဘက်စုံမီဒီယာ RAG ကို သမိုင်းတစ်လျှောက် အဟန့်အတားဖြစ်စေခဲ့သော စိန်ခေါ်မှုများကို ဖြေရှင်းပြီး ColQwen3 ဖန်တီးရန် မော်ဒယ်ပေါင်းစည်းမှုနှင့် လေ့ကျင့်ရေးမဟာဗျူဟာများကို အသုံးပြုခဲ့သည်။
အခြေခံမော်ဒယ်တစ်ခုကို အစမှ fine-tune လုပ်မည့်အစား ရှိပြီးသား စာသား embedding မော်ဒယ်မှ ရှာဖွေထုတ်ယူမှုဆိုင်ရာ အသိပညာကို လွှဲပြောင်းပေးသည့် နည်းလမ်းကို ဖန်တီးခဲ့သည်။ စံ VLM တစ်ခုသည် ပုံများကို ဖော်ပြတတ်သော်လည်း မေးခွန်းတစ်ခုနှင့် အဓိပ္ပာယ်အရ နှိုင်းယှဉ်၍ အစဉ်လိုက်သတ်မှတ်တတ်မည်ဟု မဆိုနိုင်ပါ။
ဤကွာဟချက်ကို ဖြည့်ဆည်းရန် ချိန်ညှိထားသော ပေါင်းစည်းအလေးချိန် မဟာဗျူဟာများကို အသုံးပြုခဲ့သည်။ စမ်းသပ်မှုများအရ Qwen3-Embedding ၏ စာသား latent space ထဲရှိ ရှာဖွေထုတ်ယူနိုင်စွမ်းကို ဘက်စုံမီဒီယာ space သို့ တိုက်ရိုက်လွှဲပြောင်းနိုင်ပြီး ချက်ချင်းလေ့ကျင့်ခြင်းမရှိဘဲပင် ပုံနှင့်ဗီဒီယို ရှာဖွေမှုသို့ ယေဘုယျအသုံးချနိုင်ကြောင်း တွေ့ရှိခဲ့သည်။ ဤထိရောက်သော ကနဦးသတ်မှတ်မှုကို ခိုင်မာသည့်အစအဖြစ် အသုံးချပြီးနောက် စွမ်းဆောင်ရည် ပိုကောင်းစေရန်နှင့် တည်ငြိမ်ခိုင်မာမှုရှိစေရန် မော်ဒယ်ကို ထပ်မံ fine-tune လုပ်ခဲ့သည်။ ၎င်းသည် Qwen3-VL အခြေခံမော်ဒယ်မှ fine-tune လုပ်ခြင်းနှင့် နှိုင်းယှဉ်ပါက နောက်ဆုံးရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည်ကို မြှင့်တင်ပေးသည်။
Embedding စွမ်းရည်များ လွှဲပြောင်းပြီးနောက် ချိန်ညှိကိုက်ညီမှုကို အာရုံစိုက်ခဲ့သည်။ ရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည် အမြင့်ဆုံးရရန် သင့်တော်ဆုံး epoch အရေအတွက်၊ batch size၊ learning rate၊ LoRA rank နှင့် ဒေတာအစုများ ရောစပ်ပုံတို့အပါအဝင် hyper-parameter ရှာဖွေမှုနှင့် ablation လေ့လာမှုများကို ဂရုတစိုက် ပြုလုပ်ခဲ့သည်။
Fine-tuning ဒေတာအစုများအဖြစ် VDR၊ ColPali train set၊ visrag_syn၊ နှင့် visrag_ind တို့ကို ရွေးချယ်ခဲ့သည်။ Fine-tuning အတွက် UniMax sampling ကို အသုံးပြုခဲ့သည်။ မော်ဒယ်ပေါင်းစည်းမှုကို အသုံးပြုထားပြီး ပေါင်းစည်းထားသောအခြေခံမော်ဒယ်က ဘက်စုံမီဒီယာ ရှာဖွေစွမ်းရည်အချို့ကို ရရှိထားပြီးဖြစ်သောကြောင့် ဒေတာအစုများ ပိုတိုးခြင်းက စွမ်းဆောင်ရည်ကို အနည်းငယ်ကျဆင်းစေကြောင်း တွေ့ရှိခဲ့သည်။ ထို့ကြောင့် ဒေတာအစုများ ထပ်မတိုးခဲ့ပါ။
Fine-tuning အတွက် ရွေးချယ်ထားသော hyper-parameter များမှာ အောက်ပါအတိုင်းဖြစ်သည်။
LoRA Rank | 32 |
LoRA Alpha | 32 |
LoRA ပစ်မှတ် module များ | embedding မှလွဲ၍ ပုံနှင့်စာသား အလွှာအားလုံး |
Learning Rate | 5e-5 |
မြင်ကွင်းတိုကင် အများဆုံး | 1280 |
လေ့ကျင့်ရေး Epoch များ | 1 |
စုစုပေါင်း Batch Size | 512 |
Warmup အချိုး | 5% |
သမိုင်းတစ်လျှောက် “ColBERT ပုံစံ” တိုကင်အဆင့် embedding များကို အသုံးပြုသော မော်ဒယ်များ (ဥပမာ ColPali) သည် အလွန်ကောင်းမွန်စွာ စွမ်းဆောင်နိုင်သော်လည်း သိုလှောင်မှုကုန်ကျစရိတ်မှာ လက်မခံနိုင်အောင် မြင့်မားခဲ့သည်။ မြင်ကွင်းတိုကင်တိုင်းကို အညွှန်းတပ်ခြင်းက လုပ်ငန်းအကြီးစားအဆင့်အတွက် ကုန်ကျစရိတ်လွန်ကဲသော vector database အကြီးကြီးများ ဖြစ်ပေါ်စေခဲ့သည်။
ပိုမိုကောင်းမွန်အောင်လုပ်သည့် မဟာဗျူဟာ- အမြင့်ဆုံးစွမ်းဆောင်ရည်ကို ထိန်းထားပြီး သိုလှောင်မှုကုန်ကျစရိတ် မတဟုန်ထိုးမြင့်စေရန် embedding အရွယ်အစားကို ဂရုတစိုက် ဟန်ချက်ညီစေခြင်းဖြင့် သိုလှောင်မှုစိန်ခေါ်ချက်ကို ဖြေရှင်းခဲ့သည်။ ဤကျစ်လျစ်ထိရောက်သော အရွယ်အစားအတွင်း SOTA တိကျမှုကို ထိန်းသိမ်းရန် ရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည်နှင့် သိုလှောင်မှုကုန်ကျစရိတ် အမျှတဆုံးဖြစ်စေသည့် dimension size 320 ကို ဂရုတစိုက် ရွေးချယ်ခဲ့သည်။
အခြေခံစနစ်- စံနည်းလမ်းတစ်ခု (ဥပမာ NVIDIA Nemo-3B) သည် ပုံ ၁ သန်းအတွက် embedding များ သိုလှောင်ရန် ခန့်မှန်းခြေ 10.3 TB လိုအပ်သည် (တိုကင် 1,802 @ dimension 3,072)။
ColQwen3- အလားတူ ပုံ ၁ သန်းကို 0.82 TB သာဖြင့် သိုလှောင်သည် (အများဆုံး တိုကင် 1,280 @ dimension 320)။
ColQwen3 သည် cloud အခြေခံအဆောက်အအုံဘတ်ဂျက်ကို အဆမတန် မမြင့်စေဘဲ SOTA ရှာဖွေထုတ်ယူမှုတိကျမှုကို ရရှိသည်။
ကျွန်ုပ်တို့၏နည်းလမ်းကို ViDoRe စံနှုန်းအစုဖြင့် အတည်ပြုစမ်းသပ်ခဲ့သည်။ ရလဒ်များအရ ColQwen3 သည် နောက်ဆုံးပေါ် V3 နှင့် V2 စံနှုန်းများ (အင်္ဂလိပ်နှင့် ဘာသာစုံနှစ်မျိုးလုံး) တွင် စံသစ်များ သတ်မှတ်နိုင်ခဲ့ပြီး အဟောင်း V1 လုပ်ငန်းများ၌လည်း ထိပ်တန်းစွမ်းဆောင်ရည်ကို ဆက်လက်ထိန်းထားနိုင်ကြောင်း အတည်ပြုသည်။
ColQwen3-8B သည် အင်္ဂလိပ်နှင့် ဘာသာစုံ ရှာဖွေထုတ်ယူမှုတွင် ဦးဆောင်နေသည်။
အင်္ဂလိပ် nDCG@5
မော်ဒယ် | ကွန်ပျူတာသိပ္ပံ | စွမ်းအင် | ဘဏ္ဍာရေး | လူ့စွမ်းအားအရင်းအမြစ် | စက်မှု | ဆေးဝါး | ရူပဗေဒ | ပျမ်းမျှ |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
ဘာသာစုံ nDCG@5
မော်ဒယ် | ကွန်ပျူတာသိပ္ပံ | စွမ်းအင် | ဘဏ္ဍာရေး | လူ့စွမ်းအားအရင်းအမြစ် | စက်မှု | ဆေးဝါး | ရူပဗေဒ | ပျမ်းမျှ |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG၊ စီးပွားရေးပညာနှင့် DocVQA တို့တွင် တစ်သမတ်တည်း မြင့်မားသောစွမ်းဆောင်ရည်။
စံနှုန်း | မော်ဒယ် | ရမှတ် (ပျမ်းမျှ) | ထင်ရှားသောအောင်မြင်မှု |
ViDoRe V2 (အင်္ဂလိပ်) | ColQwen3-8B | 0.6772 | ESG & BioMed တွင် နံပါတ် ၁ |
ViDoRe V2 (ဘာသာစုံ) | ColQwen3-8B | 0.6085 | စီးပွားရေးပညာတွင် နံပါတ် ၁ |
ViDoRe V1 (အင်္ဂလိပ်) | Nemo ColEmbed 3B | 0.9100 | ပျမ်းမျှ အနည်းငယ်ပိုမြင့် |
ViDoRe V1 (အင်္ဂလိပ်) | ColQwen3-8B | 0.9076 | ArxivQA & Syn-Gov တွင် နံပါတ် ၁ |
ColQwen3 သည် ဗီဒီယိုရှာဖွေထုတ်ယူမှုတွင် ကောင်းစွာ ယေဘုယျအသုံးချနိုင်ကြောင်း ပြသရန် မော်ဒယ်များကို စာသားမှဗီဒီယို (အထွေထွေရှာဖွေထုတ်ယူမှု) လုပ်ငန်းများအတွက် CareBench စံနှုန်းဖြင့် အကဲဖြတ်ခဲ့သည်။
ဤအကဲဖြတ်မှုတွင် မူရင်းဗီဒီယိုကုဒ်ပြောင်းနည်းကို အသုံးပြုခဲ့သည်။ ကျွန်ုပ်တို့၏မော်ဒယ်များသည် ထပ်ဆောင်းစာသားမှတ်ချက် သို့မဟုတ် မက်တာဒေတာမပါဘဲ ဗီဒီယိုဖိုင်များကို တိုက်ရိုက်ကုဒ်ပြောင်းခဲ့သည်။ ၎င်းက မော်ဒယ်သည် မြင်ကွင်းဆိုင်ရာအဓိပ္ပာယ်ပေါ်သာ အခြေခံ၍ ရှာဖွေထုတ်ယူနိုင်ကြောင်း ထင်ရှားစေသည်။
မော်ဒယ် | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 ကြောင့် ဖြစ်ပေါ်လာသော အကြီးမားဆုံးပြောင်းလဲမှုတစ်ခုမှာ ဗီဒီယိုကို စာရွက်စာတမ်းကဲ့သို့ပင် ကိုင်တွယ်နိုင်ခြင်းဖြစ်သည်။ လုပ်ငန်းများစွာတွင် ဗီဒီယိုသည် “အမှောင်ဒေတာ” ဖြစ်သည်။ လူတစ်ဦးက ဖိုင်တိုင်းကို ကိုယ်တိုင်တဂ်မတပ်ထားလျှင် ၎င်းသည် ရေရှည်သိုလှောင်မှုထဲတွင် ရှာမရဘဲ ရှိနေတတ်သည်။
ColQwen3 သည် ပိုင်းခြားထားသောကလစ်များကို ဖရိမ်အလိုက် ရှာဖွေထုတ်ယူနိုင်စေခြင်းဖြင့် ယင်းအခြေအနေကို ပြောင်းလဲပေးသည်။
လုပ်ငန်းများသည် နေ့စဉ် အတွင်းပိုင်းဗီဒီယိုအစည်းအဝေး နာရီပေါင်းထောင်ချီကို မှတ်တမ်းတင်ကြသော်လည်း ထိုမှတ်တမ်းများမှာ များသောအားဖြင့် အလဟဿပျောက်ကွယ်သွားသည်။
လုပ်ငန်းစဉ်- ရှည်လျားသောအစည်းအဝေးမှတ်တမ်းများကို အဓိပ္ပာယ်ရှိသည့် ကလစ်တိုများအဖြစ် အလိုအလျောက်ပိုင်းခြားပြီး ColQwen3 ဖြင့် အညွှန်းတပ်ခြင်းဖြင့် ရှာဖွေနိုင်သော “ကုမ္ပဏီမှတ်ဉာဏ်” တစ်ခု ဖန်တီးနိုင်သည်။
မေးခွန်း- ပရောဂျက်မန်နေဂျာတစ်ဦးက “Show me the clip where the engineering lead explained the latency issue with the API.” ဟု မေးနိုင်သည်။
ရလဒ်- စနစ်သည် မိနစ် ၆၀ ကြာ ဗီဒီယိုဖိုင်ကို ပြန်ပေးမည့်အစား သက်ဆိုင်ရာပုံကြမ်းကို မျက်နှာပြင်ပေါ်မျှဝေ၍ ဆွေးနွေးခဲ့သည့် ၄၅ စက္ကန့်စာအပိုင်းကို အတိအကျ ရှာဖွေပေးသည်။ ထိုအချိန်၌ ပြောဆိုသူများက “latency” ဟူသောစကားလုံးကို တိတိကျကျ မပြောခဲ့လျှင်ပင် ရှာနိုင်သည်။
မူလပုံစံ ဘက်စုံမီဒီယာ embedding သို့ ကူးပြောင်းခြင်းက ကဏ္ဍအသီးသီးတွင် လုပ်ငန်းစဉ်အသစ်များကို ဖွင့်လှစ်ပေးသည်။ ဤမော်ဒယ်ကို အရှုပ်ထွေးဆုံး လုပ်ငန်းဒေတာပတ်ဝန်းကျင်အချို့နှင့် နှိုင်းယှဉ်၍ ကျယ်ကျယ်ပြန့်ပြန့် စံနှုန်းစမ်းသပ်ထားသည်။
မဟာစီမံကိန်းများ၊ မြေအသုံးချဇုန်မြေပုံများနှင့် ရှုပ်ထွေးသော ဗိသုကာအမြင်ပုံများကို အလွန်များပြားစွာ စီမံရသည့် မြို့ပြအတိုင်ပင်ခံကုမ္ပဏီများ ကြုံတွေ့ရသော ဒေတာစိန်ခေါ်မှုများဖြင့် ColQwen3 ကို စမ်းသပ်ခဲ့သည်။
စိန်ခေါ်မှု- ဤပတ်ဝန်းကျင်များတွင် သမားရိုးကျ RAG ပိုက်လိုင်းများ အခက်တွေ့တတ်သည်။ OCR ကိရိယာများသည် ရှုပ်ထွေးသော နေရာစီမံကိန်းများကို “ပုံကြမ်း” ဟုသာ ဖော်ပြလေ့ရှိသဖြင့် ယာဉ်အသွားအလာ၊ စိမ်းလန်းဇုန် သို့မဟုတ် အဆောက်အအုံနောက်ဆုတ်အကွာအဝေးကဲ့သို့ အရေးကြီးအသေးစိတ်များ လွတ်သွားသည်။
စွမ်းဆောင်ရည်- ကျွန်ုပ်တို့၏အတွင်းပိုင်း စံနှုန်းစမ်းသပ်မှုများအရ ColQwen3 သည် ကုန်ကျစရိတ်မြင့် OCR/စာတန်းထိုး ကြိုတင်လုပ်ဆောင်မှုကို ထိရောက်စွာ ကျော်လွှားနိုင်သည်။ အချက်အလက်သိပ်သည်းသည့် ဗိသုကာပုံများဖြင့် စမ်းသပ်ရာတွင် မော်ဒယ်သည် လမ်းလျှောက်ဝင်ပေါက်များ သို့မဟုတ် ထင်ရှားသောဇုန်နယ်နိမိတ်များကဲ့သို့ တိကျသည့် မြင်ကွင်းအမှတ်အသားများအပေါ် အခြေခံ၍ စာရွက်စာတမ်းများကို အောင်မြင်စွာ ရှာဖွေခဲ့သည်။ စာသားသီးသန့် အခြေခံစနစ်များထက် သိသိသာသာ ပိုကောင်းပြီး အသိပညာထည့်သွင်းမှုကုန်ကျစရိတ်ကိုလည်း အကြီးအကျယ် လျှော့ချနိုင်မည်ဖြစ်သည်။
ရင်းနှီးမြှုပ်နှံမှုဘဏ်လုပ်ငန်းရှင်များနှင့် လေ့လာဆန်းစစ်သူများသည် နှစ်ပတ်လည်အစီရင်ခံစာများနှင့် ရင်းနှီးမြှုပ်နှံသူဆလိုက်များကို ရှာဖွေစစ်ဆေးရာတွင် နာရီပေါင်းထောင်ချီ သုံးစွဲကြသည်။
လုပ်ငန်းစဉ်- လေ့လာဆန်းစစ်သူက “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.” ဟု မေးနိုင်သည်။
အပြောင်းအလဲ- သော့ချက်စာလုံးကိုက်ညီမှုကို အားကိုးမည့်အစား မော်ဒယ်က သီးခြားဒေတာမြင်ကွင်းပုံစံ ပါဝင်မှုအပေါ် အခြေခံ၍ သက်ဆိုင်ရာဆလိုက်ကို အတိအကျ ရှာဖွေပေးသဖြင့် RAG စနစ်က မေးခွန်းများကို တိကျစွာ ဖြေနိုင်သည်။
ကုန်ထုတ်လုပ်ရေးကုမ္ပဏီများတွင် နည်းပညာလက်စွဲများနှင့် ပိုက်လိုင်းပုံများ (P&ID များ) အစုအဝေးကြီးများ ရှိသည်။
လုပ်ငန်းစဉ်- တာဘိုင်ပြုပြင်နေသော ကွင်းဆင်းအင်ဂျင်နီယာတစ်ဦးသည် အစိတ်အပိုင်းတစ်ခုကို ဓာတ်ပုံရိုက်နိုင်သလို “Show me the wiring diagram for the hydraulic pump assembly.” ဟုလည်း မေးနိုင်သည်။
အပြောင်းအလဲ- ColQwen3 သည် ဝါယာကြိုးပုံ၏ မြင်ကွင်းဖော်ပြချက် ကို ခွဲခြားသိရှိပြီး မှန်ကန်သောစာမျက်နှာကို ရှာဖွေပေးသဖြင့် စက်ရပ်ချိန်ကို နာရီနှင့်ချီ လျှော့ချနိုင်သည်။
ဥပဒေဆိုင်ရာအထောက်အထားရှာဖွေမှုတွင် စကန်ဖတ်ထားသည့် စာမျက်နှာသန်းချီကို စစ်ဆေးရပြီး ရှာဖွေရန်ခက်သည့် အဓိကအချက်မှာ များသောအားဖြင့် မြင်ကွင်းအမှတ်အသားတစ်ခု ဖြစ်သည်။
လုပ်ငန်းစဉ်- စည်းမျဉ်းလိုက်နာမှုအရာရှိက “Documents signed by the CFO” သို့မဟုတ် “Contracts containing the official ‘Confidential’ stamp.” ဟု ရှာနိုင်သည်။
အပြောင်းအလဲ- OCR သီးသန့်က မကြာခဏ လွတ်သွားတတ်သော လက်မှတ် သို့မဟုတ် တံဆိပ်ပါဝင်မှုကို မော်ဒယ်က မြင်ကွင်းအရ သိရှိပြီး မူကြမ်းနှင့် အပြီးသတ်စာရွက်စာတမ်းကို ခွဲခြားနိုင်သည်။
ColQwen3 သည် open-weights (Apache 2.0) ဖြစ်ပြီး Hugging Face တွင် ယခုရရှိနိုင်သည်။ ၎င်းကို ခေတ်မီ RAG ပိုက်လိုင်းများအတွက် တိုက်ရိုက်အဆင့်မြှင့်နိုင်အောင် ဒီဇိုင်းထုတ်ထားပြီး စာသား၊ ပုံနှင့် ဗီဒီယိုများကို ချက်ချင်းလုပ်ဆောင်ရန် လိုအပ်သော inference code ကို ပံ့ပိုးထားသည်။
ရိုးရှင်းသောစာသားရှာဖွေမှုကို ကျော်လွန်ပြီး မြင်ကွင်းပိုင်ဆိုင်မှုများအတွင်း ပိတ်မိနေသော ဉာဏ်ရည်ကို ဖော်ထုတ်ရန် အသင့်ဖြစ်နေသည့် လုပ်ငန်းများအတွက် ဤအရာသည် စံသစ်ဖြစ်သည်။
နောက်တစ်ဆင့်- မော်ဒယ်ကဒ်ကို ကြည့်ရှုပြီး Hugging Face ရှိ တိုက်ရိုက်သရုပ်ပြမှုကို စမ်းသုံးပါ- /-colqwen3-embed-8b နှင့် /-colqwen3-embed-4b