စာသားကိုကျော်လွန်၍ စစ်မှန်သော ဘက်စုံမီဒီယာ အစမှအဆုံး RAG ကို ဖော်ထုတ်ခြင်း

ဘက်စုံမီဒီယာ embedding မော်ဒယ်များက ရှုပ်ထွေးသော စာရွက်စာတမ်း၊ ပုံနှင့် ဗီဒီယိုများမှ အသုံးဝင်သည့်အချက်အလက်များကို တိုက်ရိုက်ရှာဖွေပေးသည်။

လွန်ခဲ့သောနှစ်နှစ်အတွင်း “RAG” (Retrieval-Augmented Generation) သည် စာသားနှင့်သာ သက်ဆိုင်သကဲ့သို့ ဖြစ်နေခဲ့သည်။ စံလုပ်နည်းက ရိုးရှင်းသည်။ စာရွက်စာတမ်းများကိုယူ၊ စာသားထုတ်၊ အပိုင်းခွဲပြီး အညွှန်းတပ်ခြင်းဖြစ်သည်။

သို့သော် လုပ်ငန်းလောကသည် ရိုးရိုးစာသားဖိုင်များဖြင့် လည်ပတ်နေခြင်းမဟုတ်ပါ။ ၎င်းသည် ရှုပ်ထွေးသော PDF များ၊ ဇယားသိပ်သည်းသည့် ဆလိုက်များ၊ CAD ပုံများ၊ စကန်ဖတ်ထားသော ပြေစာများနှင့် တိုးပွားလာနေသည့် ဗီဒီယိုမှတ်တမ်းအစုအဝေးကြီးများဖြင့် လည်ပတ်နေသည်။

ပုံတစ်ပုံကို embedding မလုပ်မီ OCR သို့မဟုတ် Vision LLM များဖြင့် စာသား “စာတန်းထိုး” ပြောင်းသည့် လက်ရှိစက်မှုစံနည်းလမ်းသည် အကြီးမားဆုံး အဟန့်အတားဖြစ်သည်။ ၎င်းသည် နှေးကွေးပြီး ကုန်ကျစရိတ်မြင့်ကာ မူရင်းဒေတာ၏ ကြွယ်ဝသော နေရာချထားမှုနှင့် မြင်ကွင်းဆိုင်ရာအကြောင်းအရာများ မလွဲမသွေ ဆုံးရှုံးစေသည်။ သင့် AI က ရှုပ်ထွေးသောပုံတစ်ပုံကို “အသေးစိတ်ပုံကြမ်းတစ်ခု” ဟုသာ ဖော်ပြပါက ယင်းအတွင်းရှိ သီးခြားဗားလ် သို့မဟုတ် ဝါယာကြိုးပုံစံကို ရှာနိုင်စွမ်း ဆုံးရှုံးသွားပြီဖြစ်သည်။

ယနေ့တွင် ဤပြဿနာကို အစမှအဆုံး မြင်ကွင်းရှာဖွေထုတ်ယူမှု ဖြင့် ဖြေရှင်းရန် ဒီဇိုင်းထုတ်ထားပြီး ColPali ဗိသုကာပေါ် အခြေခံတည်ဆောက်ထားသော ခေတ်မီဆုံး ဘက်စုံမီဒီယာ embedding မော်ဒယ်မိသားစုကို ထုတ်ပြန်လိုက်သည်။

နောက်ကွယ်မှ အင်ဂျင်နီယာပညာ- အဆင့်မြင့် fine-tuning မဟာဗျူဟာများ

အမှန်တကယ် ထိရောက်သော ဘက်စုံမီဒီယာရှာဖွေစနစ်ကို တည်ဆောက်ခြင်းသည် အသင့်သုံး Vision-Language Model (VLM) တစ်ခုကိုယူ၍ ရှာခိုင်းရုံမျှ မလွယ်ကူပါ။ ဘက်စုံမီဒီယာ RAG ကို သမိုင်းတစ်လျှောက် အဟန့်အတားဖြစ်စေခဲ့သော စိန်ခေါ်မှုများကို ဖြေရှင်းပြီး ColQwen3 ဖန်တီးရန် မော်ဒယ်ပေါင်းစည်းမှုနှင့် လေ့ကျင့်ရေးမဟာဗျူဟာများကို အသုံးပြုခဲ့သည်။

၁။ ချိန်ညှိထားသော ပေါင်းစည်းအလေးချိန်ဖြင့် embedding စွမ်းရည် လွှဲပြောင်းခြင်း

အခြေခံမော်ဒယ်တစ်ခုကို အစမှ fine-tune လုပ်မည့်အစား ရှိပြီးသား စာသား embedding မော်ဒယ်မှ ရှာဖွေထုတ်ယူမှုဆိုင်ရာ အသိပညာကို လွှဲပြောင်းပေးသည့် နည်းလမ်းကို ဖန်တီးခဲ့သည်။ စံ VLM တစ်ခုသည် ပုံများကို ဖော်ပြတတ်သော်လည်း မေးခွန်းတစ်ခုနှင့် အဓိပ္ပာယ်အရ နှိုင်းယှဉ်၍ အစဉ်လိုက်သတ်မှတ်တတ်မည်ဟု မဆိုနိုင်ပါ။

ဤကွာဟချက်ကို ဖြည့်ဆည်းရန် ချိန်ညှိထားသော ပေါင်းစည်းအလေးချိန် မဟာဗျူဟာများကို အသုံးပြုခဲ့သည်။ စမ်းသပ်မှုများအရ Qwen3-Embedding ၏ စာသား latent space ထဲရှိ ရှာဖွေထုတ်ယူနိုင်စွမ်းကို ဘက်စုံမီဒီယာ space သို့ တိုက်ရိုက်လွှဲပြောင်းနိုင်ပြီး ချက်ချင်းလေ့ကျင့်ခြင်းမရှိဘဲပင် ပုံနှင့်ဗီဒီယို ရှာဖွေမှုသို့ ယေဘုယျအသုံးချနိုင်ကြောင်း တွေ့ရှိခဲ့သည်။ ဤထိရောက်သော ကနဦးသတ်မှတ်မှုကို ခိုင်မာသည့်အစအဖြစ် အသုံးချပြီးနောက် စွမ်းဆောင်ရည် ပိုကောင်းစေရန်နှင့် တည်ငြိမ်ခိုင်မာမှုရှိစေရန် မော်ဒယ်ကို ထပ်မံ fine-tune လုပ်ခဲ့သည်။ ၎င်းသည် Qwen3-VL အခြေခံမော်ဒယ်မှ fine-tune လုပ်ခြင်းနှင့် နှိုင်းယှဉ်ပါက နောက်ဆုံးရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည်ကို မြှင့်တင်ပေးသည်။

၂။ Hyper-parameter များကို ဂရုတစိုက် ချိန်ညှိခြင်း

Embedding စွမ်းရည်များ လွှဲပြောင်းပြီးနောက် ချိန်ညှိကိုက်ညီမှုကို အာရုံစိုက်ခဲ့သည်။ ရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည် အမြင့်ဆုံးရရန် သင့်တော်ဆုံး epoch အရေအတွက်၊ batch size၊ learning rate၊ LoRA rank နှင့် ဒေတာအစုများ ရောစပ်ပုံတို့အပါအဝင် hyper-parameter ရှာဖွေမှုနှင့် ablation လေ့လာမှုများကို ဂရုတစိုက် ပြုလုပ်ခဲ့သည်။

Fine-tuning ဒေတာအစုများအဖြစ် VDR၊ ColPali train set၊ visrag_syn၊ နှင့် visrag_ind တို့ကို ရွေးချယ်ခဲ့သည်။ Fine-tuning အတွက် UniMax sampling ကို အသုံးပြုခဲ့သည်။ မော်ဒယ်ပေါင်းစည်းမှုကို အသုံးပြုထားပြီး ပေါင်းစည်းထားသောအခြေခံမော်ဒယ်က ဘက်စုံမီဒီယာ ရှာဖွေစွမ်းရည်အချို့ကို ရရှိထားပြီးဖြစ်သောကြောင့် ဒေတာအစုများ ပိုတိုးခြင်းက စွမ်းဆောင်ရည်ကို အနည်းငယ်ကျဆင်းစေကြောင်း တွေ့ရှိခဲ့သည်။ ထို့ကြောင့် ဒေတာအစုများ ထပ်မတိုးခဲ့ပါ။

Fine-tuning အတွက် ရွေးချယ်ထားသော hyper-parameter များမှာ အောက်ပါအတိုင်းဖြစ်သည်။

LoRA Rank

32

LoRA Alpha

32

LoRA ပစ်မှတ် module များ

embedding မှလွဲ၍ ပုံနှင့်စာသား အလွှာအားလုံး

Learning Rate

5e-5

မြင်ကွင်းတိုကင် အများဆုံး

1280

လေ့ကျင့်ရေး Epoch များ

1

စုစုပေါင်း Batch Size

512

Warmup အချိုး

5%

၃။ “ColBERT” အကျပ်အတည်း- မြင့်မားသောစွမ်းဆောင်ရည်နှင့် သိုလှောင်မှုကုန်ကျစရိတ်

သမိုင်းတစ်လျှောက် “ColBERT ပုံစံ” တိုကင်အဆင့် embedding များကို အသုံးပြုသော မော်ဒယ်များ (ဥပမာ ColPali) သည် အလွန်ကောင်းမွန်စွာ စွမ်းဆောင်နိုင်သော်လည်း သိုလှောင်မှုကုန်ကျစရိတ်မှာ လက်မခံနိုင်အောင် မြင့်မားခဲ့သည်။ မြင်ကွင်းတိုကင်တိုင်းကို အညွှန်းတပ်ခြင်းက လုပ်ငန်းအကြီးစားအဆင့်အတွက် ကုန်ကျစရိတ်လွန်ကဲသော vector database အကြီးကြီးများ ဖြစ်ပေါ်စေခဲ့သည်။

  • ပိုမိုကောင်းမွန်အောင်လုပ်သည့် မဟာဗျူဟာ- အမြင့်ဆုံးစွမ်းဆောင်ရည်ကို ထိန်းထားပြီး သိုလှောင်မှုကုန်ကျစရိတ် မတဟုန်ထိုးမြင့်စေရန် embedding အရွယ်အစားကို ဂရုတစိုက် ဟန်ချက်ညီစေခြင်းဖြင့် သိုလှောင်မှုစိန်ခေါ်ချက်ကို ဖြေရှင်းခဲ့သည်။ ဤကျစ်လျစ်ထိရောက်သော အရွယ်အစားအတွင်း SOTA တိကျမှုကို ထိန်းသိမ်းရန် ရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည်နှင့် သိုလှောင်မှုကုန်ကျစရိတ် အမျှတဆုံးဖြစ်စေသည့် dimension size 320 ကို ဂရုတစိုက် ရွေးချယ်ခဲ့သည်။

    • အခြေခံစနစ်- စံနည်းလမ်းတစ်ခု (ဥပမာ NVIDIA Nemo-3B) သည် ပုံ ၁ သန်းအတွက် embedding များ သိုလှောင်ရန် ခန့်မှန်းခြေ 10.3 TB လိုအပ်သည် (တိုကင် 1,802 @ dimension 3,072)။

    • ColQwen3- အလားတူ ပုံ ၁ သန်းကို 0.82 TB သာဖြင့် သိုလှောင်သည် (အများဆုံး တိုကင် 1,280 @ dimension 320)။

ColQwen3 သည် cloud အခြေခံအဆောက်အအုံဘတ်ဂျက်ကို အဆမတန် မမြင့်စေဘဲ SOTA ရှာဖွေထုတ်ယူမှုတိကျမှုကို ရရှိသည်။

အကဲဖြတ်ရလဒ်များ

ကျွန်ုပ်တို့၏နည်းလမ်းကို ViDoRe စံနှုန်းအစုဖြင့် အတည်ပြုစမ်းသပ်ခဲ့သည်။ ရလဒ်များအရ ColQwen3 သည် နောက်ဆုံးပေါ် V3 နှင့် V2 စံနှုန်းများ (အင်္ဂလိပ်နှင့် ဘာသာစုံနှစ်မျိုးလုံး) တွင် စံသစ်များ သတ်မှတ်နိုင်ခဲ့ပြီး အဟောင်း V1 လုပ်ငန်းများ၌လည်း ထိပ်တန်းစွမ်းဆောင်ရည်ကို ဆက်လက်ထိန်းထားနိုင်ကြောင်း အတည်ပြုသည်။

ViDoRe v3 (နောက်ဆုံးပေါ်)

ColQwen3-8B သည် အင်္ဂလိပ်နှင့် ဘာသာစုံ ရှာဖွေထုတ်ယူမှုတွင် ဦးဆောင်နေသည်။

အင်္ဂလိပ် nDCG@5

မော်ဒယ်

ကွန်ပျူတာသိပ္ပံ

စွမ်းအင်

ဘဏ္ဍာရေး

လူ့စွမ်းအားအရင်းအမြစ်

စက်မှု

ဆေးဝါး

ရူပဗေဒ

ပျမ်းမျှ

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

ဘာသာစုံ nDCG@5

မော်ဒယ်

ကွန်ပျူတာသိပ္ပံ

စွမ်းအင်

ဘဏ္ဍာရေး

လူ့စွမ်းအားအရင်းအမြစ်

စက်မှု

ဆေးဝါး

ရူပဗေဒ

ပျမ်းမျှ

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 နှင့် v1 မှ ထင်ရှားသည့်ရလဒ်များ

ESG၊ စီးပွားရေးပညာနှင့် DocVQA တို့တွင် တစ်သမတ်တည်း မြင့်မားသောစွမ်းဆောင်ရည်။

စံနှုန်း

မော်ဒယ်

ရမှတ် (ပျမ်းမျှ)

ထင်ရှားသောအောင်မြင်မှု

ViDoRe V2 (အင်္ဂလိပ်)

ColQwen3-8B

0.6772

ESG & BioMed တွင် နံပါတ် ၁

ViDoRe V2 (ဘာသာစုံ)

ColQwen3-8B

0.6085

စီးပွားရေးပညာတွင် နံပါတ် ၁

ViDoRe V1 (အင်္ဂလိပ်)

Nemo ColEmbed 3B

0.9100

ပျမ်းမျှ အနည်းငယ်ပိုမြင့်

ViDoRe V1 (အင်္ဂလိပ်)

ColQwen3-8B

0.9076

ArxivQA & Syn-Gov တွင် နံပါတ် ၁

ဗီဒီယိုရှာဖွေထုတ်ယူမှု- CareBench အကဲဖြတ်ချက်

ColQwen3 သည် ဗီဒီယိုရှာဖွေထုတ်ယူမှုတွင် ကောင်းစွာ ယေဘုယျအသုံးချနိုင်ကြောင်း ပြသရန် မော်ဒယ်များကို စာသားမှဗီဒီယို (အထွေထွေရှာဖွေထုတ်ယူမှု) လုပ်ငန်းများအတွက် CareBench စံနှုန်းဖြင့် အကဲဖြတ်ခဲ့သည်။

ဤအကဲဖြတ်မှုတွင် မူရင်းဗီဒီယိုကုဒ်ပြောင်းနည်းကို အသုံးပြုခဲ့သည်။ ကျွန်ုပ်တို့၏မော်ဒယ်များသည် ထပ်ဆောင်းစာသားမှတ်ချက် သို့မဟုတ် မက်တာဒေတာမပါဘဲ ဗီဒီယိုဖိုင်များကို တိုက်ရိုက်ကုဒ်ပြောင်းခဲ့သည်။ ၎င်းက မော်ဒယ်သည် မြင်ကွင်းဆိုင်ရာအဓိပ္ပာယ်ပေါ်သာ အခြေခံ၍ ရှာဖွေထုတ်ယူနိုင်ကြောင်း ထင်ရှားစေသည်။

မော်ဒယ်

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“အမှောင်ဒေတာ” ကို ဖော်ထုတ်ခြင်း- ဗီဒီယို၏ စွမ်းဆောင်ရည်အမြင့်ဆုံးနယ်ပယ်

ColQwen3 ကြောင့် ဖြစ်ပေါ်လာသော အကြီးမားဆုံးပြောင်းလဲမှုတစ်ခုမှာ ဗီဒီယိုကို စာရွက်စာတမ်းကဲ့သို့ပင် ကိုင်တွယ်နိုင်ခြင်းဖြစ်သည်။ လုပ်ငန်းများစွာတွင် ဗီဒီယိုသည် “အမှောင်ဒေတာ” ဖြစ်သည်။ လူတစ်ဦးက ဖိုင်တိုင်းကို ကိုယ်တိုင်တဂ်မတပ်ထားလျှင် ၎င်းသည် ရေရှည်သိုလှောင်မှုထဲတွင် ရှာမရဘဲ ရှိနေတတ်သည်။

ColQwen3 သည် ပိုင်းခြားထားသောကလစ်များကို ဖရိမ်အလိုက် ရှာဖွေထုတ်ယူနိုင်စေခြင်းဖြင့် ယင်းအခြေအနေကို ပြောင်းလဲပေးသည်။

အသုံးချမှုအထူးကဏ္ဍ- ကုမ္ပဏီ၏မှတ်ဉာဏ်ဘဏ်

လုပ်ငန်းများသည် နေ့စဉ် အတွင်းပိုင်းဗီဒီယိုအစည်းအဝေး နာရီပေါင်းထောင်ချီကို မှတ်တမ်းတင်ကြသော်လည်း ထိုမှတ်တမ်းများမှာ များသောအားဖြင့် အလဟဿပျောက်ကွယ်သွားသည်။

  • လုပ်ငန်းစဉ်- ရှည်လျားသောအစည်းအဝေးမှတ်တမ်းများကို အဓိပ္ပာယ်ရှိသည့် ကလစ်တိုများအဖြစ် အလိုအလျောက်ပိုင်းခြားပြီး ColQwen3 ဖြင့် အညွှန်းတပ်ခြင်းဖြင့် ရှာဖွေနိုင်သော “ကုမ္ပဏီမှတ်ဉာဏ်” တစ်ခု ဖန်တီးနိုင်သည်။

  • မေးခွန်း- ပရောဂျက်မန်နေဂျာတစ်ဦးက “Show me the clip where the engineering lead explained the latency issue with the API.” ဟု မေးနိုင်သည်။

  • ရလဒ်- စနစ်သည် မိနစ် ၆၀ ကြာ ဗီဒီယိုဖိုင်ကို ပြန်ပေးမည့်အစား သက်ဆိုင်ရာပုံကြမ်းကို မျက်နှာပြင်ပေါ်မျှဝေ၍ ဆွေးနွေးခဲ့သည့် ၄၅ စက္ကန့်စာအပိုင်းကို အတိအကျ ရှာဖွေပေးသည်။ ထိုအချိန်၌ ပြောဆိုသူများက “latency” ဟူသောစကားလုံးကို တိတိကျကျ မပြောခဲ့လျှင်ပင် ရှာနိုင်သည်။

လုပ်ငန်းသုံးအသုံးချမှုများ- တန်ဖိုးမြင့်ပြဿနာများကို ဖြေရှင်းခြင်း

မူလပုံစံ ဘက်စုံမီဒီယာ embedding သို့ ကူးပြောင်းခြင်းက ကဏ္ဍအသီးသီးတွင် လုပ်ငန်းစဉ်အသစ်များကို ဖွင့်လှစ်ပေးသည်။ ဤမော်ဒယ်ကို အရှုပ်ထွေးဆုံး လုပ်ငန်းဒေတာပတ်ဝန်းကျင်အချို့နှင့် နှိုင်းယှဉ်၍ ကျယ်ကျယ်ပြန့်ပြန့် စံနှုန်းစမ်းသပ်ထားသည်။

၁။ စံနှုန်းအထူးရလဒ်- မြို့ပြအတိုင်ပင်ခံနှင့် ဗိသုကာပညာ

မဟာစီမံကိန်းများ၊ မြေအသုံးချဇုန်မြေပုံများနှင့် ရှုပ်ထွေးသော ဗိသုကာအမြင်ပုံများကို အလွန်များပြားစွာ စီမံရသည့် မြို့ပြအတိုင်ပင်ခံကုမ္ပဏီများ ကြုံတွေ့ရသော ဒေတာစိန်ခေါ်မှုများဖြင့် ColQwen3 ကို စမ်းသပ်ခဲ့သည်။

  • စိန်ခေါ်မှု- ဤပတ်ဝန်းကျင်များတွင် သမားရိုးကျ RAG ပိုက်လိုင်းများ အခက်တွေ့တတ်သည်။ OCR ကိရိယာများသည် ရှုပ်ထွေးသော နေရာစီမံကိန်းများကို “ပုံကြမ်း” ဟုသာ ဖော်ပြလေ့ရှိသဖြင့် ယာဉ်အသွားအလာ၊ စိမ်းလန်းဇုန် သို့မဟုတ် အဆောက်အအုံနောက်ဆုတ်အကွာအဝေးကဲ့သို့ အရေးကြီးအသေးစိတ်များ လွတ်သွားသည်။

  • စွမ်းဆောင်ရည်- ကျွန်ုပ်တို့၏အတွင်းပိုင်း စံနှုန်းစမ်းသပ်မှုများအရ ColQwen3 သည် ကုန်ကျစရိတ်မြင့် OCR/စာတန်းထိုး ကြိုတင်လုပ်ဆောင်မှုကို ထိရောက်စွာ ကျော်လွှားနိုင်သည်။ အချက်အလက်သိပ်သည်းသည့် ဗိသုကာပုံများဖြင့် စမ်းသပ်ရာတွင် မော်ဒယ်သည် လမ်းလျှောက်ဝင်ပေါက်များ သို့မဟုတ် ထင်ရှားသောဇုန်နယ်နိမိတ်များကဲ့သို့ တိကျသည့် မြင်ကွင်းအမှတ်အသားများအပေါ် အခြေခံ၍ စာရွက်စာတမ်းများကို အောင်မြင်စွာ ရှာဖွေခဲ့သည်။ စာသားသီးသန့် အခြေခံစနစ်များထက် သိသိသာသာ ပိုကောင်းပြီး အသိပညာထည့်သွင်းမှုကုန်ကျစရိတ်ကိုလည်း အကြီးအကျယ် လျှော့ချနိုင်မည်ဖြစ်သည်။

၂။ ရှုပ်ထွေးသော ဘဏ္ဍာရေးနှင့် ဈေးကွက်ထောက်လှမ်းရေး

ရင်းနှီးမြှုပ်နှံမှုဘဏ်လုပ်ငန်းရှင်များနှင့် လေ့လာဆန်းစစ်သူများသည် နှစ်ပတ်လည်အစီရင်ခံစာများနှင့် ရင်းနှီးမြှုပ်နှံသူဆလိုက်များကို ရှာဖွေစစ်ဆေးရာတွင် နာရီပေါင်းထောင်ချီ သုံးစွဲကြသည်။

  • လုပ်ငန်းစဉ်- လေ့လာဆန်းစစ်သူက “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.” ဟု မေးနိုင်သည်။

  • အပြောင်းအလဲ- သော့ချက်စာလုံးကိုက်ညီမှုကို အားကိုးမည့်အစား မော်ဒယ်က သီးခြားဒေတာမြင်ကွင်းပုံစံ ပါဝင်မှုအပေါ် အခြေခံ၍ သက်ဆိုင်ရာဆလိုက်ကို အတိအကျ ရှာဖွေပေးသဖြင့် RAG စနစ်က မေးခွန်းများကို တိကျစွာ ဖြေနိုင်သည်။

၃။ စက်မှုကုန်ထုတ်လုပ်ရေးနှင့် ကွင်းဆင်းဝန်ဆောင်မှု

ကုန်ထုတ်လုပ်ရေးကုမ္ပဏီများတွင် နည်းပညာလက်စွဲများနှင့် ပိုက်လိုင်းပုံများ (P&ID များ) အစုအဝေးကြီးများ ရှိသည်။

  • လုပ်ငန်းစဉ်- တာဘိုင်ပြုပြင်နေသော ကွင်းဆင်းအင်ဂျင်နီယာတစ်ဦးသည် အစိတ်အပိုင်းတစ်ခုကို ဓာတ်ပုံရိုက်နိုင်သလို “Show me the wiring diagram for the hydraulic pump assembly.” ဟုလည်း မေးနိုင်သည်။

  • အပြောင်းအလဲ- ColQwen3 သည် ဝါယာကြိုးပုံ၏ မြင်ကွင်းဖော်ပြချက် ကို ခွဲခြားသိရှိပြီး မှန်ကန်သောစာမျက်နှာကို ရှာဖွေပေးသဖြင့် စက်ရပ်ချိန်ကို နာရီနှင့်ချီ လျှော့ချနိုင်သည်။

၄။ ဥပဒေနှင့် စည်းမျဉ်းလိုက်နာမှု

ဥပဒေဆိုင်ရာအထောက်အထားရှာဖွေမှုတွင် စကန်ဖတ်ထားသည့် စာမျက်နှာသန်းချီကို စစ်ဆေးရပြီး ရှာဖွေရန်ခက်သည့် အဓိကအချက်မှာ များသောအားဖြင့် မြင်ကွင်းအမှတ်အသားတစ်ခု ဖြစ်သည်။

  • လုပ်ငန်းစဉ်- စည်းမျဉ်းလိုက်နာမှုအရာရှိက “Documents signed by the CFO” သို့မဟုတ် “Contracts containing the official ‘Confidential’ stamp.” ဟု ရှာနိုင်သည်။

  • အပြောင်းအလဲ- OCR သီးသန့်က မကြာခဏ လွတ်သွားတတ်သော လက်မှတ် သို့မဟုတ် တံဆိပ်ပါဝင်မှုကို မော်ဒယ်က မြင်ကွင်းအရ သိရှိပြီး မူကြမ်းနှင့် အပြီးသတ်စာရွက်စာတမ်းကို ခွဲခြားနိုင်သည်။

စတင်အသုံးပြုခြင်း

ColQwen3 သည် open-weights (Apache 2.0) ဖြစ်ပြီး Hugging Face တွင် ယခုရရှိနိုင်သည်။ ၎င်းကို ခေတ်မီ RAG ပိုက်လိုင်းများအတွက် တိုက်ရိုက်အဆင့်မြှင့်နိုင်အောင် ဒီဇိုင်းထုတ်ထားပြီး စာသား၊ ပုံနှင့် ဗီဒီယိုများကို ချက်ချင်းလုပ်ဆောင်ရန် လိုအပ်သော inference code ကို ပံ့ပိုးထားသည်။

ရိုးရှင်းသောစာသားရှာဖွေမှုကို ကျော်လွန်ပြီး မြင်ကွင်းပိုင်ဆိုင်မှုများအတွင်း ပိတ်မိနေသော ဉာဏ်ရည်ကို ဖော်ထုတ်ရန် အသင့်ဖြစ်နေသည့် လုပ်ငန်းများအတွက် ဤအရာသည် စံသစ်ဖြစ်သည်။

နောက်တစ်ဆင့်- မော်ဒယ်ကဒ်ကို ကြည့်ရှုပြီး Hugging Face ရှိ တိုက်ရိုက်သရုပ်ပြမှုကို စမ်းသုံးပါ- /-colqwen3-embed-8b နှင့် /-colqwen3-embed-4b

စာရေးသူများ

Xin Huangနှင့် Kye Min Tan