စာသားကိုကျော်လွန်၍ စစ်မှန်သော ဘက်စုံမီဒီယာ အစမှအဆုံး RAG ကို ဖော်ထုတ်ခြင်း

ဘက်စုံမီဒီယာ embedding မော်ဒယ်များက ရှုပ်ထွေးသော စာရွက်စာတမ်း၊ ပုံနှင့် ဗီဒီယိုများမှ အသုံးဝင်သည့်အချက်အလက်များကို တိုက်ရိုက်ရှာဖွေပေးသည်။

လွန်ခဲ့သောနှစ်နှစ်အတွင်း “RAG” (Retrieval-Augmented Generation) သည် စာသားနှင့်သာ သက်ဆိုင်သကဲ့သို့ ဖြစ်နေခဲ့သည်။ စံလုပ်နည်းက ရိုးရှင်းသည်။ စာရွက်စာတမ်းများကိုယူ၊ စာသားထုတ်၊ အပိုင်းခွဲပြီး အညွှန်းတပ်ခြင်းဖြစ်သည်။

သို့သော် လုပ်ငန်းလောကသည် ရိုးရိုးစာသားဖိုင်များဖြင့် လည်ပတ်နေခြင်းမဟုတ်ပါ။ ၎င်းသည် ရှုပ်ထွေးသော PDF များ၊ ဇယားသိပ်သည်းသည့် ဆလိုက်များ၊ CAD ပုံများ၊ စကန်ဖတ်ထားသော ပြေစာများနှင့် တိုးပွားလာနေသည့် ဗီဒီယိုမှတ်တမ်းအစုအဝေးကြီးများဖြင့် လည်ပတ်နေသည်။

ပုံတစ်ပုံကို embedding မလုပ်မီ OCR သို့မဟုတ် Vision LLM များဖြင့် စာသား “စာတန်းထိုး” ပြောင်းသည့် လက်ရှိစက်မှုစံနည်းလမ်းသည် အကြီးမားဆုံး အဟန့်အတားဖြစ်သည်။ ၎င်းသည် နှေးကွေးပြီး ကုန်ကျစရိတ်မြင့်ကာ မူရင်းဒေတာ၏ ကြွယ်ဝသော နေရာချထားမှုနှင့် မြင်ကွင်းဆိုင်ရာအကြောင်းအရာများ မလွဲမသွေ ဆုံးရှုံးစေသည်။ သင့် AI က ရှုပ်ထွေးသောပုံတစ်ပုံကို “အသေးစိတ်ပုံကြမ်းတစ်ခု” ဟုသာ ဖော်ပြပါက ယင်းအတွင်းရှိ သီးခြားဗားလ် သို့မဟုတ် ဝါယာကြိုးပုံစံကို ရှာနိုင်စွမ်း ဆုံးရှုံးသွားပြီဖြစ်သည်။

ယနေ့တွင် ဤပြဿနာကို အစမှအဆုံး မြင်ကွင်းရှာဖွေထုတ်ယူမှု ဖြင့် ဖြေရှင်းရန် ဒီဇိုင်းထုတ်ထားပြီး ColPali ဗိသုကာပေါ် အခြေခံတည်ဆောက်ထားသော ခေတ်မီဆုံး ဘက်စုံမီဒီယာ embedding မော်ဒယ်မိသားစုကို ထုတ်ပြန်လိုက်သည်။

နောက်ကွယ်မှ အင်ဂျင်နီယာပညာ- အဆင့်မြင့် fine-tuning မဟာဗျူဟာများ

အမှန်တကယ် ထိရောက်သော ဘက်စုံမီဒီယာရှာဖွေစနစ်ကို တည်ဆောက်ခြင်းသည် အသင့်သုံး Vision-Language Model (VLM) တစ်ခုကိုယူ၍ ရှာခိုင်းရုံမျှ မလွယ်ကူပါ။ ဘက်စုံမီဒီယာ RAG ကို သမိုင်းတစ်လျှောက် အဟန့်အတားဖြစ်စေခဲ့သော စိန်ခေါ်မှုများကို ဖြေရှင်းပြီး ColQwen3 ဖန်တီးရန် မော်ဒယ်ပေါင်းစည်းမှုနှင့် လေ့ကျင့်ရေးမဟာဗျူဟာများကို အသုံးပြုခဲ့သည်။

၁။ ချိန်ညှိထားသော ပေါင်းစည်းအလေးချိန်ဖြင့် embedding စွမ်းရည် လွှဲပြောင်းခြင်း

အခြေခံမော်ဒယ်တစ်ခုကို အစမှ fine-tune လုပ်မည့်အစား ရှိပြီးသား စာသား embedding မော်ဒယ်မှ ရှာဖွေထုတ်ယူမှုဆိုင်ရာ အသိပညာကို လွှဲပြောင်းပေးသည့် နည်းလမ်းကို ဖန်တီးခဲ့သည်။ စံ VLM တစ်ခုသည် ပုံများကို ဖော်ပြတတ်သော်လည်း မေးခွန်းတစ်ခုနှင့် အဓိပ္ပာယ်အရ နှိုင်းယှဉ်၍ အစဉ်လိုက်သတ်မှတ်တတ်မည်ဟု မဆိုနိုင်ပါ။

ဤကွာဟချက်ကို ဖြည့်ဆည်းရန် ချိန်ညှိထားသော ပေါင်းစည်းအလေးချိန် မဟာဗျူဟာများကို အသုံးပြုခဲ့သည်။ စမ်းသပ်မှုများအရ Qwen3-Embedding ၏ စာသား latent space ထဲရှိ ရှာဖွေထုတ်ယူနိုင်စွမ်းကို ဘက်စုံမီဒီယာ space သို့ တိုက်ရိုက်လွှဲပြောင်းနိုင်ပြီး ချက်ချင်းလေ့ကျင့်ခြင်းမရှိဘဲပင် ပုံနှင့်ဗီဒီယို ရှာဖွေမှုသို့ ယေဘုယျအသုံးချနိုင်ကြောင်း တွေ့ရှိခဲ့သည်။ ဤထိရောက်သော ကနဦးသတ်မှတ်မှုကို ခိုင်မာသည့်အစအဖြစ် အသုံးချပြီးနောက် စွမ်းဆောင်ရည် ပိုကောင်းစေရန်နှင့် တည်ငြိမ်ခိုင်မာမှုရှိစေရန် မော်ဒယ်ကို ထပ်မံ fine-tune လုပ်ခဲ့သည်။ ၎င်းသည် Qwen3-VL အခြေခံမော်ဒယ်မှ fine-tune လုပ်ခြင်းနှင့် နှိုင်းယှဉ်ပါက နောက်ဆုံးရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည်ကို မြှင့်တင်ပေးသည်။

၂။ Hyper-parameter များကို ဂရုတစိုက် ချိန်ညှိခြင်း

Embedding စွမ်းရည်များ လွှဲပြောင်းပြီးနောက် ချိန်ညှိကိုက်ညီမှုကို အာရုံစိုက်ခဲ့သည်။ ရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည် အမြင့်ဆုံးရရန် သင့်တော်ဆုံး epoch အရေအတွက်၊ batch size၊ learning rate၊ LoRA rank နှင့် ဒေတာအစုများ ရောစပ်ပုံတို့အပါအဝင် hyper-parameter ရှာဖွေမှုနှင့် ablation လေ့လာမှုများကို ဂရုတစိုက် ပြုလုပ်ခဲ့သည်။

Fine-tuning ဒေတာအစုများအဖြစ် VDRColPali train setvisrag_syn၊ နှင့် visrag_ind တို့ကို ရွေးချယ်ခဲ့သည်။ Fine-tuning အတွက် UniMax sampling ကို အသုံးပြုခဲ့သည်။ မော်ဒယ်ပေါင်းစည်းမှုကို အသုံးပြုထားပြီး ပေါင်းစည်းထားသောအခြေခံမော်ဒယ်က ဘက်စုံမီဒီယာ ရှာဖွေစွမ်းရည်အချို့ကို ရရှိထားပြီးဖြစ်သောကြောင့် ဒေတာအစုများ ပိုတိုးခြင်းက စွမ်းဆောင်ရည်ကို အနည်းငယ်ကျဆင်းစေကြောင်း တွေ့ရှိခဲ့သည်။ ထို့ကြောင့် ဒေတာအစုများ ထပ်မတိုးခဲ့ပါ။

Fine-tuning အတွက် ရွေးချယ်ထားသော hyper-parameter များမှာ အောက်ပါအတိုင်းဖြစ်သည်။

LoRA Rank

32

LoRA Alpha

32

LoRA ပစ်မှတ် module များ

embedding မှလွဲ၍ ပုံနှင့်စာသား အလွှာအားလုံး

Learning Rate

5e-5

မြင်ကွင်းတိုကင် အများဆုံး

1280

လေ့ကျင့်ရေး Epoch များ

1

စုစုပေါင်း Batch Size

512

Warmup အချိုး

5%

၃။ “ColBERT” အကျပ်အတည်း- မြင့်မားသောစွမ်းဆောင်ရည်နှင့် သိုလှောင်မှုကုန်ကျစရိတ်

သမိုင်းတစ်လျှောက် “ColBERT ပုံစံ” တိုကင်အဆင့် embedding များကို အသုံးပြုသော မော်ဒယ်များ (ဥပမာ ColPali) သည် အလွန်ကောင်းမွန်စွာ စွမ်းဆောင်နိုင်သော်လည်း သိုလှောင်မှုကုန်ကျစရိတ်မှာ လက်မခံနိုင်အောင် မြင့်မားခဲ့သည်။ မြင်ကွင်းတိုကင်တိုင်းကို အညွှန်းတပ်ခြင်းက လုပ်ငန်းအကြီးစားအဆင့်အတွက် ကုန်ကျစရိတ်လွန်ကဲသော vector database အကြီးကြီးများ ဖြစ်ပေါ်စေခဲ့သည်။

  • ပိုမိုကောင်းမွန်အောင်လုပ်သည့် မဟာဗျူဟာ- အမြင့်ဆုံးစွမ်းဆောင်ရည်ကို ထိန်းထားပြီး သိုလှောင်မှုကုန်ကျစရိတ် မတဟုန်ထိုးမြင့်စေရန် embedding အရွယ်အစားကို ဂရုတစိုက် ဟန်ချက်ညီစေခြင်းဖြင့် သိုလှောင်မှုစိန်ခေါ်ချက်ကို ဖြေရှင်းခဲ့သည်။ ဤကျစ်လျစ်ထိရောက်သော အရွယ်အစားအတွင်း SOTA တိကျမှုကို ထိန်းသိမ်းရန် ရှာဖွေထုတ်ယူမှုစွမ်းဆောင်ရည်နှင့် သိုလှောင်မှုကုန်ကျစရိတ် အမျှတဆုံးဖြစ်စေသည့် dimension size 320 ကို ဂရုတစိုက် ရွေးချယ်ခဲ့သည်။

    • အခြေခံစနစ်- စံနည်းလမ်းတစ်ခု (ဥပမာ NVIDIA Nemo-3B) သည် ပုံ ၁ သန်းအတွက် embedding များ သိုလှောင်ရန် ခန့်မှန်းခြေ 10.3 TB လိုအပ်သည် (တိုကင် 1,802 @ dimension 3,072)။

    • ColQwen3- အလားတူ ပုံ ၁ သန်းကို 0.82 TB သာဖြင့် သိုလှောင်သည် (အများဆုံး တိုကင် 1,280 @ dimension 320)။

ColQwen3 သည် cloud အခြေခံအဆောက်အအုံဘတ်ဂျက်ကို အဆမတန် မမြင့်စေဘဲ SOTA ရှာဖွေထုတ်ယူမှုတိကျမှုကို ရရှိသည်။

အကဲဖြတ်ရလဒ်များ

ကျွန်ုပ်တို့၏နည်းလမ်းကို ViDoRe စံနှုန်းအစုဖြင့် အတည်ပြုစမ်းသပ်ခဲ့သည်။ ရလဒ်များအရ ColQwen3 သည် နောက်ဆုံးပေါ် V3 နှင့် V2 စံနှုန်းများ (အင်္ဂလိပ်နှင့် ဘာသာစုံနှစ်မျိုးလုံး) တွင် စံသစ်များ သတ်မှတ်နိုင်ခဲ့ပြီး အဟောင်း V1 လုပ်ငန်းများ၌လည်း ထိပ်တန်းစွမ်းဆောင်ရည်ကို ဆက်လက်ထိန်းထားနိုင်ကြောင်း အတည်ပြုသည်။

ViDoRe v3 (နောက်ဆုံးပေါ်)

ColQwen3-8B သည် အင်္ဂလိပ်နှင့် ဘာသာစုံ ရှာဖွေထုတ်ယူမှုတွင် ဦးဆောင်နေသည်။

အင်္ဂလိပ် nDCG@5

မော်ဒယ်

ကွန်ပျူတာသိပ္ပံ

စွမ်းအင်

ဘဏ္ဍာရေး

လူ့စွမ်းအားအရင်းအမြစ်

စက်မှု

ဆေးဝါး

ရူပဗေဒ

ပျမ်းမျှ

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

ဘာသာစုံ nDCG@5

မော်ဒယ်

ကွန်ပျူတာသိပ္ပံ

စွမ်းအင်

ဘဏ္ဍာရေး

လူ့စွမ်းအားအရင်းအမြစ်

စက်မှု

ဆေးဝါး

ရူပဗေဒ

ပျမ်းမျှ

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 နှင့် v1 မှ ထင်ရှားသည့်ရလဒ်များ

ESG၊ စီးပွားရေးပညာနှင့် DocVQA တို့တွင် တစ်သမတ်တည်း မြင့်မားသောစွမ်းဆောင်ရည်။

စံနှုန်း

မော်ဒယ်

ရမှတ် (ပျမ်းမျှ)

ထင်ရှားသောအောင်မြင်မှု

ViDoRe V2 (အင်္ဂလိပ်)

ColQwen3-8B

0.6772

ESG & BioMed တွင် နံပါတ် ၁

ViDoRe V2 (ဘာသာစုံ)

ColQwen3-8B

0.6085

စီးပွားရေးပညာတွင် နံပါတ် ၁

ViDoRe V1 (အင်္ဂလိပ်)

Nemo ColEmbed 3B

0.9100

ပျမ်းမျှ အနည်းငယ်ပိုမြင့်

ViDoRe V1 (အင်္ဂလိပ်)

ColQwen3-8B

0.9076

ArxivQA & Syn-Gov တွင် နံပါတ် ၁

ဗီဒီယိုရှာဖွေထုတ်ယူမှု- CareBench အကဲဖြတ်ချက်

ColQwen3 သည် ဗီဒီယိုရှာဖွေထုတ်ယူမှုတွင် ကောင်းစွာ ယေဘုယျအသုံးချနိုင်ကြောင်း ပြသရန် မော်ဒယ်များကို စာသားမှဗီဒီယို (အထွေထွေရှာဖွေထုတ်ယူမှု) လုပ်ငန်းများအတွက် CareBench စံနှုန်းဖြင့် အကဲဖြတ်ခဲ့သည်။

ဤအကဲဖြတ်မှုတွင် မူရင်းဗီဒီယိုကုဒ်ပြောင်းနည်းကို အသုံးပြုခဲ့သည်။ ကျွန်ုပ်တို့၏မော်ဒယ်များသည် ထပ်ဆောင်းစာသားမှတ်ချက် သို့မဟုတ် မက်တာဒေတာမပါဘဲ ဗီဒီယိုဖိုင်များကို တိုက်ရိုက်ကုဒ်ပြောင်းခဲ့သည်။ ၎င်းက မော်ဒယ်သည် မြင်ကွင်းဆိုင်ရာအဓိပ္ပာယ်ပေါ်သာ အခြေခံ၍ ရှာဖွေထုတ်ယူနိုင်ကြောင်း ထင်ရှားစေသည်။

မော်ဒယ်

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“အမှောင်ဒေတာ” ကို ဖော်ထုတ်ခြင်း- ဗီဒီယို၏ စွမ်းဆောင်ရည်အမြင့်ဆုံးနယ်ပယ်

ColQwen3 ကြောင့် ဖြစ်ပေါ်လာသော အကြီးမားဆုံးပြောင်းလဲမှုတစ်ခုမှာ ဗီဒီယိုကို စာရွက်စာတမ်းကဲ့သို့ပင် ကိုင်တွယ်နိုင်ခြင်းဖြစ်သည်။ လုပ်ငန်းများစွာတွင် ဗီဒီယိုသည် “အမှောင်ဒေတာ” ဖြစ်သည်။ လူတစ်ဦးက ဖိုင်တိုင်းကို ကိုယ်တိုင်တဂ်မတပ်ထားလျှင် ၎င်းသည် ရေရှည်သိုလှောင်မှုထဲတွင် ရှာမရဘဲ ရှိနေတတ်သည်။

ColQwen3 သည် ပိုင်းခြားထားသောကလစ်များကို ဖရိမ်အလိုက် ရှာဖွေထုတ်ယူနိုင်စေခြင်းဖြင့် ယင်းအခြေအနေကို ပြောင်းလဲပေးသည်။

အသုံးချမှုအထူးကဏ္ဍ- ကုမ္ပဏီ၏မှတ်ဉာဏ်ဘဏ်

လုပ်ငန်းများသည် နေ့စဉ် အတွင်းပိုင်းဗီဒီယိုအစည်းအဝေး နာရီပေါင်းထောင်ချီကို မှတ်တမ်းတင်ကြသော်လည်း ထိုမှတ်တမ်းများမှာ များသောအားဖြင့် အလဟဿပျောက်ကွယ်သွားသည်။

  • လုပ်ငန်းစဉ်- ရှည်လျားသောအစည်းအဝေးမှတ်တမ်းများကို အဓိပ္ပာယ်ရှိသည့် ကလစ်တိုများအဖြစ် အလိုအလျောက်ပိုင်းခြားပြီး ColQwen3 ဖြင့် အညွှန်းတပ်ခြင်းဖြင့် ရှာဖွေနိုင်သော “ကုမ္ပဏီမှတ်ဉာဏ်” တစ်ခု ဖန်တီးနိုင်သည်။

  • မေးခွန်း- ပရောဂျက်မန်နေဂျာတစ်ဦးက “Show me the clip where the engineering lead explained the latency issue with the API.” ဟု မေးနိုင်သည်။

  • ရလဒ်- စနစ်သည် မိနစ် ၆၀ ကြာ ဗီဒီယိုဖိုင်ကို ပြန်ပေးမည့်အစား သက်ဆိုင်ရာပုံကြမ်းကို မျက်နှာပြင်ပေါ်မျှဝေ၍ ဆွေးနွေးခဲ့သည့် ၄၅ စက္ကန့်စာအပိုင်းကို အတိအကျ ရှာဖွေပေးသည်။ ထိုအချိန်၌ ပြောဆိုသူများက “latency” ဟူသောစကားလုံးကို တိတိကျကျ မပြောခဲ့လျှင်ပင် ရှာနိုင်သည်။

လုပ်ငန်းသုံးအသုံးချမှုများ- တန်ဖိုးမြင့်ပြဿနာများကို ဖြေရှင်းခြင်း

မူလပုံစံ ဘက်စုံမီဒီယာ embedding သို့ ကူးပြောင်းခြင်းက ကဏ္ဍအသီးသီးတွင် လုပ်ငန်းစဉ်အသစ်များကို ဖွင့်လှစ်ပေးသည်။ ဤမော်ဒယ်ကို အရှုပ်ထွေးဆုံး လုပ်ငန်းဒေတာပတ်ဝန်းကျင်အချို့နှင့် နှိုင်းယှဉ်၍ ကျယ်ကျယ်ပြန့်ပြန့် စံနှုန်းစမ်းသပ်ထားသည်။

၁။ စံနှုန်းအထူးရလဒ်- မြို့ပြအတိုင်ပင်ခံနှင့် ဗိသုကာပညာ

မဟာစီမံကိန်းများ၊ မြေအသုံးချဇုန်မြေပုံများနှင့် ရှုပ်ထွေးသော ဗိသုကာအမြင်ပုံများကို အလွန်များပြားစွာ စီမံရသည့် မြို့ပြအတိုင်ပင်ခံကုမ္ပဏီများ ကြုံတွေ့ရသော ဒေတာစိန်ခေါ်မှုများဖြင့် ColQwen3 ကို စမ်းသပ်ခဲ့သည်။

  • စိန်ခေါ်မှု- ဤပတ်ဝန်းကျင်များတွင် သမားရိုးကျ RAG ပိုက်လိုင်းများ အခက်တွေ့တတ်သည်။ OCR ကိရိယာများသည် ရှုပ်ထွေးသော နေရာစီမံကိန်းများကို “ပုံကြမ်း” ဟုသာ ဖော်ပြလေ့ရှိသဖြင့် ယာဉ်အသွားအလာ၊ စိမ်းလန်းဇုန် သို့မဟုတ် အဆောက်အအုံနောက်ဆုတ်အကွာအဝေးကဲ့သို့ အရေးကြီးအသေးစိတ်များ လွတ်သွားသည်။

  • စွမ်းဆောင်ရည်- ကျွန်ုပ်တို့၏အတွင်းပိုင်း စံနှုန်းစမ်းသပ်မှုများအရ ColQwen3 သည် ကုန်ကျစရိတ်မြင့် OCR/စာတန်းထိုး ကြိုတင်လုပ်ဆောင်မှုကို ထိရောက်စွာ ကျော်လွှားနိုင်သည်။ အချက်အလက်သိပ်သည်းသည့် ဗိသုကာပုံများဖြင့် စမ်းသပ်ရာတွင် မော်ဒယ်သည် လမ်းလျှောက်ဝင်ပေါက်များ သို့မဟုတ် ထင်ရှားသောဇုန်နယ်နိမိတ်များကဲ့သို့ တိကျသည့် မြင်ကွင်းအမှတ်အသားများအပေါ် အခြေခံ၍ စာရွက်စာတမ်းများကို အောင်မြင်စွာ ရှာဖွေခဲ့သည်။ စာသားသီးသန့် အခြေခံစနစ်များထက် သိသိသာသာ ပိုကောင်းပြီး အသိပညာထည့်သွင်းမှုကုန်ကျစရိတ်ကိုလည်း အကြီးအကျယ် လျှော့ချနိုင်မည်ဖြစ်သည်။

၂။ ရှုပ်ထွေးသော ဘဏ္ဍာရေးနှင့် ဈေးကွက်ထောက်လှမ်းရေး

ရင်းနှီးမြှုပ်နှံမှုဘဏ်လုပ်ငန်းရှင်များနှင့် လေ့လာဆန်းစစ်သူများသည် နှစ်ပတ်လည်အစီရင်ခံစာများနှင့် ရင်းနှီးမြှုပ်နှံသူဆလိုက်များကို ရှာဖွေစစ်ဆေးရာတွင် နာရီပေါင်းထောင်ချီ သုံးစွဲကြသည်။

  • လုပ်ငန်းစဉ်- လေ့လာဆန်းစစ်သူက “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.” ဟု မေးနိုင်သည်။

  • အပြောင်းအလဲ- သော့ချက်စာလုံးကိုက်ညီမှုကို အားကိုးမည့်အစား မော်ဒယ်က သီးခြားဒေတာမြင်ကွင်းပုံစံ ပါဝင်မှုအပေါ် အခြေခံ၍ သက်ဆိုင်ရာဆလိုက်ကို အတိအကျ ရှာဖွေပေးသဖြင့် RAG စနစ်က မေးခွန်းများကို တိကျစွာ ဖြေနိုင်သည်။

၃။ စက်မှုကုန်ထုတ်လုပ်ရေးနှင့် ကွင်းဆင်းဝန်ဆောင်မှု

ကုန်ထုတ်လုပ်ရေးကုမ္ပဏီများတွင် နည်းပညာလက်စွဲများနှင့် ပိုက်လိုင်းပုံများ (P&ID များ) အစုအဝေးကြီးများ ရှိသည်။

  • လုပ်ငန်းစဉ်- တာဘိုင်ပြုပြင်နေသော ကွင်းဆင်းအင်ဂျင်နီယာတစ်ဦးသည် အစိတ်အပိုင်းတစ်ခုကို ဓာတ်ပုံရိုက်နိုင်သလို “Show me the wiring diagram for the hydraulic pump assembly.” ဟုလည်း မေးနိုင်သည်။

  • အပြောင်းအလဲ- ColQwen3 သည် ဝါယာကြိုးပုံ၏ မြင်ကွင်းဖော်ပြချက် ကို ခွဲခြားသိရှိပြီး မှန်ကန်သောစာမျက်နှာကို ရှာဖွေပေးသဖြင့် စက်ရပ်ချိန်ကို နာရီနှင့်ချီ လျှော့ချနိုင်သည်။

၄။ ဥပဒေနှင့် စည်းမျဉ်းလိုက်နာမှု

ဥပဒေဆိုင်ရာအထောက်အထားရှာဖွေမှုတွင် စကန်ဖတ်ထားသည့် စာမျက်နှာသန်းချီကို စစ်ဆေးရပြီး ရှာဖွေရန်ခက်သည့် အဓိကအချက်မှာ များသောအားဖြင့် မြင်ကွင်းအမှတ်အသားတစ်ခု ဖြစ်သည်။

  • လုပ်ငန်းစဉ်- စည်းမျဉ်းလိုက်နာမှုအရာရှိက “Documents signed by the CFO” သို့မဟုတ် “Contracts containing the official ‘Confidential’ stamp.” ဟု ရှာနိုင်သည်။

  • အပြောင်းအလဲ- OCR သီးသန့်က မကြာခဏ လွတ်သွားတတ်သော လက်မှတ် သို့မဟုတ် တံဆိပ်ပါဝင်မှုကို မော်ဒယ်က မြင်ကွင်းအရ သိရှိပြီး မူကြမ်းနှင့် အပြီးသတ်စာရွက်စာတမ်းကို ခွဲခြားနိုင်သည်။

စတင်အသုံးပြုခြင်း

ColQwen3 သည် open-weights (Apache 2.0) ဖြစ်ပြီး Hugging Face တွင် ယခုရရှိနိုင်သည်။ ၎င်းကို ခေတ်မီ RAG ပိုက်လိုင်းများအတွက် တိုက်ရိုက်အဆင့်မြှင့်နိုင်အောင် ဒီဇိုင်းထုတ်ထားပြီး စာသား၊ ပုံနှင့် ဗီဒီယိုများကို ချက်ချင်းလုပ်ဆောင်ရန် လိုအပ်သော inference code ကို ပံ့ပိုးထားသည်။

ရိုးရှင်းသောစာသားရှာဖွေမှုကို ကျော်လွန်ပြီး မြင်ကွင်းပိုင်ဆိုင်မှုများအတွင်း ပိတ်မိနေသော ဉာဏ်ရည်ကို ဖော်ထုတ်ရန် အသင့်ဖြစ်နေသည့် လုပ်ငန်းများအတွက် ဤအရာသည် စံသစ်ဖြစ်သည်။

နောက်တစ်ဆင့်- မော်ဒယ်ကဒ်ကို ကြည့်ရှုပြီး Hugging Face ရှိ တိုက်ရိုက်သရုပ်ပြမှုကို စမ်းသုံးပါ- /-colqwen3-embed-8b နှင့် /-colqwen3-embed-4b

စာရေးသူ

Xin Huangနှင့် Kye Min Tan