ከጽሑፍ ባሻገር፦ እውነተኛ ባለብዙ ሞዳሊቲ፣ ከጫፍ እስከ ጫፍ RAGን ማስቻል

ባለብዙ ሞዳሊቲ የመክተቻ ሞዴሎች ቡድኖች ከውስብስብ ሰነዶች፣ ምስሎችና ቪዲዮዎች ጠቃሚ መረጃን በቀጥታ እንዲያገኙ ያግዛሉ።

ባለፉት ሁለት ዓመታት «RAG» (በመልሶ ማግኘት የተጠናከረ ማመንጨት) ከጽሑፍ ጋር ብቻ የሚያያዝ ጽንሰ ሐሳብ ሆኖ ቆይቷል። መደበኛው አሠራር ቀላል ነው፦ ሰነዶችን ይውሰዱ፣ ጽሑፉን ያውጡ፣ ከፋፍለው ኢንዴክስ ያድርጉት።

የድርጅት ዓለም ግን በተራ የጽሑፍ ፋይሎች አይሠራም። የሚሠራው በውስብስብ PDFዎች፣ ጥቅጥቅ ያሉ ገበታዎችን በያዙ ስላይዶች፣ የCAD ሥዕሎች፣ የተቃኙ ደረሰኞችና እየጨመሩ ባሉ ግዙፍ የቪዲዮ ቅጂዎች ማከማቻ ነው።

ይህን ለማስተናገድ ምስልን ከመክተት በፊት OCR ወይም Vision LLMs ተጠቅሞ ወደ ጽሑፍ «መግለጫ» የመቀየር የኢንዱስትሪው መደበኛ አሠራር ግዙፍ ማነቆ ነው። ዘገምተኛና ውድ ከመሆኑም በላይ፣ የመጀመሪያውን ውሂብ የበለጸገ የቦታና የምስል ዐውድ ማጣቱ አይቀርም። የእርስዎ AI ውስብስብ ምስልን «ንድፍ» ብሎ ብቻ ከገለጸው፣ በውስጡ ያለውን የተወሰነ ቫልቭ ወይም የሽቦ ንድፍ የመፈለግ ችሎታ አጥተዋል።

ዛሬ፣ ከጫፍ እስከ ጫፍ ምስላዊ መልሶ ማግኘትን በማስቻል ይህን ችግር ለመፍታት በColPali አርክቴክቸር ላይ የተገነቡ እጅግ ዘመናዊ ባለብዙ ሞዳሊቲ የመክተቻ ሞዴሎችን ቤተሰብ ይፋ እያደረግን ነው።

ከአስደናቂው ውጤት ጀርባ ያለው ምሕንድስና፦ የላቁ የማስተካከያ ስልቶች

በእውነት ውጤታማ ባለብዙ ሞዳሊቲ መልሶ አግኚ መገንባት፣ ዝግጁ የVision-Language Model (VLM) ወስዶ እንዲፈልግ እንደመጠየቅ ቀላል አይደለም። ባለብዙ ሞዳሊቲ RAGን ለረጅም ጊዜ ወደኋላ የጎተቱትን ችግሮች ለመፍታትና ColQwen3ን ለመፍጠር፣ ሞዴል የማዋሃድና የሥልጠና ስልቶችን ተጠቅመናል።

1. በተስተካከለ የተዋሃደ ክብደት የመክተት ችሎታን ማስተላለፍ

መሠረታዊ ሞዴልን ከባዶ ከማስተካከል ይልቅ፣ የመልሶ ማግኘት ተግባራት እውቀትን ከነባር የጽሑፍ መክተቻ ሞዴል የምናስተላልፍበትን ዘዴ ነድፈናል። መደበኛ VLM ምስሎችን መግለጽ ያውቃል፤ ነገር ግን ከአንድ ጥያቄ አንጻር በትርጉም ደረጃ እንዴት እንደሚያስቀምጣቸው የግድ አያውቅም።

ይህን ክፍተት ለመሙላት የተስተካከሉ የተዋሃደ ክብደት ስልቶችን ተጠቅመናል። በሙከራዎቻችን፣ በጽሑፋዊው ድብቅ ምህዳር ያለው የQwen3-Embedding መልሶ የማግኘት ችሎታ ያለ አፋጣኝ ሥልጠና እንኳን ወደ ባለብዙ ሞዳሊቲ ምህዳር በቀጥታ ተላልፎ ለምስልና ለቪዲዮ መልሶ ማግኘት መላመድ እንደሚችል አግኝተናል። ይህን ውጤታማ ማስጀመሪያ እንደ ጠንካራ መነሻ ተጠቅመን፣ አፈጻጸሙን የበለጠ ለማሻሻልና ጽናቱን ለማረጋገጥ ሞዴሉን አስተካክለናል። ይህም ከQwen3-VL መሠረታዊ ሞዴል በመነሳት ከሚደረግ ማስተካከያ ጋር ሲነጻጸር የመጨረሻውን የመልሶ ማግኘት አፈጻጸም ያሻሽላል።

2. ጥንቃቄ የተሞላበት የልዕለ-ግቤት ማስተካከያ

የመክተት ችሎታዎቹ ከተላለፉ በኋላ ትኩረታችንን በማሰለፍ ላይ አደረግን። የመልሶ ማግኘት አፈጻጸምን ከፍ ለማድረግ፣ ተስማሚውን የዙሮች ብዛት፣ የባች መጠን፣ የመማር ፍጥነት፣ የLoRA ደረጃና የውሂብ ስብስቦች ድብልቅን ጨምሮ ጥንቃቄ የተሞላባቸውን የልዕለ-ግቤት ፍለጋዎችና የክፍል ማስወገድ ጥናቶችን አካሂደናል።

ለማስተካከያ የሚያገለግሉ የውሂብ ስብስቦቻችን እንዲሆኑ VDRColPali train setvisrag_syn, እና visrag_indን መርጠናል። ለማስተካከያው UniMax ናሙና መውሰድን ተጠቅመናል። ሞዴል ማዋሃድን ስለተጠቀምንና መሠረታዊው የተዋሃደ ሞዴል ከፊል ባለብዙ ሞዳሊቲ የመልሶ ማግኘት ችሎታን አስቀድሞ ስለወረሰ፣ ተጨማሪ የውሂብ ስብስቦችን መጨመር አፈጻጸሙን በትንሹ እንደሚቀንስ አግኝተናል፤ ስለዚህ ወደ ተጨማሪ ስብስቦች አላስፋፋንም።

ለማስተካከያው የመረጥናቸው ልዕለ-ግቤቶች እነሆ፦

የLoRA ደረጃ

32

LoRA Alpha

32

የLoRA ዒላማ ሞጁሎች

ከመክተቻው በስተቀር የምስልና የጽሑፍ ሁሉም ንብርብሮች

የመማር ፍጥነት

5e-5

ከፍተኛው የምስል Tokens ብዛት

1280

የሥልጠና ዙሮች

1

አጠቃላይ የባች መጠን

512

የማሟሟቂያ ምጥጥን

5%

3. የ«ColBERT» አጣብቂኝ፦ ከፍተኛ አፈጻጸም ወይስ የማከማቻ ወጪ

በታሪክ፣ የ«ColBERT ዓይነት» token-ደረጃ መክተቻዎችን የሚጠቀሙ ሞዴሎች (እንደ ColPali) አስደናቂ አፈጻጸም ቢያቀርቡም፣ የማከማቻ ወጪያቸው ከአቅም በላይ ነበር። እያንዳንዱን ምስላዊ token ኢንዴክስ ማድረግ፣ በድርጅት መጠን ለመጠቀም እጅግ ውድ የሆኑ ግዙፍ የቬክተር ውሂብ ጎታዎችን ፈጥሯል።

  • የማሻሻያ ስልቱ፦ ከፍተኛውን አፈጻጸም እንደያዝን የማከማቻ ወጪ ከቁጥጥር ውጭ እንዳይሆን፣ የመክተቻዎቻችንን መጠን በጥንቃቄ በማመጣጠን የማከማቻውን ችግር ፈትተናል። በዚህ ቀልጣፋ መጠን ውስጥ SOTA ትክክለኛነትን ለመጠበቅ፣ በመልሶ ማግኘት አፈጻጸምና በማከማቻ ወጪ መካከል የተሻለ ሚዛን እንዲኖር የዳይሜንሽን መጠኑን 320 አድርገን መርጠናል።

    • መነሻ፦ መደበኛ አቀራረብ (እንደ NVIDIA Nemo-3B) የ1 ሚሊዮን ምስሎችን መክተቻዎች ለማከማቸት በግምት 10.3 TB ይፈልጋል (1,802 tokens @ 3,072 dims)።

    • ColQwen3፦ እነዚሁን 1 ሚሊዮን ምስሎች በ0.82 TB ብቻ ያከማቻል (ከፍተኛው 1,280 tokens @ 320 dims)።

ColQwen3 የደመና መሠረተ ልማት በጀትን ሳያናር የSOTA መልሶ ማግኘት ትክክለኛነትን ያሳካል።

የግምገማ ውጤቶች

አቀራረባችንን በViDoRe የመመዘኛዎች ስብስብ አረጋግጠናል። ውጤቶቹ ColQwen3 በቅርብ ጊዜዎቹ V3 እና V2 መመዘኛዎች (በእንግሊዝኛም ሆነ በብዙ ቋንቋዎች) አዲስ ደረጃ እንዳስቀመጠ፣ በቀድሞዎቹ V1 ተግባራትም ከፍተኛ አፈጻጸሙን እንደጠበቀ ያረጋግጣሉ።

ViDoRe v3 (የቅርብ ጊዜ)

ColQwen3-8B በእንግሊዝኛና በብዙ ቋንቋዎች መልሶ ማግኘት ይመራል።

የእንግሊዝኛ nDCG@5

ሞዴል

ኮምፒውተር ሳይንስ

ኃይል

ፋይናንስ

የሰው ኃይል

ኢንዱስትሪ

ፋርማሲ

ፊዚክስ

አማካይ

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

የብዙ ቋንቋዎች nDCG@5

ሞዴል

ኮምፒውተር ሳይንስ

ኃይል

ፋይናንስ

የሰው ኃይል

ኢንዱስትሪ

ፋርማሲ

ፊዚክስ

አማካይ

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

የViDoRe v2 እና v1 ዋና ውጤቶች

በESG፣ በኢኮኖሚክስ እና በDocVQA ላይ ተከታታይ ከፍተኛ አፈጻጸም።

መመዘኛ

ሞዴል

ውጤት (አማካይ)

ጉልህ ድል

ViDoRe V2 (እንግሊዝኛ)

ColQwen3-8B

0.6772

በESG እና BioMed #1

ViDoRe V2 (ብዙ ቋንቋዎች)

ColQwen3-8B

0.6085

በኢኮኖሚክስ #1

ViDoRe V1 (እንግሊዝኛ)

Nemo ColEmbed 3B

0.9100

በትንሹ ከፍ ያለ አማካይ

ViDoRe V1 (እንግሊዝኛ)

ColQwen3-8B

0.9076

በArxivQA እና Syn-Gov #1

ቪዲዮ መልሶ ማግኘት፦ የCareBench ግምገማ

ColQwen3 ለቪዲዮ መልሶ ማግኘት በጥሩ ሁኔታ መላመዱን ለማሳየት፣ ሞዴሎቹን ከጽሑፍ ወደ ቪዲዮ (አጠቃላይ መልሶ ማግኘት) ተግባራት በCareBench መመዘኛ ገምግመናል።

ለዚህ ግምገማ ጥሬ ቪዲዮን የመቀየር አቀራረብ ተጠቅመናል፤ ሞዴሎቻችን ያለምንም ተጨማሪ የጽሑፍ ማብራሪያ ወይም የዲበ ውሂብ ግብዓት የቪዲዮ ፋይሎቹን በቀጥታ ቀይረዋል። ይህም ሞዴሉ በምስላዊ ትርጉም ብቻ ተመስርቶ መልሶ ማግኘት መቻሉን ያሳያል።

ሞዴል

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

«ጨለማ ውሂብን» መክፈት፦ የቪዲዮ ግንባር ቀደም ዘርፍ

ColQwen3 ካስቻላቸው እጅግ ጥልቅ ለውጦች አንዱ ቪዲዮን ልክ እንደ ሰነድ ማስተናገድ መቻሉ ነው። በብዙ ድርጅቶች ውስጥ ቪዲዮ «ጨለማ ውሂብ» ነው። አንድ ሰው እያንዳንዱን ፋይል በእጅ መለያ ካልሰጠው በቀር፣ በቀዝቃዛ ማከማቻ ውስጥ ፈጽሞ ሊፈለግ ሳይችል ይቀመጣል።

ColQwen3 በተከፋፈሉ ቅንጥቦች ላይ ፍሬም በፍሬም መልሶ ማግኘትን በማስቻል ይህን ይለውጣል።

የአጠቃቀም ሁኔታ፦ የድርጅት የማስታወሻ ቋት

ድርጅቶች በየቀኑ በሺዎች የሚቆጠሩ ሰዓታት የውስጥ ቪዲዮ ስብሰባዎችን ይቀርጻሉ፤ አብዛኛውን ጊዜም ቅጂዎቹ ጥቅም ሳይሰጡ ይጠፋሉ።

  • የሥራ ሂደቱ፦ ረጅም የስብሰባ ቅጂዎችን በራስ-ሰር ወደ አጫጭርና አመክንዮአዊ ቅንጥቦች በመከፋፈልና በColQwen3 ኢንዴክስ በማድረግ፣ ሊፈለግ የሚችል «የድርጅት ማስታወሻ» ይፈጥራሉ።

  • ጥያቄው፦ የፕሮጀክት አስተዳዳሪ፦ “Show me the clip where the engineering lead explained the latency issue with the API.” ብሎ መጠየቅ ይችላል።

  • ውጤቱ፦ ሥርዓቱ የ60 ደቂቃ ቪዲዮ ፋይል ከመመለስ ይልቅ፣ ተናጋሪዎቹ በዚያው ቅጽበት «መዘግየት» የሚለውን ቃል በግልጽ ባይናገሩም፣ ያ የተወሰነ ሥዕላዊ መግለጫ በማያ ገጽ ላይ ታይቶ የተወያዩበትን ትክክለኛ የ45 ሰከንድ ክፍል ያገኛል።

የድርጅት አጠቃቀሞች፦ ከፍተኛ ዋጋ ያላቸውን ችግሮች መፍታት

ወደ ቤተኛ ባለብዙ ሞዳሊቲ መክተት መሸጋገር በተለያዩ ኢንዱስትሪዎች ፈጽሞ አዲስ የሥራ ሂደቶችን ያስችላል። ይህን ሞዴል እጅግ ውስብስብ ከሆኑ የድርጅት ውሂብ አካባቢዎች ጋር በስፋት መዝነናል።

1. የመመዘኛ ዋና ውጤት፦ የከተማ ማማከርና ሥነ ሕንፃ

ColQwen3ን ግዙፍ የዋና ፕላኖች፣ የዞን ካርታዎችና ውስብስብ የሕንፃ ከፍታ ሥዕሎች ስብስብ በሚያስተዳድሩ የከተማ አማካሪ ድርጅቶች የውሂብ ችግሮች ላይ ፈትነነዋል።

  • ተግዳሮቱ፦ በእነዚህ አካባቢዎች ባህላዊ የRAG የሥራ ሂደቶች ይቸገራሉ። የOCR መሣሪያዎች ውስብስብ የሳይት ፕላኖችን በአብዛኛው «ንድፍ» ብለው ብቻ ይገልጻሉ፤ ስለ ትራፊክ ፍሰት፣ አረንጓዴ ቀጠናዎች ወይም የሕንፃ ማፈግፈጊያዎች ያሉ ወሳኝ ዝርዝሮችን ይስታሉ።

  • አፈጻጸሙ፦ የውስጥ መመዘኛዎቻችን ColQwen3 ውድ የOCR/መግለጫ ቅድመ-ሂደትን በብቃት እንደሚያስቀር ያሳያሉ። ጥቅጥቅ ባሉ የሕንፃ ሥዕሎች ላይ በተደረጉ ሙከራዎች፣ ሞዴሉ እንደ የእግረኛ መግቢያዎች ወይም የተለዩ የዞን ወሰኖች ባሉ ምስላዊ ምልክቶች መሠረት ሰነዶችን በተሳካ ሁኔታ አግኝቷል፤ ይህም ከጽሑፍ-ብቻ መነሻዎች እጅግ የላቀ ሲሆን የእውቀት ማስገቢያ ወጪንም በከፍተኛ ደረጃ ለመቀነስ ያስችላል።

2. ውስብስብ የፋይናንስና የገበያ መረጃ ትንተና

የኢንቨስትመንት ባንክ ባለሙያዎችና ተንታኞች ዓመታዊ ሪፖርቶችንና የባለሀብቶች ስላይዶችን በመመርመር በሺዎች የሚቆጠሩ ሰዓታትን ያሳልፋሉ።

  • የሥራ ሂደቱ፦ ተንታኝ፣ “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.” ብሎ መጠየቅ ይችላል።

  • ለውጡ፦ ሞዴሉ በቁልፍ ቃል ማዛመድ ፋንታ የተወሰነውን የውሂብ ምስላዊ አቀራረብ በመለየት ትክክለኛውን ስላይድ ያገኛል፤ ይህም የRAG ሥርዓቱ ለጥያቄዎች በከፍተኛ ትክክለኛነት እንዲመልስ ያስችለዋል።

3. የኢንዱስትሪ ማምረትና የመስክ አገልግሎት

የማምረቻ ድርጅቶች ግዙፍ የቴክኒክ መመሪያዎችና የቧንቧ ንድፎች (P&IDs) ስብስብ አላቸው።

  • የሥራ ሂደቱ፦ ተርባይን የሚጠግን የመስክ መሐንዲስ የአንድን ክፍል ፎቶ ማንሳት ወይም “Show me the wiring diagram for the hydraulic pump assembly.” ብሎ መጠየቅ ይችላል።

  • ለውጡ፦ ColQwen3 የሽቦ ንድፉን ምስላዊ ውክልና ለይቶ ትክክለኛውን ገጽ ያገኛል፤ ይህም የሥራ መቋረጥን በሰዓታት ሊቀንስ ይችላል።

4. ሕግና ደንብ ተገዢነት

የሕግ ማስረጃ ፍለጋ በሚሊዮኖች የሚቆጠሩ የተቃኙ ገጾችን መመርመር ይጠይቃል፤ የሚፈለገው ትንሽ ማስረጃም ብዙውን ጊዜ ምስላዊ ምልክት ነው።

  • የሥራ ሂደቱ፦ የደንብ ተገዢነት ኃላፊ “Documents signed by the CFO” ወይም “Contracts containing the official ‘Confidential’ stamp.” ብሎ መፈለግ ይችላል።

  • ለውጡ፦ ሞዴሉ ፊርማዎች ወይም ማህተሞች በምስል መታየታቸውን ተመልክቶ ረቂቅን ከተጠናቀቀ ሰነድ ይለያል፤ ይህን በOCR ብቻ ማድረግ ብዙ ጊዜ አይቻልም።

መጀመር

ColQwen3 ክብደቶቹ ክፍት ናቸው (Apache 2.0)፤ አሁንም በHugging Face ላይ ይገኛል። ለዘመናዊ የRAG የሥራ ሂደቶች በቀጥታ እንደ ማሻሻያ እንዲገባ ነድፈነዋል፤ ጽሑፍን፣ ምስሎችንና ቪዲዮን ወዲያውኑ ለማስኬድ የሚያስፈልገውን የኢንፈረንስ ኮድም ያቀርባል።

ከቀላል የጽሑፍ ፍለጋ ባሻገር በምስላዊ ሀብቶቻቸው ውስጥ የታገደውን አስተውሎት ለመክፈት ዝግጁ ለሆኑ ድርጅቶች፣ ይህ አዲሱ መስፈርት ነው።

ቀጣይ እርምጃ፦ ሞዴል ካርዱን ይመልከቱና ቀጥታ ማሳያውን በHugging Face ላይ ይሞክሩ፦ /-colqwen3-embed-8b እና /-colqwen3-embed-4b

ደራሲ

Xin Huang እና Kye Min Tan