ባለፉት ሁለት ዓመታት «RAG» (በመልሶ ማግኘት የተጠናከረ ማመንጨት) ከጽሑፍ ጋር ብቻ የሚያያዝ ጽንሰ ሐሳብ ሆኖ ቆይቷል። መደበኛው አሠራር ቀላል ነው፦ ሰነዶችን ይውሰዱ፣ ጽሑፉን ያውጡ፣ ከፋፍለው ኢንዴክስ ያድርጉት።
የድርጅት ዓለም ግን በተራ የጽሑፍ ፋይሎች አይሠራም። የሚሠራው በውስብስብ PDFዎች፣ ጥቅጥቅ ያሉ ገበታዎችን በያዙ ስላይዶች፣ የCAD ሥዕሎች፣ የተቃኙ ደረሰኞችና እየጨመሩ ባሉ ግዙፍ የቪዲዮ ቅጂዎች ማከማቻ ነው።
ይህን ለማስተናገድ ምስልን ከመክተት በፊት OCR ወይም Vision LLMs ተጠቅሞ ወደ ጽሑፍ «መግለጫ» የመቀየር የኢንዱስትሪው መደበኛ አሠራር ግዙፍ ማነቆ ነው። ዘገምተኛና ውድ ከመሆኑም በላይ፣ የመጀመሪያውን ውሂብ የበለጸገ የቦታና የምስል ዐውድ ማጣቱ አይቀርም። የእርስዎ AI ውስብስብ ምስልን «ንድፍ» ብሎ ብቻ ከገለጸው፣ በውስጡ ያለውን የተወሰነ ቫልቭ ወይም የሽቦ ንድፍ የመፈለግ ችሎታ አጥተዋል።
ዛሬ፣ ከጫፍ እስከ ጫፍ ምስላዊ መልሶ ማግኘትን በማስቻል ይህን ችግር ለመፍታት በColPali አርክቴክቸር ላይ የተገነቡ እጅግ ዘመናዊ ባለብዙ ሞዳሊቲ የመክተቻ ሞዴሎችን ቤተሰብ ይፋ እያደረግን ነው።
በእውነት ውጤታማ ባለብዙ ሞዳሊቲ መልሶ አግኚ መገንባት፣ ዝግጁ የVision-Language Model (VLM) ወስዶ እንዲፈልግ እንደመጠየቅ ቀላል አይደለም። ባለብዙ ሞዳሊቲ RAGን ለረጅም ጊዜ ወደኋላ የጎተቱትን ችግሮች ለመፍታትና ColQwen3ን ለመፍጠር፣ ሞዴል የማዋሃድና የሥልጠና ስልቶችን ተጠቅመናል።
መሠረታዊ ሞዴልን ከባዶ ከማስተካከል ይልቅ፣ የመልሶ ማግኘት ተግባራት እውቀትን ከነባር የጽሑፍ መክተቻ ሞዴል የምናስተላልፍበትን ዘዴ ነድፈናል። መደበኛ VLM ምስሎችን መግለጽ ያውቃል፤ ነገር ግን ከአንድ ጥያቄ አንጻር በትርጉም ደረጃ እንዴት እንደሚያስቀምጣቸው የግድ አያውቅም።
ይህን ክፍተት ለመሙላት የተስተካከሉ የተዋሃደ ክብደት ስልቶችን ተጠቅመናል። በሙከራዎቻችን፣ በጽሑፋዊው ድብቅ ምህዳር ያለው የQwen3-Embedding መልሶ የማግኘት ችሎታ ያለ አፋጣኝ ሥልጠና እንኳን ወደ ባለብዙ ሞዳሊቲ ምህዳር በቀጥታ ተላልፎ ለምስልና ለቪዲዮ መልሶ ማግኘት መላመድ እንደሚችል አግኝተናል። ይህን ውጤታማ ማስጀመሪያ እንደ ጠንካራ መነሻ ተጠቅመን፣ አፈጻጸሙን የበለጠ ለማሻሻልና ጽናቱን ለማረጋገጥ ሞዴሉን አስተካክለናል። ይህም ከQwen3-VL መሠረታዊ ሞዴል በመነሳት ከሚደረግ ማስተካከያ ጋር ሲነጻጸር የመጨረሻውን የመልሶ ማግኘት አፈጻጸም ያሻሽላል።
የመክተት ችሎታዎቹ ከተላለፉ በኋላ ትኩረታችንን በማሰለፍ ላይ አደረግን። የመልሶ ማግኘት አፈጻጸምን ከፍ ለማድረግ፣ ተስማሚውን የዙሮች ብዛት፣ የባች መጠን፣ የመማር ፍጥነት፣ የLoRA ደረጃና የውሂብ ስብስቦች ድብልቅን ጨምሮ ጥንቃቄ የተሞላባቸውን የልዕለ-ግቤት ፍለጋዎችና የክፍል ማስወገድ ጥናቶችን አካሂደናል።
ለማስተካከያ የሚያገለግሉ የውሂብ ስብስቦቻችን እንዲሆኑ VDR፣ ColPali train set፣ visrag_syn, እና visrag_indን መርጠናል። ለማስተካከያው UniMax ናሙና መውሰድን ተጠቅመናል። ሞዴል ማዋሃድን ስለተጠቀምንና መሠረታዊው የተዋሃደ ሞዴል ከፊል ባለብዙ ሞዳሊቲ የመልሶ ማግኘት ችሎታን አስቀድሞ ስለወረሰ፣ ተጨማሪ የውሂብ ስብስቦችን መጨመር አፈጻጸሙን በትንሹ እንደሚቀንስ አግኝተናል፤ ስለዚህ ወደ ተጨማሪ ስብስቦች አላስፋፋንም።
ለማስተካከያው የመረጥናቸው ልዕለ-ግቤቶች እነሆ፦
የLoRA ደረጃ | 32 |
LoRA Alpha | 32 |
የLoRA ዒላማ ሞጁሎች | ከመክተቻው በስተቀር የምስልና የጽሑፍ ሁሉም ንብርብሮች |
የመማር ፍጥነት | 5e-5 |
ከፍተኛው የምስል Tokens ብዛት | 1280 |
የሥልጠና ዙሮች | 1 |
አጠቃላይ የባች መጠን | 512 |
የማሟሟቂያ ምጥጥን | 5% |
በታሪክ፣ የ«ColBERT ዓይነት» token-ደረጃ መክተቻዎችን የሚጠቀሙ ሞዴሎች (እንደ ColPali) አስደናቂ አፈጻጸም ቢያቀርቡም፣ የማከማቻ ወጪያቸው ከአቅም በላይ ነበር። እያንዳንዱን ምስላዊ token ኢንዴክስ ማድረግ፣ በድርጅት መጠን ለመጠቀም እጅግ ውድ የሆኑ ግዙፍ የቬክተር ውሂብ ጎታዎችን ፈጥሯል።
የማሻሻያ ስልቱ፦ ከፍተኛውን አፈጻጸም እንደያዝን የማከማቻ ወጪ ከቁጥጥር ውጭ እንዳይሆን፣ የመክተቻዎቻችንን መጠን በጥንቃቄ በማመጣጠን የማከማቻውን ችግር ፈትተናል። በዚህ ቀልጣፋ መጠን ውስጥ SOTA ትክክለኛነትን ለመጠበቅ፣ በመልሶ ማግኘት አፈጻጸምና በማከማቻ ወጪ መካከል የተሻለ ሚዛን እንዲኖር የዳይሜንሽን መጠኑን 320 አድርገን መርጠናል።
መነሻ፦ መደበኛ አቀራረብ (እንደ NVIDIA Nemo-3B) የ1 ሚሊዮን ምስሎችን መክተቻዎች ለማከማቸት በግምት 10.3 TB ይፈልጋል (1,802 tokens @ 3,072 dims)።
ColQwen3፦ እነዚሁን 1 ሚሊዮን ምስሎች በ0.82 TB ብቻ ያከማቻል (ከፍተኛው 1,280 tokens @ 320 dims)።
ColQwen3 የደመና መሠረተ ልማት በጀትን ሳያናር የSOTA መልሶ ማግኘት ትክክለኛነትን ያሳካል።
አቀራረባችንን በViDoRe የመመዘኛዎች ስብስብ አረጋግጠናል። ውጤቶቹ ColQwen3 በቅርብ ጊዜዎቹ V3 እና V2 መመዘኛዎች (በእንግሊዝኛም ሆነ በብዙ ቋንቋዎች) አዲስ ደረጃ እንዳስቀመጠ፣ በቀድሞዎቹ V1 ተግባራትም ከፍተኛ አፈጻጸሙን እንደጠበቀ ያረጋግጣሉ።
ColQwen3-8B በእንግሊዝኛና በብዙ ቋንቋዎች መልሶ ማግኘት ይመራል።
የእንግሊዝኛ nDCG@5
ሞዴል | ኮምፒውተር ሳይንስ | ኃይል | ፋይናንስ | የሰው ኃይል | ኢንዱስትሪ | ፋርማሲ | ፊዚክስ | አማካይ |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
የብዙ ቋንቋዎች nDCG@5
ሞዴል | ኮምፒውተር ሳይንስ | ኃይል | ፋይናንስ | የሰው ኃይል | ኢንዱስትሪ | ፋርማሲ | ፊዚክስ | አማካይ |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
በESG፣ በኢኮኖሚክስ እና በDocVQA ላይ ተከታታይ ከፍተኛ አፈጻጸም።
መመዘኛ | ሞዴል | ውጤት (አማካይ) | ጉልህ ድል |
ViDoRe V2 (እንግሊዝኛ) | ColQwen3-8B | 0.6772 | በESG እና BioMed #1 |
ViDoRe V2 (ብዙ ቋንቋዎች) | ColQwen3-8B | 0.6085 | በኢኮኖሚክስ #1 |
ViDoRe V1 (እንግሊዝኛ) | Nemo ColEmbed 3B | 0.9100 | በትንሹ ከፍ ያለ አማካይ |
ViDoRe V1 (እንግሊዝኛ) | ColQwen3-8B | 0.9076 | በArxivQA እና Syn-Gov #1 |
ColQwen3 ለቪዲዮ መልሶ ማግኘት በጥሩ ሁኔታ መላመዱን ለማሳየት፣ ሞዴሎቹን ከጽሑፍ ወደ ቪዲዮ (አጠቃላይ መልሶ ማግኘት) ተግባራት በCareBench መመዘኛ ገምግመናል።
ለዚህ ግምገማ ጥሬ ቪዲዮን የመቀየር አቀራረብ ተጠቅመናል፤ ሞዴሎቻችን ያለምንም ተጨማሪ የጽሑፍ ማብራሪያ ወይም የዲበ ውሂብ ግብዓት የቪዲዮ ፋይሎቹን በቀጥታ ቀይረዋል። ይህም ሞዴሉ በምስላዊ ትርጉም ብቻ ተመስርቶ መልሶ ማግኘት መቻሉን ያሳያል።
ሞዴል | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 ካስቻላቸው እጅግ ጥልቅ ለውጦች አንዱ ቪዲዮን ልክ እንደ ሰነድ ማስተናገድ መቻሉ ነው። በብዙ ድርጅቶች ውስጥ ቪዲዮ «ጨለማ ውሂብ» ነው። አንድ ሰው እያንዳንዱን ፋይል በእጅ መለያ ካልሰጠው በቀር፣ በቀዝቃዛ ማከማቻ ውስጥ ፈጽሞ ሊፈለግ ሳይችል ይቀመጣል።
ColQwen3 በተከፋፈሉ ቅንጥቦች ላይ ፍሬም በፍሬም መልሶ ማግኘትን በማስቻል ይህን ይለውጣል።
ድርጅቶች በየቀኑ በሺዎች የሚቆጠሩ ሰዓታት የውስጥ ቪዲዮ ስብሰባዎችን ይቀርጻሉ፤ አብዛኛውን ጊዜም ቅጂዎቹ ጥቅም ሳይሰጡ ይጠፋሉ።
የሥራ ሂደቱ፦ ረጅም የስብሰባ ቅጂዎችን በራስ-ሰር ወደ አጫጭርና አመክንዮአዊ ቅንጥቦች በመከፋፈልና በColQwen3 ኢንዴክስ በማድረግ፣ ሊፈለግ የሚችል «የድርጅት ማስታወሻ» ይፈጥራሉ።
ጥያቄው፦ የፕሮጀክት አስተዳዳሪ፦ “Show me the clip where the engineering lead explained the latency issue with the API.” ብሎ መጠየቅ ይችላል።
ውጤቱ፦ ሥርዓቱ የ60 ደቂቃ ቪዲዮ ፋይል ከመመለስ ይልቅ፣ ተናጋሪዎቹ በዚያው ቅጽበት «መዘግየት» የሚለውን ቃል በግልጽ ባይናገሩም፣ ያ የተወሰነ ሥዕላዊ መግለጫ በማያ ገጽ ላይ ታይቶ የተወያዩበትን ትክክለኛ የ45 ሰከንድ ክፍል ያገኛል።
ወደ ቤተኛ ባለብዙ ሞዳሊቲ መክተት መሸጋገር በተለያዩ ኢንዱስትሪዎች ፈጽሞ አዲስ የሥራ ሂደቶችን ያስችላል። ይህን ሞዴል እጅግ ውስብስብ ከሆኑ የድርጅት ውሂብ አካባቢዎች ጋር በስፋት መዝነናል።
ColQwen3ን ግዙፍ የዋና ፕላኖች፣ የዞን ካርታዎችና ውስብስብ የሕንፃ ከፍታ ሥዕሎች ስብስብ በሚያስተዳድሩ የከተማ አማካሪ ድርጅቶች የውሂብ ችግሮች ላይ ፈትነነዋል።
ተግዳሮቱ፦ በእነዚህ አካባቢዎች ባህላዊ የRAG የሥራ ሂደቶች ይቸገራሉ። የOCR መሣሪያዎች ውስብስብ የሳይት ፕላኖችን በአብዛኛው «ንድፍ» ብለው ብቻ ይገልጻሉ፤ ስለ ትራፊክ ፍሰት፣ አረንጓዴ ቀጠናዎች ወይም የሕንፃ ማፈግፈጊያዎች ያሉ ወሳኝ ዝርዝሮችን ይስታሉ።
አፈጻጸሙ፦ የውስጥ መመዘኛዎቻችን ColQwen3 ውድ የOCR/መግለጫ ቅድመ-ሂደትን በብቃት እንደሚያስቀር ያሳያሉ። ጥቅጥቅ ባሉ የሕንፃ ሥዕሎች ላይ በተደረጉ ሙከራዎች፣ ሞዴሉ እንደ የእግረኛ መግቢያዎች ወይም የተለዩ የዞን ወሰኖች ባሉ ምስላዊ ምልክቶች መሠረት ሰነዶችን በተሳካ ሁኔታ አግኝቷል፤ ይህም ከጽሑፍ-ብቻ መነሻዎች እጅግ የላቀ ሲሆን የእውቀት ማስገቢያ ወጪንም በከፍተኛ ደረጃ ለመቀነስ ያስችላል።
የኢንቨስትመንት ባንክ ባለሙያዎችና ተንታኞች ዓመታዊ ሪፖርቶችንና የባለሀብቶች ስላይዶችን በመመርመር በሺዎች የሚቆጠሩ ሰዓታትን ያሳልፋሉ።
የሥራ ሂደቱ፦ ተንታኝ፣ “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.” ብሎ መጠየቅ ይችላል።
ለውጡ፦ ሞዴሉ በቁልፍ ቃል ማዛመድ ፋንታ የተወሰነውን የውሂብ ምስላዊ አቀራረብ በመለየት ትክክለኛውን ስላይድ ያገኛል፤ ይህም የRAG ሥርዓቱ ለጥያቄዎች በከፍተኛ ትክክለኛነት እንዲመልስ ያስችለዋል።
የማምረቻ ድርጅቶች ግዙፍ የቴክኒክ መመሪያዎችና የቧንቧ ንድፎች (P&IDs) ስብስብ አላቸው።
የሥራ ሂደቱ፦ ተርባይን የሚጠግን የመስክ መሐንዲስ የአንድን ክፍል ፎቶ ማንሳት ወይም “Show me the wiring diagram for the hydraulic pump assembly.” ብሎ መጠየቅ ይችላል።
ለውጡ፦ ColQwen3 የሽቦ ንድፉን ምስላዊ ውክልና ለይቶ ትክክለኛውን ገጽ ያገኛል፤ ይህም የሥራ መቋረጥን በሰዓታት ሊቀንስ ይችላል።
የሕግ ማስረጃ ፍለጋ በሚሊዮኖች የሚቆጠሩ የተቃኙ ገጾችን መመርመር ይጠይቃል፤ የሚፈለገው ትንሽ ማስረጃም ብዙውን ጊዜ ምስላዊ ምልክት ነው።
የሥራ ሂደቱ፦ የደንብ ተገዢነት ኃላፊ “Documents signed by the CFO” ወይም “Contracts containing the official ‘Confidential’ stamp.” ብሎ መፈለግ ይችላል።
ለውጡ፦ ሞዴሉ ፊርማዎች ወይም ማህተሞች በምስል መታየታቸውን ተመልክቶ ረቂቅን ከተጠናቀቀ ሰነድ ይለያል፤ ይህን በOCR ብቻ ማድረግ ብዙ ጊዜ አይቻልም።
ColQwen3 ክብደቶቹ ክፍት ናቸው (Apache 2.0)፤ አሁንም በHugging Face ላይ ይገኛል። ለዘመናዊ የRAG የሥራ ሂደቶች በቀጥታ እንደ ማሻሻያ እንዲገባ ነድፈነዋል፤ ጽሑፍን፣ ምስሎችንና ቪዲዮን ወዲያውኑ ለማስኬድ የሚያስፈልገውን የኢንፈረንስ ኮድም ያቀርባል።
ከቀላል የጽሑፍ ፍለጋ ባሻገር በምስላዊ ሀብቶቻቸው ውስጥ የታገደውን አስተውሎት ለመክፈት ዝግጁ ለሆኑ ድርጅቶች፣ ይህ አዲሱ መስፈርት ነው።
ቀጣይ እርምጃ፦ ሞዴል ካርዱን ይመልከቱና ቀጥታ ማሳያውን በHugging Face ላይ ይሞክሩ፦ /-colqwen3-embed-8b እና /-colqwen3-embed-4b