ბოლო ორი წლის განმავლობაში „RAG“ (მოძიებით გაძლიერებული გენერაცია) თითქმის მხოლოდ ტექსტთან ასოცირდებოდა. სტანდარტული მიდგომა მარტივია: აიღეთ დოკუმენტები, ამოიღეთ ტექსტი, დაყავით ნაწილებად და დააინდექსეთ.
მაგრამ საწარმოო სამყარო უბრალო ტექსტურ ფაილებზე არ მუშაობს. ის ეყრდნობა რთულ PDF-ებს, მჭიდრო დიაგრამებით დატვირთულ პრეზენტაციებს, CAD ნახაზებს, დასკანერებულ ინვოისებს და სულ უფრო ხშირად — ვიდეომასალის უზარმაზარ არქივებს.
გამოსახულების ჩაშენებამდე მის ტექსტად „აღსაწერად“ OCR-ის ან ვიზუალური LLM-ების გამოყენება ინდუსტრიის სტანდარტია, თუმცა ეს პროცესი სერიოზულ დაბრკოლებას ქმნის. ის ნელი და ძვირია და გარდაუვლად კარგავს საწყისი მონაცემების მდიდარ სივრცით და ვიზუალურ კონტექსტს. თუ თქვენი AI რთულ ვიზუალურ მასალას უბრალოდ „ნახაზად“ აღწერს, მასში კონკრეტული სარქვლის ან გაყვანილობის სქემის მოძიებას ვეღარ შეძლებთ.
დღეს წარმოგიდგენთ უახლესი მულტიმოდალური ჩაშენების მოდელების ოჯახს, რომელიც ColPali-ის არქიტექტურას ეფუძნება და ამ პრობლემას ბოლოდან ბოლომდე ვიზუალური მოძიებით წყვეტს.
ნამდვილად ეფექტიანი მულტიმოდალური მაძიებლის შექმნა არც ისე მარტივია, როგორც მზა ვიზუალურ-ენობრივი მოდელის (VLM) აღება და მისთვის ძიების დავალება. მულტიმოდალური RAG-ის ისტორიული დაბრკოლებების დასაძლევად და ColQwen3-ის შესაქმნელად მოდელების შერწყმისა და წვრთნის სტრატეგიები გამოვიყენეთ.
საბაზისო მოდელის ნულიდან დამატებით გაწვრთნის ნაცვლად, შევიმუშავეთ მეთოდი, რომელიც მოძიების ამოცანების ცოდნას არსებული ტექსტური ჩაშენების მოდელიდან გადასცემს. სტანდარტულ VLM-ს გამოსახულებების აღწერა შეუძლია, თუმცა მოთხოვნასთან სემანტიკური შესაბამისობით მათი რანჟირება აუცილებლად არ იცის.
ამ ხარვეზის აღმოსაფხვრელად მორგებული შერწყმული წონების სტრატეგიები გამოვიყენეთ. ექსპერიმენტებმა აჩვენა, რომ Qwen3-Embedding-ის ტექსტურ ლატენტურ სივრცეში არსებული მოძიების უნარი პირდაპირ შეიძლება გადავიდეს მულტიმოდალურ სივრცეში და დაუყოვნებელი წვრთნის გარეშეც განზოგადდეს გამოსახულებისა და ვიდეოს მოძიებაზე. ეს ეფექტიანი ინიციალიზაცია მყარ საწყის წერტილად გამოვიყენეთ, შემდეგ კი შედეგების გასაუმჯობესებლად და მდგრადობის უზრუნველსაყოფად მოდელი დამატებით გავწვრთენით. ეს Qwen3-VL-ის საბაზისო მოდელის დამატებით წვრთნასთან შედარებით მოძიების საბოლოო შედეგებს აუმჯობესებს.
ჩაშენების შესაძლებლობების გადატანის შემდეგ ყურადღება შესაბამისობაზე გავამახვილეთ. მოძიების შედეგების მაქსიმალურად გასაუმჯობესებლად ჰიპერპარამეტრების დეტალური ძიება და აბლაციის კვლევები ჩავატარეთ, მათ შორის ეპოქების ოპტიმალური რაოდენობის, პაკეტის ზომის, სწავლის სიჩქარის, LoRA რანგისა და მონაცემთა ნაკრებების ნაზავის შესარჩევად.
დამატებითი წვრთნის მონაცემთა ნაკრებებად ავირჩიეთ VDR, ColPali train set, visrag_syn, და visrag_ind. დამატებითი წვრთნისთვის UniMax შერჩევა გამოვიყენეთ. რადგან მოდელების შერწყმა გამოვიყენეთ და შერწყმულ საბაზისო მოდელს მულტიმოდალური მოძიების უნარის ნაწილი უკვე მემკვიდრეობით ჰქონდა მიღებული, აღმოვაჩინეთ, რომ მეტი მონაცემთა ნაკრების დამატება შედეგებს ოდნავ აუარესებდა; ამიტომ მათი რაოდენობა აღარ გაგვიზრდია.
დამატებითი წვრთნისთვის შემდეგი ჰიპერპარამეტრები შევარჩიეთ:
LoRA რანგი | 32 |
LoRA ალფა | 32 |
LoRA-ს სამიზნე მოდულები | გამოსახულებისა და ტექსტის ყველა შრე, ჩაშენების გარდა |
სწავლის სიჩქარე | 5e-5 |
ვიზუალური ტოკენების მაქსიმუმი | 1280 |
წვრთნის ეპოქები | 1 |
გლობალური პაკეტის ზომა | 512 |
გახურების წილი | 5% |
ისტორიულად, „ColBERT-ის სტილის“ ტოკენის დონის ჩაშენებების მქონე მოდელები (მაგალითად, ColPali) შესანიშნავ შედეგებს იძლეოდა, თუმცა მათი შენახვის ღირებულება მეტისმეტად მაღალი იყო. თითოეული ვიზუალური ტოკენის ინდექსირება ქმნიდა უზარმაზარ ვექტორულ მონაცემთა ბაზებს, რომლებიც საწარმოო მასშტაბისთვის ზედმეტად ძვირი იყო.
ოპტიმიზაციის სტრატეგია: შენახვის პრობლემა ჩაშენებების ზომის ფრთხილად დაბალანსებით გადავჭერით, რათა მაქსიმალური ეფექტიანობა შეგვენარჩუნებინა და შენახვის ხარჯების მკვეთრი ზრდა აგვერიდებინა. ამ ეფექტიან მოცულობაში SOTA სიზუსტის შესანარჩუნებლად განზომილებად 320 შევარჩიეთ, რადგან ის მოძიების ეფექტიანობასა და შენახვის ხარჯს საუკეთესოდ აბალანსებს.
საბაზისო მიდგომა: სტანდარტულ მიდგომას (მაგალითად, NVIDIA Nemo-3B-ს) 1 მილიონი გამოსახულების ჩაშენებების შესანახად დაახლოებით 10.3 ტბ სჭირდება (1,802 ტოკენი @ 3,072 განზომილება).
ColQwen3: იმავე 1 მილიონ გამოსახულებას მხოლოდ 0.82 ტბ-ში ინახავს (მაქს. 1,280 ტოკენი @ 320 განზომილება).
ColQwen3 მოძიებაში SOTA სიზუსტეს ღრუბლოვანი ინფრასტრუქტურის ბიუჯეტის გადაჭარბების გარეშე აღწევს.
ჩვენი მიდგომა ViDoRe-ის საორიენტაციო ტესტების ნაკრებზე შევამოწმეთ. შედეგები ადასტურებს, რომ ColQwen3 უახლეს V3 და V2 საორიენტაციო ტესტებში (ინგლისურ და მრავალენოვან ვერსიებში) ახალ სტანდარტებს ამკვიდრებს, ხოლო ძველ V1 ამოცანებში უმაღლეს შედეგებს ინარჩუნებს.
ColQwen3-8B ინგლისურ და მრავალენოვან მოძიებაში ლიდერობს.
ინგლისური nDCG@5
მოდელი | კომპ. მეცნიერება | ენერგეტიკა | ფინანსები | HR | მრეწვ. | ფარმაცია | ფიზიკა | საშ. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
მრავალენოვანი nDCG@5
მოდელი | კომპ. მეცნიერება | ენერგეტიკა | ფინანსები | HR | მრეწვ. | ფარმაცია | ფიზიკა | საშ. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
სტაბილურად მაღალი შედეგები ESG-ში, ეკონომიკასა და DocVQA-ში.
საორიენტაციო ტესტი | მოდელი | ქულა (საშ.) | გამორჩეული გამარჯვება |
ViDoRe V2 (ინგლისური) | ColQwen3-8B | 0.6772 | #1 ESG-სა და BioMed-ში |
ViDoRe V2 (მრავალენოვანი) | ColQwen3-8B | 0.6085 | #1 ეკონომიკაში |
ViDoRe V1 (ინგლისური) | Nemo ColEmbed 3B | 0.9100 | ოდნავ მაღალი საშუალო მაჩვენებელი |
ViDoRe V1 (ინგლისური) | ColQwen3-8B | 0.9076 | #1 ArxivQA-სა და Syn-Gov-ში |
იმის საჩვენებლად, რომ ColQwen3 ვიდეოს მოძიებაზეც კარგად განზოგადდება, მოდელები ტექსტიდან ვიდეოს მოძიების (ზოგადი მოძიების) ამოცანებისთვის CareBench-ის საორიენტაციო ტესტზე შევაფასეთ.
ამ შეფასებისთვის ვიდეოს პირდაპირი კოდირების მიდგომა გამოვიყენეთ: ჩვენი მოდელები ვიდეოფაილებს უშუალოდ, დამატებითი ტექსტური ანოტაციებისა და მეტამონაცემების გარეშე აკოდირებდნენ. ეს წარმოაჩენს მოდელის უნარს, მოძიება მხოლოდ ვიზუალურ სემანტიკაზე დაყრდნობით შეასრულოს.
მოდელი | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3-ის ერთ-ერთი ყველაზე მნიშვნელოვანი სიახლე ისაა, რომ მას ვიდეოს დამუშავება დოკუმენტის მსგავსად შეუძლია. ბევრ საწარმოში ვიდეო „ბნელი მონაცემია“: ის ცივ საცავში ინახება და სრულიად მოუძიებელია, თუ ადამიანმა თითოეული ფაილი ხელით არ მონიშნა.
ColQwen3 ამას ცვლის და სეგმენტირებულ კლიპებში კადრების მიხედვით მოძიებას უზრუნველყოფს.
საწარმოები ყოველდღიურად ათასობით საათის შიდა ვიდეოშეხვედრებს იწერენ, თუმცა ეს ჩანაწერები, როგორც წესი, უკვალოდ იკარგება.
სამუშაო პროცესი: შეხვედრების ხანგრძლივი ჩანაწერების მოკლე, ლოგიკურ კლიპებად ავტომატურად დაყოფითა და ColQwen3-ით ინდექსირებით იქმნება ძიებადი „კორპორაციული მეხსიერება“.
მოთხოვნა: პროექტის მენეჯერს შეუძლია იკითხოს: “Show me the clip where the engineering lead explained the latency issue with the API.”
შედეგი: 60-წუთიანი ვიდეოფაილის ნაცვლად, სისტემა ზუსტად იმ 45-წამიან მონაკვეთს პოულობს, რომელშიც ეკრანზე კონკრეტული დიაგრამა აჩვენეს და განიხილეს — მაშინაც კი, თუ მომხსენებლებს იმ წამს სიტყვა „შეყოვნება“ პირდაპირ არ უხსენებიათ.
ნატიურ მულტიმოდალურ ჩაშენებებზე გადასვლა სხვადასხვა დარგში სრულიად ახალ სამუშაო პროცესებს ქმნის. ეს მოდელი საწარმოთა მონაცემების რამდენიმე ურთულეს გარემოში საფუძვლიანად შევაფასეთ.
ColQwen3 გამოვცადეთ ურბანული საკონსულტაციო კომპანიების მონაცემებზე, რომლებიც გენერალური გეგმების, ზონირების რუკებისა და რთული არქიტექტურული ფასადების უზარმაზარ ბიბლიოთეკებს მართავენ.
გამოწვევა: ასეთ გარემოში ტრადიციულ RAG კონვეიერებს უჭირთ. OCR ხელსაწყოები რთულ ტერიტორიულ გეგმებს ხშირად უბრალოდ „სქემად“ აღწერს და მხედველობიდან რჩება მნიშვნელოვანი დეტალები — მოძრაობის ნაკადები, მწვანე ზონები ან შენობების საზღვრიდან დაშორება.
ეფექტიანობა: ჩვენი შიდა საორიენტაციო ტესტები აჩვენებს, რომ ColQwen3 ძვირადღირებული OCR/აღწერების წინასწარი დამუშავების საჭიროებას ეფექტიანად აუქმებს. მაღალი სიმჭიდროვის არქიტექტურულ ნახაზებზე ჩატარებულ ტესტებში მოდელმა წარმატებით მოიძია დოკუმენტები კონკრეტული ვიზუალური ნიშნებით, მათ შორის ქვეითთა შესასვლელებითა და მკაფიო ზონირების საზღვრებით. მან მხოლოდ ტექსტზე დაფუძნებულ საბაზისო სისტემებს მნიშვნელოვნად აჯობა და ცოდნის ათვისების ხარჯების მკვეთრად შემცირების შესაძლებლობა აჩვენა.
საინვესტიციო ბანკირები და ანალიტიკოსები წლიური ანგარიშებისა და ინვესტორთა პრეზენტაციების განხილვას ათასობით საათს უთმობენ.
სამუშაო პროცესი: ანალიტიკოსს შეუძლია მოითხოვოს: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
ცვლილება: საკვანძო სიტყვების დამთხვევებზე დაყრდნობის ნაცვლად, მოდელი კონკრეტული მონაცემთა ვიზუალიზაციის არსებობით ზუსტ სლაიდს პოულობს, რაც RAG სისტემას კითხვებზე მაღალი სიზუსტით პასუხის საშუალებას აძლევს.
მწარმოებელ კომპანიებს ტექნიკური სახელმძღვანელოებისა და მილსადენების სქემების (P&ID) უზარმაზარი ბიბლიოთეკები აქვთ.
სამუშაო პროცესი: ტურბინის შემკეთებელ საველე ინჟინერს შეუძლია ნაწილს ფოტო გადაუღოს ან მოითხოვოს: “Show me the wiring diagram for the hydraulic pump assembly.”
ცვლილება: ColQwen3 გაყვანილობის სქემის ვიზუალურ გამოსახულებას ამოიცნობს და სწორ გვერდს პოულობს, რამაც უმოქმედობის პერიოდი შესაძლოა საათებით შეამციროს.
იურიდიული მოკვლევა მილიონობით დასკანერებული გვერდის განხილვას მოიცავს, სადაც საძიებელი „ნემსი“ ხშირად ვიზუალური ნიშანია.
სამუშაო პროცესი: შესაბამისობის ოფიცერს შეუძლია მოძებნოს “Documents signed by the CFO” ან “Contracts containing the official ‘Confidential’ stamp.”
ცვლილება: მოდელი ხელმოწერებისა და ბეჭდების ვიზუალური არსებობით განასხვავებს მონახაზსა და საბოლოო დოკუმენტს — დეტალს, რომელსაც მხოლოდ OCR ხშირად ვერ ამჩნევს.
ColQwen3 ღია წონების მქონეა (Apache 2.0) და უკვე ხელმისაწვდომია Hugging Face-ზე. ის შევქმენით თანამედროვე RAG კონვეიერების მარტივ განახლებად და მოჰყვება ტექსტის, გამოსახულებებისა და ვიდეოს დაუყოვნებლივ დასამუშავებლად საჭირო ინფერენსის კოდი.
საწარმოებისთვის, რომლებსაც მარტივი ტექსტური ძიების მიღმა გადასვლა და ვიზუალურ აქტივებში მოქცეული ინტელექტის გამოყენება სურთ, ეს ახალი სტანდარტია.
შემდეგი ნაბიჯი: გაეცანით მოდელის ბარათს და სცადეთ ცოცხალი დემო Hugging Face-ზე: /-colqwen3-embed-8b და /-colqwen3-embed-4b