गेल्या दोन वर्षांपासून “RAG” (पुनर्प्राप्ती-संवर्धित निर्मिती) ही संकल्पना जवळपास पूर्णपणे मजकुराशीच समानार्थी झाली आहे. प्रमाणित पद्धत सोपी आहे: दस्तऐवज घ्या, त्यातील मजकूर काढा, त्याचे तुकडे करा आणि अनुक्रमणिका तयार करा.
मात्र उद्योगांचे कामकाज साध्या मजकूर फाइलवर चालत नाही. ते गुंतागुंतीच्या PDF, माहितीने भरलेल्या आलेखांच्या स्लाइड संचांवर, CAD रेखाचित्रांवर, स्कॅन केलेल्या पावत्यांवर आणि वाढत्या प्रमाणात व्हिडिओ चित्रफितींच्या प्रचंड संग्रहांवर चालते.
एम्बेडिंग करण्यापूर्वी OCR किंवा दृश्य LLM वापरून प्रतिमेचे मजकुरी “वर्णन” तयार करण्याची उद्योगमान्य पद्धत मोठा अडथळा ठरते. ही पद्धत संथ आणि महागडी आहे; शिवाय मूळ डेटाचा समृद्ध अवकाशीय आणि दृश्य संदर्भ अपरिहार्यपणे गमावते. तुमच्या AI ने गुंतागुंतीच्या दृश्याचे वर्णन फक्त “एक आराखडा” असे केले, तर त्यातील विशिष्ट झडप किंवा विद्युतजोडणीचे रेखाचित्र शोधण्याची क्षमता तुम्ही गमावली आहे.
आज आम्ही ColPali संरचनेवर आधारित अत्याधुनिक बहुमाध्यमी एम्बेडिंग मॉडेलचे एक कुटुंब जारी करत आहोत. संपूर्ण प्रक्रियेतील दृश्य पुनर्प्राप्ती शक्य करून ही मॉडेल या समस्येचे निराकरण करण्यासाठी तयार केली आहेत.
बाजारात तयार मिळणारे दृश्य-भाषा मॉडेल (VLM) घेऊन त्याला शोध घेण्यास सांगणे एवढेच खरोखर प्रभावी बहुमाध्यमी पुनर्प्राप्ती प्रणाली तयार करण्यासाठी पुरेसे नसते. बहुमाध्यमी RAG ला आजवर रोखून धरणाऱ्या आव्हानांवर मात करून ColQwen3 तयार करण्यासाठी आम्ही मॉडेल विलिनीकरण आणि प्रशिक्षण धोरणे वापरली.
मूलभूत मॉडेलचे सुरुवातीपासून सूक्ष्म-समायोजन करण्याऐवजी, विद्यमान मजकूर एम्बेडिंग मॉडेलमधील पुनर्प्राप्ती कार्यांचे ज्ञान हस्तांतरित करण्याची पद्धत आम्ही विकसित केली. प्रमाणित VLM ला प्रतिमांचे वर्णन करता येते, पण प्रश्नाच्या तुलनेत अर्थाधारित क्रमवारी लावता येईलच असे नाही.
ही दरी भरून काढण्यासाठी आम्ही समायोजित विलीन भारांकन धोरणे वापरली. आमच्या प्रयोगांत आढळले की Qwen3-Embedding ची मजकुरी सुप्त अवकाशातील पुनर्प्राप्ती क्षमता थेट बहुमाध्यमी अवकाशात हस्तांतरित करता येते आणि तत्काळ प्रशिक्षणाशिवायही प्रतिमा व व्हिडिओ पुनर्प्राप्तीसाठी तिचे सामान्यीकरण होते. या प्रभावी प्रारंभिक मांडणीचा भक्कम सुरुवातीचा आधार म्हणून वापर करून, कामगिरी आणखी अनुकूल करण्यासाठी आणि मजबुती सुनिश्चित करण्यासाठी आम्ही मॉडेलचे सूक्ष्म-समायोजन केले. Qwen3-VL मूलभूत मॉडेलपासून सूक्ष्म-समायोजन करण्याच्या तुलनेत यामुळे अंतिम पुनर्प्राप्ती कामगिरी सुधारते.
एम्बेडिंग क्षमता हस्तांतरित झाल्यानंतर आम्ही संरेखनावर लक्ष केंद्रित केले. पुनर्प्राप्ती कामगिरी कमाल करण्यासाठी आम्ही युगांची इष्टतम संख्या, तुकडीचा आकार, शिक्षण दर, LoRA क्रम आणि डेटासंचांचे मिश्रण यांचा समावेश असलेले सखोल हायपर-पॅरामीटर शोध व घटक-विलोपन अभ्यास केले.
सूक्ष्म-समायोजन डेटासंच म्हणून आम्ही VDR, ColPali प्रशिक्षण संच, visrag_syn, आणि visrag_ind निवडले. सूक्ष्म-समायोजनासाठी आम्ही UniMax नमुना-निवड वापरली. आम्ही मॉडेल विलिनीकरण वापरल्यामुळे आणि विलीन मूलभूत मॉडेलला आधीच काही प्रमाणात बहुमाध्यमी पुनर्प्राप्ती क्षमता मिळाल्यामुळे, अधिक डेटासंच जोडल्यास कामगिरी किंचित खालावते असे आढळले. त्यामुळे आम्ही डेटासंचांची संख्या वाढवली नाही.
सूक्ष्म-समायोजनासाठी आम्ही निवडलेले हायपर-पॅरामीटर पुढीलप्रमाणे आहेत:
LoRA क्रम | 32 |
LoRA अल्फा | 32 |
LoRA लक्ष्य मॉड्यूल | एम्बेडिंग वगळता प्रतिमा आणि मजकूर या दोन्हींचे सर्व स्तर |
शिक्षण दर | 5e-5 |
कमाल दृश्य टोकन | 1280 |
प्रशिक्षण युगे | 1 |
जागतिक तुकडी आकार | 512 |
पूर्वतयारी गुणोत्तर | 5% |
आजवर “ColBERT-शैलीतील” टोकन-स्तरीय एम्बेडिंग वापरणाऱ्या मॉडेलनी (उदा. ColPali) अविश्वसनीय कामगिरी दिली, पण त्यांचा संग्रहण खर्च परवडण्यापलीकडचा होता. प्रत्येक दृश्य टोकनची अनुक्रमणिका केल्याने प्रचंड सदिश डेटाबेस तयार होत आणि उद्योगस्तरावर ते अतिशय महाग ठरत.
अनुकूलन धोरण: कमाल कामगिरी कायम ठेवतानाच संग्रहण खर्च अनियंत्रित वाढू नये म्हणून एम्बेडिंगच्या आकाराचा काळजीपूर्वक समतोल साधून आम्ही संग्रहणाचे आव्हान सोडवले. या कार्यक्षम आकारमर्यादेत अत्याधुनिक अचूकता राखण्यासाठी, पुनर्प्राप्ती कामगिरी आणि संग्रहण खर्च यांचा सर्वोत्तम समतोल साधणारा 320 हा परिमाण आकार आम्ही काळजीपूर्वक निवडला.
आधाररेषा: प्रमाणित पद्धतीला (उदा. NVIDIA Nemo-3B) 10 लाख प्रतिमांची एम्बेडिंग साठवण्यासाठी अंदाजे 10.3 TB लागतात (1,802 टोकन @ 3,072 परिमाणे).
ColQwen3: त्याच 10 लाख प्रतिमा फक्त 0.82 TB मध्ये साठवते (कमाल 1,280 टोकन @ 320 परिमाणे).
क्लाउड पायाभूत सुविधांचा खर्च अनियंत्रित न वाढवता ColQwen3 अत्याधुनिक पुनर्प्राप्ती अचूकता साध्य करते.
आम्ही ViDoRe बेंचमार्क संचावर आमच्या पद्धतीची पडताळणी केली. निकालांवरून स्पष्ट होते की ColQwen3 ने नवीनतम V3 आणि V2 बेंचमार्कमध्ये (इंग्रजी व बहुभाषिक दोन्ही) नवे मानदंड प्रस्थापित केले असून, जुन्या V1 कार्यांमध्येही सर्वोच्च दर्जाची कामगिरी कायम ठेवली आहे.
इंग्रजी आणि बहुभाषिक पुनर्प्राप्तीत ColQwen3-8B आघाडीवर आहे.
इंग्रजी nDCG@5
मॉडेल | संगणकशास्त्र | ऊर्जा | वित्त | मनुष्यबळ | उद्योग | औषधनिर्मिती | भौतिकशास्त्र | सरासरी |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
बहुभाषिक nDCG@5
मॉडेल | संगणकशास्त्र | ऊर्जा | वित्त | मनुष्यबळ | उद्योग | औषधनिर्मिती | भौतिकशास्त्र | सरासरी |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, अर्थशास्त्र आणि DocVQA मध्ये सातत्यपूर्ण उच्च कामगिरी.
बेंचमार्क | मॉडेल | गुण (सरासरी) | उल्लेखनीय आघाडी |
ViDoRe V2 (इंग्रजी) | ColQwen3-8B | 0.6772 | ESG आणि BioMed मध्ये #1 |
ViDoRe V2 (बहुभाषिक) | ColQwen3-8B | 0.6085 | अर्थशास्त्रात #1 |
ViDoRe V1 (इंग्रजी) | Nemo ColEmbed 3B | 0.9100 | किंचित अधिक सरासरी |
ViDoRe V1 (इंग्रजी) | ColQwen3-8B | 0.9076 | ArxivQA आणि Syn-Gov मध्ये #1 |
व्हिडिओ पुनर्प्राप्तीसाठी ColQwen3 चे प्रभावी सामान्यीकरण दाखवण्यासाठी, आम्ही मजकूर-ते-व्हिडिओ (सामान्य पुनर्प्राप्ती) कार्यांसाठी CareBench बेंचमार्कवर मॉडेलचे मूल्यमापन केले.
या मूल्यमापनासाठी आम्ही कच्च्या व्हिडिओच्या एन्कोडिंगची पद्धत वापरली: आमच्या मॉडेलनी कोणतीही अतिरिक्त मजकूर भाष्ये किंवा मेटाडेटा न घेता व्हिडिओ फाइल थेट एन्कोड केल्या. यातून केवळ दृश्यात्मक अर्थाच्या आधारे पुनर्प्राप्ती करण्याची मॉडेलची क्षमता दिसून येते.
मॉडेल | रिकॉल@1 | रिकॉल@5 | रिकॉल@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
व्हिडिओलाही दस्तऐवजांप्रमाणे हाताळण्याची क्षमता हा ColQwen3 मुळे शक्य झालेल्या सर्वांत मूलभूत बदलांपैकी एक आहे. अनेक उद्योगांमध्ये व्हिडिओ हा “अप्रकट डेटा” असतो. प्रत्येक फाइलला एखाद्या व्यक्तीने हाताने टॅग केल्याशिवाय तो शोधता न येणाऱ्या शीत संग्रहणात पडून राहतो.
खंडित क्लिपमध्ये प्रत्येक फ्रेमनुसार पुनर्प्राप्ती शक्य करून ColQwen3 ही परिस्थिती बदलते.
उद्योग दररोज अंतर्गत व्हिडिओ बैठकांचे हजारो तास रेकॉर्ड करतात आणि हे रेकॉर्डिंग सहसा विस्मृतीत जातात.
कार्यप्रवाह: बैठकींची दीर्घ रेकॉर्डिंग आपोआप लहान, सुसंगत क्लिपमध्ये विभागून आणि ColQwen3 च्या मदतीने त्यांची अनुक्रमणिका तयार करून, शोधता येणारी “संस्थात्मक स्मृती” निर्माण करता येते.
प्रश्न: प्रकल्प व्यवस्थापक विचारू शकतो: “अभियांत्रिकी प्रमुखाने API मधील विलंबाची समस्या समजावून सांगितलेली क्लिप दाखवा.”
निकाल: 60 मिनिटांची व्हिडिओ फाइल देण्याऐवजी, प्रणाली स्क्रीनवर तो विशिष्ट आकृतीबंध दाखवून त्यावर चर्चा केलेला नेमका 45 सेकंदांचा भाग शोधून देते; वक्त्यांनी त्या नेमक्या क्षणी “विलंब” हा शब्द स्पष्टपणे उच्चारला नसला तरीही.
मूळ बहुमाध्यमी एम्बेडिंगमुळे विविध उद्योगांमध्ये पूर्णपणे नवे कार्यप्रवाह शक्य होतात. आम्ही अत्यंत गुंतागुंतीच्या काही उद्योग डेटा वातावरणांच्या तुलनेत या मॉडेलची विस्तृत बेंचमार्क चाचणी केली आहे.
बृहद् आराखडे, क्षेत्रविभाजन नकाशे आणि गुंतागुंतीच्या वास्तुशास्त्रीय उन्नतिदृश्यांचे विशाल संग्रह सांभाळणाऱ्या नागरी सल्लागार संस्थांसमोरील डेटा आव्हानांवर आम्ही ColQwen3 ची चाचणी केली.
आव्हान: अशा वातावरणात पारंपरिक RAG प्रक्रिया अडखळतात. OCR साधने गुंतागुंतीच्या स्थळ आराखड्यांना सहसा फक्त “रेखाचित्र” असे वर्णन देतात आणि वाहतूक प्रवाह, हरित क्षेत्रे किंवा इमारतींसाठी आवश्यक मोकळ्या जागेसंबंधीचे महत्त्वाचे तपशील गमावतात.
कामगिरी: आमचे अंतर्गत बेंचमार्क दर्शवतात की ColQwen3 महागड्या OCR/वर्णननिर्मिती पूर्वप्रक्रियेची गरज प्रभावीपणे टाळते. अतिशय दाट वास्तुशास्त्रीय रेखाचित्रांच्या चाचण्यांत, पादचारी प्रवेशबिंदू किंवा विशिष्ट क्षेत्रविभाजन सीमा यांसारख्या दृश्य खुणांच्या आधारे मॉडेलने दस्तऐवज यशस्वीपणे शोधले. त्याची कामगिरी केवळ मजकूराधारित आधाररेषांपेक्षा लक्षणीयरीत्या सरस होती आणि ज्ञान अंतर्ग्रहणाचा खर्च मोठ्या प्रमाणात कमी होण्याची शक्यताही दिसली.
गुंतवणूक बँकर्स आणि विश्लेषक वार्षिक अहवाल व गुंतवणूकदारांसाठीचे स्लाइड संच तपासण्यात हजारो तास घालवतात.
कार्यप्रवाह: विश्लेषक विचारू शकतो, “2024 च्या स्लाइड संचांमधील APAC महसूल आणि EMEA महसुलाची विभागणी शोधा.”
बदल: कीवर्ड जुळणीवर अवलंबून राहण्याऐवजी, विशिष्ट डेटा दृश्यांकनाच्या दृश्य उपस्थितीवरून मॉडेल नेमकी स्लाइड शोधते. त्यामुळे RAG प्रणाली अत्यंत अचूकपणे प्रश्नांची उत्तरे देऊ शकते.
उत्पादन कंपन्यांकडे तांत्रिक मार्गदर्शिका आणि नळजोडणी आकृत्यांचे (P&IDs) विशाल संग्रह असतात.
कार्यप्रवाह: टर्बाइन दुरुस्त करणारा क्षेत्रीय अभियंता एखाद्या भागाचा फोटो काढू शकतो किंवा विचारू शकतो, “हायड्रॉलिक पंप जोडणीचे विद्युतजोडणी रेखाचित्र दाखवा.”
बदल: ColQwen3 विद्युतजोडणी रेखाचित्राचे दृश्य स्वरूप ओळखून योग्य पृष्ठ शोधते आणि त्यामुळे बंदकाळ अनेक तासांनी कमी होऊ शकतो.
कायदेशीर पुरावे शोधताना लाखो स्कॅन केलेली पाने तपासावी लागतात आणि त्यातील महत्त्वाचा “धागा” अनेकदा दृश्य खूण असतो.
कार्यप्रवाह: अनुपालन अधिकारी “मुख्य वित्त अधिकाऱ्याने स्वाक्षरी केलेले दस्तऐवज” किंवा “अधिकृत ‘गोपनीय’ शिक्का असलेले करार” शोधू शकतो.
बदल: स्वाक्षऱ्या किंवा शिक्क्यांच्या दृश्य उपस्थितीवरून मॉडेल मसुदा आणि अंतिम दस्तऐवज यांतील फरक ओळखते; केवळ OCR वापरल्यास ही बाब अनेकदा सुटते.
ColQwen3 चे भार खुले आहेत (Apache 2.0) आणि ते आता Hugging Face वर उपलब्ध आहे. आधुनिक RAG प्रक्रियांसाठी ते थेट पर्याय म्हणून वापरता यावे यासाठी आम्ही त्याची रचना केली असून, मजकूर, प्रतिमा आणि व्हिडिओंवर त्वरित प्रक्रिया करण्यासाठी आवश्यक अनुमान कोडही दिला आहे.
साध्या मजकूर शोधापलीकडे जाऊन दृश्य मालमत्तेत अडकलेली बुद्धिमत्ता खुली करण्यास सज्ज असलेल्या उद्योगांसाठी हा नवा मानदंड आहे.
पुढील पाऊल: मॉडेल कार्ड पाहा आणि Hugging Face वरील थेट प्रात्यक्षिक वापरून पाहा: /-colqwen3-embed-8b आणि /-colqwen3-embed-4b