पिछले दो वर्षों से “RAG” (पुनर्प्राप्ति-संवर्धित निर्माण) लगभग पूरी तरह टेक्स्ट का पर्याय रहा है. मानक तरीका सरल है: दस्तावेज़ लें, उनसे टेक्स्ट निकालें, उसे खंडों में बांटें और अनुक्रमित करें.
लेकिन उद्यम जगत केवल साधारण टेक्स्ट फ़ाइलों पर नहीं चलता. यह जटिल पीडीएफ़, सघन चार्ट वाली प्रस्तुतियों, सीएडी रेखाचित्रों, स्कैन किए गए चालानों और लगातार बढ़ते विशाल वीडियो अभिलेखागार पर चलता है.
एम्बेडिंग से पहले ओसीआर या दृश्य भाषा मॉडलों से किसी छवि का टेक्स्ट में “विवरण” बनवाने का उद्योग-मानक तरीका एक बड़ी बाधा है. यह धीमा और महंगा है तथा मूल डेटा का समृद्ध स्थानिक और दृश्य संदर्भ अनिवार्य रूप से खो देता है. अगर आपका एआई किसी जटिल दृश्य को केवल “एक खाका” बताता है, तो आप उसके भीतर मौजूद किसी विशिष्ट वाल्व या तार-संयोजन आरेख को खोजने की क्षमता खो चुके हैं.
आज हम ColPali संरचना पर आधारित अत्याधुनिक बहुविध एम्बेडिंग मॉडलों का समूह जारी कर रहे हैं, जिसे आरंभ से अंत तक दृश्य पुनर्प्राप्ति संभव बनाकर इस समस्या को हल करने के लिए तैयार किया गया है.
वास्तव में प्रभावी बहुविध पुनर्प्राप्ति प्रणाली बनाना इतना आसान नहीं कि कोई तैयार दृश्य-भाषा मॉडल (VLM) लेकर उससे खोज करने को कह दिया जाए. बहुविध RAG को ऐतिहासिक रूप से रोकने वाली चुनौतियां हल करने और ColQwen3 बनाने के लिए हमने मॉडल विलय और प्रशिक्षण रणनीतियां अपनाईं.
आधार मॉडल को आरंभ से सूक्ष्म-समायोजित करने के बजाय, हमने मौजूदा टेक्स्ट एम्बेडिंग मॉडल से पुनर्प्राप्ति कार्यों का ज्ञान हस्तांतरित करने की विधि बनाई. एक मानक VLM छवियों का वर्णन करना जानता है, लेकिन आवश्यक नहीं कि वह किसी प्रश्न के संदर्भ में अर्थ के आधार पर उनकी श्रेणी तय करना भी जानता हो.
इस अंतर को पाटने के लिए हमने समायोजित विलय भारांकन रणनीतियां अपनाईं. हमारे प्रयोगों में पाया गया कि टेक्स्ट के अव्यक्त क्षेत्र में Qwen3-Embedding की पुनर्प्राप्ति क्षमता सीधे बहुविध क्षेत्र में हस्तांतरित की जा सकती है और तत्काल प्रशिक्षण के बिना भी छवि तथा वीडियो पुनर्प्राप्ति में सामान्यीकृत होती है. इस प्रभावी आरंभिक व्यवस्था को मजबूत प्रारंभिक बिंदु बनाकर हमने प्रदर्शन को और बेहतर तथा सुदृढ़ता सुनिश्चित करने के लिए मॉडल का सूक्ष्म-समायोजन किया. यह Qwen3-VL आधार मॉडल से सूक्ष्म-समायोजन करने की तुलना में अंतिम पुनर्प्राप्ति प्रदर्शन बेहतर करता है.
एम्बेडिंग क्षमताएं हस्तांतरित होने के बाद हमने संरेखण पर ध्यान केंद्रित किया. पुनर्प्राप्ति प्रदर्शन अधिकतम करने के लिए हमने उपयुक्त प्रशिक्षण चक्रों की संख्या, बैच आकार, अधिगम दर, LoRA रैंक और डेटासेट मिश्रण सहित हाइपर-पैरामीटर की विस्तृत खोज और पृथक्करण अध्ययन किए.
सूक्ष्म-समायोजन के लिए हमने VDR, ColPali प्रशिक्षण समूह, visrag_syn, और visrag_ind डेटासेट चुने. सूक्ष्म-समायोजन के लिए हमने UniMax नमूनाकरण का उपयोग किया. चूंकि हमने मॉडल विलय लागू किया था और विलय किए गए आधार मॉडल को बहुविध पुनर्प्राप्ति की कुछ क्षमता पहले से मिली थी, इसलिए हमने पाया कि अधिक डेटासेट जोड़ने से प्रदर्शन वास्तव में थोड़ा घटता है. इसी कारण हमने डेटासेट की संख्या नहीं बढ़ाई.
सूक्ष्म-समायोजन के लिए हमने ये हाइपर-पैरामीटर चुने:
LoRA रैंक | 32 |
LoRA अल्फ़ा | 32 |
LoRA लक्ष्य मॉड्यूल | एम्बेडिंग को छोड़कर छवि और टेक्स्ट दोनों की सभी परतें |
अधिगम दर | 5e-5 |
अधिकतम दृश्य टोकन | 1280 |
प्रशिक्षण चक्र | 1 |
वैश्विक बैच आकार | 512 |
तैयारी अनुपात | 5% |
ऐतिहासिक रूप से “ColBERT-शैली” की टोकन-स्तरीय एम्बेडिंग इस्तेमाल करने वाले मॉडल (जैसे ColPali) शानदार प्रदर्शन देते थे, लेकिन उनकी भंडारण लागत अत्यधिक थी. हर दृश्य टोकन को अनुक्रमित करने से विशाल सदिश डेटाबेस बनते थे, जो उद्यम स्तर पर बहुत महंगे थे.
अनुकूलन रणनीति: हमने एम्बेडिंग का आकार सावधानी से संतुलित करके भंडारण की चुनौती हल की, ताकि अधिकतम प्रदर्शन बना रहे और भंडारण लागत अनियंत्रित न हो. इस कुशल आकार में सर्वोत्तम सटीकता बनाए रखने के लिए हमने पुनर्प्राप्ति प्रदर्शन और भंडारण लागत के सबसे संतुलित विकल्प के रूप में आयाम आकार 320 चुना.
आधारभूत तरीका: एक मानक तरीका (जैसे NVIDIA Nemo-3B) 10 लाख छवियों की एम्बेडिंग संग्रहीत करने के लिए लगभग 10.3 टीबी मांगता है (1,802 टोकन @ 3,072 आयाम).
ColQwen3: उन्हीं 10 लाख छवियों को केवल 0.82 टीबी में संग्रहीत करता है (अधिकतम 1,280 टोकन @ 320 आयाम).
ColQwen3 क्लाउड अवसंरचना का बजट बढ़ाए बिना सर्वोत्तम पुनर्प्राप्ति सटीकता हासिल करता है.
हमने ViDoRe बेंचमार्क समूह पर अपने दृष्टिकोण को मान्य किया. परिणाम पुष्टि करते हैं कि ColQwen3 नवीनतम V3 और V2 बेंचमार्कों (अंग्रेज़ी और बहुभाषी दोनों) पर नए मानक स्थापित करता है, साथ ही पुराने V1 कार्यों पर शीर्ष-स्तरीय प्रदर्शन बनाए रखता है.
ColQwen3-8B अंग्रेज़ी और बहुभाषी पुनर्प्राप्ति में अग्रणी है.
अंग्रेज़ी nDCG@5
मॉडल | कंप्यूटर विज्ञान | ऊर्जा | वित्त | मानव संसाधन | उद्योग | औषधि | भौतिकी | औसत |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
बहुभाषी nDCG@5
मॉडल | कंप्यूटर विज्ञान | ऊर्जा | वित्त | मानव संसाधन | उद्योग | औषधि | भौतिकी | औसत |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ईएसजी, अर्थशास्त्र और DocVQA में लगातार उच्च प्रदर्शन.
बेंचमार्क | मॉडल | स्कोर (औसत) | उल्लेखनीय जीत |
ViDoRe V2 (अंग्रेज़ी) | ColQwen3-8B | 0.6772 | ईएसजी और BioMed में #1 |
ViDoRe V2 (बहुभाषी) | ColQwen3-8B | 0.6085 | अर्थशास्त्र में #1 |
ViDoRe V1 (अंग्रेज़ी) | Nemo ColEmbed 3B | 0.9100 | थोड़ा अधिक औसत |
ViDoRe V1 (अंग्रेज़ी) | ColQwen3-8B | 0.9076 | ArxivQA और Syn-Gov में #1 |
यह दिखाने के लिए कि ColQwen3 वीडियो पुनर्प्राप्ति में भी प्रभावी रूप से सामान्यीकरण करता है, हमने टेक्स्ट-से-वीडियो (सामान्य पुनर्प्राप्ति) कार्यों के लिए CareBench बेंचमार्क पर मॉडलों का मूल्यांकन किया.
इस मूल्यांकन के लिए हमने कच्ची वीडियो एन्कोडिंग अपनाई: हमारे मॉडलों ने बिना किसी अतिरिक्त टेक्स्ट टिप्पणी या मेटाडेटा इनपुट के वीडियो फ़ाइलों को सीधे एन्कोड किया. यह केवल दृश्य अर्थ के आधार पर पुनर्प्राप्ति करने की मॉडल की क्षमता को रेखांकित करता है.
मॉडल | रिकॉल@1 | रिकॉल@5 | रिकॉल@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 से संभव हुए सबसे गहरे बदलावों में से एक है वीडियो को दस्तावेज़ों की तरह समझने की इसकी क्षमता. कई उद्यमों में वीडियो “अप्रयुक्त डेटा” बना रहता है. वह दीर्घकालिक भंडारण में पड़ा रहता है और तब तक खोजा नहीं जा सकता, जब तक किसी व्यक्ति ने हर फ़ाइल को स्वयं टैग न किया हो.
ColQwen3 खंडित क्लिप में फ़्रेम-दर-फ़्रेम पुनर्प्राप्ति संभव बनाकर इसे बदल देता है.
उद्यम हर दिन आंतरिक वीडियो बैठकों के हज़ारों घंटे रिकॉर्ड करते हैं और आम तौर पर ये रिकॉर्डिंग गुमनामी में खो जाती हैं.
कार्यप्रवाह: बैठकों की लंबी रिकॉर्डिंग को स्वचालित रूप से छोटे, तार्किक क्लिप में बांटकर और ColQwen3 से अनुक्रमित करके आप खोजने योग्य “कंपनी स्मृति” बना सकते हैं.
प्रश्न: परियोजना प्रबंधक पूछ सकता है: “वह क्लिप दिखाएं जिसमें अभियांत्रिकी प्रमुख ने एपीआई की विलंबता संबंधी समस्या समझाई थी.”
परिणाम: 60 मिनट की वीडियो फ़ाइल लौटाने के बजाय, प्रणाली ठीक वही 45 सेकंड का अंश खोजती है जिसमें संबंधित आरेख स्क्रीन पर साझा करके उस पर चर्चा की गई थी, भले ही वक्ताओं ने उस समय स्पष्ट रूप से “विलंबता” शब्द न कहा हो.
मूल बहुविध एम्बेडिंग अपनाने से विभिन्न उद्योगों में पूरी तरह नए कार्यप्रवाह संभव होते हैं. हमने कुछ सबसे जटिल उद्यम डेटा परिवेशों के मुकाबले इस मॉडल का व्यापक बेंचमार्क परीक्षण किया है.
हमने ColQwen3 को शहरी परामर्श कंपनियों की डेटा चुनौतियों पर परखा, जो मास्टर प्लान, क्षेत्रीकरण मानचित्र और जटिल वास्तुशिल्प ऊर्ध्वचित्रों के विशाल संग्रह संभालती हैं.
चुनौती: इन परिवेशों में पारंपरिक RAG प्रक्रियाएं संघर्ष करती हैं. ओसीआर उपकरण आम तौर पर जटिल स्थल योजनाओं को केवल “योजनात्मक आरेख” बताते हैं और यातायात प्रवाह, हरित क्षेत्र या भवन की पीछे हटने की दूरी जैसे महत्वपूर्ण विवरण चूक जाते हैं.
प्रदर्शन: हमारे आंतरिक बेंचमार्क दिखाते हैं कि ColQwen3 महंगी ओसीआर/विवरण-निर्माण पूर्व-प्रक्रिया की आवश्यकता को प्रभावी ढंग से समाप्त करता है. सघन वास्तुशिल्प रेखाचित्रों वाले परीक्षणों में मॉडल ने पैदल यात्री प्रवेश बिंदुओं या विशिष्ट क्षेत्रीकरण सीमाओं जैसे दृश्य संकेतकों के आधार पर दस्तावेज़ सफलतापूर्वक खोजे. इसने केवल टेक्स्ट वाले आधारभूत तरीकों से कहीं बेहतर प्रदर्शन किया और ज्ञान ग्रहण की लागत में भारी कमी की संभावना दिखाई.
निवेश बैंकर और विश्लेषक वार्षिक रिपोर्टों तथा निवेशक प्रस्तुतियों को खंगालने में हज़ारों घंटे लगाते हैं.
कार्यप्रवाह: विश्लेषक पूछ सकता है, “2024 की प्रस्तुतियों में एशिया-प्रशांत और यूरोप, मध्य पूर्व व अफ़्रीका के राजस्व का तुलनात्मक विवरण खोजें.”
बदलाव: कीवर्ड मिलान पर निर्भर रहने के बजाय, मॉडल संबंधित डेटा दृश्यांकन की मौजूदगी के आधार पर ठीक वही स्लाइड खोजता है, जिससे RAG प्रणाली प्रश्नों के अत्यंत सटीक उत्तर दे सकती है.
विनिर्माण कंपनियों के पास तकनीकी पुस्तिकाओं और पाइपिंग आरेखों (P&IDs) के विशाल संग्रह होते हैं.
कार्यप्रवाह: टर्बाइन की मरम्मत कर रहा क्षेत्रीय अभियंता किसी पुर्ज़े की तस्वीर ले सकता है या पूछ सकता है, “हाइड्रॉलिक पंप संयोजन का तार-संयोजन आरेख दिखाएं.”
बदलाव: ColQwen3 तार-संयोजन आरेख के दृश्य निरूपण को पहचानकर सही पृष्ठ खोजता है, जिससे काम बंद रहने का समय कई घंटे घट सकता है.
विधिक खोज में लाखों स्कैन किए गए पृष्ठों की समीक्षा करनी होती है, जिनमें महत्वपूर्ण सुराग अक्सर कोई दृश्य संकेतक होता है.
कार्यप्रवाह: अनुपालन अधिकारी “मुख्य वित्तीय अधिकारी के हस्ताक्षर वाले दस्तावेज़” या “आधिकारिक ‘गोपनीय’ मुहर वाले अनुबंध” खोज सकता है.
बदलाव: मॉडल हस्ताक्षर या मुहर की दृश्य मौजूदगी के आधार पर मसौदे और अंतिम दस्तावेज़ में अंतर करता है, जिसे केवल ओसीआर अक्सर नहीं पकड़ पाता.
ColQwen3 के भार खुले हैं (Apache 2.0) और यह अब Hugging Face पर उपलब्ध है. हमने इसे आधुनिक RAG प्रक्रियाओं में सीधे लगाए जा सकने वाले उन्नयन के रूप में तैयार किया है और टेक्स्ट, छवियों तथा वीडियो को तुरंत संसाधित करने के लिए आवश्यक अनुमान कोड दिया है.
जो उद्यम साधारण टेक्स्ट खोज से आगे बढ़कर अपनी दृश्य परिसंपत्तियों में बंद इंटेलिजेंस का उपयोग करना चाहते हैं, उनके लिए यह नया मानक है.
अगला कदम: मॉडल कार्ड देखें और Hugging Face पर प्रत्यक्ष प्रदर्शन आज़माएं: /-colqwen3-embed-8b और /-colqwen3-embed-4b