मुख्य नेविगेशन

टेक्स्ट से आगे: वास्तविक बहुविध, आरंभ-से-अंत RAG को संभव बनाना

बहुविध एम्बेडिंग मॉडल टीमों को जटिल दस्तावेज़ों, छवियों और वीडियो से उपयोगी जानकारी सीधे खोजने में मदद करते हैं.

पिछले दो वर्षों से “RAG” (पुनर्प्राप्ति-संवर्धित निर्माण) लगभग पूरी तरह टेक्स्ट का पर्याय रहा है. मानक तरीका सरल है: दस्तावेज़ लें, उनसे टेक्स्ट निकालें, उसे खंडों में बांटें और अनुक्रमित करें.

लेकिन उद्यम जगत केवल साधारण टेक्स्ट फ़ाइलों पर नहीं चलता. यह जटिल पीडीएफ़, सघन चार्ट वाली प्रस्तुतियों, सीएडी रेखाचित्रों, स्कैन किए गए चालानों और लगातार बढ़ते विशाल वीडियो अभिलेखागार पर चलता है.

एम्बेडिंग से पहले ओसीआर या दृश्य भाषा मॉडलों से किसी छवि का टेक्स्ट में “विवरण” बनवाने का उद्योग-मानक तरीका एक बड़ी बाधा है. यह धीमा और महंगा है तथा मूल डेटा का समृद्ध स्थानिक और दृश्य संदर्भ अनिवार्य रूप से खो देता है. अगर आपका एआई किसी जटिल दृश्य को केवल “एक खाका” बताता है, तो आप उसके भीतर मौजूद किसी विशिष्ट वाल्व या तार-संयोजन आरेख को खोजने की क्षमता खो चुके हैं.

आज हम ColPali संरचना पर आधारित अत्याधुनिक बहुविध एम्बेडिंग मॉडलों का समूह जारी कर रहे हैं, जिसे आरंभ से अंत तक दृश्य पुनर्प्राप्ति संभव बनाकर इस समस्या को हल करने के लिए तैयार किया गया है.

इस कमाल के पीछे का अभियांत्रिकी कौशल: उन्नत सूक्ष्म-समायोजन रणनीतियां

वास्तव में प्रभावी बहुविध पुनर्प्राप्ति प्रणाली बनाना इतना आसान नहीं कि कोई तैयार दृश्य-भाषा मॉडल (VLM) लेकर उससे खोज करने को कह दिया जाए. बहुविध RAG को ऐतिहासिक रूप से रोकने वाली चुनौतियां हल करने और ColQwen3 बनाने के लिए हमने मॉडल विलय और प्रशिक्षण रणनीतियां अपनाईं.

1. समायोजित विलय भारांकन से एम्बेडिंग क्षमता का हस्तांतरण

आधार मॉडल को आरंभ से सूक्ष्म-समायोजित करने के बजाय, हमने मौजूदा टेक्स्ट एम्बेडिंग मॉडल से पुनर्प्राप्ति कार्यों का ज्ञान हस्तांतरित करने की विधि बनाई. एक मानक VLM छवियों का वर्णन करना जानता है, लेकिन आवश्यक नहीं कि वह किसी प्रश्न के संदर्भ में अर्थ के आधार पर उनकी श्रेणी तय करना भी जानता हो.

इस अंतर को पाटने के लिए हमने समायोजित विलय भारांकन रणनीतियां अपनाईं. हमारे प्रयोगों में पाया गया कि टेक्स्ट के अव्यक्त क्षेत्र में Qwen3-Embedding की पुनर्प्राप्ति क्षमता सीधे बहुविध क्षेत्र में हस्तांतरित की जा सकती है और तत्काल प्रशिक्षण के बिना भी छवि तथा वीडियो पुनर्प्राप्ति में सामान्यीकृत होती है. इस प्रभावी आरंभिक व्यवस्था को मजबूत प्रारंभिक बिंदु बनाकर हमने प्रदर्शन को और बेहतर तथा सुदृढ़ता सुनिश्चित करने के लिए मॉडल का सूक्ष्म-समायोजन किया. यह Qwen3-VL आधार मॉडल से सूक्ष्म-समायोजन करने की तुलना में अंतिम पुनर्प्राप्ति प्रदर्शन बेहतर करता है.

2. हाइपर-पैरामीटर का सावधानीपूर्वक समायोजन

एम्बेडिंग क्षमताएं हस्तांतरित होने के बाद हमने संरेखण पर ध्यान केंद्रित किया. पुनर्प्राप्ति प्रदर्शन अधिकतम करने के लिए हमने उपयुक्त प्रशिक्षण चक्रों की संख्या, बैच आकार, अधिगम दर, LoRA रैंक और डेटासेट मिश्रण सहित हाइपर-पैरामीटर की विस्तृत खोज और पृथक्करण अध्ययन किए.

सूक्ष्म-समायोजन के लिए हमने VDR, ColPali प्रशिक्षण समूह, visrag_syn, और visrag_ind डेटासेट चुने. सूक्ष्म-समायोजन के लिए हमने UniMax नमूनाकरण का उपयोग किया. चूंकि हमने मॉडल विलय लागू किया था और विलय किए गए आधार मॉडल को बहुविध पुनर्प्राप्ति की कुछ क्षमता पहले से मिली थी, इसलिए हमने पाया कि अधिक डेटासेट जोड़ने से प्रदर्शन वास्तव में थोड़ा घटता है. इसी कारण हमने डेटासेट की संख्या नहीं बढ़ाई.

सूक्ष्म-समायोजन के लिए हमने ये हाइपर-पैरामीटर चुने:

LoRA रैंक

32

LoRA अल्फ़ा

32

LoRA लक्ष्य मॉड्यूल

एम्बेडिंग को छोड़कर छवि और टेक्स्ट दोनों की सभी परतें

अधिगम दर

5e-5

अधिकतम दृश्य टोकन

1280

प्रशिक्षण चक्र

1

वैश्विक बैच आकार

512

तैयारी अनुपात

5%

3. “ColBERT” की दुविधा: उच्च प्रदर्शन बनाम भंडारण लागत

ऐतिहासिक रूप से “ColBERT-शैली” की टोकन-स्तरीय एम्बेडिंग इस्तेमाल करने वाले मॉडल (जैसे ColPali) शानदार प्रदर्शन देते थे, लेकिन उनकी भंडारण लागत अत्यधिक थी. हर दृश्य टोकन को अनुक्रमित करने से विशाल सदिश डेटाबेस बनते थे, जो उद्यम स्तर पर बहुत महंगे थे.

  • अनुकूलन रणनीति: हमने एम्बेडिंग का आकार सावधानी से संतुलित करके भंडारण की चुनौती हल की, ताकि अधिकतम प्रदर्शन बना रहे और भंडारण लागत अनियंत्रित न हो. इस कुशल आकार में सर्वोत्तम सटीकता बनाए रखने के लिए हमने पुनर्प्राप्ति प्रदर्शन और भंडारण लागत के सबसे संतुलित विकल्प के रूप में आयाम आकार 320 चुना.

    • आधारभूत तरीका: एक मानक तरीका (जैसे NVIDIA Nemo-3B) 10 लाख छवियों की एम्बेडिंग संग्रहीत करने के लिए लगभग 10.3 टीबी मांगता है (1,802 टोकन @ 3,072 आयाम).

    • ColQwen3: उन्हीं 10 लाख छवियों को केवल 0.82 टीबी में संग्रहीत करता है (अधिकतम 1,280 टोकन @ 320 आयाम).

ColQwen3 क्लाउड अवसंरचना का बजट बढ़ाए बिना सर्वोत्तम पुनर्प्राप्ति सटीकता हासिल करता है.

मूल्यांकन परिणाम

हमने ViDoRe बेंचमार्क समूह पर अपने दृष्टिकोण को मान्य किया. परिणाम पुष्टि करते हैं कि ColQwen3 नवीनतम V3 और V2 बेंचमार्कों (अंग्रेज़ी और बहुभाषी दोनों) पर नए मानक स्थापित करता है, साथ ही पुराने V1 कार्यों पर शीर्ष-स्तरीय प्रदर्शन बनाए रखता है.

ViDoRe v3 (नवीनतम)

ColQwen3-8B अंग्रेज़ी और बहुभाषी पुनर्प्राप्ति में अग्रणी है.

अंग्रेज़ी nDCG@5

मॉडल

कंप्यूटर विज्ञान

ऊर्जा

वित्त

मानव संसाधन

उद्योग

औषधि

भौतिकी

औसत

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

बहुभाषी nDCG@5

मॉडल

कंप्यूटर विज्ञान

ऊर्जा

वित्त

मानव संसाधन

उद्योग

औषधि

भौतिकी

औसत

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 और v1 की प्रमुख उपलब्धियां

ईएसजी, अर्थशास्त्र और DocVQA में लगातार उच्च प्रदर्शन.

बेंचमार्क

मॉडल

स्कोर (औसत)

उल्लेखनीय जीत

ViDoRe V2 (अंग्रेज़ी)

ColQwen3-8B

0.6772

ईएसजी और BioMed में #1

ViDoRe V2 (बहुभाषी)

ColQwen3-8B

0.6085

अर्थशास्त्र में #1

ViDoRe V1 (अंग्रेज़ी)

Nemo ColEmbed 3B

0.9100

थोड़ा अधिक औसत

ViDoRe V1 (अंग्रेज़ी)

ColQwen3-8B

0.9076

ArxivQA और Syn-Gov में #1

वीडियो पुनर्प्राप्ति: CareBench मूल्यांकन

यह दिखाने के लिए कि ColQwen3 वीडियो पुनर्प्राप्ति में भी प्रभावी रूप से सामान्यीकरण करता है, हमने टेक्स्ट-से-वीडियो (सामान्य पुनर्प्राप्ति) कार्यों के लिए CareBench बेंचमार्क पर मॉडलों का मूल्यांकन किया.

इस मूल्यांकन के लिए हमने कच्ची वीडियो एन्कोडिंग अपनाई: हमारे मॉडलों ने बिना किसी अतिरिक्त टेक्स्ट टिप्पणी या मेटाडेटा इनपुट के वीडियो फ़ाइलों को सीधे एन्कोड किया. यह केवल दृश्य अर्थ के आधार पर पुनर्प्राप्ति करने की मॉडल की क्षमता को रेखांकित करता है.

मॉडल

रिकॉल@1

रिकॉल@5

रिकॉल@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“अप्रयुक्त डेटा” का द्वार खोलना: वीडियो का अत्याधुनिक क्षेत्र

ColQwen3 से संभव हुए सबसे गहरे बदलावों में से एक है वीडियो को दस्तावेज़ों की तरह समझने की इसकी क्षमता. कई उद्यमों में वीडियो “अप्रयुक्त डेटा” बना रहता है. वह दीर्घकालिक भंडारण में पड़ा रहता है और तब तक खोजा नहीं जा सकता, जब तक किसी व्यक्ति ने हर फ़ाइल को स्वयं टैग न किया हो.

ColQwen3 खंडित क्लिप में फ़्रेम-दर-फ़्रेम पुनर्प्राप्ति संभव बनाकर इसे बदल देता है.

प्रमुख उपयोग: कंपनी का स्मृति भंडार

उद्यम हर दिन आंतरिक वीडियो बैठकों के हज़ारों घंटे रिकॉर्ड करते हैं और आम तौर पर ये रिकॉर्डिंग गुमनामी में खो जाती हैं.

  • कार्यप्रवाह: बैठकों की लंबी रिकॉर्डिंग को स्वचालित रूप से छोटे, तार्किक क्लिप में बांटकर और ColQwen3 से अनुक्रमित करके आप खोजने योग्य “कंपनी स्मृति” बना सकते हैं.

  • प्रश्न: परियोजना प्रबंधक पूछ सकता है: “वह क्लिप दिखाएं जिसमें अभियांत्रिकी प्रमुख ने एपीआई की विलंबता संबंधी समस्या समझाई थी.”

  • परिणाम: 60 मिनट की वीडियो फ़ाइल लौटाने के बजाय, प्रणाली ठीक वही 45 सेकंड का अंश खोजती है जिसमें संबंधित आरेख स्क्रीन पर साझा करके उस पर चर्चा की गई थी, भले ही वक्ताओं ने उस समय स्पष्ट रूप से “विलंबता” शब्द न कहा हो.

उद्यम उपयोग: उच्च-मूल्य वाली समस्याओं का समाधान

मूल बहुविध एम्बेडिंग अपनाने से विभिन्न उद्योगों में पूरी तरह नए कार्यप्रवाह संभव होते हैं. हमने कुछ सबसे जटिल उद्यम डेटा परिवेशों के मुकाबले इस मॉडल का व्यापक बेंचमार्क परीक्षण किया है.

1. बेंचमार्क की प्रमुख उपलब्धि: शहरी परामर्श और वास्तुकला

हमने ColQwen3 को शहरी परामर्श कंपनियों की डेटा चुनौतियों पर परखा, जो मास्टर प्लान, क्षेत्रीकरण मानचित्र और जटिल वास्तुशिल्प ऊर्ध्वचित्रों के विशाल संग्रह संभालती हैं.

  • चुनौती: इन परिवेशों में पारंपरिक RAG प्रक्रियाएं संघर्ष करती हैं. ओसीआर उपकरण आम तौर पर जटिल स्थल योजनाओं को केवल “योजनात्मक आरेख” बताते हैं और यातायात प्रवाह, हरित क्षेत्र या भवन की पीछे हटने की दूरी जैसे महत्वपूर्ण विवरण चूक जाते हैं.

  • प्रदर्शन: हमारे आंतरिक बेंचमार्क दिखाते हैं कि ColQwen3 महंगी ओसीआर/विवरण-निर्माण पूर्व-प्रक्रिया की आवश्यकता को प्रभावी ढंग से समाप्त करता है. सघन वास्तुशिल्प रेखाचित्रों वाले परीक्षणों में मॉडल ने पैदल यात्री प्रवेश बिंदुओं या विशिष्ट क्षेत्रीकरण सीमाओं जैसे दृश्य संकेतकों के आधार पर दस्तावेज़ सफलतापूर्वक खोजे. इसने केवल टेक्स्ट वाले आधारभूत तरीकों से कहीं बेहतर प्रदर्शन किया और ज्ञान ग्रहण की लागत में भारी कमी की संभावना दिखाई.

2. जटिल वित्तीय और बाज़ार आसूचना

निवेश बैंकर और विश्लेषक वार्षिक रिपोर्टों तथा निवेशक प्रस्तुतियों को खंगालने में हज़ारों घंटे लगाते हैं.

  • कार्यप्रवाह: विश्लेषक पूछ सकता है, “2024 की प्रस्तुतियों में एशिया-प्रशांत और यूरोप, मध्य पूर्व व अफ़्रीका के राजस्व का तुलनात्मक विवरण खोजें.”

  • बदलाव: कीवर्ड मिलान पर निर्भर रहने के बजाय, मॉडल संबंधित डेटा दृश्यांकन की मौजूदगी के आधार पर ठीक वही स्लाइड खोजता है, जिससे RAG प्रणाली प्रश्नों के अत्यंत सटीक उत्तर दे सकती है.

3. औद्योगिक विनिर्माण और क्षेत्रीय सेवा

विनिर्माण कंपनियों के पास तकनीकी पुस्तिकाओं और पाइपिंग आरेखों (P&IDs) के विशाल संग्रह होते हैं.

  • कार्यप्रवाह: टर्बाइन की मरम्मत कर रहा क्षेत्रीय अभियंता किसी पुर्ज़े की तस्वीर ले सकता है या पूछ सकता है, “हाइड्रॉलिक पंप संयोजन का तार-संयोजन आरेख दिखाएं.”

  • बदलाव: ColQwen3 तार-संयोजन आरेख के दृश्य निरूपण को पहचानकर सही पृष्ठ खोजता है, जिससे काम बंद रहने का समय कई घंटे घट सकता है.

4. विधि और अनुपालन

विधिक खोज में लाखों स्कैन किए गए पृष्ठों की समीक्षा करनी होती है, जिनमें महत्वपूर्ण सुराग अक्सर कोई दृश्य संकेतक होता है.

  • कार्यप्रवाह: अनुपालन अधिकारी “मुख्य वित्तीय अधिकारी के हस्ताक्षर वाले दस्तावेज़” या “आधिकारिक ‘गोपनीय’ मुहर वाले अनुबंध” खोज सकता है.

  • बदलाव: मॉडल हस्ताक्षर या मुहर की दृश्य मौजूदगी के आधार पर मसौदे और अंतिम दस्तावेज़ में अंतर करता है, जिसे केवल ओसीआर अक्सर नहीं पकड़ पाता.

आरंभ करें

ColQwen3 के भार खुले हैं (Apache 2.0) और यह अब Hugging Face पर उपलब्ध है. हमने इसे आधुनिक RAG प्रक्रियाओं में सीधे लगाए जा सकने वाले उन्नयन के रूप में तैयार किया है और टेक्स्ट, छवियों तथा वीडियो को तुरंत संसाधित करने के लिए आवश्यक अनुमान कोड दिया है.

जो उद्यम साधारण टेक्स्ट खोज से आगे बढ़कर अपनी दृश्य परिसंपत्तियों में बंद इंटेलिजेंस का उपयोग करना चाहते हैं, उनके लिए यह नया मानक है.

अगला कदम: मॉडल कार्ड देखें और Hugging Face पर प्रत्यक्ष प्रदर्शन आज़माएं: /-colqwen3-embed-8b और /-colqwen3-embed-4b

लेखक

Xin Huang और Kye Min Tan