मुख्य नेव्हिगेशन

मजकुरापलीकडे: खऱ्या बहुमाध्यमी, संपूर्ण प्रक्रियेतील RAG ला मुक्त करणे

बहुमाध्यमी एम्बेडिंग मॉडेलमुळे संघांना गुंतागुंतीचे दस्तऐवज, प्रतिमा आणि व्हिडिओंमधून उपयुक्त माहिती थेट शोधता येते.

गेल्या दोन वर्षांपासून “RAG” (पुनर्प्राप्ती-संवर्धित निर्मिती) ही संकल्पना जवळपास पूर्णपणे मजकुराशीच समानार्थी झाली आहे. प्रमाणित पद्धत सोपी आहे: दस्तऐवज घ्या, त्यातील मजकूर काढा, त्याचे तुकडे करा आणि अनुक्रमणिका तयार करा.

मात्र उद्योगांचे कामकाज साध्या मजकूर फाइलवर चालत नाही. ते गुंतागुंतीच्या PDF, माहितीने भरलेल्या आलेखांच्या स्लाइड संचांवर, CAD रेखाचित्रांवर, स्कॅन केलेल्या पावत्यांवर आणि वाढत्या प्रमाणात व्हिडिओ चित्रफितींच्या प्रचंड संग्रहांवर चालते.

एम्बेडिंग करण्यापूर्वी OCR किंवा दृश्य LLM वापरून प्रतिमेचे मजकुरी “वर्णन” तयार करण्याची उद्योगमान्य पद्धत मोठा अडथळा ठरते. ही पद्धत संथ आणि महागडी आहे; शिवाय मूळ डेटाचा समृद्ध अवकाशीय आणि दृश्य संदर्भ अपरिहार्यपणे गमावते. तुमच्या AI ने गुंतागुंतीच्या दृश्याचे वर्णन फक्त “एक आराखडा” असे केले, तर त्यातील विशिष्ट झडप किंवा विद्युतजोडणीचे रेखाचित्र शोधण्याची क्षमता तुम्ही गमावली आहे.

आज आम्ही ColPali संरचनेवर आधारित अत्याधुनिक बहुमाध्यमी एम्बेडिंग मॉडेलचे एक कुटुंब जारी करत आहोत. संपूर्ण प्रक्रियेतील दृश्य पुनर्प्राप्ती शक्य करून ही मॉडेल या समस्येचे निराकरण करण्यासाठी तयार केली आहेत.

जादूमागील अभियांत्रिकी: प्रगत सूक्ष्म-समायोजन धोरणे

बाजारात तयार मिळणारे दृश्य-भाषा मॉडेल (VLM) घेऊन त्याला शोध घेण्यास सांगणे एवढेच खरोखर प्रभावी बहुमाध्यमी पुनर्प्राप्ती प्रणाली तयार करण्यासाठी पुरेसे नसते. बहुमाध्यमी RAG ला आजवर रोखून धरणाऱ्या आव्हानांवर मात करून ColQwen3 तयार करण्यासाठी आम्ही मॉडेल विलिनीकरण आणि प्रशिक्षण धोरणे वापरली.

1. समायोजित विलीन भारांकनाद्वारे एम्बेडिंग क्षमता हस्तांतरित करणे

मूलभूत मॉडेलचे सुरुवातीपासून सूक्ष्म-समायोजन करण्याऐवजी, विद्यमान मजकूर एम्बेडिंग मॉडेलमधील पुनर्प्राप्ती कार्यांचे ज्ञान हस्तांतरित करण्याची पद्धत आम्ही विकसित केली. प्रमाणित VLM ला प्रतिमांचे वर्णन करता येते, पण प्रश्नाच्या तुलनेत अर्थाधारित क्रमवारी लावता येईलच असे नाही.

ही दरी भरून काढण्यासाठी आम्ही समायोजित विलीन भारांकन धोरणे वापरली. आमच्या प्रयोगांत आढळले की Qwen3-Embedding ची मजकुरी सुप्त अवकाशातील पुनर्प्राप्ती क्षमता थेट बहुमाध्यमी अवकाशात हस्तांतरित करता येते आणि तत्काळ प्रशिक्षणाशिवायही प्रतिमा व व्हिडिओ पुनर्प्राप्तीसाठी तिचे सामान्यीकरण होते. या प्रभावी प्रारंभिक मांडणीचा भक्कम सुरुवातीचा आधार म्हणून वापर करून, कामगिरी आणखी अनुकूल करण्यासाठी आणि मजबुती सुनिश्चित करण्यासाठी आम्ही मॉडेलचे सूक्ष्म-समायोजन केले. Qwen3-VL मूलभूत मॉडेलपासून सूक्ष्म-समायोजन करण्याच्या तुलनेत यामुळे अंतिम पुनर्प्राप्ती कामगिरी सुधारते.

2. हायपर-पॅरामीटरचे काळजीपूर्वक समायोजन

एम्बेडिंग क्षमता हस्तांतरित झाल्यानंतर आम्ही संरेखनावर लक्ष केंद्रित केले. पुनर्प्राप्ती कामगिरी कमाल करण्यासाठी आम्ही युगांची इष्टतम संख्या, तुकडीचा आकार, शिक्षण दर, LoRA क्रम आणि डेटासंचांचे मिश्रण यांचा समावेश असलेले सखोल हायपर-पॅरामीटर शोध व घटक-विलोपन अभ्यास केले.

सूक्ष्म-समायोजन डेटासंच म्हणून आम्ही VDR, ColPali प्रशिक्षण संच, visrag_syn, आणि visrag_ind निवडले. सूक्ष्म-समायोजनासाठी आम्ही UniMax नमुना-निवड वापरली. आम्ही मॉडेल विलिनीकरण वापरल्यामुळे आणि विलीन मूलभूत मॉडेलला आधीच काही प्रमाणात बहुमाध्यमी पुनर्प्राप्ती क्षमता मिळाल्यामुळे, अधिक डेटासंच जोडल्यास कामगिरी किंचित खालावते असे आढळले. त्यामुळे आम्ही डेटासंचांची संख्या वाढवली नाही.

सूक्ष्म-समायोजनासाठी आम्ही निवडलेले हायपर-पॅरामीटर पुढीलप्रमाणे आहेत:

LoRA क्रम

32

LoRA अल्फा

32

LoRA लक्ष्य मॉड्यूल

एम्बेडिंग वगळता प्रतिमा आणि मजकूर या दोन्हींचे सर्व स्तर

शिक्षण दर

5e-5

कमाल दृश्य टोकन

1280

प्रशिक्षण युगे

1

जागतिक तुकडी आकार

512

पूर्वतयारी गुणोत्तर

5%

3. “ColBERT” पेच: उच्च कामगिरी विरुद्ध संग्रहण खर्च

आजवर “ColBERT-शैलीतील” टोकन-स्तरीय एम्बेडिंग वापरणाऱ्या मॉडेलनी (उदा. ColPali) अविश्वसनीय कामगिरी दिली, पण त्यांचा संग्रहण खर्च परवडण्यापलीकडचा होता. प्रत्येक दृश्य टोकनची अनुक्रमणिका केल्याने प्रचंड सदिश डेटाबेस तयार होत आणि उद्योगस्तरावर ते अतिशय महाग ठरत.

  • अनुकूलन धोरण: कमाल कामगिरी कायम ठेवतानाच संग्रहण खर्च अनियंत्रित वाढू नये म्हणून एम्बेडिंगच्या आकाराचा काळजीपूर्वक समतोल साधून आम्ही संग्रहणाचे आव्हान सोडवले. या कार्यक्षम आकारमर्यादेत अत्याधुनिक अचूकता राखण्यासाठी, पुनर्प्राप्ती कामगिरी आणि संग्रहण खर्च यांचा सर्वोत्तम समतोल साधणारा 320 हा परिमाण आकार आम्ही काळजीपूर्वक निवडला.

    • आधाररेषा: प्रमाणित पद्धतीला (उदा. NVIDIA Nemo-3B) 10 लाख प्रतिमांची एम्बेडिंग साठवण्यासाठी अंदाजे 10.3 TB लागतात (1,802 टोकन @ 3,072 परिमाणे).

    • ColQwen3: त्याच 10 लाख प्रतिमा फक्त 0.82 TB मध्ये साठवते (कमाल 1,280 टोकन @ 320 परिमाणे).

क्लाउड पायाभूत सुविधांचा खर्च अनियंत्रित न वाढवता ColQwen3 अत्याधुनिक पुनर्प्राप्ती अचूकता साध्य करते.

मूल्यमापनाचे निकाल

आम्ही ViDoRe बेंचमार्क संचावर आमच्या पद्धतीची पडताळणी केली. निकालांवरून स्पष्ट होते की ColQwen3 ने नवीनतम V3 आणि V2 बेंचमार्कमध्ये (इंग्रजी व बहुभाषिक दोन्ही) नवे मानदंड प्रस्थापित केले असून, जुन्या V1 कार्यांमध्येही सर्वोच्च दर्जाची कामगिरी कायम ठेवली आहे.

ViDoRe v3 (नवीनतम)

इंग्रजी आणि बहुभाषिक पुनर्प्राप्तीत ColQwen3-8B आघाडीवर आहे.

इंग्रजी nDCG@5

मॉडेल

संगणकशास्त्र

ऊर्जा

वित्त

मनुष्यबळ

उद्योग

औषधनिर्मिती

भौतिकशास्त्र

सरासरी

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

बहुभाषिक nDCG@5

मॉडेल

संगणकशास्त्र

ऊर्जा

वित्त

मनुष्यबळ

उद्योग

औषधनिर्मिती

भौतिकशास्त्र

सरासरी

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 आणि v1 मधील ठळक बाबी

ESG, अर्थशास्त्र आणि DocVQA मध्ये सातत्यपूर्ण उच्च कामगिरी.

बेंचमार्क

मॉडेल

गुण (सरासरी)

उल्लेखनीय आघाडी

ViDoRe V2 (इंग्रजी)

ColQwen3-8B

0.6772

ESG आणि BioMed मध्ये #1

ViDoRe V2 (बहुभाषिक)

ColQwen3-8B

0.6085

अर्थशास्त्रात #1

ViDoRe V1 (इंग्रजी)

Nemo ColEmbed 3B

0.9100

किंचित अधिक सरासरी

ViDoRe V1 (इंग्रजी)

ColQwen3-8B

0.9076

ArxivQA आणि Syn-Gov मध्ये #1

व्हिडिओ पुनर्प्राप्ती: CareBench मूल्यमापन

व्हिडिओ पुनर्प्राप्तीसाठी ColQwen3 चे प्रभावी सामान्यीकरण दाखवण्यासाठी, आम्ही मजकूर-ते-व्हिडिओ (सामान्य पुनर्प्राप्ती) कार्यांसाठी CareBench बेंचमार्कवर मॉडेलचे मूल्यमापन केले.

या मूल्यमापनासाठी आम्ही कच्च्या व्हिडिओच्या एन्कोडिंगची पद्धत वापरली: आमच्या मॉडेलनी कोणतीही अतिरिक्त मजकूर भाष्ये किंवा मेटाडेटा न घेता व्हिडिओ फाइल थेट एन्कोड केल्या. यातून केवळ दृश्यात्मक अर्थाच्या आधारे पुनर्प्राप्ती करण्याची मॉडेलची क्षमता दिसून येते.

मॉडेल

रिकॉल@1

रिकॉल@5

रिकॉल@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“अप्रकट डेटा” खुला करणे: व्हिडिओची अत्याधुनिक सीमा

व्हिडिओलाही दस्तऐवजांप्रमाणे हाताळण्याची क्षमता हा ColQwen3 मुळे शक्य झालेल्या सर्वांत मूलभूत बदलांपैकी एक आहे. अनेक उद्योगांमध्ये व्हिडिओ हा “अप्रकट डेटा” असतो. प्रत्येक फाइलला एखाद्या व्यक्तीने हाताने टॅग केल्याशिवाय तो शोधता न येणाऱ्या शीत संग्रहणात पडून राहतो.

खंडित क्लिपमध्ये प्रत्येक फ्रेमनुसार पुनर्प्राप्ती शक्य करून ColQwen3 ही परिस्थिती बदलते.

उपयोगाचे उदाहरण: संस्थेची स्मृतीभांडार प्रणाली

उद्योग दररोज अंतर्गत व्हिडिओ बैठकांचे हजारो तास रेकॉर्ड करतात आणि हे रेकॉर्डिंग सहसा विस्मृतीत जातात.

  • कार्यप्रवाह: बैठकींची दीर्घ रेकॉर्डिंग आपोआप लहान, सुसंगत क्लिपमध्ये विभागून आणि ColQwen3 च्या मदतीने त्यांची अनुक्रमणिका तयार करून, शोधता येणारी “संस्थात्मक स्मृती” निर्माण करता येते.

  • प्रश्न: प्रकल्प व्यवस्थापक विचारू शकतो: “अभियांत्रिकी प्रमुखाने API मधील विलंबाची समस्या समजावून सांगितलेली क्लिप दाखवा.”

  • निकाल: 60 मिनिटांची व्हिडिओ फाइल देण्याऐवजी, प्रणाली स्क्रीनवर तो विशिष्ट आकृतीबंध दाखवून त्यावर चर्चा केलेला नेमका 45 सेकंदांचा भाग शोधून देते; वक्त्यांनी त्या नेमक्या क्षणी “विलंब” हा शब्द स्पष्टपणे उच्चारला नसला तरीही.

उद्योगांसाठी उपयोग: उच्च-मूल्य समस्या सोडवणे

मूळ बहुमाध्यमी एम्बेडिंगमुळे विविध उद्योगांमध्ये पूर्णपणे नवे कार्यप्रवाह शक्य होतात. आम्ही अत्यंत गुंतागुंतीच्या काही उद्योग डेटा वातावरणांच्या तुलनेत या मॉडेलची विस्तृत बेंचमार्क चाचणी केली आहे.

1. बेंचमार्कमधील ठळक बाब: नागरी सल्लामसलत आणि वास्तुकला

बृहद् आराखडे, क्षेत्रविभाजन नकाशे आणि गुंतागुंतीच्या वास्तुशास्त्रीय उन्नतिदृश्यांचे विशाल संग्रह सांभाळणाऱ्या नागरी सल्लागार संस्थांसमोरील डेटा आव्हानांवर आम्ही ColQwen3 ची चाचणी केली.

  • आव्हान: अशा वातावरणात पारंपरिक RAG प्रक्रिया अडखळतात. OCR साधने गुंतागुंतीच्या स्थळ आराखड्यांना सहसा फक्त “रेखाचित्र” असे वर्णन देतात आणि वाहतूक प्रवाह, हरित क्षेत्रे किंवा इमारतींसाठी आवश्यक मोकळ्या जागेसंबंधीचे महत्त्वाचे तपशील गमावतात.

  • कामगिरी: आमचे अंतर्गत बेंचमार्क दर्शवतात की ColQwen3 महागड्या OCR/वर्णननिर्मिती पूर्वप्रक्रियेची गरज प्रभावीपणे टाळते. अतिशय दाट वास्तुशास्त्रीय रेखाचित्रांच्या चाचण्यांत, पादचारी प्रवेशबिंदू किंवा विशिष्ट क्षेत्रविभाजन सीमा यांसारख्या दृश्य खुणांच्या आधारे मॉडेलने दस्तऐवज यशस्वीपणे शोधले. त्याची कामगिरी केवळ मजकूराधारित आधाररेषांपेक्षा लक्षणीयरीत्या सरस होती आणि ज्ञान अंतर्ग्रहणाचा खर्च मोठ्या प्रमाणात कमी होण्याची शक्यताही दिसली.

2. गुंतागुंतीची वित्तीय आणि बाजार बुद्धिमत्ता

गुंतवणूक बँकर्स आणि विश्लेषक वार्षिक अहवाल व गुंतवणूकदारांसाठीचे स्लाइड संच तपासण्यात हजारो तास घालवतात.

  • कार्यप्रवाह: विश्लेषक विचारू शकतो, “2024 च्या स्लाइड संचांमधील APAC महसूल आणि EMEA महसुलाची विभागणी शोधा.”

  • बदल: कीवर्ड जुळणीवर अवलंबून राहण्याऐवजी, विशिष्ट डेटा दृश्यांकनाच्या दृश्य उपस्थितीवरून मॉडेल नेमकी स्लाइड शोधते. त्यामुळे RAG प्रणाली अत्यंत अचूकपणे प्रश्नांची उत्तरे देऊ शकते.

3. औद्योगिक उत्पादन आणि क्षेत्रीय सेवा

उत्पादन कंपन्यांकडे तांत्रिक मार्गदर्शिका आणि नळजोडणी आकृत्यांचे (P&IDs) विशाल संग्रह असतात.

  • कार्यप्रवाह: टर्बाइन दुरुस्त करणारा क्षेत्रीय अभियंता एखाद्या भागाचा फोटो काढू शकतो किंवा विचारू शकतो, “हायड्रॉलिक पंप जोडणीचे विद्युतजोडणी रेखाचित्र दाखवा.”

  • बदल: ColQwen3 विद्युतजोडणी रेखाचित्राचे दृश्य स्वरूप ओळखून योग्य पृष्ठ शोधते आणि त्यामुळे बंदकाळ अनेक तासांनी कमी होऊ शकतो.

4. कायदा आणि अनुपालन

कायदेशीर पुरावे शोधताना लाखो स्कॅन केलेली पाने तपासावी लागतात आणि त्यातील महत्त्वाचा “धागा” अनेकदा दृश्य खूण असतो.

  • कार्यप्रवाह: अनुपालन अधिकारी “मुख्य वित्त अधिकाऱ्याने स्वाक्षरी केलेले दस्तऐवज” किंवा “अधिकृत ‘गोपनीय’ शिक्का असलेले करार” शोधू शकतो.

  • बदल: स्वाक्षऱ्या किंवा शिक्क्यांच्या दृश्य उपस्थितीवरून मॉडेल मसुदा आणि अंतिम दस्तऐवज यांतील फरक ओळखते; केवळ OCR वापरल्यास ही बाब अनेकदा सुटते.

सुरुवात करा

ColQwen3 चे भार खुले आहेत (Apache 2.0) आणि ते आता Hugging Face वर उपलब्ध आहे. आधुनिक RAG प्रक्रियांसाठी ते थेट पर्याय म्हणून वापरता यावे यासाठी आम्ही त्याची रचना केली असून, मजकूर, प्रतिमा आणि व्हिडिओंवर त्वरित प्रक्रिया करण्यासाठी आवश्यक अनुमान कोडही दिला आहे.

साध्या मजकूर शोधापलीकडे जाऊन दृश्य मालमत्तेत अडकलेली बुद्धिमत्ता खुली करण्यास सज्ज असलेल्या उद्योगांसाठी हा नवा मानदंड आहे.

पुढील पाऊल: मॉडेल कार्ड पाहा आणि Hugging Face वरील थेट प्रात्यक्षिक वापरून पाहा: /-colqwen3-embed-8b आणि /-colqwen3-embed-4b

लेखक

Xin Huang आणि Kye Min Tan