முதன்மை வழிசெலுத்தல்

உரைக்கு அப்பால்: உண்மையான பல்முறைமை, முழுமையான RAG-ஐச் சாத்தியமாக்குதல்

சிக்கலான ஆவணங்கள், படங்கள் மற்றும் காணொளிகளிலிருந்து பயனுள்ள தகவல்களை நேரடியாக மீட்டெடுக்கப் பல்முறைமைப் பொதிப்பு மாடல்கள் குழுக்களுக்கு உதவுகின்றன.

கடந்த இரண்டு ஆண்டுகளாக, “RAG” எனப்படும் மீட்டெடுப்பு-மேம்படுத்தப்பட்ட உருவாக்கம் என்பது ஏறக்குறைய உரையை மட்டுமே குறிப்பதாக இருந்தது. வழக்கமான நடைமுறை எளிமையானது: ஆவணங்களிலிருந்து உரையைப் பிரித்தெடுத்து, துண்டுகளாகப் பிரித்து, அட்டவணைப்படுத்துவது.

ஆனால் நிறுவன உலகம் வெறும் உரைக் கோப்புகளை அடிப்படையாகக் கொண்டு இயங்குவதில்லை. சிக்கலான PDF-கள், அடர்த்தியான வரைபடங்களைக் கொண்ட விளக்கக்காட்சிகள், CAD வரைபடங்கள், வருடப்பட்ட ரசீதுகள் மற்றும் தொடர்ந்து பெருகும் மாபெரும் காணொளிக் காப்பகங்களே அதன் அடிப்படை.

ஒரு படத்தைப் பொதிப்பதற்கு முன் OCR அல்லது காட்சிசார் பெரும் மொழி மாடல்களைக் கொண்டு உரையாக “விளக்குவது” என்ற தொழில்துறை நடைமுறை மிகப்பெரிய இடையூறாக உள்ளது. அது மெதுவானது, செலவுமிக்கது; மேலும் மூலத் தரவின் செறிவான இடவியல் மற்றும் காட்சிசார் சூழலைத் தவிர்க்க முடியாமல் இழக்கிறது. ஒரு சிக்கலான காட்சியை உங்கள் செயற்கை நுண்ணறிவு வெறுமனே “ஒரு வரைபடம்” என்று விவரித்தால், அதிலுள்ள குறிப்பிட்ட வால்வு அல்லது மின்கம்பி அமைப்பு வரைபடத்தைத் தேடும் திறனை இழந்துவிட்டீர்கள்.

தொடக்கம் முதல் முடிவு வரையிலான காட்சி மீட்டெடுப்பைச் சாத்தியமாக்கி இச்சிக்கலைத் தீர்க்க வடிவமைக்கப்பட்ட ColPali கட்டமைப்பின் அடிப்படையிலான அதிநவீன பல்முறைமைப் பொதிப்பு மாடல் குடும்பத்தை இன்று வெளியிடுகிறோம்.

மாயத்தின் பின்னுள்ள பொறியியல்: மேம்பட்ட நுண்சீரமைப்பு உத்திகள்

உண்மையிலேயே பயனுள்ள பல்முறைமை மீட்டெடுப்பியை உருவாக்குவது, ஆயத்தமாகக் கிடைக்கும் காட்சி-மொழி மாடலை எடுத்து தேடச் சொல்வதுபோல் எளிதானதல்ல. பல்முறைமை RAG-ஐ வரலாற்று ரீதியாகத் தடுத்த சவால்களைத் தீர்த்து ColQwen3-ஐ உருவாக்க, மாடல் ஒன்றிணைப்பு மற்றும் பயிற்சி உத்திகளைப் பயன்படுத்தினோம்.

1. சீரமைக்கப்பட்ட ஒன்றிணைந்த எடையிடல் மூலம் பொதிப்புத் திறனை மாற்றுதல்

ஒரு அடிப்படை மாடலைத் தொடக்கத்திலிருந்து நுண்சீரமைப்பதற்குப் பதிலாக, ஏற்கெனவே உள்ள உரைப் பொதிப்பு மாடலிலிருந்து மீட்டெடுப்புப் பணிகளின் அறிவை மாற்றும் முறையை உருவாக்கினோம். வழக்கமான காட்சி-மொழி மாடலுக்குப் படங்களை விவரிக்கத் தெரியும்; ஆனால் ஒரு வினவலுடன் பொருளடிப்படையில் ஒப்பிட்டு அவற்றைத் தரவரிசைப்படுத்தத் தெரிய வேண்டிய அவசியமில்லை.

இந்த இடைவெளியை நிரப்ப, சீரமைக்கப்பட்ட ஒன்றிணைந்த எடையிடல் உத்திகளைப் பயன்படுத்தினோம். உரை மறைநிலை வெளியில் உள்ள Qwen3-Embedding-இன் மீட்டெடுப்புத் திறனைப் பல்முறைமை வெளிக்கு நேரடியாக மாற்ற முடியும் என்றும், உடனடிப் பயிற்சி இல்லாமலேயே அது பட மற்றும் காணொளி மீட்டெடுப்புக்குப் பொதுமைப்படும் என்றும் எங்கள் சோதனைகளில் கண்டறிந்தோம். இந்தப் பயனுள்ள தொடக்கநிலையை வலுவான ஆரம்பப் புள்ளியாகக் கொண்டு, செயல்திறனை மேலும் மேம்படுத்தவும் நிலைத்தன்மையை உறுதிப்படுத்தவும் மாடலை நுண்சீரமைத்தோம். Qwen3-VL அடிப்படை மாடலிலிருந்து நுண்சீரமைப்பதை ஒப்பிடும்போது, இது இறுதி மீட்டெடுப்புச் செயல்திறனை மேம்படுத்துகிறது.

2. கவனமான மீ-அளவுருச் சீரமைப்பு

பொதிப்புத் திறன்கள் மாற்றப்பட்டதும், சீரமைப்பில் கவனம் செலுத்தினோம். மீட்டெடுப்புச் செயல்திறனை அதிகபட்சமாக்க, சுற்றுகளின் உகந்த எண்ணிக்கை, தொகுதி அளவு, கற்றல் வீதம், LoRA தரவரிசை மற்றும் தரவுத்தொகுப்புகளின் கலவை ஆகியவற்றை உள்ளடக்கிய கவனமான மீ-அளவுருத் தேடல்களையும் நீக்கல் ஆய்வுகளையும் மேற்கொண்டோம்.

நுண்சீரமைப்புத் தரவுத்தொகுப்புகளாக VDR, ColPali பயிற்சித் தொகுப்பு, visrag_syn, மற்றும் visrag_ind ஆகியவற்றைத் தேர்ந்தெடுத்தோம். நுண்சீரமைப்புக்கு UniMax மாதிரித் தேர்வைப் பயன்படுத்தினோம். நாங்கள் மாடல் ஒன்றிணைப்பைப் பயன்படுத்தியதாலும், ஒன்றிணைந்த அடிப்படை மாடல் ஏற்கெனவே பல்முறைமை மீட்டெடுப்புத் திறனைப் பகுதியளவு பெற்றிருப்பதாலும், கூடுதல் தரவுத்தொகுப்புகளைச் சேர்ப்பது செயல்திறனைச் சற்றுக் குறைப்பதைக் கண்டோம். எனவே மேலும் பல தரவுத்தொகுப்புகளுக்கு விரிவாக்கவில்லை.

நுண்சீரமைப்புக்காக நாங்கள் தேர்ந்தெடுத்த மீ-அளவுருக்கள் இவை:

LoRA தரவரிசை

32

LoRA ஆல்பா

32

LoRA இலக்குத் தொகுதிகள்

பொதிப்பைத் தவிர, படம் மற்றும் உரை இரண்டின் அனைத்து அடுக்குகளும்

கற்றல் வீதம்

5e-5

அதிகபட்சக் காட்சி டோக்கன்கள்

1280

பயிற்சிச் சுற்றுகள்

1

மொத்தத் தொகுதி அளவு

512

தொடக்கப் பயிற்சி விகிதம்

5%

3. “ColBERT” சிக்கல்: உயர்ந்த செயல்திறனா, சேமிப்புச் செலவா

வரலாற்று ரீதியாக, “ColBERT பாணி” டோக்கன்-நிலைப் பொதிப்புகளைப் பயன்படுத்திய மாடல்கள், ColPali போன்றவை, வியக்கத்தக்க செயல்திறனை வழங்கினாலும் அவற்றின் சேமிப்புச் செலவு தாங்க முடியாததாக இருந்தது. ஒவ்வொரு காட்சி டோக்கனையும் அட்டவணைப்படுத்துவது, நிறுவன அளவில் பயன்படுத்த முடியாத அளவுக்குச் செலவுமிக்க மாபெரும் வெக்டர் தரவுத்தளங்களை உருவாக்கியது.

  • மேம்படுத்தல் உத்தி: அதிகபட்சச் செயல்திறனைத் தக்கவைத்துக்கொண்டே சேமிப்புச் செலவு கட்டுக்கடங்காமல் அதிகரிப்பதைத் தடுக்க, பொதிப்புகளின் அளவைக் கவனமாகச் சமநிலைப்படுத்திச் சேமிப்புச் சவாலுக்குத் தீர்வு கண்டோம். இந்தச் சிக்கனமான அளவுக்குள் அதிநவீனத் துல்லியத்தைத் தக்கவைக்க, மீட்டெடுப்புச் செயல்திறனுக்கும் சேமிப்புச் செலவுக்கும் சிறந்த சமநிலையை வழங்கும் வகையில் பரிமாண அளவை 320 ஆகக் கவனமாகத் தேர்ந்தெடுத்தோம்.

    • அடிப்படை: வழக்கமான ஓர் அணுகுமுறைக்கு, NVIDIA Nemo-3B போன்றது, 10 லட்சம் படங்களின் பொதிப்புகளைச் சேமிக்க சுமார் 10.3 TB தேவைப்படும் (1,802 டோக்கன்கள் @ 3,072 பரிமாணங்கள்).

    • ColQwen3: அதே 10 லட்சம் படங்களை வெறும் 0.82 TB-இல் சேமிக்கிறது (அதிகபட்சம் 1,280 டோக்கன்கள் @ 320 பரிமாணங்கள்).

மேகக் கட்டமைப்புச் செலவைப் பெருக்காமல், ColQwen3 அதிநவீன மீட்டெடுப்புத் துல்லியத்தை அடைகிறது.

மதிப்பீட்டு முடிவுகள்

ViDoRe அளவுகோல் தொகுப்பில் எங்கள் அணுகுமுறையைச் சரிபார்த்தோம். சமீபத்திய V3 மற்றும் V2 அளவுகோல்களில், ஆங்கிலம் மற்றும் பன்மொழி இரண்டிலும், ColQwen3 புதிய தரநிலைகளை நிறுவுவதையும், பழைய V1 பணிகளில் உயர்தரச் செயல்திறனைத் தக்கவைப்பதையும் முடிவுகள் உறுதிப்படுத்துகின்றன.

ViDoRe v3 (சமீபத்தியது)

ஆங்கிலம் மற்றும் பன்மொழி மீட்டெடுப்பில் ColQwen3-8B முன்னிலை வகிக்கிறது.

ஆங்கில nDCG@5

மாடல்

கணினி அறிவியல்

ஆற்றல்

நிதி

மனிதவளம்

தொழில்

மருந்தியல்

இயற்பியல்

சராசரி

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

பன்மொழி nDCG@5

மாடல்

கணினி அறிவியல்

ஆற்றல்

நிதி

மனிதவளம்

தொழில்

மருந்தியல்

இயற்பியல்

சராசரி

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 மற்றும் v1 சிறப்பம்சங்கள்

ESG, பொருளாதாரம் மற்றும் DocVQA முழுவதிலும் தொடர்ந்து உயர்ந்த செயல்திறன்.

அளவுகோல்

மாடல்

மதிப்பெண் (சராசரி)

குறிப்பிடத்தக்க வெற்றி

ViDoRe V2 (ஆங்கிலம்)

ColQwen3-8B

0.6772

ESG & BioMed-இல் முதலிடம்

ViDoRe V2 (பன்மொழி)

ColQwen3-8B

0.6085

பொருளாதாரத்தில் முதலிடம்

ViDoRe V1 (ஆங்கிலம்)

Nemo ColEmbed 3B

0.9100

சற்றே அதிக சராசரி

ViDoRe V1 (ஆங்கிலம்)

ColQwen3-8B

0.9076

ArxivQA & Syn-Gov-இல் முதலிடம்

காணொளி மீட்டெடுப்பு: CareBench மதிப்பீடு

காணொளி மீட்டெடுப்புக்கு ColQwen3 சிறப்பாகப் பொதுமைப்படுத்தப்படுவதை நிரூபிக்க, உரையிலிருந்து காணொளிக்கான பொதுவான மீட்டெடுப்புப் பணிகளுக்குரிய CareBench அளவுகோலில் மாடல்களை மதிப்பிட்டோம்.

இந்த மதிப்பீட்டில் மூலக் காணொளிக் குறியாக்க அணுகுமுறையைப் பயன்படுத்தினோம்: கூடுதல் உரை விளக்கங்கள் அல்லது மீத்தரவு உள்ளீடுகள் எதுவுமின்றி, எங்கள் மாடல்கள் காணொளிக் கோப்புகளை நேரடியாகக் குறியாக்கின. காட்சி சார்ந்த பொருளை மட்டுமே அடிப்படையாகக் கொண்டு மீட்டெடுக்கும் மாடலின் திறனை இது எடுத்துக்காட்டுகிறது.

மாடல்

மீட்டழைப்பு@1

மீட்டழைப்பு@5

மீட்டழைப்பு@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“இருண்ட தரவை” அணுகுதல்: காணொளியின் அதிநவீன எல்லை

ஆவணங்களைப் போலவே காணொளியையும் கையாளும் ColQwen3-இன் திறன், அது ஏற்படுத்தும் மிக ஆழமான மாற்றங்களில் ஒன்றாகும். பல நிறுவனங்களில் காணொளி என்பது “இருண்ட தரவு.” ஒவ்வொரு கோப்பையும் ஒருவர் கைமுறையாகக் குறியிடாத வரை, அது குளிர்ச் சேமிப்பகத்தில் தேட முடியாதபடி கிடக்கிறது.

பிரிக்கப்பட்ட காணொளித் துணுக்குகளில் சட்டகம் வாரியாக மீட்டெடுக்க உதவுவதன் மூலம் ColQwen3 இதை மாற்றுகிறது.

பயன்பாட்டு எடுத்துக்காட்டு: நிறுவன நினைவுக் களஞ்சியம்

நிறுவனங்கள் தினமும் ஆயிரக்கணக்கான மணிநேர உள்கூட்டக் காணொளிகளைப் பதிவு செய்கின்றன; பொதுவாக அந்தப் பதிவுகள் பின்னர் கண்டுபிடிக்க முடியாமல் போகின்றன.

  • பணிப்பாய்வு: நீண்ட கூட்டப் பதிவுகளைச் சிறிய, பொருளுள்ள காணொளித் துணுக்குகளாகத் தானாகப் பிரித்து, அவற்றை ColQwen3 மூலம் அட்டவணைப்படுத்தினால், தேடக்கூடிய “நிறுவன நினைவை” உருவாக்கலாம்.

  • வினவல்: ஒரு திட்ட மேலாளர் இவ்வாறு கேட்கலாம்: “API-இன் தாமதச் சிக்கலைப் பொறியியல் தலைவர் விளக்கிய காணொளித் துணுக்கைக் காட்டு.”

  • முடிவு: 60 நிமிடக் காணொளிக் கோப்பை வழங்குவதற்குப் பதிலாக, குறிப்பிட்ட வரைபடம் திரையில் பகிரப்பட்டு விவாதிக்கப்பட்ட துல்லியமான 45 வினாடித் துணுக்கை அமைப்பு மீட்டெடுக்கிறது. அந்தத் தருணத்தில் பேச்சாளர்கள் “தாமதம்” என்ற சொல்லை வெளிப்படையாகக் கூறாவிட்டாலும் இது சாத்தியம்.

நிறுவனப் பயன்பாடுகள்: அதிக மதிப்புள்ள சிக்கல்களுக்குத் தீர்வு

நேரடி பல்முறைமைப் பொதிப்புக்கு மாறுவது, பல்வேறு தொழில்துறைகளில் முற்றிலும் புதிய பணிப்பாய்வுகளைச் சாத்தியமாக்குகிறது. மிகவும் சிக்கலான சில நிறுவனத் தரவுச் சூழல்களுக்கு எதிராக இந்த மாடலை விரிவாக அளவிட்டுள்ளோம்.

1. அளவுகோல் சிறப்பம்சம்: நகர்ப்புற ஆலோசனை மற்றும் கட்டிடக்கலை

பெருந்திட்டங்கள், மண்டல வரைபடங்கள் மற்றும் சிக்கலான கட்டிட முகப்புத் தோற்றங்களின் மாபெரும் தொகுப்புகளை நிர்வகிக்கும் நகர்ப்புற ஆலோசனை நிறுவனங்கள் எதிர்கொள்ளும் தரவுச் சவால்களில் ColQwen3-ஐச் சோதித்தோம்.

  • சவால்: இத்தகைய சூழல்களில் பாரம்பரிய RAG செயலாக்கத் தொடர்கள் சிரமப்படுகின்றன. OCR கருவிகள் சிக்கலான தளத் திட்டங்களைப் பொதுவாக “திட்ட வரைபடம்” என்று மட்டும் விவரிப்பதால், போக்குவரத்து ஓட்டம், பசுமை மண்டலங்கள் அல்லது கட்டிடப் பின்னடைவுகள் குறித்த முக்கிய விவரங்கள் தவறவிடப்படுகின்றன.

  • செயல்திறன்: செலவுமிக்க OCR அல்லது விளக்கவுரை முன்செயலாக்கத்தின் தேவையை ColQwen3 திறம்படத் தவிர்ப்பதை எங்கள் உள் அளவுகோல்கள் காட்டுகின்றன. அடர்த்தியான கட்டிடக்கலை வரைபடங்களைக் கொண்ட சோதனைகளில், பாதசாரி அணுகல் இடங்கள் அல்லது தனித்துவமான மண்டல எல்லைகள் போன்ற குறிப்பிட்ட காட்சிக் குறிகளின் அடிப்படையில் மாடல் ஆவணங்களை வெற்றிகரமாக மீட்டெடுத்தது. இது உரை மட்டுமே சார்ந்த அடிப்படைகளைவிடக் குறிப்பிடத்தக்க அளவில் சிறந்து செயல்பட்டதுடன், அறிவு உள்வாங்கல் செலவையும் பெருமளவு குறைக்கும் வாய்ப்பைக் காட்டியது.

2. சிக்கலான நிதி மற்றும் சந்தை நுண்ணறிவு

முதலீட்டு வங்கியாளர்களும் பகுப்பாய்வாளர்களும் ஆண்டறிக்கைகளையும் முதலீட்டாளர் விளக்கக்காட்சிகளையும் ஆராய ஆயிரக்கணக்கான மணிநேரம் செலவிடுகின்றனர்.

  • பணிப்பாய்வு: ஒரு பகுப்பாய்வாளர், “2024 விளக்கக்காட்சிகளில் உள்ள APAC வருவாய் மற்றும் EMEA வருவாயின் பிரிவைக் கண்டுபிடி.” என்று கேட்கலாம்.

  • மாற்றம்: திறவுச்சொல் பொருத்தங்களைச் சார்ந்திருக்காமல், குறிப்பிட்ட தரவுக் காட்சிப்படுத்தல் இடம்பெற்றிருப்பதன் அடிப்படையில் மாடல் துல்லியமான படவில்லையை மீட்டெடுக்கிறது. இதனால் RAG அமைப்பு மிகத் துல்லியமாகப் பதிலளிக்க முடிகிறது.

3. தொழில்துறை உற்பத்தி மற்றும் களச் சேவை

உற்பத்தி நிறுவனங்களிடம் தொழில்நுட்பக் கையேடுகள் மற்றும் குழாய் அமைப்பு வரைபடங்களின் (P&ID) பெரும் தொகுப்புகள் உள்ளன.

  • பணிப்பாய்வு: விசையாழியைப் பழுதுபார்க்கும் களப் பொறியாளர் ஒரு பாகத்தைப் படமெடுக்கலாம் அல்லது “நீரழுத்த விசையியக்கி அமைப்பின் மின்கம்பி வரைபடத்தைக் காட்டு.” என்று கேட்கலாம்.

  • மாற்றம்: மின்கம்பி வரைபடத்தின் காட்சிப் பிரதிநிதித்துவத்தை ColQwen3 அடையாளம் கண்டு சரியான பக்கத்தை மீட்டெடுக்கிறது. இதனால் செயல்பாடற்ற நேரம் பல மணிநேரம் குறையலாம்.

4. சட்டம் மற்றும் இணக்கம்

சட்ட ஆவண ஆய்வில், முக்கியத் தடயம் பெரும்பாலும் ஒரு காட்சிக் குறியாக இருக்கும் கோடிக்கணக்கான வருடப்பட்ட பக்கங்களை மதிப்பாய்வு செய்ய வேண்டியுள்ளது.

  • பணிப்பாய்வு: ஓர் இணக்க அதிகாரி “தலைமை நிதி அதிகாரி கையொப்பமிட்ட ஆவணங்கள்” அல்லது “அதிகாரப்பூர்வமான ‘ரகசியம்’ முத்திரையுள்ள ஒப்பந்தங்கள்” எனத் தேடலாம்.

  • மாற்றம்: கையொப்பங்கள் அல்லது முத்திரைகள் காட்சியளிப்பதன் அடிப்படையில் வரைவு ஆவணத்தையும் இறுதி ஆவணத்தையும் மாடல் வேறுபடுத்துகிறது; உரை அறிதல் மட்டும் பெரும்பாலும் தவறவிடும் அம்சம் இது.

தொடங்குதல்

ColQwen3 திறந்த எடைகளுடன் (Apache 2.0) இப்போது Hugging Face-இல் கிடைக்கிறது. நவீன RAG செயலாக்கத் தொடர்களில் நேரடியாகச் சேர்க்கக்கூடிய மேம்படுத்தலாக இதை வடிவமைத்துள்ளோம். உரை, படங்கள் மற்றும் காணொளியை உடனடியாகச் செயலாக்கத் தேவையான அனுமானக் குறியீடும் இதில் வழங்கப்படுகிறது.

எளிய உரைத் தேடலைத் தாண்டி, காட்சிசார் வளங்களில் சிக்கியுள்ள நுண்ணறிவை அணுகத் தயாராக இருக்கும் நிறுவனங்களுக்கு இதுவே புதிய தரநிலை.

அடுத்த படி: மாடல் கார்டைப் பார்த்து, Hugging Face-இல் நேரடி செயல்விளக்கத்தை முயலுங்கள்: /-colqwen3-embed-8b மற்றும் /-colqwen3-embed-4b

ஆசிரியர்

Xin Huang மற்றும் Kye Min Tan