கடந்த இரண்டு ஆண்டுகளாக, “RAG” எனப்படும் மீட்டெடுப்பு-மேம்படுத்தப்பட்ட உருவாக்கம் என்பது ஏறக்குறைய உரையை மட்டுமே குறிப்பதாக இருந்தது. வழக்கமான நடைமுறை எளிமையானது: ஆவணங்களிலிருந்து உரையைப் பிரித்தெடுத்து, துண்டுகளாகப் பிரித்து, அட்டவணைப்படுத்துவது.
ஆனால் நிறுவன உலகம் வெறும் உரைக் கோப்புகளை அடிப்படையாகக் கொண்டு இயங்குவதில்லை. சிக்கலான PDF-கள், அடர்த்தியான வரைபடங்களைக் கொண்ட விளக்கக்காட்சிகள், CAD வரைபடங்கள், வருடப்பட்ட ரசீதுகள் மற்றும் தொடர்ந்து பெருகும் மாபெரும் காணொளிக் காப்பகங்களே அதன் அடிப்படை.
ஒரு படத்தைப் பொதிப்பதற்கு முன் OCR அல்லது காட்சிசார் பெரும் மொழி மாடல்களைக் கொண்டு உரையாக “விளக்குவது” என்ற தொழில்துறை நடைமுறை மிகப்பெரிய இடையூறாக உள்ளது. அது மெதுவானது, செலவுமிக்கது; மேலும் மூலத் தரவின் செறிவான இடவியல் மற்றும் காட்சிசார் சூழலைத் தவிர்க்க முடியாமல் இழக்கிறது. ஒரு சிக்கலான காட்சியை உங்கள் செயற்கை நுண்ணறிவு வெறுமனே “ஒரு வரைபடம்” என்று விவரித்தால், அதிலுள்ள குறிப்பிட்ட வால்வு அல்லது மின்கம்பி அமைப்பு வரைபடத்தைத் தேடும் திறனை இழந்துவிட்டீர்கள்.
தொடக்கம் முதல் முடிவு வரையிலான காட்சி மீட்டெடுப்பைச் சாத்தியமாக்கி இச்சிக்கலைத் தீர்க்க வடிவமைக்கப்பட்ட ColPali கட்டமைப்பின் அடிப்படையிலான அதிநவீன பல்முறைமைப் பொதிப்பு மாடல் குடும்பத்தை இன்று வெளியிடுகிறோம்.
உண்மையிலேயே பயனுள்ள பல்முறைமை மீட்டெடுப்பியை உருவாக்குவது, ஆயத்தமாகக் கிடைக்கும் காட்சி-மொழி மாடலை எடுத்து தேடச் சொல்வதுபோல் எளிதானதல்ல. பல்முறைமை RAG-ஐ வரலாற்று ரீதியாகத் தடுத்த சவால்களைத் தீர்த்து ColQwen3-ஐ உருவாக்க, மாடல் ஒன்றிணைப்பு மற்றும் பயிற்சி உத்திகளைப் பயன்படுத்தினோம்.
ஒரு அடிப்படை மாடலைத் தொடக்கத்திலிருந்து நுண்சீரமைப்பதற்குப் பதிலாக, ஏற்கெனவே உள்ள உரைப் பொதிப்பு மாடலிலிருந்து மீட்டெடுப்புப் பணிகளின் அறிவை மாற்றும் முறையை உருவாக்கினோம். வழக்கமான காட்சி-மொழி மாடலுக்குப் படங்களை விவரிக்கத் தெரியும்; ஆனால் ஒரு வினவலுடன் பொருளடிப்படையில் ஒப்பிட்டு அவற்றைத் தரவரிசைப்படுத்தத் தெரிய வேண்டிய அவசியமில்லை.
இந்த இடைவெளியை நிரப்ப, சீரமைக்கப்பட்ட ஒன்றிணைந்த எடையிடல் உத்திகளைப் பயன்படுத்தினோம். உரை மறைநிலை வெளியில் உள்ள Qwen3-Embedding-இன் மீட்டெடுப்புத் திறனைப் பல்முறைமை வெளிக்கு நேரடியாக மாற்ற முடியும் என்றும், உடனடிப் பயிற்சி இல்லாமலேயே அது பட மற்றும் காணொளி மீட்டெடுப்புக்குப் பொதுமைப்படும் என்றும் எங்கள் சோதனைகளில் கண்டறிந்தோம். இந்தப் பயனுள்ள தொடக்கநிலையை வலுவான ஆரம்பப் புள்ளியாகக் கொண்டு, செயல்திறனை மேலும் மேம்படுத்தவும் நிலைத்தன்மையை உறுதிப்படுத்தவும் மாடலை நுண்சீரமைத்தோம். Qwen3-VL அடிப்படை மாடலிலிருந்து நுண்சீரமைப்பதை ஒப்பிடும்போது, இது இறுதி மீட்டெடுப்புச் செயல்திறனை மேம்படுத்துகிறது.
பொதிப்புத் திறன்கள் மாற்றப்பட்டதும், சீரமைப்பில் கவனம் செலுத்தினோம். மீட்டெடுப்புச் செயல்திறனை அதிகபட்சமாக்க, சுற்றுகளின் உகந்த எண்ணிக்கை, தொகுதி அளவு, கற்றல் வீதம், LoRA தரவரிசை மற்றும் தரவுத்தொகுப்புகளின் கலவை ஆகியவற்றை உள்ளடக்கிய கவனமான மீ-அளவுருத் தேடல்களையும் நீக்கல் ஆய்வுகளையும் மேற்கொண்டோம்.
நுண்சீரமைப்புத் தரவுத்தொகுப்புகளாக VDR, ColPali பயிற்சித் தொகுப்பு, visrag_syn, மற்றும் visrag_ind ஆகியவற்றைத் தேர்ந்தெடுத்தோம். நுண்சீரமைப்புக்கு UniMax மாதிரித் தேர்வைப் பயன்படுத்தினோம். நாங்கள் மாடல் ஒன்றிணைப்பைப் பயன்படுத்தியதாலும், ஒன்றிணைந்த அடிப்படை மாடல் ஏற்கெனவே பல்முறைமை மீட்டெடுப்புத் திறனைப் பகுதியளவு பெற்றிருப்பதாலும், கூடுதல் தரவுத்தொகுப்புகளைச் சேர்ப்பது செயல்திறனைச் சற்றுக் குறைப்பதைக் கண்டோம். எனவே மேலும் பல தரவுத்தொகுப்புகளுக்கு விரிவாக்கவில்லை.
நுண்சீரமைப்புக்காக நாங்கள் தேர்ந்தெடுத்த மீ-அளவுருக்கள் இவை:
LoRA தரவரிசை | 32 |
LoRA ஆல்பா | 32 |
LoRA இலக்குத் தொகுதிகள் | பொதிப்பைத் தவிர, படம் மற்றும் உரை இரண்டின் அனைத்து அடுக்குகளும் |
கற்றல் வீதம் | 5e-5 |
அதிகபட்சக் காட்சி டோக்கன்கள் | 1280 |
பயிற்சிச் சுற்றுகள் | 1 |
மொத்தத் தொகுதி அளவு | 512 |
தொடக்கப் பயிற்சி விகிதம் | 5% |
வரலாற்று ரீதியாக, “ColBERT பாணி” டோக்கன்-நிலைப் பொதிப்புகளைப் பயன்படுத்திய மாடல்கள், ColPali போன்றவை, வியக்கத்தக்க செயல்திறனை வழங்கினாலும் அவற்றின் சேமிப்புச் செலவு தாங்க முடியாததாக இருந்தது. ஒவ்வொரு காட்சி டோக்கனையும் அட்டவணைப்படுத்துவது, நிறுவன அளவில் பயன்படுத்த முடியாத அளவுக்குச் செலவுமிக்க மாபெரும் வெக்டர் தரவுத்தளங்களை உருவாக்கியது.
மேம்படுத்தல் உத்தி: அதிகபட்சச் செயல்திறனைத் தக்கவைத்துக்கொண்டே சேமிப்புச் செலவு கட்டுக்கடங்காமல் அதிகரிப்பதைத் தடுக்க, பொதிப்புகளின் அளவைக் கவனமாகச் சமநிலைப்படுத்திச் சேமிப்புச் சவாலுக்குத் தீர்வு கண்டோம். இந்தச் சிக்கனமான அளவுக்குள் அதிநவீனத் துல்லியத்தைத் தக்கவைக்க, மீட்டெடுப்புச் செயல்திறனுக்கும் சேமிப்புச் செலவுக்கும் சிறந்த சமநிலையை வழங்கும் வகையில் பரிமாண அளவை 320 ஆகக் கவனமாகத் தேர்ந்தெடுத்தோம்.
அடிப்படை: வழக்கமான ஓர் அணுகுமுறைக்கு, NVIDIA Nemo-3B போன்றது, 10 லட்சம் படங்களின் பொதிப்புகளைச் சேமிக்க சுமார் 10.3 TB தேவைப்படும் (1,802 டோக்கன்கள் @ 3,072 பரிமாணங்கள்).
ColQwen3: அதே 10 லட்சம் படங்களை வெறும் 0.82 TB-இல் சேமிக்கிறது (அதிகபட்சம் 1,280 டோக்கன்கள் @ 320 பரிமாணங்கள்).
மேகக் கட்டமைப்புச் செலவைப் பெருக்காமல், ColQwen3 அதிநவீன மீட்டெடுப்புத் துல்லியத்தை அடைகிறது.
ViDoRe அளவுகோல் தொகுப்பில் எங்கள் அணுகுமுறையைச் சரிபார்த்தோம். சமீபத்திய V3 மற்றும் V2 அளவுகோல்களில், ஆங்கிலம் மற்றும் பன்மொழி இரண்டிலும், ColQwen3 புதிய தரநிலைகளை நிறுவுவதையும், பழைய V1 பணிகளில் உயர்தரச் செயல்திறனைத் தக்கவைப்பதையும் முடிவுகள் உறுதிப்படுத்துகின்றன.
ஆங்கிலம் மற்றும் பன்மொழி மீட்டெடுப்பில் ColQwen3-8B முன்னிலை வகிக்கிறது.
ஆங்கில nDCG@5
மாடல் | கணினி அறிவியல் | ஆற்றல் | நிதி | மனிதவளம் | தொழில் | மருந்தியல் | இயற்பியல் | சராசரி |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
பன்மொழி nDCG@5
மாடல் | கணினி அறிவியல் | ஆற்றல் | நிதி | மனிதவளம் | தொழில் | மருந்தியல் | இயற்பியல் | சராசரி |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, பொருளாதாரம் மற்றும் DocVQA முழுவதிலும் தொடர்ந்து உயர்ந்த செயல்திறன்.
அளவுகோல் | மாடல் | மதிப்பெண் (சராசரி) | குறிப்பிடத்தக்க வெற்றி |
ViDoRe V2 (ஆங்கிலம்) | ColQwen3-8B | 0.6772 | ESG & BioMed-இல் முதலிடம் |
ViDoRe V2 (பன்மொழி) | ColQwen3-8B | 0.6085 | பொருளாதாரத்தில் முதலிடம் |
ViDoRe V1 (ஆங்கிலம்) | Nemo ColEmbed 3B | 0.9100 | சற்றே அதிக சராசரி |
ViDoRe V1 (ஆங்கிலம்) | ColQwen3-8B | 0.9076 | ArxivQA & Syn-Gov-இல் முதலிடம் |
காணொளி மீட்டெடுப்புக்கு ColQwen3 சிறப்பாகப் பொதுமைப்படுத்தப்படுவதை நிரூபிக்க, உரையிலிருந்து காணொளிக்கான பொதுவான மீட்டெடுப்புப் பணிகளுக்குரிய CareBench அளவுகோலில் மாடல்களை மதிப்பிட்டோம்.
இந்த மதிப்பீட்டில் மூலக் காணொளிக் குறியாக்க அணுகுமுறையைப் பயன்படுத்தினோம்: கூடுதல் உரை விளக்கங்கள் அல்லது மீத்தரவு உள்ளீடுகள் எதுவுமின்றி, எங்கள் மாடல்கள் காணொளிக் கோப்புகளை நேரடியாகக் குறியாக்கின. காட்சி சார்ந்த பொருளை மட்டுமே அடிப்படையாகக் கொண்டு மீட்டெடுக்கும் மாடலின் திறனை இது எடுத்துக்காட்டுகிறது.
மாடல் | மீட்டழைப்பு@1 | மீட்டழைப்பு@5 | மீட்டழைப்பு@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ஆவணங்களைப் போலவே காணொளியையும் கையாளும் ColQwen3-இன் திறன், அது ஏற்படுத்தும் மிக ஆழமான மாற்றங்களில் ஒன்றாகும். பல நிறுவனங்களில் காணொளி என்பது “இருண்ட தரவு.” ஒவ்வொரு கோப்பையும் ஒருவர் கைமுறையாகக் குறியிடாத வரை, அது குளிர்ச் சேமிப்பகத்தில் தேட முடியாதபடி கிடக்கிறது.
பிரிக்கப்பட்ட காணொளித் துணுக்குகளில் சட்டகம் வாரியாக மீட்டெடுக்க உதவுவதன் மூலம் ColQwen3 இதை மாற்றுகிறது.
நிறுவனங்கள் தினமும் ஆயிரக்கணக்கான மணிநேர உள்கூட்டக் காணொளிகளைப் பதிவு செய்கின்றன; பொதுவாக அந்தப் பதிவுகள் பின்னர் கண்டுபிடிக்க முடியாமல் போகின்றன.
பணிப்பாய்வு: நீண்ட கூட்டப் பதிவுகளைச் சிறிய, பொருளுள்ள காணொளித் துணுக்குகளாகத் தானாகப் பிரித்து, அவற்றை ColQwen3 மூலம் அட்டவணைப்படுத்தினால், தேடக்கூடிய “நிறுவன நினைவை” உருவாக்கலாம்.
வினவல்: ஒரு திட்ட மேலாளர் இவ்வாறு கேட்கலாம்: “API-இன் தாமதச் சிக்கலைப் பொறியியல் தலைவர் விளக்கிய காணொளித் துணுக்கைக் காட்டு.”
முடிவு: 60 நிமிடக் காணொளிக் கோப்பை வழங்குவதற்குப் பதிலாக, குறிப்பிட்ட வரைபடம் திரையில் பகிரப்பட்டு விவாதிக்கப்பட்ட துல்லியமான 45 வினாடித் துணுக்கை அமைப்பு மீட்டெடுக்கிறது. அந்தத் தருணத்தில் பேச்சாளர்கள் “தாமதம்” என்ற சொல்லை வெளிப்படையாகக் கூறாவிட்டாலும் இது சாத்தியம்.
நேரடி பல்முறைமைப் பொதிப்புக்கு மாறுவது, பல்வேறு தொழில்துறைகளில் முற்றிலும் புதிய பணிப்பாய்வுகளைச் சாத்தியமாக்குகிறது. மிகவும் சிக்கலான சில நிறுவனத் தரவுச் சூழல்களுக்கு எதிராக இந்த மாடலை விரிவாக அளவிட்டுள்ளோம்.
பெருந்திட்டங்கள், மண்டல வரைபடங்கள் மற்றும் சிக்கலான கட்டிட முகப்புத் தோற்றங்களின் மாபெரும் தொகுப்புகளை நிர்வகிக்கும் நகர்ப்புற ஆலோசனை நிறுவனங்கள் எதிர்கொள்ளும் தரவுச் சவால்களில் ColQwen3-ஐச் சோதித்தோம்.
சவால்: இத்தகைய சூழல்களில் பாரம்பரிய RAG செயலாக்கத் தொடர்கள் சிரமப்படுகின்றன. OCR கருவிகள் சிக்கலான தளத் திட்டங்களைப் பொதுவாக “திட்ட வரைபடம்” என்று மட்டும் விவரிப்பதால், போக்குவரத்து ஓட்டம், பசுமை மண்டலங்கள் அல்லது கட்டிடப் பின்னடைவுகள் குறித்த முக்கிய விவரங்கள் தவறவிடப்படுகின்றன.
செயல்திறன்: செலவுமிக்க OCR அல்லது விளக்கவுரை முன்செயலாக்கத்தின் தேவையை ColQwen3 திறம்படத் தவிர்ப்பதை எங்கள் உள் அளவுகோல்கள் காட்டுகின்றன. அடர்த்தியான கட்டிடக்கலை வரைபடங்களைக் கொண்ட சோதனைகளில், பாதசாரி அணுகல் இடங்கள் அல்லது தனித்துவமான மண்டல எல்லைகள் போன்ற குறிப்பிட்ட காட்சிக் குறிகளின் அடிப்படையில் மாடல் ஆவணங்களை வெற்றிகரமாக மீட்டெடுத்தது. இது உரை மட்டுமே சார்ந்த அடிப்படைகளைவிடக் குறிப்பிடத்தக்க அளவில் சிறந்து செயல்பட்டதுடன், அறிவு உள்வாங்கல் செலவையும் பெருமளவு குறைக்கும் வாய்ப்பைக் காட்டியது.
முதலீட்டு வங்கியாளர்களும் பகுப்பாய்வாளர்களும் ஆண்டறிக்கைகளையும் முதலீட்டாளர் விளக்கக்காட்சிகளையும் ஆராய ஆயிரக்கணக்கான மணிநேரம் செலவிடுகின்றனர்.
பணிப்பாய்வு: ஒரு பகுப்பாய்வாளர், “2024 விளக்கக்காட்சிகளில் உள்ள APAC வருவாய் மற்றும் EMEA வருவாயின் பிரிவைக் கண்டுபிடி.” என்று கேட்கலாம்.
மாற்றம்: திறவுச்சொல் பொருத்தங்களைச் சார்ந்திருக்காமல், குறிப்பிட்ட தரவுக் காட்சிப்படுத்தல் இடம்பெற்றிருப்பதன் அடிப்படையில் மாடல் துல்லியமான படவில்லையை மீட்டெடுக்கிறது. இதனால் RAG அமைப்பு மிகத் துல்லியமாகப் பதிலளிக்க முடிகிறது.
உற்பத்தி நிறுவனங்களிடம் தொழில்நுட்பக் கையேடுகள் மற்றும் குழாய் அமைப்பு வரைபடங்களின் (P&ID) பெரும் தொகுப்புகள் உள்ளன.
பணிப்பாய்வு: விசையாழியைப் பழுதுபார்க்கும் களப் பொறியாளர் ஒரு பாகத்தைப் படமெடுக்கலாம் அல்லது “நீரழுத்த விசையியக்கி அமைப்பின் மின்கம்பி வரைபடத்தைக் காட்டு.” என்று கேட்கலாம்.
மாற்றம்: மின்கம்பி வரைபடத்தின் காட்சிப் பிரதிநிதித்துவத்தை ColQwen3 அடையாளம் கண்டு சரியான பக்கத்தை மீட்டெடுக்கிறது. இதனால் செயல்பாடற்ற நேரம் பல மணிநேரம் குறையலாம்.
சட்ட ஆவண ஆய்வில், முக்கியத் தடயம் பெரும்பாலும் ஒரு காட்சிக் குறியாக இருக்கும் கோடிக்கணக்கான வருடப்பட்ட பக்கங்களை மதிப்பாய்வு செய்ய வேண்டியுள்ளது.
பணிப்பாய்வு: ஓர் இணக்க அதிகாரி “தலைமை நிதி அதிகாரி கையொப்பமிட்ட ஆவணங்கள்” அல்லது “அதிகாரப்பூர்வமான ‘ரகசியம்’ முத்திரையுள்ள ஒப்பந்தங்கள்” எனத் தேடலாம்.
மாற்றம்: கையொப்பங்கள் அல்லது முத்திரைகள் காட்சியளிப்பதன் அடிப்படையில் வரைவு ஆவணத்தையும் இறுதி ஆவணத்தையும் மாடல் வேறுபடுத்துகிறது; உரை அறிதல் மட்டும் பெரும்பாலும் தவறவிடும் அம்சம் இது.
ColQwen3 திறந்த எடைகளுடன் (Apache 2.0) இப்போது Hugging Face-இல் கிடைக்கிறது. நவீன RAG செயலாக்கத் தொடர்களில் நேரடியாகச் சேர்க்கக்கூடிய மேம்படுத்தலாக இதை வடிவமைத்துள்ளோம். உரை, படங்கள் மற்றும் காணொளியை உடனடியாகச் செயலாக்கத் தேவையான அனுமானக் குறியீடும் இதில் வழங்கப்படுகிறது.
எளிய உரைத் தேடலைத் தாண்டி, காட்சிசார் வளங்களில் சிக்கியுள்ள நுண்ணறிவை அணுகத் தயாராக இருக்கும் நிறுவனங்களுக்கு இதுவே புதிய தரநிலை.
அடுத்த படி: மாடல் கார்டைப் பார்த்து, Hugging Face-இல் நேரடி செயல்விளக்கத்தை முயலுங்கள்: /-colqwen3-embed-8b மற்றும் /-colqwen3-embed-4b