കഴിഞ്ഞ രണ്ട് വർഷമായി, “RAG” (വീണ്ടെടുക്കൽ-വർധിത ജനറേഷൻ) എന്നത് മിക്കവാറും ടെക്സ്റ്റിന്റെ പര്യായമായിരുന്നു. പതിവ് രീതി ലളിതമാണ്: രേഖകളിൽനിന്ന് ടെക്സ്റ്റ് വേർതിരിച്ച് ഭാഗങ്ങളാക്കി സൂചികയിലാക്കുക.
എന്നാൽ സംരംഭലോകം പ്ലെയിൻ ടെക്സ്റ്റ് ഫയലുകളെ മാത്രം ആശ്രയിച്ചല്ല പ്രവർത്തിക്കുന്നത്. സങ്കീർണമായ PDF-കൾ, വിവരസാന്ദ്രമായ ചാർട്ടുകളുള്ള സ്ലൈഡ് ഡെക്കുകൾ, CAD ഡ്രോയിങ്ങുകൾ, സ്കാൻ ചെയ്ത ഇൻവോയ്സുകൾ, കൂടാതെ വർധിച്ചുവരുന്ന വൻ വീഡിയോശേഖരങ്ങൾ എന്നിവയാണ് അതിന്റെ അടിസ്ഥാനം.
എംബെഡ് ചെയ്യുന്നതിനുമുമ്പ് OCR അല്ലെങ്കിൽ വിഷൻ LLM ഉപയോഗിച്ച് ചിത്രത്തിന് ടെക്സ്റ്റ് “അടിക്കുറിപ്പ്” നൽകുന്ന വ്യവസായത്തിലെ പതിവ് രീതി വലിയൊരു തടസ്സമാണ്. അത് മന്ദഗതിയിലും ചെലവേറിയതുമാണ്; യഥാർഥ ഡാറ്റയുടെ സമ്പന്നമായ സ്ഥലപരവും ദൃശ്യപരവുമായ സന്ദർഭം അനിവാര്യമായും നഷ്ടപ്പെടുത്തുകയും ചെയ്യും. സങ്കീർണമായ ഒരു ദൃശ്യം നിങ്ങളുടെ AI “ഒരു ബ്ലൂപ്രിന്റ്” എന്ന് മാത്രം വിവരിച്ചാൽ, അതിനുള്ളിലെ നിർദിഷ്ട വാൽവോ വയറിങ് സ്കീമാറ്റിക്കോ തിരയാനുള്ള കഴിവ് നഷ്ടപ്പെടും.
തുടക്കം മുതൽ അവസാനം വരെയുള്ള ദൃശ്യ വീണ്ടെടുക്കൽ സാധ്യമാക്കി ഈ പ്രശ്നം പരിഹരിക്കാൻ രൂപകൽപ്പന ചെയ്ത, ColPali ആർക്കിടെക്ചറിനെ അടിസ്ഥാനമാക്കിയുള്ള അത്യാധുനിക മൾട്ടിമോഡൽ എംബെഡ്ഡിങ് മോഡലുകളുടെ ഒരു കുടുംബം ഇന്ന് ഞങ്ങൾ പുറത്തിറക്കുന്നു.
വിപണിയിൽ ലഭ്യമായ ഒരു വിഷൻ-ലാംഗ്വേജ് മോഡലിനോട് (VLM) തിരയാൻ ആവശ്യപ്പെടുന്നതുപോലെ ലളിതമല്ല യഥാർഥത്തിൽ ഫലപ്രദമായ മൾട്ടിമോഡൽ റിട്രീവർ നിർമിക്കുന്നത്. മൾട്ടിമോഡൽ RAG-നെ ചരിത്രപരമായി പിന്നോട്ടടിച്ച വെല്ലുവിളികൾ പരിഹരിച്ച് ColQwen3 സൃഷ്ടിക്കാൻ, മോഡൽ ലയനവും പരിശീലന തന്ത്രങ്ങളും ഞങ്ങൾ ഉപയോഗിച്ചു.
ഒരു അടിസ്ഥാന മോഡലിനെ ആദ്യം മുതൽ സൂക്ഷ്മക്രമീകരിക്കുന്നതിനുപകരം, നിലവിലുള്ള ടെക്സ്റ്റ് എംബെഡ്ഡിങ് മോഡലിൽനിന്ന് വീണ്ടെടുക്കൽ ടാസ്കുകളിലെ അറിവ് കൈമാറാനുള്ള രീതി ഞങ്ങൾ വികസിപ്പിച്ചു. ഒരു സാധാരണ VLM-ന് ചിത്രങ്ങൾ വിവരിക്കാനറിയാം, എന്നാൽ ഒരു ചോദ്യവുമായി അർഥപരമായി താരതമ്യം ചെയ്ത് അവയെ റാങ്ക് ചെയ്യണമെന്നില്ല.
ഈ വിടവ് നികത്താൻ ക്രമീകരിച്ച ലയന ഭാരനിർണയ തന്ത്രങ്ങൾ ഞങ്ങൾ ഉപയോഗിച്ചു. ടെക്സ്റ്റ് ലേറ്റന്റ് സ്പേസിലെ Qwen3-Embedding-ന്റെ വീണ്ടെടുക്കൽ ശേഷി മൾട്ടിമോഡൽ സ്പേസിലേക്ക് നേരിട്ട് കൈമാറാമെന്നും, ഉടനടി പരിശീലനം നൽകാതെയും അത് ചിത്ര-വീഡിയോ വീണ്ടെടുക്കലിലേക്ക് സാമാന്യവൽക്കരിക്കാമെന്നും പരീക്ഷണങ്ങളിൽ കണ്ടെത്തി. ഈ ഫലപ്രദമായ പ്രാരംഭീകരണം ശക്തമായ തുടക്കമാക്കി, പ്രകടനം കൂടുതൽ മെച്ചപ്പെടുത്താനും കരുത്ത് ഉറപ്പാക്കാനും മോഡലിനെ തുടർന്ന് സൂക്ഷ്മക്രമീകരിച്ചു. Qwen3-VL അടിസ്ഥാന മോഡലിൽനിന്ന് സൂക്ഷ്മക്രമീകരിക്കുന്നതുമായി താരതമ്യം ചെയ്യുമ്പോൾ ഇത് അന്തിമ വീണ്ടെടുക്കൽ പ്രകടനം മെച്ചപ്പെടുത്തുന്നു.
എംബെഡ്ഡിങ് ശേഷികൾ കൈമാറിയശേഷം ഞങ്ങൾ വിന്യാസത്തിൽ ശ്രദ്ധ കേന്ദ്രീകരിച്ചു. വീണ്ടെടുക്കൽ പ്രകടനം പരമാവധിയാക്കാൻ, എപ്പോക്കുകളുടെ അനുയോജ്യമായ എണ്ണം, ബാച്ച് വലുപ്പം, പഠനനിരക്ക്, LoRA റാങ്ക്, ഡാറ്റാസെറ്റുകളുടെ മിശ്രിതം എന്നിവ ഉൾപ്പെടുത്തി സൂക്ഷ്മമായ ഹൈപ്പർ-പാരാമീറ്റർ തിരയലുകളും അബ്ലേഷൻ പഠനങ്ങളും നടത്തി.
സൂക്ഷ്മക്രമീകരണ ഡാറ്റാസെറ്റുകളായി VDR, ColPali പരിശീലന സെറ്റ്, visrag_syn, visrag_ind എന്നിവ തിരഞ്ഞെടുത്തു. സൂക്ഷ്മക്രമീകരണത്തിന് UniMax സാംപ്ലിങ് ഉപയോഗിച്ചു. മോഡൽ ലയനം പ്രയോഗിച്ചതിനാലും ലയിപ്പിച്ച അടിസ്ഥാന മോഡലിന് ഭാഗിക മൾട്ടിമോഡൽ റിട്രീവർ ശേഷി ഇതിനകം ലഭിച്ചതിനാലും, കൂടുതൽ ഡാറ്റാസെറ്റുകൾ ചേർക്കുന്നത് പ്രകടനം അല്പം കുറയ്ക്കുമെന്ന് കണ്ടെത്തി. അതിനാൽ കൂടുതൽ ഡാറ്റാസെറ്റുകളിലേക്ക് വ്യാപിപ്പിച്ചില്ല.
സൂക്ഷ്മക്രമീകരണത്തിനായി ഞങ്ങൾ തിരഞ്ഞെടുത്ത ഹൈപ്പർ-പാരാമീറ്ററുകൾ ഇവയാണ്:
LoRA റാങ്ക് | 32 |
LoRA ആൽഫ | 32 |
LoRA ലക്ഷ്യ മൊഡ്യൂളുകൾ | എംബെഡ്ഡിങ് ഒഴികെയുള്ള ചിത്രത്തിന്റെയും ടെക്സ്റ്റിന്റെയും എല്ലാ പാളികളും |
പഠനനിരക്ക് | 5e-5 |
പരമാവധി ദൃശ്യ ടോക്കണുകൾ | 1280 |
പരിശീലന എപ്പോക്കുകൾ | 1 |
ആഗോള ബാച്ച് വലുപ്പം | 512 |
വോംഅപ്പ് അനുപാതം | 5% |
ചരിത്രപരമായി, “ColBERT-രീതിയിലുള്ള” ടോക്കൺ-തല എംബെഡ്ഡിങ്ങുകൾ ഉപയോഗിക്കുന്ന മോഡലുകൾ (ColPali പോലുള്ളവ) അസാധാരണ പ്രകടനം നൽകിയെങ്കിലും സംഭരണച്ചെലവ് താങ്ങാനാകാത്തതായിരുന്നു. ഓരോ ദൃശ്യ ടോക്കണും സൂചികയിലാക്കിയത് സംരംഭതലത്തിൽ അമിതച്ചെലവുള്ള വൻ വെക്റ്റർ ഡാറ്റാബേസുകൾ സൃഷ്ടിച്ചു.
ഒപ്റ്റിമൈസേഷൻ തന്ത്രം: പരമാവധി പ്രകടനം നിലനിർത്തുകയും സംഭരണച്ചെലവ് കുതിച്ചുയരുന്നത് തടയുകയും ചെയ്യുന്ന വിധത്തിൽ എംബെഡ്ഡിങ്ങുകളുടെ വലുപ്പം സൂക്ഷ്മമായി സന്തുലിതമാക്കി സംഭരണ വെല്ലുവിളി പരിഹരിച്ചു. ഈ കാര്യക്ഷമമായ വലുപ്പത്തിൽ അത്യാധുനിക കൃത്യത നിലനിർത്താൻ, വീണ്ടെടുക്കൽ പ്രകടനവും സംഭരണച്ചെലവും ഏറ്റവും സന്തുലിതമാക്കുന്ന ഡൈമെൻഷൻ വലുപ്പമായി 320 തിരഞ്ഞെടുത്തു.
അടിസ്ഥാനരീതി: 10 ലക്ഷം ചിത്രങ്ങളുടെ എംബെഡ്ഡിങ്ങുകൾ സംഭരിക്കാൻ സാധാരണ സമീപനത്തിന് (NVIDIA Nemo-3B പോലുള്ളത്) ഏകദേശം 10.3 TB ആവശ്യമാണ് (3,072 ഡൈമെൻഷനിൽ 1,802 ടോക്കണുകൾ).
ColQwen3: അതേ 10 ലക്ഷം ചിത്രങ്ങൾ വെറും 0.82 TB-യിൽ സംഭരിക്കുന്നു (320 ഡൈമെൻഷനിൽ പരമാവധി 1,280 ടോക്കണുകൾ).
ക്ലൗഡ് അടിസ്ഥാനസൗകര്യ ബജറ്റ് പെരുപ്പിക്കാതെ ColQwen3 അത്യാധുനിക വീണ്ടെടുക്കൽ കൃത്യത കൈവരിക്കുന്നു.
ViDoRe ബെഞ്ച്മാർക്ക് സ്യൂട്ടിൽ ഞങ്ങളുടെ സമീപനം സാധൂകരിച്ചു. പഴയ V1 ടാസ്കുകളിൽ മുൻനിര പ്രകടനം നിലനിർത്തിക്കൊണ്ട്, ഏറ്റവും പുതിയ V3, V2 ബെഞ്ച്മാർക്കുകളിൽ—ഇംഗ്ലീഷിലും ബഹുഭാഷയിലും—ColQwen3 പുതിയ നിലവാരം സ്ഥാപിക്കുന്നതായി ഫലങ്ങൾ സ്ഥിരീകരിക്കുന്നു.
ഇംഗ്ലീഷ്, ബഹുഭാഷാ വീണ്ടെടുക്കലിൽ ColQwen3-8B മുന്നിലാണ്.
ഇംഗ്ലീഷ് nDCG@5
മോഡൽ | കമ്പ്യൂട്ടർ സയൻസ് | ഊർജം | ധനകാര്യം | മാനവവിഭവശേഷി | വ്യവസായം | ഔഷധമേഖല | ഭൗതികശാസ്ത്രം | ശരാശരി |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
ബഹുഭാഷാ nDCG@5
മോഡൽ | കമ്പ്യൂട്ടർ സയൻസ് | ഊർജം | ധനകാര്യം | മാനവവിഭവശേഷി | വ്യവസായം | ഔഷധമേഖല | ഭൗതികശാസ്ത്രം | ശരാശരി |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, സാമ്പത്തികശാസ്ത്രം, DocVQA എന്നിവയിലുടനീളം സ്ഥിരമായ ഉയർന്ന പ്രകടനം.
ബെഞ്ച്മാർക്ക് | മോഡൽ | സ്കോർ (ശരാശരി) | ശ്രദ്ധേയമായ വിജയം |
ViDoRe V2 (ഇംഗ്ലീഷ്) | ColQwen3-8B | 0.6772 | ESG, BioMed എന്നിവയിൽ ഒന്നാം സ്ഥാനം |
ViDoRe V2 (ബഹുഭാഷാ) | ColQwen3-8B | 0.6085 | സാമ്പത്തികശാസ്ത്രത്തിൽ ഒന്നാം സ്ഥാനം |
ViDoRe V1 (ഇംഗ്ലീഷ്) | Nemo ColEmbed 3B | 0.9100 | അല്പം ഉയർന്ന ശരാശരി |
ViDoRe V1 (ഇംഗ്ലീഷ്) | ColQwen3-8B | 0.9076 | ArxivQA, Syn-Gov എന്നിവയിൽ ഒന്നാം സ്ഥാനം |
വീഡിയോ വീണ്ടെടുക്കലിലേക്ക് ColQwen3 ശക്തമായി സാമാന്യവൽക്കരിക്കുന്നുവെന്ന് തെളിയിക്കാൻ, ടെക്സ്റ്റ്-ടു-വീഡിയോ (പൊതുവായ വീണ്ടെടുക്കൽ) ടാസ്കുകൾക്കായുള്ള CareBench ബെഞ്ച്മാർക്കിൽ മോഡലുകൾ വിലയിരുത്തി.
ഈ വിലയിരുത്തലിൽ ഞങ്ങൾ അസംസ്കൃത വീഡിയോ എൻകോഡിങ് സമീപനം ഉപയോഗിച്ചു: അധിക ടെക്സ്റ്റ് വ്യാഖ്യാനങ്ങളോ മെറ്റാഡാറ്റ ഇൻപുട്ടുകളോ ഇല്ലാതെ മോഡലുകൾ വീഡിയോ ഫയലുകൾ നേരിട്ട് എൻകോഡ് ചെയ്തു. ദൃശ്യ അർഥഘടന മാത്രം അടിസ്ഥാനമാക്കി വീണ്ടെടുക്കാനുള്ള മോഡലിന്റെ കഴിവ് ഇത് വ്യക്തമാക്കുന്നു.
മോഡൽ | റീകോൾ@1 | റീകോൾ@5 | റീകോൾ@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
വീഡിയോയെ രേഖകൾപോലെ തന്നെ കൈകാര്യം ചെയ്യാനുള്ള ColQwen3-യുടെ കഴിവാണ് അതു സാധ്യമാക്കുന്ന ഏറ്റവും സുപ്രധാന മാറ്റങ്ങളിലൊന്ന്. പല സംരംഭങ്ങളിലും വീഡിയോ “ഡാർക്ക് ഡാറ്റ” ആണ്. ഓരോ ഫയലും ഒരാൾ നേരിട്ട് ടാഗ് ചെയ്തിട്ടില്ലെങ്കിൽ, തിരയാനാകാതെ അത് കോൾഡ് സ്റ്റോറേജിൽ കിടക്കും.
വിഭജിച്ച ക്ലിപ്പുകളിൽ ഫ്രെയിം അടിസ്ഥാനത്തിലുള്ള വീണ്ടെടുക്കൽ സാധ്യമാക്കി ColQwen3 ഇതു മാറ്റുന്നു.
സംരംഭങ്ങൾ ദിവസേന ആയിരക്കണക്കിന് മണിക്കൂർ ആഭ്യന്തര വീഡിയോ മീറ്റിങ്ങുകൾ റെക്കോർഡ് ചെയ്യുന്നുണ്ടെങ്കിലും, സാധാരണയായി അവ ഉപയോഗശൂന്യമായി മറഞ്ഞുപോകുന്നു.
പ്രവർത്തനക്രമം: ദീർഘമായ മീറ്റിങ് റെക്കോർഡിങ്ങുകൾ യുക്തിസഹമായ ചെറിയ ക്ലിപ്പുകളായി സ്വയം വിഭജിച്ച് ColQwen3 ഉപയോഗിച്ച് സൂചികയിലാക്കുമ്പോൾ, തിരയാനാകുന്ന ഒരു “സ്ഥാപന ഓർമ” സൃഷ്ടിക്കാം.
ചോദ്യം: ഒരു പ്രോജക്റ്റ് മാനേജർക്ക് ഇങ്ങനെ ചോദിക്കാം: “API-യിലെ ലേറ്റൻസി പ്രശ്നം എൻജിനീയറിങ് മേധാവി വിശദീകരിച്ച ക്ലിപ്പ് കാണിക്കൂ.”
ഫലം: 60 മിനിറ്റ് വീഡിയോ ഫയൽ നൽകുന്നതിനുപകരം, ആ പ്രത്യേക ഡയഗ്രം സ്ക്രീനിൽ പങ്കുവെച്ച് ചർച്ച ചെയ്ത കൃത്യമായ 45 സെക്കൻഡ് ഭാഗം സിസ്റ്റം വീണ്ടെടുക്കുന്നു. ആ നിമിഷത്തിൽ സംസാരിച്ചവർ “ലേറ്റൻസി” എന്ന വാക്ക് പറഞ്ഞില്ലെങ്കിലും ഇതു സാധ്യമാണ്.
നേറ്റീവ് മൾട്ടിമോഡൽ എംബെഡ്ഡിങ്ങിലേക്കുള്ള മാറ്റം വ്യവസായങ്ങളിലുടനീളം പുതിയ പ്രവർത്തനക്രമങ്ങൾ സാധ്യമാക്കുന്നു. ഏറ്റവും സങ്കീർണമായ ചില സംരംഭ ഡാറ്റാ പരിതസ്ഥിതികളുമായി താരതമ്യം ചെയ്ത് ഈ മോഡലിനെ ഞങ്ങൾ വിപുലമായി ബെഞ്ച്മാർക്ക് ചെയ്തിട്ടുണ്ട്.
മാസ്റ്റർ പ്ലാനുകൾ, സോണിങ് മാപ്പുകൾ, സങ്കീർണമായ വാസ്തുവിദ്യാ എലിവേഷനുകൾ എന്നിവയുടെ വലിയ ശേഖരം കൈകാര്യം ചെയ്യുന്ന നഗര ഉപദേശക സ്ഥാപനങ്ങൾ നേരിടുന്ന ഡാറ്റാ വെല്ലുവിളികളിൽ ColQwen3 പരീക്ഷിച്ചു.
വെല്ലുവിളി: ഇത്തരം പരിതസ്ഥിതികളിൽ പരമ്പരാഗത RAG പൈപ്പ്ലൈനുകൾ ബുദ്ധിമുട്ടുന്നു. സങ്കീർണമായ സൈറ്റ് പ്ലാനുകൾക്ക് OCR ഉപകരണങ്ങൾ സാധാരണയായി “സ്കീമാറ്റിക്” എന്നു മാത്രം അടിക്കുറിപ്പിടുന്നതിനാൽ ഗതാഗത പ്രവാഹം, ഹരിത മേഖലകൾ, കെട്ടിടത്തിന്റെ പിന്നോട്ടുള്ള അകലം തുടങ്ങിയ നിർണായക വിവരങ്ങൾ നഷ്ടപ്പെടുന്നു.
പ്രകടനം: ചെലവേറിയ OCR/അടിക്കുറിപ്പിടൽ മുൻപ്രോസസ്സിങ്ങിന്റെ ആവശ്യം ColQwen3 ഫലപ്രദമായി ഒഴിവാക്കുന്നുവെന്ന് ഞങ്ങളുടെ ആഭ്യന്തര ബെഞ്ച്മാർക്കുകൾ തെളിയിക്കുന്നു. വളരെ സാന്ദ്രമായ വാസ്തുവിദ്യാ ഡ്രോയിങ്ങുകളിലെ പരീക്ഷണങ്ങളിൽ, കാൽനട പ്രവേശനകവാടങ്ങളോ വ്യത്യസ്തമായ സോണിങ് അതിരുകളോ പോലുള്ള പ്രത്യേക ദൃശ്യസൂചകങ്ങൾ അടിസ്ഥാനമാക്കി മോഡൽ രേഖകൾ വിജയകരമായി വീണ്ടെടുത്തു. ടെക്സ്റ്റ്-മാത്രം അടിസ്ഥാനരീതികളെക്കാൾ ഏറെ മെച്ചപ്പെട്ട പ്രകടനത്തിനൊപ്പം വിജ്ഞാന ഉൾപ്പെടുത്തൽ ചെലവ് ഗണ്യമായി കുറയ്ക്കാനും ഇതിന് കഴിയും.
നിക്ഷേപ ബാങ്കർമാരും വിശകലന വിദഗ്ധരും വാർഷിക റിപ്പോർട്ടുകളും നിക്ഷേപക ഡെക്കുകളും പരിശോധിക്കാൻ ആയിരക്കണക്കിന് മണിക്കൂർ ചെലവഴിക്കുന്നു.
പ്രവർത്തനക്രമം: ഒരു വിശകലന വിദഗ്ധന് ഇങ്ങനെ ചോദിക്കാം: “2024-ലെ സ്ലൈഡ് ഡെക്കുകളിൽനിന്ന് APAC വരുമാനവും EMEA വരുമാനവും തമ്മിലുള്ള വിഭജനം കണ്ടെത്തൂ.”
മാറ്റം: കീവേഡ് പൊരുത്തങ്ങളെ ആശ്രയിക്കുന്നതിനുപകരം, നിർദിഷ്ട ഡാറ്റാ ദൃശ്യവൽക്കരണത്തിന്റെ സാന്നിധ്യം അടിസ്ഥാനമാക്കി മോഡൽ കൃത്യമായ സ്ലൈഡ് വീണ്ടെടുക്കുന്നു. അതിനാൽ RAG സിസ്റ്റത്തിന് ഉയർന്ന കൃത്യതയോടെ ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകാം.
നിർമാണ സ്ഥാപനങ്ങൾക്ക് സാങ്കേതിക മാനുവലുകളുടെയും പൈപ്പിങ് ഡയഗ്രാമുകളുടെയും (P&ID) വലിയ ശേഖരങ്ങളുണ്ട്.
പ്രവർത്തനക്രമം: ടർബൈൻ അറ്റകുറ്റപ്പണി നടത്തുന്ന ഒരു ഫീൽഡ് എൻജിനീയർക്ക് ഭാഗത്തിന്റെ ഫോട്ടോയെടുക്കുകയോ ഇങ്ങനെ ചോദിക്കുകയോ ചെയ്യാം: “ഹൈഡ്രോളിക് പമ്പ് അസംബ്ലിയുടെ വയറിങ് ഡയഗ്രം കാണിക്കൂ.”
മാറ്റം: വയറിങ് ഡയഗ്രാമിന്റെ ദൃശ്യാവിഷ്കാരം ColQwen3 തിരിച്ചറിഞ്ഞ് ശരിയായ പേജ് വീണ്ടെടുക്കുന്നു. ഇതിലൂടെ പ്രവർത്തനരഹിത സമയം മണിക്കൂറുകളോളം കുറയ്ക്കാനാകും.
നിയമപരമായ തെളിവുശേഖരണത്തിൽ ലക്ഷ്യം പലപ്പോഴും ഒരു ദൃശ്യസൂചകമായതിനാൽ, സ്കാൻ ചെയ്ത ദശലക്ഷക്കണക്കിന് പേജുകൾ പരിശോധിക്കേണ്ടിവരുന്നു.
പ്രവർത്തനക്രമം: ഒരു അനുസരണ ഉദ്യോഗസ്ഥന് “CFO ഒപ്പിട്ട രേഖകൾ” എന്നോ “ഔദ്യോഗിക ‘രഹസ്യം’ മുദ്രയുള്ള കരാറുകൾ” എന്നോ തിരയാം.
മാറ്റം: ഒപ്പുകളുടെയോ മുദ്രകളുടെയോ ദൃശ്യസാന്നിധ്യം അടിസ്ഥാനമാക്കി കരടും അന്തിമ രേഖയും മോഡൽ വേർതിരിച്ചറിയുന്നു. ശുദ്ധമായ OCR പലപ്പോഴും കാണാതെപോകുന്ന കാര്യമാണിത്.
ColQwen3 തുറന്ന ഭാരങ്ങളുള്ളതാണ് (Apache 2.0); ഇപ്പോൾ Hugging Face-ൽ ലഭ്യമാണ്. ടെക്സ്റ്റ്, ചിത്രങ്ങൾ, വീഡിയോ എന്നിവ ഉടൻ പ്രോസസ് ചെയ്യാൻ ആവശ്യമായ ഇൻഫറൻസ് കോഡ് നൽകുന്ന, ആധുനിക RAG പൈപ്പ്ലൈനുകളിൽ നേരിട്ട് ചേർക്കാവുന്ന അപ്ഗ്രേഡായാണ് ഇത് രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്.
ലളിതമായ ടെക്സ്റ്റ് തിരയലിനപ്പുറം നീങ്ങി ദൃശ്യ ആസ്തികളിൽ കുടുങ്ങിക്കിടക്കുന്ന ഇൻ്റലിജൻസ് പ്രയോജനപ്പെടുത്താൻ തയ്യാറായ സംരംഭങ്ങൾക്കുള്ള പുതിയ നിലവാരമാണിത്.
അടുത്ത ഘട്ടം: മോഡൽ കാർഡ് പരിശോധിച്ച് Hugging Face-ലെ തത്സമയ ഡെമോ പരീക്ഷിക്കുക: /-colqwen3-embed-8b കൂടാതെ /-colqwen3-embed-4b