ടെക്സ്റ്റിനപ്പുറം: യഥാർഥ മൾട്ടിമോഡൽ സമ്പൂർണ RAG സാധ്യമാക്കുന്നു

സങ്കീർണമായ രേഖകൾ, ചിത്രങ്ങൾ, വീഡിയോകൾ എന്നിവയിൽനിന്ന് പ്രയോജനകരമായ വിവരങ്ങൾ നേരിട്ട് വീണ്ടെടുക്കാൻ മൾട്ടിമോഡൽ എംബെഡ്ഡിങ് മോഡലുകൾ ടീമുകളെ സഹായിക്കുന്നു.

കഴിഞ്ഞ രണ്ട് വർഷമായി, “RAG” (വീണ്ടെടുക്കൽ-വർധിത ജനറേഷൻ) എന്നത് മിക്കവാറും ടെക്സ്റ്റിന്റെ പര്യായമായിരുന്നു. പതിവ് രീതി ലളിതമാണ്: രേഖകളിൽനിന്ന് ടെക്സ്റ്റ് വേർതിരിച്ച് ഭാഗങ്ങളാക്കി സൂചികയിലാക്കുക.

എന്നാൽ സംരംഭലോകം പ്ലെയിൻ ടെക്സ്റ്റ് ഫയലുകളെ മാത്രം ആശ്രയിച്ചല്ല പ്രവർത്തിക്കുന്നത്. സങ്കീർണമായ PDF-കൾ, വിവരസാന്ദ്രമായ ചാർട്ടുകളുള്ള സ്ലൈഡ് ഡെക്കുകൾ, CAD ഡ്രോയിങ്ങുകൾ, സ്കാൻ ചെയ്ത ഇൻവോയ്സുകൾ, കൂടാതെ വർധിച്ചുവരുന്ന വൻ വീഡിയോശേഖരങ്ങൾ എന്നിവയാണ് അതിന്റെ അടിസ്ഥാനം.

എംബെഡ് ചെയ്യുന്നതിനുമുമ്പ് OCR അല്ലെങ്കിൽ വിഷൻ LLM ഉപയോഗിച്ച് ചിത്രത്തിന് ടെക്സ്റ്റ് “അടിക്കുറിപ്പ്” നൽകുന്ന വ്യവസായത്തിലെ പതിവ് രീതി വലിയൊരു തടസ്സമാണ്. അത് മന്ദഗതിയിലും ചെലവേറിയതുമാണ്; യഥാർഥ ഡാറ്റയുടെ സമ്പന്നമായ സ്ഥലപരവും ദൃശ്യപരവുമായ സന്ദർഭം അനിവാര്യമായും നഷ്ടപ്പെടുത്തുകയും ചെയ്യും. സങ്കീർണമായ ഒരു ദൃശ്യം നിങ്ങളുടെ AI “ഒരു ബ്ലൂപ്രിന്റ്” എന്ന് മാത്രം വിവരിച്ചാൽ, അതിനുള്ളിലെ നിർദിഷ്ട വാൽവോ വയറിങ് സ്കീമാറ്റിക്കോ തിരയാനുള്ള കഴിവ് നഷ്ടപ്പെടും.

തുടക്കം മുതൽ അവസാനം വരെയുള്ള ദൃശ്യ വീണ്ടെടുക്കൽ സാധ്യമാക്കി ഈ പ്രശ്നം പരിഹരിക്കാൻ രൂപകൽപ്പന ചെയ്ത, ColPali ആർക്കിടെക്ചറിനെ അടിസ്ഥാനമാക്കിയുള്ള അത്യാധുനിക മൾട്ടിമോഡൽ എംബെഡ്ഡിങ് മോഡലുകളുടെ ഒരു കുടുംബം ഇന്ന് ഞങ്ങൾ പുറത്തിറക്കുന്നു.

മാന്ത്രികതയ്ക്കു പിന്നിലെ എൻജിനീയറിങ്: വിപുലമായ സൂക്ഷ്മക്രമീകരണ തന്ത്രങ്ങൾ

വിപണിയിൽ ലഭ്യമായ ഒരു വിഷൻ-ലാംഗ്വേജ് മോഡലിനോട് (VLM) തിരയാൻ ആവശ്യപ്പെടുന്നതുപോലെ ലളിതമല്ല യഥാർഥത്തിൽ ഫലപ്രദമായ മൾട്ടിമോഡൽ റിട്രീവർ നിർമിക്കുന്നത്. മൾട്ടിമോഡൽ RAG-നെ ചരിത്രപരമായി പിന്നോട്ടടിച്ച വെല്ലുവിളികൾ പരിഹരിച്ച് ColQwen3 സൃഷ്ടിക്കാൻ, മോഡൽ ലയനവും പരിശീലന തന്ത്രങ്ങളും ഞങ്ങൾ ഉപയോഗിച്ചു.

1. ക്രമീകരിച്ച ലയന ഭാരനിർണയത്തിലൂടെ എംബെഡ്ഡിങ് ശേഷി കൈമാറൽ

ഒരു അടിസ്ഥാന മോഡലിനെ ആദ്യം മുതൽ സൂക്ഷ്മക്രമീകരിക്കുന്നതിനുപകരം, നിലവിലുള്ള ടെക്സ്റ്റ് എംബെഡ്ഡിങ് മോഡലിൽനിന്ന് വീണ്ടെടുക്കൽ ടാസ്കുകളിലെ അറിവ് കൈമാറാനുള്ള രീതി ഞങ്ങൾ വികസിപ്പിച്ചു. ഒരു സാധാരണ VLM-ന് ചിത്രങ്ങൾ വിവരിക്കാനറിയാം, എന്നാൽ ഒരു ചോദ്യവുമായി അർഥപരമായി താരതമ്യം ചെയ്ത് അവയെ റാങ്ക് ചെയ്യണമെന്നില്ല.

ഈ വിടവ് നികത്താൻ ക്രമീകരിച്ച ലയന ഭാരനിർണയ തന്ത്രങ്ങൾ ഞങ്ങൾ ഉപയോഗിച്ചു. ടെക്സ്റ്റ് ലേറ്റന്റ് സ്പേസിലെ Qwen3-Embedding-ന്റെ വീണ്ടെടുക്കൽ ശേഷി മൾട്ടിമോഡൽ സ്പേസിലേക്ക് നേരിട്ട് കൈമാറാമെന്നും, ഉടനടി പരിശീലനം നൽകാതെയും അത് ചിത്ര-വീഡിയോ വീണ്ടെടുക്കലിലേക്ക് സാമാന്യവൽക്കരിക്കാമെന്നും പരീക്ഷണങ്ങളിൽ കണ്ടെത്തി. ഈ ഫലപ്രദമായ പ്രാരംഭീകരണം ശക്തമായ തുടക്കമാക്കി, പ്രകടനം കൂടുതൽ മെച്ചപ്പെടുത്താനും കരുത്ത് ഉറപ്പാക്കാനും മോഡലിനെ തുടർന്ന് സൂക്ഷ്മക്രമീകരിച്ചു. Qwen3-VL അടിസ്ഥാന മോഡലിൽനിന്ന് സൂക്ഷ്മക്രമീകരിക്കുന്നതുമായി താരതമ്യം ചെയ്യുമ്പോൾ ഇത് അന്തിമ വീണ്ടെടുക്കൽ പ്രകടനം മെച്ചപ്പെടുത്തുന്നു.

2. സൂക്ഷ്മമായ ഹൈപ്പർ-പാരാമീറ്റർ ക്രമീകരണം

എംബെഡ്ഡിങ് ശേഷികൾ കൈമാറിയശേഷം ഞങ്ങൾ വിന്യാസത്തിൽ ശ്രദ്ധ കേന്ദ്രീകരിച്ചു. വീണ്ടെടുക്കൽ പ്രകടനം പരമാവധിയാക്കാൻ, എപ്പോക്കുകളുടെ അനുയോജ്യമായ എണ്ണം, ബാച്ച് വലുപ്പം, പഠനനിരക്ക്, LoRA റാങ്ക്, ഡാറ്റാസെറ്റുകളുടെ മിശ്രിതം എന്നിവ ഉൾപ്പെടുത്തി സൂക്ഷ്മമായ ഹൈപ്പർ-പാരാമീറ്റർ തിരയലുകളും അബ്ലേഷൻ പഠനങ്ങളും നടത്തി.

സൂക്ഷ്മക്രമീകരണ ഡാറ്റാസെറ്റുകളായി VDR, ColPali പരിശീലന സെറ്റ്, visrag_syn, visrag_ind എന്നിവ തിരഞ്ഞെടുത്തു. സൂക്ഷ്മക്രമീകരണത്തിന് UniMax സാംപ്ലിങ് ഉപയോഗിച്ചു. മോഡൽ ലയനം പ്രയോഗിച്ചതിനാലും ലയിപ്പിച്ച അടിസ്ഥാന മോഡലിന് ഭാഗിക മൾട്ടിമോഡൽ റിട്രീവർ ശേഷി ഇതിനകം ലഭിച്ചതിനാലും, കൂടുതൽ ഡാറ്റാസെറ്റുകൾ ചേർക്കുന്നത് പ്രകടനം അല്പം കുറയ്ക്കുമെന്ന് കണ്ടെത്തി. അതിനാൽ കൂടുതൽ ഡാറ്റാസെറ്റുകളിലേക്ക് വ്യാപിപ്പിച്ചില്ല.

സൂക്ഷ്മക്രമീകരണത്തിനായി ഞങ്ങൾ തിരഞ്ഞെടുത്ത ഹൈപ്പർ-പാരാമീറ്ററുകൾ ഇവയാണ്:

LoRA റാങ്ക്

32

LoRA ആൽഫ

32

LoRA ലക്ഷ്യ മൊഡ്യൂളുകൾ

എംബെഡ്ഡിങ് ഒഴികെയുള്ള ചിത്രത്തിന്റെയും ടെക്സ്റ്റിന്റെയും എല്ലാ പാളികളും

പഠനനിരക്ക്

5e-5

പരമാവധി ദൃശ്യ ടോക്കണുകൾ

1280

പരിശീലന എപ്പോക്കുകൾ

1

ആഗോള ബാച്ച് വലുപ്പം

512

വോംഅപ്പ് അനുപാതം

5%

3. “ColBERT” പ്രതിസന്ധി: ഉയർന്ന പ്രകടനമോ സംഭരണച്ചെലവോ

ചരിത്രപരമായി, “ColBERT-രീതിയിലുള്ള” ടോക്കൺ-തല എംബെഡ്ഡിങ്ങുകൾ ഉപയോഗിക്കുന്ന മോഡലുകൾ (ColPali പോലുള്ളവ) അസാധാരണ പ്രകടനം നൽകിയെങ്കിലും സംഭരണച്ചെലവ് താങ്ങാനാകാത്തതായിരുന്നു. ഓരോ ദൃശ്യ ടോക്കണും സൂചികയിലാക്കിയത് സംരംഭതലത്തിൽ അമിതച്ചെലവുള്ള വൻ വെക്റ്റർ ഡാറ്റാബേസുകൾ സൃഷ്ടിച്ചു.

  • ഒപ്റ്റിമൈസേഷൻ തന്ത്രം: പരമാവധി പ്രകടനം നിലനിർത്തുകയും സംഭരണച്ചെലവ് കുതിച്ചുയരുന്നത് തടയുകയും ചെയ്യുന്ന വിധത്തിൽ എംബെഡ്ഡിങ്ങുകളുടെ വലുപ്പം സൂക്ഷ്മമായി സന്തുലിതമാക്കി സംഭരണ വെല്ലുവിളി പരിഹരിച്ചു. ഈ കാര്യക്ഷമമായ വലുപ്പത്തിൽ അത്യാധുനിക കൃത്യത നിലനിർത്താൻ, വീണ്ടെടുക്കൽ പ്രകടനവും സംഭരണച്ചെലവും ഏറ്റവും സന്തുലിതമാക്കുന്ന ഡൈമെൻഷൻ വലുപ്പമായി 320 തിരഞ്ഞെടുത്തു.

    • അടിസ്ഥാനരീതി: 10 ലക്ഷം ചിത്രങ്ങളുടെ എംബെഡ്ഡിങ്ങുകൾ സംഭരിക്കാൻ സാധാരണ സമീപനത്തിന് (NVIDIA Nemo-3B പോലുള്ളത്) ഏകദേശം 10.3 TB ആവശ്യമാണ് (3,072 ഡൈമെൻഷനിൽ 1,802 ടോക്കണുകൾ).

    • ColQwen3: അതേ 10 ലക്ഷം ചിത്രങ്ങൾ വെറും 0.82 TB-യിൽ സംഭരിക്കുന്നു (320 ഡൈമെൻഷനിൽ പരമാവധി 1,280 ടോക്കണുകൾ).

ക്ലൗഡ് അടിസ്ഥാനസൗകര്യ ബജറ്റ് പെരുപ്പിക്കാതെ ColQwen3 അത്യാധുനിക വീണ്ടെടുക്കൽ കൃത്യത കൈവരിക്കുന്നു.

വിലയിരുത്തൽ ഫലങ്ങൾ

ViDoRe ബെഞ്ച്മാർക്ക് സ്യൂട്ടിൽ ഞങ്ങളുടെ സമീപനം സാധൂകരിച്ചു. പഴയ V1 ടാസ്കുകളിൽ മുൻനിര പ്രകടനം നിലനിർത്തിക്കൊണ്ട്, ഏറ്റവും പുതിയ V3, V2 ബെഞ്ച്മാർക്കുകളിൽ—ഇംഗ്ലീഷിലും ബഹുഭാഷയിലും—ColQwen3 പുതിയ നിലവാരം സ്ഥാപിക്കുന്നതായി ഫലങ്ങൾ സ്ഥിരീകരിക്കുന്നു.

ViDoRe v3 (ഏറ്റവും പുതിയത്)

ഇംഗ്ലീഷ്, ബഹുഭാഷാ വീണ്ടെടുക്കലിൽ ColQwen3-8B മുന്നിലാണ്.

ഇംഗ്ലീഷ് nDCG@5

മോഡൽ

കമ്പ്യൂട്ടർ സയൻസ്

ഊർജം

ധനകാര്യം

മാനവവിഭവശേഷി

വ്യവസായം

ഔഷധമേഖല

ഭൗതികശാസ്ത്രം

ശരാശരി

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

ബഹുഭാഷാ nDCG@5

മോഡൽ

കമ്പ്യൂട്ടർ സയൻസ്

ഊർജം

ധനകാര്യം

മാനവവിഭവശേഷി

വ്യവസായം

ഔഷധമേഖല

ഭൗതികശാസ്ത്രം

ശരാശരി

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2, v1 പ്രധാന ഫലങ്ങൾ

ESG, സാമ്പത്തികശാസ്ത്രം, DocVQA എന്നിവയിലുടനീളം സ്ഥിരമായ ഉയർന്ന പ്രകടനം.

ബെഞ്ച്മാർക്ക്

മോഡൽ

സ്കോർ (ശരാശരി)

ശ്രദ്ധേയമായ വിജയം

ViDoRe V2 (ഇംഗ്ലീഷ്)

ColQwen3-8B

0.6772

ESG, BioMed എന്നിവയിൽ ഒന്നാം സ്ഥാനം

ViDoRe V2 (ബഹുഭാഷാ)

ColQwen3-8B

0.6085

സാമ്പത്തികശാസ്ത്രത്തിൽ ഒന്നാം സ്ഥാനം

ViDoRe V1 (ഇംഗ്ലീഷ്)

Nemo ColEmbed 3B

0.9100

അല്പം ഉയർന്ന ശരാശരി

ViDoRe V1 (ഇംഗ്ലീഷ്)

ColQwen3-8B

0.9076

ArxivQA, Syn-Gov എന്നിവയിൽ ഒന്നാം സ്ഥാനം

വീഡിയോ വീണ്ടെടുക്കൽ: CareBench വിലയിരുത്തൽ

വീഡിയോ വീണ്ടെടുക്കലിലേക്ക് ColQwen3 ശക്തമായി സാമാന്യവൽക്കരിക്കുന്നുവെന്ന് തെളിയിക്കാൻ, ടെക്സ്റ്റ്-ടു-വീഡിയോ (പൊതുവായ വീണ്ടെടുക്കൽ) ടാസ്കുകൾക്കായുള്ള CareBench ബെഞ്ച്മാർക്കിൽ മോഡലുകൾ വിലയിരുത്തി.

ഈ വിലയിരുത്തലിൽ ഞങ്ങൾ അസംസ്കൃത വീഡിയോ എൻകോഡിങ് സമീപനം ഉപയോഗിച്ചു: അധിക ടെക്സ്റ്റ് വ്യാഖ്യാനങ്ങളോ മെറ്റാഡാറ്റ ഇൻപുട്ടുകളോ ഇല്ലാതെ മോഡലുകൾ വീഡിയോ ഫയലുകൾ നേരിട്ട് എൻകോഡ് ചെയ്തു. ദൃശ്യ അർഥഘടന മാത്രം അടിസ്ഥാനമാക്കി വീണ്ടെടുക്കാനുള്ള മോഡലിന്റെ കഴിവ് ഇത് വ്യക്തമാക്കുന്നു.

മോഡൽ

റീകോൾ@1

റീകോൾ@5

റീകോൾ@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“ഡാർക്ക് ഡാറ്റ” പ്രയോജനപ്പെടുത്തുന്നു: വീഡിയോയിലെ അത്യാധുനിക മേഖല

വീഡിയോയെ രേഖകൾപോലെ തന്നെ കൈകാര്യം ചെയ്യാനുള്ള ColQwen3-യുടെ കഴിവാണ് അതു സാധ്യമാക്കുന്ന ഏറ്റവും സുപ്രധാന മാറ്റങ്ങളിലൊന്ന്. പല സംരംഭങ്ങളിലും വീഡിയോ “ഡാർക്ക് ഡാറ്റ” ആണ്. ഓരോ ഫയലും ഒരാൾ നേരിട്ട് ടാഗ് ചെയ്തിട്ടില്ലെങ്കിൽ, തിരയാനാകാതെ അത് കോൾഡ് സ്റ്റോറേജിൽ കിടക്കും.

വിഭജിച്ച ക്ലിപ്പുകളിൽ ഫ്രെയിം അടിസ്ഥാനത്തിലുള്ള വീണ്ടെടുക്കൽ സാധ്യമാക്കി ColQwen3 ഇതു മാറ്റുന്നു.

ഉപയോഗസാഹചര്യം: സ്ഥാപനത്തിന്റെ ഓർമശേഖരം

സംരംഭങ്ങൾ ദിവസേന ആയിരക്കണക്കിന് മണിക്കൂർ ആഭ്യന്തര വീഡിയോ മീറ്റിങ്ങുകൾ റെക്കോർഡ് ചെയ്യുന്നുണ്ടെങ്കിലും, സാധാരണയായി അവ ഉപയോഗശൂന്യമായി മറഞ്ഞുപോകുന്നു.

  • പ്രവർത്തനക്രമം: ദീർഘമായ മീറ്റിങ് റെക്കോർഡിങ്ങുകൾ യുക്തിസഹമായ ചെറിയ ക്ലിപ്പുകളായി സ്വയം വിഭജിച്ച് ColQwen3 ഉപയോഗിച്ച് സൂചികയിലാക്കുമ്പോൾ, തിരയാനാകുന്ന ഒരു “സ്ഥാപന ഓർമ” സൃഷ്ടിക്കാം.

  • ചോദ്യം: ഒരു പ്രോജക്റ്റ് മാനേജർക്ക് ഇങ്ങനെ ചോദിക്കാം: “API-യിലെ ലേറ്റൻസി പ്രശ്നം എൻജിനീയറിങ് മേധാവി വിശദീകരിച്ച ക്ലിപ്പ് കാണിക്കൂ.”

  • ഫലം: 60 മിനിറ്റ് വീഡിയോ ഫയൽ നൽകുന്നതിനുപകരം, ആ പ്രത്യേക ഡയഗ്രം സ്ക്രീനിൽ പങ്കുവെച്ച് ചർച്ച ചെയ്ത കൃത്യമായ 45 സെക്കൻഡ് ഭാഗം സിസ്റ്റം വീണ്ടെടുക്കുന്നു. ആ നിമിഷത്തിൽ സംസാരിച്ചവർ “ലേറ്റൻസി” എന്ന വാക്ക് പറഞ്ഞില്ലെങ്കിലും ഇതു സാധ്യമാണ്.

സംരംഭ ഉപയോഗസാഹചര്യങ്ങൾ: ഉയർന്ന മൂല്യമുള്ള പ്രശ്നപരിഹാരം

നേറ്റീവ് മൾട്ടിമോഡൽ എംബെഡ്ഡിങ്ങിലേക്കുള്ള മാറ്റം വ്യവസായങ്ങളിലുടനീളം പുതിയ പ്രവർത്തനക്രമങ്ങൾ സാധ്യമാക്കുന്നു. ഏറ്റവും സങ്കീർണമായ ചില സംരംഭ ഡാറ്റാ പരിതസ്ഥിതികളുമായി താരതമ്യം ചെയ്ത് ഈ മോഡലിനെ ഞങ്ങൾ വിപുലമായി ബെഞ്ച്മാർക്ക് ചെയ്തിട്ടുണ്ട്.

1. ബെഞ്ച്മാർക്ക് സവിശേഷത: നഗര ഉപദേശവും വാസ്തുവിദ്യയും

മാസ്റ്റർ പ്ലാനുകൾ, സോണിങ് മാപ്പുകൾ, സങ്കീർണമായ വാസ്തുവിദ്യാ എലിവേഷനുകൾ എന്നിവയുടെ വലിയ ശേഖരം കൈകാര്യം ചെയ്യുന്ന നഗര ഉപദേശക സ്ഥാപനങ്ങൾ നേരിടുന്ന ഡാറ്റാ വെല്ലുവിളികളിൽ ColQwen3 പരീക്ഷിച്ചു.

  • വെല്ലുവിളി: ഇത്തരം പരിതസ്ഥിതികളിൽ പരമ്പരാഗത RAG പൈപ്പ്‌ലൈനുകൾ ബുദ്ധിമുട്ടുന്നു. സങ്കീർണമായ സൈറ്റ് പ്ലാനുകൾക്ക് OCR ഉപകരണങ്ങൾ സാധാരണയായി “സ്കീമാറ്റിക്” എന്നു മാത്രം അടിക്കുറിപ്പിടുന്നതിനാൽ ഗതാഗത പ്രവാഹം, ഹരിത മേഖലകൾ, കെട്ടിടത്തിന്റെ പിന്നോട്ടുള്ള അകലം തുടങ്ങിയ നിർണായക വിവരങ്ങൾ നഷ്ടപ്പെടുന്നു.

  • പ്രകടനം: ചെലവേറിയ OCR/അടിക്കുറിപ്പിടൽ മുൻപ്രോസസ്സിങ്ങിന്റെ ആവശ്യം ColQwen3 ഫലപ്രദമായി ഒഴിവാക്കുന്നുവെന്ന് ഞങ്ങളുടെ ആഭ്യന്തര ബെഞ്ച്മാർക്കുകൾ തെളിയിക്കുന്നു. വളരെ സാന്ദ്രമായ വാസ്തുവിദ്യാ ഡ്രോയിങ്ങുകളിലെ പരീക്ഷണങ്ങളിൽ, കാൽനട പ്രവേശനകവാടങ്ങളോ വ്യത്യസ്തമായ സോണിങ് അതിരുകളോ പോലുള്ള പ്രത്യേക ദൃശ്യസൂചകങ്ങൾ അടിസ്ഥാനമാക്കി മോഡൽ രേഖകൾ വിജയകരമായി വീണ്ടെടുത്തു. ടെക്സ്റ്റ്-മാത്രം അടിസ്ഥാനരീതികളെക്കാൾ ഏറെ മെച്ചപ്പെട്ട പ്രകടനത്തിനൊപ്പം വിജ്ഞാന ഉൾപ്പെടുത്തൽ ചെലവ് ഗണ്യമായി കുറയ്ക്കാനും ഇതിന് കഴിയും.

2. സങ്കീർണമായ ധനകാര്യ-വിപണി ഇൻ്റലിജൻസ്

നിക്ഷേപ ബാങ്കർമാരും വിശകലന വിദഗ്ധരും വാർഷിക റിപ്പോർട്ടുകളും നിക്ഷേപക ഡെക്കുകളും പരിശോധിക്കാൻ ആയിരക്കണക്കിന് മണിക്കൂർ ചെലവഴിക്കുന്നു.

  • പ്രവർത്തനക്രമം: ഒരു വിശകലന വിദഗ്ധന് ഇങ്ങനെ ചോദിക്കാം: “2024-ലെ സ്ലൈഡ് ഡെക്കുകളിൽനിന്ന് APAC വരുമാനവും EMEA വരുമാനവും തമ്മിലുള്ള വിഭജനം കണ്ടെത്തൂ.”

  • മാറ്റം: കീവേഡ് പൊരുത്തങ്ങളെ ആശ്രയിക്കുന്നതിനുപകരം, നിർദിഷ്ട ഡാറ്റാ ദൃശ്യവൽക്കരണത്തിന്റെ സാന്നിധ്യം അടിസ്ഥാനമാക്കി മോഡൽ കൃത്യമായ സ്ലൈഡ് വീണ്ടെടുക്കുന്നു. അതിനാൽ RAG സിസ്റ്റത്തിന് ഉയർന്ന കൃത്യതയോടെ ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകാം.

3. വ്യാവസായിക ഉൽപ്പാദനവും ഫീൽഡ് സേവനവും

നിർമാണ സ്ഥാപനങ്ങൾക്ക് സാങ്കേതിക മാനുവലുകളുടെയും പൈപ്പിങ് ഡയഗ്രാമുകളുടെയും (P&ID) വലിയ ശേഖരങ്ങളുണ്ട്.

  • പ്രവർത്തനക്രമം: ടർബൈൻ അറ്റകുറ്റപ്പണി നടത്തുന്ന ഒരു ഫീൽഡ് എൻജിനീയർക്ക് ഭാഗത്തിന്റെ ഫോട്ടോയെടുക്കുകയോ ഇങ്ങനെ ചോദിക്കുകയോ ചെയ്യാം: “ഹൈഡ്രോളിക് പമ്പ് അസംബ്ലിയുടെ വയറിങ് ഡയഗ്രം കാണിക്കൂ.”

  • മാറ്റം: വയറിങ് ഡയഗ്രാമിന്റെ ദൃശ്യാവിഷ്കാരം ColQwen3 തിരിച്ചറിഞ്ഞ് ശരിയായ പേജ് വീണ്ടെടുക്കുന്നു. ഇതിലൂടെ പ്രവർത്തനരഹിത സമയം മണിക്കൂറുകളോളം കുറയ്ക്കാനാകും.

4. നിയമവും അനുസരണവും

നിയമപരമായ തെളിവുശേഖരണത്തിൽ ലക്ഷ്യം പലപ്പോഴും ഒരു ദൃശ്യസൂചകമായതിനാൽ, സ്കാൻ ചെയ്ത ദശലക്ഷക്കണക്കിന് പേജുകൾ പരിശോധിക്കേണ്ടിവരുന്നു.

  • പ്രവർത്തനക്രമം: ഒരു അനുസരണ ഉദ്യോഗസ്ഥന് “CFO ഒപ്പിട്ട രേഖകൾ” എന്നോ “ഔദ്യോഗിക ‘രഹസ്യം’ മുദ്രയുള്ള കരാറുകൾ” എന്നോ തിരയാം.

  • മാറ്റം: ഒപ്പുകളുടെയോ മുദ്രകളുടെയോ ദൃശ്യസാന്നിധ്യം അടിസ്ഥാനമാക്കി കരടും അന്തിമ രേഖയും മോഡൽ വേർതിരിച്ചറിയുന്നു. ശുദ്ധമായ OCR പലപ്പോഴും കാണാതെപോകുന്ന കാര്യമാണിത്.

ആരംഭിക്കുക

ColQwen3 തുറന്ന ഭാരങ്ങളുള്ളതാണ് (Apache 2.0); ഇപ്പോൾ Hugging Face-ൽ ലഭ്യമാണ്. ടെക്സ്റ്റ്, ചിത്രങ്ങൾ, വീഡിയോ എന്നിവ ഉടൻ പ്രോസസ് ചെയ്യാൻ ആവശ്യമായ ഇൻഫറൻസ് കോഡ് നൽകുന്ന, ആധുനിക RAG പൈപ്പ്‌ലൈനുകളിൽ നേരിട്ട് ചേർക്കാവുന്ന അപ്‌ഗ്രേഡായാണ് ഇത് രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്.

ലളിതമായ ടെക്സ്റ്റ് തിരയലിനപ്പുറം നീങ്ങി ദൃശ്യ ആസ്തികളിൽ കുടുങ്ങിക്കിടക്കുന്ന ഇൻ്റലിജൻസ് പ്രയോജനപ്പെടുത്താൻ തയ്യാറായ സംരംഭങ്ങൾക്കുള്ള പുതിയ നിലവാരമാണിത്.

അടുത്ത ഘട്ടം: മോഡൽ കാർഡ് പരിശോധിച്ച് Hugging Face-ലെ തത്സമയ ഡെമോ പരീക്ഷിക്കുക: /-colqwen3-embed-8b കൂടാതെ /-colqwen3-embed-4b

രചയിതാവ്

Xin Huang, Kye Min Tan