ટેક્સ્ટથી આગળ: સાચું બહુવિધ-માધ્યમ, શરૂઆતથી અંત સુધીનું RAG

બહુવિધ-માધ્યમ એમ્બેડિંગ મોડલો ટીમોને જટિલ દસ્તાવેજો, છબીઓ અને વિડિયોમાંથી સીધી ઉપયોગી માહિતી મેળવવામાં મદદ કરે છે.

છેલ્લાં બે વર્ષથી “RAG” (પુનઃપ્રાપ્તિ-સંવર્ધિત સર્જન) લગભગ સંપૂર્ણપણે ટેક્સ્ટનો પર્યાય બની ગયું છે. પ્રમાણભૂત રીત સરળ છે: દસ્તાવેજોમાંથી ટેક્સ્ટ કાઢો, તેના ટુકડા કરો અને તેને અનુક્રમિત કરો.

પરંતુ કંપનીઓની દુનિયા સાદી ટેક્સ્ટ ફાઇલો પર ચાલતી નથી. તે જટિલ PDF, ગીચ આલેખવાળી સ્લાઇડ પ્રસ્તુતિઓ, CAD રેખાંકનો, સ્કૅન કરેલા ચલણો અને વધતા જતા વિશાળ વિડિયો સંગ્રહો પર ચાલે છે.

એમ્બેડિંગ પહેલાં OCR અથવા વિઝન LLM વડે છબીનું ટેક્સ્ટમાં “વર્ણન” કરવાની ઉદ્યોગની પ્રમાણભૂત રીત બહુ મોટો અવરોધ છે. તે ધીમી અને મોંઘી છે તથા મૂળ ડેટાનો સમૃદ્ધ અવકાશી અને દૃશ્ય સંદર્ભ અનિવાર્યપણે ગુમાવે છે. તમારું AI કોઈ જટિલ દૃશ્યને માત્ર “બ્લૂપ્રિન્ટ” તરીકે વર્ણવે તો તમે તેની અંદરનો ચોક્કસ વાલ્વ કે વાયરિંગની યોજનાકીય આકૃતિ શોધવાની ક્ષમતા ગુમાવી દીધી છે.

આજે અમે ColPali આર્કિટેક્ચર પર આધારિત અદ્યતન બહુવિધ-માધ્યમ એમ્બેડિંગ મોડલોનો પરિવાર રજૂ કરી રહ્યા છીએ, જે શરૂઆતથી અંત સુધી દૃશ્ય પુનઃપ્રાપ્તિ શક્ય બનાવીને આ સમસ્યા ઉકેલવા રચાયો છે.

આ ચમત્કાર પાછળનું એન્જિનિયરિંગ: અદ્યતન સૂક્ષ્મ-સમાયોજન વ્યૂહરચનાઓ

ખરેખર અસરકારક બહુવિધ-માધ્યમ પુનઃપ્રાપક બનાવવા માટે તૈયાર વિઝન-લેંગ્વેજ મોડલ (VLM) લઈને તેને શોધવાનું કહેવું પૂરતું નથી. બહુવિધ-માધ્યમ RAGને ઐતિહાસિક રીતે રોકતા પડકારો ઉકેલવા અને ColQwen3 બનાવવા માટે અમે મોડલ વિલય અને તાલીમ વ્યૂહરચનાઓ અપનાવી.

1. સમાયોજિત સંયુક્ત ભારાંકન દ્વારા એમ્બેડિંગ ક્ષમતાનું સ્થાનાંતરણ

પાયાના મોડલને શરૂઆતથી સૂક્ષ્મ-સમાયોજિત કરવાને બદલે અમે હાલના ટેક્સ્ટ એમ્બેડિંગ મોડલમાંથી પુનઃપ્રાપ્તિ કાર્યોનું જ્ઞાન સ્થાનાંતરિત કરવાની પદ્ધતિ વિકસાવી. પ્રમાણભૂત VLM છબીઓનું વર્ણન કરી શકે છે, પરંતુ પ્રશ્નની સામે અર્થના આધારે તેમનો ક્રમ નક્કી કરવાનું તેને આવડતું જ હોય એવું નથી.

આ અંતર દૂર કરવા અમે સમાયોજિત સંયુક્ત ભારાંકન વ્યૂહરચનાઓ અપનાવી. અમારા પ્રયોગોમાં જાણવા મળ્યું કે ટેક્સ્ટના સુપ્ત અવકાશમાં Qwen3-Embeddingની પુનઃપ્રાપ્તિ ક્ષમતા સીધી બહુવિધ-માધ્યમ અવકાશમાં સ્થાનાંતરિત થઈ શકે છે અને તાત્કાલિક તાલીમ વિના પણ છબી તથા વિડિયો પુનઃપ્રાપ્તિ માટે સામાન્યીકરણ કરી શકે છે. આ અસરકારક આરંભને મજબૂત પ્રારંભબિંદુ તરીકે વાપરીને પછી અમે પ્રદર્શનને વધુ શ્રેષ્ઠ બનાવવા અને મજબૂતી સુનિશ્ચિત કરવા મોડલનું સૂક્ષ્મ-સમાયોજન કર્યું. Qwen3-VLના પાયાના મોડલથી કરેલા સૂક્ષ્મ-સમાયોજનની સરખામણીમાં તે અંતિમ પુનઃપ્રાપ્તિ પ્રદર્શન સુધારે છે.

2. હાઇપર-પેરામીટરનું સાવચેતીપૂર્વક સમાયોજન

એમ્બેડિંગ ક્ષમતાઓ સ્થાનાંતરિત થયા પછી અમે સંરેખણ પર ધ્યાન કેન્દ્રિત કર્યું. પુનઃપ્રાપ્તિ પ્રદર્શન મહત્તમ કરવા અમે શ્રેષ્ઠ તાલીમચક્રોની સંખ્યા, બૅચનું કદ, શીખવાનો દર, LoRA ક્રમ અને ડેટાસેટના મિશ્રણ સહિત હાઇપર-પેરામીટરની સાવચેતીપૂર્વક શોધ અને ઘટક-નિવારણ અભ્યાસ કર્યા.

સૂક્ષ્મ-સમાયોજન માટે અમે VDR, ColPali તાલીમ સમૂહ, visrag_syn, અને visrag_ind ડેટાસેટ પસંદ કર્યા. સૂક્ષ્મ-સમાયોજન માટે અમે UniMax નમૂના-પસંદગીનો ઉપયોગ કર્યો. અમે મોડલ વિલય કર્યો હોવાથી અને પાયાના સંયુક્ત મોડલને બહુવિધ-માધ્યમ પુનઃપ્રાપકની આંશિક ક્ષમતા પહેલેથી મળી હોવાથી વધુ ડેટાસેટ ઉમેરવાથી પ્રદર્શન થોડું ઘટતું હોવાનું અમને જણાયું. તેથી અમે વધુ ડેટાસેટ સુધી વિસ્તરણ કર્યું નહીં.

સૂક્ષ્મ-સમાયોજન માટે અમે પસંદ કરેલા હાઇપર-પેરામીટર આ રહ્યા:

LoRA ક્રમ

32

LoRA આલ્ફા

32

LoRA લક્ષ્ય મોડ્યુલ

એમ્બેડિંગ સિવાય છબી અને ટેક્સ્ટ બંનેનાં તમામ સ્તરો

શીખવાનો દર

5e-5

મહત્તમ દૃશ્ય ટોકન

1280

તાલીમચક્રો

1

વૈશ્વિક બૅચનું કદ

512

વૉર્મઅપ ગુણોત્તર

5%

3. “ColBERT” દ્વિધા: ઉચ્ચ પ્રદર્શન સામે સંગ્રહ ખર્ચ

ઐતિહાસિક રીતે “ColBERT-શૈલી”નાં ટોકન-સ્તરના એમ્બેડિંગ વાપરતાં મોડલો (જેમ કે ColPali) અદ્ભુત પ્રદર્શન આપતાં હતાં, પરંતુ તેનો સંગ્રહ ખર્ચ પરવડે તેમ નહોતો. દરેક દૃશ્ય ટોકનને અનુક્રમિત કરવાથી એટલા વિશાળ વેક્ટર ડેટાબેઝ બનતા કે કંપનીના સ્તરે તેનો ખર્ચ ઘણો વધારે પડતો.

  • શ્રેષ્ઠીકરણ વ્યૂહરચના: સંગ્રહ ખર્ચને બેફામ વધતો રોકીને મહત્તમ પ્રદર્શન જાળવવા અમે એમ્બેડિંગનું કદ સાવચેતીપૂર્વક સંતુલિત કર્યું અને સંગ્રહનો પડકાર ઉકેલ્યો. આ કાર્યક્ષમ કદમાં અત્યાધુનિક ચોકસાઈ જાળવવા માટે અમે પુનઃપ્રાપ્તિ પ્રદર્શન અને સંગ્રહ ખર્ચનું સૌથી સંતુલિત સંયોજન આપતું 320 પરિમાણનું કદ પસંદ કર્યું.

    • આધારરેખા: પ્રમાણભૂત અભિગમ (જેમ કે NVIDIA Nemo-3B)માં 10 લાખ છબીઓનાં એમ્બેડિંગ સંગ્રહવા અંદાજે 10.3 TB જોઈએ છે (1,802 ટોકન @ 3,072 પરિમાણ).

    • ColQwen3: એ જ 10 લાખ છબીઓ માત્ર 0.82 TBમાં સંગ્રહે છે (મહત્તમ 1,280 ટોકન @ 320 પરિમાણ).

ColQwen3 ક્લાઉડ માળખાના બજેટને અતિશય વધાર્યા વિના અત્યાધુનિક પુનઃપ્રાપ્તિ ચોકસાઈ હાંસલ કરે છે.

મૂલ્યાંકનનાં પરિણામો

અમે ViDoRe બેન્ચમાર્ક સ્યુટ પર અમારા અભિગમને માન્ય ઠરાવ્યો. પરિણામો પુષ્ટિ કરે છે કે ColQwen3 નવીનતમ V3 અને V2 બેન્ચમાર્કમાં (અંગ્રેજી અને બહુભાષી બંનેમાં) નવા માપદંડ સ્થાપે છે અને જૂના V1 કાર્યોમાં પણ શ્રેષ્ઠ સ્તરનું પ્રદર્શન જાળવે છે.

ViDoRe v3 (નવીનતમ)

અંગ્રેજી અને બહુભાષી પુનઃપ્રાપ્તિમાં ColQwen3-8B અગ્રેસર છે.

અંગ્રેજી nDCG@5

મોડલ

કમ્પ્યુટર વિજ્ઞાન

ઊર્જા

નાણાકીય ક્ષેત્ર

માનવ સંસાધન

ઉદ્યોગ

ઔષધ ક્ષેત્ર

ભૌતિકશાસ્ત્ર

સરેરાશ

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

બહુભાષી nDCG@5

મોડલ

કમ્પ્યુટર વિજ્ઞાન

ઊર્જા

નાણાકીય ક્ષેત્ર

માનવ સંસાધન

ઉદ્યોગ

ઔષધ ક્ષેત્ર

ભૌતિકશાસ્ત્ર

સરેરાશ

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 અને v1ની મુખ્ય વિશેષતાઓ

ESG, અર્થશાસ્ત્ર અને DocVQAમાં સતત ઉચ્ચ પ્રદર્શન.

બેન્ચમાર્ક

મોડલ

સ્કોર (સરેરાશ)

નોંધપાત્ર જીત

ViDoRe V2 (અંગ્રેજી)

ColQwen3-8B

0.6772

ESG અને BioMedમાં પ્રથમ સ્થાન

ViDoRe V2 (બહુભાષી)

ColQwen3-8B

0.6085

અર્થશાસ્ત્રમાં પ્રથમ સ્થાન

ViDoRe V1 (અંગ્રેજી)

Nemo ColEmbed 3B

0.9100

સરેરાશ સહેજ વધુ

ViDoRe V1 (અંગ્રેજી)

ColQwen3-8B

0.9076

ArxivQA અને Syn-Govમાં પ્રથમ સ્થાન

વિડિયો પુનઃપ્રાપ્તિ: CareBench મૂલ્યાંકન

વિડિયો પુનઃપ્રાપ્તિમાં પણ ColQwen3નું મજબૂત સામાન્યીકરણ દર્શાવવા માટે અમે ટેક્સ્ટ-ટુ-વિડિયો (સામાન્ય પુનઃપ્રાપ્તિ) કાર્યો માટે CareBench બેન્ચમાર્ક પર મોડલોનું મૂલ્યાંકન કર્યું.

આ મૂલ્યાંકન માટે અમે કાચા વિડિયોના એન્કોડિંગનો અભિગમ અપનાવ્યો: અમારા મોડલોએ કોઈ વધારાની લેખિત નોંધ કે મેટાડેટા ઇનપુટ વિના સીધી વિડિયો ફાઇલો એન્કોડ કરી. આ સંપૂર્ણપણે દૃશ્ય અર્થવિજ્ઞાનના આધારે પુનઃપ્રાપ્તિ કરવાની મોડલની ક્ષમતા દર્શાવે છે.

મોડલ

રિકૉલ@1

રિકૉલ@5

રિકૉલ@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“અપ્રાપ્ય ડેટા”ને સુલભ બનાવવું: વિડિયોની અત્યાધુનિક સીમા

ColQwen3થી શક્ય બનેલા સૌથી મોટા ફેરફારોમાંનો એક વિડિયોને દસ્તાવેજની જેમ જ સમજવાની તેની ક્ષમતા છે. ઘણી કંપનીઓમાં વિડિયો “અપ્રાપ્ય ડેટા” બની રહે છે. તે કોલ્ડ સ્ટોરેજમાં પડ્યો રહે છે અને કોઈ વ્યક્તિ દરેક ફાઇલને જાતે ટૅગ ન કરે ત્યાં સુધી તેને શોધી શકાતો નથી.

વિભાજિત ક્લિપમાં ફ્રેમ પ્રમાણે પુનઃપ્રાપ્તિ શક્ય બનાવીને ColQwen3 આ સ્થિતિ બદલે છે.

ઉપયોગનું વિશેષ ઉદાહરણ: કંપનીનો સ્મૃતિભંડાર

કંપનીઓ દરરોજ હજારો કલાકની આંતરિક વિડિયો મીટિંગ રેકોર્ડ કરે છે અને સામાન્ય રીતે આ રેકોર્ડિંગ ક્યાંક ખોવાઈ જાય છે.

  • કાર્યપ્રવાહ: મીટિંગનાં લાંબાં રેકોર્ડિંગને આપમેળે ટૂંકી, તાર્કિક ક્લિપમાં વિભાજિત કરીને અને ColQwen3થી અનુક્રમિત કરીને તમે શોધી શકાય તેવી “કંપનીની સ્મૃતિ” બનાવો છો.

  • પ્રશ્ન: પ્રોજેક્ટ મેનેજર પૂછી શકે છે: “એ ક્લિપ બતાવો જેમાં એન્જિનિયરિંગના વડાએ APIની વિલંબની સમસ્યા સમજાવી હતી.”

  • પરિણામ: સિસ્ટમ 60 મિનિટની વિડિયો ફાઇલ આપવાને બદલે એ ચોક્કસ 45 સેકન્ડનો ભાગ શોધી આપે છે, જેમાં ચોક્કસ આકૃતિ સ્ક્રીન પર બતાવીને તેની ચર્ચા થઈ હતી. એ ક્ષણે વક્તાઓએ “વિલંબ” શબ્દ સ્પષ્ટપણે ન કહ્યો હોય તો પણ આવું શક્ય બને છે.

કંપનીઓમાં ઉપયોગ: અત્યંત મૂલ્યવાન સમસ્યાઓનું નિરાકરણ

મૂળભૂત બહુવિધ-માધ્યમ એમ્બેડિંગ તરફનો બદલાવ વિવિધ ઉદ્યોગોમાં સાવ નવા કાર્યપ્રવાહ શક્ય બનાવે છે. અમે અત્યંત જટિલ કંપની ડેટા વાતાવરણોમાં આ મોડલનું વ્યાપક બેન્ચમાર્કિંગ કર્યું છે.

1. બેન્ચમાર્કની મુખ્ય વિશેષતા: શહેરી પરામર્શ અને સ્થાપત્ય

અમે શહેરી પરામર્શ કંપનીઓ સામે આવતા ડેટાના પડકારો પર ColQwen3નું પરીક્ષણ કર્યું. આ કંપનીઓ માસ્ટર પ્લાન, ઝોનિંગ નકશા અને જટિલ સ્થાપત્ય ઊર્ધ્વદર્શનોના વિશાળ સંગ્રહ સંભાળે છે.

  • પડકાર: આવા વાતાવરણમાં પરંપરાગત RAG પાઇપલાઇન અસરકારક રીતે કામ કરી શકતી નથી. OCR સાધનો સામાન્ય રીતે જટિલ સાઇટ પ્લાનને માત્ર “યોજનાકીય આકૃતિ” કહે છે અને વાહનવ્યવહારનો પ્રવાહ, હરિયાળા વિસ્તારો કે ઇમારતના સેટબૅક જેવી મહત્વપૂર્ણ વિગતો ચૂકી જાય છે.

  • પ્રદર્શન: અમારા આંતરિક બેન્ચમાર્ક દર્શાવે છે કે ColQwen3 મોંઘી OCR/કૅપ્શનિંગ પૂર્વ-પ્રક્રિયાની જરૂરિયાતને અસરકારક રીતે ટાળે છે. અતિ ગીચ સ્થાપત્ય રેખાંકનોના પરીક્ષણમાં મોડલે પદયાત્રી પ્રવેશબિંદુઓ કે સ્પષ્ટ ઝોનિંગ સીમાઓ જેવાં ચોક્કસ દૃશ્ય ચિહ્નોના આધારે દસ્તાવેજો સફળતાપૂર્વક શોધ્યા. તેણે માત્ર ટેક્સ્ટ આધારિત આધારરેખાઓ કરતાં ઘણું સારું પ્રદર્શન કર્યું અને જ્ઞાન ગ્રહણનો ખર્ચ નોંધપાત્ર રીતે ઘટાડવાની સંભાવના દર્શાવી.

2. જટિલ નાણાકીય અને બજાર ઇન્ટેલિજન્સ

રોકાણ બૅન્કરો અને વિશ્લેષકો વાર્ષિક અહેવાલો તથા રોકાણકાર પ્રસ્તુતિઓ તપાસવામાં હજારો કલાક વિતાવે છે.

  • કાર્યપ્રવાહ: વિશ્લેષક પૂછી શકે છે, “2024ની સ્લાઇડ પ્રસ્તુતિઓમાંથી APAC અને EMEAની આવકનું વિભાજન શોધો.”

  • બદલાવ: કીવર્ડના મેળ પર આધાર રાખવાને બદલે મોડલ ચોક્કસ ડેટા દૃશ્યાંકનની દૃશ્ય હાજરીના આધારે યોગ્ય સ્લાઇડ શોધે છે, જેથી RAG સિસ્ટમ ખૂબ ચોકસાઈથી પ્રશ્નોના જવાબ આપી શકે છે.

3. ઔદ્યોગિક ઉત્પાદન અને સ્થળ પરની સેવા

ઉત્પાદન કંપનીઓ પાસે ટેક્નિકલ માર્ગદર્શિકાઓ અને પાઇપિંગ આકૃતિઓ (P&ID)ના વિશાળ સંગ્રહ હોય છે.

  • કાર્યપ્રવાહ: ટર્બાઇન સુધારતો સ્થળ પરનો ઇજનેર કોઈ ભાગનો ફોટો લઈ શકે અથવા પૂછી શકે છે, “હાઇડ્રોલિક પંપ એસેમ્બલી માટેની વાયરિંગ આકૃતિ બતાવો.”

  • બદલાવ: ColQwen3 વાયરિંગ આકૃતિનું દૃશ્ય નિરૂપણ ઓળખીને યોગ્ય પાનું શોધે છે, જેનાથી સંભવિત રીતે ઘણા કલાકનો નિષ્ક્રિય સમય બચી શકે છે.

4. કાયદો અને અનુપાલન

કાનૂની તપાસમાં લાખો સ્કૅન કરેલાં પાનાંની સમીક્ષા કરવી પડે છે, જેમાં શોધવાની મહત્વપૂર્ણ વસ્તુ ઘણી વાર કોઈ દૃશ્ય ચિહ્ન હોય છે.

  • કાર્યપ્રવાહ: અનુપાલન અધિકારી “મુખ્ય નાણાકીય અધિકારીએ સહી કરેલા દસ્તાવેજો” અથવા “સત્તાવાર ‘ગોપનીય’ મહોરવાળા કરારો” શોધી શકે છે.

  • બદલાવ: મોડલ સહી કે મહોરની દૃશ્ય હાજરીના આધારે મુસદ્દા અને અંતિમ દસ્તાવેજ વચ્ચેનો તફાવત ઓળખે છે, જે માત્ર OCR ઘણી વાર ચૂકી જાય છે.

શરૂઆત કરો

ColQwen3 ખુલ્લા ભારાંકવાળું (Apache 2.0) છે અને હવે Hugging Face પર ઉપલબ્ધ છે. અમે તેને આધુનિક RAG પાઇપલાઇન માટે સીધા જોડી શકાય એવા સુધારા તરીકે બનાવ્યું છે, જેમાં ટેક્સ્ટ, છબીઓ અને વિડિયો પર તરત પ્રક્રિયા કરવા માટે જરૂરી અનુમાન કોડ મળે છે.

સરળ ટેક્સ્ટ શોધથી આગળ વધીને પોતાની દૃશ્ય સામગ્રીમાં છુપાયેલી ઇન્ટેલિજન્સને સુલભ બનાવવા તૈયાર કંપનીઓ માટે આ નવો માપદંડ છે.

આગલું પગલું: મોડલ કાર્ડ જુઓ અને Hugging Face પર જીવંત પ્રદર્શન અજમાવો: /-colqwen3-embed-8b અને /-colqwen3-embed-4b

લેખક

Xin Huang, Kye Min Tan