છેલ્લાં બે વર્ષથી “RAG” (પુનઃપ્રાપ્તિ-સંવર્ધિત સર્જન) લગભગ સંપૂર્ણપણે ટેક્સ્ટનો પર્યાય બની ગયું છે. પ્રમાણભૂત રીત સરળ છે: દસ્તાવેજોમાંથી ટેક્સ્ટ કાઢો, તેના ટુકડા કરો અને તેને અનુક્રમિત કરો.
પરંતુ કંપનીઓની દુનિયા સાદી ટેક્સ્ટ ફાઇલો પર ચાલતી નથી. તે જટિલ PDF, ગીચ આલેખવાળી સ્લાઇડ પ્રસ્તુતિઓ, CAD રેખાંકનો, સ્કૅન કરેલા ચલણો અને વધતા જતા વિશાળ વિડિયો સંગ્રહો પર ચાલે છે.
એમ્બેડિંગ પહેલાં OCR અથવા વિઝન LLM વડે છબીનું ટેક્સ્ટમાં “વર્ણન” કરવાની ઉદ્યોગની પ્રમાણભૂત રીત બહુ મોટો અવરોધ છે. તે ધીમી અને મોંઘી છે તથા મૂળ ડેટાનો સમૃદ્ધ અવકાશી અને દૃશ્ય સંદર્ભ અનિવાર્યપણે ગુમાવે છે. તમારું AI કોઈ જટિલ દૃશ્યને માત્ર “બ્લૂપ્રિન્ટ” તરીકે વર્ણવે તો તમે તેની અંદરનો ચોક્કસ વાલ્વ કે વાયરિંગની યોજનાકીય આકૃતિ શોધવાની ક્ષમતા ગુમાવી દીધી છે.
આજે અમે ColPali આર્કિટેક્ચર પર આધારિત અદ્યતન બહુવિધ-માધ્યમ એમ્બેડિંગ મોડલોનો પરિવાર રજૂ કરી રહ્યા છીએ, જે શરૂઆતથી અંત સુધી દૃશ્ય પુનઃપ્રાપ્તિ શક્ય બનાવીને આ સમસ્યા ઉકેલવા રચાયો છે.
ખરેખર અસરકારક બહુવિધ-માધ્યમ પુનઃપ્રાપક બનાવવા માટે તૈયાર વિઝન-લેંગ્વેજ મોડલ (VLM) લઈને તેને શોધવાનું કહેવું પૂરતું નથી. બહુવિધ-માધ્યમ RAGને ઐતિહાસિક રીતે રોકતા પડકારો ઉકેલવા અને ColQwen3 બનાવવા માટે અમે મોડલ વિલય અને તાલીમ વ્યૂહરચનાઓ અપનાવી.
પાયાના મોડલને શરૂઆતથી સૂક્ષ્મ-સમાયોજિત કરવાને બદલે અમે હાલના ટેક્સ્ટ એમ્બેડિંગ મોડલમાંથી પુનઃપ્રાપ્તિ કાર્યોનું જ્ઞાન સ્થાનાંતરિત કરવાની પદ્ધતિ વિકસાવી. પ્રમાણભૂત VLM છબીઓનું વર્ણન કરી શકે છે, પરંતુ પ્રશ્નની સામે અર્થના આધારે તેમનો ક્રમ નક્કી કરવાનું તેને આવડતું જ હોય એવું નથી.
આ અંતર દૂર કરવા અમે સમાયોજિત સંયુક્ત ભારાંકન વ્યૂહરચનાઓ અપનાવી. અમારા પ્રયોગોમાં જાણવા મળ્યું કે ટેક્સ્ટના સુપ્ત અવકાશમાં Qwen3-Embeddingની પુનઃપ્રાપ્તિ ક્ષમતા સીધી બહુવિધ-માધ્યમ અવકાશમાં સ્થાનાંતરિત થઈ શકે છે અને તાત્કાલિક તાલીમ વિના પણ છબી તથા વિડિયો પુનઃપ્રાપ્તિ માટે સામાન્યીકરણ કરી શકે છે. આ અસરકારક આરંભને મજબૂત પ્રારંભબિંદુ તરીકે વાપરીને પછી અમે પ્રદર્શનને વધુ શ્રેષ્ઠ બનાવવા અને મજબૂતી સુનિશ્ચિત કરવા મોડલનું સૂક્ષ્મ-સમાયોજન કર્યું. Qwen3-VLના પાયાના મોડલથી કરેલા સૂક્ષ્મ-સમાયોજનની સરખામણીમાં તે અંતિમ પુનઃપ્રાપ્તિ પ્રદર્શન સુધારે છે.
એમ્બેડિંગ ક્ષમતાઓ સ્થાનાંતરિત થયા પછી અમે સંરેખણ પર ધ્યાન કેન્દ્રિત કર્યું. પુનઃપ્રાપ્તિ પ્રદર્શન મહત્તમ કરવા અમે શ્રેષ્ઠ તાલીમચક્રોની સંખ્યા, બૅચનું કદ, શીખવાનો દર, LoRA ક્રમ અને ડેટાસેટના મિશ્રણ સહિત હાઇપર-પેરામીટરની સાવચેતીપૂર્વક શોધ અને ઘટક-નિવારણ અભ્યાસ કર્યા.
સૂક્ષ્મ-સમાયોજન માટે અમે VDR, ColPali તાલીમ સમૂહ, visrag_syn, અને visrag_ind ડેટાસેટ પસંદ કર્યા. સૂક્ષ્મ-સમાયોજન માટે અમે UniMax નમૂના-પસંદગીનો ઉપયોગ કર્યો. અમે મોડલ વિલય કર્યો હોવાથી અને પાયાના સંયુક્ત મોડલને બહુવિધ-માધ્યમ પુનઃપ્રાપકની આંશિક ક્ષમતા પહેલેથી મળી હોવાથી વધુ ડેટાસેટ ઉમેરવાથી પ્રદર્શન થોડું ઘટતું હોવાનું અમને જણાયું. તેથી અમે વધુ ડેટાસેટ સુધી વિસ્તરણ કર્યું નહીં.
સૂક્ષ્મ-સમાયોજન માટે અમે પસંદ કરેલા હાઇપર-પેરામીટર આ રહ્યા:
LoRA ક્રમ | 32 |
LoRA આલ્ફા | 32 |
LoRA લક્ષ્ય મોડ્યુલ | એમ્બેડિંગ સિવાય છબી અને ટેક્સ્ટ બંનેનાં તમામ સ્તરો |
શીખવાનો દર | 5e-5 |
મહત્તમ દૃશ્ય ટોકન | 1280 |
તાલીમચક્રો | 1 |
વૈશ્વિક બૅચનું કદ | 512 |
વૉર્મઅપ ગુણોત્તર | 5% |
ઐતિહાસિક રીતે “ColBERT-શૈલી”નાં ટોકન-સ્તરના એમ્બેડિંગ વાપરતાં મોડલો (જેમ કે ColPali) અદ્ભુત પ્રદર્શન આપતાં હતાં, પરંતુ તેનો સંગ્રહ ખર્ચ પરવડે તેમ નહોતો. દરેક દૃશ્ય ટોકનને અનુક્રમિત કરવાથી એટલા વિશાળ વેક્ટર ડેટાબેઝ બનતા કે કંપનીના સ્તરે તેનો ખર્ચ ઘણો વધારે પડતો.
શ્રેષ્ઠીકરણ વ્યૂહરચના: સંગ્રહ ખર્ચને બેફામ વધતો રોકીને મહત્તમ પ્રદર્શન જાળવવા અમે એમ્બેડિંગનું કદ સાવચેતીપૂર્વક સંતુલિત કર્યું અને સંગ્રહનો પડકાર ઉકેલ્યો. આ કાર્યક્ષમ કદમાં અત્યાધુનિક ચોકસાઈ જાળવવા માટે અમે પુનઃપ્રાપ્તિ પ્રદર્શન અને સંગ્રહ ખર્ચનું સૌથી સંતુલિત સંયોજન આપતું 320 પરિમાણનું કદ પસંદ કર્યું.
આધારરેખા: પ્રમાણભૂત અભિગમ (જેમ કે NVIDIA Nemo-3B)માં 10 લાખ છબીઓનાં એમ્બેડિંગ સંગ્રહવા અંદાજે 10.3 TB જોઈએ છે (1,802 ટોકન @ 3,072 પરિમાણ).
ColQwen3: એ જ 10 લાખ છબીઓ માત્ર 0.82 TBમાં સંગ્રહે છે (મહત્તમ 1,280 ટોકન @ 320 પરિમાણ).
ColQwen3 ક્લાઉડ માળખાના બજેટને અતિશય વધાર્યા વિના અત્યાધુનિક પુનઃપ્રાપ્તિ ચોકસાઈ હાંસલ કરે છે.
અમે ViDoRe બેન્ચમાર્ક સ્યુટ પર અમારા અભિગમને માન્ય ઠરાવ્યો. પરિણામો પુષ્ટિ કરે છે કે ColQwen3 નવીનતમ V3 અને V2 બેન્ચમાર્કમાં (અંગ્રેજી અને બહુભાષી બંનેમાં) નવા માપદંડ સ્થાપે છે અને જૂના V1 કાર્યોમાં પણ શ્રેષ્ઠ સ્તરનું પ્રદર્શન જાળવે છે.
અંગ્રેજી અને બહુભાષી પુનઃપ્રાપ્તિમાં ColQwen3-8B અગ્રેસર છે.
અંગ્રેજી nDCG@5
મોડલ | કમ્પ્યુટર વિજ્ઞાન | ઊર્જા | નાણાકીય ક્ષેત્ર | માનવ સંસાધન | ઉદ્યોગ | ઔષધ ક્ષેત્ર | ભૌતિકશાસ્ત્ર | સરેરાશ |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
બહુભાષી nDCG@5
મોડલ | કમ્પ્યુટર વિજ્ઞાન | ઊર્જા | નાણાકીય ક્ષેત્ર | માનવ સંસાધન | ઉદ્યોગ | ઔષધ ક્ષેત્ર | ભૌતિકશાસ્ત્ર | સરેરાશ |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, અર્થશાસ્ત્ર અને DocVQAમાં સતત ઉચ્ચ પ્રદર્શન.
બેન્ચમાર્ક | મોડલ | સ્કોર (સરેરાશ) | નોંધપાત્ર જીત |
ViDoRe V2 (અંગ્રેજી) | ColQwen3-8B | 0.6772 | ESG અને BioMedમાં પ્રથમ સ્થાન |
ViDoRe V2 (બહુભાષી) | ColQwen3-8B | 0.6085 | અર્થશાસ્ત્રમાં પ્રથમ સ્થાન |
ViDoRe V1 (અંગ્રેજી) | Nemo ColEmbed 3B | 0.9100 | સરેરાશ સહેજ વધુ |
ViDoRe V1 (અંગ્રેજી) | ColQwen3-8B | 0.9076 | ArxivQA અને Syn-Govમાં પ્રથમ સ્થાન |
વિડિયો પુનઃપ્રાપ્તિમાં પણ ColQwen3નું મજબૂત સામાન્યીકરણ દર્શાવવા માટે અમે ટેક્સ્ટ-ટુ-વિડિયો (સામાન્ય પુનઃપ્રાપ્તિ) કાર્યો માટે CareBench બેન્ચમાર્ક પર મોડલોનું મૂલ્યાંકન કર્યું.
આ મૂલ્યાંકન માટે અમે કાચા વિડિયોના એન્કોડિંગનો અભિગમ અપનાવ્યો: અમારા મોડલોએ કોઈ વધારાની લેખિત નોંધ કે મેટાડેટા ઇનપુટ વિના સીધી વિડિયો ફાઇલો એન્કોડ કરી. આ સંપૂર્ણપણે દૃશ્ય અર્થવિજ્ઞાનના આધારે પુનઃપ્રાપ્તિ કરવાની મોડલની ક્ષમતા દર્શાવે છે.
મોડલ | રિકૉલ@1 | રિકૉલ@5 | રિકૉલ@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3થી શક્ય બનેલા સૌથી મોટા ફેરફારોમાંનો એક વિડિયોને દસ્તાવેજની જેમ જ સમજવાની તેની ક્ષમતા છે. ઘણી કંપનીઓમાં વિડિયો “અપ્રાપ્ય ડેટા” બની રહે છે. તે કોલ્ડ સ્ટોરેજમાં પડ્યો રહે છે અને કોઈ વ્યક્તિ દરેક ફાઇલને જાતે ટૅગ ન કરે ત્યાં સુધી તેને શોધી શકાતો નથી.
વિભાજિત ક્લિપમાં ફ્રેમ પ્રમાણે પુનઃપ્રાપ્તિ શક્ય બનાવીને ColQwen3 આ સ્થિતિ બદલે છે.
કંપનીઓ દરરોજ હજારો કલાકની આંતરિક વિડિયો મીટિંગ રેકોર્ડ કરે છે અને સામાન્ય રીતે આ રેકોર્ડિંગ ક્યાંક ખોવાઈ જાય છે.
કાર્યપ્રવાહ: મીટિંગનાં લાંબાં રેકોર્ડિંગને આપમેળે ટૂંકી, તાર્કિક ક્લિપમાં વિભાજિત કરીને અને ColQwen3થી અનુક્રમિત કરીને તમે શોધી શકાય તેવી “કંપનીની સ્મૃતિ” બનાવો છો.
પ્રશ્ન: પ્રોજેક્ટ મેનેજર પૂછી શકે છે: “એ ક્લિપ બતાવો જેમાં એન્જિનિયરિંગના વડાએ APIની વિલંબની સમસ્યા સમજાવી હતી.”
પરિણામ: સિસ્ટમ 60 મિનિટની વિડિયો ફાઇલ આપવાને બદલે એ ચોક્કસ 45 સેકન્ડનો ભાગ શોધી આપે છે, જેમાં ચોક્કસ આકૃતિ સ્ક્રીન પર બતાવીને તેની ચર્ચા થઈ હતી. એ ક્ષણે વક્તાઓએ “વિલંબ” શબ્દ સ્પષ્ટપણે ન કહ્યો હોય તો પણ આવું શક્ય બને છે.
મૂળભૂત બહુવિધ-માધ્યમ એમ્બેડિંગ તરફનો બદલાવ વિવિધ ઉદ્યોગોમાં સાવ નવા કાર્યપ્રવાહ શક્ય બનાવે છે. અમે અત્યંત જટિલ કંપની ડેટા વાતાવરણોમાં આ મોડલનું વ્યાપક બેન્ચમાર્કિંગ કર્યું છે.
અમે શહેરી પરામર્શ કંપનીઓ સામે આવતા ડેટાના પડકારો પર ColQwen3નું પરીક્ષણ કર્યું. આ કંપનીઓ માસ્ટર પ્લાન, ઝોનિંગ નકશા અને જટિલ સ્થાપત્ય ઊર્ધ્વદર્શનોના વિશાળ સંગ્રહ સંભાળે છે.
પડકાર: આવા વાતાવરણમાં પરંપરાગત RAG પાઇપલાઇન અસરકારક રીતે કામ કરી શકતી નથી. OCR સાધનો સામાન્ય રીતે જટિલ સાઇટ પ્લાનને માત્ર “યોજનાકીય આકૃતિ” કહે છે અને વાહનવ્યવહારનો પ્રવાહ, હરિયાળા વિસ્તારો કે ઇમારતના સેટબૅક જેવી મહત્વપૂર્ણ વિગતો ચૂકી જાય છે.
પ્રદર્શન: અમારા આંતરિક બેન્ચમાર્ક દર્શાવે છે કે ColQwen3 મોંઘી OCR/કૅપ્શનિંગ પૂર્વ-પ્રક્રિયાની જરૂરિયાતને અસરકારક રીતે ટાળે છે. અતિ ગીચ સ્થાપત્ય રેખાંકનોના પરીક્ષણમાં મોડલે પદયાત્રી પ્રવેશબિંદુઓ કે સ્પષ્ટ ઝોનિંગ સીમાઓ જેવાં ચોક્કસ દૃશ્ય ચિહ્નોના આધારે દસ્તાવેજો સફળતાપૂર્વક શોધ્યા. તેણે માત્ર ટેક્સ્ટ આધારિત આધારરેખાઓ કરતાં ઘણું સારું પ્રદર્શન કર્યું અને જ્ઞાન ગ્રહણનો ખર્ચ નોંધપાત્ર રીતે ઘટાડવાની સંભાવના દર્શાવી.
રોકાણ બૅન્કરો અને વિશ્લેષકો વાર્ષિક અહેવાલો તથા રોકાણકાર પ્રસ્તુતિઓ તપાસવામાં હજારો કલાક વિતાવે છે.
કાર્યપ્રવાહ: વિશ્લેષક પૂછી શકે છે, “2024ની સ્લાઇડ પ્રસ્તુતિઓમાંથી APAC અને EMEAની આવકનું વિભાજન શોધો.”
બદલાવ: કીવર્ડના મેળ પર આધાર રાખવાને બદલે મોડલ ચોક્કસ ડેટા દૃશ્યાંકનની દૃશ્ય હાજરીના આધારે યોગ્ય સ્લાઇડ શોધે છે, જેથી RAG સિસ્ટમ ખૂબ ચોકસાઈથી પ્રશ્નોના જવાબ આપી શકે છે.
ઉત્પાદન કંપનીઓ પાસે ટેક્નિકલ માર્ગદર્શિકાઓ અને પાઇપિંગ આકૃતિઓ (P&ID)ના વિશાળ સંગ્રહ હોય છે.
કાર્યપ્રવાહ: ટર્બાઇન સુધારતો સ્થળ પરનો ઇજનેર કોઈ ભાગનો ફોટો લઈ શકે અથવા પૂછી શકે છે, “હાઇડ્રોલિક પંપ એસેમ્બલી માટેની વાયરિંગ આકૃતિ બતાવો.”
બદલાવ: ColQwen3 વાયરિંગ આકૃતિનું દૃશ્ય નિરૂપણ ઓળખીને યોગ્ય પાનું શોધે છે, જેનાથી સંભવિત રીતે ઘણા કલાકનો નિષ્ક્રિય સમય બચી શકે છે.
કાનૂની તપાસમાં લાખો સ્કૅન કરેલાં પાનાંની સમીક્ષા કરવી પડે છે, જેમાં શોધવાની મહત્વપૂર્ણ વસ્તુ ઘણી વાર કોઈ દૃશ્ય ચિહ્ન હોય છે.
કાર્યપ્રવાહ: અનુપાલન અધિકારી “મુખ્ય નાણાકીય અધિકારીએ સહી કરેલા દસ્તાવેજો” અથવા “સત્તાવાર ‘ગોપનીય’ મહોરવાળા કરારો” શોધી શકે છે.
બદલાવ: મોડલ સહી કે મહોરની દૃશ્ય હાજરીના આધારે મુસદ્દા અને અંતિમ દસ્તાવેજ વચ્ચેનો તફાવત ઓળખે છે, જે માત્ર OCR ઘણી વાર ચૂકી જાય છે.
ColQwen3 ખુલ્લા ભારાંકવાળું (Apache 2.0) છે અને હવે Hugging Face પર ઉપલબ્ધ છે. અમે તેને આધુનિક RAG પાઇપલાઇન માટે સીધા જોડી શકાય એવા સુધારા તરીકે બનાવ્યું છે, જેમાં ટેક્સ્ટ, છબીઓ અને વિડિયો પર તરત પ્રક્રિયા કરવા માટે જરૂરી અનુમાન કોડ મળે છે.
સરળ ટેક્સ્ટ શોધથી આગળ વધીને પોતાની દૃશ્ય સામગ્રીમાં છુપાયેલી ઇન્ટેલિજન્સને સુલભ બનાવવા તૈયાર કંપનીઓ માટે આ નવો માપદંડ છે.
આગલું પગલું: મોડલ કાર્ડ જુઓ અને Hugging Face પર જીવંત પ્રદર્શન અજમાવો: /-colqwen3-embed-8b અને /-colqwen3-embed-4b