Gjatë dy viteve të fundit, «RAG» (gjenerimi i përforcuar nga rikthimi) ka qenë pothuajse tërësisht sinonim i tekstit. Metoda standarde është e thjeshtë: merr dokumentet, nxirr tekstin, ndaje në pjesë dhe indeksoje.
Por bota e ndërmarrjeve nuk funksionon me skedarë teksti të thjeshtë. Ajo mbështetet në PDF komplekse, prezantime me grafikë të ngjeshur, vizatime CAD, fatura të skanuara dhe, gjithnjë e më shumë, arkiva masive videosh.
Standardi i industrisë për trajtimin e tyre—përdorimi i OCR-së ose i LLM-ve pamore për ta «përshkruar» një imazh si tekst para përfshirjes—është një pengesë e madhe. Është i ngadaltë, i kushtueshëm dhe humb në mënyrë të pashmangshme kontekstin e pasur hapësinor dhe pamor të të dhënave origjinale. Nëse IA-ja juaj e përshkruan një pamje komplekse thjesht si «projekt teknik», ju humbni mundësinë për të kërkuar valvulën apo skemën specifike të instalimeve elektrike brenda saj.
Sot po prezantojmë një familje modelesh moderne të përfshirjes multimodale, të ndërtuara mbi arkitekturën ColPali, për ta zgjidhur këtë problem duke mundësuar rikthim pamor nga skaji në skaj.
Ndërtimi i një sistemi vërtet efikas të rikthimit multimodal nuk është aq i thjeshtë sa të marrësh një model të gatshëm pamje-gjuhë (VLM) dhe t'i kërkosh të bëjë kërkime. Për të zgjidhur sfidat që historikisht e kanë penguar RAG-un multimodal dhe për të krijuar ColQwen3, përdorëm strategji të bashkimit dhe trajnimit të modeleve.
Në vend që ta përshtatnim imët nga e para një model bazë, zhvilluam një metodë për transferimin e njohurive mbi detyrat e rikthimit nga një model ekzistues i përfshirjes tekstuale. Një VLM standard di t'i përshkruajë imazhet, por jo domosdoshmërisht t'i renditë semantikisht kundrejt një pyetjeje.
Për ta kapërcyer këtë hendek, përdorëm strategji të akorduara të peshimit të bashkimit. Në eksperimentet tona zbuluam se aftësia e rikthimit e Qwen3-Embedding në hapësirën latente tekstuale mund të transferohej drejtpërdrejt në hapësirën multimodale, duke u përgjithësuar për rikthimin e imazheve dhe videove edhe pa trajnim të menjëhershëm. Duke e përdorur këtë inicializim efikas si pikënisje të fortë, më pas e përshtatëm imët modelin për ta optimizuar më tej performancën dhe për të garantuar qëndrueshmëri. Kjo përmirëson performancën përfundimtare të rikthimit krahasuar me përshtatjen e imët të modelit bazë Qwen3-VL.
Pasi transferuam aftësitë e përfshirjes, u përqendruam tek harmonizimi. Kryem kërkime të kujdesshme të hiperparametrave dhe studime ablacioni, duke përfshirë numrin optimal të epokave, madhësinë e grupit, ritmin e të nxënit, rangun LoRA dhe përzierjen e grupeve të të dhënave, për të maksimizuar performancën e rikthimit.
Si grupe të dhënash për përshtatjen e imët zgjodhëm VDR, grupin e trajnimit ColPali, visrag_syn, dhe visrag_ind. Për përshtatjen e imët përdorëm kampionimin UniMax. Meqë zbatuam bashkimin e modeleve dhe modeli bazë i bashkuar trashëgon tashmë një pjesë të aftësisë multimodale të rikthimit, zbuluam se shtimi i grupeve të tjera të të dhënave do ta ulte pak performancën; prandaj nuk e zgjeruam numrin e tyre.
Këta janë hiperparametrat që zgjodhëm për përshtatjen e imët:
Rangu LoRA | 32 |
Alfa LoRA | 32 |
Modulet e synuara LoRA | të gjitha shtresat e imazhit dhe tekstit, përveç përfshirjes |
Ritmi i të nxënit | 5e-5 |
Numri maksimal i tokenëve pamorë | 1280 |
Epokat e trajnimit | 1 |
Madhësia globale e grupit | 512 |
Raporti i nxehjes | 5% |
Historikisht, modelet që përdornin përfshirje në nivel tokeni «sipas stilit ColBERT» (si ColPali) ofronin performancë të jashtëzakonshme, por me kosto të papërballueshme ruajtjeje. Indeksimi i çdo tokeni pamor krijonte baza masive të dhënash vektoriale, tepër të kushtueshme për shkallën e ndërmarrjeve.
Strategjia e optimizimit: Sfidën e ruajtjes e trajtuam duke balancuar me kujdes madhësinë e përfshirjeve, për të ruajtur performancën maksimale pa lejuar rritjen e pakontrolluar të kostove. Për të ruajtur saktësinë SOTA brenda kësaj madhësie efikase, zgjodhëm me kujdes 320 si numër dimensionesh, për ekuilibrin më të mirë mes performancës së rikthimit dhe kostos së ruajtjes.
Baza krahasuese: Një qasje standarde (si NVIDIA Nemo-3B) kërkon rreth 10.3 TB për të ruajtur përfshirjet e 1 milion imazheve (1,802 tokenë @ 3,072 dimensione).
ColQwen3: Të njëjtat 1 milion imazhe i ruan në vetëm 0.82 TB (maksimumi 1,280 tokenë @ 320 dimensione).
ColQwen3 arrin saktësi SOTA në rikthim pa e tejkaluar buxhetin e infrastrukturës cloud.
E validuam qasjen tonë me paketën e standardeve ViDoRe. Rezultatet konfirmojnë se ColQwen3 vendos standarde të reja në testet më të fundit V3 dhe V2, si në anglisht ashtu edhe në shumë gjuhë, duke ruajtur njëkohësisht performancë të nivelit më të lartë në detyrat e mëparshme V1.
ColQwen3-8B kryeson në rikthimin në anglisht dhe në shumë gjuhë.
nDCG@5 në anglisht
Modeli | Shk. kompj. | Energji | Financë | BNj | Ind. | Farmaci | Fizikë | Mes. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
nDCG@5 shumëgjuhësh
Modeli | Shk. kompj. | Energji | Financë | BNj | Ind. | Farmaci | Fizikë | Mes. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Performancë e lartë dhe e qëndrueshme në ESG, ekonomi dhe DocVQA.
Standardi | Modeli | Rezultati (mes.) | Arritje e spikatur |
ViDoRe V2 (anglisht) | ColQwen3-8B | 0.6772 | Nr. 1 në ESG & BioMed |
ViDoRe V2 (shumëgjuhësh) | ColQwen3-8B | 0.6085 | Nr. 1 në ekonomi |
ViDoRe V1 (anglisht) | Nemo ColEmbed 3B | 0.9100 | Mesatare pak më e lartë |
ViDoRe V1 (anglisht) | ColQwen3-8B | 0.9076 | Nr. 1 në ArxivQA & Syn-Gov |
Për të treguar se ColQwen3 përgjithëson fuqishëm në rikthimin e videove, i vlerësuam modelet në standardin CareBench për detyrat tekst-në-video (rikthim i përgjithshëm).
Për këtë vlerësim përdorëm një qasje të kodimit të videos së papërpunuar: modelet tona i koduan drejtpërdrejt skedarët video, pa shënime shtesë tekstuale apo të dhëna hyrëse metadatash. Kjo nxjerr në pah aftësinë e modelit për të kryer rikthim vetëm në bazë të semantikës pamore.
Modeli | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Një nga ndryshimet më të thella që mundëson ColQwen3 është aftësia për ta trajtuar videon njësoj si dokumentet. Në shumë ndërmarrje, videot janë «të dhëna të errëta». Ato mbeten në arkivim afatgjatë, krejtësisht të pakërkueshme, përveçse kur dikush ka etiketuar manualisht çdo skedar.
ColQwen3 e ndryshon këtë duke mundësuar rikthimin kuadër pas kuadri në klipe të segmentuara.
Çdo ditë, ndërmarrjet regjistrojnë mijëra orë takimesh të brendshme me video dhe, zakonisht, këto regjistrime humbasin në harresë.
Rrjedha e punës: Duke i segmentuar automatikisht regjistrimet e gjata të takimeve në klipe më të shkurtra e logjike dhe duke i indeksuar me ColQwen3, krijoni një «kujtesë të korporatës» ku mund të kërkohet.
Pyetja: Një menaxher projekti mund të kërkojë: “Show me the clip where the engineering lead explained the latency issue with the API.”
Rezultati: Në vend që të kthejë një skedar video 60-minutësh, sistemi gjen pikërisht segmentin 45-sekondësh ku diagrami përkatës u shfaq në ekran dhe u diskutua, edhe nëse folësit nuk e thanë shprehimisht fjalën «vonesë» pikërisht në atë çast.
Kalimi në përfshirje multimodale native mundëson rrjedha pune krejtësisht të reja në të gjitha industritë. E kemi testuar gjerësisht këtë model në disa nga mjediset më komplekse të të dhënave të ndërmarrjeve.
E testuam ColQwen3 me sfidat e të dhënave që hasin firmat e konsulencës urbane, të cilat menaxhojnë biblioteka masive planesh të përgjithshme, hartash zonimi dhe pamjesh arkitekturore komplekse.
Sfida: Në këto mjedise, proceset tradicionale RAG hasin vështirësi. Mjetet OCR zakonisht i përshkruajnë planet komplekse të zonave thjesht si «skemë», duke humbur hollësi kyçe për qarkullimin, zonat e gjelbra ose distancat e ndërtesave nga kufijtë.
Performanca: Testet tona të brendshme tregojnë se ColQwen3 shmang me efektivitet nevojën për parapërpunim të kushtueshëm me OCR/përshkrim. Në testet me vizatime arkitekturore me dendësi të lartë, modeli riktheu me sukses dokumente sipas shenjuesve të veçantë pamorë, si pikat e hyrjes për këmbësorë ose kufijtë e dallueshëm të zonimit. Kjo tejkaloi ndjeshëm bazat vetëm me tekst dhe premton ulje drastike të kostove të përvetësimit të njohurive.
Bankierët e investimeve dhe analistët shpenzojnë mijëra orë duke shqyrtuar raporte vjetore dhe prezantime për investitorët.
Rrjedha e punës: Një analist mund të kërkojë: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Ndryshimi: Në vend që të mbështetet te përputhja e fjalëve kyçe, modeli rikthen slajdin e saktë sipas pranisë pamore të vizualizimit specifik të të dhënave, duke i lejuar sistemit RAG t'u përgjigjet pyetjeve me saktësi të lartë.
Kompanitë prodhuese kanë biblioteka të mëdha manualesh teknike dhe diagramesh tubacionesh dhe instrumentesh (P&ID).
Rrjedha e punës: Një inxhinier në terren që riparon një turbinë mund të fotografojë një pjesë ose të kërkojë: “Show me the wiring diagram for the hydraulic pump assembly.”
Ndryshimi: ColQwen3 identifikon paraqitjen pamore të skemës elektrike dhe rikthen faqen e duhur, duke mundësuar uljen me disa orë të kohës së ndërprerjes.
Zbulimi ligjor përfshin shqyrtimin e miliona faqeve të skanuara, ku «gjilpëra në kashtë» është shpesh një shenjues pamor.
Rrjedha e punës: Një zyrtar pajtueshmërie mund të kërkojë “Documents signed by the CFO” ose “Contracts containing the official ‘Confidential’ stamp.”
Ndryshimi: Modeli dallon një draft nga një dokument i finalizuar sipas pranisë pamore të nënshkrimeve ose vulave, diçka që OCR-ja e pastër shpesh nuk e kap.
ColQwen3 ka pesha të hapura (Apache 2.0) dhe tani ofrohet në Hugging Face. E kemi projektuar si një përmirësim të drejtpërdrejtë për proceset moderne RAG, duke ofruar kodin e inferencës që nevojitet për të përpunuar menjëherë tekst, imazhe dhe video.
Për ndërmarrjet e gatshme të shkojnë përtej kërkimit të thjeshtë tekstual dhe të çlirojnë Inteligjencën e bllokuar në asetet e tyre pamore, ky është standardi i ri.
Hapi tjetër: Eksploroni kartën e modelit dhe provoni demonstrimin drejtpërdrejt në Hugging Face: /-colqwen3-embed-8b dhe /-colqwen3-embed-4b