Navigimi kryesor

Përtej tekstit: RAG vërtet multimodal, nga skaji në skaj

Modelet e përfshirjes multimodale i ndihmojnë ekipet të rikthejnë informacion të dobishëm drejtpërdrejt nga dokumente komplekse, imazhe dhe video.

Gjatë dy viteve të fundit, «RAG» (gjenerimi i përforcuar nga rikthimi) ka qenë pothuajse tërësisht sinonim i tekstit. Metoda standarde është e thjeshtë: merr dokumentet, nxirr tekstin, ndaje në pjesë dhe indeksoje.

Por bota e ndërmarrjeve nuk funksionon me skedarë teksti të thjeshtë. Ajo mbështetet në PDF komplekse, prezantime me grafikë të ngjeshur, vizatime CAD, fatura të skanuara dhe, gjithnjë e më shumë, arkiva masive videosh.

Standardi i industrisë për trajtimin e tyre—përdorimi i OCR-së ose i LLM-ve pamore për ta «përshkruar» një imazh si tekst para përfshirjes—është një pengesë e madhe. Është i ngadaltë, i kushtueshëm dhe humb në mënyrë të pashmangshme kontekstin e pasur hapësinor dhe pamor të të dhënave origjinale. Nëse IA-ja juaj e përshkruan një pamje komplekse thjesht si «projekt teknik», ju humbni mundësinë për të kërkuar valvulën apo skemën specifike të instalimeve elektrike brenda saj.

Sot po prezantojmë një familje modelesh moderne të përfshirjes multimodale, të ndërtuara mbi arkitekturën ColPali, për ta zgjidhur këtë problem duke mundësuar rikthim pamor nga skaji në skaj.

Inxhinieria pas magjisë: strategji të avancuara të përshtatjes së imët

Ndërtimi i një sistemi vërtet efikas të rikthimit multimodal nuk është aq i thjeshtë sa të marrësh një model të gatshëm pamje-gjuhë (VLM) dhe t'i kërkosh të bëjë kërkime. Për të zgjidhur sfidat që historikisht e kanë penguar RAG-un multimodal dhe për të krijuar ColQwen3, përdorëm strategji të bashkimit dhe trajnimit të modeleve.

1. Transferimi i aftësisë së përfshirjes përmes peshimit të akorduar të bashkimit

Në vend që ta përshtatnim imët nga e para një model bazë, zhvilluam një metodë për transferimin e njohurive mbi detyrat e rikthimit nga një model ekzistues i përfshirjes tekstuale. Një VLM standard di t'i përshkruajë imazhet, por jo domosdoshmërisht t'i renditë semantikisht kundrejt një pyetjeje.

Për ta kapërcyer këtë hendek, përdorëm strategji të akorduara të peshimit të bashkimit. Në eksperimentet tona zbuluam se aftësia e rikthimit e Qwen3-Embedding në hapësirën latente tekstuale mund të transferohej drejtpërdrejt në hapësirën multimodale, duke u përgjithësuar për rikthimin e imazheve dhe videove edhe pa trajnim të menjëhershëm. Duke e përdorur këtë inicializim efikas si pikënisje të fortë, më pas e përshtatëm imët modelin për ta optimizuar më tej performancën dhe për të garantuar qëndrueshmëri. Kjo përmirëson performancën përfundimtare të rikthimit krahasuar me përshtatjen e imët të modelit bazë Qwen3-VL.

2. Akordimi i kujdesshëm i hiperparametrave

Pasi transferuam aftësitë e përfshirjes, u përqendruam tek harmonizimi. Kryem kërkime të kujdesshme të hiperparametrave dhe studime ablacioni, duke përfshirë numrin optimal të epokave, madhësinë e grupit, ritmin e të nxënit, rangun LoRA dhe përzierjen e grupeve të të dhënave, për të maksimizuar performancën e rikthimit.

Si grupe të dhënash për përshtatjen e imët zgjodhëm VDR, grupin e trajnimit ColPali, visrag_syn, dhe visrag_ind. Për përshtatjen e imët përdorëm kampionimin UniMax. Meqë zbatuam bashkimin e modeleve dhe modeli bazë i bashkuar trashëgon tashmë një pjesë të aftësisë multimodale të rikthimit, zbuluam se shtimi i grupeve të tjera të të dhënave do ta ulte pak performancën; prandaj nuk e zgjeruam numrin e tyre.

Këta janë hiperparametrat që zgjodhëm për përshtatjen e imët:

Rangu LoRA

32

Alfa LoRA

32

Modulet e synuara LoRA

të gjitha shtresat e imazhit dhe tekstit, përveç përfshirjes

Ritmi i të nxënit

5e-5

Numri maksimal i tokenëve pamorë

1280

Epokat e trajnimit

1

Madhësia globale e grupit

512

Raporti i nxehjes

5%

3. Dilema «ColBERT»: performancë e lartë kundrejt kostos së ruajtjes

Historikisht, modelet që përdornin përfshirje në nivel tokeni «sipas stilit ColBERT» (si ColPali) ofronin performancë të jashtëzakonshme, por me kosto të papërballueshme ruajtjeje. Indeksimi i çdo tokeni pamor krijonte baza masive të dhënash vektoriale, tepër të kushtueshme për shkallën e ndërmarrjeve.

  • Strategjia e optimizimit: Sfidën e ruajtjes e trajtuam duke balancuar me kujdes madhësinë e përfshirjeve, për të ruajtur performancën maksimale pa lejuar rritjen e pakontrolluar të kostove. Për të ruajtur saktësinë SOTA brenda kësaj madhësie efikase, zgjodhëm me kujdes 320 si numër dimensionesh, për ekuilibrin më të mirë mes performancës së rikthimit dhe kostos së ruajtjes.

    • Baza krahasuese: Një qasje standarde (si NVIDIA Nemo-3B) kërkon rreth 10.3 TB për të ruajtur përfshirjet e 1 milion imazheve (1,802 tokenë @ 3,072 dimensione).

    • ColQwen3: Të njëjtat 1 milion imazhe i ruan në vetëm 0.82 TB (maksimumi 1,280 tokenë @ 320 dimensione).

ColQwen3 arrin saktësi SOTA në rikthim pa e tejkaluar buxhetin e infrastrukturës cloud.

Rezultatet e vlerësimit

E validuam qasjen tonë me paketën e standardeve ViDoRe. Rezultatet konfirmojnë se ColQwen3 vendos standarde të reja në testet më të fundit V3 dhe V2, si në anglisht ashtu edhe në shumë gjuhë, duke ruajtur njëkohësisht performancë të nivelit më të lartë në detyrat e mëparshme V1.

ViDoRe v3 (më i fundit)

ColQwen3-8B kryeson në rikthimin në anglisht dhe në shumë gjuhë.

nDCG@5 në anglisht

Modeli

Shk. kompj.

Energji

Financë

BNj

Ind.

Farmaci

Fizikë

Mes.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 shumëgjuhësh

Modeli

Shk. kompj.

Energji

Financë

BNj

Ind.

Farmaci

Fizikë

Mes.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Pikat kryesore të ViDoRe v2 dhe v1

Performancë e lartë dhe e qëndrueshme në ESG, ekonomi dhe DocVQA.

Standardi

Modeli

Rezultati (mes.)

Arritje e spikatur

ViDoRe V2 (anglisht)

ColQwen3-8B

0.6772

Nr. 1 në ESG & BioMed

ViDoRe V2 (shumëgjuhësh)

ColQwen3-8B

0.6085

Nr. 1 në ekonomi

ViDoRe V1 (anglisht)

Nemo ColEmbed 3B

0.9100

Mesatare pak më e lartë

ViDoRe V1 (anglisht)

ColQwen3-8B

0.9076

Nr. 1 në ArxivQA & Syn-Gov

Rikthimi i videove: vlerësimi CareBench

Për të treguar se ColQwen3 përgjithëson fuqishëm në rikthimin e videove, i vlerësuam modelet në standardin CareBench për detyrat tekst-në-video (rikthim i përgjithshëm).

Për këtë vlerësim përdorëm një qasje të kodimit të videos së papërpunuar: modelet tona i koduan drejtpërdrejt skedarët video, pa shënime shtesë tekstuale apo të dhëna hyrëse metadatash. Kjo nxjerr në pah aftësinë e modelit për të kryer rikthim vetëm në bazë të semantikës pamore.

Modeli

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Çlirimi i «të dhënave të errëta»: kufiri i ri i videos

Një nga ndryshimet më të thella që mundëson ColQwen3 është aftësia për ta trajtuar videon njësoj si dokumentet. Në shumë ndërmarrje, videot janë «të dhëna të errëta». Ato mbeten në arkivim afatgjatë, krejtësisht të pakërkueshme, përveçse kur dikush ka etiketuar manualisht çdo skedar.

ColQwen3 e ndryshon këtë duke mundësuar rikthimin kuadër pas kuadri në klipe të segmentuara.

Në fokus: banka e kujtesës së korporatës

Çdo ditë, ndërmarrjet regjistrojnë mijëra orë takimesh të brendshme me video dhe, zakonisht, këto regjistrime humbasin në harresë.

  • Rrjedha e punës: Duke i segmentuar automatikisht regjistrimet e gjata të takimeve në klipe më të shkurtra e logjike dhe duke i indeksuar me ColQwen3, krijoni një «kujtesë të korporatës» ku mund të kërkohet.

  • Pyetja: Një menaxher projekti mund të kërkojë: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Rezultati: Në vend që të kthejë një skedar video 60-minutësh, sistemi gjen pikërisht segmentin 45-sekondësh ku diagrami përkatës u shfaq në ekran dhe u diskutua, edhe nëse folësit nuk e thanë shprehimisht fjalën «vonesë» pikërisht në atë çast.

Raste përdorimi në ndërmarrje: zgjidhja e problemeve me vlerë të lartë

Kalimi në përfshirje multimodale native mundëson rrjedha pune krejtësisht të reja në të gjitha industritë. E kemi testuar gjerësisht këtë model në disa nga mjediset më komplekse të të dhënave të ndërmarrjeve.

1. Në fokus: konsulenca urbane dhe arkitektura

E testuam ColQwen3 me sfidat e të dhënave që hasin firmat e konsulencës urbane, të cilat menaxhojnë biblioteka masive planesh të përgjithshme, hartash zonimi dhe pamjesh arkitekturore komplekse.

  • Sfida: Në këto mjedise, proceset tradicionale RAG hasin vështirësi. Mjetet OCR zakonisht i përshkruajnë planet komplekse të zonave thjesht si «skemë», duke humbur hollësi kyçe për qarkullimin, zonat e gjelbra ose distancat e ndërtesave nga kufijtë.

  • Performanca: Testet tona të brendshme tregojnë se ColQwen3 shmang me efektivitet nevojën për parapërpunim të kushtueshëm me OCR/përshkrim. Në testet me vizatime arkitekturore me dendësi të lartë, modeli riktheu me sukses dokumente sipas shenjuesve të veçantë pamorë, si pikat e hyrjes për këmbësorë ose kufijtë e dallueshëm të zonimit. Kjo tejkaloi ndjeshëm bazat vetëm me tekst dhe premton ulje drastike të kostove të përvetësimit të njohurive.

2. Inteligjencë komplekse financiare dhe tregu

Bankierët e investimeve dhe analistët shpenzojnë mijëra orë duke shqyrtuar raporte vjetore dhe prezantime për investitorët.

  • Rrjedha e punës: Një analist mund të kërkojë: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Ndryshimi: Në vend që të mbështetet te përputhja e fjalëve kyçe, modeli rikthen slajdin e saktë sipas pranisë pamore të vizualizimit specifik të të dhënave, duke i lejuar sistemit RAG t'u përgjigjet pyetjeve me saktësi të lartë.

3. Prodhimi industrial dhe shërbimi në terren

Kompanitë prodhuese kanë biblioteka të mëdha manualesh teknike dhe diagramesh tubacionesh dhe instrumentesh (P&ID).

  • Rrjedha e punës: Një inxhinier në terren që riparon një turbinë mund të fotografojë një pjesë ose të kërkojë: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Ndryshimi: ColQwen3 identifikon paraqitjen pamore të skemës elektrike dhe rikthen faqen e duhur, duke mundësuar uljen me disa orë të kohës së ndërprerjes.

4. Çështjet ligjore dhe pajtueshmëria

Zbulimi ligjor përfshin shqyrtimin e miliona faqeve të skanuara, ku «gjilpëra në kashtë» është shpesh një shenjues pamor.

  • Rrjedha e punës: Një zyrtar pajtueshmërie mund të kërkojë “Documents signed by the CFO” ose “Contracts containing the official ‘Confidential’ stamp.”

  • Ndryshimi: Modeli dallon një draft nga një dokument i finalizuar sipas pranisë pamore të nënshkrimeve ose vulave, diçka që OCR-ja e pastër shpesh nuk e kap.

Si të filloni

ColQwen3 ka pesha të hapura (Apache 2.0) dhe tani ofrohet në Hugging Face. E kemi projektuar si një përmirësim të drejtpërdrejtë për proceset moderne RAG, duke ofruar kodin e inferencës që nevojitet për të përpunuar menjëherë tekst, imazhe dhe video.

Për ndërmarrjet e gatshme të shkojnë përtej kërkimit të thjeshtë tekstual dhe të çlirojnë Inteligjencën e bllokuar në asetet e tyre pamore, ky është standardi i ri.

Hapi tjetër: Eksploroni kartën e modelit dhe provoni demonstrimin drejtpërdrejt në Hugging Face: /-colqwen3-embed-8b dhe /-colqwen3-embed-4b

Autor

Xin Huang dhe Kye Min Tan