V zadnjih dveh letih je bil »RAG« (generiranje, podprto z iskanjem) skoraj izključno sopomenka za besedilo. Običajni postopek je preprost: vzamete dokumente, izločite besedilo, ga razdelite na dele in indeksirate.
Toda poslovni svet ne temelji na navadnih besedilnih datotekah. Temelji na zapletenih dokumentih PDF, predstavitvah z zgoščenimi grafikoni, risbah CAD, optično prebranih računih in vse pogosteje na obsežnih arhivih videoposnetkov.
Industrijski standard, pri katerem se slika pred vdelavo z OCR-jem ali vizualnimi velikimi jezikovnimi modeli »opiše« z besedilom, je veliko ozko grlo. Je počasen in drag ter neizogibno izgubi bogat prostorski in vizualni kontekst izvornih podatkov. Če vaša umetna inteligenca zapleten vizualni prikaz opiše zgolj kot »načrt«, ne morete več poiskati konkretnega ventila ali električne sheme v njem.
Danes izdajamo družino najsodobnejših večmodalnih modelov vložitev, ki nadgrajujejo arhitekturo ColPali in to težavo rešujejo z omogočanjem celovitega vizualnega iskanja.
Učinkovitega večmodalnega iskalnika ni mogoče ustvariti tako preprosto, da vzamemo že pripravljen vizualno-jezikovni model (VLM) in mu naročimo iskanje. Za odpravo izzivov, ki so v preteklosti zavirali večmodalni RAG, in razvoj ColQwen3 smo uporabili strategije združevanja in učenja modelov.
Namesto dodatnega prilagajanja osnovnega modela od začetka smo razvili metodo za prenos znanja o nalogah iskanja iz obstoječega modela besedilnih vložitev. Standardni VLM zna opisovati slike, vendar jih ne zna nujno pomensko razvrstiti glede na poizvedbo.
To vrzel smo premostili s strategijami prilagojenega uteženega združevanja. V poskusih smo ugotovili, da je mogoče iskalne zmožnosti modela Qwen3-Embedding v latentnem prostoru besedila neposredno prenesti v večmodalni prostor in jih posplošiti na iskanje slik ter videoposnetkov tudi brez takojšnjega učenja. To učinkovito inicializacijo smo uporabili kot trdno izhodišče, nato pa model dodatno prilagodili, da bi še izboljšali uspešnost in zagotovili robustnost. S tem se končna uspešnost iskanja izboljša v primerjavi z dodatnim prilagajanjem osnovnega modela Qwen3-VL.
Po prenosu zmožnosti vložitev smo se osredotočili na poravnavo. Izvedli smo skrbna iskanja hiperparametrov in ablacijske študije, med drugim za optimalno število epoh, velikost paketa, hitrost učenja, rang LoRA in kombinacijo podatkovnih zbirk, da bi čim bolj izboljšali uspešnost iskanja.
Za dodatno prilagajanje smo izbrali podatkovne zbirke VDR, učno zbirko ColPali, visrag_syn, in visrag_ind. Za dodatno prilagajanje smo uporabili vzorčenje UniMax. Ker smo uporabili združevanje modelov in združeni osnovni model že podeduje del večmodalnih iskalnih zmožnosti, smo ugotovili, da bi dodajanje podatkovnih zbirk uspešnost nekoliko poslabšalo, zato njihovega števila nismo povečali.
Za dodatno prilagajanje smo izbrali naslednje hiperparametre:
Rang LoRA | 32 |
Alfa LoRA | 32 |
Ciljni moduli LoRA | vse slikovne in besedilne plasti razen plasti vložitev |
Hitrost učenja | 5e-5 |
Največ vizualnih žetonov | 1280 |
Učne epohe | 1 |
Globalna velikost paketa | 512 |
Delež ogrevanja | 5% |
Modeli z vložitvami na ravni žetonov v slogu »ColBERT« (kot je ColPali) so v preteklosti zagotavljali izjemno uspešnost, vendar so bili stroški shranjevanja previsoki. Indeksiranje vsakega vizualnega žetona je ustvarilo ogromne vektorske podatkovne zbirke, ki so bile za uporabo v velikih podjetjih predrage.
Strategija optimizacije: Izziv shranjevanja smo rešili s skrbnim uravnoteženjem velikosti vložitev, da bi ohranili čim večjo uspešnost, ne da bi stroški shranjevanja skokovito narasli. Da bi ob tej učinkoviti velikosti ohranili najsodobnejšo natančnost, smo izbrali 320 razsežnosti, saj ponujajo najboljše ravnovesje med uspešnostjo iskanja in stroški shranjevanja.
Izhodišče: Standardni pristop (kot je NVIDIA Nemo-3B) za shranjevanje vložitev milijona slik potrebuje približno 10.3 TB (1.802 žetona pri 3.072 razsežnostih).
ColQwen3: Isti milijon slik shrani v samo 0.82 TB (največ 1.280 žetonov pri 320 razsežnostih).
ColQwen3 dosega najsodobnejšo natančnost iskanja, ne da bi močno povečal proračun za infrastrukturo v oblaku.
Svoj pristop smo preverili z zbirko primerjalnih preizkusov ViDoRe. Rezultati potrjujejo, da ColQwen3 postavlja nove standarde pri najnovejših preizkusih V3 in V2, tako angleških kot večjezičnih, obenem pa ohranja vrhunsko uspešnost pri starejših nalogah V1.
ColQwen3-8B vodi pri angleškem in večjezičnem iskanju.
Angleški nDCG@5
Model | Računalništvo | Energetika | Finance | Kadrovanje | Industrija | Farmacija | Fizika | Povp. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Večjezični nDCG@5
Model | Računalništvo | Energetika | Finance | Kadrovanje | Industrija | Farmacija | Fizika | Povp. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Dosledno visoka uspešnost na področjih ESG, ekonomije in DocVQA.
Primerjalni preizkus | Model | Rezultat (povp.) | Pomembna zmaga |
ViDoRe V2 (angleško) | ColQwen3-8B | 0.6772 | 1. mesto pri ESG & BioMed |
ViDoRe V2 (večjezično) | ColQwen3-8B | 0.6085 | 1. mesto pri ekonomiji |
ViDoRe V1 (angleško) | Nemo ColEmbed 3B | 0.9100 | Nekoliko višje povprečje |
ViDoRe V1 (angleško) | ColQwen3-8B | 0.9076 | 1. mesto pri ArxivQA & Syn-Gov |
Da bi pokazali, kako dobro se ColQwen3 posplošuje na iskanje videoposnetkov, smo modele ovrednotili s primerjalnim preizkusom CareBench za naloge iskanja videoposnetkov na podlagi besedila (General Retrieval).
Pri tem vrednotenju smo uporabili neposredno kodiranje neobdelanega videa: naši modeli so videodatoteke kodirali neposredno, brez dodatnih besedilnih oznak ali metapodatkov. To kaže, da lahko model išče izključno na podlagi vizualne semantike.
Model | Priklic@1 | Priklic@5 | Priklic@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Eden najpomembnejših premikov, ki jih omogoča ColQwen3, je obravnava videoposnetkov enako kot dokumentov. V številnih podjetjih so videoposnetki »temni podatki«. Ležijo v hladni shrambi in jih sploh ni mogoče iskati, razen če je človek ročno označil vsako datoteko.
ColQwen3 to spreminja, saj omogoča iskanje po posameznih sličicah v razdeljenih posnetkih.
Podjetja vsak dan posnamejo na tisoče ur internih videosestankov, ti posnetki pa običajno izginejo v pozabo.
Potek dela: Z avtomatskim razdeljevanjem dolgih posnetkov sestankov na krajše, smiselne izseke in njihovim indeksiranjem s ColQwen3 ustvarite »pomnilnik podjetja«, po katerem je mogoče iskati.
Poizvedba: Vodja projekta lahko vpraša: “Show me the clip where the engineering lead explained the latency issue with the API.”
Rezultat: Sistem namesto 60-minutne videodatoteke poišče točno tisti 45-sekundni odsek, v katerem je bil na zaslonu prikazan in obravnavan konkretni diagram, tudi če govorci ravno takrat niso izrecno izgovorili besede »latency«.
Prehod na izvorne večmodalne vložitve omogoča povsem nove delovne postopke v različnih panogah. Ta model smo obsežno primerjalno preizkusili v nekaterih najzahtevnejših poslovnih podatkovnih okoljih.
ColQwen3 smo preizkusili na podatkovnih izzivih urbanističnih svetovalnih podjetij, ki upravljajo obsežne zbirke prostorskih načrtov, kart namenske rabe in zapletenih arhitekturnih fasadnih načrtov.
Izziv: Tradicionalni cevovodi RAG imajo v takih okoljih težave. Orodja OCR zapletene situacijske načrte običajno opišejo zgolj kot »shemo« ter spregledajo ključne podrobnosti o prometnih tokovih, zelenih površinah ali odmikih stavb.
Uspešnost: Naši interni primerjalni preizkusi kažejo, da ColQwen3 učinkovito odpravlja potrebo po dragi predobdelavi z OCR-jem oziroma opisovanjem slik. Pri preizkusih z zelo podrobnimi arhitekturnimi risbami je model uspešno poiskal dokumente na podlagi konkretnih vizualnih oznak, kot so dostopne točke za pešce ali jasno razmejene namenske rabe. S tem je občutno presegel izhodišča, ki temeljijo samo na besedilu, in obeta veliko znižanje stroškov vnosa znanja.
Investicijski bančniki in analitiki porabijo na tisoče ur za pregledovanje letnih poročil in predstavitev za vlagatelje.
Potek dela: Analitik lahko vpraša: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Premik: Model se ne zanaša na ujemanje ključnih besed, temveč poišče točen diapozitiv na podlagi vizualne prisotnosti konkretnega prikaza podatkov, zato lahko sistem RAG zelo natančno odgovarja na vprašanja.
Proizvodna podjetja imajo obsežne zbirke tehničnih priročnikov ter diagramov cevovodov in instrumentacije (P&ID).
Potek dela: Terenski inženir, ki popravlja turbino, lahko fotografira del ali vpraša: “Show me the wiring diagram for the hydraulic pump assembly.”
Premik: ColQwen3 prepozna vizualni prikaz električne sheme in poišče pravo stran, s čimer lahko izpad skrajša za več ur.
Pravno odkrivanje vključuje pregledovanje milijonov optično prebranih strani, na katerih je iskana »igla v kopici sena« pogosto vizualna oznaka.
Potek dela: Pooblaščenec za skladnost lahko išče “Documents signed by the CFO” ali “Contracts containing the official ‘Confidential’ stamp.”
Premik: Model na podlagi vizualne prisotnosti podpisov ali žigov razlikuje med osnutkom in dokončnim dokumentom, kar čisti OCR pogosto spregleda.
ColQwen3 ima odprte uteži (Apache 2.0) in je že na voljo na platformi Hugging Face. Zasnovali smo ga kot neposredno nadgradnjo sodobnih cevovodov RAG, ki vključuje kodo za sklepanje, potrebno za takojšnjo obdelavo besedila, slik in videoposnetkov.
Za podjetja, ki želijo preseči preprosto besedilno iskanje in izkoristiti inteligenco, ujeto v svojih vizualnih vsebinah, je to novi standard.
Naslednji korak: Oglejte si sistemski dokument modela in preizkusite predstavitev v živo na platformi Hugging Face: /-colqwen3-embed-8b in /-colqwen3-embed-4b