De siste to årene har «RAG» (Retrieval-Augmented Generation) nesten utelukkende vært forbundet med tekst. Standardoppskriften er enkel: Ta dokumenter, trekk ut teksten, del den opp og indekser den.
Men næringslivet drives ikke av rene tekstfiler. Det drives av komplekse PDF-er, presentasjoner med tettpakkede diagrammer, CAD-tegninger, skannede fakturaer og stadig oftere enorme arkiver med videoopptak.
Bransjestandarden – å bruke OCR eller visuelle språkmodeller til å «tekstbeskrive» et bilde før det representeres som en embedding – er en enorm flaskehals. Det er tregt og kostbart og fører uunngåelig til at den rike romlige og visuelle konteksten i originaldataene går tapt. Hvis KI-en din bare beskriver et komplekst bilde som «en arbeidstegning», mister du muligheten til å søke etter den bestemte ventilen eller koblingsskissen i bildet.
I dag lanserer vi en serie avanserte multimodale embedding-modeller basert på ColPali-arkitekturen. De løser dette problemet ved å muliggjøre helhetlig visuell gjenfinning.
Å bygge en virkelig effektiv multimodal gjenfinningsmodell er ikke så enkelt som å ta en standard visuell språkmodell (VLM) og be den søke. For å løse utfordringene som historisk har holdt multimodal RAG tilbake, og skape ColQwen3, brukte vi strategier for modellsammenslåing og trening.
I stedet for å finjustere en grunnmodell fra bunnen av utviklet vi en metode for å overføre kunnskap om gjenfinningsoppgaver fra en eksisterende tekstbasert embedding-modell. En vanlig VLM kan beskrive bilder, men vet ikke nødvendigvis hvordan de skal rangeres semantisk opp mot en spørring.
For å bygge bro over dette gapet brukte vi strategier med finjustert, sammenslått vekting. I forsøkene våre fant vi at gjenfinningsevnen til Qwen3-Embedding i det latente tekstrommet kunne overføres direkte til det multimodale rommet. Den generaliserte til bilde- og videogjenfinning selv uten umiddelbar trening. Vi brukte denne effektive initialiseringen som et solid utgangspunkt og finjusterte deretter modellen for å forbedre ytelsen ytterligere og sikre robusthet. Det gir bedre endelig gjenfinningsytelse enn finjustering fra grunnmodellen Qwen3-VL.
Etter at embedding-egenskapene var overført, konsentrerte vi oss om tilpasning. Vi gjennomførte grundige søk etter hyperparametere og ablasjonsstudier, blant annet av optimalt antall epoker, batchstørrelse, læringsrate, LoRA-rangering og datasettblanding, for å maksimere gjenfinningsytelsen.
Som datasett for finjustering valgte vi VDR, ColPali train set, visrag_syn, og visrag_ind. Vi brukte UniMax-utvalg til finjusteringen. Fordi vi brukte modellsammenslåing og den sammenslåtte grunnmodellen allerede har en viss multimodal gjenfinningsevne, fant vi at flere datasett faktisk ville svekke ytelsen litt. Derfor skalerte vi ikke opp til flere datasett.
Dette er hyperparameterne vi valgte for finjusteringen:
LoRA-rangering | 32 |
LoRA-alfa | 32 |
LoRA-målmoduler | alle bilde- og tekstlag unntatt embedding-laget |
Læringsrate | 5e-5 |
Maks. antall visuelle tokener | 1280 |
Treningsepoker | 1 |
Global batchstørrelse | 512 |
Oppvarmingsandel | 5% |
Historisk har modeller med «ColBERT-lignende» embeddings på tokennivå, som ColPali, gitt svært høy ytelse, men uoverkommelige lagringskostnader. Indeksering av hvert visuelle token skapte enorme vektordatabaser som var for kostbare i virksomhetsskala.
Optimaliseringsstrategien: Vi løste lagringsutfordringen ved å balansere størrelsen på embeddingene nøye, slik at vi beholdt maksimal ytelse uten at lagringskostnadene løp løpsk. For å opprettholde bransjeledende nøyaktighet med dette effektive formatet valgte vi dimensjonsstørrelsen 320, som gir den beste balansen mellom gjenfinningsytelse og lagringskostnader.
Referanse: En vanlig metode, som NVIDIA Nemo-3B, krever omtrent 10,3 TB for å lagre embeddings for 1 million bilder (1 802 tokener med 3 072 dimensjoner).
ColQwen3: Lagrer de samme 1 million bildene på bare 0,82 TB (maks. 1 280 tokener med 320 dimensjoner).
ColQwen3 oppnår bransjeledende nøyaktighet for gjenfinning uten å sprenge budsjettet for skyinfrastruktur.
Vi validerte fremgangsmåten vår med ViDoRe-referansetestene. Resultatene bekrefter at ColQwen3 setter en ny standard i de nyeste V3- og V2-testene, både på engelsk og flere språk, samtidig som ytelsen er blant de beste på eldre V1-oppgaver.
ColQwen3-8B leder innen gjenfinning på engelsk og flere språk.
Engelsk nDCG@5
Modell | Informatikk | Energi | Finans | HR | Ind. | Farmasi | Fysikk | Snitt |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Flerspråklig nDCG@5
Modell | Informatikk | Energi | Finans | HR | Ind. | Farmasi | Fysikk | Snitt |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Jevnt høy ytelse på ESG, Economics og DocVQA.
Referansetest | Modell | Poengsum (snitt) | Fremtredende seier |
ViDoRe V2 (engelsk) | ColQwen3-8B | 0.6772 | Nr. 1 i ESG & BioMed |
ViDoRe V2 (flerspråklig) | ColQwen3-8B | 0.6085 | Nr. 1 i Economics |
ViDoRe V1 (engelsk) | Nemo ColEmbed 3B | 0.9100 | Noe høyere gjennomsnitt |
ViDoRe V1 (engelsk) | ColQwen3-8B | 0.9076 | Nr. 1 i ArxivQA & Syn-Gov |
For å vise at ColQwen3 generaliserer svært godt til videogjenfinning, evaluerte vi modellene med CareBench-referansetesten for tekst-til-video-oppgaver (General Retrieval).
I denne evalueringen brukte vi rå videokoding: Modellene våre kodet videofilene direkte uten ytterligere tekstlige merknader eller metadata. Dette fremhever modellens evne til å finne innhold utelukkende basert på visuell semantikk.
Modell | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
En av de mest betydningsfulle endringene ColQwen3 muliggjør, er at video kan behandles på samme måte som dokumenter. I mange virksomheter er video «mørke data». Opptakene ligger i kaldlagring og er fullstendig usøkbare med mindre noen manuelt har merket hver fil.
ColQwen3 endrer dette ved å muliggjøre bildevis gjenfinning i segmenterte klipp.
Hver dag tar virksomheter opp tusenvis av timer med interne videomøter, og som regel forsvinner disse opptakene i et svart hull.
Arbeidsflyten: Ved å dele lange møteopptak automatisk inn i kortere, logiske klipp og indeksere dem med ColQwen3 skaper du et søkbart «virksomhetsminne».
Spørringen: En prosjektleder kan spørre: “Show me the clip where the engineering lead explained the latency issue with the API.”
Resultatet: I stedet for å returnere en 60 minutter lang videofil finner systemet nøyaktig det 45 sekunder lange segmentet der det aktuelle diagrammet ble vist og diskutert, selv om talerne ikke uttrykkelig sa ordet «latency» akkurat da.
Overgangen til innebygde multimodale embedding-modeller åpner helt nye arbeidsflyter på tvers av bransjer. Vi har testet denne modellen grundig mot noen av de mest komplekse datamiljøene i virksomheter.
Vi testet ColQwen3 mot datautfordringene som byrådgivningsfirmaer møter når de håndterer enorme samlinger av hovedplaner, reguleringskart og komplekse fasadetegninger.
Utfordringen: Tradisjonelle RAG-prosesser sliter i slike miljøer. OCR-verktøy beskriver ofte komplekse situasjonsplaner bare som «skjematiske» og overser viktige detaljer om trafikkflyt, grøntområder og byggegrenser.
Ytelsen: Våre interne referansetester viser at ColQwen3 effektivt fjerner behovet for kostbar OCR- og bildetekstbehandling. I tester med detaljrike arkitekttegninger fant modellen dokumenter basert på bestemte visuelle kjennetegn, som fotgjengerinnganger og tydelige reguleringsgrenser. Den overgikk tekstbaserte referansemodeller betydelig og kan samtidig redusere kostnadene ved kunnskapsinnhenting drastisk.
Investeringsbankfolk og analytikere bruker tusenvis av timer på å gå gjennom årsrapporter og investorpresentasjoner.
Arbeidsflyten: En analytiker kan spørre: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Endringen: I stedet for å basere seg på nøkkelordtreff finner modellen nøyaktig riktig lysbilde ut fra den visuelle forekomsten av den aktuelle datavisualiseringen. Dermed kan RAG-systemet besvare spørsmål med høy presisjon.
Produksjonsbedrifter har enorme samlinger av tekniske håndbøker og rør- og instrumentdiagrammer (P&ID-er).
Arbeidsflyten: En felttekniker som reparerer en turbin, kan ta bilde av en del eller spørre: “Show me the wiring diagram for the hydraulic pump assembly.”
Endringen: ColQwen3 identifiserer den visuelle fremstillingen av koblingsskjemaet og finner riktig side, noe som potensielt kan redusere nedetiden med flere timer.
Dokumentgjennomgang i juridiske saker omfatter millioner av skannede sider, der «nålen i høystakken» ofte er et visuelt kjennetegn.
Arbeidsflyten: En etterlevelsesansvarlig kan søke etter “Documents signed by the CFO” eller “Contracts containing the official ‘Confidential’ stamp.”
Endringen: Modellen skiller mellom et utkast og et ferdigstilt dokument ut fra synlige signaturer eller stempler – noe ren OCR ofte overser.
ColQwen3 har åpne vekter (Apache 2.0) og er nå tilgjengelig på Hugging Face. Vi har utformet den som en direkte oppgradering for moderne RAG-prosesser, med inferenskoden som trengs for å behandle tekst, bilder og video umiddelbart.
For virksomheter som er klare til å gå videre fra enkelt tekstsøk og frigjøre intelligensen i de visuelle ressursene sine, er dette den nye standarden.
Neste trinn: Se modellkortet og prøv den interaktive demoen på Hugging Face: /-colqwen3-embed-8b og /-colqwen3-embed-4b