Bortom text: äkta multimodal RAG från början till slut

Multimodala inbäddningsmodeller hjälper team att hämta användbar information direkt från komplexa dokument, bilder och videor.

Under de senaste två åren har ”RAG” (Retrieval-Augmented Generation) nästan uteslutande varit synonymt med text. Standardmetoden är enkel: ta dokumenten, extrahera texten, dela upp den i segment och indexera den.

Men företagsvärlden bygger inte på vanliga textfiler. Den bygger på komplexa PDF-filer, presentationer med informationsrika diagram, CAD-ritningar, skannade fakturor och i allt högre grad enorma arkiv med videomaterial.

Branschstandarden – att använda OCR eller visuella språkmodeller för att ”textbeskriva” en bild före inbäddningen – skapar en enorm flaskhals. Det är långsamt och dyrt och gör oundvikligen att den ursprungliga informationens rika rumsliga och visuella sammanhang går förlorat. Om din AI bara beskriver en komplex bild som ”en ritning” kan du inte längre söka efter den specifika ventilen eller det kopplingsschema som finns i bilden.

I dag lanserar vi en familj av toppmoderna multimodala inbäddningsmodeller som bygger vidare på arkitekturen ColPali och löser problemet genom att möjliggöra visuell sökning från början till slut.

Tekniken bakom magin: avancerade strategier för finjustering

Att bygga en verkligt effektiv multimodal sökmodell är inte så enkelt som att ta en färdig visuell språkmodell (VLM) och be den söka. För att lösa problemen som historiskt har hållit tillbaka multimodal RAG och skapa ColQwen3 använde vi strategier för modellsammanslagning och träning.

1. Överföring av inbäddningsförmåga genom finjusterad viktning vid sammanslagning

I stället för att finjustera en basmodell från grunden utvecklade vi en metod för att överföra kunskap om sökuppgifter från en befintlig textinbäddningsmodell. En vanlig VLM kan beskriva bilder men vet inte nödvändigtvis hur de ska rangordnas semantiskt mot en sökfråga.

För att överbrygga detta gap använde vi strategier med finjusterad viktning vid sammanslagning. Våra experiment visade att sökförmågan hos Qwen3-Embedding i det latenta textrummet kunde överföras direkt till det multimodala rummet och generaliseras till bild- och videosökning även utan omedelbar träning. Vi använde denna effektiva initiering som en stark utgångspunkt och finjusterade sedan modellen för att ytterligare optimera prestandan och säkerställa robusthet. Det förbättrar den slutliga sökprestandan jämfört med finjustering från basmodellen Qwen3-VL.

2. Noggrann justering av hyperparametrar

När inbäddningsförmågan hade överförts fokuserade vi på anpassningen. Vi genomförde noggranna hyperparametersökningar och ablationsstudier av bland annat optimalt antal epoker, batchstorlek, inlärningshastighet, LoRA-rang och datauppsättningsmix för att maximera sökprestandan.

Som datauppsättningar för finjustering valde vi VDR, ColPali-träningsdata, visrag_syn, och visrag_ind. Vi använde UniMax-sampling för finjusteringen. Eftersom vi använde modellsammanslagning och den sammanslagna basmodellen redan ärver viss multimodal sökförmåga upptäckte vi att fler datauppsättningar faktiskt försämrade prestandan något. Därför skalade vi inte upp till fler datauppsättningar.

Här är hyperparametrarna vi valde för finjusteringen:

LoRA-rang

32

LoRA-alfa

32

LoRA-målmoduler

alla lager för både bild och text utom inbäddning

Inlärningshastighet

5e-5

Max antal visuella token

1280

Träningsepoker

1

Global batchstorlek

512

Uppvärmningsandel

5%

3. ”ColBERT”-dilemmat: hög prestanda kontra lagringskostnad

Historiskt har modeller med inbäddningar på tokennivå i ”ColBERT-stil” (som ColPali) gett otrolig prestanda, men till en oöverkomlig lagringskostnad. Indexering av varje visuell token skapade enorma vektordatabaser som blev för dyra i företagsskala.

  • Optimeringsstrategin: Vi hanterade lagringsutmaningen genom att noggrant balansera storleken på våra inbäddningar för att behålla maximal prestanda utan skenande lagringskostnader. För att behålla marknadsledande precision med detta effektiva fotavtryck valde vi noggrant 320 dimensioner, vilket gav bäst balans mellan sökprestanda och lagringskostnad.

    • Baslinje: En standardmetod (som NVIDIA Nemo-3B) kräver cirka 10,3 TB för att lagra inbäddningar för 1 miljon bilder (1 802 token med 3 072 dimensioner).

    • ColQwen3: Lagrar samma 1 miljon bilder på bara 0,82 TB (högst 1 280 token med 320 dimensioner).

ColQwen3 uppnår marknadsledande sökprecision utan att spräcka budgeten för molninfrastruktur.

Utvärderingsresultat

Vi validerade vår metod med benchmarksviten ViDoRe. Resultaten bekräftar att ColQwen3 sätter en ny standard i de senaste benchmarktesten V3 och V2, både på engelska och flera språk, samtidigt som modellen behåller prestanda i toppklass för äldre V1-uppgifter.

ViDoRe v3 (senaste)

ColQwen3-8B leder inom informationssökning på engelska och flera språk.

Engelska nDCG@5

Modell

Datavet.

Energi

Finans

HR

Ind.

Läkemedel

Fysik

Snitt

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Flerspråkig nDCG@5

Modell

Datavet.

Energi

Finans

HR

Ind.

Läkemedel

Fysik

Snitt

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Höjdpunkter från ViDoRe v2 och v1

Genomgående höga resultat inom ESG, ekonomi och DocVQA.

Benchmarktest

Modell

Poäng (snitt)

Särskild framgång

ViDoRe V2 (engelska)

ColQwen3-8B

0.6772

Etta inom ESG & BioMed

ViDoRe V2 (flera språk)

ColQwen3-8B

0.6085

Etta inom ekonomi

ViDoRe V1 (engelska)

Nemo ColEmbed 3B

0.9100

Något högre snitt

ViDoRe V1 (engelska)

ColQwen3-8B

0.9076

Etta inom ArxivQA & Syn-Gov

Videosökning: utvärdering med CareBench

För att visa att ColQwen3 generaliserar väl till videosökning utvärderade vi modellerna med benchmarktestet CareBench för uppgifter där video hämtas utifrån text (General Retrieval).

I utvärderingen använde vi rå videokodning: våra modeller kodade videofilerna direkt, utan ytterligare textkommentarer eller metadata. Det visar modellens förmåga att söka enbart utifrån visuell semantik.

Modell

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Frigör ”mörka data”: videons nya gränsland

En av de mest genomgripande förändringarna med ColQwen3 är möjligheten att behandla video precis som dokument. I många företag är video ”mörka data”. Materialet ligger i kallagring och är helt osökbart om inte någon manuellt har taggat varje fil.

ColQwen3 förändrar detta genom att möjliggöra sökning bildruta för bildruta i segmenterade klipp.

Användningsfall i fokus: företagets minnesbank

Varje dag spelar företag in tusentals timmar av interna videomöten, och oftast försvinner inspelningarna i ett svart hål.

  • Arbetsflödet: Genom att automatiskt dela upp långa mötesinspelningar i kortare, logiska klipp och indexera dem med ColQwen3 skapar du ett sökbart ”företagsminne”.

  • Frågan: En projektledare kan fråga: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Resultatet: I stället för en 60 minuter lång videofil hämtar systemet exakt det 45-sekunderssegment där diagrammet visades och diskuterades, även om talarna inte uttryckligen sade ordet ”latency” just då.

Användningsfall för företag: lös problem med högt värde

Övergången till inbyggda multimodala inbäddningar möjliggör helt nya arbetsflöden i alla branscher. Vi har testat modellen ingående mot några av de mest komplexa datamiljöerna för företag.

1. Höjdpunkt i benchmarktestet: stadsutvecklingskonsulting och arkitektur

Vi testade ColQwen3 mot de datautmaningar som stadsutvecklingskonsulter möter när de hanterar enorma samlingar av översiktsplaner, områdesindelningskartor och komplexa fasadritningar.

  • Utmaningen: I dessa miljöer har traditionella RAG-pipelines svårt att prestera. OCR-verktyg beskriver ofta komplexa situationsplaner enbart som ”scheman” och missar viktiga detaljer om trafikflöden, grönområden eller avstånd till tomtgränser.

  • Prestandan: Våra interna benchmarktest visar att ColQwen3 effektivt eliminerar behovet av dyr OCR- och bildtextförbehandling. I tester med detaljrika arkitektritningar hämtade modellen rätt dokument utifrån specifika visuella markörer, exempelvis gångentréer och tydliga områdesgränser. Resultaten var betydligt bättre än för textbaserade baslinjer och visar potential för kraftigt sänkta kostnader för kunskapsinläsning.

2. Komplex finans- och marknadsinformation

Investmentbankirer och analytiker ägnar tusentals timmar åt att gå igenom årsredovisningar och investerarpresentationer.

  • Arbetsflödet: En analytiker kan fråga: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Förändringen: I stället för att förlita sig på sökordsträffar hämtar modellen rätt bild utifrån den visuella förekomsten av den specifika datavisualiseringen, så att RAG-systemet kan besvara frågor med hög precision.

3. Industriell tillverkning och fältservice

Tillverkningsföretag har enorma samlingar av tekniska handböcker och rör- och instrumentdiagram (P&ID).

  • Arbetsflödet: En fälttekniker som reparerar en turbin kan fotografera en del eller fråga: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Förändringen: ColQwen3 identifierar den visuella återgivningen av kopplingsschemat och hämtar rätt sida, vilket kan minska stilleståndstiden med flera timmar.

4. Juridik och regelefterlevnad

Juridisk dokumentgranskning omfattar miljontals skannade sidor där ”nålen i höstacken” ofta är en visuell markör.

  • Arbetsflödet: En regelefterlevnadsansvarig kan söka efter “Documents signed by the CFO” eller “Contracts containing the official ‘Confidential’ stamp.”

  • Förändringen: Modellen skiljer ett utkast från ett färdigställt dokument genom att visuellt upptäcka underskrifter eller stämplar, något som ren OCR ofta missar.

Kom igång

ColQwen3 har öppna vikter (Apache 2.0) och finns nu på Hugging Face. Vi har utformat den som en direkt uppgradering av moderna RAG-pipelines och tillhandahåller inferenskoden som behövs för att omedelbart bearbeta text, bilder och video.

För företag som är redo att gå bortom enkel textsökning och frigöra den intelligens som finns dold i deras visuella material är detta den nya standarden.

Nästa steg: Läs modellkortet och prova livedemon på Hugging Face: /-colqwen3-embed-8b och /-colqwen3-embed-4b

Författare

Xin Huang, Kye Min Tan