Mere end tekst: Ægte multimodal RAG fra ende til anden

Multimodale indlejringsmodeller hjælper teams med at finde nyttige oplysninger direkte i komplekse dokumenter, billeder og videoer.

De seneste to år har »RAG« (Retrieval-Augmented Generation) næsten udelukkende været synonymt med tekst. Standardmetoden er enkel: Tag dokumenter, udtræk teksten, opdel den i bidder, og indeksér den.

Men virksomheder drives ikke af almindelige tekstfiler. De bygger på komplekse PDF-filer, præsentationer med tætpakkede diagrammer, CAD-tegninger, scannede fakturaer og i stigende grad enorme arkiver med videooptagelser.

Branchestandarden – at bruge OCR eller visuelle LLM'er til at »beskrive« et billede som tekst før indlejring – er en enorm flaskehals. Det er langsomt og dyrt og medfører uundgåeligt, at de oprindelige datas rige rumlige og visuelle kontekst går tabt. Hvis din AI blot beskriver et komplekst visuelt materiale som »en teknisk tegning«, mister du muligheden for at søge efter den specifikke ventil eller det specifikke ledningsdiagram i den.

I dag lancerer vi en serie avancerede multimodale indlejringsmodeller, der bygger på ColPali-arkitekturen og løser problemet ved at muliggøre visuel søgning fra ende til anden.

Teknikken bag magien: avancerede finjusteringsstrategier

At bygge en virkelig effektiv multimodal søgemodel er ikke så enkelt som at tage en standardmodel for visuelt sprog (VLM) og bede den om at søge. For at løse de udfordringer, der historisk har bremset multimodal RAG, og skabe ColQwen3 anvendte vi strategier til modelsammenlægning og træning.

1. Overførsel af indlejringsevner via finjusteret sammenlagt vægtning

I stedet for at finjustere en basismodel fra bunden udviklede vi en metode til at overføre viden om søgeopgaver fra en eksisterende tekstbaseret indlejringsmodel. En standard-VLM kan beskrive billeder, men kan ikke nødvendigvis rangere dem semantisk i forhold til en forespørgsel.

For at lukke dette hul anvendte vi strategier med finjusteret sammenlagt vægtning. I vores forsøg konstaterede vi, at Qwen3-Embeddings søgeevne i det latente tekstrum kunne overføres direkte til det multimodale rum og generalisere til billed- og videosøgning selv uden umiddelbar træning. Med denne effektive initialisering som et stærkt udgangspunkt finjusterede vi derefter modellen for at optimere ydeevnen yderligere og sikre robusthed. Det forbedrer den endelige søgeydelse sammenlignet med finjustering af Qwen3-VL-basismodellen.

2. Omhyggelig justering af hyperparametre

Efter overførslen af indlejringsevnerne fokuserede vi på tilpasning. Vi udførte grundige søgninger efter hyperparametre og ablationsstudier af blandt andet det optimale antal epoker, batchstørrelse, læringsrate, LoRA-rang og sammensætning af datasæt for at maksimere søgeydelsen.

Som datasæt til finjustering valgte vi VDR, ColPali-træningssættet, visrag_syn, og visrag_ind. Vi brugte UniMax-sampling til finjusteringen. Da vi anvendte modelsammenlægning, og den sammenlagte basismodel allerede har delvise multimodale søgeevner, konstaterede vi, at flere datasæt faktisk ville forringe ydeevnen en smule. Derfor skalerede vi ikke op til flere datasæt.

Her er de hyperparametre, vi valgte til finjusteringen:

LoRA-rang

32

LoRA-alfa

32

LoRA-målmoduler

alle billed- og tekstlag undtagen indlejring

Læringsrate

5e-5

Maks. visuelle tokens

1280

Træningsepoker

1

Global batchstørrelse

512

Opvarmningsandel

5%

3. »ColBERT«-dilemmaet: høj ydeevne kontra lageromkostninger

Historisk set har modeller med tokenindlejringer i »ColBERT-stil« (som ColPali) leveret en imponerende ydeevne, men med uoverkommelige lageromkostninger. Indeksering af hvert visuelt token skabte enorme vektordatabaser, som var for dyre til brug i stor skala i virksomheder.

  • Optimeringsstrategien: Vi håndterede lagerudfordringen ved nøje at afbalancere størrelsen på vores indlejringer, så ydeevnen blev maksimeret, uden at lageromkostningerne eksploderede. For at bevare SOTA-nøjagtigheden med dette effektive lageraftryk valgte vi omhyggeligt en dimensionsstørrelse på 320, som gav den bedste balance mellem søgeydelse og lageromkostninger.

    • Reference: En standardtilgang (som NVIDIA Nemo-3B) kræver cirka 10,3 TB til lagring af indlejringer for 1 million billeder (1.802 tokens @ 3.072 dimensioner).

    • ColQwen3: Lagrer de samme 1 million billeder på kun 0,82 TB (maks. 1.280 tokens @ 320 dimensioner).

ColQwen3 opnår SOTA-nøjagtighed ved søgning uden at sprænge budgettet til cloudinfrastruktur.

Evalueringsresultater

Vi validerede vores tilgang med ViDoRe-benchmarkpakken. Resultaterne bekræfter, at ColQwen3 sætter nye standarder i de nyeste V3- og V2-benchmarks (både engelske og flersprogede) og samtidig leverer ydeevne i topklasse på ældre V1-opgaver.

ViDoRe v3 (nyeste)

ColQwen3-8B fører inden for engelsk og flersproget søgning.

Engelsk nDCG@5

Model

Datalogi

Energi

Finans

HR

Ind.

Farma

Fysik

Gns.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Flersproget nDCG@5

Model

Datalogi

Energi

Finans

HR

Ind.

Farma

Fysik

Gns.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Højdepunkter fra ViDoRe v2 og v1

Konsekvent høj ydeevne på tværs af ESG, økonomi og DocVQA.

Benchmark

Model

Score (gns.)

Bemærkelsesværdig sejr

ViDoRe V2 (engelsk)

ColQwen3-8B

0.6772

Nr. 1 i ESG & BioMed

ViDoRe V2 (flersproget)

ColQwen3-8B

0.6085

Nr. 1 i økonomi

ViDoRe V1 (engelsk)

Nemo ColEmbed 3B

0.9100

Lidt højere gennemsnit

ViDoRe V1 (engelsk)

ColQwen3-8B

0.9076

Nr. 1 i ArxivQA & Syn-Gov

Videosøgning: CareBench-evaluering

For at vise, at ColQwen3 generaliserer effektivt til videosøgning, evaluerede vi modellerne med CareBench-benchmarket for tekst-til-video-opgaver (generel søgning).

Til denne evaluering brugte vi rå videokodning: Vores modeller kodede videofilerne direkte uden yderligere tekstannotationer eller metadata som input. Det fremhæver modellens evne til at søge udelukkende ud fra visuel semantik.

Model

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Frigørelse af »mørke data«: videoens banebrydende potentiale

En af de mest markante forandringer, som ColQwen3 muliggør, er evnen til at behandle video på samme måde som dokumenter. I mange virksomheder er video »mørke data«. Materialet ligger i kold lagring og er helt usøgbart, medmindre et menneske manuelt har tagget hver fil.

Det ændrer ColQwen3 ved at muliggøre billed-for-billed-søgning i segmenterede klip.

Fokus på anvendelse: virksomhedens hukommelsesbank

Hver dag optager virksomheder tusindvis af timers interne videomøder, og som regel forsvinder optagelserne i glemslen.

  • Arbejdsgangen: Ved automatisk at opdele lange mødeoptagelser i kortere, logiske klip og indeksere dem med ColQwen3 skaber man en søgbar »virksomhedshukommelse«.

  • Forespørgslen: En projektleder kan spørge: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Resultatet: I stedet for at returnere en 60 minutter lang videofil finder systemet præcis det 45-sekunders segment, hvor det pågældende diagram blev vist på skærmen og diskuteret – selv hvis talerne ikke udtrykkeligt sagde ordet »latency« på netop det tidspunkt.

Anvendelser i virksomheder: Løsning af værdifulde problemer

Overgangen til indlejring med indbygget multimodalitet åbner for helt nye arbejdsgange på tværs af brancher. Vi har testet denne model grundigt mod nogle af de mest komplekse datamiljøer i virksomheder.

1. Benchmarkhøjdepunkt: byrådgivning og arkitektur

Vi testede ColQwen3 mod de dataudfordringer, som byrådgivningsfirmaer møder, når de håndterer enorme samlinger af helhedsplaner, zonekort og komplekse arkitektoniske facadetegninger.

  • Udfordringen: I disse miljøer har traditionelle RAG-pipelines svært ved at slå til. OCR-værktøjer beskriver typisk komplekse situationsplaner blot som »skemaer« og overser afgørende detaljer om trafikstrømme, grønne zoner eller byggelinjer.

  • Ydeevnen: Vores interne benchmarks viser, at ColQwen3 effektivt fjerner behovet for dyr OCR- og billedtekstforbehandling. I test med informationstætte arkitekttegninger fandt modellen dokumenter ud fra specifikke visuelle markører som fodgængeradgange eller tydelige zonegrænser. Den klarede sig markant bedre end rent tekstbaserede referencemodeller og kan samtidig reducere omkostningerne ved indlæsning af viden drastisk.

2. Kompleks finans- og markedsindsigt

Investeringsbankfolk og analytikere bruger tusindvis af timer på at gennemgå årsrapporter og investorpræsentationer.

  • Arbejdsgangen: En analytiker kan spørge: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Forandringen: I stedet for at basere sig på søgeordsmatch finder modellen det præcise dias ud fra den visuelle tilstedeværelse af den specifikke datavisualisering, så RAG-systemet kan besvare spørgsmål med høj præcision.

3. Industriel produktion og service i marken

Produktionsvirksomheder råder over enorme samlinger af tekniske manualer og rør- og instrumentdiagrammer (P&ID'er).

  • Arbejdsgangen: En servicetekniker, der reparerer en turbine, kan tage et billede af en del eller spørge: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Forandringen: ColQwen3 identificerer den visuelle gengivelse af ledningsdiagrammet og finder den korrekte side, hvilket potentielt kan reducere nedetiden med flere timer.

4. Jura og compliance

Juridisk dokumentgennemgang omfatter millioner af scannede sider, hvor »nålen i høstakken« ofte er en visuel markør.

  • Arbejdsgangen: En complianceansvarlig kan søge efter “Documents signed by the CFO” eller “Contracts containing the official ‘Confidential’ stamp.”

  • Forandringen: Modellen skelner mellem et udkast og et færdiggjort dokument ud fra den visuelle tilstedeværelse af underskrifter eller stempler – noget, som ren OCR ofte overser.

Kom godt i gang

ColQwen3 har åbne vægte (Apache 2.0) og er nu tilgængelig på Hugging Face. Vi har designet den som en direkte opgradering til moderne RAG-pipelines med den inferenskode, der kræves for straks at behandle tekst, billeder og video.

For virksomheder, der er klar til at gå videre end enkel tekstsøgning og frigøre den intelligens, der er gemt i deres visuelle aktiver, er dette den nye standard.

Næste skridt: Se modelkortet, og prøv livedemoen på Hugging Face: /-colqwen3-embed-8b og /-colqwen3-embed-4b

Forfatter

Xin Huang og Kye Min Tan