Verder dan tekst: echte multimodale, end-to-end RAG ontsluiten

Met multimodale embeddingmodellen kunnen teams nuttige informatie rechtstreeks ophalen uit complexe documenten, afbeeldingen en video's.

De afgelopen twee jaar stond "RAG" (Retrieval-Augmented Generation) vrijwel uitsluitend voor tekst. De standaardaanpak is eenvoudig: neem documenten, extraheer de tekst, verdeel die in segmenten en indexeer deze.

Maar het bedrijfsleven draait niet op plattetekstbestanden. Het draait op complexe pdf's, presentaties met informatierijke grafieken, CAD-tekeningen, gescande facturen en steeds vaker enorme archieven met videobeelden.

De industriestandaard om dit te verwerken — afbeeldingen vóór het embedden met OCR of Vision LLM's van tekstuele bijschriften voorzien — vormt een enorme flessenhals. Deze aanpak is traag en duur, en verliest onvermijdelijk de rijke ruimtelijke en visuele context van de oorspronkelijke data. Als uw AI een complexe afbeelding simpelweg omschrijft als "een blauwdruk", kunt u niet meer zoeken naar de specifieke klep of het bedradingsschema daarin.

Vandaag brengen we een reeks geavanceerde multimodale embeddingmodellen uit die voortbouwen op de ColPali-architectuur en dit probleem oplossen met end-to-end visuele retrieval.

De techniek achter de magie: geavanceerde strategieën voor fine-tuning

Een werkelijk effectieve multimodale retriever bouwen is niet zo eenvoudig als een kant-en-klaar Vision-Language Model (VLM) laten zoeken. Om de problemen op te lossen die multimodale RAG van oudsher beperken en ColQwen3 te creëren, gebruikten we strategieën voor het samenvoegen en trainen van modellen.

1. Embeddingcapaciteit overdragen via afgestemde gewogen samenvoeging

In plaats van een basismodel vanaf nul te fine-tunen, ontwikkelden we een methode om kennis van retrievaltaken over te dragen vanuit een bestaand tekstueel embeddingmodel. Een standaard-VLM kan afbeeldingen beschrijven, maar kan ze niet per se op semantische relevantie voor een zoekopdracht rangschikken.

Om deze kloof te overbruggen, gebruikten we strategieën voor afgestemde gewogen samenvoeging. Uit onze experimenten bleek dat de retrievalcapaciteit van Qwen3-Embedding in de tekstuele latente ruimte rechtstreeks kon worden overgedragen naar de multimodale ruimte. Deze generaliseerde zelfs zonder directe training naar retrieval van afbeeldingen en video's. Met deze effectieve initialisatie als sterk uitgangspunt hebben we het model vervolgens gefinetuned om de prestaties verder te optimaliseren en de robuustheid te waarborgen. Dit verbetert de uiteindelijke retrievalprestaties ten opzichte van fine-tuning vanuit het Qwen3-VL-basismodel.

2. Zorgvuldige afstemming van hyperparameters

Nadat de embeddingcapaciteiten waren overgedragen, richtten we ons op de afstemming. We voerden zorgvuldige zoekopdrachten naar hyperparameters en ablatiestudies uit, onder meer naar het optimale aantal epochs, de batchgrootte, de leersnelheid, de LoRA-rang en de mix van datasets, om de retrievalprestaties te maximaliseren.

Als datasets voor fine-tuning kozen we VDR, de ColPali-trainingsset, visrag_syn, en visrag_ind. Voor de fine-tuning gebruikten we UniMax-sampling. Omdat we modellen samenvoegden en het samengevoegde basismodel al een deel van de multimodale retrievalcapaciteit erft, bleek uitbreiding met meer datasets de prestaties juist iets te verminderen. Daarom hebben we het aantal datasets niet verder opgeschaald.

Dit zijn de hyperparameters die we voor de fine-tuning hebben gekozen:

LoRA-rang

32

LoRA-alfa

32

LoRA-doelmodules

alle lagen voor zowel beeld als tekst, behalve embeddings

Leersnelheid

5e-5

Max. visuele tokens

1280

Trainingsepochs

1

Globale batchgrootte

512

Warm-upverhouding

5%

3. Het "ColBERT"-dilemma: hoge prestaties versus opslagkosten

Modellen met embeddings op tokenniveau in "ColBERT-stijl" (zoals ColPali) boden van oudsher indrukwekkende prestaties, maar tegen onbetaalbare opslagkosten. Door elke visuele token te indexeren ontstonden enorme vectordatabases die te duur waren voor gebruik op bedrijfsschaal.

  • De optimalisatiestrategie: We pakten het opslagprobleem aan door de omvang van onze embeddings zorgvuldig af te stemmen, zodat de prestaties maximaal bleven zonder dat de opslagkosten explodeerden. Om binnen deze efficiënte omvang SOTA-nauwkeurigheid te behouden, kozen we zorgvuldig een dimensiegrootte van 320 voor de beste balans tussen retrievalprestaties en opslagkosten.

    • Baseline: Een standaardaanpak (zoals NVIDIA Nemo-3B) vereist ongeveer 10,3 TB om embeddings voor 1 miljoen afbeeldingen op te slaan (1.802 tokens met 3.072 dimensies).

    • ColQwen3: Slaat dezelfde 1 miljoen afbeeldingen op in slechts 0,82 TB (max. 1.280 tokens met 320 dimensies).

ColQwen3 behaalt SOTA-nauwkeurigheid bij retrieval zonder het budget voor cloudinfrastructuur op te blazen.

Evaluatieresultaten

We hebben onze aanpak gevalideerd met de ViDoRe-benchmarksuite. De resultaten bevestigen dat ColQwen3 nieuwe maatstaven zet voor de nieuwste V3- en V2-benchmarks, zowel Engels als meertalig, en tegelijk topprestaties levert bij oudere V1-taken.

ViDoRe v3 (nieuwste)

ColQwen3-8B presteert het best bij Engelse en meertalige retrieval.

Engelse nDCG@5

Model

Informatica

Energie

Financiën

HR

Ind.

Farma

Natuurkunde

Gem.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Meertalige nDCG@5

Model

Informatica

Energie

Financiën

HR

Ind.

Farma

Natuurkunde

Gem.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Hoogtepunten van ViDoRe v2 en v1

Consistent sterke prestaties bij ESG, economie en DocVQA.

Benchmark

Model

Score (gem.)

Opvallend resultaat

ViDoRe V2 (Engels)

ColQwen3-8B

0.6772

Nr. 1 in ESG & BioMed

ViDoRe V2 (meertalig)

ColQwen3-8B

0.6085

Nr. 1 in economie

ViDoRe V1 (Engels)

Nemo ColEmbed 3B

0.9100

Iets hoger gemiddelde

ViDoRe V1 (Engels)

ColQwen3-8B

0.9076

Nr. 1 in ArxivQA & Syn-Gov

Video-retrieval: evaluatie met CareBench

Om aan te tonen dat ColQwen3 goed generaliseert naar video-retrieval, hebben we de modellen geëvalueerd met de CareBench-benchmark voor text-to-video-taken (General Retrieval).

Voor deze evaluatie gebruikten we onbewerkte videocodering: onze modellen codeerden de videobestanden rechtstreeks, zonder aanvullende tekstuele annotaties of metadata. Dit onderstreept dat het model uitsluitend op basis van visuele semantiek informatie kan ophalen.

Model

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

"Dark data" ontsluiten: de grensverleggende mogelijkheden van video

Een van de ingrijpendste veranderingen die ColQwen3 mogelijk maakt, is dat video net als documenten kan worden verwerkt. Bij veel bedrijven is video "dark data". De beelden staan in koude opslag en zijn volstrekt ondoorzoekbaar, tenzij iemand elk bestand handmatig heeft getagd.

ColQwen3 brengt daar verandering in door retrieval per frame mogelijk te maken voor gesegmenteerde clips.

Uitgelichte toepassing: het bedrijfsgeheugen

Bedrijven nemen dagelijks duizenden uren aan interne videovergaderingen op, maar meestal verdwijnen die opnamen in een zwart gat.

  • De workflow: Door lange vergaderopnamen automatisch op te delen in kortere, logische clips en die met ColQwen3 te indexeren, creëert u een doorzoekbaar "bedrijfsgeheugen".

  • De zoekopdracht: Een projectmanager kan vragen: "Show me the clip where the engineering lead explained the latency issue with the API."

  • Het resultaat: In plaats van een videobestand van 60 minuten terug te geven, haalt het systeem precies het fragment van 45 seconden op waarin dat specifieke diagram in beeld werd gedeeld en besproken, zelfs als de sprekers op dat moment niet expliciet het woord "latency" uitspraken.

Bedrijfstoepassingen: waardevolle problemen oplossen

De overstap naar native multimodale embeddings maakt in allerlei sectoren volledig nieuwe workflows mogelijk. We hebben dit model uitgebreid gebenchmarkt in enkele van de meest complexe bedrijfsomgevingen voor data.

1. Uitgelichte benchmark: stedelijk advies en architectuur

We hebben ColQwen3 getest met de data-uitdagingen van stedelijke adviesbureaus, die enorme verzamelingen structuurplannen, bestemmingskaarten en complexe bouwkundige aanzichten beheren.

  • De uitdaging: Traditionele RAG-pijplijnen hebben moeite met dit soort omgevingen. OCR-tools omschrijven complexe situatietekeningen doorgaans simpelweg als "schema" en missen zo cruciale details over verkeersstromen, groenzones of rooilijnen.

  • De prestaties: Onze interne benchmarks tonen aan dat ColQwen3 dure voorverwerking met OCR en bijschriften effectief overbodig maakt. In tests met zeer gedetailleerde bouwtekeningen haalde het model met succes documenten op aan de hand van specifieke visuele kenmerken, zoals voetgangerstoegangen of duidelijke bestemmingsgrenzen. Daarmee presteerde het aanzienlijk beter dan baselines die alleen tekst gebruiken, terwijl de kosten voor kennisopname sterk kunnen dalen.

2. Complexe financiële en marktinformatie

Investeringsbankiers en analisten besteden duizenden uren aan het doorspitten van jaarverslagen en beleggerspresentaties.

  • De workflow: Een analist kan vragen: "Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks."

  • De verandering: In plaats van op overeenkomende trefwoorden te vertrouwen, haalt het model precies de juiste dia op aan de hand van de visuele aanwezigheid van de specifieke datavisualisatie. Zo kan het RAG-systeem vragen zeer nauwkeurig beantwoorden.

3. Industriële productie en buitendienst

Productiebedrijven beschikken over enorme verzamelingen technische handleidingen en leiding- en instrumentatieschema's (P&ID's).

  • De workflow: Een buitendienstmonteur die een turbine repareert, kan een foto van een onderdeel maken of vragen: "Show me the wiring diagram for the hydraulic pump assembly."

  • De verandering: ColQwen3 herkent de visuele weergave van het bedradingsschema en haalt de juiste pagina op, waardoor de uitvaltijd mogelijk met uren wordt verkort.

4. Juridische zaken en compliance

Bij juridisch feitenonderzoek moeten miljoenen gescande pagina's worden beoordeeld, waarbij de "speld in de hooiberg" vaak een visueel kenmerk is.

  • De workflow: Een compliancemedewerker kan zoeken naar "Documents signed by the CFO" of "Contracts containing the official 'Confidential' stamp."

  • De verandering: Het model onderscheidt een concept van een definitief document aan de hand van de visuele aanwezigheid van handtekeningen of stempels, iets wat pure OCR vaak mist.

Aan de slag

ColQwen3 heeft open gewichten (Apache 2.0) en is nu beschikbaar op Hugging Face. We hebben het ontworpen als een direct inzetbare upgrade voor moderne RAG-pijplijnen, inclusief de benodigde inferentiecode om meteen tekst, afbeeldingen en video te verwerken.

Voor bedrijven die verder willen gaan dan eenvoudig zoeken in tekst en de intelligentie in hun visuele materiaal willen ontsluiten, is dit de nieuwe standaard.

Volgende stap: Bekijk de modelkaart en probeer de live demo op Hugging Face: /-colqwen3-embed-8b en /-colqwen3-embed-4b

Auteur

Xin Huang, Kye Min Tan