Mehr als Text: echtes multimodales End-to-End-RAG erschließen

Multimodale Einbettungsmodelle helfen Teams, nützliche Informationen direkt aus komplexen Dokumenten, Bildern und Videos abzurufen.

In den vergangenen zwei Jahren war „RAG“ (Retrieval-Augmented Generation) fast ausschließlich ein Synonym für Text. Das Standardvorgehen ist einfach: Dokumente nehmen, den Text extrahieren, in Abschnitte unterteilen und indexieren.

Doch die Unternehmenswelt basiert nicht auf reinen Textdateien. Sie arbeitet mit komplexen PDFs, Präsentationen voller Diagramme, CAD-Zeichnungen, gescannten Rechnungen und zunehmend mit riesigen Videoarchiven.

Der Branchenstandard, Bilder vor der Einbettung per OCR oder Vision-LLM als Text zu beschreiben, ist ein erheblicher Engpass. Dieses Verfahren ist langsam und teuer und verliert unweigerlich den umfangreichen räumlichen und visuellen Kontext der Originaldaten. Wenn deine KI eine komplexe Darstellung nur als „Bauplan“ beschreibt, kannst du darin nicht mehr nach einem bestimmten Ventil oder Schaltplan suchen.

Heute veröffentlichen wir eine Familie hochmoderner multimodaler Einbettungsmodelle, die auf der ColPali-Architektur aufbauen. Sie lösen dieses Problem durch eine durchgängige visuelle Suche.

Die Technik dahinter: fortgeschrittene Strategien zur Feinabstimmung

Für ein wirklich leistungsfähiges multimodales Suchsystem genügt es nicht, ein handelsübliches Bild-Sprach-Modell (VLM) suchen zu lassen. Um die bisherigen Hürden für multimodales RAG zu überwinden und ColQwen3 zu entwickeln, setzten wir Strategien zur Modellzusammenführung und zum Training ein.

1. Übertragung der Einbettungsfähigkeit durch abgestimmte Gewichtungszusammenführung

Statt ein Basismodell von Grund auf feinabzustimmen, entwickelten wir eine Methode, um das Wissen über Suchaufgaben aus einem bestehenden Texteinbettungsmodell zu übertragen. Ein Standard-VLM kann Bilder beschreiben, weiß aber nicht unbedingt, wie es sie semantisch nach ihrer Relevanz für eine Anfrage ordnet.

Um diese Lücke zu schließen, nutzten wir abgestimmte Strategien zur Gewichtungszusammenführung. Unsere Experimente zeigten, dass sich die Suchfähigkeit von Qwen3-Embedding im latenten Textraum direkt auf den multimodalen Raum übertragen ließ. Sie verallgemeinerte sich auch ohne unmittelbares Training auf die Bild- und Videosuche. Diese wirksame Initialisierung diente als solide Ausgangsbasis. Anschließend stimmten wir das Modell weiter ab, um die Leistung zu optimieren und Robustheit sicherzustellen. Dies verbessert die endgültige Suchleistung gegenüber der Feinabstimmung des Qwen3-VL-Basismodells.

2. Sorgfältige Abstimmung der Hyperparameter

Nach der Übertragung der Einbettungsfähigkeiten konzentrierten wir uns auf die Ausrichtung. Wir führten sorgfältige Hyperparametersuchen und Ablationsstudien durch. Dabei untersuchten wir unter anderem die optimale Anzahl an Epochen, die Batchgröße, die Lernrate, den LoRA-Rang und die Zusammenstellung der Datensätze, um die Suchleistung zu maximieren.

Als Datensätze für die Feinabstimmung wählten wir VDR, das ColPali-Trainingsset, visrag_syn, und visrag_ind. Für die Feinabstimmung verwendeten wir UniMax-Sampling. Da wir Modelle zusammenführten und das zusammengeführte Basismodell bereits einen Teil der multimodalen Suchfähigkeit übernimmt, stellten wir fest, dass zusätzliche Datensätze die Leistung sogar leicht verschlechtern. Deshalb erweiterten wir ihre Anzahl nicht.

Für die Feinabstimmung wählten wir folgende Hyperparameter:

LoRA-Rang

32

LoRA-Alpha

32

LoRA-Zielmodule

alle Bild- und Textebenen außer der Einbettung

Lernrate

5e-5

Maximale visuelle Token

1280

Trainingsepochen

1

Globale Batchgröße

512

Warm-up-Anteil

5 %

3. Das „ColBERT“-Dilemma: hohe Leistung oder geringe Speicherkosten

Modelle mit Einbettungen auf Token-Ebene im „ColBERT-Stil“ wie ColPali boten bislang eine außergewöhnliche Leistung, verursachten jedoch untragbare Speicherkosten. Die Indexierung jedes visuellen Tokens erzeugte riesige Vektordatenbanken, die für den Einsatz in Unternehmen zu teuer waren.

  • Die Optimierungsstrategie: Wir lösten das Speicherproblem, indem wir die Größe unserer Einbettungen sorgfältig austarierten. So bleibt die Leistung möglichst hoch, ohne dass die Speicherkosten ausufern. Um bei diesem effizienten Speicherbedarf eine erstklassige Genauigkeit zu erzielen, wählten wir 320 Dimensionen als besten Kompromiss zwischen Suchleistung und Speicherkosten.

    • Baseline: Ein Standardansatz wie NVIDIA Nemo-3B benötigt etwa 10,3 TB, um Einbettungen für 1 Million Bilder zu speichern (1.802 Token mit 3.072 Dimensionen).

    • ColQwen3: Speichert dieselbe 1 Million Bilder auf nur 0,82 TB (maximal 1.280 Token mit 320 Dimensionen).

ColQwen3 erzielt eine erstklassige Suchgenauigkeit, ohne das Budget für die Cloud-Infrastruktur zu sprengen.

Evaluierungsergebnisse

Wir haben unseren Ansatz mit der ViDoRe-Benchmark-Suite validiert. Die Ergebnisse bestätigen, dass ColQwen3 bei den neuesten V3- und V2-Benchmarks auf Englisch und in mehreren Sprachen neue Maßstäbe setzt und zugleich bei älteren V1-Aufgaben Spitzenleistungen erzielt.

ViDoRe v3 (neueste Version)

ColQwen3-8B führt bei der englischen und mehrsprachigen Suche.

Englisch nDCG@5

Modell

Informatik

Energie

Finanzen

Personal

Industrie

Pharma

Physik

Durchschn.

-colqwen3-8b

0,7443

0,6491

0,6823

0,6421

0,5766

0,6665

0,4747

0,6113

-colqwen3-4b

0,7419

0,6023

0,6753

0,6037

0,5787

0,6612

0,4640

0,5934

nemo-colembed-3b

0,7514

0,5838

0,6712

0,6256

0,5447

0,6524

0,4128

0,5769

jina-embeddings-v4

0,7175

0,5842

0,6417

0,6206

0,5443

0,6303

0,4191

0,5680

Mehrsprachig nDCG@5

Modell

Informatik

Energie

Finanzen

Personal

Industrie

Pharma

Physik

Durchschn.

-colqwen3-8b

0,7194

0,6619

0,6172

0,6097

0,5164

0,6403

0,4706

0,5866

-colqwen3-4b

0,7213

0,6374

0,6019

0,5637

0,5131

0,6351

0,4636

0,5708

nemo-colembed-3b

0,7216

0,5901

0,5646

0,5504

0,4335

0,6170

0,4192

0,5383

Highlights von ViDoRe v2 und v1

Durchgehend hohe Leistung bei ESG, Wirtschaft und DocVQA.

Benchmark

Modell

Wert (Durchschn.)

Besonderer Erfolg

ViDoRe V2 (Englisch)

ColQwen3-8B

0,6772

Platz 1 bei ESG und BioMed

ViDoRe V2 (mehrsprachig)

ColQwen3-8B

0,6085

Platz 1 bei Wirtschaft

ViDoRe V1 (Englisch)

Nemo ColEmbed 3B

0,9100

Etwas höherer Durchschnitt

ViDoRe V1 (Englisch)

ColQwen3-8B

0,9076

Platz 1 bei ArxivQA und Syn-Gov

Videosuche: CareBench-Evaluierung

Um zu zeigen, dass sich ColQwen3 gut auf die Videosuche übertragen lässt, evaluierten wir die Modelle mit dem CareBench-Benchmark für Text-zu-Video-Aufgaben (allgemeine Suche).

Für diese Evaluierung verwendeten wir eine direkte Videokodierung: Unsere Modelle kodierten die Videodateien ohne zusätzliche Textanmerkungen oder Metadaten. Dies unterstreicht die Fähigkeit des Modells, Inhalte allein anhand visueller Semantik zu finden.

Modell

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0,8670

0,9590

0,9850

-colqwen3-4b

0,8620

0,9570

0,9800

Care7B

0,7700

0,9560

0,9870

„Dark Data“ erschließen: die Frontier- der Videosuche

Eine der tiefgreifendsten Veränderungen durch ColQwen3 ist, dass Videos wie Dokumente verarbeitet werden können. In vielen Unternehmen sind Videos „Dark Data“. Sie liegen in selten genutzten Speichern und bleiben unauffindbar, sofern nicht jede Datei manuell gekennzeichnet wurde.

ColQwen3 ändert dies und ermöglicht die bildweise Suche in segmentierten Clips.

Anwendungsfall im Fokus: das Unternehmensgedächtnis

Unternehmen zeichnen täglich Tausende Stunden interner Videobesprechungen auf. Meist geraten diese Aufnahmen jedoch in Vergessenheit.

  • Der Ablauf: Lange Besprechungsaufzeichnungen werden automatisch in kürzere, logisch gegliederte Clips segmentiert und mit ColQwen3 indexiert. So entsteht ein durchsuchbares „Unternehmensgedächtnis“.

  • Die Anfrage: Eine Projektleitung kann fragen: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Das Ergebnis: Statt einer 60-minütigen Videodatei liefert das System genau den 45-sekündigen Abschnitt, in dem das betreffende Diagramm gezeigt und besprochen wurde. Das funktioniert auch dann, wenn das Wort „Latenz“ in diesem Moment nicht ausdrücklich fiel.

Anwendungsfälle in Unternehmen: wichtige Probleme lösen

Der Wechsel zu nativen multimodalen Einbettungen ermöglicht branchenübergreifend völlig neue Arbeitsabläufe. Wir haben dieses Modell umfassend anhand einiger der komplexesten Datenumgebungen in Unternehmen getestet.

1. Benchmark-Highlight: Stadtplanung und Architektur

Wir testeten ColQwen3 anhand der Datenprobleme von Stadtplanungsberatungen, die umfangreiche Bestände an Masterplänen, Flächennutzungskarten und komplexen Gebäudeansichten verwalten.

  • Die Herausforderung: Herkömmliche RAG-Pipelines stoßen in solchen Umgebungen an ihre Grenzen. OCR-Tools beschreiben komplexe Lagepläne häufig nur als „Schema“ und übersehen wichtige Details zu Verkehrsflüssen, Grünflächen oder Gebäudeabständen.

  • Die Leistung: Unsere internen Benchmarks zeigen, dass ColQwen3 eine teure OCR- und Bildbeschreibungs-Vorverarbeitung überflüssig machen kann. In Tests mit detailreichen Architekturzeichnungen fand das Modell Dokumente erfolgreich anhand bestimmter visueller Merkmale wie Zugängen für Fußgänger oder klarer Flächennutzungsgrenzen. Damit übertraf es reine Text-Baselines deutlich und verspricht, die Kosten der Wissensaufnahme drastisch zu senken.

2. Komplexe Finanz- und Marktanalysen

Fachleute im Investmentbanking und in der Analyse verbringen Tausende Stunden damit, Geschäftsberichte und Investorenpräsentationen zu durchsuchen.

  • Der Ablauf: Eine Analysefachkraft kann fragen: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Die Veränderung: Statt sich auf Stichworttreffer zu verlassen, findet das Modell die genaue Folie anhand der visuellen Darstellung der betreffenden Daten. Dadurch kann das RAG-System Fragen mit hoher Präzision beantworten.

3. Industrielle Fertigung und Außendienst

Fertigungsunternehmen verfügen über umfangreiche Bestände an technischen Handbüchern und Rohrleitungs- und Instrumentierungsdiagrammen (P&IDs).

  • Der Ablauf: Eine Fachkraft im Außendienst, die eine Turbine repariert, kann ein Bauteil fotografieren oder fragen: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Die Veränderung: ColQwen3 erkennt die visuelle Darstellung des Schaltplans und findet die richtige Seite. Dadurch können sich Ausfallzeiten möglicherweise um Stunden verkürzen.

4. Recht und Compliance

Bei der juristischen Dokumentenprüfung müssen Millionen gescannter Seiten gesichtet werden, wobei das entscheidende Detail häufig ein visuelles Merkmal ist.

  • Der Ablauf: Eine Compliance-Fachkraft kann nach “Documents signed by the CFO” oder “Contracts containing the official ‘Confidential’ stamp.” suchen.

  • Die Veränderung: Das Modell unterscheidet einen Entwurf von einem finalisierten Dokument anhand sichtbarer Unterschriften oder Stempel, die reine OCR häufig übersieht.

Erste Schritte

ColQwen3 verfügt über offene Gewichte (Apache 2.0) und ist ab sofort auf Hugging Face verfügbar. Wir haben es als direkt einsetzbares Upgrade für moderne RAG-Pipelines entwickelt. Der erforderliche Inferenzcode zur sofortigen Verarbeitung von Text, Bildern und Videos ist enthalten.

Für Unternehmen, die über eine einfache Textsuche hinausgehen und die in ihren visuellen Ressourcen enthaltenen Informationen erschließen möchten, ist dies der neue Standard.

Nächster Schritt: Lies die Modellkarte und teste die Live-Demo auf Hugging Face: /-colqwen3-embed-8b und /-colqwen3-embed-4b

Autor

Xin Huang und Kye Min Tan