Navigation principale

Au-delà du texte : libérer un véritable RAG multimodal de bout en bout

Les modèles d’embedding multimodaux aident les équipes à extraire directement des informations utiles de documents complexes, d’images et de vidéos.

Depuis deux ans, le « RAG » (génération augmentée par la recherche) est presque exclusivement associé au texte. La méthode habituelle est simple : prendre des documents, en extraire le texte, le segmenter et l’indexer.

Mais le monde de l’entreprise ne repose pas sur des fichiers en texte brut. Il repose sur des PDF complexes, des présentations aux graphiques denses, des dessins CAO, des factures numérisées et, de plus en plus, d’immenses archives vidéo.

La méthode standard du secteur, qui consiste à utiliser l’OCR ou des LLM de vision pour « légender » une image sous forme de texte avant de créer son embedding, constitue un énorme goulot d’étranglement. Elle est lente, coûteuse et entraîne inévitablement la perte du riche contexte spatial et visuel des données d’origine. Si votre IA décrit un visuel complexe comme un simple « plan », vous ne pouvez plus rechercher la vanne ou le schéma de câblage précis qu’il contient.

Aujourd’hui, nous lançons une famille de modèles d’embedding multimodaux de pointe, fondés sur l’architecture ColPali et conçus pour résoudre ce problème grâce à la recherche visuelle de bout en bout.

L’ingénierie derrière la magie : stratégies avancées d’ajustement fin

Créer un outil de recherche multimodal réellement efficace ne consiste pas simplement à prendre un modèle vision-langage (VLM) prêt à l’emploi et à lui demander d’effectuer une recherche. Pour surmonter les obstacles qui ont historiquement freiné le RAG multimodal et créer ColQwen3, nous avons employé des stratégies de fusion et d’entraînement de modèles.

1. Transfert des capacités d’embedding par pondération de fusion ajustée

Plutôt que d’ajuster finement un modèle de base à partir de zéro, nous avons conçu une méthode permettant de transférer les connaissances des tâches de recherche depuis un modèle d’embedding textuel existant. Un VLM standard sait décrire des images, mais pas nécessairement les classer sémantiquement par rapport à une requête.

Pour combler cette lacune, nous avons utilisé des stratégies de pondération de fusion ajustée. Nos expériences ont montré que la capacité de recherche de Qwen3-Embedding dans l’espace latent textuel pouvait être directement transférée à l’espace multimodal et se généraliser à la recherche d’images et de vidéos, même sans entraînement immédiat. En exploitant cette initialisation efficace comme solide point de départ, nous avons ensuite ajusté finement le modèle afin d’optimiser davantage ses performances et d’assurer sa robustesse. Cela améliore les performances finales de recherche par rapport à un ajustement fin du modèle de base Qwen3-VL.

2. Réglage minutieux des hyperparamètres

Une fois les capacités d’embedding transférées, nous nous sommes concentrés sur l’alignement. Nous avons mené des recherches approfondies sur les hyperparamètres et des études d’ablation portant notamment sur le nombre optimal d’époques, la taille des lots, le taux d’apprentissage, le rang LoRA et la combinaison des jeux de données, afin de maximiser les performances de recherche.

Pour l’ajustement fin, nous avons choisi les jeux de données VDR, jeu d’entraînement ColPali, visrag_syn, et visrag_ind. Nous avons utilisé l’échantillonnage UniMax pour l’ajustement fin. Comme nous avons appliqué une fusion de modèles et que le modèle de base fusionné hérite déjà d’une partie des capacités de recherche multimodale, nous avons constaté que l’ajout de jeux de données dégradait légèrement les performances ; nous n’en avons donc pas augmenté le nombre.

Voici les hyperparamètres retenus pour l’ajustement fin :

Rang LoRA

32

Alpha LoRA

32

Modules cibles LoRA

toutes les couches d’image et de texte, sauf l’embedding

Taux d’apprentissage

5e-5

Nombre maximal de tokens visuels

1280

Époques d’entraînement

1

Taille globale des lots

512

Ratio de préchauffage

5%

3. Le dilemme « ColBERT » : hautes performances ou coût de stockage

Historiquement, les modèles utilisant des embeddings au niveau des tokens « à la ColBERT », comme ColPali, offraient des performances exceptionnelles, mais à un coût de stockage prohibitif. L’indexation de chaque token visuel créait d’immenses bases de données vectorielles, trop coûteuses à l’échelle de l’entreprise.

  • La stratégie d’optimisation : nous avons résolu le problème du stockage en équilibrant soigneusement la taille de nos embeddings afin de préserver des performances maximales sans faire exploser les coûts de stockage. Pour maintenir une précision de pointe dans cette empreinte réduite, nous avons choisi une dimension de 320, qui offre le meilleur équilibre entre performances de recherche et coût de stockage.

    • Référence : une approche standard, comme NVIDIA Nemo-3B, nécessite environ 10,3 To pour stocker les embeddings d’un million d’images (1 802 tokens à 3 072 dimensions).

    • ColQwen3 : stocke le même million d’images dans seulement 0,82 To (maximum de 1 280 tokens à 320 dimensions).

ColQwen3 atteint une précision de recherche de pointe sans faire exploser le budget de l’infrastructure cloud.

Résultats de l’évaluation

Nous avons validé notre approche sur la suite de benchmarks ViDoRe. Les résultats confirment que ColQwen3 établit de nouvelles références sur les derniers benchmarks V3 et V2, en anglais comme en multilingue, tout en maintenant d’excellentes performances sur les anciennes tâches V1.

ViDoRe v3 (dernière version)

ColQwen3-8B arrive en tête pour la recherche en anglais et multilingue.

nDCG@5 en anglais

Modèle

Informatique

Énergie

Finance

RH

Ind.

Pharma

Physique

Moy.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 multilingue

Modèle

Informatique

Énergie

Finance

RH

Ind.

Pharma

Physique

Moy.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Points forts de ViDoRe v2 et v1

Des performances élevées et constantes en ESG, économie et DocVQA.

Benchmark

Modèle

Score (moy.)

Résultat notable

ViDoRe V2 (anglais)

ColQwen3-8B

0.6772

N° 1 en ESG et BioMed

ViDoRe V2 (multilingue)

ColQwen3-8B

0.6085

N° 1 en économie

ViDoRe V1 (anglais)

Nemo ColEmbed 3B

0.9100

Moyenne légèrement supérieure

ViDoRe V1 (anglais)

ColQwen3-8B

0.9076

N° 1 en ArxivQA et Syn-Gov

Recherche vidéo : évaluation CareBench

Afin de démontrer la forte capacité de généralisation de ColQwen3 à la recherche vidéo, nous avons évalué les modèles sur le benchmark CareBench pour les tâches de recherche de vidéos à partir de texte (recherche générale).

Pour cette évaluation, nous avons utilisé une approche d’encodage vidéo brut : nos modèles ont encodé directement les fichiers vidéo, sans annotations textuelles supplémentaires ni métadonnées en entrée. Cela souligne la capacité du modèle à effectuer des recherches en se fondant uniquement sur la sémantique visuelle.

Modèle

Rappel@1

Rappel@5

Rappel@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Libérer les « données obscures » : la frontière de la vidéo

L’une des évolutions les plus profondes permises par ColQwen3 est sa capacité à traiter les vidéos comme des documents. Dans de nombreuses entreprises, la vidéo constitue une « donnée obscure ». Elle reste dans un stockage à froid, totalement introuvable à moins qu’une personne n’ait étiqueté manuellement chaque fichier.

ColQwen3 change la donne en permettant une recherche image par image dans des extraits segmentés.

Cas d’usage à la une : la mémoire d’entreprise

Chaque jour, les entreprises enregistrent des milliers d’heures de réunions vidéo internes qui, généralement, se perdent dans le néant.

  • Le processus : en segmentant automatiquement les longs enregistrements de réunions en extraits plus courts et cohérents, puis en les indexant avec ColQwen3, vous créez une « mémoire d’entreprise » interrogeable.

  • La requête : un chef de projet peut demander : « Montrez-moi l’extrait où le responsable de l’ingénierie a expliqué le problème de latence de l’API. »

  • Le résultat : au lieu de renvoyer un fichier vidéo de 60 minutes, le système retrouve précisément le segment de 45 secondes où ce diagramme a été affiché à l’écran et commenté, même si les intervenants n’ont pas explicitement prononcé le mot « latence » à cet instant précis.

Cas d’usage en entreprise : résoudre des problèmes à forte valeur ajoutée

Le passage à des embeddings multimodaux natifs ouvre la voie à des processus entièrement nouveaux dans tous les secteurs. Nous avons soumis ce modèle à des benchmarks approfondis dans certains des environnements de données d’entreprise les plus complexes.

1. Point fort du benchmark : conseil urbain et architecture

Nous avons testé ColQwen3 face aux défis de données rencontrés par les cabinets de conseil urbain, qui gèrent d’immenses bibliothèques de plans directeurs, de cartes de zonage et d’élévations architecturales complexes.

  • Le défi : dans ces environnements, les pipelines RAG traditionnels peinent à fonctionner. Les outils OCR décrivent généralement les plans de site complexes comme de simples « schémas », ignorant des détails essentiels sur les flux de circulation, les espaces verts ou les retraits des bâtiments.

  • Les performances : nos benchmarks internes montrent que ColQwen3 élimine efficacement le besoin d’un prétraitement OCR ou de légendage coûteux. Lors de tests sur des dessins architecturaux très denses, le modèle a retrouvé des documents à partir de repères visuels précis, tels que les accès piétons ou des limites de zonage distinctes. Il surpasse ainsi nettement les références uniquement textuelles, tout en promettant une réduction drastique des coûts d’ingestion des connaissances.

2. Analyse complexe des marchés et de la finance

Les banquiers d’affaires et les analystes passent des milliers d’heures à parcourir des rapports annuels et des présentations aux investisseurs.

  • Le processus : un analyste peut demander : « Trouvez la ventilation du chiffre d’affaires APAC par rapport à celui de la région EMEA dans les présentations de 2024. »

  • Le changement : au lieu de s’appuyer sur des correspondances de mots-clés, le modèle retrouve la diapositive exacte grâce à la présence visuelle de la représentation de données recherchée, permettant au système RAG de répondre avec une grande précision.

3. Production industrielle et services sur site

Les entreprises industrielles possèdent de vastes bibliothèques de manuels techniques et de schémas de tuyauterie et d’instrumentation (P&ID).

  • Le processus : un technicien de terrain réparant une turbine peut photographier une pièce ou demander : « Montrez-moi le schéma de câblage de l’ensemble de pompe hydraulique. »

  • Le changement : ColQwen3 identifie la représentation visuelle du schéma de câblage et retrouve la bonne page, réduisant potentiellement les temps d’arrêt de plusieurs heures.

4. Juridique et conformité

La recherche de preuves juridiques implique d’examiner des millions de pages numérisées où « l’aiguille » est souvent un repère visuel.

  • Le processus : un responsable de la conformité peut rechercher « les documents signés par le directeur financier » ou « les contrats portant le tampon officiel “Confidentiel” ».

  • Le changement : le modèle distingue un brouillon d’un document finalisé grâce à la présence visuelle de signatures ou de tampons, ce que l’OCR seul ne détecte souvent pas.

Bien démarrer

ColQwen3 est un modèle à poids ouverts (Apache 2.0), désormais disponible sur Hugging Face. Nous l’avons conçu comme une mise à niveau directement intégrable aux pipelines RAG modernes, avec le code d’inférence nécessaire pour traiter immédiatement du texte, des images et des vidéos.

Pour les entreprises prêtes à dépasser la simple recherche textuelle et à libérer l’intelligence enfermée dans leurs ressources visuelles, c’est la nouvelle référence.

Étape suivante : consultez la fiche modèle et essayez la démo en direct sur Hugging Face : /-colqwen3-embed-8b et /-colqwen3-embed-4b

Auteur

Xin Huang, Kye Min Tan