Navigation principale

Au-delà du texte : libérer le véritable RAG multimodal de bout en bout

Les modèles de plongement multimodaux aident les équipes à extraire de l’information utile directement de documents complexes, d’images et de vidéos.

Depuis deux ans, le « RAG » (génération augmentée par la recherche) est presque exclusivement synonyme de texte. La méthode habituelle est simple : prendre les documents, en extraire le texte, le diviser en segments et l’indexer.

Mais le monde de l’entreprise ne fonctionne pas avec de simples fichiers texte. Il repose sur des PDF complexes, des présentations aux graphiques denses, des dessins CAO, des factures numérisées et, de plus en plus, d’immenses archives vidéo.

La méthode courante du secteur, qui consiste à utiliser la ROC ou des GML visuels pour « décrire » une image sous forme de texte avant de l’intégrer, constitue un énorme goulot d’étranglement. Elle est lente, coûteuse et perd inévitablement le riche contexte spatial et visuel des données originales. Si votre IA décrit simplement un visuel complexe comme « un plan », vous ne pouvez plus rechercher la vanne précise ou le schéma de câblage qu’il contient.

Aujourd’hui, nous lançons une famille de modèles de plongement multimodaux de pointe, fondés sur l’architecture ColPali et conçus pour résoudre ce problème grâce à la recherche visuelle de bout en bout.

L’ingénierie derrière la magie : stratégies avancées de réglage fin

Créer un moteur de recherche multimodal vraiment efficace ne se résume pas à prendre un modèle vision-langage (VLM) prêt à l’emploi et à lui demander d’effectuer une recherche. Pour surmonter les obstacles qui ont historiquement freiné le RAG multimodal et créer ColQwen3, nous avons employé des stratégies de fusion et d’entraînement de modèles.

1. Transfert de la capacité de plongement par pondération fusionnée et réglée

Plutôt que de régler finement un modèle de base à partir de zéro, nous avons conçu une méthode permettant de transférer les connaissances des tâches de recherche depuis un modèle de plongement textuel existant. Un VLM standard sait décrire les images, mais pas nécessairement les classer sémantiquement par rapport à une requête.

Pour combler cet écart, nous avons utilisé des stratégies de pondération fusionnée et réglée. Nos expériences ont montré que la capacité de recherche de Qwen3-Embedding dans l’espace latent textuel pouvait être directement transférée à l’espace multimodal et se généraliser à la recherche d’images et de vidéos, même sans entraînement immédiat. En utilisant cette initialisation efficace comme solide point de départ, nous avons ensuite réglé finement le modèle pour optimiser davantage ses performances et assurer sa robustesse. Cela améliore les performances finales de recherche par rapport au réglage fin du modèle de base Qwen3-VL.

2. Réglage minutieux des hyperparamètres

Après le transfert des capacités de plongement, nous nous sommes concentrés sur l’alignement. Nous avons effectué des recherches minutieuses d’hyperparamètres et des études d’ablation portant notamment sur le nombre optimal d’époques, la taille des lots, le taux d’apprentissage, le rang LoRA et la combinaison de jeux de données afin de maximiser les performances de recherche.

Pour le réglage fin, nous avons choisi les jeux de données VDR, ensemble d’entraînement ColPali, visrag_syn, et visrag_ind. Nous avons utilisé l’échantillonnage UniMax pour le réglage fin. Comme nous avons fusionné les modèles et que le modèle fusionné de base hérite déjà d’une partie des capacités de recherche multimodale, nous avons constaté qu’ajouter des jeux de données dégradait légèrement les performances; nous n’en avons donc pas utilisé davantage.

Voici les hyperparamètres sélectionnés pour le réglage fin :

Rang LoRA

32

Alpha LoRA

32

Modules cibles LoRA

toutes les couches d’image et de texte, sauf le plongement

Taux d’apprentissage

5e-5

Nombre maximal de tokens visuels

1280

Époques d’entraînement

1

Taille globale des lots

512

Ratio de préchauffage

5 %

3. Le dilemme « ColBERT » : hautes performances ou faible coût de stockage

Historiquement, les modèles utilisant des plongements au niveau du token de « style ColBERT » (comme ColPali) offraient des performances exceptionnelles, mais à un coût de stockage prohibitif. L’indexation de chaque token visuel créait d’immenses bases de données vectorielles, trop coûteuses à l’échelle de l’entreprise.

  • La stratégie d’optimisation : Nous avons relevé le défi du stockage en équilibrant soigneusement la taille de nos plongements afin de préserver un maximum de performances sans faire exploser les coûts de stockage. Pour maintenir une précision de pointe dans cet espace réduit, nous avons soigneusement fixé la dimension à 320 afin d’obtenir le meilleur équilibre entre performances de recherche et coût de stockage.

    • Référence : Une approche standard, comme NVIDIA Nemo-3B, nécessite environ 10,3 To pour stocker les plongements d’un million d’images (1 802 tokens à 3 072 dimensions).

    • ColQwen3 : Stocke le même million d’images dans seulement 0,82 To (maximum de 1 280 tokens à 320 dimensions).

ColQwen3 atteint une précision de recherche de pointe sans faire exploser le budget d’infrastructure infonuagique.

Résultats d’évaluation

Nous avons validé notre approche avec la suite d’évaluation ViDoRe. Les résultats confirment que ColQwen3 établit de nouvelles normes dans les récentes évaluations V3 et V2, en anglais et multilingues, tout en maintenant des performances de premier ordre dans les anciennes tâches V1.

ViDoRe v3 (plus récente)

ColQwen3-8B domine la recherche en anglais et multilingue.

nDCG@5 en anglais

Modèle

Info.

Énergie

Finance

RH

Ind.

Pharma

Physique

Moy.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 multilingue

Modèle

Info.

Énergie

Finance

RH

Ind.

Pharma

Physique

Moy.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Faits saillants de ViDoRe v2 et v1

Performances élevées et constantes pour l’ESG, l’économie et DocVQA.

Évaluation

Modèle

Score (moy.)

Résultat notable

ViDoRe V2 (anglais)

ColQwen3-8B

0.6772

1er en ESG et BioMed

ViDoRe V2 (multilingue)

ColQwen3-8B

0.6085

1er en économie

ViDoRe V1 (anglais)

Nemo ColEmbed 3B

0.9100

Moyenne légèrement supérieure

ViDoRe V1 (anglais)

ColQwen3-8B

0.9076

1er en ArxivQA et Syn-Gov

Recherche vidéo : évaluation CareBench

Pour démontrer la grande capacité de ColQwen3 à se généraliser à la recherche vidéo, nous avons évalué les modèles avec l’évaluation CareBench pour les tâches texte-vers-vidéo (recherche générale).

Pour cette évaluation, nous avons utilisé une approche d’encodage vidéo brut : nos modèles ont encodé directement les fichiers vidéo, sans annotations textuelles ni métadonnées supplémentaires. Cela souligne la capacité du modèle à effectuer une recherche fondée uniquement sur la sémantique visuelle.

Modèle

Rappel@1

Rappel@5

Rappel@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Libérer les « données obscures » : la vidéo de pointe

L’un des changements les plus profonds permis par ColQwen3 est sa capacité à traiter la vidéo comme un document. Dans de nombreuses entreprises, la vidéo constitue des « données obscures ». Elle reste dans un stockage à froid, entièrement introuvable, à moins qu’une personne ait étiqueté manuellement chaque fichier.

ColQwen3 change la donne en permettant une recherche image par image dans des clips segmentés.

Cas d’utilisation à l’honneur : la mémoire d’entreprise

Chaque jour, les entreprises enregistrent des milliers d’heures de réunions vidéo internes qui, généralement, se perdent dans le néant.

  • Le flux de travail : En segmentant automatiquement les longs enregistrements de réunions en clips plus courts et logiques, puis en les indexant avec ColQwen3, vous créez une « mémoire d’entreprise » consultable.

  • La requête : Un gestionnaire de projet peut demander : « Montre-moi le clip où le responsable de l’ingénierie a expliqué le problème de latence de l’API. »

  • Le résultat : Au lieu de renvoyer une vidéo de 60 minutes, le système récupère exactement le segment de 45 secondes où ce diagramme précis a été présenté à l’écran et abordé, même si les personnes n’ont pas explicitement prononcé le mot « latence » à cet instant précis.

Cas d’utilisation en entreprise : résoudre des problèmes à forte valeur

Le passage aux plongements multimodaux natifs permet des flux de travail entièrement nouveaux dans tous les secteurs. Nous avons soumis ce modèle à des évaluations poussées dans certains des environnements de données d’entreprise les plus complexes.

1. Fait saillant de l’évaluation : conseil urbain et architecture

Nous avons testé ColQwen3 face aux défis de données des sociétés de conseil urbain, qui gèrent d’immenses bibliothèques de plans directeurs, de cartes de zonage et d’élévations architecturales complexes.

  • Le défi : Dans ces environnements, les pipelines RAG traditionnels peinent à fonctionner. Les outils de ROC décrivent généralement les plans d’aménagement complexes comme de simples « schémas », omettant des détails essentiels sur la circulation, les espaces verts ou les marges de recul.

  • Les performances : Nos évaluations internes démontrent que ColQwen3 élimine efficacement le besoin d’un prétraitement coûteux par ROC ou sous-titrage. Lors de tests sur des dessins architecturaux très denses, le modèle a récupéré des documents à partir de repères visuels précis, comme des accès piétonniers ou des limites de zonage distinctes, surpassant nettement les références textuelles tout en promettant une forte réduction des coûts d’ingestion des connaissances.

2. Analyse financière et veille de marché complexes

Les banquiers d’affaires et les analystes passent des milliers d’heures à parcourir des rapports annuels et des présentations aux investisseurs.

  • Le flux de travail : Un analyste peut demander : « Trouve la ventilation des revenus de l’APAC par rapport à ceux de l’EMEA dans les présentations de 2024. »

  • Le changement : Plutôt que de se fier aux correspondances de mots-clés, le modèle récupère la diapositive exacte grâce à la présence visuelle de la représentation de données précise, permettant au système RAG de répondre avec une grande précision.

3. Fabrication industrielle et service sur le terrain

Les entreprises manufacturières possèdent de vastes bibliothèques de manuels techniques et de schémas de tuyauterie et d’instrumentation (P&ID).

  • Le flux de travail : Un ingénieur sur le terrain qui répare une turbine peut photographier une pièce ou demander : « Montre-moi le schéma de câblage de l’ensemble de pompe hydraulique. »

  • Le changement : ColQwen3 reconnaît la représentation visuelle du schéma de câblage et récupère la bonne page, ce qui peut réduire les temps d’arrêt de plusieurs heures.

4. Droit et conformité

La communication de la preuve exige l’examen de millions de pages numérisées où l’« aiguille » est souvent un repère visuel.

  • Le flux de travail : Un responsable de la conformité peut rechercher « les documents signés par le directeur financier » ou « les contrats portant le tampon officiel “Confidentiel” ».

  • Le changement : Le modèle distingue une ébauche d’un document finalisé grâce à la présence visuelle de signatures ou de tampons, ce que la ROC seule manque souvent.

Pour commencer

ColQwen3 utilise des poids ouverts (Apache 2.0) et est maintenant offert sur Hugging Face. Nous l’avons conçu comme une mise à niveau prête à intégrer aux pipelines RAG modernes, avec le code d’inférence nécessaire pour traiter immédiatement le texte, les images et la vidéo.

Pour les entreprises prêtes à dépasser la simple recherche textuelle et à libérer l’intelligence enfermée dans leurs ressources visuelles, voilà la nouvelle norme.

Prochaine étape : Consultez la fiche modèle et essayez la démo en direct sur Hugging Face : /-colqwen3-embed-8b et /-colqwen3-embed-4b

Auteur

Xin Huang, Kye Min Tan