メインナビゲーション

テキストの先へ:真のマルチモーダル・エンドツーエンド RAG

マルチモーダル埋め込みモデルにより、複雑な文書、画像、動画から有用な情報を直接検索できます。

この 2 年間、「RAG」(検索拡張生成)は、ほぼもっぱらテキストと同義でした。標準的な手順は単純です。文書からテキストを抽出し、分割してインデックス化します。

しかし、企業の業務はプレーンテキストファイルだけで成り立っているわけではありません。複雑な PDF、グラフが詰まったスライド資料、CAD 図面、スキャン済み請求書、そして増え続ける膨大な動画アーカイブで成り立っています。

こうしたデータを扱うために、埋め込み前に OCR や Vision LLM で画像をテキストに「キャプション化」する業界標準の手法は、大きなボトルネックになっています。処理が遅く高コストで、元データが持つ豊かな空間的・視覚的文脈も必然的に失われます。AI が複雑な視覚情報を単に「設計図」と説明してしまえば、その中にある特定のバルブや配線図を検索できなくなります。

本日、エンドツーエンドの視覚検索によってこの問題を解決する、ColPali アーキテクチャを基盤とした最先端のマルチモーダル埋め込みモデル群を公開します。

革新を支えるエンジニアリング:高度なファインチューニング戦略

真に効果的なマルチモーダル検索モデルの構築は、既製の視覚言語モデル(VLM)に検索を指示するほど単純ではありません。これまでマルチモーダル RAG の進歩を妨げてきた課題を解決し、ColQwen3 を生み出すため、モデルのマージと学習戦略を採用しました。

1. 調整済みマージ重みによる埋め込み能力の転移

ベースモデルを一からファインチューニングする代わりに、既存のテキスト埋め込みモデルから検索タスクの知識を転移する手法を開発しました。一般的な VLM は画像を説明できますが、クエリとの意味的な関連性に基づいて画像を順位付けできるとは限りません。

この隔たりを埋めるため、調整済みのマージ重み戦略を採用しました。実験の結果、テキスト潜在空間における Qwen3-Embedding の検索能力をマルチモーダル空間へ直接転移でき、直後に学習を行わなくても画像や動画の検索へ汎化できることが分かりました。この効果的な初期化を強固な出発点として活用し、さらにモデルをファインチューニングして性能と堅牢性を高めました。これにより、Qwen3-VL ベースモデルからファインチューニングする場合と比べて、最終的な検索性能が向上します。

2. 緻密なハイパーパラメーターチューニング

埋め込み能力を転移した後は、アラインメントに注力しました。検索性能を最大化するため、最適なエポック数、バッチサイズ、学習率、LoRA ランク、データセットの混合比率などについて、綿密なハイパーパラメーター探索とアブレーションスタディを実施しました。

ファインチューニング用データセットには、VDRColPali train setvisrag_syn、visrag_ind を選びました。ファインチューニングには UniMax サンプリングを使用しました。モデルをマージしたことで、マージ後のベースモデルはマルチモーダル検索能力の一部をすでに継承しています。そのため、データセットを増やすとかえって性能がわずかに低下することが分かり、追加のデータセットには拡張しませんでした。

ファインチューニングには、以下のハイパーパラメーターを採用しました。

LoRA ランク

32

LoRA アルファ

32

LoRA 対象モジュール

埋め込みを除く、画像とテキストの全レイヤー

学習率

5e-5

最大視覚トークン数

1280

学習エポック数

1

グローバルバッチサイズ

512

ウォームアップ比率

5%

3. 「ColBERT」のジレンマ:高性能とストレージコスト

従来、ColPali のように「ColBERT 方式」のトークン単位の埋め込みを使うモデルは驚異的な性能を発揮する一方、ストレージコストが非現実的なほど高額でした。すべての視覚トークンをインデックス化すると巨大なベクトルデータベースが生成され、企業規模での運用にはコストがかかりすぎました。

  • 最適化戦略:性能を最大限に維持しつつストレージコストの急増を防ぐよう、埋め込みのサイズを慎重に調整してストレージの課題に対処しました。効率的なサイズで最先端の精度を維持するため、検索性能とストレージコストのバランスが最も良い次元数として 320 を選びました。

    • ベースライン:NVIDIA Nemo-3B のような標準的手法では、100 万枚の画像の埋め込みを保存するために約 10.3 TB が必要です(1,802 トークン × 3,072 次元)。

    • ColQwen3:同じ 100 万枚の画像をわずか 0.82 TB で保存できます(最大 1,280 トークン × 320 次元)。

ColQwen3 は、クラウドインフラ予算を膨張させることなく、最先端の検索精度を実現します。

評価結果

ViDoRe ベンチマークスイートで、私たちのアプローチを検証しました。結果から、ColQwen3 が最新の V3 および V2 ベンチマーク(英語、多言語の両方)で新たな基準を確立しつつ、従来の V1 タスクでも最高水準の性能を維持していることが確認されました。

ViDoRe v3(最新版)

ColQwen3-8B は英語および多言語検索で首位です。

英語 nDCG@5

モデル

コンピューター科学

エネルギー

金融

人事

産業

製薬

物理学

平均

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

多言語 nDCG@5

モデル

コンピューター科学

エネルギー

金融

人事

産業

製薬

物理学

平均

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 と v1 のハイライト

ESG、経済、DocVQA の全分野で一貫して高い性能を発揮しています。

ベンチマーク

モデル

スコア(平均)

特筆すべき首位

ViDoRe V2(英語)

ColQwen3-8B

0.6772

ESG と BioMed で 1 位

ViDoRe V2(多言語)

ColQwen3-8B

0.6085

経済で 1 位

ViDoRe V1(英語)

Nemo ColEmbed 3B

0.9100

平均がわずかに上

ViDoRe V1(英語)

ColQwen3-8B

0.9076

ArxivQA と Syn-Gov で 1 位

動画検索:CareBench による評価

ColQwen3 の動画検索に対する高い汎化性能を実証するため、テキストから動画を検索するタスク(General Retrieval)向けの CareBench ベンチマークで各モデルを評価しました。

この評価では、生の動画をエンコードする方式を採用しました。モデルはテキスト注釈やメタデータを追加せず、動画ファイルを直接エンコードしました。これは、モデルが純粋に視覚的な意味に基づいて検索できることを示しています。

モデル

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

「ダークデータ」の活用:動画というフロンティア

ColQwen3 がもたらす最も大きな変化の一つは、動画を文書と同じように扱えることです。多くの企業では、動画は「ダークデータ」です。人がすべてのファイルに手作業でタグを付けない限り、検索できないままコールドストレージに眠っています。

ColQwen3 は、分割されたクリップをフレーム単位で検索できるようにし、この状況を変えます。

ユースケース紹介:企業の記憶バンク

企業では毎日、社内のビデオ会議が何千時間も録画されていますが、通常、その録画は埋もれたままになります。

  • ワークフロー:長時間の会議録画を意味のまとまりごとに短いクリップへ自動分割し、ColQwen3 でインデックス化することで、検索可能な「企業の記憶」を構築できます。

  • クエリ:プロジェクトマネージャーは、「エンジニアリング責任者が API の遅延問題を説明した場面を見せて」と尋ねられます。

  • 結果:システムは 60 分の動画ファイルを返すのではなく、その図が画面に表示され、議論された正確な 45 秒間を検索します。その瞬間に話者が「遅延」という言葉を明示していなくても検索できます。

企業向けユースケース:価値の高い課題の解決

ネイティブなマルチモーダル埋め込みへの移行により、幅広い業界でまったく新しいワークフローが実現します。私たちは、極めて複雑な企業データ環境を想定し、このモデルを広範にベンチマークしました。

1. ベンチマークのハイライト:都市コンサルティングと建築

膨大な都市基本計画、用途地域図、複雑な建築立面図を管理する都市コンサルティング会社が直面するデータ課題に対して、ColQwen3 をテストしました。

  • 課題:こうした環境では、従来の RAG パイプラインでは対応が困難です。一般的な OCR ツールは、複雑な敷地計画を単に「概略図」と説明するため、交通動線、緑地、建物の後退距離といった重要な詳細を見落とします。

  • 性能:社内ベンチマークでは、ColQwen3 により高コストな OCR/キャプション生成の前処理が不要になることが実証されています。高密度な建築図面を用いたテストでは、歩行者用の出入口や明確な用途地域境界など、特定の視覚的マーカーに基づいてモデルが文書を正しく検索しました。テキストのみのベースラインを大幅に上回り、知識取り込みコストの大幅な削減も期待できます。

2. 複雑な金融・市場インテリジェンス

投資銀行担当者やアナリストは、年次報告書や投資家向け資料の精査に何千時間も費やしています。

  • ワークフロー:アナリストは、「2024 年のスライド資料から、APAC と EMEA の売上内訳を見つけて」と尋ねられます。

  • 変化:キーワード一致に頼る代わりに、モデルは該当するデータ可視化の見た目を基に正確なスライドを検索するため、RAG システムは質問へ高精度に回答できます。

3. 製造業とフィールドサービス

製造企業は、技術マニュアルや配管計装図(P&ID)を大量に保有しています。

  • ワークフロー:タービンを修理するフィールドエンジニアは部品の写真を撮るか、「油圧ポンプアセンブリの配線図を見せて」と尋ねられます。

  • 変化:ColQwen3 は配線図の視覚的表現を識別して正しいページを検索するため、ダウンタイムを数時間短縮できる可能性があります。

4. 法務とコンプライアンス

法的証拠開示では、何百万ページものスキャン文書を確認しますが、探し出すべき重要情報は視覚的なマーカーであることが少なくありません。

  • ワークフロー:コンプライアンス担当者は、「CFO が署名した文書」「正式な『機密』印のある契約書」を検索できます。

  • 変化:モデルは署名や印影の視覚的な有無を基に、草案と確定文書を区別します。これは純粋な OCR では見落とされがちな情報です。

はじめに

ColQwen3 はオープンウェイト(Apache 2.0)で、Hugging Face から今すぐ利用できます。最新の RAG パイプラインへそのまま導入できるアップグレードとして設計し、テキスト、画像、動画をすぐに処理するための推論コードも提供しています。

単純なテキスト検索の先へ進み、視覚資産に埋もれたインテリジェンスを活用したい企業にとって、これが新たな標準です。

次のステップ:Hugging Face でモデルカードを確認し、ライブデモをお試しください:/-colqwen3-embed-8b/-colqwen3-embed-4b

著者

Xin Huang、Kye Min Tan