超越文字:釋放真正的多模態端到端 RAG

多模態嵌入模型協助團隊直接從複雜文件、圖像及影片中檢索有用資訊。

過去兩年,「RAG」(檢索增強生成)幾乎完全等同於文字處理。標準做法很簡單:從文件擷取文字、分塊,再建立索引。

然而,企業運作並非建基於純文字檔案。企業依賴的是複雜 PDF、包含密集圖表的簡報、CAD 圖則、掃描發票,以及日益龐大的影片檔案庫。

業界標準做法是在嵌入圖像前,先利用 OCR 或視覺大型語言模型將圖像「描述」成文字,但這形成了巨大的瓶頸。這種方法速度慢、成本高,而且無可避免會損失原始數據豐富的空間及視覺脈絡。如果 AI 只把複雜圖像描述為「一張藍圖」,您便無法搜尋當中的特定閥門或電路示意圖。

今天,我們推出一系列建基於 ColPali 架構的頂尖多模態嵌入模型,透過實現端到端視覺檢索來解決這個問題。

締造出色效能的工程技術:進階微調策略

要建立真正有效的多模態檢索器,並非拿一個現成的視覺語言模型(VLM)執行搜尋那麼簡單。為克服長期制約多模態 RAG 的挑戰並建立 ColQwen3,我們採用了模型合併及訓練策略。

1. 透過經調校的合併權重轉移嵌入能力

我們沒有從零開始微調基礎模型,而是設計了一套方法,從現有文字嵌入模型轉移檢索任務的知識。標準 VLM 懂得描述圖像,卻未必懂得根據查詢按語義為圖像排序。

為彌補這項差距,我們採用了經調校的合併權重策略。實驗發現,Qwen3-Embedding 在文字潛在空間中的檢索能力可直接轉移至多模態空間,即使未有立即訓練,也能泛化至圖像及影片檢索。我們以這項有效的初始化作為穩健起點,再微調模型,以進一步提升效能並確保穩健性。相較從 Qwen3-VL 基礎模型開始微調,此方法提升了最終檢索效能。

2. 精細調校超參數

轉移嵌入能力後,我們將重點放在對齊上。我們進行了細緻的超參數搜尋及消融研究,涵蓋最佳訓練週期數、批次大小、學習率、LoRA 秩及數據集組合,以盡量提升檢索效能。

我們選用 VDRColPali 訓練集visrag_syn,visrag_ind 作為微調數據集。微調採用 UniMax 採樣。由於我們採用了模型合併,而合併後的基礎模型已繼承部分檢索器的多模態能力,我們發現增加更多數據集反而會令效能稍為下降,因此沒有進一步擴充數據集。

以下是我們為微調選定的超參數:

LoRA 秩

32

LoRA Alpha

32

LoRA 目標模組

圖像及文字的所有層(嵌入層除外)

學習率

5e-5

最大視覺 Token 數

1280

訓練週期數

1

全域批次大小

512

預熱比例

5%

3.「ColBERT」兩難:高效能與儲存成本

一直以來,採用「ColBERT 式」Token 級嵌入的模型(例如 ColPali)效能卓越,但儲存成本高昂得難以負擔。為每個視覺 Token 建立索引會產生極其龐大的向量數據庫,企業規模的成本過高。

  • 優化策略:我們透過仔細平衡嵌入大小來應對儲存挑戰,在盡量保留效能之餘,避免儲存成本急升。為在這個精簡規模下維持頂尖準確度,我們將維度大小定為 320,以在檢索效能與儲存成本之間取得最佳平衡。

    • 基準:標準方法(例如 NVIDIA Nemo-3B)儲存 100 萬張圖像的嵌入約需 10.3 TB(1,802 個 Token @ 3,072 維)。

    • ColQwen3:只需 0.82 TB 即可儲存同樣的 100 萬張圖像(最多 1,280 個 Token @ 320 維)。

ColQwen3 達到頂尖檢索準確度,而不會令雲端基礎設施預算失控。

評估結果

我們在 ViDoRe 基準測試套件上驗證了這套方法。結果證實,ColQwen3 在最新的 V3 和 V2 基準測試(英文及多語言)中樹立了新標準,同時在較舊的 V1 任務上維持頂尖表現。

ViDoRe v3(最新)

ColQwen3-8B 在英文及多語言檢索中領先。

英文 nDCG@5

模型

電腦科學

能源

金融

人力資源

工業

製藥

物理

平均

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

多語言 nDCG@5

模型

電腦科學

能源

金融

人力資源

工業

製藥

物理

平均

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 及 v1 重點結果

在 ESG、經濟學及 DocVQA 上持續保持高效能。

基準測試

模型

分數(平均)

突出佳績

ViDoRe V2(英文)

ColQwen3-8B

0.6772

ESG 及 BioMed 排名第 1

ViDoRe V2(多語言)

ColQwen3-8B

0.6085

經濟學排名第 1

ViDoRe V1(英文)

Nemo ColEmbed 3B

0.9100

平均分略高

ViDoRe V1(英文)

ColQwen3-8B

0.9076

ArxivQA 及 Syn-Gov 排名第 1

影片檢索:CareBench 評估

為證明 ColQwen3 能有效泛化至影片檢索,我們在文字轉影片(一般檢索)任務的 CareBench 基準測試上評估了這些模型。

是次評估採用原始影片編碼方法:模型直接編碼影片檔案,不加入任何文字註釋或元數據輸入。這突顯模型僅憑視覺語義執行檢索的能力。

模型

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

釋放「暗數據」:影片新前沿

ColQwen3 帶來的其中一項最深遠轉變,是能夠像處理文件一樣處理影片。在許多企業中,影片都是「暗數據」。它們存放在冷儲存庫中,除非有人逐一手動加上標籤,否則完全無法搜尋。

ColQwen3 透過對分段片段進行逐幀檢索,改變了這種情況。

應用案例焦點:企業記憶庫

企業每天都會錄製數以千小時計的內部視像會議,而這些錄影通常就此石沉大海。

  • 工作流程:自動將冗長的會議錄影分割成較短且脈絡完整的片段,再以 ColQwen3 建立索引,即可建立可搜尋的「企業記憶」。

  • 查詢:項目經理可以提出要求:「顯示工程主管解釋 API 延遲問題的片段。」

  • 結果:系統不會傳回長達 60 分鐘的影片檔案,而是精準找出畫面上展示並討論該圖表的 45 秒片段,即使講者在那一刻並未明確說出「延遲」一詞。

企業應用案例:解決高價值問題

轉用原生多模態嵌入,為各行各業開創了全新的工作流程。我們已在多種極為複雜的企業數據環境中,對此模型進行廣泛的基準測試。

1. 基準測試焦點:城市顧問及建築業

我們針對城市顧問公司面對的數據挑戰測試 ColQwen3。這些公司管理龐大的總體規劃圖、分區地圖及複雜建築立面圖庫。

  • 挑戰:傳統 RAG 管線在這類環境中難以應付。OCR 工具通常只會將複雜的場地平面圖描述為「示意圖」,因而遺漏交通流向、綠化區或建築退界等關鍵細節。

  • 效能:內部基準測試顯示,ColQwen3 可有效省卻昂貴的 OCR/圖像描述預處理。在高密度建築圖則測試中,模型成功根據行人出入口或明確分區界線等特定視覺標記檢索文件,表現大幅優於純文字基準,並有望顯著降低知識擷取成本。

2. 複雜金融及市場情報

投資銀行家及分析師花費數以千小時翻查年報及投資者簡報。

  • 工作流程:分析師可以提出要求:「找出 2024 年簡報中亞太區與歐洲、中東及非洲地區的收入明細比較。」

  • 轉變:模型不再依賴關鍵字配對,而是根據特定數據視覺化內容的視覺特徵,檢索確切的投影片,讓 RAG 系統能以高準確度回答問題。

3. 工業製造及現場服務

製造商擁有龐大的技術手冊及管道與儀表流程圖(P&ID)資料庫。

  • 工作流程:維修渦輪機的現場工程師可以拍攝零件照片,或提出要求:「顯示液壓泵組件的電路圖。」

  • 轉變:ColQwen3 識別電路圖的視覺呈現並檢索正確頁面,有望將停機時間縮短數小時。

4. 法律及合規

法律文件披露涉及審閱數以百萬計的掃描頁面,而關鍵線索往往是一個視覺標記。

  • 工作流程:合規主任可以搜尋「由財務總監簽署的文件」「附有正式『機密』印章的合約」

  • 轉變:模型可根據簽署或印章等視覺特徵區分草稿與定稿,而純 OCR 往往無法識別這些差異。

開始使用

ColQwen3 採用開放權重(Apache 2.0),現已在 Hugging Face 上推出。我們將它設計為現代 RAG 管線的即插即用升級方案,並提供所需推理程式碼,讓您立即處理文字、圖像及影片。

對於準備超越簡單文字搜尋、釋放視覺資產中潛藏智能的企業,這就是新標準。

下一步:查看模型說明卡,並在 Hugging Face 試用即時示範:/-colqwen3-embed-8b/-colqwen3-embed-4b

作者

Xin Huang及Kye Min Tan