過去兩年,「RAG」(檢索增強生成)幾乎完全等同於文字處理。標準做法很簡單:從文件擷取文字、分塊,再建立索引。
然而,企業運作並非建基於純文字檔案。企業依賴的是複雜 PDF、包含密集圖表的簡報、CAD 圖則、掃描發票,以及日益龐大的影片檔案庫。
業界標準做法是在嵌入圖像前,先利用 OCR 或視覺大型語言模型將圖像「描述」成文字,但這形成了巨大的瓶頸。這種方法速度慢、成本高,而且無可避免會損失原始數據豐富的空間及視覺脈絡。如果 AI 只把複雜圖像描述為「一張藍圖」,您便無法搜尋當中的特定閥門或電路示意圖。
今天,我們推出一系列建基於 ColPali 架構的頂尖多模態嵌入模型,透過實現端到端視覺檢索來解決這個問題。
要建立真正有效的多模態檢索器,並非拿一個現成的視覺語言模型(VLM)執行搜尋那麼簡單。為克服長期制約多模態 RAG 的挑戰並建立 ColQwen3,我們採用了模型合併及訓練策略。
我們沒有從零開始微調基礎模型,而是設計了一套方法,從現有文字嵌入模型轉移檢索任務的知識。標準 VLM 懂得描述圖像,卻未必懂得根據查詢按語義為圖像排序。
為彌補這項差距,我們採用了經調校的合併權重策略。實驗發現,Qwen3-Embedding 在文字潛在空間中的檢索能力可直接轉移至多模態空間,即使未有立即訓練,也能泛化至圖像及影片檢索。我們以這項有效的初始化作為穩健起點,再微調模型,以進一步提升效能並確保穩健性。相較從 Qwen3-VL 基礎模型開始微調,此方法提升了最終檢索效能。
轉移嵌入能力後,我們將重點放在對齊上。我們進行了細緻的超參數搜尋及消融研究,涵蓋最佳訓練週期數、批次大小、學習率、LoRA 秩及數據集組合,以盡量提升檢索效能。
我們選用 VDR、ColPali 訓練集、visrag_syn, 及 visrag_ind 作為微調數據集。微調採用 UniMax 採樣。由於我們採用了模型合併,而合併後的基礎模型已繼承部分檢索器的多模態能力,我們發現增加更多數據集反而會令效能稍為下降,因此沒有進一步擴充數據集。
以下是我們為微調選定的超參數:
LoRA 秩 | 32 |
LoRA Alpha | 32 |
LoRA 目標模組 | 圖像及文字的所有層(嵌入層除外) |
學習率 | 5e-5 |
最大視覺 Token 數 | 1280 |
訓練週期數 | 1 |
全域批次大小 | 512 |
預熱比例 | 5% |
一直以來,採用「ColBERT 式」Token 級嵌入的模型(例如 ColPali)效能卓越,但儲存成本高昂得難以負擔。為每個視覺 Token 建立索引會產生極其龐大的向量數據庫,企業規模的成本過高。
優化策略:我們透過仔細平衡嵌入大小來應對儲存挑戰,在盡量保留效能之餘,避免儲存成本急升。為在這個精簡規模下維持頂尖準確度,我們將維度大小定為 320,以在檢索效能與儲存成本之間取得最佳平衡。
基準:標準方法(例如 NVIDIA Nemo-3B)儲存 100 萬張圖像的嵌入約需 10.3 TB(1,802 個 Token @ 3,072 維)。
ColQwen3:只需 0.82 TB 即可儲存同樣的 100 萬張圖像(最多 1,280 個 Token @ 320 維)。
ColQwen3 達到頂尖檢索準確度,而不會令雲端基礎設施預算失控。
我們在 ViDoRe 基準測試套件上驗證了這套方法。結果證實,ColQwen3 在最新的 V3 和 V2 基準測試(英文及多語言)中樹立了新標準,同時在較舊的 V1 任務上維持頂尖表現。
ColQwen3-8B 在英文及多語言檢索中領先。
英文 nDCG@5
模型 | 電腦科學 | 能源 | 金融 | 人力資源 | 工業 | 製藥 | 物理 | 平均 |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
多語言 nDCG@5
模型 | 電腦科學 | 能源 | 金融 | 人力資源 | 工業 | 製藥 | 物理 | 平均 |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
在 ESG、經濟學及 DocVQA 上持續保持高效能。
基準測試 | 模型 | 分數(平均) | 突出佳績 |
ViDoRe V2(英文) | ColQwen3-8B | 0.6772 | ESG 及 BioMed 排名第 1 |
ViDoRe V2(多語言) | ColQwen3-8B | 0.6085 | 經濟學排名第 1 |
ViDoRe V1(英文) | Nemo ColEmbed 3B | 0.9100 | 平均分略高 |
ViDoRe V1(英文) | ColQwen3-8B | 0.9076 | ArxivQA 及 Syn-Gov 排名第 1 |
為證明 ColQwen3 能有效泛化至影片檢索,我們在文字轉影片(一般檢索)任務的 CareBench 基準測試上評估了這些模型。
是次評估採用原始影片編碼方法:模型直接編碼影片檔案,不加入任何文字註釋或元數據輸入。這突顯模型僅憑視覺語義執行檢索的能力。
模型 | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 帶來的其中一項最深遠轉變,是能夠像處理文件一樣處理影片。在許多企業中,影片都是「暗數據」。它們存放在冷儲存庫中,除非有人逐一手動加上標籤,否則完全無法搜尋。
ColQwen3 透過對分段片段進行逐幀檢索,改變了這種情況。
企業每天都會錄製數以千小時計的內部視像會議,而這些錄影通常就此石沉大海。
工作流程:自動將冗長的會議錄影分割成較短且脈絡完整的片段,再以 ColQwen3 建立索引,即可建立可搜尋的「企業記憶」。
查詢:項目經理可以提出要求:「顯示工程主管解釋 API 延遲問題的片段。」
結果:系統不會傳回長達 60 分鐘的影片檔案,而是精準找出畫面上展示並討論該圖表的 45 秒片段,即使講者在那一刻並未明確說出「延遲」一詞。
轉用原生多模態嵌入,為各行各業開創了全新的工作流程。我們已在多種極為複雜的企業數據環境中,對此模型進行廣泛的基準測試。
我們針對城市顧問公司面對的數據挑戰測試 ColQwen3。這些公司管理龐大的總體規劃圖、分區地圖及複雜建築立面圖庫。
挑戰:傳統 RAG 管線在這類環境中難以應付。OCR 工具通常只會將複雜的場地平面圖描述為「示意圖」,因而遺漏交通流向、綠化區或建築退界等關鍵細節。
效能:內部基準測試顯示,ColQwen3 可有效省卻昂貴的 OCR/圖像描述預處理。在高密度建築圖則測試中,模型成功根據行人出入口或明確分區界線等特定視覺標記檢索文件,表現大幅優於純文字基準,並有望顯著降低知識擷取成本。
投資銀行家及分析師花費數以千小時翻查年報及投資者簡報。
工作流程:分析師可以提出要求:「找出 2024 年簡報中亞太區與歐洲、中東及非洲地區的收入明細比較。」
轉變:模型不再依賴關鍵字配對,而是根據特定數據視覺化內容的視覺特徵,檢索確切的投影片,讓 RAG 系統能以高準確度回答問題。
製造商擁有龐大的技術手冊及管道與儀表流程圖(P&ID)資料庫。
工作流程:維修渦輪機的現場工程師可以拍攝零件照片,或提出要求:「顯示液壓泵組件的電路圖。」
轉變:ColQwen3 識別電路圖的視覺呈現並檢索正確頁面,有望將停機時間縮短數小時。
法律文件披露涉及審閱數以百萬計的掃描頁面,而關鍵線索往往是一個視覺標記。
工作流程:合規主任可以搜尋「由財務總監簽署的文件」或「附有正式『機密』印章的合約」。
轉變:模型可根據簽署或印章等視覺特徵區分草稿與定稿,而純 OCR 往往無法識別這些差異。
ColQwen3 採用開放權重(Apache 2.0),現已在 Hugging Face 上推出。我們將它設計為現代 RAG 管線的即插即用升級方案,並提供所需推理程式碼,讓您立即處理文字、圖像及影片。
對於準備超越簡單文字搜尋、釋放視覺資產中潛藏智能的企業,這就是新標準。
下一步:查看模型說明卡,並在 Hugging Face 試用即時示範:/-colqwen3-embed-8b 及 /-colqwen3-embed-4b