過去兩年,「RAG」(檢索增強生成)幾乎一直是文字的同義詞。標準做法很簡單:取得文件、擷取文字、切分成區塊,再建立索引。
但企業世界並非只靠純文字檔案運作。企業仰賴複雜的 PDF、包含密集圖表的簡報、CAD 圖面、掃描發票,以及日益龐大的影片檔案庫。
業界標準做法是在嵌入前,使用 OCR 或視覺 LLM 將圖片「描述」成文字,但這會形成嚴重瓶頸。這種做法緩慢、昂貴,而且必然會失去原始資料豐富的空間與視覺脈絡。如果 AI 只將複雜的視覺內容描述為「藍圖」,你就無法搜尋其中的特定閥門或配線圖。
今天,我們推出一系列以 ColPali 架構為基礎的先進多模態嵌入模型,透過支援端對端視覺檢索來解決這項問題。
要打造真正有效的多模態檢索器,並不是拿現成的視覺語言模型(VLM)來搜尋那麼簡單。為解決長期限制多模態 RAG 發展的挑戰並打造 ColQwen3,我們採用了模型合併與訓練策略。
我們並未從頭微調基礎模型,而是設計一套方法,從現有文字嵌入模型轉移檢索任務的知識。標準 VLM 知道如何描述圖片,卻不一定知道如何依據查詢對圖片進行語意排序。
為填補這項落差,我們採用了調校後的合併權重策略。實驗發現,Qwen3-Embedding 在文字潛在空間中的檢索能力,可直接轉移至多模態空間;即使未立即進行訓練,也能泛化至圖片與影片檢索。以這項有效的初始化作為穩固起點後,我們再微調模型,以進一步最佳化效能並確保穩健性。相較於從 Qwen3-VL 基礎模型開始微調,這種方法提升了最終檢索效能。
轉移嵌入能力後,我們將重點放在對齊。我們仔細進行超參數搜尋與消融研究,包括最佳訓練週期數、批次大小、學習率、LoRA 秩及資料集組合,以盡可能提升檢索效能。
微調資料集選用 VDR、ColPali 訓練集、visrag_syn, 及 visrag_ind。微調時,我們使用 UniMax 取樣。由於採用了模型合併,且合併後的基礎模型已繼承部分多模態檢索能力,我們發現增加更多資料集反而會使效能略微下降,因此未進一步擴充資料集。
以下是我們為微調選定的超參數:
LoRA 秩 | 32 |
LoRA Alpha | 32 |
LoRA 目標模組 | 圖片與文字的所有層,嵌入層除外 |
學習率 | 5e-5 |
最大視覺 Token 數 | 1280 |
訓練週期數 | 1 |
全域批次大小 | 512 |
暖身比例 | 5% |
過去,使用「ColBERT 風格」Token 級嵌入的模型(如 ColPali)效能驚人,但儲存成本高得令人卻步。為每個視覺 Token 建立索引會產生龐大的向量資料庫,成本高到無法支援企業規模。
最佳化策略:我們審慎平衡嵌入大小,在盡可能維持效能的同時,避免儲存成本暴增,藉此解決儲存難題。為以如此精簡的規模維持 SOTA 準確率,我們審慎選定 320 維,在檢索效能與儲存成本之間取得最佳平衡。
基準:標準方法(如 NVIDIA Nemo-3B)需要約 10.3 TB,才能儲存 100 萬張圖片的嵌入(1,802 個 Token @ 3,072 維)。
ColQwen3:只需 0.82 TB 即可儲存相同的 100 萬張圖片(最多 1,280 個 Token @ 320 維)。
ColQwen3 無須讓雲端基礎架構預算失控,也能達到 SOTA 檢索準確率。
我們使用 ViDoRe 基準測試套件驗證了此方法。結果證實,ColQwen3 在最新的 V3 與 V2 基準測試(英文及多語言)中樹立了新標準,同時在舊版 V1 任務中維持頂尖表現。
ColQwen3-8B 在英文及多語言檢索方面領先。
英文 nDCG@5
模型 | 電腦科學 | 能源 | 金融 | 人資 | 工業 | 製藥 | 物理 | 平均 |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
多語言 nDCG@5
模型 | 電腦科學 | 能源 | 金融 | 人資 | 工業 | 製藥 | 物理 | 平均 |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
在 ESG、經濟學與 DocVQA 方面持續展現優異效能。
基準測試 | 模型 | 分數(平均) | 突出優勢 |
ViDoRe V2(英文) | ColQwen3-8B | 0.6772 | ESG 與 BioMed 排名第 1 |
ViDoRe V2(多語言) | ColQwen3-8B | 0.6085 | 經濟學排名第 1 |
ViDoRe V1(英文) | Nemo ColEmbed 3B | 0.9100 | 平均分數略高 |
ViDoRe V1(英文) | ColQwen3-8B | 0.9076 | ArxivQA 與 Syn-Gov 排名第 1 |
為證明 ColQwen3 能有效泛化至影片檢索,我們在文字轉影片(一般檢索)任務的 CareBench 基準上評估了這些模型。
此次評估採用原始影片編碼方法:模型直接編碼影片檔案,不使用任何額外的文字註解或中繼資料。這突顯了模型僅依據視覺語意執行檢索的能力。
模型 | 召回率@1 | 召回率@5 | 召回率@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 帶來的一項重大轉變,是能像處理文件一樣處理影片。在許多企業中,影片屬於「暗資料」。它們存放於冷儲存空間,除非有人逐一手動加上標籤,否則完全無法搜尋。
ColQwen3 透過對分段片段進行逐幀檢索,改變了這種情況。
企業每天錄製數千小時的內部視訊會議,但這些錄影通常就此石沉大海。
工作流程:自動將冗長的會議錄影切分成較短且合乎邏輯的片段,再使用 ColQwen3 建立索引,即可建構可搜尋的「企業記憶」。
查詢:專案經理可以要求:「找出工程主管說明 API 延遲問題的片段。」
結果:系統不會傳回長達 60 分鐘的影片檔案,而是精準找出螢幕上分享並討論該圖表的 45 秒片段,即使講者當時並未明確說出「延遲」一詞也能找到。
轉向原生多模態嵌入,可為各行各業開啟全新的工作流程。我們已在多種極為複雜的企業資料環境中,對此模型進行廣泛的基準測試。
我們針對都市顧問公司面臨的資料挑戰測試 ColQwen3。這類公司管理龐大的總體規劃、分區地圖與複雜建築立面圖資料庫。
挑戰:傳統 RAG 管線難以應付這類環境。OCR 工具通常只會將複雜的基地配置圖描述為「示意圖」,因而漏掉交通動線、綠地或建築退縮等關鍵細節。
效能:內部基準測試顯示,ColQwen3 能有效省去昂貴的 OCR/圖片描述前置處理。在高密度建築圖面測試中,模型能根據行人出入口或明確分區邊界等特定視覺標記成功檢索文件,表現顯著優於純文字基準,並有望大幅降低知識匯入成本。
投資銀行家與分析師要花費數千小時翻查年報與投資人簡報。
工作流程:分析師可以詢問:「從 2024 年的簡報中,找出亞太地區與歐洲、中東及非洲地區的營收明細比較。」
轉變:模型不再依賴關鍵字比對,而是根據特定資料視覺化的外觀,精準檢索相應投影片,讓 RAG 系統能以高準確度回答問題。
製造公司擁有龐大的技術手冊與管線及儀表圖(P&ID)資料庫。
工作流程:維修渦輪機的現場工程師可以拍下零件照片,或詢問:「顯示液壓泵組件的配線圖。」
轉變:ColQwen3 能辨識配線圖的視覺呈現並檢索正確頁面,可能將停機時間縮短數小時。
法律證據開示需要審閱數百萬頁掃描文件,而其中的關鍵線索往往是視覺標記。
工作流程:法遵人員可以搜尋「由財務長簽署的文件」或「蓋有正式『機密』印章的合約」。
轉變:模型會依據簽名或印章等視覺特徵,區分草稿與定稿文件,而純 OCR 往往會遺漏這些資訊。
ColQwen3 採用開放權重(Apache 2.0),現已在 Hugging Face 上推出。我們將它設計為現代 RAG 管線的即插即用升級方案,並提供可立即處理文字、圖片與影片所需的推論程式碼。
對於準備超越簡易文字搜尋、釋放視覺資產中智慧的企業而言,這就是新標準。
下一步:前往 Hugging Face 查看模型說明卡並試用即時示範:/-colqwen3-embed-8b 及 /-colqwen3-embed-4b