过去两年,“RAG”(检索增强生成)几乎一直是文本的代名词。标准做法很简单:获取文档、提取文本、进行分块并建立索引。
但企业世界并非依靠纯文本文件运转。企业使用的是复杂的 PDF、包含密集图表的幻灯片、CAD 图纸、扫描发票,以及规模日益庞大的视频档案。
行业的标准处理方式是先用 OCR 或视觉大语言模型将图像“描述”为文本,再进行嵌入,但这形成了巨大的瓶颈。这种方式速度慢、成本高,而且不可避免地会丢失原始数据丰富的空间和视觉上下文。如果 AI 只将复杂的视觉内容描述为“一张蓝图”,你就无法搜索其中的特定阀门或接线图。
今天,我们发布了一系列基于 ColPali 架构打造的先进多模态嵌入模型,通过实现端到端视觉检索来解决这一问题。
要构建真正有效的多模态检索器,并非拿一个现成的视觉语言模型(VLM)来执行搜索那么简单。为解决长期制约多模态 RAG 的难题并打造 ColQwen3,我们采用了模型合并和训练策略。
我们没有从头微调基础模型,而是设计了一种方法,将现有文本嵌入模型中的检索任务知识迁移过来。标准 VLM 知道如何描述图像,但未必知道如何依据查询对图像进行语义排序。
为弥合这一差距,我们采用了调优后的合并权重策略。实验发现,Qwen3-Embedding 在文本潜在空间中的检索能力可直接迁移至多模态空间,即使没有立即训练,也能泛化至图像和视频检索。以这种有效的初始化作为坚实起点,我们随后进一步微调模型,以优化性能并确保稳健性。与从 Qwen3-VL 基础模型开始微调相比,这种方法提升了最终检索性能。
迁移嵌入能力后,我们将重点转向对齐。为最大限度提升检索性能,我们开展了细致的超参数搜索和消融研究,涵盖最优训练轮数、批次大小、学习率、LoRA 秩以及数据集组合。
微调数据集选用了 VDR、ColPali 训练集、visrag_syn, 和 visrag_ind。微调采用 UniMax 采样。由于采用了模型合并,合并后的基础模型已继承部分多模态检索能力。我们发现增加更多数据集反而会导致性能略微下降,因此没有进一步扩大数据集规模。
以下是我们为微调选择的超参数:
LoRA 秩 | 32 |
LoRA Alpha | 32 |
LoRA 目标模块 | 图像和文本的所有层,嵌入层除外 |
学习率 | 5e-5 |
最大视觉 Token 数 | 1280 |
训练轮数 | 1 |
全局批次大小 | 512 |
预热比例 | 5% |
以往,采用“ColBERT 风格”Token 级嵌入的模型(如 ColPali)性能出众,但存储成本高得难以承受。为每个视觉 Token 建立索引会产生庞大的向量数据库,其成本无法满足企业级部署需求。
优化策略:我们谨慎权衡嵌入大小,在最大限度保留性能的同时,避免存储成本激增,从而解决这一存储难题。为在高效存储规模下保持 SOTA 准确率,我们将维度精心设为 320,以实现检索性能与存储成本的最佳平衡。
基线:标准方法(如 NVIDIA Nemo-3B)存储 100 万张图像的嵌入约需 10.3 TB(1,802 个 Token @ 3,072 维)。
ColQwen3:存储同样 100 万张图像仅需 0.82 TB(最多 1,280 个 Token @ 320 维)。
ColQwen3 实现了 SOTA 检索准确率,同时不会让云基础设施预算失控。
我们使用 ViDoRe 基准测试套件验证了这一方法。结果证实,ColQwen3 在最新的 V3 和 V2 基准测试(英语和多语言)中树立了新标准,同时在旧版 V1 任务上保持一流水平。
ColQwen3-8B 在英语和多语言检索中领先。
英语 nDCG@5
模型 | 计算机科学 | 能源 | 金融 | 人力资源 | 工业 | 制药 | 物理 | 平均值 |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
多语言 nDCG@5
模型 | 计算机科学 | 能源 | 金融 | 人力资源 | 工业 | 制药 | 物理 | 平均值 |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
在 ESG、经济学和 DocVQA 任务中始终保持出色表现。
基准测试 | 模型 | 得分(平均值) | 突出优势 |
ViDoRe V2(英语) | ColQwen3-8B | 0.6772 | ESG 和 BioMed 排名第 1 |
ViDoRe V2(多语言) | ColQwen3-8B | 0.6085 | 经济学排名第 1 |
ViDoRe V1(英语) | Nemo ColEmbed 3B | 0.9100 | 平均分略高 |
ViDoRe V1(英语) | ColQwen3-8B | 0.9076 | ArxivQA 和 Syn-Gov 排名第 1 |
为证明 ColQwen3 能够有效泛化至视频检索,我们在文本到视频(通用检索)任务的 CareBench 基准上评估了这些模型。
此次评估采用原始视频编码方法:模型直接编码视频文件,不使用任何额外的文本注释或元数据输入。这凸显了模型仅依据视觉语义进行检索的能力。
模型 | 召回率@1 | 召回率@5 | 召回率@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 带来的一个深刻转变,是能够像处理文档一样处理视频。在许多企业中,视频是“暗数据”。它们被放在冷存储中,除非人工逐一标记每个文件,否则完全无法搜索。
ColQwen3 改变了这一局面,可对分段后的视频片段进行逐帧检索。
企业每天都会录制数千小时的内部视频会议,而这些录像通常就此石沉大海。
工作流程:将长篇会议录像自动切分成较短且逻辑完整的片段,再用 ColQwen3 建立索引,即可创建可搜索的“企业记忆”。
查询:项目经理可以提出:“找到工程负责人解释 API 延迟问题的那段视频。”
结果:系统不会返回一段 60 分钟的视频文件,而是精准检索出屏幕上展示并讨论相关图表的 45 秒片段,即使发言者当时并未明确说出“延迟”一词。
转向原生多模态嵌入,为各行各业开启了全新的工作流程。我们已在一些极为复杂的企业数据环境中对该模型进行了全面基准测试。
我们针对城市咨询公司面临的数据挑战测试了 ColQwen3。这类公司管理着庞大的总体规划、分区地图和复杂建筑立面图资料库。
挑战:传统 RAG 流程难以应对这类环境。OCR 工具通常只会将复杂场地规划图描述为“示意图”,从而遗漏交通流线、绿化区或建筑退界等关键细节。
性能:内部基准测试表明,ColQwen3 可有效省去昂贵的 OCR/图像描述预处理。在高密度建筑图纸测试中,该模型能够依据行人出入口或清晰的分区边界等特定视觉标记成功检索文档,性能显著优于纯文本基线,同时有望大幅降低知识摄取成本。
投资银行家和分析师要花费数千小时查阅年报和投资者演示文稿。
工作流程:分析师可以询问:“从 2024 年的演示文稿中找出亚太地区与欧洲、中东和非洲地区的收入明细。”
转变:模型不再依赖关键词匹配,而是根据特定数据可视化图表的视觉特征检索出准确的幻灯片,让 RAG 系统能够高精度回答问题。
制造企业拥有海量技术手册和管道及仪表流程图(P&ID)。
工作流程:维修涡轮机的现场工程师可以拍摄零件照片,或询问:“显示液压泵总成的接线图。”
转变:ColQwen3 能够识别接线图的视觉表示并检索正确页面,有望将停机时间缩短数小时。
法律取证需要审查数百万页扫描文件,而其中要寻找的“针”往往是某种视觉标记。
工作流程:合规官可以搜索“由 CFO 签署的文件”或“带有正式‘机密’印章的合同”。
转变:模型可根据签名或印章等视觉特征区分草稿与最终文件,而纯 OCR 往往会遗漏这些信息。
ColQwen3 采用开放权重(Apache 2.0),现已在 Hugging Face 上发布。它可直接升级现代 RAG 流程,并提供立即处理文本、图像和视频所需的推理代码。
对于希望超越简单文本搜索、释放视觉资产中潜藏智能的企业而言,这就是新标准。
下一步:查看模型卡,并在 Hugging Face 上体验在线演示:/-colqwen3-embed-8b 和 /-colqwen3-embed-4b