텍스트를 넘어: 진정한 멀티모달 엔드투엔드 RAG 실현

멀티모달 임베딩 모델은 팀이 복잡한 문서, 이미지, 동영상에서 유용한 정보를 직접 검색하도록 지원합니다.

지난 2년 동안 ‘RAG’(검색 증강 생성)는 거의 전적으로 텍스트와 동의어처럼 사용되어 왔습니다. 표준 방식은 간단합니다. 문서에서 텍스트를 추출해 청크로 나눈 뒤 색인합니다.

하지만 기업 환경은 일반 텍스트 파일만으로 운영되지 않습니다. 복잡한 PDF, 빽빽한 차트가 담긴 슬라이드 자료, CAD 도면, 스캔한 송장, 그리고 갈수록 방대해지는 동영상 아카이브를 기반으로 돌아갑니다.

이미지를 임베딩하기 전에 OCR이나 비전 LLM으로 텍스트 ‘설명’을 생성하는 업계 표준 방식은 심각한 병목을 초래합니다. 느리고 비용이 많이 들며, 원본 데이터의 풍부한 공간적·시각적 맥락을 필연적으로 잃게 됩니다. AI가 복잡한 시각 자료를 단순히 ‘청사진’이라고 설명한다면 그 안에 있는 특정 밸브나 배선도를 검색할 수 없게 됩니다.

오늘 이 문제를 해결하기 위해 ColPali 아키텍처를 기반으로 구축된 최첨단 멀티모달 임베딩 모델 제품군을 공개합니다. 이 모델은 엔드투엔드 시각 검색을 지원합니다.

혁신을 구현한 엔지니어링: 고급 미세 조정 전략

진정으로 효과적인 멀티모달 검색기를 구축하려면 기성 비전 언어 모델(VLM)에 검색을 지시하는 것만으로는 부족합니다. 멀티모달 RAG의 발전을 가로막아 온 문제를 해결하고 ColQwen3를 만들기 위해 모델 병합 및 훈련 전략을 활용했습니다.

1. 조정된 병합 가중치를 통한 임베딩 역량 이전

기본 모델을 처음부터 미세 조정하는 대신 기존 텍스트 임베딩 모델에서 검색 과제 지식을 이전하는 방법을 설계했습니다. 일반적인 VLM은 이미지를 설명할 수 있지만, 질의와의 의미적 관련성을 기준으로 이미지의 순위를 매기는 방법까지 아는 것은 아닙니다.

이러한 격차를 해소하기 위해 조정된 병합 가중치 전략을 사용했습니다. 실험 결과, 텍스트 잠재 공간에서 Qwen3-Embedding의 검색 역량을 멀티모달 공간으로 직접 이전할 수 있었으며, 즉각적인 훈련 없이도 이미지와 동영상 검색으로 일반화되었습니다. 이 효과적인 초기화를 강력한 출발점으로 삼은 다음 모델을 미세 조정해 성능을 더욱 최적화하고 견고성을 확보했습니다. 그 결과 Qwen3-VL 기본 모델에서 미세 조정을 시작하는 것보다 최종 검색 성능이 향상됩니다.

2. 세심한 하이퍼파라미터 조정

임베딩 역량을 이전한 후에는 정렬에 집중했습니다. 검색 성능을 극대화하기 위해 최적의 에포크 수, 배치 크기, 학습률, LoRA 랭크, 데이터 세트 구성 등을 대상으로 세심한 하이퍼파라미터 탐색과 절제 연구를 진행했습니다.

미세 조정 데이터 세트로 VDR, ColPali 훈련 세트, visrag_syn,visrag_ind를 선택했습니다. 미세 조정에는 UniMax 샘플링을 사용했습니다. 모델 병합을 적용했고 병합된 기본 모델이 이미 멀티모달 검색 역량을 일부 물려받았기 때문에 데이터 세트를 늘리면 오히려 성능이 소폭 저하된다는 사실을 발견했습니다. 따라서 더 많은 데이터 세트로 확장하지 않았습니다.

미세 조정에 선택한 하이퍼파라미터는 다음과 같습니다.

LoRA 랭크

32

LoRA 알파

32

LoRA 대상 모듈

임베딩을 제외한 이미지 및 텍스트의 모든 레이어

학습률

5e-5

최대 시각 토큰 수

1280

훈련 에포크

1

전역 배치 크기

512

워밍업 비율

5%

3. ‘ColBERT’의 딜레마: 고성능과 스토리지 비용

기존에는 ColPali처럼 ‘ColBERT 방식’의 토큰 수준 임베딩을 사용하는 모델이 탁월한 성능을 제공했지만 스토리지 비용이 감당하기 어려울 정도로 높았습니다. 모든 시각 토큰을 색인하면 벡터 데이터베이스가 방대해져 기업 규모로 운용하기에는 비용이 지나치게 높았습니다.

  • 최적화 전략: 스토리지 비용의 급증을 막으면서 성능을 최대한 유지하도록 임베딩 크기를 세심하게 조정해 스토리지 문제를 해결했습니다. 효율적인 용량으로 SOTA 정확도를 유지하기 위해 검색 성능과 스토리지 비용의 균형이 가장 좋은 차원 크기 320을 선택했습니다.

    • 기준선: 표준 방식(예: NVIDIA Nemo-3B)은 이미지 100만 개의 임베딩을 저장하는 데 약 10.3TB가 필요합니다(1,802토큰 @ 3,072차원).

    • ColQwen3: 동일한 이미지 100만 개를 단 0.82TB에 저장합니다(최대 1,280토큰 @ 320차원).

ColQwen3는 클라우드 인프라 예산을 급증시키지 않으면서 SOTA 검색 정확도를 달성합니다.

평가 결과

ViDoRe 벤치마크 제품군에서 접근 방식을 검증했습니다. 결과에 따르면 ColQwen3는 최신 V3 및 V2 벤치마크(영어 및 다국어)에서 새로운 기준을 세우는 동시에 기존 V1 과제에서도 최상위 성능을 유지합니다.

ViDoRe v3(최신)

ColQwen3-8B는 영어 및 다국어 검색에서 선두를 달립니다.

영어 nDCG@5

모델

컴퓨터 과학

에너지

금융

인사

산업

제약

물리학

평균

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

다국어 nDCG@5

모델

컴퓨터 과학

에너지

금융

인사

산업

제약

물리학

평균

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 및 v1 주요 결과

ESG, 경제학, DocVQA 전반에서 일관되게 높은 성능을 보입니다.

벤치마크

모델

점수(평균)

주요 성과

ViDoRe V2(영어)

ColQwen3-8B

0.6772

ESG 및 BioMed 1위

ViDoRe V2(다국어)

ColQwen3-8B

0.6085

경제학 1위

ViDoRe V1(영어)

Nemo ColEmbed 3B

0.9100

평균이 근소하게 높음

ViDoRe V1(영어)

ColQwen3-8B

0.9076

ArxivQA 및 Syn-Gov 1위

동영상 검색: CareBench 평가

ColQwen3가 동영상 검색에도 뛰어난 일반화 성능을 보인다는 점을 입증하기 위해 텍스트-동영상(일반 검색) 과제용 CareBench 벤치마크에서 모델을 평가했습니다.

이번 평가에서는 원본 동영상 인코딩 방식을 사용했습니다. 모델이 별도의 텍스트 주석이나 메타데이터 입력 없이 동영상 파일을 직접 인코딩했습니다. 이는 순수하게 시각적 의미만을 바탕으로 검색하는 모델의 역량을 보여줍니다.

모델

재현율@1

재현율@5

재현율@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

‘다크 데이터’의 활용: 동영상의 프런티어

ColQwen3가 가져온 가장 중대한 변화 중 하나는 동영상을 문서처럼 다룰 수 있다는 점입니다. 많은 기업에서 동영상은 ‘다크 데이터’입니다. 사람이 모든 파일에 일일이 태그를 달지 않으면 검색할 수 없는 채로 콜드 스토리지에 방치됩니다.

ColQwen3는 분할된 클립을 프레임 단위로 검색할 수 있게 해 이러한 상황을 바꿉니다.

주요 사용 사례: 기업 메모리 뱅크

기업에서는 매일 수천 시간 분량의 사내 화상 회의를 녹화하지만, 이러한 녹화물은 대부분 활용되지 못한 채 사라집니다.

  • 워크플로: 긴 회의 녹화물을 짧고 논리적인 클립으로 자동 분할하고 ColQwen3로 색인하면 검색 가능한 ‘기업 메모리’를 만들 수 있습니다.

  • 질의: 프로젝트 관리자는 다음과 같이 요청할 수 있습니다. “Show me the clip where the engineering lead explained the latency issue with the API.”

  • 결과: 시스템은 60분짜리 동영상 파일 대신 해당 다이어그램이 화면에 공유되고 논의된 정확한 45초 구간을 검색합니다. 발표자가 바로 그 순간에 ‘지연 시간’이라는 단어를 명시적으로 말하지 않았더라도 찾아낼 수 있습니다.

기업 사용 사례: 가치가 높은 문제 해결

네이티브 멀티모달 임베딩으로 전환하면 산업 전반에서 완전히 새로운 워크플로가 가능해집니다. 가장 복잡한 기업 데이터 환경을 일부 재현해 이 모델을 광범위하게 벤치마크했습니다.

1. 주요 벤치마크: 도시 컨설팅 및 건축

마스터플랜, 용도지역 지도, 복잡한 건축 입면도의 방대한 자료를 관리하는 도시 컨설팅 회사가 직면한 데이터 문제를 바탕으로 ColQwen3를 테스트했습니다.

  • 과제: 이러한 환경에서는 기존 RAG 파이프라인이 제대로 작동하기 어렵습니다. OCR 도구는 복잡한 배치도를 대개 단순히 ‘도식’이라고 설명하기 때문에 교통 흐름, 녹지 구역, 건축선 후퇴 같은 핵심 세부 정보를 놓칩니다.

  • 성능: 내부 벤치마크 결과, ColQwen3는 비용이 많이 드는 OCR/캡셔닝 전처리 과정을 효과적으로 생략할 수 있었습니다. 고밀도 건축 도면 테스트에서 모델은 보행자 출입구나 뚜렷한 용도지역 경계 같은 특정 시각적 표지를 바탕으로 문서를 성공적으로 검색했습니다. 텍스트 전용 기준선보다 성능이 크게 뛰어났으며 지식 수집 비용도 대폭 절감할 가능성을 보였습니다.

2. 복잡한 금융 및 시장 인텔리전스

투자 은행가와 분석가는 연차 보고서와 투자자용 자료를 검토하는 데 수천 시간을 씁니다.

  • 워크플로: 분석가는 다음과 같이 요청할 수 있습니다. “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • 변화: 모델은 키워드 일치에 의존하는 대신 특정 데이터 시각화 요소를 시각적으로 인식해 정확한 슬라이드를 검색하므로 RAG 시스템이 질문에 매우 정밀하게 답할 수 있습니다.

3. 산업 제조 및 현장 서비스

제조 기업은 방대한 기술 매뉴얼과 배관·계장도(P&ID)를 보유하고 있습니다.

  • 워크플로: 터빈을 수리하는 현장 엔지니어는 부품 사진을 찍거나 다음과 같이 요청할 수 있습니다. “Show me the wiring diagram for the hydraulic pump assembly.”

  • 변화: ColQwen3는 배선도의 시각적 표현을 식별해 올바른 페이지를 검색하므로 가동 중단 시간을 몇 시간이나 줄일 수 있습니다.

4. 법무 및 규정 준수

법적 증거 개시 절차에서는 스캔된 수백만 페이지를 검토해야 하며, 찾아야 할 핵심 정보가 시각적 표지인 경우가 많습니다.

  • 워크플로: 규정 준수 담당자는 “Documents signed by the CFO” 또는 “Contracts containing the official ‘Confidential’ stamp.”를 검색할 수 있습니다.

  • 변화: 모델은 서명이나 도장의 시각적 존재를 바탕으로 초안과 최종 문서를 구분합니다. 순수 OCR 방식에서는 흔히 놓치는 부분입니다.

시작하기

ColQwen3는 오픈 가중치(Apache 2.0) 모델이며 지금 Hugging Face에서 사용할 수 있습니다. 최신 RAG 파이프라인에 즉시 적용할 수 있는 업그레이드로 설계했으며 텍스트, 이미지, 동영상을 바로 처리하는 데 필요한 추론 코드를 제공합니다.

단순한 텍스트 검색을 넘어 시각 자산에 갇힌 인텔리전스를 활용하려는 기업에 이것이 새로운 기준입니다.

다음 단계: Hugging Face에서 모델 카드를 확인하고 라이브 데모를 사용해 보세요: /-colqwen3-embed-8b/-colqwen3-embed-4b

작성자

Xin Huang 및 Kye Min Tan