Текстээс цааш: жинхэнэ мультимодал, эхнээс нь дуусталх RAG

Мультимодал эмбеддинг загварууд нь нарийн төвөгтэй баримт бичиг, зураг, видеоноос хэрэгтэй мэдээллийг шууд хайж олоход багуудад тусална.

Сүүлийн хоёр жилд “RAG” (хайлтаар баяжуулсан үүсгэлт) гэх ойлголт бараг зөвхөн тексттэй ижил утгаар хэрэглэгдэж ирлээ. Стандарт арга нь энгийн: баримт бичгээс текстийг салгаж, хэсэгчлэн хуваагаад индексжүүлнэ.

Гэвч байгууллагын үйл ажиллагаа энгийн текст файлд тулгуурладаггүй. Харин нарийн төвөгтэй PDF, мэдээлэл шигүү графиктай слайд, CAD зураг, сканнердсан нэхэмжлэх, улам бүр өсөн нэмэгдэж буй асар их видео архивт тулгуурладаг.

Эдгээрийг эмбеддинг болгохоос өмнө OCR эсвэл Vision LLM ашиглан дүрсийг текстээр “тайлбарладаг” салбарын стандарт арга асар том гацаа болдог. Энэ нь удаан, өндөр өртөгтэй бөгөөд эх өгөгдлийн баялаг орон зайн болон дүрслэлийн агуулгыг зайлшгүй алддаг. Хэрэв таны AI нарийн төвөгтэй дүрслэлийг зүгээр л “зураг төсөл” гэж тайлбарлавал доторх тодорхой хавхлага эсвэл утасны схемийг хайх боломж алдагдана.

Өнөөдөр бид ColPali архитектурт тулгуурласан, дүрслэлийг эхнээс нь дуустал шууд хайх боломж олгон энэ асуудлыг шийдэх хамгийн сүүлийн үеийн мультимодал эмбеддинг загваруудын цувралыг танилцуулж байна.

Ид шидийн цаадах инженерчлэл: дэвшилтэт нарийн тохируулгын стратеги

Үнэхээр үр дүнтэй мультимодал хайгч бүтээх нь бэлэн хараа-хэлний загвар (VLM) аваад хайлт хийлгэхээс хавьгүй төвөгтэй. Мультимодал RAG-ийн хөгжлийг удаашруулж ирсэн сорилтуудыг шийдэн ColQwen3-ийг бүтээхийн тулд бид загвар нэгтгэх болон сургах стратеги ашигласан.

1. Тохируулсан нэгтгэсэн жингээр эмбеддинг чадварыг шилжүүлэх

Суурь загварыг эхнээс нь нарийн тохируулахын оронд одоо байгаа текстэн эмбеддинг загвараас хайлтын даалгаврын мэдлэгийг шилжүүлэх арга боловсруулсан. Стандарт VLM дүрсийг тайлбарлаж чаддаг ч асуулгатай утга зүйн хувьд харьцуулан эрэмбэлэх чадвартай байх албагүй.

Энэ зөрүүг арилгахын тулд бид тохируулсан нэгтгэсэн жингийн стратеги ашигласан. Туршилтаар Qwen3-Embedding-ийн текстэн далд орон зай дахь хайлтын чадварыг мультимодал орон зайд шууд шилжүүлж, нэмэлт сургалтгүйгээр ч зураг болон видео хайлтад ерөнхийлж болохыг тогтоосон. Энэхүү үр дүнтэй эхлүүлэлтийг бат бөх суурь болгон ашиглаж, гүйцэтгэлийг улам сайжруулж, найдвартай байдлыг хангахын тулд загварыг нарийн тохируулсан. Энэ нь Qwen3-VL суурь загвараас шууд нарийн тохируулсантай харьцуулахад эцсийн хайлтын гүйцэтгэлийг сайжруулдаг.

2. Гиперпараметрийн нямбай тохируулга

Эмбеддинг чадварыг шилжүүлсний дараа бид нийцүүлэлтэд төвлөрсөн. Хайлтын гүйцэтгэлийг дээдлэхийн тулд эпохийн оновчтой тоо, багцын хэмжээ, суралцах хурд, LoRA ранг, өгөгдлийн багцын хольцыг хамарсан гиперпараметрийн нарийн хайлт болон хасалтын судалгаа хийсэн.

Нарийн тохируулгын өгөгдлийн багцаар VDR, ColPali train set, visrag_syn, болон visrag_ind-ийг сонгосон. Нарийн тохируулгад UniMax түүвэрлэлтийг ашигласан. Загвар нэгтгэсэн бөгөөд нэгтгэсэн суурь загвар мультимодал хайлтын чадварыг хэсэгчлэн өвлөсөн тул өгөгдлийн багцыг нэмэх нь гүйцэтгэлийг үл ялиг бууруулж байгааг тогтоосон. Иймээс илүү олон өгөгдлийн багц ашиглаагүй.

Нарийн тохируулгад сонгосон гиперпараметрүүд:

LoRA ранг

32

LoRA альфа

32

LoRA зорилтот модулиуд

эмбеддингээс бусад зураг, текстийн бүх давхарга

Суралцах хурд

5e-5

Дүрслэлийн токены дээд хэмжээ

1280

Сургалтын эпох

1

Нийт багцын хэмжээ

512

Халаалтын харьцаа

5%

3. “ColBERT”-ийн бэрхшээл: өндөр гүйцэтгэл ба хадгалалтын зардал

Уламжлалт байдлаар ColPali зэрэг “ColBERT маягийн” токен түвшний эмбеддинг ашигладаг загварууд гайхалтай гүйцэтгэлтэй ч хадгалалтын зардал нь хэт өндөр байсан. Дүрслэлийн токен бүрийг индексжүүлэхэд байгууллагын хэмжээнд ашиглахад хэт өндөр өртөгтэй асар том вектор өгөгдлийн сан үүсдэг байв.

  • Оновчлолын стратеги: Хамгийн өндөр гүйцэтгэлийг хадгалахын зэрэгцээ хадгалалтын зардлыг хэт өсгөхгүй байхаар эмбеддингийн хэмжээг нямбай тэнцвэржүүлж, хадгалалтын сорилтыг шийдсэн. Энэхүү үр ашигтай хэмжээнд SOTA нарийвчлалыг хадгалахын тулд хайлтын гүйцэтгэл ба хадгалалтын зардлыг хамгийн сайн тэнцвэржүүлэх хэмжээсийг 320 гэж сонгосон.

    • Суурь үзүүлэлт: Стандарт арга (NVIDIA Nemo-3B гэх мэт) 1 сая зургийн эмбеддингийг хадгалахад ойролцоогоор 10.3 TB шаарддаг (1,802 токен @ 3,072 хэмжээс).

    • ColQwen3: Ижил 1 сая зургийг ердөө 0.82 TB-д хадгална (дээд тал нь 1,280 токен @ 320 хэмжээс).

ColQwen3 нь үүлэн дэд бүтцийн төсвийг хэтрүүлэхгүйгээр SOTA түвшний хайлтын нарийвчлалд хүрдэг.

Үнэлгээний үр дүн

Бид аргачлалаа ViDoRe жишиг сорилын багцаар баталгаажууллаа. Үр дүнгээс харахад ColQwen3 нь хамгийн сүүлийн үеийн V3, V2 англи болон олон хэлний жишиг сорилд шинэ жишиг тогтоож, хуучны V1 даалгавруудад ч тэргүүлэх түвшний гүйцэтгэлээ хадгалжээ.

ViDoRe v3 (хамгийн сүүлийн)

ColQwen3-8B нь англи болон олон хэлний хайлтаар тэргүүлж байна.

Англи nDCG@5

Загвар

Компьютерын ухаан

Эрчим хүч

Санхүү

Хүний нөөц

Аж үйлдвэр

Эм зүй

Физик

Дундаж

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Олон хэлний nDCG@5

Загвар

Компьютерын ухаан

Эрчим хүч

Санхүү

Хүний нөөц

Аж үйлдвэр

Эм зүй

Физик

Дундаж

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 болон v1-ийн онцлох үр дүн

ESG, эдийн засаг болон DocVQA-д тогтмол өндөр гүйцэтгэл үзүүлэв.

Жишиг сорил

Загвар

Оноо (дундаж)

Онцлох амжилт

ViDoRe V2 (англи)

ColQwen3-8B

0.6772

ESG болон BioMed-д №1

ViDoRe V2 (олон хэл)

ColQwen3-8B

0.6085

Эдийн засгаар №1

ViDoRe V1 (англи)

Nemo ColEmbed 3B

0.9100

Дундаж нь ялимгүй өндөр

ViDoRe V1 (англи)

ColQwen3-8B

0.9076

ArxivQA болон Syn-Gov-д №1

Видео хайлт: CareBench үнэлгээ

ColQwen3 видео хайлтад сайн ерөнхийлж чаддагийг харуулахын тулд загваруудыг текстээс видео хайх (Ерөнхий хайлт) даалгаврын CareBench жишиг сорилоор үнэллээ.

Энэ үнэлгээнд бид түүхий видеог кодлох арга ашигласан: загварууд маань нэмэлт текстэн тайлбар, метадата оруулахгүйгээр видео файлыг шууд кодолсон. Энэ нь загвар зөвхөн дүрсний утга агуулгад тулгуурлан хайлт хийх чадвартайг харуулж байна.

Загвар

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“Харанхуй өгөгдөл”-ийг нээх нь: видеоны хил хязгаар

ColQwen3-ийн авчирсан хамгийн том өөрчлөлтүүдийн нэг нь видеог баримт бичигтэй адил боловсруулах чадвар юм. Олон байгууллагад видео нь “харанхуй өгөгдөл” байдаг. Хүн файл бүрийг гараар шошголоогүй л бол хүйтэн хадгалалтад хайх боломжгүй хэвээр үлддэг.

ColQwen3 нь хэсэгчлэн хуваасан клипээс кадр бүрээр хайх боломж олгон үүнийг өөрчилж байна.

Хэрэглээний жишээ: байгууллагын санах ойн сан

Байгууллагууд өдөр бүр олон мянган цагийн дотоод видео уулзалт бичдэг ч эдгээр бичлэг ихэнхдээ мартагдан алга болдог.

  • Ажлын явц: Урт уулзалтын бичлэгийг автоматаар богино, утга зүйн хэсгүүдэд хувааж, ColQwen3-аар индексжүүлснээр хайлт хийх боломжтой “байгууллагын санах ой” үүснэ.

  • Асуулга: Төслийн менежер: “Show me the clip where the engineering lead explained the latency issue with the API.” гэж асууж болно.

  • Үр дүн: Систем 60 минутын видео файл буцаахын оронд тухайн диаграмыг дэлгэцээр үзүүлж, хэлэлцсэн яг тэр 45 секундын хэсгийг олно. Яригчид тэр мөчид “latency” гэдэг үгийг шууд хэлээгүй байсан ч хайлт ажиллана.

Байгууллагын хэрэглээ: өндөр үнэ цэнтэй асуудлуудыг шийдэх нь

Төрөлх мультимодал эмбеддингт шилжсэнээр салбар бүрд цоо шинэ ажлын урсгал бий болно. Бид энэ загварыг байгууллагын хамгийн нарийн төвөгтэй өгөгдлийн орчны заримтай харьцуулан өргөн хүрээнд туршсан.

1. Жишиг сорилын онцлох үр дүн: хот төлөвлөлтийн зөвлөх үйлчилгээ ба архитектур

Бид ColQwen3-ийг ерөнхий төлөвлөгөө, бүсчлэлийн зураг, архитектурын нарийн фасад зургийн асар их сантай ажилладаг хот төлөвлөлтийн зөвлөх компаниудын өгөгдлийн сорилтоор туршсан.

  • Сорилт: Ийм орчинд уламжлалт RAG дамжлага хүндрэлтэй тулгардаг. OCR хэрэгслүүд нарийн төвөгтэй талбайн төлөвлөгөөг ихэвчлэн зүгээр л “схем” гэж тайлбарлан, замын хөдөлгөөний урсгал, ногоон бүс, барилгын ухралтын чухал мэдээллийг орхигдуулдаг.

  • Гүйцэтгэл: ColQwen3 нь өндөр өртөгтэй OCR болон тайлбар үүсгэх урьдчилсан боловсруулалтын хэрэгцээг үр дүнтэй арилгадаг нь бидний дотоод жишиг сорилоор харагдсан. Нягт мэдээлэлтэй архитектурын зураг дээр туршихад загвар явган хүний нэвтрэх цэг, ялгаатай бүсчлэлийн хил зэрэг тодорхой дүрслэлийн тэмдэглэгээнд тулгуурлан баримтыг амжилттай олсон. Ингэснээр зөвхөн текстэд суурилсан суурь аргуудаас илт давж, мэдлэг оруулах зардлыг эрс бууруулах боломж харуулсан.

2. Санхүү, зах зээлийн нарийн шинжилгээ

Хөрөнгө оруулалтын банкны мэргэжилтнүүд, шинжээчид жилийн тайлан болон хөрөнгө оруулагчдад зориулсан танилцуулгыг шүүхэд олон мянган цаг зарцуулдаг.

  • Ажлын явц: Шинжээч “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.” гэж асууж болно.

  • Өөрчлөлт: Загвар түлхүүр үг тааруулахын оронд тодорхой өгөгдлийн дүрслэл харагдаж буйд үндэслэн яг тохирох слайдыг олдог. Ингэснээр RAG систем асуултад өндөр нарийвчлалтай хариулна.

3. Аж үйлдвэрийн үйлдвэрлэл ба талбайн үйлчилгээ

Үйлдвэрлэлийн компаниуд техникийн гарын авлага болон хоолойн шугам, багаж хэрэгслийн диаграмын (P&ID) асар их сантай.

  • Ажлын явц: Турбин засаж буй талбайн инженер эд ангийн зургийг авах эсвэл “Show me the wiring diagram for the hydraulic pump assembly.” гэж асууж болно.

  • Өөрчлөлт: ColQwen3 утасны схемийн дүрслэлийг таньж, зөв хуудсыг олсноор зогсолтын хугацааг хэдэн цагаар бууруулах боломжтой.

4. Хууль ба нийцэл

Хуулийн баримт илрүүлэх ажилд олон сая сканнердсан хуудсыг шалгадаг бөгөөд хайж буй “зүү” нь ихэвчлэн дүрслэлийн тэмдэглэгээ байдаг.

  • Ажлын явц: Нийцлийн ажилтан “Documents signed by the CFO” эсвэл “Contracts containing the official ‘Confidential’ stamp.” гэж хайж болно.

  • Өөрчлөлт: Загвар гарын үсэг, тамга харагдаж буйд үндэслэн ноорог ба эцэслэсэн баримтыг ялгана. Зөвхөн OCR ашиглахад үүнийг ихэвчлэн орхигдуулдаг.

Эхлэх нь

ColQwen3 нь нээлттэй жинтэй (Apache 2.0) бөгөөд Hugging Face дээр ашиглах боломжтой. Бид үүнийг орчин үеийн RAG дамжлагад шууд орлуулах шинэчлэл болгон бүтээж, текст, зураг, видеог нэн даруй боловсруулахад шаардлагатай инференсийн кодыг дагалдуулсан.

Энгийн текстэн хайлтаас цааш гарч, дүрслэлийн нөөцдөө агуулагдсан оюун ухааныг нээхэд бэлэн байгууллагуудын хувьд энэ бол шинэ стандарт юм.

Дараагийн алхам: Загварын карттай танилцаж, Hugging Face дээрх шууд демог туршина уу: /-colqwen3-embed-8b болон /-colqwen3-embed-4b

Зохиогч

Xin Huang, Kye Min Tan