Сүүлийн хоёр жилд “RAG” (хайлтаар баяжуулсан үүсгэлт) гэх ойлголт бараг зөвхөн тексттэй ижил утгаар хэрэглэгдэж ирлээ. Стандарт арга нь энгийн: баримт бичгээс текстийг салгаж, хэсэгчлэн хуваагаад индексжүүлнэ.
Гэвч байгууллагын үйл ажиллагаа энгийн текст файлд тулгуурладаггүй. Харин нарийн төвөгтэй PDF, мэдээлэл шигүү графиктай слайд, CAD зураг, сканнердсан нэхэмжлэх, улам бүр өсөн нэмэгдэж буй асар их видео архивт тулгуурладаг.
Эдгээрийг эмбеддинг болгохоос өмнө OCR эсвэл Vision LLM ашиглан дүрсийг текстээр “тайлбарладаг” салбарын стандарт арга асар том гацаа болдог. Энэ нь удаан, өндөр өртөгтэй бөгөөд эх өгөгдлийн баялаг орон зайн болон дүрслэлийн агуулгыг зайлшгүй алддаг. Хэрэв таны AI нарийн төвөгтэй дүрслэлийг зүгээр л “зураг төсөл” гэж тайлбарлавал доторх тодорхой хавхлага эсвэл утасны схемийг хайх боломж алдагдана.
Өнөөдөр бид ColPali архитектурт тулгуурласан, дүрслэлийг эхнээс нь дуустал шууд хайх боломж олгон энэ асуудлыг шийдэх хамгийн сүүлийн үеийн мультимодал эмбеддинг загваруудын цувралыг танилцуулж байна.
Үнэхээр үр дүнтэй мультимодал хайгч бүтээх нь бэлэн хараа-хэлний загвар (VLM) аваад хайлт хийлгэхээс хавьгүй төвөгтэй. Мультимодал RAG-ийн хөгжлийг удаашруулж ирсэн сорилтуудыг шийдэн ColQwen3-ийг бүтээхийн тулд бид загвар нэгтгэх болон сургах стратеги ашигласан.
Суурь загварыг эхнээс нь нарийн тохируулахын оронд одоо байгаа текстэн эмбеддинг загвараас хайлтын даалгаврын мэдлэгийг шилжүүлэх арга боловсруулсан. Стандарт VLM дүрсийг тайлбарлаж чаддаг ч асуулгатай утга зүйн хувьд харьцуулан эрэмбэлэх чадвартай байх албагүй.
Энэ зөрүүг арилгахын тулд бид тохируулсан нэгтгэсэн жингийн стратеги ашигласан. Туршилтаар Qwen3-Embedding-ийн текстэн далд орон зай дахь хайлтын чадварыг мультимодал орон зайд шууд шилжүүлж, нэмэлт сургалтгүйгээр ч зураг болон видео хайлтад ерөнхийлж болохыг тогтоосон. Энэхүү үр дүнтэй эхлүүлэлтийг бат бөх суурь болгон ашиглаж, гүйцэтгэлийг улам сайжруулж, найдвартай байдлыг хангахын тулд загварыг нарийн тохируулсан. Энэ нь Qwen3-VL суурь загвараас шууд нарийн тохируулсантай харьцуулахад эцсийн хайлтын гүйцэтгэлийг сайжруулдаг.
Эмбеддинг чадварыг шилжүүлсний дараа бид нийцүүлэлтэд төвлөрсөн. Хайлтын гүйцэтгэлийг дээдлэхийн тулд эпохийн оновчтой тоо, багцын хэмжээ, суралцах хурд, LoRA ранг, өгөгдлийн багцын хольцыг хамарсан гиперпараметрийн нарийн хайлт болон хасалтын судалгаа хийсэн.
Нарийн тохируулгын өгөгдлийн багцаар VDR, ColPali train set, visrag_syn, болон visrag_ind-ийг сонгосон. Нарийн тохируулгад UniMax түүвэрлэлтийг ашигласан. Загвар нэгтгэсэн бөгөөд нэгтгэсэн суурь загвар мультимодал хайлтын чадварыг хэсэгчлэн өвлөсөн тул өгөгдлийн багцыг нэмэх нь гүйцэтгэлийг үл ялиг бууруулж байгааг тогтоосон. Иймээс илүү олон өгөгдлийн багц ашиглаагүй.
Нарийн тохируулгад сонгосон гиперпараметрүүд:
LoRA ранг | 32 |
LoRA альфа | 32 |
LoRA зорилтот модулиуд | эмбеддингээс бусад зураг, текстийн бүх давхарга |
Суралцах хурд | 5e-5 |
Дүрслэлийн токены дээд хэмжээ | 1280 |
Сургалтын эпох | 1 |
Нийт багцын хэмжээ | 512 |
Халаалтын харьцаа | 5% |
Уламжлалт байдлаар ColPali зэрэг “ColBERT маягийн” токен түвшний эмбеддинг ашигладаг загварууд гайхалтай гүйцэтгэлтэй ч хадгалалтын зардал нь хэт өндөр байсан. Дүрслэлийн токен бүрийг индексжүүлэхэд байгууллагын хэмжээнд ашиглахад хэт өндөр өртөгтэй асар том вектор өгөгдлийн сан үүсдэг байв.
Оновчлолын стратеги: Хамгийн өндөр гүйцэтгэлийг хадгалахын зэрэгцээ хадгалалтын зардлыг хэт өсгөхгүй байхаар эмбеддингийн хэмжээг нямбай тэнцвэржүүлж, хадгалалтын сорилтыг шийдсэн. Энэхүү үр ашигтай хэмжээнд SOTA нарийвчлалыг хадгалахын тулд хайлтын гүйцэтгэл ба хадгалалтын зардлыг хамгийн сайн тэнцвэржүүлэх хэмжээсийг 320 гэж сонгосон.
Суурь үзүүлэлт: Стандарт арга (NVIDIA Nemo-3B гэх мэт) 1 сая зургийн эмбеддингийг хадгалахад ойролцоогоор 10.3 TB шаарддаг (1,802 токен @ 3,072 хэмжээс).
ColQwen3: Ижил 1 сая зургийг ердөө 0.82 TB-д хадгална (дээд тал нь 1,280 токен @ 320 хэмжээс).
ColQwen3 нь үүлэн дэд бүтцийн төсвийг хэтрүүлэхгүйгээр SOTA түвшний хайлтын нарийвчлалд хүрдэг.
Бид аргачлалаа ViDoRe жишиг сорилын багцаар баталгаажууллаа. Үр дүнгээс харахад ColQwen3 нь хамгийн сүүлийн үеийн V3, V2 англи болон олон хэлний жишиг сорилд шинэ жишиг тогтоож, хуучны V1 даалгавруудад ч тэргүүлэх түвшний гүйцэтгэлээ хадгалжээ.
ColQwen3-8B нь англи болон олон хэлний хайлтаар тэргүүлж байна.
Англи nDCG@5
Загвар | Компьютерын ухаан | Эрчим хүч | Санхүү | Хүний нөөц | Аж үйлдвэр | Эм зүй | Физик | Дундаж |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Олон хэлний nDCG@5
Загвар | Компьютерын ухаан | Эрчим хүч | Санхүү | Хүний нөөц | Аж үйлдвэр | Эм зүй | Физик | Дундаж |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, эдийн засаг болон DocVQA-д тогтмол өндөр гүйцэтгэл үзүүлэв.
Жишиг сорил | Загвар | Оноо (дундаж) | Онцлох амжилт |
ViDoRe V2 (англи) | ColQwen3-8B | 0.6772 | ESG болон BioMed-д №1 |
ViDoRe V2 (олон хэл) | ColQwen3-8B | 0.6085 | Эдийн засгаар №1 |
ViDoRe V1 (англи) | Nemo ColEmbed 3B | 0.9100 | Дундаж нь ялимгүй өндөр |
ViDoRe V1 (англи) | ColQwen3-8B | 0.9076 | ArxivQA болон Syn-Gov-д №1 |
ColQwen3 видео хайлтад сайн ерөнхийлж чаддагийг харуулахын тулд загваруудыг текстээс видео хайх (Ерөнхий хайлт) даалгаврын CareBench жишиг сорилоор үнэллээ.
Энэ үнэлгээнд бид түүхий видеог кодлох арга ашигласан: загварууд маань нэмэлт текстэн тайлбар, метадата оруулахгүйгээр видео файлыг шууд кодолсон. Энэ нь загвар зөвхөн дүрсний утга агуулгад тулгуурлан хайлт хийх чадвартайг харуулж байна.
Загвар | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3-ийн авчирсан хамгийн том өөрчлөлтүүдийн нэг нь видеог баримт бичигтэй адил боловсруулах чадвар юм. Олон байгууллагад видео нь “харанхуй өгөгдөл” байдаг. Хүн файл бүрийг гараар шошголоогүй л бол хүйтэн хадгалалтад хайх боломжгүй хэвээр үлддэг.
ColQwen3 нь хэсэгчлэн хуваасан клипээс кадр бүрээр хайх боломж олгон үүнийг өөрчилж байна.
Байгууллагууд өдөр бүр олон мянган цагийн дотоод видео уулзалт бичдэг ч эдгээр бичлэг ихэнхдээ мартагдан алга болдог.
Ажлын явц: Урт уулзалтын бичлэгийг автоматаар богино, утга зүйн хэсгүүдэд хувааж, ColQwen3-аар индексжүүлснээр хайлт хийх боломжтой “байгууллагын санах ой” үүснэ.
Асуулга: Төслийн менежер: “Show me the clip where the engineering lead explained the latency issue with the API.” гэж асууж болно.
Үр дүн: Систем 60 минутын видео файл буцаахын оронд тухайн диаграмыг дэлгэцээр үзүүлж, хэлэлцсэн яг тэр 45 секундын хэсгийг олно. Яригчид тэр мөчид “latency” гэдэг үгийг шууд хэлээгүй байсан ч хайлт ажиллана.
Төрөлх мультимодал эмбеддингт шилжсэнээр салбар бүрд цоо шинэ ажлын урсгал бий болно. Бид энэ загварыг байгууллагын хамгийн нарийн төвөгтэй өгөгдлийн орчны заримтай харьцуулан өргөн хүрээнд туршсан.
Бид ColQwen3-ийг ерөнхий төлөвлөгөө, бүсчлэлийн зураг, архитектурын нарийн фасад зургийн асар их сантай ажилладаг хот төлөвлөлтийн зөвлөх компаниудын өгөгдлийн сорилтоор туршсан.
Сорилт: Ийм орчинд уламжлалт RAG дамжлага хүндрэлтэй тулгардаг. OCR хэрэгслүүд нарийн төвөгтэй талбайн төлөвлөгөөг ихэвчлэн зүгээр л “схем” гэж тайлбарлан, замын хөдөлгөөний урсгал, ногоон бүс, барилгын ухралтын чухал мэдээллийг орхигдуулдаг.
Гүйцэтгэл: ColQwen3 нь өндөр өртөгтэй OCR болон тайлбар үүсгэх урьдчилсан боловсруулалтын хэрэгцээг үр дүнтэй арилгадаг нь бидний дотоод жишиг сорилоор харагдсан. Нягт мэдээлэлтэй архитектурын зураг дээр туршихад загвар явган хүний нэвтрэх цэг, ялгаатай бүсчлэлийн хил зэрэг тодорхой дүрслэлийн тэмдэглэгээнд тулгуурлан баримтыг амжилттай олсон. Ингэснээр зөвхөн текстэд суурилсан суурь аргуудаас илт давж, мэдлэг оруулах зардлыг эрс бууруулах боломж харуулсан.
Хөрөнгө оруулалтын банкны мэргэжилтнүүд, шинжээчид жилийн тайлан болон хөрөнгө оруулагчдад зориулсан танилцуулгыг шүүхэд олон мянган цаг зарцуулдаг.
Ажлын явц: Шинжээч “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.” гэж асууж болно.
Өөрчлөлт: Загвар түлхүүр үг тааруулахын оронд тодорхой өгөгдлийн дүрслэл харагдаж буйд үндэслэн яг тохирох слайдыг олдог. Ингэснээр RAG систем асуултад өндөр нарийвчлалтай хариулна.
Үйлдвэрлэлийн компаниуд техникийн гарын авлага болон хоолойн шугам, багаж хэрэгслийн диаграмын (P&ID) асар их сантай.
Ажлын явц: Турбин засаж буй талбайн инженер эд ангийн зургийг авах эсвэл “Show me the wiring diagram for the hydraulic pump assembly.” гэж асууж болно.
Өөрчлөлт: ColQwen3 утасны схемийн дүрслэлийг таньж, зөв хуудсыг олсноор зогсолтын хугацааг хэдэн цагаар бууруулах боломжтой.
Хуулийн баримт илрүүлэх ажилд олон сая сканнердсан хуудсыг шалгадаг бөгөөд хайж буй “зүү” нь ихэвчлэн дүрслэлийн тэмдэглэгээ байдаг.
Ажлын явц: Нийцлийн ажилтан “Documents signed by the CFO” эсвэл “Contracts containing the official ‘Confidential’ stamp.” гэж хайж болно.
Өөрчлөлт: Загвар гарын үсэг, тамга харагдаж буйд үндэслэн ноорог ба эцэслэсэн баримтыг ялгана. Зөвхөн OCR ашиглахад үүнийг ихэвчлэн орхигдуулдаг.
ColQwen3 нь нээлттэй жинтэй (Apache 2.0) бөгөөд Hugging Face дээр ашиглах боломжтой. Бид үүнийг орчин үеийн RAG дамжлагад шууд орлуулах шинэчлэл болгон бүтээж, текст, зураг, видеог нэн даруй боловсруулахад шаардлагатай инференсийн кодыг дагалдуулсан.
Энгийн текстэн хайлтаас цааш гарч, дүрслэлийн нөөцдөө агуулагдсан оюун ухааныг нээхэд бэлэн байгууллагуудын хувьд энэ бол шинэ стандарт юм.
Дараагийн алхам: Загварын карттай танилцаж, Hugging Face дээрх шууд демог туршина уу: /-colqwen3-embed-8b болон /-colqwen3-embed-4b