Даље од текста: прави мултимодални RAG од почетка до краја

Мултимодални модели за уграђивање помажу тимовима да корисне информације проналазе непосредно у сложеним документима, сликама и видео-снимцима.

Током последње две године, „RAG“ (генерисање проширено претраживањем) био је готово искључиво синоним за текст. Стандардни поступак је једноставан: узмите документе, издвојте текст, поделите га на делове и индексирајте.

Али пословни свет се не заснива на обичним текстуалним датотекама. Он се ослања на сложене PDF документе, презентације с густим графиконима, CAD цртеже, скениране фактуре и све веће архиве видео-снимака.

Секторски стандард за њихову обраду — коришћење OCR-а или визуелних LLM-ова да би се слика пре уграђивања „описала“ текстом — представља огромно уско грло. Тај поступак је спор и скуп, а неминовно губи богат просторни и визуелни контекст изворних података. Ако ваша вештачка интелигенција сложен визуелни приказ опише само као „технички цртеж“, више не можете да тражите одређени вентил или шему ожичења у њему.

Данас објављујемо породицу најсавременијих мултимодалних модела за уграђивање, заснованих на архитектури ColPali, који овај проблем решавају омогућавањем визуелног претраживања од почетка до краја.

Инжењерство иза магије: напредне стратегије финог подешавања

Израда заиста ефикасног мултимодалног претраживача није тако једноставна као узети готов визуелно-језички модел (VLM) и затражити му да претражује. Да бисмо превазишли препреке које су дуго ограничавале мултимодални RAG и направили ColQwen3, применили смо стратегије спајања и обучавања модела.

1. Пренос способности уграђивања подешеним пондерисањем при спајању

Уместо финог подешавања основног модела од нуле, осмислили смо метод за пренос знања о задацима претраживања из постојећег текстуалног модела за уграђивање. Стандардни VLM уме да описује слике, али не мора нужно да зна како да их семантички рангира у односу на упит.

Да бисмо премостили тај јаз, применили смо стратегије подешеног пондерисања при спајању. У експериментима смо утврдили да се способност претраживања модела Qwen3-Embedding у текстуалном латентном простору може непосредно пренети у мултимодални простор и генерализовати на претраживање слика и видеа чак и без непосредног обучавања. Користећи ову ефикасну иницијализацију као снажну полазну тачку, затим смо фино подесили модел ради даље оптимизације резултата и обезбеђивања робусности. То побољшава коначне резултате претраживања у поређењу с финим подешавањем основног модела Qwen3-VL.

2. Пажљиво подешавање хиперпараметара

Након преноса способности уграђивања, усредсредили смо се на усклађивање. Спровели смо пажљиве претраге хиперпараметара и аблационе студије, укључујући оптималан број епоха, величину серије, стопу учења, LoRA ранг и комбинацију скупова података, како бисмо максимално побољшали претраживање.

За фино подешавање изабрали смо скупове података VDR, ColPali train set, visrag_syn, и visrag_ind. За фино подешавање користили смо UniMax узорковање. Пошто смо применили спајање модела, а добијени основни модел већ наслеђује део мултимодалних способности претраживача, утврдили смо да би додавање још скупова података заправо незнатно погоршало резултате, па их нисмо додавали.

Ово су хиперпараметри које смо изабрали за фино подешавање:

LoRA ранг

32

LoRA алфа

32

Циљни LoRA модули

сви слојеви и слике и текста, осим уграђивања

Стопа учења

5e-5

Максималан број визуелних токена

1280

Епохе обучавања

1

Глобална величина серије

512

Удео загревања

5%

3. Дилема „ColBERT“: високи резултати наспрам трошкова складиштења

Модели који користе уграђивања на нивоу токена у стилу „ColBERT“, попут ColPali, традиционално су пружали изванредне резултате, али уз превисоке трошкове складиштења. Индексирање сваког визуелног токена стварало је огромне векторске базе података, прескупе за примену у обиму великих предузећа.

  • Стратегија оптимизације: Проблем складиштења решили смо пажљивим уравнотежавањем величине уграђивања, како бисмо задржали максималне резултате без наглог раста трошкова складиштења. Да бисмо задржали најсавременију прецизност уз овако ефикасан обим, пажљиво смо одабрали 320 димензија као најбољу равнотежу између резултата претраживања и трошкова складиштења.

    • Полазна основа: Стандардном приступу, попут NVIDIA Nemo-3B, потребно је приближно 10,3 TB за чување уграђивања милион слика (1.802 токена @ 3.072 димензије).

    • ColQwen3: Чува истих милион слика у свега 0,82 TB (највише 1.280 токена @ 320 димензија).

ColQwen3 постиже најсавременију прецизност претраживања без прекорачења буџета за инфраструктуру у облаку.

Резултати евалуације

Наш приступ смо потврдили на скупу тестова ViDoRe. Резултати потврђују да ColQwen3 поставља нове стандарде на најновијим тестовима V3 и V2, и на енглеском и у вишејезичном окружењу, уз врхунске резултате на старијим задацима V1.

ViDoRe v3 (најновији)

ColQwen3-8B предњачи у претраживању на енглеском и у вишејезичном претраживању.

Енглески nDCG@5

Модел

Рачунарство

Енергетика

Финансије

ЉР

Сектор

Фармација

Физика

Просек

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Вишејезични nDCG@5

Модел

Рачунарство

Енергетика

Финансије

ЉР

Сектор

Фармација

Физика

Просек

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Најважнији резултати ViDoRe v2 и v1

Доследно високи резултати у областима ESG, економије и DocVQA.

Тест

Модел

Резултат (просек)

Значајан успех

ViDoRe V2 (енглески)

ColQwen3-8B

0.6772

Број 1 у ESG & BioMed

ViDoRe V2 (вишејезични)

ColQwen3-8B

0.6085

Број 1 у економији

ViDoRe V1 (енглески)

Nemo ColEmbed 3B

0.9100

Незнатно виши просек

ViDoRe V1 (енглески)

ColQwen3-8B

0.9076

Број 1 у ArxivQA & Syn-Gov

Претраживање видео-снимака: евалуација CareBench

Да бисмо показали да се ColQwen3 успешно генерализује на претраживање видео-снимака, моделе смо оценили на тесту CareBench за задатке претраживања видеа на основу текста (General Retrieval).

За ову евалуацију применили смо директно кодирање необрађеног видеа: наши модели су непосредно кодирали видео-датотеке, без додатних текстуалних напомена или метаподатака. То истиче способност модела да претражује искључиво на основу визуелне семантике.

Модел

Одзив@1

Одзив@5

Одзив@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Откључавање „тамних података“: гранични домет видеа

Једна од најзначајнијих промена које ColQwen3 омогућава јесте способност да видео обрађује исто као документе. У многим предузећима видео је „тамни податак“. Чува се у хладном складишту и уопште се не може претраживати ако човек није ручно означио сваку датотеку.

ColQwen3 то мења тако што омогућава претраживање сегментираних исечака кадар по кадар.

Пример примене: корпоративна банка знања

Предузећа свакодневно снимају хиљаде сати интерних видео-састанака, а ти снимци обично нестану у забораву.

  • Ток рада: Аутоматским дељењем дугих снимака састанака на краће, логичне исечке и њиховим индексирањем помоћу ColQwen3 ствара се претражива „корпоративна меморија“.

  • Упит: Руководилац пројекта може да затражи: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Резултат: Уместо видео-датотеке од 60 минута, систем проналази тачан сегмент од 45 секунди у којем је тај дијаграм приказан на екрану и разматран, чак и ако говорници у том тренутку нису изричито изговорили реч „кашњење“.

Примене у предузећима: решавање проблема велике вредности

Прелазак на изворно мултимодално уграђивање омогућава потпуно нове токове рада у различитим секторима. Овај модел смо опсежно тестирали у неким од најсложенијих окружења за податке у предузећима.

1. Најважнији резултат тестирања: урбанистички консалтинг и архитектура

ColQwen3 смо тестирали на изазовима с подацима са којима се суочавају фирме за урбанистички консалтинг, које управљају огромним библиотекама генералних планова, мапа зонирања и сложених архитектонских изгледа.

  • Изазов: Традиционални RAG токови обраде тешко функционишу у овим окружењима. OCR алати сложене ситуационе планове обично описују само као „шему“, занемарујући кључне детаље о токовима саобраћаја, зеленим зонама или удаљености објеката од граница парцеле.

  • Резултати: Наши интерни тестови показују да ColQwen3 успешно уклања потребу за скупом претходном OCR обрадом и генерисањем описа. У тестовима с густим архитектонским цртежима, модел је успешно проналазио документе на основу одређених визуелних ознака, попут пешачких приступа или јасних граница зона. Тиме је знатно надмашио основна решења заснована само на тексту и показао потенцијал за драстично смањење трошкова уноса знања.

2. Сложена финансијска и тржишна анализа

Инвестициони банкари и аналитичари проводе хиљаде сати прегледајући годишње извештаје и презентације за инвеститоре.

  • Ток рада: Аналитичар може да затражи: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Промена: Уместо ослањања на подударање кључних речи, модел проналази тачан слајд на основу визуелног присуства конкретног приказа података, што RAG систему омогућава да изузетно прецизно одговара на питања.

3. Индустријска производња и теренске услуге

Производна предузећа поседују огромне библиотеке техничких приручника и дијаграма цевовода и инструментације (P&ID).

  • Ток рада: Теренски инжењер који поправља турбину може да фотографише део или затражи: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Промена: ColQwen3 препознаје визуелни приказ шеме ожичења и проналази одговарајућу страницу, чиме потенцијално скраћује застој за више сати.

4. Правни послови и усклађеност

Правна претрага подразумева преглед милиона скенираних страница, на којима је тражена „игла у пласту сена“ често визуелна ознака.

  • Ток рада: Службеник за усклађеност може да тражи “Documents signed by the CFO” или “Contracts containing the official ‘Confidential’ stamp.”

  • Промена: Модел разликује нацрт од завршног документа на основу визуелног присуства потписа или печата, што чист OCR често пропусти.

Први кораци

ColQwen3 има отворене тежине (Apache 2.0) и већ је доступан на платформи Hugging Face. Осмислили смо га као непосредну надоградњу модерних RAG токова обраде, уз сав потребан код за инференцију ради тренутне обраде текста, слика и видеа.

За предузећа спремна да превазиђу једноставно претраживање текста и откључају Интелигенцију заробљену у визуелним ресурсима, ово је нови стандард.

Следећи корак: Погледајте картицу модела и испробајте демо уживо на платформи Hugging Face: /-colqwen3-embed-8b и /-colqwen3-embed-4b

Autor

Xin Huang и Kye Min Tan