Негізгі навигация

Мәтіннен әрі: нағыз мультимодальды, толық циклді RAG мүмкіндігін ашу

Мультимодальды ендіру модельдері командаларға күрделі құжаттардан, суреттерден және видеолардан пайдалы ақпаратты тікелей табуға көмектеседі.

Соңғы екі жылда «RAG» (іздеу арқылы толықтырылған генерация) ұғымы тек мәтінмен дерлік мағыналас болды. Стандартты тәсіл қарапайым: құжаттарды алып, мәтінін бөліп шығару, оны фрагменттерге бөлу және индекстеу.

Алайда кәсіпорындар қарапайым мәтіндік файлдармен ғана жұмыс істемейді. Олардың жұмысында күрделі PDF файлдары, диаграммалары тығыз слайдтар, CAD сызбалары, сканерленген шот-фактуралар және көлемі барған сайын ұлғайып жатқан видео мұрағаттары қолданылады.

Ендірмес бұрын суретті OCR немесе визуалды LLM арқылы мәтінге айналдырып «сипаттау» — салалық стандартқа айналғанымен, бұл орасан зор тар орын болып отыр. Бұл тәсіл баяу әрі қымбат және бастапқы деректегі бай кеңістіктік әрі визуалды контексті сөзсіз жоғалтады. Егер ЖИ күрделі визуалды материалды жай ғана «сызба» деп сипаттаса, оның ішіндегі нақты клапанды немесе электр сымдарының схемасын іздеу мүмкіндігін жоғалтасыз.

Бүгін біз осы мәселені толық циклді визуалды іздеу арқылы шешуге арналған, ColPali архитектурасына негізделген озық мультимодальды ендіру модельдерінің тобын шығарамыз.

Сиқырдың инженерлік негізі: жетілдірілген дәл баптау стратегиялары

Шын мәнінде тиімді мультимодальды іздеу жүйесін жасау дайын визуалды-тілдік модельді (VLM) алып, одан іздеуді сұрай салудан әлдеқайда күрделі. Мультимодальды RAG дамуын бұрыннан тежеп келген мәселелерді шешіп, ColQwen3 жасау үшін модельдерді біріктіру және оқыту стратегияларын қолдандық.

1. Бапталған біріктіру салмақтары арқылы ендіру мүмкіндігін тасымалдау

Негізгі модельді басынан бастап дәл баптаудың орнына, қолданыстағы мәтіндік ендіру моделінен іздеу тапсырмалары туралы білімді тасымалдау әдісін әзірледік. Стандартты VLM суреттерді сипаттай алады, бірақ оларды сұрауға семантикалық сәйкестігі бойынша міндетті түрде реттей алмайды.

Осы олқылықтың орнын толтыру үшін бапталған біріктіру салмақтарының стратегияларын қолдандық. Тәжірибелеріміз Qwen3-Embedding моделінің мәтіндік жасырын кеңістіктегі іздеу қабілетін мультимодальды кеңістікке тікелей тасымалдауға болатынын көрсетті. Бұл қабілет бірден оқытпай-ақ сурет пен видео іздеуге бейімделеді. Осы тиімді бастапқы күйді берік тірек ретінде пайдаланып, өнімділікті одан әрі оңтайландыру және сенімділікті қамтамасыз ету үшін модельді дәл баптадық. Бұл Qwen3-VL негізгі моделінен бастап дәл баптаумен салыстырғанда соңғы іздеу өнімділігін жақсартады.

2. Гиперпараметрлерді мұқият баптау

Ендіру мүмкіндіктері тасымалданғаннан кейін сәйкестендіруге назар аудардық. Іздеу өнімділігін барынша арттыру үшін эпохалардың оңтайлы санын, пакет өлшемін, үйрену жылдамдығын, LoRA рангін және деректер жиындарының қоспасын қамтитын мұқият гиперпараметр іздеуі мен абляциялық зерттеулер жүргіздік.

Дәл баптауға арналған деректер жиындары ретінде VDR, ColPali оқыту жиынтығын, visrag_syn, және visrag_ind таңдадық. Дәл баптауда UniMax іріктеуін қолдандық. Модельдерді біріктіргендіктен және негізгі біріктірілген модель мультимодальды іздеу қабілетінің бір бөлігін мұра еткендіктен, деректер жиындарының санын көбейту өнімділікті аздап төмендететінін байқадық. Сондықтан қосымша жиындарды пайдаланбадық.

Дәл баптау үшін таңдаған гиперпараметрлеріміз:

LoRA рангі

32

LoRA альфасы

32

LoRA мақсатты модульдері

ендіруден басқа сурет пен мәтіннің барлық қабаты

Үйрену жылдамдығы

5e-5

Визуалды токендердің ең көп саны

1280

Оқыту эпохалары

1

Жалпы пакет өлшемі

512

Қыздыру үлесі

5%

3. «ColBERT» дилеммасы: жоғары өнімділік пен сақтау құны

Бұрын «ColBERT стиліндегі» токен деңгейіндегі ендірулерді пайдаланатын модельдер (мысалы, ColPali) керемет өнімділік көрсеткенімен, сақтау құны тым жоғары болатын. Әр визуалды токенді индекстеу кәсіпорын ауқымында тым қымбат болатын орасан зор векторлық дерекқорлар жасайтын.

  • Оңтайландыру стратегиясы: Ендірулеріміздің өлшемін мұқият теңгеріп, өнімділікті барынша сақтай отырып, сақтау шығындарының шектен тыс өсуіне жол бермедік. Осы ықшам көлемде SOTA дәлдігін сақтау үшін іздеу өнімділігі мен сақтау құнының ең жақсы теңгерімін беретін өлшем ретінде 320-ны таңдадық.

    • Бастапқы деңгей: Стандартты тәсілге (мысалы, NVIDIA Nemo-3B) 1 миллион суреттің ендірулерін сақтау үшін шамамен 10.3 ТБ қажет (1 802 токен @ 3 072 өлшем).

    • ColQwen3: Дәл сол 1 миллион суретті небәрі 0.82 ТБ көлемінде сақтайды (ең көбі 1 280 токен @ 320 өлшем).

ColQwen3 бұлттық инфрақұрылым бюджетін шамадан тыс өсірмей, SOTA іздеу дәлдігіне жетеді.

Бағалау нәтижелері

Тәсілімізді ViDoRe эталондық тесттер жиынтығында тексердік. Нәтижелер ColQwen3 моделінің ең жаңа V3 және V2 тесттерінде (ағылшын және көптілді нұсқаларда) жаңа стандарт орнатып, бұрынғы V1 тапсырмаларында да үздік деңгейдегі өнімділікті сақтайтынын растайды.

ViDoRe v3 (ең жаңа)

ColQwen3-8B ағылшын және көптілді іздеуде көш бастап тұр.

Ағылшын тіліндегі nDCG@5

Модель

Информатика

Энергетика

Қаржы

HR

Өнеркәсіп

Фармацевтика

Физика

Орташа

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Көптілді nDCG@5

Модель

Информатика

Энергетика

Қаржы

HR

Өнеркәсіп

Фармацевтика

Физика

Орташа

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 және v1 негізгі нәтижелері

ESG, экономика және DocVQA бойынша тұрақты жоғары өнімділік.

Эталондық тест

Модель

Ұпай (орташа)

Елеулі жетістік

ViDoRe V2 (ағылшын)

ColQwen3-8B

0.6772

ESG және BioMed бойынша №1

ViDoRe V2 (көптілді)

ColQwen3-8B

0.6085

Экономика бойынша №1

ViDoRe V1 (ағылшын)

Nemo ColEmbed 3B

0.9100

Орташа көрсеткіші сәл жоғары

ViDoRe V1 (ағылшын)

ColQwen3-8B

0.9076

ArxivQA және Syn-Gov бойынша №1

Видео іздеу: CareBench бағалауы

ColQwen3 моделінің видео іздеуге жақсы бейімделетінін көрсету үшін модельдерді мәтін бойынша видео іздеу (General Retrieval) тапсырмаларына арналған CareBench эталондық тестінде бағаладық.

Бұл бағалауда бастапқы видеоны кодтау тәсілін қолдандық: модельдеріміз видеофайлдарды ешқандай қосымша мәтіндік аннотациясыз немесе метадеректерсіз тікелей кодтады. Бұл модельдің тек визуалды семантикаға сүйеніп іздеу жүргізе алатынын көрсетеді.

Модель

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

«Қараңғы деректерді» ашу: видеоның озық шебі

ColQwen3 әкелген ең түбегейлі өзгерістердің бірі — видеоны құжат секілді өңдеу мүмкіндігі. Көптеген кәсіпорында видео — «қараңғы дерек». Әр файлды адам қолмен белгілеп шықпаса, ол салқын қоймада іздеуге келмейтін күйде жата береді.

ColQwen3 сегменттелген клиптерді кадр бойынша іздеуге мүмкіндік беріп, бұл жағдайды өзгертеді.

Қолдану сценарийі: корпоративтік жад қоры

Кәсіпорындар күн сайын мыңдаған сағаттық ішкі видеокездесулерді жазып алады, бірақ бұл жазбалар көбіне із-түзсіз жоғалады.

  • Жұмыс процесі: Кездесулердің ұзақ жазбаларын автоматты түрде қысқа әрі мағыналы клиптерге бөліп, ColQwen3 арқылы индекстеу нәтижесінде іздеуге болатын «корпоративтік жад» жасалады.

  • Сұрау: Жоба менеджері мынаны сұрай алады: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Нәтиже: Жүйе 60 минуттық видеофайлдың орнына нақты диаграмма экранда көрсетіліп, талқыланған дәл 45 секундтық үзіндіні табады. Тіпті сөйлеушілер сол сәтте «latency» сөзін нақты атамаса да, үзінді табылады.

Кәсіпорындағы қолдану сценарийлері: құнды мәселелерді шешу

Нативті мультимодальды ендіруге көшу түрлі салаларда мүлде жаңа жұмыс процестерін іске қосады. Бұл модельді кәсіпорындардағы ең күрделі деректер орталарының кейбірінде жан-жақты сынадық.

1. Эталондық тест нәтижесі: қала консалтингі және сәулет

ColQwen3 моделін бас жоспарлар, аймақтарға бөлу карталары және күрделі сәулеттік қасбет сызбаларының ауқымды қорын басқаратын қалалық консалтинг компанияларының деректеріне тән қиындықтарда сынадық.

  • Мәселе: Мұндай ортада дәстүрлі RAG конвейерлері қиналады. OCR құралдары күрделі учаске жоспарларын әдетте жай ғана «схема» деп сипаттап, көлік қозғалысы, жасыл аймақтар немесе ғимараттың шегініс қашықтығы туралы маңызды мәліметтерді елемейді.

  • Өнімділік: Ішкі эталондық тесттеріміз ColQwen3 моделінің қымбат OCR/сипаттама жасау алдындағы өңдеуін қажет етпейтінін көрсетті. Тығыз сәулет сызбаларымен жүргізілген сынақтарда модель жаяу жүргіншілер кіретін нүктелер немесе айқын аймақ шекаралары секілді нақты визуалды белгілер бойынша құжаттарды сәтті тапты. Ол тек мәтінге негізделген бастапқы тәсілдерден айтарлықтай озып, білімді жүйеге енгізу шығынын күрт азайтуға мүмкіндік береді.

2. Күрделі қаржылық және нарықтық талдау

Инвестициялық банкирлер мен талдаушылар жылдық есептер мен инвесторларға арналған презентацияларды қарауға мыңдаған сағат жұмсайды.

  • Жұмыс процесі: Талдаушы мынаны сұрай алады: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Өзгеріс: Модель кілтсөз сәйкестігіне сүйенбей, нақты деректер визуализациясының көрінісіне қарай дәл слайдты табады. Соның арқасында RAG жүйесі сұрақтарға жоғары дәлдікпен жауап береді.

3. Өнеркәсіптік өндіріс және көшпелі қызмет көрсету

Өндірістік компанияларда техникалық нұсқаулықтар мен құбыр сызбаларының (P&ID) ауқымды қорлары бар.

  • Жұмыс процесі: Турбинаны жөндеп жатқан көшпелі инженер бөлшекті суретке түсіре алады немесе мынаны сұрай алады: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Өзгеріс: ColQwen3 электр сымдары схемасының визуалды көрінісін анықтап, дұрыс бетті табады. Бұл тоқтап тұру уақытын бірнеше сағатқа қысқартуы мүмкін.

4. Құқық және нормативтік талаптарға сәйкестік

Заңдық зерттеу миллиондаған сканерленген бетті қарап шығуды талап етеді, ал ізделетін «ине» көбіне визуалды белгі болады.

  • Жұмыс процесі: Нормативтік талаптарға сәйкестік жөніндегі маман “Documents signed by the CFO” немесе “Contracts containing the official ‘Confidential’ stamp.” деп іздей алады.

  • Өзгеріс: Модель қолтаңбалар мен мөрлердің визуалды түрде болуына қарап, жоба мен түпкілікті құжатты ажыратады. Таза OCR мұны жиі байқамайды.

Жұмысты бастау

ColQwen3 — ашық салмақты модель (Apache 2.0), ол қазір Hugging Face платформасында қолжетімді. Оны заманауи RAG конвейерлеріне оңай қосылатын жаңарту ретінде әзірледік. Мәтінді, суреттерді және видеоны бірден өңдеуге қажетті инференс коды қоса беріледі.

Қарапайым мәтіндік іздеуден әрі өтіп, визуалды активтеріндегі жасырын білімді ашуға дайын кәсіпорындар үшін бұл — жаңа стандарт.

Келесі қадам: Модель картасын қарап, Hugging Face платформасындағы интерактивті демонұсқаны қолданып көріңіз: /-colqwen3-embed-8b және /-colqwen3-embed-4b

Автор

Xin Huang және Kye Min Tan