Соңғы екі жылда «RAG» (іздеу арқылы толықтырылған генерация) ұғымы тек мәтінмен дерлік мағыналас болды. Стандартты тәсіл қарапайым: құжаттарды алып, мәтінін бөліп шығару, оны фрагменттерге бөлу және индекстеу.
Алайда кәсіпорындар қарапайым мәтіндік файлдармен ғана жұмыс істемейді. Олардың жұмысында күрделі PDF файлдары, диаграммалары тығыз слайдтар, CAD сызбалары, сканерленген шот-фактуралар және көлемі барған сайын ұлғайып жатқан видео мұрағаттары қолданылады.
Ендірмес бұрын суретті OCR немесе визуалды LLM арқылы мәтінге айналдырып «сипаттау» — салалық стандартқа айналғанымен, бұл орасан зор тар орын болып отыр. Бұл тәсіл баяу әрі қымбат және бастапқы деректегі бай кеңістіктік әрі визуалды контексті сөзсіз жоғалтады. Егер ЖИ күрделі визуалды материалды жай ғана «сызба» деп сипаттаса, оның ішіндегі нақты клапанды немесе электр сымдарының схемасын іздеу мүмкіндігін жоғалтасыз.
Бүгін біз осы мәселені толық циклді визуалды іздеу арқылы шешуге арналған, ColPali архитектурасына негізделген озық мультимодальды ендіру модельдерінің тобын шығарамыз.
Шын мәнінде тиімді мультимодальды іздеу жүйесін жасау дайын визуалды-тілдік модельді (VLM) алып, одан іздеуді сұрай салудан әлдеқайда күрделі. Мультимодальды RAG дамуын бұрыннан тежеп келген мәселелерді шешіп, ColQwen3 жасау үшін модельдерді біріктіру және оқыту стратегияларын қолдандық.
Негізгі модельді басынан бастап дәл баптаудың орнына, қолданыстағы мәтіндік ендіру моделінен іздеу тапсырмалары туралы білімді тасымалдау әдісін әзірледік. Стандартты VLM суреттерді сипаттай алады, бірақ оларды сұрауға семантикалық сәйкестігі бойынша міндетті түрде реттей алмайды.
Осы олқылықтың орнын толтыру үшін бапталған біріктіру салмақтарының стратегияларын қолдандық. Тәжірибелеріміз Qwen3-Embedding моделінің мәтіндік жасырын кеңістіктегі іздеу қабілетін мультимодальды кеңістікке тікелей тасымалдауға болатынын көрсетті. Бұл қабілет бірден оқытпай-ақ сурет пен видео іздеуге бейімделеді. Осы тиімді бастапқы күйді берік тірек ретінде пайдаланып, өнімділікті одан әрі оңтайландыру және сенімділікті қамтамасыз ету үшін модельді дәл баптадық. Бұл Qwen3-VL негізгі моделінен бастап дәл баптаумен салыстырғанда соңғы іздеу өнімділігін жақсартады.
Ендіру мүмкіндіктері тасымалданғаннан кейін сәйкестендіруге назар аудардық. Іздеу өнімділігін барынша арттыру үшін эпохалардың оңтайлы санын, пакет өлшемін, үйрену жылдамдығын, LoRA рангін және деректер жиындарының қоспасын қамтитын мұқият гиперпараметр іздеуі мен абляциялық зерттеулер жүргіздік.
Дәл баптауға арналған деректер жиындары ретінде VDR, ColPali оқыту жиынтығын, visrag_syn, және visrag_ind таңдадық. Дәл баптауда UniMax іріктеуін қолдандық. Модельдерді біріктіргендіктен және негізгі біріктірілген модель мультимодальды іздеу қабілетінің бір бөлігін мұра еткендіктен, деректер жиындарының санын көбейту өнімділікті аздап төмендететінін байқадық. Сондықтан қосымша жиындарды пайдаланбадық.
Дәл баптау үшін таңдаған гиперпараметрлеріміз:
LoRA рангі | 32 |
LoRA альфасы | 32 |
LoRA мақсатты модульдері | ендіруден басқа сурет пен мәтіннің барлық қабаты |
Үйрену жылдамдығы | 5e-5 |
Визуалды токендердің ең көп саны | 1280 |
Оқыту эпохалары | 1 |
Жалпы пакет өлшемі | 512 |
Қыздыру үлесі | 5% |
Бұрын «ColBERT стиліндегі» токен деңгейіндегі ендірулерді пайдаланатын модельдер (мысалы, ColPali) керемет өнімділік көрсеткенімен, сақтау құны тым жоғары болатын. Әр визуалды токенді индекстеу кәсіпорын ауқымында тым қымбат болатын орасан зор векторлық дерекқорлар жасайтын.
Оңтайландыру стратегиясы: Ендірулеріміздің өлшемін мұқият теңгеріп, өнімділікті барынша сақтай отырып, сақтау шығындарының шектен тыс өсуіне жол бермедік. Осы ықшам көлемде SOTA дәлдігін сақтау үшін іздеу өнімділігі мен сақтау құнының ең жақсы теңгерімін беретін өлшем ретінде 320-ны таңдадық.
Бастапқы деңгей: Стандартты тәсілге (мысалы, NVIDIA Nemo-3B) 1 миллион суреттің ендірулерін сақтау үшін шамамен 10.3 ТБ қажет (1 802 токен @ 3 072 өлшем).
ColQwen3: Дәл сол 1 миллион суретті небәрі 0.82 ТБ көлемінде сақтайды (ең көбі 1 280 токен @ 320 өлшем).
ColQwen3 бұлттық инфрақұрылым бюджетін шамадан тыс өсірмей, SOTA іздеу дәлдігіне жетеді.
Тәсілімізді ViDoRe эталондық тесттер жиынтығында тексердік. Нәтижелер ColQwen3 моделінің ең жаңа V3 және V2 тесттерінде (ағылшын және көптілді нұсқаларда) жаңа стандарт орнатып, бұрынғы V1 тапсырмаларында да үздік деңгейдегі өнімділікті сақтайтынын растайды.
ColQwen3-8B ағылшын және көптілді іздеуде көш бастап тұр.
Ағылшын тіліндегі nDCG@5
Модель | Информатика | Энергетика | Қаржы | HR | Өнеркәсіп | Фармацевтика | Физика | Орташа |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Көптілді nDCG@5
Модель | Информатика | Энергетика | Қаржы | HR | Өнеркәсіп | Фармацевтика | Физика | Орташа |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, экономика және DocVQA бойынша тұрақты жоғары өнімділік.
Эталондық тест | Модель | Ұпай (орташа) | Елеулі жетістік |
ViDoRe V2 (ағылшын) | ColQwen3-8B | 0.6772 | ESG және BioMed бойынша №1 |
ViDoRe V2 (көптілді) | ColQwen3-8B | 0.6085 | Экономика бойынша №1 |
ViDoRe V1 (ағылшын) | Nemo ColEmbed 3B | 0.9100 | Орташа көрсеткіші сәл жоғары |
ViDoRe V1 (ағылшын) | ColQwen3-8B | 0.9076 | ArxivQA және Syn-Gov бойынша №1 |
ColQwen3 моделінің видео іздеуге жақсы бейімделетінін көрсету үшін модельдерді мәтін бойынша видео іздеу (General Retrieval) тапсырмаларына арналған CareBench эталондық тестінде бағаладық.
Бұл бағалауда бастапқы видеоны кодтау тәсілін қолдандық: модельдеріміз видеофайлдарды ешқандай қосымша мәтіндік аннотациясыз немесе метадеректерсіз тікелей кодтады. Бұл модельдің тек визуалды семантикаға сүйеніп іздеу жүргізе алатынын көрсетеді.
Модель | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 әкелген ең түбегейлі өзгерістердің бірі — видеоны құжат секілді өңдеу мүмкіндігі. Көптеген кәсіпорында видео — «қараңғы дерек». Әр файлды адам қолмен белгілеп шықпаса, ол салқын қоймада іздеуге келмейтін күйде жата береді.
ColQwen3 сегменттелген клиптерді кадр бойынша іздеуге мүмкіндік беріп, бұл жағдайды өзгертеді.
Кәсіпорындар күн сайын мыңдаған сағаттық ішкі видеокездесулерді жазып алады, бірақ бұл жазбалар көбіне із-түзсіз жоғалады.
Жұмыс процесі: Кездесулердің ұзақ жазбаларын автоматты түрде қысқа әрі мағыналы клиптерге бөліп, ColQwen3 арқылы индекстеу нәтижесінде іздеуге болатын «корпоративтік жад» жасалады.
Сұрау: Жоба менеджері мынаны сұрай алады: “Show me the clip where the engineering lead explained the latency issue with the API.”
Нәтиже: Жүйе 60 минуттық видеофайлдың орнына нақты диаграмма экранда көрсетіліп, талқыланған дәл 45 секундтық үзіндіні табады. Тіпті сөйлеушілер сол сәтте «latency» сөзін нақты атамаса да, үзінді табылады.
Нативті мультимодальды ендіруге көшу түрлі салаларда мүлде жаңа жұмыс процестерін іске қосады. Бұл модельді кәсіпорындардағы ең күрделі деректер орталарының кейбірінде жан-жақты сынадық.
ColQwen3 моделін бас жоспарлар, аймақтарға бөлу карталары және күрделі сәулеттік қасбет сызбаларының ауқымды қорын басқаратын қалалық консалтинг компанияларының деректеріне тән қиындықтарда сынадық.
Мәселе: Мұндай ортада дәстүрлі RAG конвейерлері қиналады. OCR құралдары күрделі учаске жоспарларын әдетте жай ғана «схема» деп сипаттап, көлік қозғалысы, жасыл аймақтар немесе ғимараттың шегініс қашықтығы туралы маңызды мәліметтерді елемейді.
Өнімділік: Ішкі эталондық тесттеріміз ColQwen3 моделінің қымбат OCR/сипаттама жасау алдындағы өңдеуін қажет етпейтінін көрсетті. Тығыз сәулет сызбаларымен жүргізілген сынақтарда модель жаяу жүргіншілер кіретін нүктелер немесе айқын аймақ шекаралары секілді нақты визуалды белгілер бойынша құжаттарды сәтті тапты. Ол тек мәтінге негізделген бастапқы тәсілдерден айтарлықтай озып, білімді жүйеге енгізу шығынын күрт азайтуға мүмкіндік береді.
Инвестициялық банкирлер мен талдаушылар жылдық есептер мен инвесторларға арналған презентацияларды қарауға мыңдаған сағат жұмсайды.
Жұмыс процесі: Талдаушы мынаны сұрай алады: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Өзгеріс: Модель кілтсөз сәйкестігіне сүйенбей, нақты деректер визуализациясының көрінісіне қарай дәл слайдты табады. Соның арқасында RAG жүйесі сұрақтарға жоғары дәлдікпен жауап береді.
Өндірістік компанияларда техникалық нұсқаулықтар мен құбыр сызбаларының (P&ID) ауқымды қорлары бар.
Жұмыс процесі: Турбинаны жөндеп жатқан көшпелі инженер бөлшекті суретке түсіре алады немесе мынаны сұрай алады: “Show me the wiring diagram for the hydraulic pump assembly.”
Өзгеріс: ColQwen3 электр сымдары схемасының визуалды көрінісін анықтап, дұрыс бетті табады. Бұл тоқтап тұру уақытын бірнеше сағатқа қысқартуы мүмкін.
Заңдық зерттеу миллиондаған сканерленген бетті қарап шығуды талап етеді, ал ізделетін «ине» көбіне визуалды белгі болады.
Жұмыс процесі: Нормативтік талаптарға сәйкестік жөніндегі маман “Documents signed by the CFO” немесе “Contracts containing the official ‘Confidential’ stamp.” деп іздей алады.
Өзгеріс: Модель қолтаңбалар мен мөрлердің визуалды түрде болуына қарап, жоба мен түпкілікті құжатты ажыратады. Таза OCR мұны жиі байқамайды.
ColQwen3 — ашық салмақты модель (Apache 2.0), ол қазір Hugging Face платформасында қолжетімді. Оны заманауи RAG конвейерлеріне оңай қосылатын жаңарту ретінде әзірледік. Мәтінді, суреттерді және видеоны бірден өңдеуге қажетті инференс коды қоса беріледі.
Қарапайым мәтіндік іздеуден әрі өтіп, визуалды активтеріндегі жасырын білімді ашуға дайын кәсіпорындар үшін бұл — жаңа стандарт.
Келесі қадам: Модель картасын қарап, Hugging Face платформасындағы интерактивті демонұсқаны қолданып көріңіз: /-colqwen3-embed-8b және /-colqwen3-embed-4b