Главна навигација

Надвор од текстот: вистински мултимодален RAG од почеток до крај

Моделите за мултимодални вградувања им помагаат на тимовите директно да пронаоѓаат корисни информации во сложени документи, слики и видеа.

Во последните две години, „RAG“ (генерирање дополнето со пронаоѓање) речиси исклучиво се поврзуваше со текст. Стандардниот пристап е едноставен: земете ги документите, извлечете го текстот, поделете го на делови и индексирајте го.

Но деловниот свет не се потпира на обични текстуални датотеки. Тој се потпира на сложени PDF-документи, презентации со густи графикони, CAD-цртежи, скенирани фактури и, сè повеќе, огромни архиви од видеоматеријали.

Индустрискиот стандард за нивна обработка — користење OCR или визуелни LLM за да се „опише“ сликата со текст пред да се вгради — претставува огромно тесно грло. Овој процес е бавен и скап и неизбежно го губи богатиот просторен и визуелен контекст на изворните податоци. Ако вашата ВИ опише сложена слика едноставно како „технички план“, ја губите можноста да пребарувате конкретен вентил или електрична шема во неа.

Денес објавуваме семејство најсовремени модели за мултимодални вградувања, изградени врз архитектурата ColPali, кои го решаваат овој проблем овозможувајќи визуелно пронаоѓање од почеток до крај.

Инженерството зад магијата: напредни стратегии за фино приспособување

Создавањето навистина ефикасен мултимодален систем за пронаоѓање не е толку едноставно како да земете готов визуелно-јазичен модел (VLM) и да побарате да пребарува. За да ги надминеме предизвиците што досега го ограничуваа мултимодалниот RAG и да го создадеме ColQwen3, применивме стратегии за спојување и обучување модели.

1. Пренос на способноста за вградување преку приспособено пондерирање при спојување

Наместо фино да приспособуваме основен модел од почеток, развивме метод за пренесување на знаењето за задачите за пронаоѓање од постоен модел за текстуални вградувања. Стандарден VLM знае да опишува слики, но не мора да знае семантички да ги рангира според барањето.

За да го премостиме овој јаз, користевме стратегии за приспособено пондерирање при спојување. Во експериментите откривме дека способноста за пронаоѓање на Qwen3-Embedding во латентниот текстуален простор може директно да се пренесе во мултимодалниот простор и да се генерализира за пронаоѓање слики и видеа дури и без непосредно обучување. Користејќи ја оваа ефикасна иницијализација како цврста појдовна точка, потоа фино го приспособивме моделот за дополнително да ги оптимизираме перформансите и да обезбедиме робусност. Тоа ги подобрува конечните перформанси при пронаоѓање во споредба со финото приспособување на основниот модел Qwen3-VL.

2. Внимателно приспособување на хиперпараметрите

Откако ги пренесовме способностите за вградување, се сосредоточивме на усогласувањето. Спроведовме внимателно пребарување на хиперпараметрите и аблациски студии, вклучувајќи ги оптималниот број епохи, големината на серијата, стапката на учење, рангот LoRA и комбинацијата од множества податоци, за да ги зголемиме перформансите при пронаоѓање.

Како множества податоци за фино приспособување ги избравме VDR, множеството за обука ColPali, visrag_syn, и visrag_ind. За финото приспособување користевме земање примероци UniMax. Бидејќи применивме спојување модели, а основниот споен модел веќе наследува делумна мултимодална способност за пронаоѓање, откривме дека додавањето повеќе множества податоци всушност малку ги влошува перформансите, па не го зголемивме нивниот број.

Ова се хиперпараметрите што ги избравме за финото приспособување:

Ранг на LoRA

32

Алфа на LoRA

32

Целни модули на LoRA

сите слоеви и за слика и за текст, освен вградувањето

Стапка на учење

5e-5

Максимум визуелни токени

1280

Епохи на обучување

1

Глобална големина на серијата

512

Сооднос на загревање

5%

3. Дилемата „ColBERT“: високи перформанси наспроти трошоци за складирање

Историски гледано, моделите со вградувања на ниво на токен во стилот на „ColBERT“ (како ColPali) нудеа извонредни перформанси, но со превисоки трошоци за складирање. Индексирањето на секој визуелен токен создаваше огромни векторски бази на податоци, прескапи за употреба во претпријатија.

  • Стратегијата за оптимизација: Предизвикот со складирањето го решивме со внимателно балансирање на големината на вградувањата, задржувајќи максимални перформанси без нагло зголемување на трошоците. За да ја задржиме врвната прецизност со овој ефикасен обем, внимателно избравме димензија од 320 како најдобар баланс меѓу перформансите при пронаоѓање и трошоците за складирање.

    • Основна вредност: Стандарден пристап (како NVIDIA Nemo-3B) бара приближно 10,3 TB за складирање на вградувањата за 1 милион слики (1.802 токени со 3.072 димензии).

    • ColQwen3: Ги складира истите 1 милион слики во само 0,82 TB (најмногу 1.280 токени со 320 димензии).

ColQwen3 постигнува врвна прецизност при пронаоѓање без да го оптоварува буџетот за облачна инфраструктура.

Резултати од евалуацијата

Го потврдивме нашиот пристап со пакетот од реперни тестови ViDoRe. Резултатите потврдуваат дека ColQwen3 поставува нови стандарди на најновите реперни тестови V3 и V2 (и на англиски и на повеќе јазици), задржувајќи врвни перформанси и на постарите задачи V1.

ViDoRe v3 (најнова верзија)

ColQwen3-8B е водечки во пронаоѓањето на англиски и на повеќе јазици.

nDCG@5 на англиски

Модел

Комп. науки

Енергетика

Финансии

ЧР

Инд.

Фармација

Физика

Просек

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Повеќејазичен nDCG@5

Модел

Комп. науки

Енергетика

Финансии

ЧР

Инд.

Фармација

Физика

Просек

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Најважни резултати од ViDoRe v2 и v1

Постојано високи перформанси кај ESG, економија и DocVQA.

Реперен тест

Модел

Резултат (просек)

Значајна победа

ViDoRe V2 (англиски)

ColQwen3-8B

0.6772

Бр. 1 во ESG & BioMed

ViDoRe V2 (повеќејазично)

ColQwen3-8B

0.6085

Бр. 1 во економија

ViDoRe V1 (англиски)

Nemo ColEmbed 3B

0.9100

Малку повисок просек

ViDoRe V1 (англиски)

ColQwen3-8B

0.9076

Бр. 1 во ArxivQA & Syn-Gov

Пронаоѓање видеа: евалуација со CareBench

За да покажеме дека ColQwen3 успешно се генерализира и за пронаоѓање видеа, ги евалуиравме моделите со реперниот тест CareBench за задачи за пронаоѓање видео врз основа на текст (General Retrieval).

За оваа евалуација користевме пристап со кодирање необработено видео: нашите модели директно ги кодираа видеодатотеките, без дополнителни текстуални ознаки или метаподатоци. Ова ја истакнува способноста на моделот да пронаоѓа содржини исклучиво врз основа на визуелната семантика.

Модел

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Отклучување на „темните податоци“: граничниот потенцијал на видеото

Една од најзначајните промени што ги овозможува ColQwen3 е способноста да го обработува видеото исто како документите. Во многу претпријатија, видеото е „темен податок“. Се чува во студена архива и воопшто не може да се пребарува, освен ако човек рачно не ја означил секоја датотека.

ColQwen3 го менува тоа, овозможувајќи пронаоѓање кадар по кадар во сегментирани клипови.

Истакнат пример на примена: корпоративна мемориска банка

Секој ден, претпријатијата снимаат илјадници часови интерни видеосостаноци, а тие снимки најчесто исчезнуваат во заборав.

  • Работниот тек: Со автоматско делење на долгите снимки од состаноци на пократки, логички клипови и нивно индексирање со ColQwen3, создавате пребарлива „корпоративна меморија“.

  • Барањето: Проектен менаџер може да побара: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Резултатот: Наместо да врати видеодатотека од 60 минути, системот го пронаоѓа точниот сегмент од 45 секунди во кој конкретниот дијаграм бил прикажан и дискутиран, дури и ако говорниците во тој момент не го изговориле зборот „доцнење“.

Примени во претпријатијата: решавање проблеми со висока вредност

Преминот кон нативни мултимодални вградувања овозможува сосема нови работни текови во различни индустрии. Темелно го тестиравме овој модел во некои од најсложените околини со податоци во претпријатијата.

1. Истакнат реперен тест: урбанистичко советување и архитектура

Го тестиравме ColQwen3 со предизвиците со податоци на урбанистичките консултантски фирми, кои управуваат со огромни библиотеки од генерални планови, карти за зонирање и сложени архитектонски фасади.

  • Предизвикот: Во вакви околини, традиционалните RAG-процеси имаат тешкотии. Алатките за OCR обично ги опишуваат сложените ситуациски планови едноставно како „шема“, пропуштајќи клучни детали за сообраќајниот тек, зелените зони или оддалеченоста на објектите од границите.

  • Перформансите: Нашите интерни реперни тестови покажуваат дека ColQwen3 успешно ја отстранува потребата од скапа претходна обработка со OCR и генерирање описи. Во тестовите со архитектонски цртежи со многу детали, моделот успешно пронаоѓаше документи според конкретни визуелни ознаки, како пристапни точки за пешаци или јасни граници на зони, значително надминувајќи ги основните системи што користат само текст и ветувајќи драстично намалување на трошоците за внесување знаење.

2. Сложена финансиска и пазарна интелигенција

Инвестициските банкари и аналитичарите трошат илјадници часови прегледувајќи годишни извештаи и презентации за инвеститори.

  • Работниот тек: Аналитичар може да побара: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Промената: Наместо да се потпира на совпаѓање клучни зборови, моделот го пронаоѓа точниот слајд според визуелното присуство на конкретниот приказ на податоци, овозможувајќи му на RAG-системот многу прецизно да одговара на прашања.

3. Индустриско производство и теренско сервисирање

Производствените компании располагаат со огромни библиотеки од технички прирачници и цевководни и инструментални дијаграми (P&ID).

  • Работниот тек: Теренски инженер што поправа турбина може да фотографира дел или да побара: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Промената: ColQwen3 го препознава визуелниот приказ на електричната шема и ја пронаоѓа точната страница, со што потенцијално го скратува застојот за неколку часа.

4. Правни работи и усогласеност

Правното откривање опфаќа преглед на милиони скенирани страници, каде што „иглата во стогот сено“ често е визуелна ознака.

  • Работниот тек: Службеник за усогласеност може да пребарува “Documents signed by the CFO” или “Contracts containing the official ‘Confidential’ stamp.”

  • Промената: Моделот разликува нацрт од конечен документ според визуелното присуство на потписи или печати — нешто што обичниот OCR често го пропушта.

Започнете

ColQwen3 има отворени тежини (Apache 2.0) и веќе е достапен на Hugging Face. Го осмисливме како директна надградба за современите RAG-процеси, со потребниот код за извршување за веднаш да обработува текст, слики и видео.

За претпријатијата подготвени да го надминат едноставното пребарување текст и да ја отклучат интелигенцијата заробена во нивните визуелни ресурси, ова е новиот стандард.

Следен чекор: Разгледајте ја картичката на моделот и испробајте го демото во живо на Hugging Face: /-colqwen3-embed-8b и /-colqwen3-embed-4b

Автор

Xin Huang и Kye Min Tan