Fő navigáció

A szövegen túl: valódi multimodális, teljes folyamatot átfogó RAG

A multimodális beágyazási modellek segítségével a csapatok közvetlenül kereshetnek hasznos információkat összetett dokumentumokban, képekben és videókban.

Az elmúlt két évben a „RAG” (visszakereséssel kiegészített generálás) szinte kizárólag a szöveggel volt egyenértékű. A bevett módszer egyszerű: végy dokumentumokat, nyerd ki belőlük a szöveget, bontsd részekre, majd indexeld.

A vállalati világ azonban nem egyszerű szövegfájlokra épül. Összetett PDF-ekre, adatokkal zsúfolt diagramokat tartalmazó prezentációkra, CAD-rajzokra, beszkennelt számlákra és egyre inkább hatalmas videóarchívumokra épül.

Óriási szűk keresztmetszetet jelent az az iparági szabványeljárás, amely OCR-rel vagy vizuális LLM-ekkel szöveges leírást készít a képről a beágyazás előtt. Lassú, drága, és elkerülhetetlenül elveszíti az eredeti adatok gazdag térbeli és vizuális kontextusát. Ha az MI egy összetett ábrát egyszerűen „tervrajzként” ír le, többé nem lehet rákeresni a rajta szereplő konkrét szelepre vagy kapcsolási rajzra.

Ma élvonalbeli multimodális beágyazási modellek családját adjuk ki. A ColPali architektúrájára épülő modelleket e probléma megoldására terveztük, lehetővé téve a teljes folyamatot átfogó vizuális visszakeresést.

A varázslat mögötti mérnöki munka: fejlett finomhangolási stratégiák

Egy valóban hatékony multimodális visszakereső létrehozása nem olyan egyszerű, mint elővenni egy kész vizuális-nyelvi modellt (VLM), és megkérni, hogy keressen. A multimodális RAG fejlődését korábban hátráltató kihívások megoldásához és a ColQwen3 létrehozásához modellegyesítési és betanítási stratégiákat alkalmaztunk.

1. A beágyazási képesség átvitele hangolt egyesítési súlyozással

Ahelyett, hogy az alapmodellt a nulláról finomhangoltuk volna, olyan módszert dolgoztunk ki, amely egy meglévő szövegbeágyazási modellből viszi át a visszakeresési feladatok ismeretét. Egy szabványos VLM képes leírni a képeket, de nem feltétlenül tudja őket szemantikai alapon rangsorolni egy lekérdezéshez képest.

Ezt a hiányt hangolt egyesítési súlyozási stratégiákkal hidaltuk át. Kísérleteink szerint a Qwen3-Embedding szöveges látens térben meglévő visszakeresési képessége közvetlenül átvihető a multimodális térbe, és azonnali betanítás nélkül is általánosítható kép- és videó-visszakeresésre. Ezt a hatékony inicializálást erős kiindulópontként használva tovább finomhangoltuk a modellt a teljesítmény optimalizálása és a robusztusság biztosítása érdekében. Ez jobb végső visszakeresési teljesítményt eredményez, mint a Qwen3-VL alapmodellből kiinduló finomhangolás.

2. A hiperparaméterek gondos hangolása

A beágyazási képességek átvitele után az összehangolásra összpontosítottunk. A visszakeresési teljesítmény maximalizálása érdekében gondos hiperparaméter-kereséseket és ablációs vizsgálatokat végeztünk, többek között az epochok optimális számára, a kötegméretre, a tanulási rátára, a LoRA-rangra és az adatkészletek összetételére vonatkozóan.

Finomhangolási adatkészleteinknek a VDR, a ColPali train set, a visrag_syn, és a visrag_ind adatkészleteket választottuk. A finomhangoláshoz UniMax-mintavételezést használtunk. Mivel modellegyesítést alkalmaztunk, és az egyesített alapmodell már részben örökölte a multimodális visszakeresési képességet, azt tapasztaltuk, hogy több adatkészlet bevonása enyhén rontaná a teljesítményt, ezért nem bővítettük tovább a készletek körét.

A finomhangoláshoz a következő hiperparamétereket választottuk:

LoRA-rang

32

LoRA-alfa

32

LoRA-célmodulok

a beágyazási réteg kivételével az összes kép- és szövegréteg

Tanulási ráta

5e-5

Vizuális tokenek maximális száma

1280

Betanítási epochok

1

Globális kötegméret

512

Bemelegítési arány

5%

3. A „ColBERT” dilemma: nagy teljesítmény vagy alacsony tárolási költség

A „ColBERT-stílusú”, tokenszintű beágyazásokat használó modellek – például a ColPali – hagyományosan kimagasló teljesítményt kínáltak, de megfizethetetlen tárolási költséggel. Minden vizuális token indexelése hatalmas vektoradatbázisokat hozott létre, amelyek vállalati léptékben túl költségesek voltak.

  • Az optimalizálási stratégia: A tárolási kihívást a beágyazások méretének gondos kiegyensúlyozásával kezeltük, hogy a lehető legjobb teljesítmény megőrzése mellett elkerüljük a tárolási költségek elszabadulását. A legkorszerűbb pontosság és a hatékony méret megőrzéséhez 320-as dimenziószámot választottunk, amely a legjobb egyensúlyt nyújtja a visszakeresési teljesítmény és a tárolási költség között.

    • Alapmegoldás: Egy szabványos megközelítésnek – például az NVIDIA Nemo-3B-nek – körülbelül 10,3 TB tárhelyre van szüksége 1 millió kép beágyazásainak tárolásához (1 802 token, 3 072 dimenzióval).

    • ColQwen3: Ugyanezt az 1 millió képet mindössze 0,82 TB-on tárolja (legfeljebb 1 280 token, 320 dimenzióval).

A ColQwen3 élvonalbeli visszakeresési pontosságot ér el anélkül, hogy felemésztené a felhő-infrastruktúrára szánt költségvetést.

Értékelési eredmények

Módszerünket a ViDoRe benchmarkcsomagon validáltuk. Az eredmények megerősítik, hogy a ColQwen3 új mércét állít a legújabb V3 és V2 benchmarkokon – angol és többnyelvű változatban egyaránt –, miközben a korábbi V1-feladatokon is élvonalbeli teljesítményt nyújt.

ViDoRe v3 (legújabb)

A ColQwen3-8B vezet az angol és a többnyelvű visszakeresésben.

Angol nDCG@5

Modell

Informatika

Energetika

Pénzügy

HR

Ipar

Gyógyszeripar

Fizika

Átlag

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Többnyelvű nDCG@5

Modell

Informatika

Energetika

Pénzügy

HR

Ipar

Gyógyszeripar

Fizika

Átlag

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

A ViDoRe v2 és v1 legfontosabb eredményei

Egyenletesen magas teljesítmény az ESG, a közgazdaságtan és a DocVQA terén.

Benchmark

Modell

Pontszám (átlag)

Kiemelkedő eredmény

ViDoRe V2 (angol)

ColQwen3-8B

0.6772

1. hely ESG és BioMed terén

ViDoRe V2 (többnyelvű)

ColQwen3-8B

0.6085

1. hely közgazdaságtanból

ViDoRe V1 (angol)

Nemo ColEmbed 3B

0.9100

Kissé magasabb átlag

ViDoRe V1 (angol)

ColQwen3-8B

0.9076

1. hely ArxivQA és Syn-Gov terén

Videó-visszakeresés: CareBench-értékelés

Annak igazolására, hogy a ColQwen3 videó-visszakeresésre is kiválóan általánosít, a modelleket a szövegből videót kereső általános visszakeresési feladatok CareBench benchmarkján értékeltük.

Az értékeléshez nyers videókódolást alkalmaztunk: modelljeink közvetlenül kódolták a videófájlokat, további szöveges megjegyzések vagy metaadatok nélkül. Ez jól mutatja, hogy a modell kizárólag vizuális szemantika alapján is képes visszakeresni.

Modell

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

A „sötét adatok” felszabadítása: a videó mint új élvonal

A ColQwen3 által lehetővé tett egyik legmélyrehatóbb változás, hogy a videókat ugyanúgy képes kezelni, mint a dokumentumokat. Sok vállalatnál a videó „sötét adat”: ritkán használt tárhelyen pihen, és egyáltalán nem kereshető, hacsak valaki kézzel fel nem címkézett minden fájlt.

A ColQwen3 ezen úgy változtat, hogy a szegmentált klipek képkockánként is visszakereshetők.

Kiemelt felhasználási eset: a vállalati emlékezet

A vállalatok naponta több ezer órányi belső videóértekezletet rögzítenek, ám ezek a felvételek rendszerint nyomtalanul eltűnnek.

  • A munkafolyamat: A hosszú értekezlet-felvételek automatikusan rövidebb, logikai egységekre bontásával és ColQwen3-mal történő indexelésével kereshető „vállalati emlékezet” hozható létre.

  • A lekérdezés: Egy projektmenedzser megkérdezheti: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Az eredmény: A rendszer nem egy 60 perces videófájlt ad vissza, hanem pontosan azt a 45 másodperces részletet, amelyben az adott diagram megjelent a képernyőn, és megvitatták – még akkor is, ha a beszélők abban a pillanatban nem mondták ki kifejezetten a „latency” szót.

Vállalati felhasználási esetek: nagy értékű problémák megoldása

A natív multimodális beágyazásra való átállás teljesen új munkafolyamatokat tesz lehetővé az iparágak széles körében. A modellt a legösszetettebb vállalati adatkörnyezetek némelyikén is alaposan teszteltük.

1. Kiemelt benchmark: várostervezési tanácsadás és építészet

A ColQwen3-at olyan adatkezelési kihívásokon teszteltük, amelyekkel a rendezési terveket, övezeti térképeket és összetett építészeti homlokzatrajzokat tömegesen kezelő várostervezési tanácsadó cégek szembesülnek.

  • A kihívás: Ezekben a környezetekben a hagyományos RAG-folyamatok nehezen boldogulnak. Az OCR-eszközök az összetett helyszínrajzokat jellemzően egyszerűen „vázlatként” írják le, így elsikkadnak a forgalomáramlásra, zöldterületekre vagy építési határvonalakra vonatkozó fontos részletek.

  • A teljesítmény: Belső benchmarkjaink azt mutatják, hogy a ColQwen3 hatékonyan kiváltja a költséges OCR-es és képleíró előfeldolgozást. A nagy információsűrűségű építészeti rajzokon végzett tesztekben a modell sikeresen keresett vissza dokumentumokat konkrét vizuális jelölések – például gyalogos bejáratok vagy jól elkülönülő övezethatárok – alapján. Ezzel jelentősen felülmúlta a kizárólag szöveges alapmegoldásokat, miközben az ismeretek betöltési költségének drasztikus csökkentését ígéri.

2. Összetett pénzügyi és piaci információelemzés

A befektetési bankárok és elemzők több ezer órát töltenek éves jelentések és befektetői prezentációk átvizsgálásával.

  • A munkafolyamat: Egy elemző megkérdezheti: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • A változás: A kulcsszóegyezések helyett a modell az adott adatvizualizáció vizuális jelenléte alapján keresi vissza a pontos diát, így a RAG-rendszer nagy pontossággal válaszolhat a kérdésekre.

3. Ipari gyártás és helyszíni szerviz

A gyártóvállalatok műszaki kézikönyvek és csővezeték-műszerezési rajzok (P&ID-k) hatalmas gyűjteményeivel rendelkeznek.

  • A munkafolyamat: Egy turbinát javító helyszíni mérnök lefényképezhet egy alkatrészt, vagy megkérdezheti: “Show me the wiring diagram for the hydraulic pump assembly.”

  • A változás: A ColQwen3 felismeri a kapcsolási rajz vizuális megjelenítését, és visszakeresi a megfelelő oldalt, amivel akár órákkal csökkentheti az állásidőt.

4. Jogi és megfelelőségi terület

A jogi dokumentumfeltárás során több millió beszkennelt oldalt kell átvizsgálni, ahol a keresett „tű a szénakazalban” gyakran egy vizuális jelölés.

  • A munkafolyamat: Egy megfelelőségi szakember rákereshet a következőkre: “Documents signed by the CFO” vagy “Contracts containing the official ‘Confidential’ stamp.”

  • A változás: A modell az aláírások vagy bélyegzők vizuális jelenléte alapján megkülönbözteti a tervezetet a végleges dokumentumtól – ezt a pusztán OCR-alapú módszerek gyakran nem érzékelik.

Első lépések

A ColQwen3 nyílt súlyokkal (Apache 2.0 alatt) már elérhető a Hugging Face-en. Úgy terveztük, hogy a modern RAG-folyamatok közvetlenül beilleszthető frissítése legyen, és biztosítsa a szöveg, a képek és a videók azonnali feldolgozásához szükséges inferenciakódot.

Ez az új szabvány azoknak a vállalatoknak, amelyek készek túllépni az egyszerű szöveges keresésen, és kiaknázni a vizuális eszközeikben rejlő intelligenciát.

Következő lépés: Tekintse meg a modellkártyát, és próbálja ki az élő demót a Hugging Face-en: /-colqwen3-embed-8b és /-colqwen3-embed-4b

Szerző

Xin Huang és Kye Min Tan