Az elmúlt két évben a „RAG” (visszakereséssel kiegészített generálás) szinte kizárólag a szöveggel volt egyenértékű. A bevett módszer egyszerű: végy dokumentumokat, nyerd ki belőlük a szöveget, bontsd részekre, majd indexeld.
A vállalati világ azonban nem egyszerű szövegfájlokra épül. Összetett PDF-ekre, adatokkal zsúfolt diagramokat tartalmazó prezentációkra, CAD-rajzokra, beszkennelt számlákra és egyre inkább hatalmas videóarchívumokra épül.
Óriási szűk keresztmetszetet jelent az az iparági szabványeljárás, amely OCR-rel vagy vizuális LLM-ekkel szöveges leírást készít a képről a beágyazás előtt. Lassú, drága, és elkerülhetetlenül elveszíti az eredeti adatok gazdag térbeli és vizuális kontextusát. Ha az MI egy összetett ábrát egyszerűen „tervrajzként” ír le, többé nem lehet rákeresni a rajta szereplő konkrét szelepre vagy kapcsolási rajzra.
Ma élvonalbeli multimodális beágyazási modellek családját adjuk ki. A ColPali architektúrájára épülő modelleket e probléma megoldására terveztük, lehetővé téve a teljes folyamatot átfogó vizuális visszakeresést.
Egy valóban hatékony multimodális visszakereső létrehozása nem olyan egyszerű, mint elővenni egy kész vizuális-nyelvi modellt (VLM), és megkérni, hogy keressen. A multimodális RAG fejlődését korábban hátráltató kihívások megoldásához és a ColQwen3 létrehozásához modellegyesítési és betanítási stratégiákat alkalmaztunk.
Ahelyett, hogy az alapmodellt a nulláról finomhangoltuk volna, olyan módszert dolgoztunk ki, amely egy meglévő szövegbeágyazási modellből viszi át a visszakeresési feladatok ismeretét. Egy szabványos VLM képes leírni a képeket, de nem feltétlenül tudja őket szemantikai alapon rangsorolni egy lekérdezéshez képest.
Ezt a hiányt hangolt egyesítési súlyozási stratégiákkal hidaltuk át. Kísérleteink szerint a Qwen3-Embedding szöveges látens térben meglévő visszakeresési képessége közvetlenül átvihető a multimodális térbe, és azonnali betanítás nélkül is általánosítható kép- és videó-visszakeresésre. Ezt a hatékony inicializálást erős kiindulópontként használva tovább finomhangoltuk a modellt a teljesítmény optimalizálása és a robusztusság biztosítása érdekében. Ez jobb végső visszakeresési teljesítményt eredményez, mint a Qwen3-VL alapmodellből kiinduló finomhangolás.
A beágyazási képességek átvitele után az összehangolásra összpontosítottunk. A visszakeresési teljesítmény maximalizálása érdekében gondos hiperparaméter-kereséseket és ablációs vizsgálatokat végeztünk, többek között az epochok optimális számára, a kötegméretre, a tanulási rátára, a LoRA-rangra és az adatkészletek összetételére vonatkozóan.
Finomhangolási adatkészleteinknek a VDR, a ColPali train set, a visrag_syn, és a visrag_ind adatkészleteket választottuk. A finomhangoláshoz UniMax-mintavételezést használtunk. Mivel modellegyesítést alkalmaztunk, és az egyesített alapmodell már részben örökölte a multimodális visszakeresési képességet, azt tapasztaltuk, hogy több adatkészlet bevonása enyhén rontaná a teljesítményt, ezért nem bővítettük tovább a készletek körét.
A finomhangoláshoz a következő hiperparamétereket választottuk:
LoRA-rang | 32 |
LoRA-alfa | 32 |
LoRA-célmodulok | a beágyazási réteg kivételével az összes kép- és szövegréteg |
Tanulási ráta | 5e-5 |
Vizuális tokenek maximális száma | 1280 |
Betanítási epochok | 1 |
Globális kötegméret | 512 |
Bemelegítési arány | 5% |
A „ColBERT-stílusú”, tokenszintű beágyazásokat használó modellek – például a ColPali – hagyományosan kimagasló teljesítményt kínáltak, de megfizethetetlen tárolási költséggel. Minden vizuális token indexelése hatalmas vektoradatbázisokat hozott létre, amelyek vállalati léptékben túl költségesek voltak.
Az optimalizálási stratégia: A tárolási kihívást a beágyazások méretének gondos kiegyensúlyozásával kezeltük, hogy a lehető legjobb teljesítmény megőrzése mellett elkerüljük a tárolási költségek elszabadulását. A legkorszerűbb pontosság és a hatékony méret megőrzéséhez 320-as dimenziószámot választottunk, amely a legjobb egyensúlyt nyújtja a visszakeresési teljesítmény és a tárolási költség között.
Alapmegoldás: Egy szabványos megközelítésnek – például az NVIDIA Nemo-3B-nek – körülbelül 10,3 TB tárhelyre van szüksége 1 millió kép beágyazásainak tárolásához (1 802 token, 3 072 dimenzióval).
ColQwen3: Ugyanezt az 1 millió képet mindössze 0,82 TB-on tárolja (legfeljebb 1 280 token, 320 dimenzióval).
A ColQwen3 élvonalbeli visszakeresési pontosságot ér el anélkül, hogy felemésztené a felhő-infrastruktúrára szánt költségvetést.
Módszerünket a ViDoRe benchmarkcsomagon validáltuk. Az eredmények megerősítik, hogy a ColQwen3 új mércét állít a legújabb V3 és V2 benchmarkokon – angol és többnyelvű változatban egyaránt –, miközben a korábbi V1-feladatokon is élvonalbeli teljesítményt nyújt.
A ColQwen3-8B vezet az angol és a többnyelvű visszakeresésben.
Angol nDCG@5
Modell | Informatika | Energetika | Pénzügy | HR | Ipar | Gyógyszeripar | Fizika | Átlag |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Többnyelvű nDCG@5
Modell | Informatika | Energetika | Pénzügy | HR | Ipar | Gyógyszeripar | Fizika | Átlag |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Egyenletesen magas teljesítmény az ESG, a közgazdaságtan és a DocVQA terén.
Benchmark | Modell | Pontszám (átlag) | Kiemelkedő eredmény |
ViDoRe V2 (angol) | ColQwen3-8B | 0.6772 | 1. hely ESG és BioMed terén |
ViDoRe V2 (többnyelvű) | ColQwen3-8B | 0.6085 | 1. hely közgazdaságtanból |
ViDoRe V1 (angol) | Nemo ColEmbed 3B | 0.9100 | Kissé magasabb átlag |
ViDoRe V1 (angol) | ColQwen3-8B | 0.9076 | 1. hely ArxivQA és Syn-Gov terén |
Annak igazolására, hogy a ColQwen3 videó-visszakeresésre is kiválóan általánosít, a modelleket a szövegből videót kereső általános visszakeresési feladatok CareBench benchmarkján értékeltük.
Az értékeléshez nyers videókódolást alkalmaztunk: modelljeink közvetlenül kódolták a videófájlokat, további szöveges megjegyzések vagy metaadatok nélkül. Ez jól mutatja, hogy a modell kizárólag vizuális szemantika alapján is képes visszakeresni.
Modell | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
A ColQwen3 által lehetővé tett egyik legmélyrehatóbb változás, hogy a videókat ugyanúgy képes kezelni, mint a dokumentumokat. Sok vállalatnál a videó „sötét adat”: ritkán használt tárhelyen pihen, és egyáltalán nem kereshető, hacsak valaki kézzel fel nem címkézett minden fájlt.
A ColQwen3 ezen úgy változtat, hogy a szegmentált klipek képkockánként is visszakereshetők.
A vállalatok naponta több ezer órányi belső videóértekezletet rögzítenek, ám ezek a felvételek rendszerint nyomtalanul eltűnnek.
A munkafolyamat: A hosszú értekezlet-felvételek automatikusan rövidebb, logikai egységekre bontásával és ColQwen3-mal történő indexelésével kereshető „vállalati emlékezet” hozható létre.
A lekérdezés: Egy projektmenedzser megkérdezheti: “Show me the clip where the engineering lead explained the latency issue with the API.”
Az eredmény: A rendszer nem egy 60 perces videófájlt ad vissza, hanem pontosan azt a 45 másodperces részletet, amelyben az adott diagram megjelent a képernyőn, és megvitatták – még akkor is, ha a beszélők abban a pillanatban nem mondták ki kifejezetten a „latency” szót.
A natív multimodális beágyazásra való átállás teljesen új munkafolyamatokat tesz lehetővé az iparágak széles körében. A modellt a legösszetettebb vállalati adatkörnyezetek némelyikén is alaposan teszteltük.
A ColQwen3-at olyan adatkezelési kihívásokon teszteltük, amelyekkel a rendezési terveket, övezeti térképeket és összetett építészeti homlokzatrajzokat tömegesen kezelő várostervezési tanácsadó cégek szembesülnek.
A kihívás: Ezekben a környezetekben a hagyományos RAG-folyamatok nehezen boldogulnak. Az OCR-eszközök az összetett helyszínrajzokat jellemzően egyszerűen „vázlatként” írják le, így elsikkadnak a forgalomáramlásra, zöldterületekre vagy építési határvonalakra vonatkozó fontos részletek.
A teljesítmény: Belső benchmarkjaink azt mutatják, hogy a ColQwen3 hatékonyan kiváltja a költséges OCR-es és képleíró előfeldolgozást. A nagy információsűrűségű építészeti rajzokon végzett tesztekben a modell sikeresen keresett vissza dokumentumokat konkrét vizuális jelölések – például gyalogos bejáratok vagy jól elkülönülő övezethatárok – alapján. Ezzel jelentősen felülmúlta a kizárólag szöveges alapmegoldásokat, miközben az ismeretek betöltési költségének drasztikus csökkentését ígéri.
A befektetési bankárok és elemzők több ezer órát töltenek éves jelentések és befektetői prezentációk átvizsgálásával.
A munkafolyamat: Egy elemző megkérdezheti: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
A változás: A kulcsszóegyezések helyett a modell az adott adatvizualizáció vizuális jelenléte alapján keresi vissza a pontos diát, így a RAG-rendszer nagy pontossággal válaszolhat a kérdésekre.
A gyártóvállalatok műszaki kézikönyvek és csővezeték-műszerezési rajzok (P&ID-k) hatalmas gyűjteményeivel rendelkeznek.
A munkafolyamat: Egy turbinát javító helyszíni mérnök lefényképezhet egy alkatrészt, vagy megkérdezheti: “Show me the wiring diagram for the hydraulic pump assembly.”
A változás: A ColQwen3 felismeri a kapcsolási rajz vizuális megjelenítését, és visszakeresi a megfelelő oldalt, amivel akár órákkal csökkentheti az állásidőt.
A jogi dokumentumfeltárás során több millió beszkennelt oldalt kell átvizsgálni, ahol a keresett „tű a szénakazalban” gyakran egy vizuális jelölés.
A munkafolyamat: Egy megfelelőségi szakember rákereshet a következőkre: “Documents signed by the CFO” vagy “Contracts containing the official ‘Confidential’ stamp.”
A változás: A modell az aláírások vagy bélyegzők vizuális jelenléte alapján megkülönbözteti a tervezetet a végleges dokumentumtól – ezt a pusztán OCR-alapú módszerek gyakran nem érzékelik.
A ColQwen3 nyílt súlyokkal (Apache 2.0 alatt) már elérhető a Hugging Face-en. Úgy terveztük, hogy a modern RAG-folyamatok közvetlenül beilleszthető frissítése legyen, és biztosítsa a szöveg, a képek és a videók azonnali feldolgozásához szükséges inferenciakódot.
Ez az új szabvány azoknak a vállalatoknak, amelyek készek túllépni az egyszerű szöveges keresésen, és kiaknázni a vizuális eszközeikben rejlő intelligenciát.
Következő lépés: Tekintse meg a modellkártyát, és próbálja ki az élő demót a Hugging Face-en: /-colqwen3-embed-8b és /-colqwen3-embed-4b