Hlavní navigace

Za hranice textu: skutečně multimodální RAG od začátku do konce

Multimodální embeddingové modely pomáhají týmům vyhledávat užitečné informace přímo ve složitých dokumentech, obrázcích a videích.

Poslední dva roky bylo „RAG“ (generování rozšířené o vyhledávání) téměř výhradně spojováno s textem. Standardní postup je jednoduchý: vzít dokumenty, extrahovat text, rozdělit ho na části a indexovat.

Podnikový svět ale nestojí na prostých textových souborech. Stojí na složitých PDF, prezentacích s hutnými grafy, výkresech CAD, naskenovaných fakturách a stále častěji i na rozsáhlých archivech videozáznamů.

Oborový standard, který před vytvořením embeddingu převádí obraz na text pomocí OCR nebo vizuálních LLM, představuje zásadní úzké hrdlo. Je pomalý, nákladný a nevyhnutelně ztrácí bohatý prostorový a vizuální kontext původních dat. Pokud vaše AI popíše složitý vizuální obsah pouze jako „technický výkres“, ztratíte možnost vyhledat v něm konkrétní ventil nebo schéma zapojení.

Dnes vydáváme rodinu špičkových multimodálních embeddingových modelů, které vycházejí z architektury ColPali a tento problém řeší prostřednictvím komplexního vizuálního vyhledávání.

Technologie v pozadí: pokročilé strategie dolaďování

Vytvořit skutečně účinný multimodální vyhledávací systém není tak snadné jako vzít běžně dostupný vizuálně-jazykový model (VLM) a požádat ho, aby vyhledával. Abychom překonali problémy, které historicky brzdily multimodální RAG, a vytvořili ColQwen3, využili jsme strategie slučování a trénování modelů.

1. Přenos schopnosti vytvářet embeddingy pomocí vyladěného sloučeného vážení

Místo dolaďování základního modelu od začátku jsme vyvinuli metodu, která přenáší znalosti o vyhledávacích úlohách z existujícího textového embeddingového modelu. Standardní VLM umí popisovat obrázky, ale nemusí je umět sémanticky seřadit podle relevance k dotazu.

Tuto mezeru jsme překlenuli pomocí strategií vyladěného sloučeného vážení. V experimentech jsme zjistili, že vyhledávací schopnost modelu Qwen3-Embedding v latentním textovém prostoru lze přímo přenést do multimodálního prostoru. Model tak dokáže zobecnit na vyhledávání obrázků a videí i bez bezprostředního trénování. Tuto účinnou inicializaci jsme využili jako pevný výchozí bod a model následně doladili, abychom dále optimalizovali výkon a zajistili jeho robustnost. Oproti dolaďování ze základního modelu Qwen3-VL se tím zlepšuje výsledný výkon vyhledávání.

2. Pečlivé ladění hyperparametrů

Po přenosu schopnosti vytvářet embeddingy jsme se zaměřili na sladění. Provedli jsme důkladné hledání hyperparametrů a ablační studie, které zahrnovaly optimální počet epoch, velikost dávky, rychlost učení, hodnost LoRA a skladbu datových sad, abychom maximalizovali výkon vyhledávání.

Pro dolaďování jsme zvolili datové sady VDR, trénovací sadu ColPali, visrag_syn, a visrag_ind. Při dolaďování jsme použili vzorkování UniMax. Protože jsme použili slučování modelů a sloučený základní model již částečně zdědil schopnost multimodálního vyhledávání, zjistili jsme, že přidání dalších datových sad by výkon mírně zhoršilo. Jejich počet jsme proto dále nezvyšovali.

Pro dolaďování jsme zvolili následující hyperparametry:

Hodnost LoRA

32

Alfa LoRA

32

Cílové moduly LoRA

všechny vrstvy obrazu i textu kromě embeddingu

Rychlost učení

5e-5

Maximální počet vizuálních tokenů

1280

Trénovací epochy

1

Globální velikost dávky

512

Podíl zahřívací fáze

5%

3. Dilema „ColBERT“: vysoký výkon versus náklady na úložiště

Modely využívající embeddingy na úrovni tokenů ve stylu „ColBERT“ (například ColPali) historicky nabízely mimořádný výkon, ale za neúnosnou cenu úložiště. Indexování každého vizuálního tokenu vytvářelo obrovské vektorové databáze, které byly v podnikovém měřítku příliš nákladné.

  • Strategie optimalizace: Problém s úložištěm jsme vyřešili pečlivým vyvážením velikosti embeddingů tak, abychom zachovali maximální výkon a zabránili prudkému růstu nákladů. Abychom při této úsporné velikosti zachovali špičkovou přesnost, zvolili jsme rozměr 320, který nabízí nejlepší rovnováhu mezi výkonem vyhledávání a náklady na úložiště.

    • Výchozí řešení: Standardní přístup (například NVIDIA Nemo-3B) vyžaduje k uložení embeddingů 1 milionu obrázků přibližně 10,3 TB (1 802 tokenů × 3 072 rozměrů).

    • ColQwen3: Uloží stejný 1 milion obrázků do pouhých 0,82 TB (max. 1 280 tokenů × 320 rozměrů).

ColQwen3 dosahuje špičkové přesnosti vyhledávání bez neúměrného navyšování rozpočtu na cloudovou infrastrukturu.

Výsledky hodnocení

Náš přístup jsme ověřili na sadě benchmarků ViDoRe. Výsledky potvrzují, že ColQwen3 nastavuje nové standardy v nejnovějších benchmarcích V3 a V2 (anglických i vícejazyčných) a zároveň si udržuje špičkový výkon ve starších úlohách V1.

ViDoRe v3 (nejnovější)

ColQwen3-8B vede ve vyhledávání v angličtině i ve více jazycích.

Angličtina nDCG@5

Model

Informatika

Energetika

Finance

HR

Průmysl

Farmacie

Fyzika

Průměr

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Vícejazyčné nDCG@5

Model

Informatika

Energetika

Finance

HR

Průmysl

Farmacie

Fyzika

Průměr

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Nejdůležitější výsledky ViDoRe v2 a v1

Stabilně vysoký výkon v ESG, ekonomii a DocVQA.

Benchmark

Model

Skóre (průměr)

Významné prvenství

ViDoRe V2 (angličtina)

ColQwen3-8B

0.6772

1. místo v ESG & BioMed

ViDoRe V2 (vícejazyčné)

ColQwen3-8B

0.6085

1. místo v ekonomii

ViDoRe V1 (angličtina)

Nemo ColEmbed 3B

0.9100

Mírně vyšší průměr

ViDoRe V1 (angličtina)

ColQwen3-8B

0.9076

1. místo v ArxivQA & Syn-Gov

Vyhledávání ve videu: hodnocení CareBench

Abychom prokázali, že ColQwen3 dobře zobecňuje i na vyhledávání ve videu, vyhodnotili jsme modely v benchmarku CareBench pro úlohy vyhledávání videa podle textu (General Retrieval).

Při tomto hodnocení jsme použili přímé kódování videa: naše modely kódovaly videosoubory přímo, bez dalších textových anotací či vstupních metadat. To ukazuje schopnost modelu vyhledávat čistě na základě vizuální sémantiky.

Model

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Zpřístupnění „temných dat“: průkopnické možnosti videa

Jednou z nejzásadnějších změn, které ColQwen3 přináší, je možnost pracovat s videem stejně jako s dokumenty. V mnoha podnicích představuje video „temná data“. Leží v chladném úložišti a nelze v něm vyhledávat, pokud někdo ručně neoznačil každý soubor.

ColQwen3 to mění díky vyhledávání po jednotlivých snímcích v rozdělených klipech.

Ukázkový scénář: firemní paměťová banka

Podniky každý den zaznamenávají tisíce hodin interních videoporad a tyto záznamy obvykle zapadnou.

  • Postup: Automatickým rozdělením dlouhých záznamů porad na kratší logické klipy a jejich indexováním pomocí ColQwen3 vytvoříte prohledávatelnou „firemní paměť“.

  • Dotaz: Projektový manažer může zadat: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Výsledek: Namísto 60minutového videosouboru systém vyhledá přesný 45sekundový úsek, v němž byl daný diagram zobrazen a probírán, i když mluvčí právě v tu chvíli výslovně nepoužili slovo „latency“.

Podnikové scénáře: řešení problémů s vysokou hodnotou

Přechod k nativním multimodálním embeddingům otevírá napříč odvětvími zcela nové pracovní postupy. Tento model jsme důkladně otestovali v některých z nejsložitějších podnikových datových prostředí.

1. Výsledky benchmarku: urbanistické poradenství a architektura

ColQwen3 jsme testovali na datových výzvách urbanistických poradenských firem, které spravují rozsáhlé knihovny územních plánů, map zónování a složitých architektonických pohledů.

  • Výzva: Tradiční RAG kanály mají v těchto prostředích potíže. Nástroje OCR obvykle označí složité situační plány pouze jako „schéma“, a přehlédnou tak zásadní detaily o dopravních tocích, zelených zónách nebo odstupech budov.

  • Výkon: Naše interní benchmarky ukazují, že ColQwen3 účinně odstraňuje potřebu nákladného předzpracování pomocí OCR a generování popisků. V testech s velmi podrobnými architektonickými výkresy model úspěšně vyhledával dokumenty podle konkrétních vizuálních prvků, jako jsou vstupy pro pěší nebo zřetelné hranice zón. Výrazně tak překonal čistě textová výchozí řešení a zároveň slibuje výrazné snížení nákladů na zpracování znalostí.

2. Komplexní finanční a tržní zpravodajství

Investiční bankéři a analytici tráví tisíce hodin procházením výročních zpráv a prezentací pro investory.

  • Postup: Analytik může zadat: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Změna: Model se nespoléhá na shodu klíčových slov, ale vyhledá přesný snímek podle vizuální přítomnosti konkrétní datové vizualizace. Systém RAG tak může odpovídat s vysokou přesností.

3. Průmyslová výroba a terénní servis

Výrobní podniky vlastní rozsáhlé knihovny technických příruček a potrubních a přístrojových schémat (P&ID).

  • Postup: Technik opravující turbínu může vyfotit součástku nebo zadat: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Změna: ColQwen3 rozpozná vizuální podobu schématu zapojení a vyhledá správnou stránku, čímž může zkrátit odstávku o celé hodiny.

4. Právo a dodržování předpisů

Právní prověrky zahrnují kontrolu milionů naskenovaných stran, kde hledanou „jehlou v kupce sena“ často bývá vizuální prvek.

  • Postup: Pracovník odpovědný za dodržování předpisů může vyhledat “Documents signed by the CFO” nebo “Contracts containing the official ‘Confidential’ stamp.”

  • Změna: Model podle vizuální přítomnosti podpisů či razítek rozliší návrh od finálního dokumentu, což čistě textové OCR často nedokáže.

Začínáme

ColQwen3 má otevřené váhy (Apache 2.0) a je nyní k dispozici na Hugging Face. Navrhli jsme jej jako snadno nasaditelné vylepšení moderních RAG kanálů a poskytujeme inferenční kód potřebný k okamžitému zpracování textu, obrázků a videa.

Pro podniky, které chtějí překonat možnosti jednoduchého textového vyhledávání a zpřístupnit znalosti ukryté ve vizuálních materiálech, jde o nový standard.

Další krok: Prozkoumejte kartu modelu a vyzkoušejte živou ukázku na Hugging Face: /-colqwen3-embed-8b a /-colqwen3-embed-4b

Autor

Xin Huang, Kye Min Tan