Hlavná navigácia

Viac než text: skutočne multimodálne a komplexné RAG

Multimodálne embeddingové modely pomáhajú tímom získavať užitočné informácie priamo zo zložitých dokumentov, obrázkov a videí.

Posledné dva roky bolo „RAG“ (generovanie rozšírené o vyhľadávanie) takmer výlučne synonymom textu. Štandardný postup je jednoduchý: vezmete dokumenty, extrahujete text, rozdelíte ho na časti a zaindexujete.

Podnikový svet však nefunguje na obyčajných textových súboroch. Funguje na zložitých súboroch PDF, prezentáciách s množstvom grafov, výkresoch CAD, naskenovaných faktúrach a čoraz častejšie aj na obrovských archívoch videozáznamov.

Odvetvový štandard, pri ktorom sa obraz pred vytvorením embeddingu pomocou OCR alebo vizuálnych LLM „opíše“ textom, predstavuje obrovské úzke miesto. Je pomalý, drahý a nevyhnutne stráca bohatý priestorový a vizuálny kontext pôvodných dát. Ak vaša AI opíše zložitý vizuál iba ako „technický výkres“, stratíte možnosť vyhľadať v ňom konkrétny ventil alebo schému zapojenia.

Dnes vydávame rodinu špičkových multimodálnych embeddingových modelov založených na architektúre ColPali. Tento problém riešia tým, že umožňujú komplexné vizuálne vyhľadávanie.

Technológia v pozadí: pokročilé stratégie dolaďovania

Vytvoriť skutočne účinný multimodálny vyhľadávací systém nie je také jednoduché ako vziať hotový vizuálno-jazykový model (VLM) a požiadať ho, aby vyhľadával. Pri tvorbe ColQwen3 sme na prekonanie problémov, ktoré v minulosti brzdili multimodálne RAG, použili stratégie zlučovania a trénovania modelov.

1. Prenos schopnosti vytvárať embeddingy pomocou vyladeného váženia pri zlučovaní

Namiesto dolaďovania základného modelu od začiatku sme navrhli metódu na prenos znalostí o úlohách vyhľadávania z existujúceho textového embeddingového modelu. Bežný VLM dokáže opisovať obrázky, no nemusí ich vedieť sémanticky zoradiť podľa relevantnosti k dotazu.

Túto medzeru sme preklenuli pomocou stratégií vyladeného váženia pri zlučovaní. V experimentoch sme zistili, že schopnosť Qwen3-Embedding vyhľadávať v textovom latentnom priestore možno priamo preniesť do multimodálneho priestoru a zovšeobecniť na vyhľadávanie obrázkov a videí aj bez okamžitého trénovania. Túto účinnú inicializáciu sme využili ako pevný základ a model následne doladili, aby sme ďalej optimalizovali výkon a zaistili robustnosť. V porovnaní s dolaďovaním základného modelu Qwen3-VL to zlepšuje výsledný výkon vyhľadávania.

2. Dôkladné ladenie hyperparametrov

Po prenose schopností vytvárať embeddingy sme sa zamerali na zarovnanie. Vykonali sme dôkladné prehľadávanie hyperparametrov a ablačné štúdie, ktoré zahŕňali optimálny počet epoch, veľkosť dávky, rýchlosť učenia, hodnosť LoRA a kombináciu dátových množín, aby sme maximalizovali výkon vyhľadávania.

Ako dátové množiny na dolaďovanie sme vybrali VDR, trénovaciu množinu ColPali, visrag_syn, a visrag_ind. Pri dolaďovaní sme použili vzorkovanie UniMax. Keďže sme použili zlučovanie modelov a zlúčený základný model už čiastočne zdedil multimodálne schopnosti vyhľadávania, zistili sme, že pridanie ďalších dátových množín by výkon mierne zhoršilo. Ich počet sme preto nezvyšovali.

Na dolaďovanie sme vybrali tieto hyperparametre:

Hodnosť LoRA

32

Alfa LoRA

32

Cieľové moduly LoRA

všetky obrazové aj textové vrstvy okrem embeddingovej

Rýchlosť učenia

5e-5

Max. počet vizuálnych tokenov

1280

Epochy trénovania

1

Globálna veľkosť dávky

512

Pomer zahrievania

5%

3. Dilema „ColBERT“: vysoký výkon verzus náklady na úložisko

Modely používajúce embeddingy na úrovni tokenov „v štýle ColBERT“ (napríklad ColPali) historicky ponúkali výnimočný výkon, ale za neúnosnú cenu úložiska. Indexovanie každého vizuálneho tokenu vytváralo obrovské vektorové databázy, ktoré boli v podnikovom meradle príliš drahé.

  • Stratégia optimalizácie: Problém s úložiskom sme vyriešili starostlivým vyvážením veľkosti embeddingov tak, aby sme zachovali maximálny výkon a zabránili prudkému rastu nákladov na úložisko. Na zachovanie špičkovej presnosti pri tejto efektívnej veľkosti sme zvolili 320 rozmerov, ktoré poskytujú najlepší pomer výkonu vyhľadávania a nákladov na úložisko.

    • Referenčné riešenie: Bežný prístup (napríklad NVIDIA Nemo-3B) vyžaduje na uloženie embeddingov pre 1 milión obrázkov približne 10,3 TB (1 802 tokenov pri 3 072 rozmeroch).

    • ColQwen3: Rovnaký 1 milión obrázkov uloží iba do 0,82 TB (max. 1 280 tokenov pri 320 rozmeroch).

ColQwen3 dosahuje špičkovú presnosť vyhľadávania bez neúmerného navyšovania rozpočtu na cloudovú infraštruktúru.

Výsledky hodnotenia

Náš prístup sme overili na súbore benchmarkov ViDoRe. Výsledky potvrdzujú, že ColQwen3 stanovuje nové štandardy v najnovších benchmarkoch V3 a V2 (anglických aj viacjazyčných) a zároveň si udržiava špičkový výkon v starších úlohách V1.

ViDoRe v3 (najnovšia)

ColQwen3-8B vedie vo vyhľadávaní v angličtine aj vo viacerých jazykoch.

Anglické nDCG@5

Model

Informatika

Energetika

Financie

ĽZ

Priem.

Farmácia

Fyzika

Priemer

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Viacjazyčné nDCG@5

Model

Informatika

Energetika

Financie

ĽZ

Priem.

Farmácia

Fyzika

Priemer

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Najdôležitejšie výsledky ViDoRe v2 a v1

Stabilne vysoký výkon v oblastiach ESG, ekonómie a DocVQA.

Benchmark

Model

Skóre (priemer)

Významné prvenstvo

ViDoRe V2 (angličtina)

ColQwen3-8B

0.6772

1. miesto v ESG & BioMed

ViDoRe V2 (viacjazyčné)

ColQwen3-8B

0.6085

1. miesto v ekonómii

ViDoRe V1 (angličtina)

Nemo ColEmbed 3B

0.9100

Mierne vyšší priemer

ViDoRe V1 (angličtina)

ColQwen3-8B

0.9076

1. miesto v ArxivQA & Syn-Gov

Vyhľadávanie videí: hodnotenie CareBench

Aby sme preukázali, že ColQwen3 dobre zovšeobecňuje aj pri vyhľadávaní videí, modely sme vyhodnotili pomocou benchmarku CareBench v úlohách vyhľadávania videa podľa textu (General Retrieval).

Pri tomto hodnotení sme použili priamy prístup ku kódovaniu videa: naše modely kódovali videosúbory priamo, bez ďalších textových anotácií či vstupných metadát. To poukazuje na schopnosť modelu vyhľadávať výlučne podľa vizuálneho významu.

Model

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Sprístupnenie „temných dát“: prelomové možnosti videa

Jednou z najzásadnejších zmien, ktoré ColQwen3 prináša, je schopnosť pracovať s videom rovnako ako s dokumentmi. V mnohých podnikoch predstavuje video „temné dáta“. Leží v studenom úložisku a nedá sa v ňom vôbec vyhľadávať, pokiaľ človek ručne neoznačí každý súbor.

ColQwen3 to mení tým, že v rozdelených klipoch umožňuje vyhľadávať po jednotlivých snímkach.

Príklad použitia: podniková pamäťová banka

Podniky denne zaznamenajú tisíce hodín interných videoporád a tieto záznamy sa zvyčajne stratia v nenávratne.

  • Pracovný postup: Automatickým rozdelením dlhých záznamov porád na kratšie logické klipy a ich indexovaním pomocou ColQwen3 vytvoríte prehľadávateľnú „podnikovú pamäť“.

  • Dotaz: Projektový manažér môže požiadať: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Výsledok: Namiesto 60-minútového videosúboru systém vyhľadá presný 45-sekundový úsek, v ktorom sa daný diagram zobrazil na obrazovke a preberal, aj keď rečníci v tej konkrétnej sekunde výslovne nepovedali slovo „latencia“.

Podnikové prípady použitia: riešenie problémov s vysokou hodnotou

Prechod na natívne multimodálne embeddingy umožňuje úplne nové pracovné postupy naprieč odvetviami. Tento model sme dôkladne otestovali v niektorých z najzložitejších podnikových dátových prostredí.

1. Výsledok benchmarku: mestské poradenstvo a architektúra

ColQwen3 sme testovali na dátových výzvach mestských poradenských spoločností, ktoré spravujú rozsiahle knižnice územných plánov, zónových máp a zložitých architektonických pohľadov.

  • Výzva: Tradičné RAG pipeliney majú v týchto prostrediach problémy. Nástroje OCR zvyčajne označia zložité situačné plány iba ako „schému“ a prehliadnu dôležité podrobnosti o dopravných tokoch, zelených zónach či odstupoch budov.

  • Výkon: Naše interné benchmarky ukazujú, že ColQwen3 účinne odstraňuje potrebu nákladného predbežného spracovania pomocou OCR a generovania opisov. Pri testoch na architektonických výkresoch s vysokou hustotou informácií model úspešne vyhľadal dokumenty podľa konkrétnych vizuálnych prvkov, ako sú prístupové body pre chodcov či zreteľné hranice zón. Výrazne tak prekonal textové referenčné riešenia a zároveň sľubuje zásadné zníženie nákladov na spracovanie znalostí.

2. Komplexné finančné a trhové informácie

Investiční bankári a analytici trávia tisíce hodín prehľadávaním výročných správ a prezentácií pre investorov.

  • Pracovný postup: Analytik môže požiadať: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Zmena: Namiesto spoliehania sa na zhodu kľúčových slov model vyhľadá presný snímok podľa vizuálnej prítomnosti konkrétnej dátovej vizualizácie, vďaka čomu môže systém RAG odpovedať na otázky s vysokou presnosťou.

3. Priemyselná výroba a terénny servis

Výrobné spoločnosti majú rozsiahle knižnice technických príručiek a potrubných a prístrojových schém (P&ID).

  • Pracovný postup: Terénny technik opravujúci turbínu môže odfotografovať súčiastku alebo požiadať: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Zmena: ColQwen3 identifikuje vizuálne znázornenie schémy zapojenia a vyhľadá správnu stranu, čo môže skrátiť odstávku o celé hodiny.

4. Právo a súlad s predpismi

Právne zisťovanie zahŕňa kontrolu miliónov naskenovaných strán, kde je hľadanou „ihlou v kope sena“ často vizuálna značka.

  • Pracovný postup: Pracovník zodpovedný za súlad môže vyhľadať “Documents signed by the CFO” alebo “Contracts containing the official ‘Confidential’ stamp.”

  • Zmena: Model rozlíši koncept od konečného dokumentu podľa vizuálnej prítomnosti podpisov alebo pečiatok, čo čisto textové OCR často prehliadne.

Začíname

ColQwen3 má otvorené váhy (Apache 2.0) a už je dostupný na Hugging Face. Navrhli sme ho ako jednoducho nasaditeľnú inováciu moderných RAG pipelineov, ktorá poskytuje inferenčný kód potrebný na okamžité spracovanie textu, obrázkov a videa.

Pre podniky, ktoré chcú prekročiť možnosti jednoduchého textového vyhľadávania a sprístupniť inteligenciu ukrytú vo vizuálnych materiáloch, ide o nový štandard.

Ďalší krok: Preskúmajte kartu modelu a vyskúšajte živé demo na Hugging Face: /-colqwen3-embed-8b a /-colqwen3-embed-4b

Autor

Xin Huang a Kye Min Tan