Posledné dva roky bolo „RAG“ (generovanie rozšírené o vyhľadávanie) takmer výlučne synonymom textu. Štandardný postup je jednoduchý: vezmete dokumenty, extrahujete text, rozdelíte ho na časti a zaindexujete.
Podnikový svet však nefunguje na obyčajných textových súboroch. Funguje na zložitých súboroch PDF, prezentáciách s množstvom grafov, výkresoch CAD, naskenovaných faktúrach a čoraz častejšie aj na obrovských archívoch videozáznamov.
Odvetvový štandard, pri ktorom sa obraz pred vytvorením embeddingu pomocou OCR alebo vizuálnych LLM „opíše“ textom, predstavuje obrovské úzke miesto. Je pomalý, drahý a nevyhnutne stráca bohatý priestorový a vizuálny kontext pôvodných dát. Ak vaša AI opíše zložitý vizuál iba ako „technický výkres“, stratíte možnosť vyhľadať v ňom konkrétny ventil alebo schému zapojenia.
Dnes vydávame rodinu špičkových multimodálnych embeddingových modelov založených na architektúre ColPali. Tento problém riešia tým, že umožňujú komplexné vizuálne vyhľadávanie.
Vytvoriť skutočne účinný multimodálny vyhľadávací systém nie je také jednoduché ako vziať hotový vizuálno-jazykový model (VLM) a požiadať ho, aby vyhľadával. Pri tvorbe ColQwen3 sme na prekonanie problémov, ktoré v minulosti brzdili multimodálne RAG, použili stratégie zlučovania a trénovania modelov.
Namiesto dolaďovania základného modelu od začiatku sme navrhli metódu na prenos znalostí o úlohách vyhľadávania z existujúceho textového embeddingového modelu. Bežný VLM dokáže opisovať obrázky, no nemusí ich vedieť sémanticky zoradiť podľa relevantnosti k dotazu.
Túto medzeru sme preklenuli pomocou stratégií vyladeného váženia pri zlučovaní. V experimentoch sme zistili, že schopnosť Qwen3-Embedding vyhľadávať v textovom latentnom priestore možno priamo preniesť do multimodálneho priestoru a zovšeobecniť na vyhľadávanie obrázkov a videí aj bez okamžitého trénovania. Túto účinnú inicializáciu sme využili ako pevný základ a model následne doladili, aby sme ďalej optimalizovali výkon a zaistili robustnosť. V porovnaní s dolaďovaním základného modelu Qwen3-VL to zlepšuje výsledný výkon vyhľadávania.
Po prenose schopností vytvárať embeddingy sme sa zamerali na zarovnanie. Vykonali sme dôkladné prehľadávanie hyperparametrov a ablačné štúdie, ktoré zahŕňali optimálny počet epoch, veľkosť dávky, rýchlosť učenia, hodnosť LoRA a kombináciu dátových množín, aby sme maximalizovali výkon vyhľadávania.
Ako dátové množiny na dolaďovanie sme vybrali VDR, trénovaciu množinu ColPali, visrag_syn, a visrag_ind. Pri dolaďovaní sme použili vzorkovanie UniMax. Keďže sme použili zlučovanie modelov a zlúčený základný model už čiastočne zdedil multimodálne schopnosti vyhľadávania, zistili sme, že pridanie ďalších dátových množín by výkon mierne zhoršilo. Ich počet sme preto nezvyšovali.
Na dolaďovanie sme vybrali tieto hyperparametre:
Hodnosť LoRA | 32 |
Alfa LoRA | 32 |
Cieľové moduly LoRA | všetky obrazové aj textové vrstvy okrem embeddingovej |
Rýchlosť učenia | 5e-5 |
Max. počet vizuálnych tokenov | 1280 |
Epochy trénovania | 1 |
Globálna veľkosť dávky | 512 |
Pomer zahrievania | 5% |
Modely používajúce embeddingy na úrovni tokenov „v štýle ColBERT“ (napríklad ColPali) historicky ponúkali výnimočný výkon, ale za neúnosnú cenu úložiska. Indexovanie každého vizuálneho tokenu vytváralo obrovské vektorové databázy, ktoré boli v podnikovom meradle príliš drahé.
Stratégia optimalizácie: Problém s úložiskom sme vyriešili starostlivým vyvážením veľkosti embeddingov tak, aby sme zachovali maximálny výkon a zabránili prudkému rastu nákladov na úložisko. Na zachovanie špičkovej presnosti pri tejto efektívnej veľkosti sme zvolili 320 rozmerov, ktoré poskytujú najlepší pomer výkonu vyhľadávania a nákladov na úložisko.
Referenčné riešenie: Bežný prístup (napríklad NVIDIA Nemo-3B) vyžaduje na uloženie embeddingov pre 1 milión obrázkov približne 10,3 TB (1 802 tokenov pri 3 072 rozmeroch).
ColQwen3: Rovnaký 1 milión obrázkov uloží iba do 0,82 TB (max. 1 280 tokenov pri 320 rozmeroch).
ColQwen3 dosahuje špičkovú presnosť vyhľadávania bez neúmerného navyšovania rozpočtu na cloudovú infraštruktúru.
Náš prístup sme overili na súbore benchmarkov ViDoRe. Výsledky potvrdzujú, že ColQwen3 stanovuje nové štandardy v najnovších benchmarkoch V3 a V2 (anglických aj viacjazyčných) a zároveň si udržiava špičkový výkon v starších úlohách V1.
ColQwen3-8B vedie vo vyhľadávaní v angličtine aj vo viacerých jazykoch.
Anglické nDCG@5
Model | Informatika | Energetika | Financie | ĽZ | Priem. | Farmácia | Fyzika | Priemer |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Viacjazyčné nDCG@5
Model | Informatika | Energetika | Financie | ĽZ | Priem. | Farmácia | Fyzika | Priemer |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Stabilne vysoký výkon v oblastiach ESG, ekonómie a DocVQA.
Benchmark | Model | Skóre (priemer) | Významné prvenstvo |
ViDoRe V2 (angličtina) | ColQwen3-8B | 0.6772 | 1. miesto v ESG & BioMed |
ViDoRe V2 (viacjazyčné) | ColQwen3-8B | 0.6085 | 1. miesto v ekonómii |
ViDoRe V1 (angličtina) | Nemo ColEmbed 3B | 0.9100 | Mierne vyšší priemer |
ViDoRe V1 (angličtina) | ColQwen3-8B | 0.9076 | 1. miesto v ArxivQA & Syn-Gov |
Aby sme preukázali, že ColQwen3 dobre zovšeobecňuje aj pri vyhľadávaní videí, modely sme vyhodnotili pomocou benchmarku CareBench v úlohách vyhľadávania videa podľa textu (General Retrieval).
Pri tomto hodnotení sme použili priamy prístup ku kódovaniu videa: naše modely kódovali videosúbory priamo, bez ďalších textových anotácií či vstupných metadát. To poukazuje na schopnosť modelu vyhľadávať výlučne podľa vizuálneho významu.
Model | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Jednou z najzásadnejších zmien, ktoré ColQwen3 prináša, je schopnosť pracovať s videom rovnako ako s dokumentmi. V mnohých podnikoch predstavuje video „temné dáta“. Leží v studenom úložisku a nedá sa v ňom vôbec vyhľadávať, pokiaľ človek ručne neoznačí každý súbor.
ColQwen3 to mení tým, že v rozdelených klipoch umožňuje vyhľadávať po jednotlivých snímkach.
Podniky denne zaznamenajú tisíce hodín interných videoporád a tieto záznamy sa zvyčajne stratia v nenávratne.
Pracovný postup: Automatickým rozdelením dlhých záznamov porád na kratšie logické klipy a ich indexovaním pomocou ColQwen3 vytvoríte prehľadávateľnú „podnikovú pamäť“.
Dotaz: Projektový manažér môže požiadať: “Show me the clip where the engineering lead explained the latency issue with the API.”
Výsledok: Namiesto 60-minútového videosúboru systém vyhľadá presný 45-sekundový úsek, v ktorom sa daný diagram zobrazil na obrazovke a preberal, aj keď rečníci v tej konkrétnej sekunde výslovne nepovedali slovo „latencia“.
Prechod na natívne multimodálne embeddingy umožňuje úplne nové pracovné postupy naprieč odvetviami. Tento model sme dôkladne otestovali v niektorých z najzložitejších podnikových dátových prostredí.
ColQwen3 sme testovali na dátových výzvach mestských poradenských spoločností, ktoré spravujú rozsiahle knižnice územných plánov, zónových máp a zložitých architektonických pohľadov.
Výzva: Tradičné RAG pipeliney majú v týchto prostrediach problémy. Nástroje OCR zvyčajne označia zložité situačné plány iba ako „schému“ a prehliadnu dôležité podrobnosti o dopravných tokoch, zelených zónach či odstupoch budov.
Výkon: Naše interné benchmarky ukazujú, že ColQwen3 účinne odstraňuje potrebu nákladného predbežného spracovania pomocou OCR a generovania opisov. Pri testoch na architektonických výkresoch s vysokou hustotou informácií model úspešne vyhľadal dokumenty podľa konkrétnych vizuálnych prvkov, ako sú prístupové body pre chodcov či zreteľné hranice zón. Výrazne tak prekonal textové referenčné riešenia a zároveň sľubuje zásadné zníženie nákladov na spracovanie znalostí.
Investiční bankári a analytici trávia tisíce hodín prehľadávaním výročných správ a prezentácií pre investorov.
Pracovný postup: Analytik môže požiadať: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Zmena: Namiesto spoliehania sa na zhodu kľúčových slov model vyhľadá presný snímok podľa vizuálnej prítomnosti konkrétnej dátovej vizualizácie, vďaka čomu môže systém RAG odpovedať na otázky s vysokou presnosťou.
Výrobné spoločnosti majú rozsiahle knižnice technických príručiek a potrubných a prístrojových schém (P&ID).
Pracovný postup: Terénny technik opravujúci turbínu môže odfotografovať súčiastku alebo požiadať: “Show me the wiring diagram for the hydraulic pump assembly.”
Zmena: ColQwen3 identifikuje vizuálne znázornenie schémy zapojenia a vyhľadá správnu stranu, čo môže skrátiť odstávku o celé hodiny.
Právne zisťovanie zahŕňa kontrolu miliónov naskenovaných strán, kde je hľadanou „ihlou v kope sena“ často vizuálna značka.
Pracovný postup: Pracovník zodpovedný za súlad môže vyhľadať “Documents signed by the CFO” alebo “Contracts containing the official ‘Confidential’ stamp.”
Zmena: Model rozlíši koncept od konečného dokumentu podľa vizuálnej prítomnosti podpisov alebo pečiatok, čo čisto textové OCR často prehliadne.
ColQwen3 má otvorené váhy (Apache 2.0) a už je dostupný na Hugging Face. Navrhli sme ho ako jednoducho nasaditeľnú inováciu moderných RAG pipelineov, ktorá poskytuje inferenčný kód potrebný na okamžité spracovanie textu, obrázkov a videa.
Pre podniky, ktoré chcú prekročiť možnosti jednoduchého textového vyhľadávania a sprístupniť inteligenciu ukrytú vo vizuálnych materiáloch, ide o nový štandard.
Ďalší krok: Preskúmajte kartu modelu a vyskúšajte živé demo na Hugging Face: /-colqwen3-embed-8b a /-colqwen3-embed-4b