Glavna navigacija

Više od teksta: istinski multimodalni RAG od početka do kraja

Multimodalni modeli ugradnje pomažu timovima da korisne informacije dohvaćaju izravno iz složenih dokumenata, slika i videozapisa.

Posljednje dvije godine „RAG” (generiranje potpomognuto dohvaćanjem) gotovo je isključivo bio sinonim za tekst. Standardni je postupak jednostavan: uzmite dokumente, izdvojite tekst, podijelite ga na dijelove i indeksirajte.

No poslovni svijet ne počiva na običnim tekstnim datotekama. Počiva na složenim PDF-ovima, prezentacijama s gustim grafikonima, CAD crtežima, skeniranim računima i sve većim arhivama videosnimki.

Industrijski standard prema kojem se slika prije ugradnje pretvara u tekstni „opis” pomoću OCR-a ili vizualnih LLM-ova stvara golemo usko grlo. Spor je i skup te neizbježno gubi bogat prostorni i vizualni kontekst izvornih podataka. Ako vaš AI složen vizualni sadržaj opiše samo kao „nacrt”, više ne možete tražiti određeni ventil ili električnu shemu u njemu.

Danas objavljujemo obitelj najsuvremenijih multimodalnih modela ugradnje, razvijenih na arhitekturi ColPali, koji ovaj problem rješavaju omogućujući vizualno pretraživanje od početka do kraja.

Inženjerstvo iza čarolije: napredne strategije finog ugađanja

Izrada doista učinkovitog multimodalnog sustava za pretraživanje nije tako jednostavna kao uzeti gotov vizualno-jezični model (VLM) i zatražiti da pretražuje. Kako bismo riješili izazove koji su dosad kočili multimodalni RAG i stvorili ColQwen3, primijenili smo strategije spajanja i treniranja modela.

1. Prijenos sposobnosti ugradnje prilagođenim ponderiranjem pri spajanju

Umjesto finog ugađanja osnovnog modela od nule, osmislili smo metodu za prijenos znanja o zadacima pretraživanja iz postojećeg modela tekstnih ugradnji. Standardni VLM zna opisivati slike, ali ih ne mora nužno znati semantički rangirati prema upitu.

Kako bismo premostili taj jaz, primijenili smo prilagođene strategije ponderiranja pri spajanju. U eksperimentima smo utvrdili da se sposobnost pretraživanja modela Qwen3-Embedding u latentnom prostoru teksta može izravno prenijeti u multimodalni prostor te generalizirati na pretraživanje slika i videozapisa čak i bez neposrednog treniranja. Iskoristili smo tu učinkovitu inicijalizaciju kao snažnu polaznu točku, a zatim fino ugodili model radi dodatne optimizacije rezultata i osiguravanja robusnosti. Time se poboljšavaju konačni rezultati pretraživanja u usporedbi s finim ugađanjem osnovnog modela Qwen3-VL.

2. Pažljivo ugađanje hiperparametara

Nakon prijenosa sposobnosti ugradnje usredotočili smo se na usklađivanje. Proveli smo temeljito pretraživanje hiperparametara i ablativne studije, uključujući optimalan broj epoha, veličinu serije, stopu učenja, rang LoRA-e i kombinaciju skupova podataka, kako bismo povećali uspješnost pretraživanja.

Za fino ugađanje odabrali smo skupove podataka VDR, skup za treniranje ColPali, visrag_syn, i visrag_ind. Za fino ugađanje primijenili smo uzorkovanje UniMax. Budući da smo primijenili spajanje modela, a spojeni osnovni model već djelomično nasljeđuje multimodalne sposobnosti pretraživanja, utvrdili smo da bi dodavanje još skupova podataka zapravo malo pogoršalo rezultate. Stoga nismo povećavali njihov broj.

Za fino ugađanje odabrali smo sljedeće hiperparametre:

Rang LoRA-e

32

Alfa LoRA-e

32

Ciljni moduli LoRA-e

svi slojevi slike i teksta osim ugradnje

Stopa učenja

5e-5

Najveći broj vizualnih tokena

1280

Epohe treniranja

1

Globalna veličina serije

512

Omjer zagrijavanja

5%

3. Dilema „ColBERT”: visoki rezultati nasuprot trošku pohrane

Povijesno gledano, modeli s ugradnjama na razini tokena u stilu „ColBERT-a”, poput ColPalija, nudili su nevjerojatne rezultate, ali uz previsok trošak pohrane. Indeksiranje svakog vizualnog tokena stvaralo je goleme vektorske baze podataka koje su bile preskupe za primjenu u velikim tvrtkama.

  • Strategija optimizacije: Izazov pohrane riješili smo pažljivim uravnoteživanjem veličine ugradnji kako bismo zadržali najbolje rezultate, a spriječili eksplozivan rast troškova pohrane. Kako bismo uz tu učinkovitu veličinu zadržali najsuvremeniju točnost, pažljivo smo odabrali 320 dimenzija kao najbolju ravnotežu između rezultata pretraživanja i troška pohrane.

    • Polazna vrijednost: Standardni pristup, poput NVIDIA Nemo-3B, zahtijeva približno 10,3 TB za pohranu ugradnji milijun slika (1.802 tokena uz 3.072 dimenzije).

    • ColQwen3: Istih milijun slika pohranjuje u samo 0,82 TB (najviše 1.280 tokena uz 320 dimenzija).

ColQwen3 postiže najsuvremeniju točnost pretraživanja bez prekomjernog povećanja proračuna za infrastrukturu u oblaku.

Rezultati evaluacije

Svoj smo pristup potvrdili na skupu referentnih testova ViDoRe. Rezultati potvrđuju da ColQwen3 postavlja nove standarde na najnovijim testovima V3 i V2, i engleskim i višejezičnim, uz zadržavanje vrhunskih rezultata na starijim zadacima V1.

ViDoRe v3 (najnoviji)

ColQwen3-8B vodeći je u pretraživanju na engleskom i više jezika.

Engleski nDCG@5

Model

Računalstvo

Energetika

Financije

Ljudski resursi

Ind.

Farmacija

Fizika

Prosjek

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Višejezični nDCG@5

Model

Računalstvo

Energetika

Financije

Ljudski resursi

Ind.

Farmacija

Fizika

Prosjek

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Najvažniji rezultati ViDoRe v2 i v1

Dosljedno visoki rezultati u područjima ESG-a, ekonomije i DocVQA-e.

Referentni test

Model

Rezultat (prosjek)

Istaknuta pobjeda

ViDoRe V2 (engleski)

ColQwen3-8B

0.6772

1. mjesto u ESG-u i biomedicini

ViDoRe V2 (višejezični)

ColQwen3-8B

0.6085

1. mjesto u ekonomiji

ViDoRe V1 (engleski)

Nemo ColEmbed 3B

0.9100

Nešto viši prosjek

ViDoRe V1 (engleski)

ColQwen3-8B

0.9076

1. mjesto u ArxivQA-i i Syn-Govu

Pretraživanje videozapisa: evaluacija CareBench

Kako bismo pokazali da se ColQwen3 izvrsno generalizira na pretraživanje videozapisa, modele smo evaluirali na referentnom testu CareBench za zadatke pretraživanja videozapisa na temelju teksta (General Retrieval).

Za ovu smo evaluaciju primijenili pristup izravnog kodiranja videozapisa: naši su modeli izravno kodirali videodatoteke bez dodatnih tekstnih opisa ili ulaznih metapodataka. To ističe sposobnost modela da pretražuje isključivo na temelju vizualne semantike.

Model

Odziv@1

Odziv@5

Odziv@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Otključavanje „tamnih podataka”: granica videozapisa

Jedna od najdubljih promjena koje omogućuje ColQwen3 jest njegova sposobnost da s videozapisima postupa jednako kao s dokumentima. U mnogim su tvrtkama videozapisi „tamni podaci”. Ostaju u hladnoj pohrani i potpuno su nepretraživi ako čovjek nije ručno označio svaku datoteku.

ColQwen3 to mijenja omogućujući pretraživanje segmentiranih isječaka kadar po kadar.

Istaknuti slučaj primjene: korporativna memorija

Tvrtke svakodnevno snimaju tisuće sati internih videosastanaka, a te snimke najčešće nestaju u zaboravu.

  • Tijek rada: Automatskim dijeljenjem dugih snimki sastanaka na kraće, logične isječke i njihovim indeksiranjem uz ColQwen3 stvara se pretraživa „korporativna memorija”.

  • Upit: Voditelj projekta može pitati: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Rezultat: Umjesto vraćanja 60-minutne videodatoteke, sustav pronalazi točan segment od 45 sekundi u kojem je konkretan dijagram prikazan na zaslonu i objašnjen, čak i ako govornici u tom trenutku nisu izričito izgovorili riječ „latencija”.

Poslovni slučajevi primjene: rješavanje problema velike vrijednosti

Prelazak na izvorne multimodalne ugradnje omogućuje posve nove tijekove rada u raznim industrijama. Ovaj smo model opsežno testirali u nekima od najsloženijih okruženja poslovnih podataka.

1. Istaknuti referentni test: urbanističko savjetovanje i arhitektura

ColQwen3 testirali smo na podatkovnim izazovima urbanističkih konzultantskih tvrtki koje upravljaju golemim zbirkama prostornih planova, karata namjene zemljišta i složenih arhitektonskih nacrta pročelja.

  • Izazov: Tradicionalni RAG procesi teško funkcioniraju u takvim okruženjima. OCR alati složene situacijske planove obično opisuju samo kao „shemu”, izostavljajući ključne pojedinosti o prometnim tokovima, zelenim zonama ili udaljenosti građevina od međa.

  • Rezultati: Naši interni referentni testovi pokazuju da ColQwen3 učinkovito uklanja potrebu za skupom predobradom OCR-om i generiranjem opisa. U testovima s vrlo detaljnim arhitektonskim crtežima model je uspješno pronalazio dokumente prema konkretnim vizualnim oznakama, poput pristupnih točaka za pješake ili jasno određenih granica zona. Time je znatno nadmašio polazne sustave koji obrađuju samo tekst, uz mogućnost drastičnog smanjenja troškova unosa znanja.

2. Složena financijska i tržišna analitika

Investicijski bankari i analitičari provode tisuće sati pregledavajući godišnja izvješća i prezentacije za ulagače.

  • Tijek rada: Analitičar može zatražiti: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Promjena: Umjesto oslanjanja na podudaranje ključnih riječi, model pronalazi točan slajd prema vizualnoj prisutnosti određenog prikaza podataka, što RAG sustavu omogućuje vrlo precizno odgovaranje na pitanja.

3. Industrijska proizvodnja i terenski servis

Proizvodne tvrtke raspolažu golemim zbirkama tehničkih priručnika i dijagrama cjevovoda i instrumentacije (P&ID).

  • Tijek rada: Terenski inženjer koji popravlja turbinu može fotografirati dio ili zatražiti: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Promjena: ColQwen3 prepoznaje vizualni prikaz električne sheme i pronalazi odgovarajuću stranicu, čime potencijalno skraćuje zastoj za nekoliko sati.

4. Pravni poslovi i usklađenost

Pravno otkrivanje dokaza uključuje pregled milijuna skeniranih stranica na kojima je tražena „igla u plastu sijena” često vizualna oznaka.

  • Tijek rada: Službenik za usklađenost može tražiti “Documents signed by the CFO” ili “Contracts containing the official ‘Confidential’ stamp.”

  • Promjena: Model razlikuje nacrt od dovršenog dokumenta prema vizualnoj prisutnosti potpisa ili pečata, što običan OCR često ne prepoznaje.

Početak rada

ColQwen3 ima otvorene težine (Apache 2.0) i već je dostupan na platformi Hugging Face. Osmislili smo ga kao neposrednu nadogradnju modernih RAG procesa te pružili kôd za izvođenje potreban za trenutačnu obradu teksta, slika i videozapisa.

Za tvrtke koje žele nadići jednostavno tekstno pretraživanje i osloboditi inteligenciju zarobljenu u vizualnim resursima, ovo je novi standard.

Sljedeći korak: Pogledajte karticu modela i isprobajte demonstraciju uživo na platformi Hugging Face: /-colqwen3-embed-8b i /-colqwen3-embed-4b

Autor

Xin Huang i Kye Min Tan