Tokom posljednje dvije godine „RAG” (generiranje potpomognuto pretraživanjem) bio je gotovo isključivo sinonim za tekst. Standardni postupak je jednostavan: uzmite dokumente, izdvojite tekst, podijelite ga na dijelove i indeksirajte.
Ali poslovni svijet ne funkcionira na običnim tekstualnim datotekama. On se oslanja na složene PDF-ove, prezentacije s gustim grafikonima, CAD crteže, skenirane fakture i sve više na ogromne arhive videosnimaka.
Industrijski standard prema kojem se sadržaj prije izrade vektorske reprezentacije obrađuje OCR-om ili vizuelnim LLM-ovima kako bi se slika „opisala” tekstom predstavlja ogromno usko grlo. Spor je, skup i neizbježno gubi bogati prostorni i vizuelni kontekst izvornih podataka. Ako vaša umjetna inteligencija složeni vizuelni sadržaj opiše samo kao „nacrt”, izgubili ste mogućnost pretraživanja određene sheme ventila ili ožičenja unutar njega.
Danas objavljujemo porodicu najsavremenijih multimodalnih modela za vektorske reprezentacije, nadograđenih na arhitekturu ColPali i osmišljenih da riješe ovaj problem omogućavanjem vizuelnog pretraživanja od početka do kraja.
Izrada zaista djelotvornog multimodalnog sistema za pretraživanje nije tako jednostavna kao uzeti gotov model za vid i jezik (VLM) i zatražiti da pretražuje. Kako bismo riješili izazove koji su kroz historiju kočili multimodalni RAG i napravili ColQwen3, koristili smo strategije spajanja i obuke modela.
Umjesto finog podešavanja osnovnog modela od nule, osmislili smo metodu prijenosa znanja o zadacima pretraživanja iz postojećeg tekstualnog modela za vektorske reprezentacije. Standardni VLM zna opisivati slike, ali ih ne zna nužno semantički rangirati prema upitu.
Kako bismo premostili taj jaz, koristili smo strategije podešenih težina spojenog modela. U eksperimentima smo utvrdili da se sposobnost pretraživanja modela Qwen3-Embedding u tekstualnom latentnom prostoru može direktno prenijeti u multimodalni prostor te generalizirati na pretraživanje slika i videozapisa čak i bez neposredne obuke. Iskoristili smo ovu djelotvornu inicijalizaciju kao snažnu polaznu tačku, a zatim fino podesili model kako bismo dodatno optimizirali performanse i osigurali robusnost. Time se poboljšavaju konačne performanse pretraživanja u odnosu na fino podešavanje osnovnog modela Qwen3-VL.
Nakon prijenosa sposobnosti vektorskih reprezentacija usredotočili smo se na usklađivanje. Proveli smo pažljive pretrage hiperparametara i ablativne studije, uključujući optimalan broj epoha, veličinu serije, stopu učenja, LoRA rang i kombinaciju skupova podataka, kako bismo maksimalno poboljšali performanse pretraživanja.
Za fino podešavanje odabrali smo skupove podataka VDR, skup za obuku ColPali, visrag_syn, i visrag_ind. Za fino podešavanje koristili smo UniMax uzorkovanje. Budući da smo primijenili spajanje modela i da spojeni osnovni model već djelimično nasljeđuje multimodalne sposobnosti pretraživanja, utvrdili smo da bi povećavanje broja skupova podataka zapravo neznatno pogoršalo performanse, pa ih nismo dodatno proširivali.
Ovo su hiperparametri koje smo odabrali za fino podešavanje:
LoRA rang | 32 |
LoRA alfa | 32 |
Ciljni moduli za LoRA | svi slojevi slike i teksta osim vektorske reprezentacije |
Stopa učenja | 5e-5 |
Maks. broj vizuelnih tokena | 1280 |
Epohe obuke | 1 |
Globalna veličina serije | 512 |
Omjer zagrijavanja | 5% |
Modeli koji koriste vektorske reprezentacije na nivou tokena „u stilu ColBERT-a”, poput ColPali, tradicionalno su pružali izvanredne performanse, ali uz previsoke troškove pohrane. Indeksiranje svakog vizuelnog tokena stvaralo je ogromne vektorske baze podataka, preskupe za poslovnu primjenu velikih razmjera.
Strategija optimizacije: Izazov pohrane riješili smo pažljivim uravnoteživanjem veličine vektorskih reprezentacija kako bismo zadržali maksimalne performanse bez naglog rasta troškova pohrane. Kako bismo unutar ovog efikasnog formata zadržali najsavremeniju preciznost, pažljivo smo odabrali 320 dimenzija kao najbolju ravnotežu između performansi pretraživanja i troškova pohrane.
Osnovni pristup: Standardnom pristupu, poput NVIDIA Nemo-3B, potrebno je približno 10,3 TB za pohranu vektorskih reprezentacija milion slika (1.802 tokena uz 3.072 dimenzije).
ColQwen3: Isti milion slika pohranjuje u samo 0,82 TB (najviše 1.280 tokena uz 320 dimenzija).
ColQwen3 postiže najsavremeniju preciznost pretraživanja bez prekomjernog opterećivanja budžeta za infrastrukturu u oblaku.
Naš pristup potvrdili smo na skupu testova ViDoRe. Rezultati potvrđuju da ColQwen3 postavlja nove standarde na najnovijim testovima V3 i V2, kako engleskim tako i višejezičnim, uz zadržavanje vrhunskih performansi na starijim zadacima V1.
ColQwen3-8B prednjači u pretraživanju na engleskom i više jezika.
Engleski nDCG@5
Model | Računarstvo | Energetika | Finansije | Ljudski resursi | Ind. | Farmacija | Fizika | Prosjek |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Višejezični nDCG@5
Model | Računarstvo | Energetika | Finansije | Ljudski resursi | Ind. | Farmacija | Fizika | Prosjek |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Dosljedno visoke performanse u oblastima ESG-a, ekonomije i DocVQA-a.
Test | Model | Rezultat (prosjek) | Značajan uspjeh |
ViDoRe V2 (engleski) | ColQwen3-8B | 0.6772 | 1. mjesto u ESG-u i biomedicini |
ViDoRe V2 (višejezični) | ColQwen3-8B | 0.6085 | 1. mjesto u ekonomiji |
ViDoRe V1 (engleski) | Nemo ColEmbed 3B | 0.9100 | Nešto viši prosjek |
ViDoRe V1 (engleski) | ColQwen3-8B | 0.9076 | 1. mjesto u ArxivQA i Syn-Gov |
Kako bismo pokazali da ColQwen3 odlično generalizira na pretraživanje videozapisa, modele smo evaluirali na testu CareBench za zadatke pretraživanja videozapisa na osnovu teksta (General Retrieval).
Za ovu evaluaciju koristili smo pristup direktnog kodiranja videozapisa: naši modeli kodirali su videodatoteke bez dodatnih tekstualnih napomena ili ulaznih metapodataka. To ističe sposobnost modela da obavlja pretraživanje isključivo na osnovu vizuelke semantike.
Model | Odziv@1 | Odziv@5 | Odziv@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Jedna od najznačajnijih promjena koje omogućava ColQwen3 jeste sposobnost da videozapise tretira poput dokumenata. U mnogim kompanijama videozapisi su „tamni podaci”. Čuvaju se u hladnoj pohrani i potpuno su nepretraživi ako čovjek nije ručno označio svaku datoteku.
ColQwen3 to mijenja omogućavajući pretraživanje segmentiranih isječaka kadar po kadar.
Kompanije svakodnevno snimaju hiljade sati internih videosastanaka, a ti snimci obično nestanu u bespućima arhive.
Tok rada: Automatskim dijeljenjem dugih snimaka sastanaka na kraće, logične isječke i njihovim indeksiranjem pomoću ColQwen3 stvarate pretraživu „korporativnu memoriju”.
Upit: Voditelj projekta može zatražiti: “Show me the clip where the engineering lead explained the latency issue with the API.”
Rezultat: Umjesto vraćanja videosnimka od 60 minuta, sistem pronalazi tačan segment od 45 sekundi u kojem je konkretni dijagram prikazan na ekranu i razmatran, čak i ako govornici u tom trenutku nisu izričito izgovorili riječ „latency”.
Prelazak na izvorne multimodalne vektorske reprezentacije omogućava potpuno nove tokove rada u različitim industrijama. Ovaj model smo opsežno testirali u nekim od najsloženijih okruženja poslovnih podataka.
ColQwen3 smo testirali na podatkovnim izazovima urbanističkih savjetodavnih firmi koje upravljaju ogromnim zbirkama generalnih planova, zoning mapa i složenih arhitektonskih fasada.
Izazov: Tradicionalni RAG sistemi teško funkcioniraju u takvim okruženjima. OCR alati složene situacione planove obično opisuju samo kao „shemu”, zanemarujući ključne detalje o protoku saobraćaja, zelenim zonama ili udaljenosti objekata od granica parcele.
Performanse: Naši interni testovi pokazuju da ColQwen3 uspješno uklanja potrebu za skupom prethodnom obradom pomoću OCR-a i generiranja opisa. U testovima s veoma detaljnim arhitektonskim crtežima model je uspješno pronalazio dokumente prema konkretnim vizuelnim oznakama, poput pristupnih tačaka za pješake ili jasno određenih granica zona. Time je znatno nadmašio osnovne sisteme zasnovane samo na tekstu i obećava drastično smanjenje troškova unosa znanja.
Investicijski bankari i analitičari provode hiljade sati pregledajući godišnje izvještaje i prezentacije za investitore.
Tok rada: Analitičar može zatražiti: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Promjena: Umjesto oslanjanja na podudaranje ključnih riječi, model pronalazi tačan slajd na osnovu vizuelnog prisustva konkretnog prikaza podataka, što RAG sistemu omogućava da na pitanja odgovara s visokom preciznošću.
Proizvodne kompanije posjeduju ogromne zbirke tehničkih priručnika i dijagrama cjevovoda i instrumentacije (P&ID).
Tok rada: Terenski inženjer koji popravlja turbinu može fotografirati dio ili zatražiti: “Show me the wiring diagram for the hydraulic pump assembly.”
Promjena: ColQwen3 prepoznaje vizuelni prikaz dijagrama ožičenja i pronalazi odgovarajuću stranicu, čime potencijalno skraćuje zastoj za nekoliko sati.
Pravno otkrivanje podataka uključuje pregled miliona skeniranih stranica na kojima je tražena „igla u plastu sijena” često vizuelna oznaka.
Tok rada: Službenik za usklađenost može tražiti “Documents signed by the CFO” ili “Contracts containing the official ‘Confidential’ stamp.”
Promjena: Model razlikuje nacrt od konačnog dokumenta prema vizuelnom prisustvu potpisa ili pečata, što isključivo OCR rješenje često ne prepoznaje.
ColQwen3 ima otvorene težine (Apache 2.0) i već je dostupan na platformi Hugging Face. Osmislili smo ga kao neposrednu nadogradnju modernih RAG sistema, uz potreban kôd za zaključivanje kojim se tekst, slike i videozapisi mogu odmah obrađivati.
Za kompanije spremne da prevaziđu jednostavno tekstualno pretraživanje i oslobode inteligenciju zarobljenu u svojim vizuelnim resursima ovo je novi standard.
Sljedeći korak: Istražite karticu modela i isprobajte demonstraciju uživo na platformi Hugging Face: /-colqwen3-embed-8b i /-colqwen3-embed-4b