În ultimii doi ani, „RAG” (generare augmentată prin regăsire) a fost aproape exclusiv sinonim cu textul. Abordarea standard este simplă: preiei documentele, extragi textul, îl împarți în fragmente și îl indexezi.
Însă companiile nu funcționează pe baza fișierelor cu text simplu. Ele se bazează pe PDF-uri complexe, prezentări cu grafice dense, desene CAD, facturi scanate și, tot mai mult, arhive uriașe de materiale video.
Standardul industriei — utilizarea OCR sau a modelelor lingvistice mari cu capacități vizuale pentru a „descrie” o imagine în text înainte de a-i crea reprezentarea — constituie un blocaj major. Procesul este lent și costisitor și pierde inevitabil bogatul context spațial și vizual al datelor originale. Dacă sistemul dvs. de IA descrie o imagine complexă doar ca „un plan tehnic”, nu mai puteți căuta vana sau schema electrică specifică din aceasta.
Astăzi lansăm o familie de modele multimodale de ultimă generație pentru reprezentări, construite pe arhitectura ColPali și concepute să rezolve această problemă prin regăsire vizuală integrală.
Construirea unui sistem multimodal de regăsire cu adevărat eficient nu este la fel de simplă ca preluarea unui model vizual-lingvistic (VLM) standard și solicitarea de a efectua căutări. Pentru a depăși dificultățile care au frânat în trecut RAG multimodal și pentru a crea ColQwen3, am folosit strategii de îmbinare și antrenare a modelelor.
În loc să ajustăm fin de la zero un model de bază, am conceput o metodă de transfer al cunoștințelor despre sarcinile de regăsire dintr-un model existent pentru reprezentări textuale. Un VLM standard știe să descrie imagini, dar nu știe neapărat să le ordoneze semantic în raport cu o interogare.
Pentru a elimina acest decalaj, am utilizat strategii de ponderare optimizată la îmbinare. Experimentele noastre au arătat că abilitatea de regăsire a Qwen3-Embedding din spațiul latent textual putea fi transferată direct în spațiul multimodal, generalizând la regăsirea imaginilor și materialelor video chiar și fără antrenare imediată. Folosind această inițializare eficientă ca punct de plecare solid, am ajustat apoi fin modelul pentru a optimiza suplimentar performanța și a-i asigura robustețea. Aceasta îmbunătățește performanța finală de regăsire față de ajustarea fină pornind de la modelul de bază Qwen3-VL.
După transferul capacităților de reprezentare, ne-am concentrat asupra alinierii. Am efectuat căutări atente ale hiperparametrilor și studii de ablație, analizând numărul optim de epoci, dimensiunea lotului, rata de învățare, rangul LoRA și combinația seturilor de date, pentru a maximiza performanța de regăsire.
Pentru ajustarea fină, am ales seturile de date VDR, setul de antrenare ColPali, visrag_syn, și visrag_ind. Pentru ajustarea fină am folosit eșantionarea UniMax. Deoarece am aplicat îmbinarea modelelor, iar modelul de bază rezultat moștenește deja parțial capacitatea de regăsire multimodală, am constatat că adăugarea mai multor seturi de date ar reduce ușor performanța. Prin urmare, nu am extins numărul acestora.
Iată hiperparametrii selectați pentru ajustarea fină:
Rang LoRA | 32 |
Alfa LoRA | 32 |
Module-țintă LoRA | toate straturile pentru imagine și text, cu excepția reprezentării |
Rată de învățare | 5e-5 |
Număr maxim de tokenuri vizuale | 1280 |
Epoci de antrenare | 1 |
Dimensiunea globală a lotului | 512 |
Proporție de încălzire | 5% |
În trecut, modelele care foloseau reprezentări la nivel de token „în stil ColBERT” (precum ColPali) ofereau performanțe incredibile, dar necesitau costuri de stocare prohibitive. Indexarea fiecărui token vizual crea baze de date vectoriale uriașe, prea costisitoare pentru utilizarea la scara unei companii.
Strategia de optimizare: Am abordat problema stocării echilibrând atent dimensiunea reprezentărilor, pentru a păstra performanța maximă fără creșterea necontrolată a costurilor. Pentru a menține o precizie de ultimă generație cu acest volum eficient, am ales atent o dimensiune de 320, care oferă cel mai bun echilibru între performanța de regăsire și costul stocării.
Referință: O abordare standard (precum NVIDIA Nemo-3B) necesită aproximativ 10,3 TB pentru stocarea reprezentărilor unui milion de imagini (1.802 tokenuri × 3.072 dimensiuni).
ColQwen3: Stochează același milion de imagini în doar 0,82 TB (maximum 1.280 de tokenuri × 320 de dimensiuni).
ColQwen3 oferă o precizie de regăsire de ultimă generație fără a împovăra bugetul infrastructurii cloud.
Ne-am validat abordarea folosind suita de teste ViDoRe. Rezultatele confirmă că ColQwen3 stabilește noi standarde în cele mai recente teste V3 și V2, atât în engleză, cât și multilingve, menținând totodată performanțe de top în sarcinile V1 anterioare.
ColQwen3-8B este lider în regăsirea în engleză și multilingvă.
nDCG@5 în engleză
Model | Informatică | Energie | Finanțe | RU | Ind. | Farmacie | Fizică | Medie |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
nDCG@5 multilingv
Model | Informatică | Energie | Finanțe | RU | Ind. | Farmacie | Fizică | Medie |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Performanțe constant ridicate în ESG, economie și DocVQA.
Test de referință | Model | Scor (medie) | Rezultat remarcabil |
ViDoRe V2 (engleză) | ColQwen3-8B | 0.6772 | Locul 1 în ESG și BioMed |
ViDoRe V2 (multilingv) | ColQwen3-8B | 0.6085 | Locul 1 în economie |
ViDoRe V1 (engleză) | Nemo ColEmbed 3B | 0.9100 | Medie ușor mai ridicată |
ViDoRe V1 (engleză) | ColQwen3-8B | 0.9076 | Locul 1 în ArxivQA și Syn-Gov |
Pentru a demonstra că ColQwen3 generalizează foarte bine la regăsirea video, am evaluat modelele cu testul CareBench pentru sarcini text-video (regăsire generală).
Pentru această evaluare, am utilizat o abordare bazată pe codificarea video brută: modelele noastre au codificat direct fișierele video, fără adnotări textuale suplimentare sau metadate de intrare. Acest lucru evidențiază capacitatea modelului de a efectua regăsirea exclusiv pe baza semanticii vizuale.
Model | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Una dintre cele mai profunde schimbări aduse de ColQwen3 este capacitatea de a trata materialele video la fel ca documentele. În multe companii, materialele video sunt „date întunecate”. Acestea rămân în arhive inactive și nu pot fi căutate decât dacă fiecare fișier a fost etichetat manual.
ColQwen3 schimbă situația, permițând regăsirea cadru cu cadru în clipuri segmentate.
În fiecare zi, companiile înregistrează mii de ore de ședințe video interne, iar aceste înregistrări se pierd, de obicei, în neant.
Fluxul de lucru: Prin segmentarea automată a înregistrărilor lungi ale ședințelor în clipuri mai scurte și coerente și indexarea lor cu ColQwen3, creați o „memorie organizațională” în care se poate căuta.
Interogarea: Un manager de proiect poate solicita: “Show me the clip where the engineering lead explained the latency issue with the API.”
Rezultatul: În loc să returneze un fișier video de 60 de minute, sistemul găsește exact segmentul de 45 de secunde în care diagrama respectivă a fost afișată și discutată, chiar dacă vorbitorii nu au rostit explicit cuvântul „latență” în acel moment.
Trecerea la reprezentări multimodale native deschide fluxuri de lucru complet noi în toate industriile. Am evaluat în detaliu acest model în raport cu unele dintre cele mai complexe medii de date ale companiilor.
Am testat ColQwen3 în raport cu dificultățile privind datele întâmpinate de firmele de consultanță urbană, care gestionează biblioteci uriașe de planuri generale, hărți de zonare și elevații arhitecturale complexe.
Provocarea: În aceste medii, fluxurile RAG tradiționale întâmpină dificultăți. Instrumentele OCR descriu de obicei planurile complexe ale amplasamentelor doar drept „scheme”, omițând detalii esențiale despre fluxul de trafic, zonele verzi sau retragerile clădirilor.
Performanța: Testele noastre interne demonstrează că ColQwen3 elimină eficient necesitatea preprocesării costisitoare prin OCR sau generarea de descrieri. În testele cu desene arhitecturale foarte dense, modelul a regăsit cu succes documente pe baza unor marcaje vizuale specifice, precum punctele de acces pietonal sau limitele distincte de zonare. Astfel, a depășit semnificativ performanțele de referință bazate exclusiv pe text și promite reducerea drastică a costurilor de asimilare a cunoștințelor.
Bancherii de investiții și analiștii petrec mii de ore examinând rapoarte anuale și prezentări pentru investitori.
Fluxul de lucru: Un analist poate solicita: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Schimbarea: În loc să se bazeze pe potrivirea cuvintelor-cheie, modelul găsește diapozitivul exact pe baza prezenței vizuale a reprezentării specifice a datelor, permițând sistemului RAG să răspundă cu mare precizie.
Companiile de producție dețin biblioteci vaste de manuale tehnice și diagrame de conducte și instrumentație (P&ID).
Fluxul de lucru: Un inginer de teren care repară o turbină poate fotografia o piesă sau poate solicita: “Show me the wiring diagram for the hydraulic pump assembly.”
Schimbarea: ColQwen3 identifică reprezentarea vizuală a schemei electrice și găsește pagina corectă, putând reduce cu ore întregi timpul de nefuncționare.
Procesul de identificare a probelor juridice presupune examinarea a milioane de pagini scanate, unde informația căutată este adesea un marcaj vizual.
Fluxul de lucru: Un responsabil de conformitate poate căuta “Documents signed by the CFO” sau “Contracts containing the official ‘Confidential’ stamp.”
Schimbarea: Modelul distinge între o ciornă și un document final pe baza prezenței vizuale a semnăturilor sau ștampilelor, detaliu adesea omis de OCR.
ColQwen3 are ponderi deschise (Apache 2.0) și este disponibil acum pe Hugging Face. L-am conceput ca pe un upgrade direct pentru fluxurile RAG moderne, oferind codul de inferență necesar procesării imediate a textului, imaginilor și materialelor video.
Pentru companiile pregătite să depășească simpla căutare în text și să valorifice inteligența ascunsă în resursele lor vizuale, acesta este noul standard.
Pasul următor: Consultați fișa de model și încercați demonstrația live pe Hugging Face: /-colqwen3-embed-8b și /-colqwen3-embed-4b