Viimased kaks aastat on „RAG“ (otsinguga täiendatud genereerimine) olnud peaaegu eranditult teksti sünonüüm. Tavapärane tööviis on lihtne: võta dokumendid, eralda tekst, jaga see lõikudeks ja indekseeri.
Ettevõtlusmaailm ei põhine aga lihttekstifailidel. See tugineb keerukatele PDF-idele, tihedate diagrammidega esitlustele, CAD-joonistele, skannitud arvetele ja üha enam ka tohututele videoarhiividele.
Valdkonna tavalahendus, kus pilt enne vektoresituse loomist OCR-i või nägemispõhise LLM-i abil tekstiks „kirjeldatakse“, tekitab tohutu pudelikaela. See on aeglane ja kulukas ning kaotab paratamatult algandmete rikkaliku ruumilise ja visuaalse konteksti. Kui tehisaru kirjeldab keerukat visuaali lihtsalt „projektijoonisena“, pole enam võimalik otsida sellelt konkreetset ventiili või elektriskeemi.
Täna avaldame ColPali arhitektuuril põhineva tipptasemel multimodaalsete vektoresitusmudelite perekonna, mis lahendab selle probleemi, võimaldades täielikku visuaalset otsingut algusest lõpuni.
Tõeliselt tõhusa multimodaalse otsingumootori loomine pole nii lihtne, et võtta valmis nägemis-keelemudel (VLM) ja paluda sellel otsida. Multimodaalset RAG-i seni piiranud probleemide lahendamiseks ja ColQwen3 loomiseks kasutasime mudelite liitmise ja treenimise strateegiaid.
Selle asemel et baasmudelit nullist peenhäälestada, töötasime välja meetodi otsinguülesannete teadmiste ülekandmiseks olemasolevast tekstipõhisest vektoresitusmudelist. Tavaline VLM oskab pilte kirjeldada, kuid ei pruugi osata neid päringu suhtes semantiliselt järjestada.
Selle lünga ületamiseks kasutasime häälestatud liitkaalude strateegiaid. Katsetes leidsime, et Qwen3-Embeddingu otsinguvõime tekstilises latentses ruumis saab otse multimodaalsesse ruumi üle kanda ning see üldistub pildi- ja videootsingule isegi ilma kohese treenimiseta. Kasutasime seda tõhusat lähtestust tugeva lähtepunktina ning peenhäälestasime seejärel mudelit, et jõudlust veelgi optimeerida ja töökindlus tagada. See parandab lõplikku otsingujõudlust võrreldes Qwen3-VL-i baasmudeli peenhäälestamisega.
Pärast vektoresituse loomise võime ülekandmist keskendusime joondamisele. Maksimaalse otsingujõudluse saavutamiseks tegime põhjalikke hüperparameetriotsinguid ja ablatsiooniuuringuid, mis hõlmasid optimaalset epohhide arvu, paketi suurust, õppemäära, LoRA järku ja andmestike kombinatsiooni.
Peenhäälestuse andmestikeks valisime VDR-i, ColPali treeningandmestiku, visrag_syn-i ja visrag_ind-i. Kasutasime peenhäälestamiseks UniMaxi valimi moodustamist. Kuna kasutasime mudelite liitmist ja liidetud baasmudel pärib juba osa multimodaalse otsingu võimest, leidsime, et andmestike arvu suurendamine vähendaks jõudlust veidi. Seetõttu me rohkem andmestikke ei lisanud.
Peenhäälestuseks valisime järgmised hüperparameetrid:
LoRA järk | 32 |
LoRA alfa | 32 |
LoRA sihtmoodulid | nii pildi kui ka teksti kõik kihid, välja arvatud vektoresituskiht |
Õppemäär | 5e-5 |
Visuaalsete tokenite maksimumarv | 1280 |
Treeningepohhid | 1 |
Üldine paketisuurus | 512 |
Soojendusosakaal | 5% |
Ajalooliselt on „ColBERT-i laadseid“ tokenitaseme vektoresitusi kasutavad mudelid (näiteks ColPali) pakkunud erakordset jõudlust, kuid lubamatult suure salvestuskuluga. Iga visuaalse tokeni indekseerimine tekitas tohutuid vektorandmebaase, mis olid ettevõtete mastaabis liiga kulukad.
Optimeerimisstrateegia: lahendasime salvestusprobleemi, tasakaalustades hoolikalt vektoresituste suurust, et säilitada maksimaalne jõudlus ilma salvestuskulude plahvatusliku kasvuta. Tipptasemel täpsuse säilitamiseks sellise tõhusa mahuga valisime mõõtmete arvuks 320, mis pakub otsingujõudluse ja salvestuskulu parimat tasakaalu.
Võrdluslahendus: tavapärane lähenemisviis (näiteks NVIDIA Nemo-3B) vajab miljoni pildi vektoresituste salvestamiseks ligikaudu 10,3 TB (1802 tokenit × 3072 mõõdet).
ColQwen3: salvestab sama miljon pilti vaid 0,82 TB mahuga (kuni 1280 tokenit × 320 mõõdet).
ColQwen3 saavutab tipptasemel otsingutäpsuse ilma pilvetaristu eelarvet lõhki ajamata.
Valideerisime oma lähenemisviisi ViDoRe võrdlustestide komplektiga. Tulemused kinnitavad, et ColQwen3 seab uusimates V3 ja V2 võrdlustestides (nii ingliskeelsetes kui ka mitmekeelsetes) uue standardi, säilitades samal ajal tipptasemel jõudluse varasemates V1 ülesannetes.
ColQwen3-8B on ingliskeelses ja mitmekeelses otsingus esikohal.
Ingliskeelne nDCG@5
Mudel | Arvutiteadus | Energeetika | Rahandus | Personal | Tööstus | Farmaatsia | Füüsika | Keskm. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Mitmekeelne nDCG@5
Mudel | Arvutiteadus | Energeetika | Rahandus | Personal | Tööstus | Farmaatsia | Füüsika | Keskm. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Ühtlaselt hea jõudlus ESG, majanduse ja DocVQA ülesannetes.
Võrdlustest | Mudel | Tulemus (keskm.) | Märkimisväärne võit |
ViDoRe V2 (ingliskeelne) | ColQwen3-8B | 0.6772 | 1. koht ESG-s & BioMedis |
ViDoRe V2 (mitmekeelne) | ColQwen3-8B | 0.6085 | 1. koht majanduses |
ViDoRe V1 (ingliskeelne) | Nemo ColEmbed 3B | 0.9100 | Veidi kõrgem keskmine |
ViDoRe V1 (ingliskeelne) | ColQwen3-8B | 0.9076 | 1. koht ArxivQA-s & Syn-Govis |
Et näidata ColQwen3 head üldistusvõimet videootsingus, hindasime mudeleid teksti põhjal videote otsimise (General Retrieval) ülesannete CareBenchi võrdlustestiga.
Selles hindamises kasutasime video vahetu kodeerimise meetodit: meie mudelid kodeerisid videofailid otse, ilma täiendavate tekstimärkuste või metaandmeteta. See toob esile mudeli võime otsida üksnes visuaalse semantika põhjal.
Mudel | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Üks ColQwen3 võimaldatud põhjalikumaid muutusi on võime käsitleda videot samamoodi nagu dokumente. Paljudes ettevõtetes on video „tumeandmed“. See seisab külmhoidlas ja on täiesti otsimatu, kui inimene pole iga faili käsitsi sildistanud.
ColQwen3 muudab seda, võimaldades segmenditud klippidest kaadrite kaupa otsida.
Ettevõtted salvestavad iga päev tuhandeid tunde sisekoosolekuid ning tavaliselt vajuvad need salvestised unustusse.
Töövoog: pikkade koosolekusalvestiste automaatne jagamine lühemateks loogilisteks klippideks ja nende indekseerimine ColQwen3-ga loob otsitava „ettevõtte mälu“.
Päring: projektijuht võib küsida: “Show me the clip where the engineering lead explained the latency issue with the API.”
Tulemus: 60-minutilise videofaili asemel leiab süsteem täpselt selle 45-sekundilise lõigu, kus konkreetset skeemi ekraanil näidati ja arutati, isegi kui kõnelejad ei öelnud sel hetkel sõna „latentsus“.
Üleminek natiivsele multimodaalsele vektoresitusele avab eri valdkondades täiesti uued töövood. Oleme seda mudelit põhjalikult testinud mõnes kõige keerukamas ettevõtte andmekeskkonnas.
Testisime ColQwen3 mudelit linnakonsultatsioonifirmade andmeprobleemidega. Need firmad haldavad tohutuid üldplaneeringute, tsoneerimiskaartide ja keerukate arhitektuursete fassaadijooniste kogusid.
Probleem: neis keskkondades jäävad tavapärased RAG-konveierid hätta. OCR-tööriistad kirjeldavad keerukaid asendiplaane tavaliselt lihtsalt „skeemina“, jättes tähelepanuta olulised üksikasjad liiklusvoo, haljasalade või hoonete taandekauguste kohta.
Jõudlus: meie sisemised võrdlustestid näitavad, et ColQwen3 võimaldab kulukast OCR-i ja pildikirjelduste eeltöötlusest tõhusalt loobuda. Tihedate arhitektuurijoonistega katsetes leidis mudel edukalt dokumente konkreetsete visuaalsete tunnuste, näiteks jalakäijate juurdepääsupunktide või selgelt eristuvate tsoneerimispiiride põhjal. See ületas märkimisväärselt ainult tekstil põhinevaid võrdluslahendusi ja lubab järsult vähendada teadmiste sisestamise kulusid.
Investeerimispankurid ja analüütikud kulutavad tuhandeid tunde aastaaruannete ja investoritele mõeldud esitluste läbitöötamisele.
Töövoog: analüütik võib küsida: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Muutus: märksõnavastetele tuginemise asemel leiab mudel täpse slaidi konkreetse andmevisualiseeringu visuaalse olemasolu põhjal, võimaldades RAG-süsteemil küsimustele väga täpselt vastata.
Tootmisettevõtetel on tohutud tehniliste juhendite ning torustiku- ja mõõteriistadiagrammide (P&ID) kogud.
Töövoog: turbiini parandav väliinsener võib detailist foto teha või küsida: “Show me the wiring diagram for the hydraulic pump assembly.”
Muutus: ColQwen3 tuvastab elektriskeemi visuaalse kujutise ja leiab õige lehekülje, lühendades potentsiaalselt seisakut tundide võrra.
Õigusliku teabe otsimisel tuleb läbi vaadata miljoneid skannitud lehekülgi, kus otsitav „nõel“ on sageli visuaalne tunnus.
Töövoog: vastavuskontrolli spetsialist võib otsida “Documents signed by the CFO” või “Contracts containing the official ‘Confidential’ stamp.”
Muutus: mudel eristab allkirjade või templite visuaalse olemasolu põhjal mustandit lõplikust dokumendist – midagi, mis jääb üksnes OCR-ile sageli märkamatuks.
ColQwen3 on avatud kaaludega (Apache 2.0) ja nüüd Hugging Face'is saadaval. Kavandasime selle tänapäevaste RAG-konveierite hõlpsaks täiendusmudeliks ning lisasime teksti, piltide ja videote koheseks töötlemiseks vajaliku inferentsikoodi.
Ettevõtetele, kes on valmis lihtsast tekstiotsingust edasi liikuma ja oma visuaalvarades peituva teabe avama, on see uus standard.
Järgmine samm: tutvuge mudeli kaardiga ja proovige Hugging Face'is reaalajas demo: /-colqwen3-embed-8b ja /-colqwen3-embed-4b