Viimeisten kahden vuoden ajan RAG (Retrieval-Augmented Generation) on yhdistetty lähes yksinomaan tekstiin. Vakiintunut toimintamalli on yksinkertainen: asiakirjoista poimitaan teksti, joka pilkotaan osiin ja indeksoidaan.
Yritysmaailma ei kuitenkaan pyöri pelkillä tekstitiedostoilla. Sen arki koostuu monimutkaisista PDF-tiedostoista, tiheitä kaavioita sisältävistä esityksistä, CAD-piirustuksista, skannatuista laskuista ja yhä useammin valtavista videoarkistoista.
Alan vakiintunut tapa käsitellä niitä – kuvan ”kuvaileminen” tekstiksi OCR:n tai visuaalisten LLM-mallien avulla ennen upotusta – muodostaa valtavan pullonkaulan. Se on hidasta ja kallista, ja samalla alkuperäisen datan rikas tilallinen ja visuaalinen konteksti väistämättä katoaa. Jos tekoäly kuvailee monimutkaisen kuvan vain ”tekniseksi piirustukseksi”, siinä olevaa tiettyä venttiiliä tai kytkentäkaaviota ei enää voi hakea.
Julkaisemme tänään ColPali-arkkitehtuuriin perustuvan, alan huipputasoa edustavan multimodaalisten upotusmallien tuoteperheen. Se ratkaisee ongelman mahdollistamalla kokonaisvaltaisen visuaalisen haun.
Aidosti tehokkaan multimodaalisen hakujärjestelmän rakentaminen ei onnistu vain ottamalla käyttöön valmis visuaalinen kielimalli (VLM) ja pyytämällä sitä hakemaan. Loimme ColQwen3:n ratkaisemaan haasteet, jotka ovat aiemmin hidastaneet multimodaalisen RAG:n kehitystä. Hyödynsimme mallien yhdistämistä ja koulutusstrategioita.
Sen sijaan, että olisimme hienosäätäneet perusmallin alusta asti, kehitimme menetelmän, jolla olemassa olevan tekstipohjaisen upotusmallin hakutehtäviä koskeva osaaminen siirretään uuteen malliin. Tavallinen VLM osaa kuvailla kuvia, mutta ei välttämättä osaa järjestää niitä kyselyyn nähden semanttiseen paremmuusjärjestykseen.
Kuromme tämän eron umpeen säädetyillä yhdistämispainotusstrategioilla. Kokeissamme havaitsimme, että Qwen3-Embeddingin hakukyky tekstin latentissa avaruudessa voitiin siirtää suoraan multimodaaliseen avaruuteen. Se yleistyi kuva- ja videohakuun jopa ilman välitöntä koulutusta. Hyödynsimme tätä tehokasta alustusta vahvana lähtökohtana ja hienosäädimme sitten mallia suorituskyvyn parantamiseksi ja toimintavarmuuden varmistamiseksi. Tämä parantaa lopullista hakutulosta verrattuna Qwen3-VL-perusmallin hienosäätöön.
Kun upotuskyvyt oli siirretty, keskityimme kohdistukseen. Maksimoimme hakusuorituskyvyn huolellisilla hyperparametrihauilla ja ablaatiotutkimuksilla. Niissä tarkastelimme muun muassa optimaalista epookkien määrää, eräkokoa, oppimisnopeutta, LoRA-rankia ja datajoukkojen yhdistelmää.
Valitsimme hienosäätöaineistoiksi VDR:n, ColPali-koulutusaineiston, visrag_synin ja visrag_indin. Käytimme hienosäädössä UniMax-otantaa. Koska yhdistimme malleja ja yhdistetty perusmalli peri jo osan multimodaalisesta hakukyvystä, havaitsimme uusien datajoukkojen lisäämisen heikentävän suorituskykyä hieman. Siksi emme kasvattaneet niiden määrää.
Valitsimme hienosäätöön seuraavat hyperparametrit:
LoRA-rank | 32 |
LoRA-alfa | 32 |
LoRA-kohdemoduulit | kaikki kuva- ja tekstitasot upotusta lukuun ottamatta |
Oppimisnopeus | 5e-5 |
Visuaalisten tokenien enimmäismäärä | 1280 |
Koulutusepookit | 1 |
Globaali eräkoko | 512 |
Lämmittelysuhde | 5% |
”ColBERT-tyylisiä” token-tason upotuksia käyttävät mallit, kuten ColPali, ovat perinteisesti tarjonneet erinomaista suorituskykyä mutta kohtuuttoman suurin tallennuskustannuksin. Jokaisen visuaalisen tokenin indeksointi loi valtavia vektoritietokantoja, jotka olivat liian kalliita yritystason käyttöön.
Optimointistrategia: Ratkaisimme tallennushaasteen tasapainottamalla upotusten koon huolellisesti niin, että suorituskyky säilyy mahdollisimman hyvänä mutta tallennuskustannukset eivät karkaa käsistä. SOTA-tason tarkkuuden säilyttämiseksi tässä tehokkaassa koossa valitsimme ulottuvuuksien määräksi 320, sillä se tasapainottaa parhaiten hakusuorituskyvyn ja tallennuskustannukset.
Vertailutaso: Tavallinen ratkaisu, kuten NVIDIA Nemo-3B, tarvitsee noin 10,3 Tt miljoonan kuvan upotusten tallentamiseen (1 802 tokenia × 3 072 ulottuvuutta).
ColQwen3: Tallentaa samat miljoona kuvaa vain 0,82 teratavuun (enintään 1 280 tokenia × 320 ulottuvuutta).
ColQwen3 saavuttaa SOTA-tason hakutarkkuuden paisuttamatta pilvi-infrastruktuurin budjettia.
Validoimme lähestymistapamme ViDoRe-vertailutestikokonaisuudella. Tulokset vahvistavat, että ColQwen3 asettaa uuden tason uusimmissa V3- ja V2-vertailutesteissä sekä englanniksi että monikielisesti ja säilyttää samalla huipputason suorituskyvyn aiemmissa V1-tehtävissä.
ColQwen3-8B johtaa englanninkielisessä ja monikielisessä haussa.
Englanninkielinen nDCG@5
Malli | Tietojenkäsittely | Energia | Rahoitus | HR | Teoll. | Lääketeoll. | Fysiikka | Keskiarvo |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Monikielinen nDCG@5
Malli | Tietojenkäsittely | Energia | Rahoitus | HR | Teoll. | Lääketeoll. | Fysiikka | Keskiarvo |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Tasaisen hyvä suorituskyky ESG:ssä, taloustieteessä ja DocVQA:ssa.
Vertailutesti | Malli | Tulos (keskiarvo) | Merkittävä voitto |
ViDoRe V2 (englanti) | ColQwen3-8B | 0.6772 | 1. sija ESG:ssä ja BioMedissä |
ViDoRe V2 (monikielinen) | ColQwen3-8B | 0.6085 | 1. sija taloustieteessä |
ViDoRe V1 (englanti) | Nemo ColEmbed 3B | 0.9100 | Hieman parempi keskiarvo |
ViDoRe V1 (englanti) | ColQwen3-8B | 0.9076 | 1. sija ArxivQA:ssa ja Syn-Govissa |
Osoittaaksemme, että ColQwen3 yleistyy tehokkaasti videohakuun, arvioimme mallit CareBench-vertailutestin tekstistä videoon -tehtävillä (General Retrieval).
Käytimme arvioinnissa raakavideon koodausta: mallimme koodasivat videotiedostot suoraan ilman tekstimuotoisia huomautuksia tai metatietoja. Tämä osoittaa mallin pystyvän hakemaan sisältöä pelkästään visuaalisen merkityksen perusteella.
Malli | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Yksi ColQwen3:n mahdollistamista merkittävimmistä muutoksista on kyky käsitellä videoita samalla tavalla kuin asiakirjoja. Monissa yrityksissä video on ”pimeää dataa”. Se lojuu kylmäsäilytyksessä täysin hakukelvottomana, ellei ihminen ole merkinnyt jokaista tiedostoa käsin.
ColQwen3 muuttaa tämän mahdollistamalla segmentoitujen leikkeiden kuvakohtaisen haun.
Yritykset tallentavat päivittäin tuhansia tunteja sisäisiä videokokouksia, ja yleensä tallenteet katoavat tyhjyyteen.
Työnkulku: Kun pitkät kokoustallenteet segmentoidaan automaattisesti lyhyemmiksi, loogisiksi leikkeiksi ja indeksoidaan ColQwen3:lla, syntyy haettava ”yritysmuisti”.
Kysely: Projektipäällikkö voi pyytää: “Show me the clip where the engineering lead explained the latency issue with the API.”
Tulos: Järjestelmä ei palauta 60 minuutin videotiedostoa vaan juuri sen 45 sekunnin jakson, jossa kyseinen kaavio näytettiin ruudulla ja siitä keskusteltiin – vaikka puhujat eivät olisi sillä hetkellä sanoneet sanaa ”latenssi”.
Siirtyminen natiivisti multimodaalisiin upotuksiin mahdollistaa täysin uusia työnkulkuja eri toimialoilla. Olemme testanneet tätä mallia kattavasti eräissä yritysten monimutkaisimmista dataympäristöistä.
Testasimme ColQwen3:a kaupunkikonsulttiyritysten datahaasteissa. Ne hallinnoivat valtavia kokoelmia yleissuunnitelmia, kaavoituskarttoja ja monimutkaisia rakennuspiirustuksia.
Haaste: Perinteiset RAG-putket toimivat näissä ympäristöissä heikosti. OCR-työkalut kuvailevat monimutkaiset asemapiirrokset yleensä vain ”kaavioiksi”, jolloin liikennevirtoja, viheralueita tai rakennusten etäisyyksiä koskevat olennaiset tiedot jäävät huomaamatta.
Suorituskyky: Sisäiset vertailutestimme osoittavat, että ColQwen3 poistaa tehokkaasti kalliin OCR- ja kuvailuesikäsittelyn tarpeen. Tiheitä arkkitehtuuripiirustuksia sisältävissä testeissä malli löysi asiakirjoja esimerkiksi jalankulkureittien ja selkeiden kaavarajojen kaltaisten visuaalisten merkkien perusteella. Se päihitti selvästi vain tekstiä käyttävät vertailumallit ja lupaa samalla pienentää tiedon käsittelykustannuksia huomattavasti.
Investointipankkiirit ja analyytikot käyttävät tuhansia tunteja vuosikertomusten ja sijoittajaesitysten läpikäyntiin.
Työnkulku: Analyytikko voi pyytää: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Muutos: Avainsanojen täsmäyttämisen sijaan malli hakee täsmälleen oikean dian tietyn datavisualisoinnin perusteella, jolloin RAG-järjestelmä pystyy vastaamaan kysymyksiin erittäin tarkasti.
Valmistavilla yrityksillä on valtavia teknisten oppaiden ja putkisto- ja instrumentointikaavioiden (P&ID) kokoelmia.
Työnkulku: Turbiinia korjaava kenttäinsinööri voi ottaa osasta valokuvan tai pyytää: “Show me the wiring diagram for the hydraulic pump assembly.”
Muutos: ColQwen3 tunnistaa kytkentäkaavion visuaalisen esityksen ja hakee oikean sivun, mikä voi lyhentää käyttökatkoa tunneilla.
Oikeudellisessa aineistonhaussa käydään läpi miljoonia skannattuja sivuja, joilla ”neula heinäsuovassa” on usein visuaalinen merkki.
Työnkulku: Vaatimustenmukaisuudesta vastaava henkilö voi hakea ilmauksilla “Documents signed by the CFO” tai “Contracts containing the official ‘Confidential’ stamp.”
Muutos: Malli erottaa luonnoksen viimeistellystä asiakirjasta allekirjoitusten tai leimojen visuaalisen esiintymisen perusteella – asia, joka jää pelkältä OCR:ltä usein huomaamatta.
ColQwen3:n painot ovat avoimia (Apache 2.0), ja malli on nyt saatavilla Hugging Facessa. Se on suunniteltu helposti käyttöönotettavaksi päivitykseksi nykyaikaisiin RAG-putkiin, ja mukana toimitetaan tekstin, kuvien ja videoiden välittömään käsittelyyn tarvittava inferenssikoodi.
Tämä on uusi standardi yrityksille, jotka ovat valmiita siirtymään yksinkertaista tekstihakua pidemmälle ja hyödyntämään visuaaliseen aineistoonsa kätkeytyvää tietoa.
Seuraava vaihe: Tutustu mallikorttiin ja kokeile Hugging Facen live-esittelyä: /-colqwen3-embed-8b ja /-colqwen3-embed-4b