Päänavigointi

Tekstiä pidemmälle: aidosti multimodaalinen, kokonaisvaltainen RAG

Multimodaaliset upotusmallit auttavat tiimejä hakemaan hyödyllistä tietoa suoraan monimutkaisista asiakirjoista, kuvista ja videoista.

Viimeisten kahden vuoden ajan RAG (Retrieval-Augmented Generation) on yhdistetty lähes yksinomaan tekstiin. Vakiintunut toimintamalli on yksinkertainen: asiakirjoista poimitaan teksti, joka pilkotaan osiin ja indeksoidaan.

Yritysmaailma ei kuitenkaan pyöri pelkillä tekstitiedostoilla. Sen arki koostuu monimutkaisista PDF-tiedostoista, tiheitä kaavioita sisältävistä esityksistä, CAD-piirustuksista, skannatuista laskuista ja yhä useammin valtavista videoarkistoista.

Alan vakiintunut tapa käsitellä niitä – kuvan ”kuvaileminen” tekstiksi OCR:n tai visuaalisten LLM-mallien avulla ennen upotusta – muodostaa valtavan pullonkaulan. Se on hidasta ja kallista, ja samalla alkuperäisen datan rikas tilallinen ja visuaalinen konteksti väistämättä katoaa. Jos tekoäly kuvailee monimutkaisen kuvan vain ”tekniseksi piirustukseksi”, siinä olevaa tiettyä venttiiliä tai kytkentäkaaviota ei enää voi hakea.

Julkaisemme tänään ColPali-arkkitehtuuriin perustuvan, alan huipputasoa edustavan multimodaalisten upotusmallien tuoteperheen. Se ratkaisee ongelman mahdollistamalla kokonaisvaltaisen visuaalisen haun.

Taikuuden taustalla oleva tekniikka: edistyneet hienosäätöstrategiat

Aidosti tehokkaan multimodaalisen hakujärjestelmän rakentaminen ei onnistu vain ottamalla käyttöön valmis visuaalinen kielimalli (VLM) ja pyytämällä sitä hakemaan. Loimme ColQwen3:n ratkaisemaan haasteet, jotka ovat aiemmin hidastaneet multimodaalisen RAG:n kehitystä. Hyödynsimme mallien yhdistämistä ja koulutusstrategioita.

1. Upotuskyvyn siirtäminen säädetyllä yhdistämispainotuksella

Sen sijaan, että olisimme hienosäätäneet perusmallin alusta asti, kehitimme menetelmän, jolla olemassa olevan tekstipohjaisen upotusmallin hakutehtäviä koskeva osaaminen siirretään uuteen malliin. Tavallinen VLM osaa kuvailla kuvia, mutta ei välttämättä osaa järjestää niitä kyselyyn nähden semanttiseen paremmuusjärjestykseen.

Kuromme tämän eron umpeen säädetyillä yhdistämispainotusstrategioilla. Kokeissamme havaitsimme, että Qwen3-Embeddingin hakukyky tekstin latentissa avaruudessa voitiin siirtää suoraan multimodaaliseen avaruuteen. Se yleistyi kuva- ja videohakuun jopa ilman välitöntä koulutusta. Hyödynsimme tätä tehokasta alustusta vahvana lähtökohtana ja hienosäädimme sitten mallia suorituskyvyn parantamiseksi ja toimintavarmuuden varmistamiseksi. Tämä parantaa lopullista hakutulosta verrattuna Qwen3-VL-perusmallin hienosäätöön.

2. Hyperparametrien huolellinen säätö

Kun upotuskyvyt oli siirretty, keskityimme kohdistukseen. Maksimoimme hakusuorituskyvyn huolellisilla hyperparametrihauilla ja ablaatiotutkimuksilla. Niissä tarkastelimme muun muassa optimaalista epookkien määrää, eräkokoa, oppimisnopeutta, LoRA-rankia ja datajoukkojen yhdistelmää.

Valitsimme hienosäätöaineistoiksi VDR:n, ColPali-koulutusaineiston, visrag_synin ja visrag_indin. Käytimme hienosäädössä UniMax-otantaa. Koska yhdistimme malleja ja yhdistetty perusmalli peri jo osan multimodaalisesta hakukyvystä, havaitsimme uusien datajoukkojen lisäämisen heikentävän suorituskykyä hieman. Siksi emme kasvattaneet niiden määrää.

Valitsimme hienosäätöön seuraavat hyperparametrit:

LoRA-rank

32

LoRA-alfa

32

LoRA-kohdemoduulit

kaikki kuva- ja tekstitasot upotusta lukuun ottamatta

Oppimisnopeus

5e-5

Visuaalisten tokenien enimmäismäärä

1280

Koulutusepookit

1

Globaali eräkoko

512

Lämmittelysuhde

5%

3. ”ColBERT”-pulma: hyvä suorituskyky vai pienet tallennuskustannukset

”ColBERT-tyylisiä” token-tason upotuksia käyttävät mallit, kuten ColPali, ovat perinteisesti tarjonneet erinomaista suorituskykyä mutta kohtuuttoman suurin tallennuskustannuksin. Jokaisen visuaalisen tokenin indeksointi loi valtavia vektoritietokantoja, jotka olivat liian kalliita yritystason käyttöön.

  • Optimointistrategia: Ratkaisimme tallennushaasteen tasapainottamalla upotusten koon huolellisesti niin, että suorituskyky säilyy mahdollisimman hyvänä mutta tallennuskustannukset eivät karkaa käsistä. SOTA-tason tarkkuuden säilyttämiseksi tässä tehokkaassa koossa valitsimme ulottuvuuksien määräksi 320, sillä se tasapainottaa parhaiten hakusuorituskyvyn ja tallennuskustannukset.

    • Vertailutaso: Tavallinen ratkaisu, kuten NVIDIA Nemo-3B, tarvitsee noin 10,3 Tt miljoonan kuvan upotusten tallentamiseen (1 802 tokenia × 3 072 ulottuvuutta).

    • ColQwen3: Tallentaa samat miljoona kuvaa vain 0,82 teratavuun (enintään 1 280 tokenia × 320 ulottuvuutta).

ColQwen3 saavuttaa SOTA-tason hakutarkkuuden paisuttamatta pilvi-infrastruktuurin budjettia.

Arviointitulokset

Validoimme lähestymistapamme ViDoRe-vertailutestikokonaisuudella. Tulokset vahvistavat, että ColQwen3 asettaa uuden tason uusimmissa V3- ja V2-vertailutesteissä sekä englanniksi että monikielisesti ja säilyttää samalla huipputason suorituskyvyn aiemmissa V1-tehtävissä.

ViDoRe v3 (uusin)

ColQwen3-8B johtaa englanninkielisessä ja monikielisessä haussa.

Englanninkielinen nDCG@5

Malli

Tietojenkäsittely

Energia

Rahoitus

HR

Teoll.

Lääketeoll.

Fysiikka

Keskiarvo

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Monikielinen nDCG@5

Malli

Tietojenkäsittely

Energia

Rahoitus

HR

Teoll.

Lääketeoll.

Fysiikka

Keskiarvo

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2:n ja v1:n kohokohdat

Tasaisen hyvä suorituskyky ESG:ssä, taloustieteessä ja DocVQA:ssa.

Vertailutesti

Malli

Tulos (keskiarvo)

Merkittävä voitto

ViDoRe V2 (englanti)

ColQwen3-8B

0.6772

1. sija ESG:ssä ja BioMedissä

ViDoRe V2 (monikielinen)

ColQwen3-8B

0.6085

1. sija taloustieteessä

ViDoRe V1 (englanti)

Nemo ColEmbed 3B

0.9100

Hieman parempi keskiarvo

ViDoRe V1 (englanti)

ColQwen3-8B

0.9076

1. sija ArxivQA:ssa ja Syn-Govissa

Videohaku: CareBench-arviointi

Osoittaaksemme, että ColQwen3 yleistyy tehokkaasti videohakuun, arvioimme mallit CareBench-vertailutestin tekstistä videoon -tehtävillä (General Retrieval).

Käytimme arvioinnissa raakavideon koodausta: mallimme koodasivat videotiedostot suoraan ilman tekstimuotoisia huomautuksia tai metatietoja. Tämä osoittaa mallin pystyvän hakemaan sisältöä pelkästään visuaalisen merkityksen perusteella.

Malli

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

”Pimeän datan” avaaminen: videon edistynyt hyödyntäminen

Yksi ColQwen3:n mahdollistamista merkittävimmistä muutoksista on kyky käsitellä videoita samalla tavalla kuin asiakirjoja. Monissa yrityksissä video on ”pimeää dataa”. Se lojuu kylmäsäilytyksessä täysin hakukelvottomana, ellei ihminen ole merkinnyt jokaista tiedostoa käsin.

ColQwen3 muuttaa tämän mahdollistamalla segmentoitujen leikkeiden kuvakohtaisen haun.

Käyttötapaus: yrityksen muistipankki

Yritykset tallentavat päivittäin tuhansia tunteja sisäisiä videokokouksia, ja yleensä tallenteet katoavat tyhjyyteen.

  • Työnkulku: Kun pitkät kokoustallenteet segmentoidaan automaattisesti lyhyemmiksi, loogisiksi leikkeiksi ja indeksoidaan ColQwen3:lla, syntyy haettava ”yritysmuisti”.

  • Kysely: Projektipäällikkö voi pyytää: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Tulos: Järjestelmä ei palauta 60 minuutin videotiedostoa vaan juuri sen 45 sekunnin jakson, jossa kyseinen kaavio näytettiin ruudulla ja siitä keskusteltiin – vaikka puhujat eivät olisi sillä hetkellä sanoneet sanaa ”latenssi”.

Yrityskäyttö: arvokkaiden ongelmien ratkaiseminen

Siirtyminen natiivisti multimodaalisiin upotuksiin mahdollistaa täysin uusia työnkulkuja eri toimialoilla. Olemme testanneet tätä mallia kattavasti eräissä yritysten monimutkaisimmista dataympäristöistä.

1. Vertailutestin kohokohta: kaupunkikonsultointi ja arkkitehtuuri

Testasimme ColQwen3:a kaupunkikonsulttiyritysten datahaasteissa. Ne hallinnoivat valtavia kokoelmia yleissuunnitelmia, kaavoituskarttoja ja monimutkaisia rakennuspiirustuksia.

  • Haaste: Perinteiset RAG-putket toimivat näissä ympäristöissä heikosti. OCR-työkalut kuvailevat monimutkaiset asemapiirrokset yleensä vain ”kaavioiksi”, jolloin liikennevirtoja, viheralueita tai rakennusten etäisyyksiä koskevat olennaiset tiedot jäävät huomaamatta.

  • Suorituskyky: Sisäiset vertailutestimme osoittavat, että ColQwen3 poistaa tehokkaasti kalliin OCR- ja kuvailuesikäsittelyn tarpeen. Tiheitä arkkitehtuuripiirustuksia sisältävissä testeissä malli löysi asiakirjoja esimerkiksi jalankulkureittien ja selkeiden kaavarajojen kaltaisten visuaalisten merkkien perusteella. Se päihitti selvästi vain tekstiä käyttävät vertailumallit ja lupaa samalla pienentää tiedon käsittelykustannuksia huomattavasti.

2. Monimutkainen rahoitus- ja markkinatieto

Investointipankkiirit ja analyytikot käyttävät tuhansia tunteja vuosikertomusten ja sijoittajaesitysten läpikäyntiin.

  • Työnkulku: Analyytikko voi pyytää: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Muutos: Avainsanojen täsmäyttämisen sijaan malli hakee täsmälleen oikean dian tietyn datavisualisoinnin perusteella, jolloin RAG-järjestelmä pystyy vastaamaan kysymyksiin erittäin tarkasti.

3. Teollinen valmistus ja kenttähuolto

Valmistavilla yrityksillä on valtavia teknisten oppaiden ja putkisto- ja instrumentointikaavioiden (P&ID) kokoelmia.

  • Työnkulku: Turbiinia korjaava kenttäinsinööri voi ottaa osasta valokuvan tai pyytää: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Muutos: ColQwen3 tunnistaa kytkentäkaavion visuaalisen esityksen ja hakee oikean sivun, mikä voi lyhentää käyttökatkoa tunneilla.

4. Oikeudelliset asiat ja vaatimustenmukaisuus

Oikeudellisessa aineistonhaussa käydään läpi miljoonia skannattuja sivuja, joilla ”neula heinäsuovassa” on usein visuaalinen merkki.

  • Työnkulku: Vaatimustenmukaisuudesta vastaava henkilö voi hakea ilmauksilla “Documents signed by the CFO” tai “Contracts containing the official ‘Confidential’ stamp.”

  • Muutos: Malli erottaa luonnoksen viimeistellystä asiakirjasta allekirjoitusten tai leimojen visuaalisen esiintymisen perusteella – asia, joka jää pelkältä OCR:ltä usein huomaamatta.

Aloittaminen

ColQwen3:n painot ovat avoimia (Apache 2.0), ja malli on nyt saatavilla Hugging Facessa. Se on suunniteltu helposti käyttöönotettavaksi päivitykseksi nykyaikaisiin RAG-putkiin, ja mukana toimitetaan tekstin, kuvien ja videoiden välittömään käsittelyyn tarvittava inferenssikoodi.

Tämä on uusi standardi yrityksille, jotka ovat valmiita siirtymään yksinkertaista tekstihakua pidemmälle ja hyödyntämään visuaaliseen aineistoonsa kätkeytyvää tietoa.

Seuraava vaihe: Tutustu mallikorttiin ja kokeile Hugging Facen live-esittelyä: /-colqwen3-embed-8b ja /-colqwen3-embed-4b

Kirjoittaja

Xin Huang ja Kye Min Tan