Galvenā navigācija

Ārpus teksta: patiesi multimodāls pilna cikla RAG

Multimodālo iegulto attēlojumu modeļi palīdz komandām izgūt noderīgu informāciju tieši no sarežģītiem dokumentiem, attēliem un video.

Pēdējos divus gadus „RAG” (izguves papildināta ģenerēšana) ir bijis gandrīz pilnībā saistīts ar tekstu. Standarta pieeja ir vienkārša: paņemt dokumentus, izvilkt tekstu, sadalīt to fragmentos un indeksēt.

Taču uzņēmumu pasaule nebalstās uz vienkārša teksta failiem. Tās pamatā ir sarežģīti PDF faili, prezentācijas ar blīvām diagrammām, CAD rasējumi, skenēti rēķini un arvien biežāk arī milzīgi videoierakstu arhīvi.

Nozares standarta pieeja — izmantot OCR vai vizuālos lielos valodas modeļus, lai pirms iegulšanas attēlu „aprakstītu” tekstā, — rada milzīgu sastrēgumu. Tā ir lēna un dārga, turklāt neizbēgami zaudē sākotnējo datu bagātīgo telpisko un vizuālo kontekstu. Ja MI sarežģītu vizuālo materiālu apraksta vienkārši kā „rasējumu”, vairs nav iespējams tajā meklēt konkrētu vārstu vai elektroinstalācijas shēmu.

Šodien mēs izlaižam mūsdienīgāko multimodālo iegulto attēlojumu modeļu saimi, kas balstīta uz ColPali arhitektūru un izstrādāta šīs problēmas risināšanai, nodrošinot pilna cikla vizuālo izguvi.

Maģijas inženiertehniskais pamats: progresīvas pielāgošanas stratēģijas

Patiesi efektīvu multimodālu izguves sistēmu nevar izveidot, vienkārši paņemot gatavu vizuālās valodas modeli (VLM) un liekot tam meklēt. Lai pārvarētu šķēršļus, kas līdz šim kavējuši multimodālo RAG, un izveidotu ColQwen3, mēs izmantojām modeļu apvienošanas un apmācības stratēģijas.

1. Iegulto attēlojumu spēju pārnese ar pielāgotiem apvienošanas svariem

Tā vietā, lai no nulles pielāgotu bāzes modeli, mēs izstrādājām metodi izguves uzdevumu zināšanu pārnesei no esoša teksta iegulto attēlojumu modeļa. Standarta VLM prot aprakstīt attēlus, taču ne vienmēr prot tos semantiski sarindot atbilstoši vaicājumam.

Lai novērstu šo trūkumu, izmantojām pielāgotas apvienošanas svaru stratēģijas. Eksperimentos atklājām, ka Qwen3-Embedding izguves spēju teksta latentajā telpā var tieši pārnest uz multimodālo telpu, vispārinot to attēlu un video izguvei pat bez tūlītējas apmācības. Izmantojot šo efektīvo inicializāciju kā stabilu sākumpunktu, mēs pēc tam pielāgojām modeli, lai vēl vairāk optimizētu tā veiktspēju un nodrošinātu noturību. Salīdzinājumā ar Qwen3-VL bāzes modeļa pielāgošanu tas uzlabo izguves gala veiktspēju.

2. Rūpīga hiperparametru pielāgošana

Kad iegulto attēlojumu spējas bija pārnestas, pievērsāmies salāgošanai. Lai maksimāli uzlabotu izguves veiktspēju, veicām rūpīgu hiperparametru meklēšanu un ablācijas pētījumus, tostarp noteicām optimālo epohu skaitu, paketes lielumu, mācīšanās ātrumu, LoRA rangu un datu kopu kombināciju.

Pielāgošanai izvēlējāmies datu kopas VDR, ColPali train set, visrag_syn, un visrag_ind. Pielāgošanā izmantojām UniMax iztveršanu. Tā kā izmantojām modeļu apvienošanu un apvienotais bāzes modelis jau daļēji pārmanto multimodālas izguves spējas, konstatējām, ka vairāk datu kopu pat nedaudz pasliktinātu veiktspēju, tāpēc to skaitu nepalielinājām.

Pielāgošanai izvēlējāmies šādus hiperparametrus:

LoRA rangs

32

LoRA alfa

32

LoRA mērķa moduļi

visi attēlu un teksta slāņi, izņemot iegulšanas slāni

Mācīšanās ātrums

5e-5

Maksimālais vizuālo tekstvienību skaits

1280

Apmācības epohas

1

Globālais paketes lielums

512

Iesildīšanās proporcija

5%

3. „ColBERT” dilemma: augsta veiktspēja vai zemas glabāšanas izmaksas

Vēsturiski modeļi ar „ColBERT tipa” tekstvienību līmeņa iegultajiem attēlojumiem, piemēram, ColPali, nodrošināja izcilu veiktspēju, taču to glabāšanas izmaksas bija pārmērīgas. Katras vizuālās tekstvienības indeksēšana radīja milzīgas vektoru datubāzes, kas uzņēmumu mērogā bija pārāk dārgas.

  • Optimizācijas stratēģija: glabāšanas problēmu atrisinājām, rūpīgi līdzsvarojot iegulto attēlojumu lielumu, lai saglabātu maksimālu veiktspēju un nepieļautu strauju glabāšanas izmaksu pieaugumu. Lai šādā efektīvā apjomā saglabātu SOTA precizitāti, izvēlējāmies 320 dimensijas, kas nodrošina vislabāko līdzsvaru starp izguves veiktspēju un glabāšanas izmaksām.

    • Bāzes pieeja: standarta risinājumam, piemēram, NVIDIA Nemo-3B, viena miljona attēlu iegulto attēlojumu glabāšanai vajag aptuveni 10.3 TB (1,802 tekstvienības × 3,072 dimensijas).

    • ColQwen3: tādu pašu vienu miljonu attēlu glabā tikai 0.82 TB (ne vairāk kā 1,280 tekstvienības × 320 dimensijas).

ColQwen3 sasniedz SOTA izguves precizitāti, nesadārdzinot mākoņinfrastruktūru.

Novērtēšanas rezultāti

Mēs pārbaudījām savu pieeju ViDoRe etalonuzdevumu kopā. Rezultāti apstiprina, ka ColQwen3 nosaka jaunus standartus jaunākajos V3 un V2 etalonuzdevumos gan angļu, gan vairākvalodu kategorijā, vienlaikus saglabājot izcilu veiktspēju iepriekšējos V1 uzdevumos.

ViDoRe V3 (jaunākā versija)

ColQwen3-8B ir līderis informācijas izguvē angļu un vairākvalodu kategorijā.

Angļu valodas nDCG@5

Modelis

Datorzinātne

Enerģētika

Finanses

Personālvadība

Rūpn.

Farmācija

Fizika

Vid.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Vairākvalodu nDCG@5

Modelis

Datorzinātne

Enerģētika

Finanses

Personālvadība

Rūpn.

Farmācija

Fizika

Vid.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe V2 un V1 būtiskākie rezultāti

Stabili augsta veiktspēja ESG, ekonomikas un DocVQA uzdevumos.

Etalonuzdevums

Modelis

Rezultāts (vid.)

Ievērojams sasniegums

ViDoRe V2 (angļu)

ColQwen3-8B

0.6772

1. vieta ESG & BioMed

ViDoRe V2 (vairākvalodu)

ColQwen3-8B

0.6085

1. vieta ekonomikā

ViDoRe V1 (angļu)

Nemo ColEmbed 3B

0.9100

Nedaudz augstāks vidējais rezultāts

ViDoRe V1 (angļu)

ColQwen3-8B

0.9076

1. vieta ArxivQA & Syn-Gov

Video izguve: CareBench novērtējums

Lai parādītu, ka ColQwen3 spēj labi vispārināt video izguves uzdevumus, mēs novērtējām modeļus CareBench teksta–video etalonuzdevumos (vispārīgā izguve).

Šajā novērtējumā izmantojām neapstrādāta video kodēšanu: mūsu modeļi kodēja video failus tieši, bez papildu teksta anotācijām vai metadatiem. Tas apliecina modeļa spēju izgūt informāciju, balstoties tikai uz vizuālo semantiku.

Modelis

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

„Tumšo datu” izmantošana: video robežšķirtne

Viena no nozīmīgākajām ColQwen3 sniegtajām pārmaiņām ir spēja apstrādāt video tāpat kā dokumentus. Daudzos uzņēmumos video ir „tumšie dati”. Tie glabājas aukstajā krātuvē un nav atrodami, ja vien cilvēks nav manuāli marķējis katru failu.

ColQwen3 to maina, nodrošinot izguvi pa kadriem segmentētos videoklipos.

Lietošanas piemērs: uzņēmuma atmiņas krātuve

Uzņēmumi ik dienu ieraksta tūkstošiem stundu iekšējo videosapulču, un parasti šie ieraksti pazūd nebūtībā.

  • Darbplūsma: automātiski sadalot garus sapulču ierakstus īsākos, loģiskos fragmentos un indeksējot tos ar ColQwen3, var izveidot meklējamu „uzņēmuma atmiņu”.

  • Vaicājums: projektu vadītājs var lūgt: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Rezultāts: 60 minūšu video faila vietā sistēma izgūst precīzu 45 sekunžu fragmentu, kurā ekrānā tika parādīta un apspriesta konkrētā diagramma, pat ja runātāji tieši tajā brīdī neizrunāja vārdu „latentums”.

Lietojums uzņēmumos: vērtīgu problēmu risināšana

Pāreja uz sākotnēji multimodāliem iegultajiem attēlojumiem paver pilnīgi jaunas darbplūsmas dažādās nozarēs. Mēs esam rūpīgi pārbaudījuši šo modeli dažās no sarežģītākajām uzņēmumu datu vidēm.

1. Etalonuzdevuma rezultāti: pilsētvides konsultācijas un arhitektūra

Mēs pārbaudījām ColQwen3 ar datu izaicinājumiem, ar kuriem saskaras pilsētvides konsultāciju uzņēmumi, pārvaldot milzīgas ģenerālplānu, zonējuma karšu un sarežģītu arhitektūras fasāžu kolekcijas.

  • Izaicinājums: tradicionālajām RAG konveijeru sistēmām šādās vidēs rodas grūtības. OCR rīki sarežģītus teritoriju plānus parasti apraksta vienkārši kā „shēmu”, neietverot būtisku informāciju par satiksmes plūsmu, zaļajām zonām vai būvju atkāpēm.

  • Veiktspēja: mūsu iekšējie etalonuzdevumi liecina, ka ColQwen3 efektīvi novērš vajadzību pēc dārgas OCR un attēlu aprakstīšanas priekšapstrādes. Pārbaudēs ar blīviem arhitektūras rasējumiem modelis sekmīgi izguva dokumentus pēc konkrētām vizuālām pazīmēm, piemēram, gājēju piekļuves punktiem vai skaidrām zonējuma robežām. Tas ievērojami pārspēja tikai tekstu izmantojošās bāzes pieejas un ļauj būtiski samazināt zināšanu ievades izmaksas.

2. Sarežģīta finanšu un tirgus analīze

Investīciju baņķieri un analītiķi pavada tūkstošiem stundu, pārskatot gada pārskatus un investoru prezentācijas.

  • Darbplūsma: analītiķis var lūgt: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Pārmaiņa: tā vietā, lai paļautos uz atslēgvārdu atbilstību, modelis izgūst precīzo slaidu pēc konkrētās datu vizualizācijas klātbūtnes, ļaujot RAG sistēmai ļoti precīzi atbildēt uz jautājumiem.

3. Rūpnieciskā ražošana un izbraukuma serviss

Ražošanas uzņēmumiem ir plašas tehnisko rokasgrāmatu un cauruļvadu un instrumentācijas shēmu (P&ID) kolekcijas.

  • Darbplūsma: izbraukuma inženieris, kurš remontē turbīnu, var nofotografēt detaļu vai lūgt: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Pārmaiņa: ColQwen3 identificē elektroinstalācijas shēmas vizuālo attēlojumu un izgūst pareizo lapu, iespējams, par vairākām stundām samazinot dīkstāvi.

4. Juridiskie un atbilstības jautājumi

Juridiskā informācijas atklāšana ietver miljoniem skenētu lapu pārskatīšanu, kur meklētais „adatas” ekvivalents bieži ir vizuāla pazīme.

  • Darbplūsma: atbilstības speciālists var meklēt “Documents signed by the CFO” vai “Contracts containing the official ‘Confidential’ stamp.”

  • Pārmaiņa: modelis pēc parakstu vai zīmogu vizuālās klātbūtnes atšķir melnrakstu no galīgā dokumenta — tīrs OCR to bieži neuztver.

Darba sākšana

ColQwen3 ir modelis ar atvērtiem svariem (Apache 2.0), un tas jau ir pieejams platformā Hugging Face. Esam to izstrādājuši kā tūlītēji ieviešamu jauninājumu mūsdienu RAG konveijeriem, nodrošinot izsecināšanas kodu, kas ļauj uzreiz apstrādāt tekstu, attēlus un video.

Uzņēmumiem, kas ir gatavi pārsniegt vienkāršas teksta meklēšanas robežas un izmantot vizuālajos materiālos apslēpto informāciju, šis ir jaunais standarts.

Nākamais solis: izpētiet modeļa karti un izmēģiniet demonstrāciju platformā Hugging Face: /-colqwen3-embed-8b un /-colqwen3-embed-4b

Autors

Xin Huang un Kye Min Tan