Handan textans: raunverulegt fjölhátta RAG frá enda til enda

Fjölhátta ívörpunarlíkön hjálpa teymum að sækja gagnlegar upplýsingar beint úr flóknum skjölum, myndum og myndskeiðum.

Undanfarin tvö ár hefur „RAG“ (endurheimtarstudd textamyndun) nær eingöngu verið tengt texta. Hefðbundna aðferðin er einföld: skjöl eru tekin, textinn dreginn út, honum skipt í búta og hann skráður í atriðaskrá.

En fyrirtæki byggja ekki starfsemi sína á einföldum textaskrám. Þau vinna með flóknar PDF-skrár, glærukynningar með þéttum gröfum, CAD-teikningar, skannaða reikninga og sífellt stærri söfn myndskeiða.

Sú hefðbundna aðferð að nota OCR eða sjónræn mállíkön til að „lýsa“ mynd með texta áður en hún er ívörpuð er gríðarlegur flöskuháls. Hún er hæg og dýr og glatar óhjákvæmilega ríkulegu rúmfræðilegu og sjónrænu samhengi upprunalegu gagnanna. Ef gervigreindin lýsir flóknu myndefni aðeins sem „teikningu“ er ekki lengur hægt að leita að tilteknum loka eða raflagnateikningu í því.

Í dag gefum við út fjölskyldu háþróaðra fjölhátta ívörpunarlíkana sem byggja á ColPali-arkitektúrnum og leysa vandann með sjónrænni endurheimt frá enda til enda.

Verkfræðin að baki töfrunum: háþróaðar fínstillingaraðferðir

Það er ekki nóg að taka tilbúið sjón- og mállíkan (VLM) og biðja það að leita til að smíða raunverulega skilvirkt fjölhátta endurheimtarlíkan. Til að leysa vandamálin sem hafa lengi hamlað fjölhátta RAG og búa til ColQwen3 notuðum við aðferðir við samruna og þjálfun líkana.

1. Flutningur ívörpunargetu með stilltri samrunavigtun

Í stað þess að fínstilla grunnlíkan frá grunni þróuðum við aðferð til að flytja þekkingu á endurheimtarverkefnum úr fyrirliggjandi textaívörpunarlíkani. Hefðbundið VLM kann að lýsa myndum en kann ekki endilega að raða þeim merkingarlega gagnvart fyrirspurn.

Til að brúa þetta bil notuðum við stilltar samrunavigtunaraðferðir. Í tilraunum okkar kom í ljós að hægt var að flytja endurheimtargetu Qwen3-Embedding í dulda textarýminu beint yfir í fjölhátta rýmið. Hún alhæfði yfir á endurheimt mynda og myndskeiða, jafnvel án tafarlausrar þjálfunar. Við nýttum þessa skilvirku frumstillingu sem sterkan upphafspunkt og fínstilltum síðan líkanið til að bæta árangurinn enn frekar og tryggja traustleika. Þetta bætir endanlegan árangur endurheimtar samanborið við fínstillingu út frá Qwen3-VL-grunnlíkaninu.

2. Nákvæm stilling ofurstika

Þegar ívörpunargetan hafði verið flutt lögðum við áherslu á samstillingu. Við gerðum ítarlegar leitir að ofurstikum og brottnámsrannsóknir til að hámarka endurheimtarárangur, meðal annars á kjörfjölda þjálfunarumferða, lotustærð, lærdómshraða, LoRA-röð og blöndu gagnasafna.

Sem fínstillingargagnasöfn völdum við VDR, ColPali-þjálfunarsafnið, visrag_syn, og visrag_ind. Við notuðum UniMax-úrtak við fínstillinguna. Þar sem við sameinuðum líkön og samrunaða grunnlíkanið erfir þegar hluta af fjölhátta endurheimtargetu komumst við að því að fleiri gagnasöfn myndu í raun skerða árangurinn lítillega. Því fjölguðum við þeim ekki.

Þetta eru ofurstikarnir sem við völdum fyrir fínstillinguna:

LoRA-röð

32

LoRA-alfa

32

Markeiningar LoRA

öll lög fyrir bæði myndir og texta, nema ívörpunarlagið

Lærdómshraði

5e-5

Hámarksfjöldi sjónrænna tóka

1280

Þjálfunarumferðir

1

Heildarlotustærð

512

Upphitunarhlutfall

5%

3. „ColBERT“-vandinn: mikill árangur eða lítill geymslukostnaður

Sögulega hafa líkön með ívörpunum á tókastigi í „ColBERT-stíl“, eins og ColPali, skilað ótrúlegum árangri en geymslukostnaðurinn verið óhóflegur. Skráning hvers sjónræns tóka skapaði gríðarlega vigurgagnagrunna sem voru of dýrir fyrir starfsemi fyrirtækja.

  • Bestunaraðferðin: Við leystum geymsluvandann með því að vega stærð ívarpananna vandlega á móti árangri, þannig að hámarksárangur héldist án þess að geymslukostnaður spryngi út. Til að viðhalda SOTA-nákvæmni með þessari skilvirku stærð völdum við 320 víddir, sem veitir best jafnvægi milli endurheimtarárangurs og geymslukostnaðar.

    • Grunnviðmið: Hefðbundin aðferð, eins og NVIDIA Nemo-3B, þarf um 10.3 TB til að geyma ívarpanir fyrir 1 milljón mynda (1,802 tókar @ 3,072 víddir).

    • ColQwen3: Geymir sömu 1 milljón mynda í aðeins 0.82 TB (að hámarki 1,280 tókar @ 320 víddir).

ColQwen3 nær SOTA-nákvæmni í endurheimt án þess að sprengja fjárhagsáætlun skýjainnviða.

Niðurstöður mats

Við sannreyndum aðferðina okkar með ViDoRe-viðmiðunarprófunum. Niðurstöðurnar staðfesta að ColQwen3 setur ný viðmið í nýjustu V3- og V2-prófunum, bæði á ensku og mörgum tungumálum, en heldur jafnframt framúrskarandi árangri í eldri V1-verkefnum.

ViDoRe v3 (nýjasta útgáfa)

ColQwen3-8B er fremst í endurheimt á ensku og mörgum tungumálum.

Enska nDCG@5

Líkan

Tölvunarfræði

Orka

Fjármál

Mannauður

Iðnaður

Lyfjafræði

Eðlisfræði

Meðaltal

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Fjöltyngt nDCG@5

Líkan

Tölvunarfræði

Orka

Fjármál

Mannauður

Iðnaður

Lyfjafræði

Eðlisfræði

Meðaltal

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Helstu niðurstöður ViDoRe v2 og v1

Stöðugt góður árangur í ESG, hagfræði og DocVQA.

Viðmiðunarpróf

Líkan

Skor (meðaltal)

Athyglisverður sigur

ViDoRe V2 (enska)

ColQwen3-8B

0.6772

#1 í ESG og BioMed

ViDoRe V2 (fjöltyngt)

ColQwen3-8B

0.6085

#1 í hagfræði

ViDoRe V1 (enska)

Nemo ColEmbed 3B

0.9100

Örlítið hærra meðaltal

ViDoRe V1 (enska)

ColQwen3-8B

0.9076

#1 í ArxivQA og Syn-Gov

Endurheimt myndskeiða: mat með CareBench

Til að sýna fram á að ColQwen3 alhæfir vel yfir á endurheimt myndskeiða mátum við líkönin með CareBench-viðmiðinu fyrir verkefni þar sem myndskeið eru sótt út frá texta (almenn endurheimt).

Í þessu mati notuðum við hráa kóðun myndskeiða: líkönin okkar kóðuðu myndskeiðsskrárnar beint, án viðbótartextaskýringa eða lýsigagna. Þetta undirstrikar getu líkansins til að endurheimta efni eingöngu út frá sjónrænni merkingu.

Líkan

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

„Dökk gögn“ virkjuð: framarleg vídd myndskeiða

Ein af veigamestu breytingunum sem ColQwen3 gerir mögulega er að hægt er að meðhöndla myndskeið rétt eins og skjöl. Hjá mörgum fyrirtækjum eru myndskeið „dökk gögn“. Þau liggja í langtímageymslu og eru alls ekki leitarbær nema einhver hafi merkt hverja skrá handvirkt.

ColQwen3 breytir þessu með því að gera kleift að leita eftir einstökum römmum í skiptum myndskeiðsbútum.

Notkunardæmi: sameiginlegt minni fyrirtækisins

Á hverjum degi taka fyrirtæki upp þúsundir klukkustunda af innri myndfundum og yfirleitt hverfa þessar upptökur ofan í svarthol.

  • Verkflæðið: Með því að skipta löngum fundarupptökum sjálfkrafa í styttri, rökrétta búta og skrá þá í atriðaskrá með ColQwen3 verður til leitarbært „fyrirtækjaminni“.

  • Fyrirspurnin: Verkefnastjóri getur spurt: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Niðurstaðan: Í stað þess að skila 60 mínútna myndskeiði finnur kerfið nákvæmlega 45 sekúndna bútinn þar sem viðkomandi skýringarmynd birtist á skjánum og var rædd, jafnvel þótt mælendurnir hafi ekki sagt orðið „biðtími“ á nákvæmlega þeirri sekúndu.

Notkun hjá fyrirtækjum: lausnir á verðmætum vandamálum

Innfædd fjölhátta ívörpun opnar fyrir alveg ný verkflæði þvert á atvinnugreinar. Við höfum prófað þetta líkan ítarlega gagnvart sumum flóknustu gagnaumhverfum fyrirtækja.

1. Helstu niðurstöður viðmiðunarprófs: borgarráðgjöf og arkitektúr

Við prófuðum ColQwen3 gagnvart gagnaáskorunum borgarráðgjafarfyrirtækja sem halda utan um gríðarleg söfn skipulagsáætlana, svæðisskipulagskorta og flókinna útlitsteikninga bygginga.

  • Áskorunin: Hefðbundnar RAG-vinnslurásir eiga erfitt uppdráttar í slíku umhverfi. OCR-verkfæri lýsa flóknum lóðaruppdráttum oft einfaldlega sem „skýringarmynd“ og missa af mikilvægum atriðum um umferðarflæði, græn svæði eða fjarlægð bygginga frá lóðarmörkum.

  • Árangurinn: Innri viðmiðunarprófanir okkar sýna að ColQwen3 getur sneitt hjá kostnaðarsamri OCR- og myndlýsingarforvinnslu. Í prófunum með þéttum arkitektateikningum fann líkanið skjöl út frá tilteknum sjónrænum merkjum, svo sem aðgengisstöðum gangandi vegfarenda eða skýrum svæðisskipulagsmörkum. Það stóð sig mun betur en grunnlíkön sem nota eingöngu texta og lofar stórfelldri lækkun kostnaðar við innlestur þekkingar.

2. Flókin fjármála- og markaðsgreind

Fjárfestingarbankamenn og greinendur verja þúsundum klukkustunda í að fara yfir ársskýrslur og fjárfestakynningar.

  • Verkflæðið: Greinandi getur spurt: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Breytingin: Í stað þess að reiða sig á samsvörun leitarorða finnur líkanið nákvæmlega réttu glæruna út frá því að tiltekin gagnamynd sé sýnileg. Þannig getur RAG-kerfið svarað spurningum af mikilli nákvæmni.

3. Iðnaðarframleiðsla og vettvangsþjónusta

Framleiðslufyrirtæki eiga gríðarleg söfn tæknileiðbeininga og lagna- og tækjateikninga (P&ID).

  • Verkflæðið: Vettvangsverkfræðingur sem gerir við hverfil getur tekið mynd af íhlut eða spurt: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Breytingin: ColQwen3 greinir sjónræna framsetningu raflagnateikningarinnar og finnur réttu síðuna, sem getur stytt niðritíma um margar klukkustundir.

4. Lögfræði og reglufylgni

Við öflun sönnunargagna þarf að yfirfara milljónir skannaðra síðna þar sem „nálin“ er oft sjónrænt merki.

  • Verkflæðið: Regluvörður getur leitað að “Documents signed by the CFO” eða “Contracts containing the official ‘Confidential’ stamp.”

  • Breytingin: Líkanið greinir á milli draga og fullgerðra skjala út frá því hvort undirskriftir eða stimplar sjást, en hreint OCR missir oft af slíku.

Hafist handa

ColQwen3 er líkan með opnar vigtir (Apache 2.0) og er nú fáanlegt á Hugging Face. Við hönnuðum það sem beina uppfærslu fyrir nútímalegar RAG-vinnslurásir, með keyrslukóða sem þarf til að vinna strax úr texta, myndum og myndskeiðum.

Fyrir fyrirtæki sem vilja komast lengra en einföld textaleit og virkja greindina sem er læst í sjónrænum gögnum þeirra er þetta nýja viðmiðið.

Næsta skref: Skoðaðu líkanskortið og prófaðu sýnikennsluna á Hugging Face: /-colqwen3-embed-8b og /-colqwen3-embed-4b

Höfundur

Xin Huang, Kye Min Tan