Pagrindinė navigacija

Daugiau nei tekstas: tikro daugiarūšio ištisinio RAG galimybės

Daugiarūšių įterpinių modeliai padeda komandoms naudingą informaciją gauti tiesiai iš sudėtingų dokumentų, vaizdų ir vaizdo įrašų.

Pastaruosius dvejus metus RAG (paieška papildyta generacija) beveik išimtinai buvo siejamas su tekstu. Įprastas veiksmų planas paprastas: paimti dokumentus, išgauti tekstą, suskaidyti jį į fragmentus ir indeksuoti.

Tačiau įmonių pasaulis nėra paremtas paprastojo teksto failais. Jame naudojami sudėtingi PDF failai, pateikčių rinkiniai su informacijos prisotintomis diagramomis, CAD brėžiniai, nuskaitytos sąskaitos ir vis dažniau – milžiniški vaizdo įrašų archyvai.

Pramonės standartu tapęs metodas – prieš kuriant įterpinius OCR arba vaizdo LLM priemonėmis „aprašyti“ vaizdą tekstu – yra didžiulis našumo ribotuvas. Jis lėtas, brangus ir neišvengiamai praranda turtingą pirminių duomenų erdvinį bei vaizdinį kontekstą. Jei jūsų DI sudėtingą vaizdą apibūdina tiesiog kaip „brėžinį“, nebegalite jame ieškoti konkretaus vožtuvo ar elektros instaliacijos schemos.

Šiandien pristatome pažangiausių daugiarūšių įterpinių modelių šeimą, sukurtą „ColPali“ architektūros pagrindu. Ji sprendžia šią problemą suteikdama galimybę atlikti ištisinę vaizdinę paiešką.

Stebuklo inžinerija: pažangios tiksliojo derinimo strategijos

Norint sukurti tikrai veiksmingą daugiarūšės paieškos sistemą, nepakanka paimti paruoštą vaizdo ir kalbos modelį (VLM) ir paprašyti jo atlikti paiešką. Kurdami „ColQwen3“ ir spręsdami problemas, kurios istoriškai stabdė daugiarūšio RAG pažangą, taikėme modelių sujungimo bei mokymo strategijas.

1. Įterpinių gebėjimų perkėlimas taikant suderintus sujungimo svorius

Užuot nuo pradžių tiksliai derinę bazinį modelį, sukūrėme metodą paieškos užduočių žinioms perkelti iš esamo tekstinių įterpinių modelio. Standartinis VLM moka apibūdinti vaizdus, tačiau nebūtinai geba juos semantiškai reitinguoti pagal užklausą.

Šiai spragai užpildyti taikėme suderintų sujungimo svorių strategijas. Eksperimentai parodė, kad „Qwen3-Embedding“ paieškos gebėjimus tekstinėje latentinėje erdvėje galima tiesiogiai perkelti į daugiarūšę erdvę ir pritaikyti vaizdų bei vaizdo įrašų paieškai net be papildomo mokymo. Šią veiksmingą inicializaciją panaudojome kaip tvirtą atspirties tašką, o tada tiksliai suderinome modelį, kad dar labiau optimizuotume našumą ir užtikrintume patikimumą. Palyginti su tiksliuoju derinimu, pradedamu nuo bazinio „Qwen3-VL“ modelio, tai pagerina galutinius paieškos rezultatus.

2. Kruopštus hiperparametrų derinimas

Perkėlę įterpinių gebėjimus, daugiausia dėmesio skyrėme suderinimui. Siekdami maksimaliai pagerinti paieškos rezultatus, kruopščiai ieškojome hiperparametrų ir atlikome abliacijos tyrimus, apimančius optimalų epochų skaičių, paketo dydį, mokymosi spartą, LoRA rangą bei duomenų rinkinių derinį.

Tiksliajam derinimui pasirinkome VDR, „ColPali“ mokymo rinkinį, visrag_syn ir visrag_ind duomenų rinkinius. Tiksliajam derinimui naudojome „UniMax“ atranką. Kadangi sujungėme modelius, o bazinis sujungtas modelis jau iš dalies paveldėjo daugiarūšės paieškos gebėjimus, nustatėme, kad pridėjus daugiau duomenų rinkinių rezultatai šiek tiek suprastėtų. Todėl jų skaičiaus nedidinome.

Tiksliajam derinimui pasirinkome šiuos hiperparametrus:

LoRA rangas

32

LoRA alfa

32

LoRA tiksliniai moduliai

visi vaizdo ir teksto sluoksniai, išskyrus įterpinių sluoksnį

Mokymosi sparta

5e-5

Didžiausias vaizdinių žetonų skaičius

1280

Mokymo epochos

1

Bendras paketo dydis

512

Įšilimo santykis

5%

3. „ColBERT“ dilema: didelis našumas ar mažos saugojimo sąnaudos

Istoriškai modeliai, kuriuose naudojami „ColBERT“ tipo žetonų lygmens įterpiniai (pvz., „ColPali“), užtikrino išskirtinius rezultatus, tačiau jų saugojimo sąnaudos buvo pernelyg didelės. Indeksuojant kiekvieną vaizdinį žetoną būdavo sukuriamos milžiniškos vektorių duomenų bazės, per brangios įmonių mastui.

  • Optimizavimo strategija: saugojimo problemą išsprendėme kruopščiai subalansuodami įterpinių dydį, kad išlaikytume didžiausią našumą ir neleistume išaugti saugojimo sąnaudoms. Kad šiame efektyviame formate išlaikytume pažangiausią tikslumą, pasirinkome 320 matmenų dydį, užtikrinantį geriausią paieškos našumo ir saugojimo sąnaudų pusiausvyrą.

    • Bazinis sprendimas: taikant standartinį metodą (pvz., „NVIDIA Nemo-3B“), 1 mln. vaizdų įterpiniams saugoti reikia maždaug 10,3 TB (1 802 žetonai po 3 072 matmenis).

    • „ColQwen3“: to paties 1 mln. vaizdų įterpinius sutalpina vos į 0,82 TB (iki 1 280 žetonų po 320 matmenų).

„ColQwen3“ pasiekia pažangiausią paieškos tikslumą neišpučiant debesijos infrastruktūros biudžeto.

Vertinimo rezultatai

Savo metodą patikrinome naudodami „ViDoRe“ lyginamųjų testų rinkinį. Rezultatai patvirtina, kad „ColQwen3“ nustato naujus standartus naujausiuose V3 ir V2 lyginamuosiuose testuose (anglų ir daugiakalbiuose), kartu išlaikydamas aukščiausio lygio rezultatus senesnėse V1 užduotyse.

„ViDoRe“ v3 (naujausia)

„ColQwen3-8B“ pirmauja anglų ir daugiakalbėje paieškoje.

Anglų k. nDCG@5

Modelis

Informatika

Energetika

Finansai

ŽI

Pram.

Farmacija

Fizika

Vid.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Daugiakalbis nDCG@5

Modelis

Informatika

Energetika

Finansai

ŽI

Pram.

Farmacija

Fizika

Vid.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Svarbiausi „ViDoRe“ v2 ir v1 rezultatai

Stabiliai aukšti ESG, ekonomikos ir „DocVQA“ rezultatai.

Lyginamasis testas

Modelis

Balas (vid.)

Reikšminga pergalė

„ViDoRe“ V2 (anglų k.)

ColQwen3-8B

0.6772

1 vieta ESG ir „BioMed“

„ViDoRe“ V2 (daugiakalbis)

ColQwen3-8B

0.6085

1 vieta ekonomikos srityje

„ViDoRe“ V1 (anglų k.)

Nemo ColEmbed 3B

0.9100

Šiek tiek aukštesnis vidurkis

„ViDoRe“ V1 (anglų k.)

ColQwen3-8B

0.9076

1 vieta „ArxivQA“ ir „Syn-Gov“

Vaizdo įrašų paieška: „CareBench“ vertinimas

Siekdami parodyti, kad „ColQwen3“ puikiai pritaikomas vaizdo įrašų paieškai, modelius įvertinome pagal teksto ir vaizdo įrašų bendrosios paieškos užduočių „CareBench“ lyginamąjį testą.

Šiam vertinimui naudojome neapdoroto vaizdo įrašo kodavimo metodą: mūsų modeliai tiesiogiai kodavo vaizdo įrašų failus be jokių papildomų tekstinių anotacijų ar metaduomenų. Tai atskleidžia modelio gebėjimą atlikti paiešką remiantis vien vaizdine semantika.

Modelis

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

„Tamsiųjų duomenų“ atvėrimas: priešakinė vaizdo įrašų sritis

Vienas svarbiausių „ColQwen3“ sukeltų pokyčių – galimybė vaizdo įrašus apdoroti taip pat kaip dokumentus. Daugelyje įmonių vaizdo įrašai yra „tamsieji duomenys“. Jie laikomi archyvinėse saugyklose ir juose visiškai neįmanoma ieškoti, nebent žmogus rankiniu būdu pažymėtų kiekvieną failą.

„ColQwen3“ tai pakeičia, nes leidžia segmentuotuose klipuose ieškoti pagal atskirus kadrus.

Naudojimo atvejis: įmonės atminties bankas

Kasdien įmonės įrašo tūkstančius valandų vidinių vaizdo susitikimų, tačiau šie įrašai paprastai pradingsta užmarštyje.

  • Darbo eiga: automatiškai suskaidę ilgus susitikimų įrašus į trumpesnius loginius klipus ir indeksavę juos su „ColQwen3“, sukuriate paieškai pritaikytą „įmonės atmintį“.

  • Užklausa: projekto vadovas gali paprašyti: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Rezultatas: užuot pateikusi 60 minučių vaizdo įrašą, sistema randa tikslų 45 sekundžių fragmentą, kuriame ekrane buvo parodyta ir aptarta konkreti diagrama, net jei kalbėtojai tuo metu aiškiai neištarė žodžio „delsa“.

Naudojimo įmonėse atvejai: vertingų problemų sprendimas

Perėjus prie savųjų daugiarūšių įterpinių, įvairiose pramonės šakose atsiveria visiškai naujos darbo eigos. Šį modelį išsamiai išbandėme su vienomis sudėtingiausių įmonių duomenų aplinkų.

1. Lyginamojo testo akcentas: miestų konsultavimas ir architektūra

„ColQwen3“ išbandėme su duomenų iššūkiais, su kuriais susiduria miestų konsultavimo įmonės, tvarkančios milžiniškas bendrųjų planų, teritorijų zonavimo žemėlapių ir sudėtingų architektūrinių fasadų bibliotekas.

  • Iššūkis: tokiose aplinkose tradiciniai RAG procesai susiduria su sunkumais. OCR įrankiai sudėtingus teritorijų planus paprastai apibūdina tiesiog kaip „schemą“, praleisdami svarbią informaciją apie eismo srautus, žaliąsias zonas ar pastatų atitraukimą nuo sklypo ribų.

  • Našumas: mūsų vidiniai lyginamieji testai rodo, kad „ColQwen3“ veiksmingai pašalina brangaus pirminio OCR ir vaizdų aprašymo poreikį. Atliekant bandymus su itin detaliais architektūriniais brėžiniais, modelis sėkmingai rado dokumentus pagal konkrečius vaizdinius požymius, pavyzdžiui, pėsčiųjų prieigos taškus ar aiškias zonavimo ribas. Jis gerokai pranoko vien tekstu pagrįstus bazinius sprendimus ir gali smarkiai sumažinti žinių įtraukimo sąnaudas.

2. Sudėtinga finansų ir rinkos analizė

Investicinės bankininkystės specialistai ir analitikai tūkstančius valandų praleidžia nagrinėdami metines ataskaitas bei investuotojams skirtas pateiktis.

  • Darbo eiga: analitikas gali paprašyti: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Pokytis: užuot naudojęs raktažodžių atitiktis, modelis randa tikslią skaidrę pagal joje matomą konkrečią duomenų vizualizaciją, todėl RAG sistema gali itin tiksliai atsakyti į klausimus.

3. Pramoninė gamyba ir techninė priežiūra vietoje

Gamybos įmonės turi milžiniškas techninių vadovų ir vamzdynų bei prietaisų schemų (P&ID) bibliotekas.

  • Darbo eiga: turbiną remontuojantis inžinierius gali nufotografuoti detalę arba paprašyti: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Pokytis: „ColQwen3“ atpažįsta elektros instaliacijos schemos vaizdinį pavidalą ir randa reikiamą puslapį, todėl prastovą galima sutrumpinti keliomis valandomis.

4. Teisė ir atitiktis

Teisinio informacijos atskleidimo metu tenka peržiūrėti milijonus nuskaitytų puslapių, kuriuose ieškoma „adatos šieno kupetoje“ – dažnai vaizdinio požymio.

  • Darbo eiga: atitikties specialistas gali ieškoti “Documents signed by the CFO” arba “Contracts containing the official ‘Confidential’ stamp.”

  • Pokytis: pagal matomus parašus ar antspaudus modelis atskiria juodraštį nuo galutinio dokumento – įprastas OCR to dažnai nepastebi.

Darbo pradžia

„ColQwen3“ yra atvirųjų svorių modelis („Apache 2.0“), jau pasiekiamas platformoje „Hugging Face“. Jį sukūrėme kaip lengvai įdiegiamą šiuolaikinių RAG procesų naujinį ir pateikėme išvedimo kodą, leidžiantį iš karto apdoroti tekstą, vaizdus bei vaizdo įrašus.

Įmonėms, pasirengusioms peržengti paprastos tekstinės paieškos ribas ir išnaudoti jų vaizdiniuose ištekliuose slypintį intelektą, tai yra naujasis standartas.

Kitas žingsnis: peržiūrėkite modelio kortelę ir išbandykite tiesioginę demonstraciją platformoje „Hugging Face“: /-colqwen3-embed-8b ir /-colqwen3-embed-4b

Autorius

Xin Huang ir Kye Min Tan