Pastaruosius dvejus metus RAG (paieška papildyta generacija) beveik išimtinai buvo siejamas su tekstu. Įprastas veiksmų planas paprastas: paimti dokumentus, išgauti tekstą, suskaidyti jį į fragmentus ir indeksuoti.
Tačiau įmonių pasaulis nėra paremtas paprastojo teksto failais. Jame naudojami sudėtingi PDF failai, pateikčių rinkiniai su informacijos prisotintomis diagramomis, CAD brėžiniai, nuskaitytos sąskaitos ir vis dažniau – milžiniški vaizdo įrašų archyvai.
Pramonės standartu tapęs metodas – prieš kuriant įterpinius OCR arba vaizdo LLM priemonėmis „aprašyti“ vaizdą tekstu – yra didžiulis našumo ribotuvas. Jis lėtas, brangus ir neišvengiamai praranda turtingą pirminių duomenų erdvinį bei vaizdinį kontekstą. Jei jūsų DI sudėtingą vaizdą apibūdina tiesiog kaip „brėžinį“, nebegalite jame ieškoti konkretaus vožtuvo ar elektros instaliacijos schemos.
Šiandien pristatome pažangiausių daugiarūšių įterpinių modelių šeimą, sukurtą „ColPali“ architektūros pagrindu. Ji sprendžia šią problemą suteikdama galimybę atlikti ištisinę vaizdinę paiešką.
Norint sukurti tikrai veiksmingą daugiarūšės paieškos sistemą, nepakanka paimti paruoštą vaizdo ir kalbos modelį (VLM) ir paprašyti jo atlikti paiešką. Kurdami „ColQwen3“ ir spręsdami problemas, kurios istoriškai stabdė daugiarūšio RAG pažangą, taikėme modelių sujungimo bei mokymo strategijas.
Užuot nuo pradžių tiksliai derinę bazinį modelį, sukūrėme metodą paieškos užduočių žinioms perkelti iš esamo tekstinių įterpinių modelio. Standartinis VLM moka apibūdinti vaizdus, tačiau nebūtinai geba juos semantiškai reitinguoti pagal užklausą.
Šiai spragai užpildyti taikėme suderintų sujungimo svorių strategijas. Eksperimentai parodė, kad „Qwen3-Embedding“ paieškos gebėjimus tekstinėje latentinėje erdvėje galima tiesiogiai perkelti į daugiarūšę erdvę ir pritaikyti vaizdų bei vaizdo įrašų paieškai net be papildomo mokymo. Šią veiksmingą inicializaciją panaudojome kaip tvirtą atspirties tašką, o tada tiksliai suderinome modelį, kad dar labiau optimizuotume našumą ir užtikrintume patikimumą. Palyginti su tiksliuoju derinimu, pradedamu nuo bazinio „Qwen3-VL“ modelio, tai pagerina galutinius paieškos rezultatus.
Perkėlę įterpinių gebėjimus, daugiausia dėmesio skyrėme suderinimui. Siekdami maksimaliai pagerinti paieškos rezultatus, kruopščiai ieškojome hiperparametrų ir atlikome abliacijos tyrimus, apimančius optimalų epochų skaičių, paketo dydį, mokymosi spartą, LoRA rangą bei duomenų rinkinių derinį.
Tiksliajam derinimui pasirinkome VDR, „ColPali“ mokymo rinkinį, visrag_syn ir visrag_ind duomenų rinkinius. Tiksliajam derinimui naudojome „UniMax“ atranką. Kadangi sujungėme modelius, o bazinis sujungtas modelis jau iš dalies paveldėjo daugiarūšės paieškos gebėjimus, nustatėme, kad pridėjus daugiau duomenų rinkinių rezultatai šiek tiek suprastėtų. Todėl jų skaičiaus nedidinome.
Tiksliajam derinimui pasirinkome šiuos hiperparametrus:
LoRA rangas | 32 |
LoRA alfa | 32 |
LoRA tiksliniai moduliai | visi vaizdo ir teksto sluoksniai, išskyrus įterpinių sluoksnį |
Mokymosi sparta | 5e-5 |
Didžiausias vaizdinių žetonų skaičius | 1280 |
Mokymo epochos | 1 |
Bendras paketo dydis | 512 |
Įšilimo santykis | 5% |
Istoriškai modeliai, kuriuose naudojami „ColBERT“ tipo žetonų lygmens įterpiniai (pvz., „ColPali“), užtikrino išskirtinius rezultatus, tačiau jų saugojimo sąnaudos buvo pernelyg didelės. Indeksuojant kiekvieną vaizdinį žetoną būdavo sukuriamos milžiniškos vektorių duomenų bazės, per brangios įmonių mastui.
Optimizavimo strategija: saugojimo problemą išsprendėme kruopščiai subalansuodami įterpinių dydį, kad išlaikytume didžiausią našumą ir neleistume išaugti saugojimo sąnaudoms. Kad šiame efektyviame formate išlaikytume pažangiausią tikslumą, pasirinkome 320 matmenų dydį, užtikrinantį geriausią paieškos našumo ir saugojimo sąnaudų pusiausvyrą.
Bazinis sprendimas: taikant standartinį metodą (pvz., „NVIDIA Nemo-3B“), 1 mln. vaizdų įterpiniams saugoti reikia maždaug 10,3 TB (1 802 žetonai po 3 072 matmenis).
„ColQwen3“: to paties 1 mln. vaizdų įterpinius sutalpina vos į 0,82 TB (iki 1 280 žetonų po 320 matmenų).
„ColQwen3“ pasiekia pažangiausią paieškos tikslumą neišpučiant debesijos infrastruktūros biudžeto.
Savo metodą patikrinome naudodami „ViDoRe“ lyginamųjų testų rinkinį. Rezultatai patvirtina, kad „ColQwen3“ nustato naujus standartus naujausiuose V3 ir V2 lyginamuosiuose testuose (anglų ir daugiakalbiuose), kartu išlaikydamas aukščiausio lygio rezultatus senesnėse V1 užduotyse.
„ColQwen3-8B“ pirmauja anglų ir daugiakalbėje paieškoje.
Anglų k. nDCG@5
Modelis | Informatika | Energetika | Finansai | ŽI | Pram. | Farmacija | Fizika | Vid. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Daugiakalbis nDCG@5
Modelis | Informatika | Energetika | Finansai | ŽI | Pram. | Farmacija | Fizika | Vid. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Stabiliai aukšti ESG, ekonomikos ir „DocVQA“ rezultatai.
Lyginamasis testas | Modelis | Balas (vid.) | Reikšminga pergalė |
„ViDoRe“ V2 (anglų k.) | ColQwen3-8B | 0.6772 | 1 vieta ESG ir „BioMed“ |
„ViDoRe“ V2 (daugiakalbis) | ColQwen3-8B | 0.6085 | 1 vieta ekonomikos srityje |
„ViDoRe“ V1 (anglų k.) | Nemo ColEmbed 3B | 0.9100 | Šiek tiek aukštesnis vidurkis |
„ViDoRe“ V1 (anglų k.) | ColQwen3-8B | 0.9076 | 1 vieta „ArxivQA“ ir „Syn-Gov“ |
Siekdami parodyti, kad „ColQwen3“ puikiai pritaikomas vaizdo įrašų paieškai, modelius įvertinome pagal teksto ir vaizdo įrašų bendrosios paieškos užduočių „CareBench“ lyginamąjį testą.
Šiam vertinimui naudojome neapdoroto vaizdo įrašo kodavimo metodą: mūsų modeliai tiesiogiai kodavo vaizdo įrašų failus be jokių papildomų tekstinių anotacijų ar metaduomenų. Tai atskleidžia modelio gebėjimą atlikti paiešką remiantis vien vaizdine semantika.
Modelis | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Vienas svarbiausių „ColQwen3“ sukeltų pokyčių – galimybė vaizdo įrašus apdoroti taip pat kaip dokumentus. Daugelyje įmonių vaizdo įrašai yra „tamsieji duomenys“. Jie laikomi archyvinėse saugyklose ir juose visiškai neįmanoma ieškoti, nebent žmogus rankiniu būdu pažymėtų kiekvieną failą.
„ColQwen3“ tai pakeičia, nes leidžia segmentuotuose klipuose ieškoti pagal atskirus kadrus.
Kasdien įmonės įrašo tūkstančius valandų vidinių vaizdo susitikimų, tačiau šie įrašai paprastai pradingsta užmarštyje.
Darbo eiga: automatiškai suskaidę ilgus susitikimų įrašus į trumpesnius loginius klipus ir indeksavę juos su „ColQwen3“, sukuriate paieškai pritaikytą „įmonės atmintį“.
Užklausa: projekto vadovas gali paprašyti: “Show me the clip where the engineering lead explained the latency issue with the API.”
Rezultatas: užuot pateikusi 60 minučių vaizdo įrašą, sistema randa tikslų 45 sekundžių fragmentą, kuriame ekrane buvo parodyta ir aptarta konkreti diagrama, net jei kalbėtojai tuo metu aiškiai neištarė žodžio „delsa“.
Perėjus prie savųjų daugiarūšių įterpinių, įvairiose pramonės šakose atsiveria visiškai naujos darbo eigos. Šį modelį išsamiai išbandėme su vienomis sudėtingiausių įmonių duomenų aplinkų.
„ColQwen3“ išbandėme su duomenų iššūkiais, su kuriais susiduria miestų konsultavimo įmonės, tvarkančios milžiniškas bendrųjų planų, teritorijų zonavimo žemėlapių ir sudėtingų architektūrinių fasadų bibliotekas.
Iššūkis: tokiose aplinkose tradiciniai RAG procesai susiduria su sunkumais. OCR įrankiai sudėtingus teritorijų planus paprastai apibūdina tiesiog kaip „schemą“, praleisdami svarbią informaciją apie eismo srautus, žaliąsias zonas ar pastatų atitraukimą nuo sklypo ribų.
Našumas: mūsų vidiniai lyginamieji testai rodo, kad „ColQwen3“ veiksmingai pašalina brangaus pirminio OCR ir vaizdų aprašymo poreikį. Atliekant bandymus su itin detaliais architektūriniais brėžiniais, modelis sėkmingai rado dokumentus pagal konkrečius vaizdinius požymius, pavyzdžiui, pėsčiųjų prieigos taškus ar aiškias zonavimo ribas. Jis gerokai pranoko vien tekstu pagrįstus bazinius sprendimus ir gali smarkiai sumažinti žinių įtraukimo sąnaudas.
Investicinės bankininkystės specialistai ir analitikai tūkstančius valandų praleidžia nagrinėdami metines ataskaitas bei investuotojams skirtas pateiktis.
Darbo eiga: analitikas gali paprašyti: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Pokytis: užuot naudojęs raktažodžių atitiktis, modelis randa tikslią skaidrę pagal joje matomą konkrečią duomenų vizualizaciją, todėl RAG sistema gali itin tiksliai atsakyti į klausimus.
Gamybos įmonės turi milžiniškas techninių vadovų ir vamzdynų bei prietaisų schemų (P&ID) bibliotekas.
Darbo eiga: turbiną remontuojantis inžinierius gali nufotografuoti detalę arba paprašyti: “Show me the wiring diagram for the hydraulic pump assembly.”
Pokytis: „ColQwen3“ atpažįsta elektros instaliacijos schemos vaizdinį pavidalą ir randa reikiamą puslapį, todėl prastovą galima sutrumpinti keliomis valandomis.
Teisinio informacijos atskleidimo metu tenka peržiūrėti milijonus nuskaitytų puslapių, kuriuose ieškoma „adatos šieno kupetoje“ – dažnai vaizdinio požymio.
Darbo eiga: atitikties specialistas gali ieškoti “Documents signed by the CFO” arba “Contracts containing the official ‘Confidential’ stamp.”
Pokytis: pagal matomus parašus ar antspaudus modelis atskiria juodraštį nuo galutinio dokumento – įprastas OCR to dažnai nepastebi.
„ColQwen3“ yra atvirųjų svorių modelis („Apache 2.0“), jau pasiekiamas platformoje „Hugging Face“. Jį sukūrėme kaip lengvai įdiegiamą šiuolaikinių RAG procesų naujinį ir pateikėme išvedimo kodą, leidžiantį iš karto apdoroti tekstą, vaizdus bei vaizdo įrašus.
Įmonėms, pasirengusioms peržengti paprastos tekstinės paieškos ribas ir išnaudoti jų vaizdiniuose ištekliuose slypintį intelektą, tai yra naujasis standartas.
Kitas žingsnis: peržiūrėkite modelio kortelę ir išbandykite tiesioginę demonstraciją platformoje „Hugging Face“: /-colqwen3-embed-8b ir /-colqwen3-embed-4b