Վերջին երկու տարիներին «RAG»-ը (որոնմամբ լրացված գեներացում) գրեթե բացառապես նույնացվել է տեքստի հետ։ Ստանդարտ մոտեցումը պարզ է. վերցնել փաստաթղթերը, առանձնացնել տեքստը, բաժանել հատվածների և ինդեքսավորել։
Սակայն ձեռնարկությունների աշխարհը չի աշխատում սովորական տեքստային ֆայլերով։ Այն աշխատում է բարդ PDF-ներով, խիտ գծապատկերներով շնորհանդեսներով, CAD գծագրերով, սկանավորված հաշիվ-ապրանքագրերով և, գնալով ավելի շատ, տեսանյութերի հսկայական արխիվներով։
Դրանք մշակելու ոլորտային ստանդարտը՝ OCR-ի կամ տեսողական LLM-ների միջոցով պատկերն ներդրումից առաջ տեքստով «նկարագրելը», հսկայական խոչընդոտ է։ Այն դանդաղ ու թանկ է և անխուսափելիորեն կորցնում է սկզբնական տվյալների հարուստ տարածական ու տեսողական համատեքստը։ Եթե ձեր ԱԲ-ն բարդ պատկերը պարզապես նկարագրում է որպես «գծագիր», դուք այլևս չեք կարող որոնել դրա ներսում պատկերված որոշակի փականը կամ էլեկտրահաղորդման սխեման։
Այսօր թողարկում ենք ժամանակակից լավագույն բազմաեղանակ ներդրման մոդելների ընտանիք, որը հիմնված է ColPali ճարտարապետության վրա և լուծում է այս խնդիրը՝ ապահովելով ամբողջական տեսողական որոնում։
Իրապես արդյունավետ բազմաեղանակ որոնիչ ստեղծելու համար բավական չէ վերցնել պատրաստի տեսալեզվային մոդել (VLM) և նրան որոնելու հրահանգ տալ։ Բազմաեղանակ RAG-ի զարգացումը պատմականորեն սահմանափակած խնդիրները լուծելու և ColQwen3-ը ստեղծելու համար կիրառել ենք մոդելների միաձուլման ու ուսուցման ռազմավարություններ։
Բազային մոդելը զրոյից ճշգրտելու փոխարեն մշակել ենք եղանակ՝ գործող տեքստային ներդրման մոդելից որոնման առաջադրանքների գիտելիքը փոխանցելու համար։ Սովորական VLM-ը գիտի՝ ինչպես նկարագրել պատկերները, բայց պարտադիր չէ, որ կարողանա դրանք իմաստային առումով դասակարգել ըստ հարցման համապատասխանության։
Այս բացը լրացնելու համար կիրառել ենք ճշգրտված միաձուլված կշռման ռազմավարություններ։ Փորձերի ընթացքում պարզեցինք, որ տեքստային թաքնված տարածքում Qwen3-Embedding-ի որոնման կարողությունը կարելի է ուղղակիորեն փոխանցել բազմաեղանակ տարածք՝ այն ընդհանրացնելով պատկերների և տեսանյութերի որոնման համար նույնիսկ առանց անմիջական ուսուցման։ Այս արդյունավետ սկզբնավորումն օգտագործելով որպես ամուր մեկնակետ՝ այնուհետև ճշգրտեցինք մոդելը՝ արդյունավետությունն ավելի օպտիմալացնելու և հուսալիությունն ապահովելու համար։ Սա բարելավում է որոնման վերջնական արդյունավետությունը՝ համեմատած Qwen3-VL բազային մոդելի ճշգրտման հետ։
Ներդրման կարողությունները փոխանցելուց հետո կենտրոնացանք համապատասխանեցման վրա։ Որոնման արդյունավետությունն առավելագույնի հասցնելու համար կատարել ենք հիպերպարամետրերի մանրակրկիտ որոնումներ և բաղադրիչների բացառման ուսումնասիրություններ՝ ներառյալ դարաշրջանների օպտիմալ թիվը, փաթեթի չափը, ուսուցման արագությունը, LoRA-ի ռանգը և տվյալների հավաքածուների խառնուրդը։
Որպես ճշգրտման տվյալների հավաքածուներ ընտրել ենք VDR-ը, ColPali-ի ուսուցման հավաքածուն, visrag_syn-ը, և visrag_ind-ը։ Ճշգրտման համար կիրառել ենք UniMax ընտրանքավորում։ Քանի որ կիրառել ենք մոդելների միաձուլում, իսկ միաձուլված բազային մոդելն արդեն մասամբ ժառանգում է բազմաեղանակ որոնման կարողությունը, պարզել ենք, որ տվյալների հավաքածուների թվի ավելացումն իրականում մի փոքր վատացնում է արդյունավետությունը։ Ուստի ավելի շատ հավաքածուներ չենք օգտագործել։
Ահա ճշգրտման համար մեր ընտրած հիպերպարամետրերը.
LoRA-ի ռանգ | 32 |
LoRA Alpha | 32 |
LoRA-ի թիրախային մոդուլներ | պատկերի և տեքստի բոլոր շերտերը՝ բացի ներդրման շերտից |
Ուսուցման արագություն | 5e-5 |
Տեսողական թոքենների առավելագույն թիվ | 1280 |
Ուսուցման դարաշրջաններ | 1 |
Փաթեթի ընդհանուր չափ | 512 |
Տաքացման հարաբերակցություն | 5% |
Պատմականորեն «ColBERT-ի ոճի»՝ թոքենի մակարդակով ներդրումներ օգտագործող մոդելները (օրինակ՝ ColPali-ն) ապահովում էին անհավանական արդյունավետություն, բայց պահեստավորման անընդունելի բարձր գնով։ Յուրաքանչյուր տեսողական թոքենի ինդեքսավորումը ստեղծում էր հսկայական վեկտորային տվյալների բազաներ, որոնք չափազանց թանկ էին ձեռնարկությունների մասշտաբով կիրառելու համար։
Օպտիմալացման ռազմավարությունը. Պահեստավորման խնդիրը լուծել ենք՝ մանրակրկիտ հավասարակշռելով ներդրումների չափը, որպեսզի պահպանենք առավելագույն արդյունավետությունը՝ առանց պահեստավորման ծախսերի կտրուկ աճի։ Այս արդյունավետ ծավալով SOTA ճշգրտությունը պահպանելու համար չափողականությունը սահմանել ենք 320՝ որոնման արդյունավետության և պահեստավորման ծախսի լավագույն հավասարակշռությունն ապահովելու նպատակով։
Ելակետային լուծում. Սովորական մոտեցմանը (օրինակ՝ NVIDIA Nemo-3B-ին) 1 միլիոն պատկերի ներդրումները պահելու համար անհրաժեշտ է մոտ 10.3 ՏԲ (1,802 թոքեն՝ 3,072 չափողականությամբ)։
ColQwen3. Նույն 1 միլիոն պատկերը պահում է ընդամենը 0.82 ՏԲ-ում (առավելագույնը 1,280 թոքեն՝ 320 չափողականությամբ)։
ColQwen3-ն ապահովում է որոնման SOTA ճշգրտություն՝ առանց ամպային ենթակառուցվածքի բյուջեն ուռճացնելու։
Մենք մեր մոտեցումը ստուգել ենք ViDoRe թեստային հավաքածուով։ Արդյունքները հաստատում են, որ ColQwen3-ը նոր չափանիշներ է սահմանում վերջին V3 և V2 թեստերում՝ թե՛ անգլերեն, թե՛ բազմալեզու, միաժամանակ պահպանելով բարձրակարգ արդյունավետություն հին V1 առաջադրանքներում։
ColQwen3-8B-ն առաջատար է անգլերեն և բազմալեզու որոնման մեջ։
Անգլերեն nDCG@5
Մոդել | Համակարգչային գիտություն | Էներգետիկա | Ֆինանսներ | ՄՌ | Արդ. | Դեղագործություն | Ֆիզիկա | Միջ. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Բազմալեզու nDCG@5
Մոդել | Համակարգչային գիտություն | Էներգետիկա | Ֆինանսներ | ՄՌ | Արդ. | Դեղագործություն | Ֆիզիկա | Միջ. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Կայուն բարձր արդյունավետություն ESG-ի, տնտեսագիտության և DocVQA-ի ոլորտներում։
Թեստ | Մոդել | Միավոր (միջ.) | Ուշագրավ հաղթանակ |
ViDoRe V2 (անգլերեն) | ColQwen3-8B | 0.6772 | №1՝ ESG-ում և BioMed-ում |
ViDoRe V2 (բազմալեզու) | ColQwen3-8B | 0.6085 | №1՝ տնտեսագիտության մեջ |
ViDoRe V1 (անգլերեն) | Nemo ColEmbed 3B | 0.9100 | Մի փոքր ավելի բարձր միջին արդյունք |
ViDoRe V1 (անգլերեն) | ColQwen3-8B | 0.9076 | №1՝ ArxivQA-ում և Syn-Gov-ում |
Ցույց տալու համար, որ ColQwen3-ը լավ է ընդհանրացնում տեսանյութերի որոնման խնդիրները, մոդելները գնահատել ենք տեքստից տեսանյութ որոնելու (General Retrieval) առաջադրանքների CareBench թեստով։
Այս գնահատման համար կիրառել ենք տեսանյութի անմիջական կոդավորում. մեր մոդելներն ուղղակիորեն կոդավորել են տեսաֆայլերը՝ առանց լրացուցիչ տեքստային ծանոթագրությունների կամ մետատվյալների։ Սա ընդգծում է զուտ տեսողական իմաստաբանության հիման վրա որոնում կատարելու մոդելի ունակությունը։
Մոդել | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3-ի շնորհիվ հնարավոր դարձած ամենախորքային փոփոխություններից մեկը տեսանյութերը փաստաթղթերի պես մշակելու ունակությունն է։ Շատ ձեռնարկություններում տեսանյութերը «մութ տվյալներ» են։ Դրանք մնում են արխիվային պահոցներում և լիովին անհասանելի են որոնման համար, եթե մարդը ձեռքով չի պիտակավորել յուրաքանչյուր ֆայլ։
ColQwen3-ը փոխում է սա՝ հատվածավորված տեսահոլովակներում կադր առ կադր որոնում ապահովելով։
Ձեռնարկություններն ամեն օր հազարավոր ժամերի ներքին տեսաժողովներ են ձայնագրում, և սովորաբար այդ ձայնագրություններն անհետ կորչում են։
Աշխատընթացը. Երկար հանդիպումների ձայնագրություններն ավտոմատ բաժանելով կարճ, տրամաբանական հատվածների և դրանք ColQwen3-ով ինդեքսավորելով՝ ստեղծում եք որոնելի «ընկերության հիշողություն»։
Հարցումը. Ծրագրի ղեկավարը կարող է հարցնել. “Show me the clip where the engineering lead explained the latency issue with the API.”
Արդյունքը. 60 րոպեանոց տեսաֆայլ վերադարձնելու փոխարեն համակարգը գտնում է հենց այն 45 վայրկյանանոց հատվածը, որտեղ տվյալ գծապատկերը ցուցադրվել և քննարկվել է, նույնիսկ եթե խոսողները հենց այդ պահին բացահայտ չեն արտասանել «հապաղում» բառը։
Բնիկ բազմաեղանակ ներդրմանն անցնելը բոլորովին նոր աշխատընթացներ է հնարավոր դարձնում տարբեր ոլորտներում։ Մենք այս մոդելը համակողմանիորեն փորձարկել ենք ձեռնարկությունների տվյալների ամենաբարդ միջավայրերից մի քանիսում։
ColQwen3-ը փորձարկել ենք քաղաքային խորհրդատվական ընկերությունների տվյալների մարտահրավերներով. այդ ընկերությունները կառավարում են գլխավոր հատակագծերի, գոտիավորման քարտեզների և ճարտարապետական բարդ ճակատապատկերների հսկայական գրադարաններ։
Մարտահրավերը. Այս միջավայրերում ավանդական RAG շղթաները դժվարանում են։ OCR գործիքները սովորաբար տեղանքի բարդ հատակագծերը պարզապես նկարագրում են որպես «սխեմա»՝ բաց թողնելով երթևեկության հոսքի, կանաչ գոտիների կամ շենքերի հետքաշերի մասին կարևոր մանրամասները։
Արդյունավետությունը. Մեր ներքին թեստերը ցույց են տալիս, որ ColQwen3-ն արդյունավետորեն վերացնում է թանկարժեք OCR/նկարագրման նախնական մշակման անհրաժեշտությունը։ Խիտ ճարտարապետական գծագրերով փորձարկումներում մոդելը հաջողությամբ գտել է փաստաթղթեր՝ հիմնվելով որոշակի տեսողական նշիչների վրա, օրինակ՝ հետիոտնային մուտքերի կամ հստակ գոտիավորման սահմանների։ Այն զգալիորեն գերազանցել է միայն տեքստով աշխատող ելակետային լուծումները և խոստանում է կտրուկ նվազեցնել գիտելիքների ներմուծման ծախսերը։
Ներդրումային բանկիրներն ու վերլուծաբանները հազարավոր ժամեր են ծախսում տարեկան հաշվետվություններն ու ներդրողների շնորհանդեսներն ուսումնասիրելու վրա։
Աշխատընթացը. Վերլուծաբանը կարող է հարցնել. “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Փոփոխությունը. Հիմնաբառերի համընկնումների վրա հենվելու փոխարեն մոդելը գտնում է ճիշտ սլայդը՝ հիմնվելով տվյալների որոշակի պատկերավորման տեսողական առկայության վրա, ինչի շնորհիվ RAG համակարգը կարող է մեծ ճշգրտությամբ պատասխանել հարցերին։
Արտադրական ընկերություններն ունեն տեխնիկական ձեռնարկների և խողովակաշարերի ու սարքավորումների սխեմաների (P&ID) հսկայական գրադարաններ։
Աշխատընթացը. Տուրբին վերանորոգող դաշտային ինժեները կարող է լուսանկարել դետալը կամ հարցնել. “Show me the wiring diagram for the hydraulic pump assembly.”
Փոփոխությունը. ColQwen3-ը ճանաչում է էլեկտրահաղորդման սխեմայի տեսողական պատկերը և գտնում ճիշտ էջը՝ հնարավոր է պարապուրդը ժամերով կրճատելով։
Իրավական բացահայտման ընթացքում ուսումնասիրվում են միլիոնավոր սկանավորված էջեր, որտեղ որոնվող կարևոր տեղեկությունը հաճախ տեսողական նշիչ է։
Աշխատընթացը. Համապատասխանության պատասխանատուն կարող է որոնել “Documents signed by the CFO” կամ “Contracts containing the official ‘Confidential’ stamp.”
Փոփոխությունը. Մոդելը ստորագրությունների կամ կնիքների տեսողական առկայությամբ տարբերակում է նախագիծը վերջնական փաստաթղթից, ինչը զուտ OCR-ը հաճախ չի նկատում։
ColQwen3-ը բաց կշիռներով է (Apache 2.0) և արդեն հասանելի է Hugging Face-ում։ Մենք այն նախագծել ենք որպես արդի RAG շղթաների անմիջական թարմացում՝ տրամադրելով տեքստի, պատկերների և տեսանյութերի անհապաղ մշակման համար անհրաժեշտ եզրակացության կոդը։
Պարզ տեքստային որոնումից առաջ անցնելու և իրենց տեսողական նյութերում թաքնված բանականությունն օգտագործելու պատրաստ ձեռնարկությունների համար սա նոր ստանդարտն է։
Հաջորդ քայլը. Դիտեք մոդելի քարտը և փորձեք Hugging Face-ի ուղիղ ցուցադրությունը՝ /-colqwen3-embed-8b և /-colqwen3-embed-4b