Հիմնական նավիգացիա

Տեքստից անդին. իրական բազմաեղանակ ամբողջական RAG-ի հնարավորությունները

Բազմաեղանակ ներդրման մոդելներն օգնում են թիմերին օգտակար տեղեկություններ որոնել անմիջապես բարդ փաստաթղթերից, պատկերներից և տեսանյութերից։

Վերջին երկու տարիներին «RAG»-ը (որոնմամբ լրացված գեներացում) գրեթե բացառապես նույնացվել է տեքստի հետ։ Ստանդարտ մոտեցումը պարզ է. վերցնել փաստաթղթերը, առանձնացնել տեքստը, բաժանել հատվածների և ինդեքսավորել։

Սակայն ձեռնարկությունների աշխարհը չի աշխատում սովորական տեքստային ֆայլերով։ Այն աշխատում է բարդ PDF-ներով, խիտ գծապատկերներով շնորհանդեսներով, CAD գծագրերով, սկանավորված հաշիվ-ապրանքագրերով և, գնալով ավելի շատ, տեսանյութերի հսկայական արխիվներով։

Դրանք մշակելու ոլորտային ստանդարտը՝ OCR-ի կամ տեսողական LLM-ների միջոցով պատկերն ներդրումից առաջ տեքստով «նկարագրելը», հսկայական խոչընդոտ է։ Այն դանդաղ ու թանկ է և անխուսափելիորեն կորցնում է սկզբնական տվյալների հարուստ տարածական ու տեսողական համատեքստը։ Եթե ձեր ԱԲ-ն բարդ պատկերը պարզապես նկարագրում է որպես «գծագիր», դուք այլևս չեք կարող որոնել դրա ներսում պատկերված որոշակի փականը կամ էլեկտրահաղորդման սխեման։

Այսօր թողարկում ենք ժամանակակից լավագույն բազմաեղանակ ներդրման մոդելների ընտանիք, որը հիմնված է ColPali ճարտարապետության վրա և լուծում է այս խնդիրը՝ ապահովելով ամբողջական տեսողական որոնում։

Հրաշքի հիմքում ընկած ճարտարագիտությունը. ճշգրտման առաջադեմ ռազմավարություններ

Իրապես արդյունավետ բազմաեղանակ որոնիչ ստեղծելու համար բավական չէ վերցնել պատրաստի տեսալեզվային մոդել (VLM) և նրան որոնելու հրահանգ տալ։ Բազմաեղանակ RAG-ի զարգացումը պատմականորեն սահմանափակած խնդիրները լուծելու և ColQwen3-ը ստեղծելու համար կիրառել ենք մոդելների միաձուլման ու ուսուցման ռազմավարություններ։

1. Ներդրման կարողության փոխանցում՝ ճշգրտված միաձուլված կշռման միջոցով

Բազային մոդելը զրոյից ճշգրտելու փոխարեն մշակել ենք եղանակ՝ գործող տեքստային ներդրման մոդելից որոնման առաջադրանքների գիտելիքը փոխանցելու համար։ Սովորական VLM-ը գիտի՝ ինչպես նկարագրել պատկերները, բայց պարտադիր չէ, որ կարողանա դրանք իմաստային առումով դասակարգել ըստ հարցման համապատասխանության։

Այս բացը լրացնելու համար կիրառել ենք ճշգրտված միաձուլված կշռման ռազմավարություններ։ Փորձերի ընթացքում պարզեցինք, որ տեքստային թաքնված տարածքում Qwen3-Embedding-ի որոնման կարողությունը կարելի է ուղղակիորեն փոխանցել բազմաեղանակ տարածք՝ այն ընդհանրացնելով պատկերների և տեսանյութերի որոնման համար նույնիսկ առանց անմիջական ուսուցման։ Այս արդյունավետ սկզբնավորումն օգտագործելով որպես ամուր մեկնակետ՝ այնուհետև ճշգրտեցինք մոդելը՝ արդյունավետությունն ավելի օպտիմալացնելու և հուսալիությունն ապահովելու համար։ Սա բարելավում է որոնման վերջնական արդյունավետությունը՝ համեմատած Qwen3-VL բազային մոդելի ճշգրտման հետ։

2. Հիպերպարամետրերի մանրակրկիտ կարգավորում

Ներդրման կարողությունները փոխանցելուց հետո կենտրոնացանք համապատասխանեցման վրա։ Որոնման արդյունավետությունն առավելագույնի հասցնելու համար կատարել ենք հիպերպարամետրերի մանրակրկիտ որոնումներ և բաղադրիչների բացառման ուսումնասիրություններ՝ ներառյալ դարաշրջանների օպտիմալ թիվը, փաթեթի չափը, ուսուցման արագությունը, LoRA-ի ռանգը և տվյալների հավաքածուների խառնուրդը։

Որպես ճշգրտման տվյալների հավաքածուներ ընտրել ենք VDR-ը, ColPali-ի ուսուցման հավաքածուն, visrag_syn-ը, և visrag_ind-ը։ Ճշգրտման համար կիրառել ենք UniMax ընտրանքավորում։ Քանի որ կիրառել ենք մոդելների միաձուլում, իսկ միաձուլված բազային մոդելն արդեն մասամբ ժառանգում է բազմաեղանակ որոնման կարողությունը, պարզել ենք, որ տվյալների հավաքածուների թվի ավելացումն իրականում մի փոքր վատացնում է արդյունավետությունը։ Ուստի ավելի շատ հավաքածուներ չենք օգտագործել։

Ահա ճշգրտման համար մեր ընտրած հիպերպարամետրերը.

LoRA-ի ռանգ

32

LoRA Alpha

32

LoRA-ի թիրախային մոդուլներ

պատկերի և տեքստի բոլոր շերտերը՝ բացի ներդրման շերտից

Ուսուցման արագություն

5e-5

Տեսողական թոքենների առավելագույն թիվ

1280

Ուսուցման դարաշրջաններ

1

Փաթեթի ընդհանուր չափ

512

Տաքացման հարաբերակցություն

5%

3. «ColBERT»-ի երկընտրանքը. բարձր արդյունավետություն, թե՞ պահեստավորման ծախս

Պատմականորեն «ColBERT-ի ոճի»՝ թոքենի մակարդակով ներդրումներ օգտագործող մոդելները (օրինակ՝ ColPali-ն) ապահովում էին անհավանական արդյունավետություն, բայց պահեստավորման անընդունելի բարձր գնով։ Յուրաքանչյուր տեսողական թոքենի ինդեքսավորումը ստեղծում էր հսկայական վեկտորային տվյալների բազաներ, որոնք չափազանց թանկ էին ձեռնարկությունների մասշտաբով կիրառելու համար։

  • Օպտիմալացման ռազմավարությունը. Պահեստավորման խնդիրը լուծել ենք՝ մանրակրկիտ հավասարակշռելով ներդրումների չափը, որպեսզի պահպանենք առավելագույն արդյունավետությունը՝ առանց պահեստավորման ծախսերի կտրուկ աճի։ Այս արդյունավետ ծավալով SOTA ճշգրտությունը պահպանելու համար չափողականությունը սահմանել ենք 320՝ որոնման արդյունավետության և պահեստավորման ծախսի լավագույն հավասարակշռությունն ապահովելու նպատակով։

    • Ելակետային լուծում. Սովորական մոտեցմանը (օրինակ՝ NVIDIA Nemo-3B-ին) 1 միլիոն պատկերի ներդրումները պահելու համար անհրաժեշտ է մոտ 10.3 ՏԲ (1,802 թոքեն՝ 3,072 չափողականությամբ)։

    • ColQwen3. Նույն 1 միլիոն պատկերը պահում է ընդամենը 0.82 ՏԲ-ում (առավելագույնը 1,280 թոքեն՝ 320 չափողականությամբ)։

ColQwen3-ն ապահովում է որոնման SOTA ճշգրտություն՝ առանց ամպային ենթակառուցվածքի բյուջեն ուռճացնելու։

Գնահատման արդյունքներ

Մենք մեր մոտեցումը ստուգել ենք ViDoRe թեստային հավաքածուով։ Արդյունքները հաստատում են, որ ColQwen3-ը նոր չափանիշներ է սահմանում վերջին V3 և V2 թեստերում՝ թե՛ անգլերեն, թե՛ բազմալեզու, միաժամանակ պահպանելով բարձրակարգ արդյունավետություն հին V1 առաջադրանքներում։

ViDoRe v3 (վերջին տարբերակ)

ColQwen3-8B-ն առաջատար է անգլերեն և բազմալեզու որոնման մեջ։

Անգլերեն nDCG@5

Մոդել

Համակարգչային գիտություն

Էներգետիկա

Ֆինանսներ

ՄՌ

Արդ.

Դեղագործություն

Ֆիզիկա

Միջ.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Բազմալեզու nDCG@5

Մոդել

Համակարգչային գիտություն

Էներգետիկա

Ֆինանսներ

ՄՌ

Արդ.

Դեղագործություն

Ֆիզիկա

Միջ.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2-ի և v1-ի կարևոր արդյունքները

Կայուն բարձր արդյունավետություն ESG-ի, տնտեսագիտության և DocVQA-ի ոլորտներում։

Թեստ

Մոդել

Միավոր (միջ.)

Ուշագրավ հաղթանակ

ViDoRe V2 (անգլերեն)

ColQwen3-8B

0.6772

№1՝ ESG-ում և BioMed-ում

ViDoRe V2 (բազմալեզու)

ColQwen3-8B

0.6085

№1՝ տնտեսագիտության մեջ

ViDoRe V1 (անգլերեն)

Nemo ColEmbed 3B

0.9100

Մի փոքր ավելի բարձր միջին արդյունք

ViDoRe V1 (անգլերեն)

ColQwen3-8B

0.9076

№1՝ ArxivQA-ում և Syn-Gov-ում

Տեսանյութերի որոնում. CareBench-ի գնահատում

Ցույց տալու համար, որ ColQwen3-ը լավ է ընդհանրացնում տեսանյութերի որոնման խնդիրները, մոդելները գնահատել ենք տեքստից տեսանյութ որոնելու (General Retrieval) առաջադրանքների CareBench թեստով։

Այս գնահատման համար կիրառել ենք տեսանյութի անմիջական կոդավորում. մեր մոդելներն ուղղակիորեն կոդավորել են տեսաֆայլերը՝ առանց լրացուցիչ տեքստային ծանոթագրությունների կամ մետատվյալների։ Սա ընդգծում է զուտ տեսողական իմաստաբանության հիման վրա որոնում կատարելու մոդելի ունակությունը։

Մոդել

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

«Մութ տվյալների» բացահայտում. տեսանյութերի առաջադեմ ոլորտը

ColQwen3-ի շնորհիվ հնարավոր դարձած ամենախորքային փոփոխություններից մեկը տեսանյութերը փաստաթղթերի պես մշակելու ունակությունն է։ Շատ ձեռնարկություններում տեսանյութերը «մութ տվյալներ» են։ Դրանք մնում են արխիվային պահոցներում և լիովին անհասանելի են որոնման համար, եթե մարդը ձեռքով չի պիտակավորել յուրաքանչյուր ֆայլ։

ColQwen3-ը փոխում է սա՝ հատվածավորված տեսահոլովակներում կադր առ կադր որոնում ապահովելով։

Կիրառման օրինակ. ընկերության հիշողության շտեմարան

Ձեռնարկություններն ամեն օր հազարավոր ժամերի ներքին տեսաժողովներ են ձայնագրում, և սովորաբար այդ ձայնագրություններն անհետ կորչում են։

  • Աշխատընթացը. Երկար հանդիպումների ձայնագրություններն ավտոմատ բաժանելով կարճ, տրամաբանական հատվածների և դրանք ColQwen3-ով ինդեքսավորելով՝ ստեղծում եք որոնելի «ընկերության հիշողություն»։

  • Հարցումը. Ծրագրի ղեկավարը կարող է հարցնել. “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Արդյունքը. 60 րոպեանոց տեսաֆայլ վերադարձնելու փոխարեն համակարգը գտնում է հենց այն 45 վայրկյանանոց հատվածը, որտեղ տվյալ գծապատկերը ցուցադրվել և քննարկվել է, նույնիսկ եթե խոսողները հենց այդ պահին բացահայտ չեն արտասանել «հապաղում» բառը։

Կիրառումներ ձեռնարկություններում. արժեքավոր խնդիրների լուծում

Բնիկ բազմաեղանակ ներդրմանն անցնելը բոլորովին նոր աշխատընթացներ է հնարավոր դարձնում տարբեր ոլորտներում։ Մենք այս մոդելը համակողմանիորեն փորձարկել ենք ձեռնարկությունների տվյալների ամենաբարդ միջավայրերից մի քանիսում։

1. Թեստի կարևոր արդյունք. քաղաքային խորհրդատվություն և ճարտարապետություն

ColQwen3-ը փորձարկել ենք քաղաքային խորհրդատվական ընկերությունների տվյալների մարտահրավերներով. այդ ընկերությունները կառավարում են գլխավոր հատակագծերի, գոտիավորման քարտեզների և ճարտարապետական բարդ ճակատապատկերների հսկայական գրադարաններ։

  • Մարտահրավերը. Այս միջավայրերում ավանդական RAG շղթաները դժվարանում են։ OCR գործիքները սովորաբար տեղանքի բարդ հատակագծերը պարզապես նկարագրում են որպես «սխեմա»՝ բաց թողնելով երթևեկության հոսքի, կանաչ գոտիների կամ շենքերի հետքաշերի մասին կարևոր մանրամասները։

  • Արդյունավետությունը. Մեր ներքին թեստերը ցույց են տալիս, որ ColQwen3-ն արդյունավետորեն վերացնում է թանկարժեք OCR/նկարագրման նախնական մշակման անհրաժեշտությունը։ Խիտ ճարտարապետական գծագրերով փորձարկումներում մոդելը հաջողությամբ գտել է փաստաթղթեր՝ հիմնվելով որոշակի տեսողական նշիչների վրա, օրինակ՝ հետիոտնային մուտքերի կամ հստակ գոտիավորման սահմանների։ Այն զգալիորեն գերազանցել է միայն տեքստով աշխատող ելակետային լուծումները և խոստանում է կտրուկ նվազեցնել գիտելիքների ներմուծման ծախսերը։

2. Ֆինանսական և շուկայական համալիր վերլուծություն

Ներդրումային բանկիրներն ու վերլուծաբանները հազարավոր ժամեր են ծախսում տարեկան հաշվետվություններն ու ներդրողների շնորհանդեսներն ուսումնասիրելու վրա։

  • Աշխատընթացը. Վերլուծաբանը կարող է հարցնել. “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Փոփոխությունը. Հիմնաբառերի համընկնումների վրա հենվելու փոխարեն մոդելը գտնում է ճիշտ սլայդը՝ հիմնվելով տվյալների որոշակի պատկերավորման տեսողական առկայության վրա, ինչի շնորհիվ RAG համակարգը կարող է մեծ ճշգրտությամբ պատասխանել հարցերին։

3. Արդյունաբերական արտադրություն և տեղում սպասարկում

Արտադրական ընկերություններն ունեն տեխնիկական ձեռնարկների և խողովակաշարերի ու սարքավորումների սխեմաների (P&ID) հսկայական գրադարաններ։

  • Աշխատընթացը. Տուրբին վերանորոգող դաշտային ինժեները կարող է լուսանկարել դետալը կամ հարցնել. “Show me the wiring diagram for the hydraulic pump assembly.”

  • Փոփոխությունը. ColQwen3-ը ճանաչում է էլեկտրահաղորդման սխեմայի տեսողական պատկերը և գտնում ճիշտ էջը՝ հնարավոր է պարապուրդը ժամերով կրճատելով։

4. Իրավական և համապատասխանության ապահովում

Իրավական բացահայտման ընթացքում ուսումնասիրվում են միլիոնավոր սկանավորված էջեր, որտեղ որոնվող կարևոր տեղեկությունը հաճախ տեսողական նշիչ է։

  • Աշխատընթացը. Համապատասխանության պատասխանատուն կարող է որոնել “Documents signed by the CFO” կամ “Contracts containing the official ‘Confidential’ stamp.”

  • Փոփոխությունը. Մոդելը ստորագրությունների կամ կնիքների տեսողական առկայությամբ տարբերակում է նախագիծը վերջնական փաստաթղթից, ինչը զուտ OCR-ը հաճախ չի նկատում։

Ինչպես սկսել

ColQwen3-ը բաց կշիռներով է (Apache 2.0) և արդեն հասանելի է Hugging Face-ում։ Մենք այն նախագծել ենք որպես արդի RAG շղթաների անմիջական թարմացում՝ տրամադրելով տեքստի, պատկերների և տեսանյութերի անհապաղ մշակման համար անհրաժեշտ եզրակացության կոդը։

Պարզ տեքստային որոնումից առաջ անցնելու և իրենց տեսողական նյութերում թաքնված բանականությունն օգտագործելու պատրաստ ձեռնարկությունների համար սա նոր ստանդարտն է։

Հաջորդ քայլը. Դիտեք մոդելի քարտը և փորձեք Hugging Face-ի ուղիղ ցուցադրությունը՝ /-colqwen3-embed-8b և /-colqwen3-embed-4b

Հեղինակ

Xin Huang, Kye Min Tan