Uelekezaji mkuu

Zaidi ya maandishi: kufungua RAG halisi ya modi nyingi kutoka mwanzo hadi mwisho

Miundo ya upachikaji wa modi nyingi husaidia timu kurejesha taarifa muhimu moja kwa moja kutoka kwenye hati changamano, picha na video.

Kwa miaka miwili iliyopita, “RAG” (Uzalishaji Ulioimarishwa kwa Urejeshaji) imehusishwa karibu kabisa na maandishi. Utaratibu wa kawaida ni rahisi: chukua hati, toa maandishi, yagawanye katika vipande na uyaorodheshe.

Lakini ulimwengu wa mashirika hautegemei faili za maandishi rahisi. Unategemea PDF changamano, slaidi zenye chati nyingi, michoro ya CAD, ankara zilizochanganuliwa na, kwa kiwango kinachoongezeka, hifadhi kubwa za video.

Kiwango cha sekta cha kushughulikia haya—kutumia OCR au Vision LLM “kufafanua” picha kwa maandishi kabla ya kuipachika—ni kikwazo kikubwa. Ni polepole, ghali na bila kuepukika hupoteza muktadha muhimu wa nafasi na picha wa data asili. Ikiwa AI yako inafafanua picha changamano kama “ramani ya ujenzi” tu, unapoteza uwezo wa kutafuta vali au mchoro mahususi wa nyaya uliomo.

Leo, tunatoa familia ya miundo ya kisasa zaidi ya upachikaji wa modi nyingi, iliyojengwa juu ya usanifu wa ColPali na iliyoundwa kutatua tatizo hili kwa kuwezesha urejeshaji wa picha kutoka mwanzo hadi mwisho.

Uhandisi unaowezesha matokeo haya: mikakati ya hali ya juu ya uboreshaji mahususi

Kuunda mfumo bora kabisa wa urejeshaji wa modi nyingi si rahisi kama kuchukua Muundo wa Picha na Lugha (VLM) ulio tayari na kuuomba utafute. Ili kutatua changamoto ambazo kwa muda mrefu zimezuia RAG ya modi nyingi na kuunda ColQwen3, tulitumia mikakati ya kuunganisha na kufunza miundo.

1. Kuhamisha uwezo wa upachikaji kupitia uzani uliounganishwa na kusawazishwa

Badala ya kuboresha muundo msingi kutoka mwanzo, tulibuni mbinu ya kuhamisha maarifa ya kazi za urejeshaji kutoka kwa muundo uliopo wa upachikaji wa maandishi. VLM ya kawaida inajua kueleza picha, lakini si lazima ijue kuzipanga kulingana na maana yake dhidi ya hoja.

Ili kuziba pengo hili, tulitumia mikakati ya uzani uliounganishwa na kusawazishwa. Katika majaribio yetu, tuligundua kuwa uwezo wa urejeshaji wa Qwen3-Embedding katika nafasi fiche ya maandishi unaweza kuhamishwa moja kwa moja hadi nafasi ya modi nyingi, na kutumika kwa urejeshaji wa picha na video hata bila mafunzo ya mara moja. Baada ya kutumia uanzishaji huu bora kama msingi imara, tuliboresha muundo zaidi ili kuongeza utendaji na kuhakikisha uthabiti. Hii huboresha utendaji wa mwisho wa urejeshaji ikilinganishwa na kuboresha muundo msingi wa Qwen3-VL.

2. Usawazishaji makini wa vigezo vikuu

Baada ya kuhamisha uwezo wa upachikaji, tulilenga upatanishaji. Tulifanya utafutaji makini wa vigezo vikuu na tafiti za kuondoa vipengele, zikiwemo idadi bora ya awamu za mafunzo, ukubwa wa kundi, kasi ya ujifunzaji, daraja la LoRA na mchanganyiko wa seti za data, ili kuongeza utendaji wa urejeshaji.

Kwa seti za data, tulichagua VDR, seti ya mafunzo ya ColPali, visrag_syn, na visrag_ind kwa uboreshaji wetu mahususi. Tulitumia usampulishaji wa UniMax kwa uboreshaji mahususi. Kwa kuwa tuliunganisha miundo na muundo msingi uliounganishwa tayari umerithi sehemu ya uwezo wa urejeshaji wa modi nyingi, tuligundua kuwa kuongeza seti zaidi za data kungepunguza utendaji kidogo; kwa hiyo, hatukuongeza seti zaidi.

Hivi ndivyo vigezo vikuu tulivyochagua kwa uboreshaji mahususi:

Daraja la LoRA

32

Alfa ya LoRA

32

Moduli lengwa za LoRA

safu zote za picha na maandishi isipokuwa upachikaji

Kasi ya Ujifunzaji

5e-5

Idadi ya Juu ya Tokeni za Picha

1280

Awamu za Mafunzo

1

Ukubwa wa Jumla wa Kundi

512

Uwiano wa Kujiandaa

5%

3. Mtanziko wa “ColBERT”: utendaji bora dhidi ya gharama ya hifadhi

Kihistoria, miundo iliyotumia upachikaji wa kiwango cha tokeni wa “mtindo wa ColBERT” (kama ColPali) ilitoa utendaji wa ajabu, lakini kwa gharama kubwa mno ya hifadhi. Kuorodhesha kila tokeni ya picha kuliunda hifadhidata kubwa za vekta ambazo zilikuwa ghali mno kutumiwa kwa kiwango cha mashirika.

  • Mkakati wa uboreshaji: Tulitatua changamoto ya hifadhi kwa kusawazisha kwa makini ukubwa wa upachikaji wetu ili kudumisha utendaji wa juu zaidi bila kuruhusu gharama za hifadhi kupanda kupita kiasi. Ili kudumisha usahihi wa SOTA katika ukubwa huu unaofaa, tulichagua kwa makini vipimo 320 ili kusawazisha vyema utendaji wa urejeshaji na gharama ya hifadhi.

    • Kiwango cha msingi: Mbinu ya kawaida (kama NVIDIA Nemo-3B) huhitaji takribani TB 10.3 kuhifadhi upachikaji wa picha milioni 1 (tokeni 1,802 @ vipimo 3,072).

    • ColQwen3: Huhifadhi picha hizo milioni 1 katika TB 0.82 pekee (hadi tokeni 1,280 @ vipimo 320).

ColQwen3 hufikia usahihi wa SOTA wa urejeshaji bila kuongeza kupita kiasi bajeti ya miundombinu ya wingu.

Matokeo ya tathmini

Tulithibitisha mbinu yetu kwa kutumia mkusanyiko wa vigezo vya ViDoRe. Matokeo yanathibitisha kuwa ColQwen3 inaweka viwango vipya kwenye vigezo vya karibuni vya V3 na V2 (vya Kiingereza na lugha nyingi), huku ikidumisha utendaji wa kiwango cha juu kwenye kazi za zamani za V1.

ViDoRe v3 (ya karibuni)

ColQwen3-8B inaongoza katika urejeshaji wa Kiingereza na lugha nyingi.

nDCG@5 ya Kiingereza

Muundo

Sayansi ya Kompyuta

Nishati

Fedha

Rasilimali Watu

Viwanda

Famasi

Fizikia

Wastani

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 ya lugha nyingi

Muundo

Sayansi ya Kompyuta

Nishati

Fedha

Rasilimali Watu

Viwanda

Famasi

Fizikia

Wastani

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Matokeo muhimu ya ViDoRe v2 na v1

Utendaji bora kwa uthabiti katika ESG, Uchumi na DocVQA.

Kigezo

Muundo

Alama (Wastani)

Ushindi Muhimu

ViDoRe V2 (Kiingereza)

ColQwen3-8B

0.6772

#1 katika ESG & BioMed

ViDoRe V2 (Lugha nyingi)

ColQwen3-8B

0.6085

#1 katika Uchumi

ViDoRe V1 (Kiingereza)

Nemo ColEmbed 3B

0.9100

Wastani wa juu kidogo

ViDoRe V1 (Kiingereza)

ColQwen3-8B

0.9076

#1 katika ArxivQA & Syn-Gov

Urejeshaji wa video: tathmini ya CareBench

Ili kuonyesha kuwa ColQwen3 inaweza kutumika vyema katika urejeshaji wa video, tulitathmini miundo kwa kutumia kigezo cha CareBench kwa kazi za kubadili maandishi kuwa video (Urejeshaji wa Jumla).

Kwa tathmini hii, tulitumia mbinu ya usimbaji wa video ghafi: miundo yetu ilisimba faili za video moja kwa moja bila ufafanuzi wa ziada wa maandishi au ingizo la metadata. Hili linaonyesha uwezo wa muundo kufanya urejeshaji kwa kutegemea maana ya picha pekee.

Muundo

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Kufungua “data iliyofichika”: mpaka wa video

Mojawapo ya mabadiliko makubwa zaidi yanayowezeshwa na ColQwen3 ni uwezo wake wa kushughulikia video kama hati. Katika mashirika mengi, video ni “data iliyofichika.” Huhifadhiwa kwenye hifadhi isiyotumika mara kwa mara na haiwezi kutafutwa kabisa isipokuwa mtu aweke lebo kwenye kila faili.

ColQwen3 inabadilisha hali hii kwa kuwezesha urejeshaji wa kila fremu kwenye klipu zilizogawanywa.

Mfano wa matumizi: hazina ya kumbukumbu za shirika

Kila siku, mashirika hurekodi maelfu ya saa za mikutano ya ndani ya video na kwa kawaida rekodi hizi husahaulika kabisa.

  • Mtiririko wa kazi: Kwa kugawanya kiotomatiki rekodi ndefu za mikutano kuwa klipu fupi zenye mantiki na kuziorodhesha kwa ColQwen3, unaunda “kumbukumbu ya shirika” inayoweza kutafutwa.

  • Hoja: Msimamizi wa mradi anaweza kuuliza: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Matokeo: Badala ya kurudisha faili ya video ya dakika 60, mfumo hurejesha sehemu halisi ya sekunde 45 ambapo mchoro huo ulionyeshwa kwenye skrini na kujadiliwa, hata kama wazungumzaji hawakutaja neno “latency” katika sekunde hiyo.

Matumizi ya mashirika: kutatua matatizo yenye thamani kubwa

Kuhamia kwenye upachikaji asilia wa modi nyingi kunafungua mitiririko mipya kabisa ya kazi katika sekta mbalimbali. Tumepima muundo huu kwa kina dhidi ya baadhi ya mazingira changamano zaidi ya data za mashirika.

1. Jambo kuu la tathmini: ushauri wa mijini na usanifu majengo

Tulijaribu ColQwen3 dhidi ya changamoto za data zinazokabili kampuni za ushauri wa mijini, ambazo husimamia maktaba kubwa za mipango kabambe, ramani za matumizi ya ardhi na michoro changamano ya majengo.

  • Changamoto: Katika mazingira haya, mifumo ya kawaida ya RAG hupata matatizo. Zana za OCR kwa kawaida hufafanua mipango changamano ya maeneo kwa neno “mchoro” pekee, hivyo kukosa maelezo muhimu kuhusu mtiririko wa magari, maeneo ya kijani au nafasi kati ya jengo na mpaka.

  • Utendaji: Tathmini zetu za ndani zinaonyesha kuwa ColQwen3 huondoa kwa ufanisi hitaji la uchakataji wa awali wa gharama kubwa wa OCR/ufafanuzi wa picha. Katika majaribio ya michoro ya usanifu yenye maelezo mengi, muundo ulirejesha hati kwa mafanikio kulingana na viashiria maalum vya picha, kama vile njia za waenda kwa miguu au mipaka tofauti ya matumizi ya ardhi. Ulizidi kwa kiasi kikubwa viwango vya mifumo ya maandishi pekee, huku ukiahidi kupunguza sana gharama za kuingiza maarifa.

2. Uchambuzi changamano wa fedha na masoko

Mabenki ya uwekezaji na wachambuzi hutumia maelfu ya saa kuchunguza ripoti za mwaka na slaidi za wawekezaji.

  • Mtiririko wa kazi: Mchambuzi anaweza kuuliza, “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Mabadiliko: Badala ya kutegemea maneno yanayolingana, muundo hurejesha slaidi halisi kulingana na uwepo wa picha wa uwasilishaji mahususi wa data, hivyo kuruhusu mfumo wa RAG kujibu maswali kwa usahihi wa juu.

3. Utengenezaji viwandani na huduma za nyanjani

Kampuni za utengenezaji zina maktaba kubwa za miongozo ya kiufundi na michoro ya mabomba (P&IDs).

  • Mtiririko wa kazi: Mhandisi wa nyanjani anayerekebisha turbine anaweza kupiga picha ya sehemu au kuuliza, “Show me the wiring diagram for the hydraulic pump assembly.”

  • Mabadiliko: ColQwen3 hutambua uwakilishi wa picha wa mchoro wa nyaya na kurejesha ukurasa sahihi, jambo linaloweza kupunguza muda wa kusimama kwa kazi kwa saa kadhaa.

4. Sheria na uzingatiaji

Ugunduzi wa kisheria huhusisha kukagua mamilioni ya kurasa zilizochanganuliwa ambapo kitu kinachotafutwa mara nyingi ni kiashiria cha picha.

  • Mtiririko wa kazi: Afisa wa uzingatiaji anaweza kutafuta “Documents signed by the CFO” au “Contracts containing the official ‘Confidential’ stamp.”

  • Mabadiliko: Muundo hutofautisha rasimu na hati iliyokamilishwa kwa kutambua saini au mihuri inayoonekana, jambo ambalo OCR pekee mara nyingi hukosa.

Kuanza

ColQwen3 ina uzani wazi (Apache 2.0) na sasa inapatikana kwenye Hugging Face. Tumeiunda iwe toleo jipya linaloweza kuongezwa moja kwa moja kwenye mifumo ya kisasa ya RAG, huku ikitoa msimbo wa uendeshaji unaohitajika kuchakata maandishi, picha na video mara moja.

Kwa mashirika yaliyo tayari kuvuka utafutaji rahisi wa maandishi na kufungua maarifa yaliyofichwa katika rasilimali zao za picha, hiki ndicho kiwango kipya.

Hatua inayofuata: Chunguza kadi ya muundo na ujaribu onyesho la moja kwa moja kwenye Hugging Face: /-colqwen3-embed-8b na /-colqwen3-embed-4b

Mwandishi

Xin Huang, Kye Min Tan