Kwa miaka miwili iliyopita, “RAG” (Uzalishaji Ulioimarishwa kwa Urejeshaji) imehusishwa karibu kabisa na maandishi. Utaratibu wa kawaida ni rahisi: chukua hati, toa maandishi, yagawanye katika vipande na uyaorodheshe.
Lakini ulimwengu wa mashirika hautegemei faili za maandishi rahisi. Unategemea PDF changamano, slaidi zenye chati nyingi, michoro ya CAD, ankara zilizochanganuliwa na, kwa kiwango kinachoongezeka, hifadhi kubwa za video.
Kiwango cha sekta cha kushughulikia haya—kutumia OCR au Vision LLM “kufafanua” picha kwa maandishi kabla ya kuipachika—ni kikwazo kikubwa. Ni polepole, ghali na bila kuepukika hupoteza muktadha muhimu wa nafasi na picha wa data asili. Ikiwa AI yako inafafanua picha changamano kama “ramani ya ujenzi” tu, unapoteza uwezo wa kutafuta vali au mchoro mahususi wa nyaya uliomo.
Leo, tunatoa familia ya miundo ya kisasa zaidi ya upachikaji wa modi nyingi, iliyojengwa juu ya usanifu wa ColPali na iliyoundwa kutatua tatizo hili kwa kuwezesha urejeshaji wa picha kutoka mwanzo hadi mwisho.
Kuunda mfumo bora kabisa wa urejeshaji wa modi nyingi si rahisi kama kuchukua Muundo wa Picha na Lugha (VLM) ulio tayari na kuuomba utafute. Ili kutatua changamoto ambazo kwa muda mrefu zimezuia RAG ya modi nyingi na kuunda ColQwen3, tulitumia mikakati ya kuunganisha na kufunza miundo.
Badala ya kuboresha muundo msingi kutoka mwanzo, tulibuni mbinu ya kuhamisha maarifa ya kazi za urejeshaji kutoka kwa muundo uliopo wa upachikaji wa maandishi. VLM ya kawaida inajua kueleza picha, lakini si lazima ijue kuzipanga kulingana na maana yake dhidi ya hoja.
Ili kuziba pengo hili, tulitumia mikakati ya uzani uliounganishwa na kusawazishwa. Katika majaribio yetu, tuligundua kuwa uwezo wa urejeshaji wa Qwen3-Embedding katika nafasi fiche ya maandishi unaweza kuhamishwa moja kwa moja hadi nafasi ya modi nyingi, na kutumika kwa urejeshaji wa picha na video hata bila mafunzo ya mara moja. Baada ya kutumia uanzishaji huu bora kama msingi imara, tuliboresha muundo zaidi ili kuongeza utendaji na kuhakikisha uthabiti. Hii huboresha utendaji wa mwisho wa urejeshaji ikilinganishwa na kuboresha muundo msingi wa Qwen3-VL.
Baada ya kuhamisha uwezo wa upachikaji, tulilenga upatanishaji. Tulifanya utafutaji makini wa vigezo vikuu na tafiti za kuondoa vipengele, zikiwemo idadi bora ya awamu za mafunzo, ukubwa wa kundi, kasi ya ujifunzaji, daraja la LoRA na mchanganyiko wa seti za data, ili kuongeza utendaji wa urejeshaji.
Kwa seti za data, tulichagua VDR, seti ya mafunzo ya ColPali, visrag_syn, na visrag_ind kwa uboreshaji wetu mahususi. Tulitumia usampulishaji wa UniMax kwa uboreshaji mahususi. Kwa kuwa tuliunganisha miundo na muundo msingi uliounganishwa tayari umerithi sehemu ya uwezo wa urejeshaji wa modi nyingi, tuligundua kuwa kuongeza seti zaidi za data kungepunguza utendaji kidogo; kwa hiyo, hatukuongeza seti zaidi.
Hivi ndivyo vigezo vikuu tulivyochagua kwa uboreshaji mahususi:
Daraja la LoRA | 32 |
Alfa ya LoRA | 32 |
Moduli lengwa za LoRA | safu zote za picha na maandishi isipokuwa upachikaji |
Kasi ya Ujifunzaji | 5e-5 |
Idadi ya Juu ya Tokeni za Picha | 1280 |
Awamu za Mafunzo | 1 |
Ukubwa wa Jumla wa Kundi | 512 |
Uwiano wa Kujiandaa | 5% |
Kihistoria, miundo iliyotumia upachikaji wa kiwango cha tokeni wa “mtindo wa ColBERT” (kama ColPali) ilitoa utendaji wa ajabu, lakini kwa gharama kubwa mno ya hifadhi. Kuorodhesha kila tokeni ya picha kuliunda hifadhidata kubwa za vekta ambazo zilikuwa ghali mno kutumiwa kwa kiwango cha mashirika.
Mkakati wa uboreshaji: Tulitatua changamoto ya hifadhi kwa kusawazisha kwa makini ukubwa wa upachikaji wetu ili kudumisha utendaji wa juu zaidi bila kuruhusu gharama za hifadhi kupanda kupita kiasi. Ili kudumisha usahihi wa SOTA katika ukubwa huu unaofaa, tulichagua kwa makini vipimo 320 ili kusawazisha vyema utendaji wa urejeshaji na gharama ya hifadhi.
Kiwango cha msingi: Mbinu ya kawaida (kama NVIDIA Nemo-3B) huhitaji takribani TB 10.3 kuhifadhi upachikaji wa picha milioni 1 (tokeni 1,802 @ vipimo 3,072).
ColQwen3: Huhifadhi picha hizo milioni 1 katika TB 0.82 pekee (hadi tokeni 1,280 @ vipimo 320).
ColQwen3 hufikia usahihi wa SOTA wa urejeshaji bila kuongeza kupita kiasi bajeti ya miundombinu ya wingu.
Tulithibitisha mbinu yetu kwa kutumia mkusanyiko wa vigezo vya ViDoRe. Matokeo yanathibitisha kuwa ColQwen3 inaweka viwango vipya kwenye vigezo vya karibuni vya V3 na V2 (vya Kiingereza na lugha nyingi), huku ikidumisha utendaji wa kiwango cha juu kwenye kazi za zamani za V1.
ColQwen3-8B inaongoza katika urejeshaji wa Kiingereza na lugha nyingi.
nDCG@5 ya Kiingereza
Muundo | Sayansi ya Kompyuta | Nishati | Fedha | Rasilimali Watu | Viwanda | Famasi | Fizikia | Wastani |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
nDCG@5 ya lugha nyingi
Muundo | Sayansi ya Kompyuta | Nishati | Fedha | Rasilimali Watu | Viwanda | Famasi | Fizikia | Wastani |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Utendaji bora kwa uthabiti katika ESG, Uchumi na DocVQA.
Kigezo | Muundo | Alama (Wastani) | Ushindi Muhimu |
ViDoRe V2 (Kiingereza) | ColQwen3-8B | 0.6772 | #1 katika ESG & BioMed |
ViDoRe V2 (Lugha nyingi) | ColQwen3-8B | 0.6085 | #1 katika Uchumi |
ViDoRe V1 (Kiingereza) | Nemo ColEmbed 3B | 0.9100 | Wastani wa juu kidogo |
ViDoRe V1 (Kiingereza) | ColQwen3-8B | 0.9076 | #1 katika ArxivQA & Syn-Gov |
Ili kuonyesha kuwa ColQwen3 inaweza kutumika vyema katika urejeshaji wa video, tulitathmini miundo kwa kutumia kigezo cha CareBench kwa kazi za kubadili maandishi kuwa video (Urejeshaji wa Jumla).
Kwa tathmini hii, tulitumia mbinu ya usimbaji wa video ghafi: miundo yetu ilisimba faili za video moja kwa moja bila ufafanuzi wa ziada wa maandishi au ingizo la metadata. Hili linaonyesha uwezo wa muundo kufanya urejeshaji kwa kutegemea maana ya picha pekee.
Muundo | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Mojawapo ya mabadiliko makubwa zaidi yanayowezeshwa na ColQwen3 ni uwezo wake wa kushughulikia video kama hati. Katika mashirika mengi, video ni “data iliyofichika.” Huhifadhiwa kwenye hifadhi isiyotumika mara kwa mara na haiwezi kutafutwa kabisa isipokuwa mtu aweke lebo kwenye kila faili.
ColQwen3 inabadilisha hali hii kwa kuwezesha urejeshaji wa kila fremu kwenye klipu zilizogawanywa.
Kila siku, mashirika hurekodi maelfu ya saa za mikutano ya ndani ya video na kwa kawaida rekodi hizi husahaulika kabisa.
Mtiririko wa kazi: Kwa kugawanya kiotomatiki rekodi ndefu za mikutano kuwa klipu fupi zenye mantiki na kuziorodhesha kwa ColQwen3, unaunda “kumbukumbu ya shirika” inayoweza kutafutwa.
Hoja: Msimamizi wa mradi anaweza kuuliza: “Show me the clip where the engineering lead explained the latency issue with the API.”
Matokeo: Badala ya kurudisha faili ya video ya dakika 60, mfumo hurejesha sehemu halisi ya sekunde 45 ambapo mchoro huo ulionyeshwa kwenye skrini na kujadiliwa, hata kama wazungumzaji hawakutaja neno “latency” katika sekunde hiyo.
Kuhamia kwenye upachikaji asilia wa modi nyingi kunafungua mitiririko mipya kabisa ya kazi katika sekta mbalimbali. Tumepima muundo huu kwa kina dhidi ya baadhi ya mazingira changamano zaidi ya data za mashirika.
Tulijaribu ColQwen3 dhidi ya changamoto za data zinazokabili kampuni za ushauri wa mijini, ambazo husimamia maktaba kubwa za mipango kabambe, ramani za matumizi ya ardhi na michoro changamano ya majengo.
Changamoto: Katika mazingira haya, mifumo ya kawaida ya RAG hupata matatizo. Zana za OCR kwa kawaida hufafanua mipango changamano ya maeneo kwa neno “mchoro” pekee, hivyo kukosa maelezo muhimu kuhusu mtiririko wa magari, maeneo ya kijani au nafasi kati ya jengo na mpaka.
Utendaji: Tathmini zetu za ndani zinaonyesha kuwa ColQwen3 huondoa kwa ufanisi hitaji la uchakataji wa awali wa gharama kubwa wa OCR/ufafanuzi wa picha. Katika majaribio ya michoro ya usanifu yenye maelezo mengi, muundo ulirejesha hati kwa mafanikio kulingana na viashiria maalum vya picha, kama vile njia za waenda kwa miguu au mipaka tofauti ya matumizi ya ardhi. Ulizidi kwa kiasi kikubwa viwango vya mifumo ya maandishi pekee, huku ukiahidi kupunguza sana gharama za kuingiza maarifa.
Mabenki ya uwekezaji na wachambuzi hutumia maelfu ya saa kuchunguza ripoti za mwaka na slaidi za wawekezaji.
Mtiririko wa kazi: Mchambuzi anaweza kuuliza, “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Mabadiliko: Badala ya kutegemea maneno yanayolingana, muundo hurejesha slaidi halisi kulingana na uwepo wa picha wa uwasilishaji mahususi wa data, hivyo kuruhusu mfumo wa RAG kujibu maswali kwa usahihi wa juu.
Kampuni za utengenezaji zina maktaba kubwa za miongozo ya kiufundi na michoro ya mabomba (P&IDs).
Mtiririko wa kazi: Mhandisi wa nyanjani anayerekebisha turbine anaweza kupiga picha ya sehemu au kuuliza, “Show me the wiring diagram for the hydraulic pump assembly.”
Mabadiliko: ColQwen3 hutambua uwakilishi wa picha wa mchoro wa nyaya na kurejesha ukurasa sahihi, jambo linaloweza kupunguza muda wa kusimama kwa kazi kwa saa kadhaa.
Ugunduzi wa kisheria huhusisha kukagua mamilioni ya kurasa zilizochanganuliwa ambapo kitu kinachotafutwa mara nyingi ni kiashiria cha picha.
Mtiririko wa kazi: Afisa wa uzingatiaji anaweza kutafuta “Documents signed by the CFO” au “Contracts containing the official ‘Confidential’ stamp.”
Mabadiliko: Muundo hutofautisha rasimu na hati iliyokamilishwa kwa kutambua saini au mihuri inayoonekana, jambo ambalo OCR pekee mara nyingi hukosa.
ColQwen3 ina uzani wazi (Apache 2.0) na sasa inapatikana kwenye Hugging Face. Tumeiunda iwe toleo jipya linaloweza kuongezwa moja kwa moja kwenye mifumo ya kisasa ya RAG, huku ikitoa msimbo wa uendeshaji unaohitajika kuchakata maandishi, picha na video mara moja.
Kwa mashirika yaliyo tayari kuvuka utafutaji rahisi wa maandishi na kufungua maarifa yaliyofichwa katika rasilimali zao za picha, hiki ndicho kiwango kipya.
Hatua inayofuata: Chunguza kadi ya muundo na ujaribu onyesho la moja kwa moja kwenye Hugging Face: /-colqwen3-embed-8b na /-colqwen3-embed-4b