Sajroning rong taun pungkasan, “RAG” (Retrieval-Augmented Generation) mèh tansah dianggep padha karo teks. Cara bakuné prasaja: jupuk dokumen, ekstrak teksé, pecah dadi bagéan cilik, banjur indeks.
Nanging, donya perusahaan ora mlaku nganggo berkas teks biasa. Operasiné nganggo PDF rumit, kumpulan slide kebak grafik, gambar CAD, invoice pindhean, lan saya akèh arsip rekaman video gedhé.
Standar industri kanggo nangani iki—nganggo OCR utawa Vision LLM kanggo ngowahi gambar dadi katrangan teks sadurungé di-embedding—dadi bottleneck gedhé. Prosès iki alon, larang, lan mesthi ngilangi konteks spasial lan visual sing sugih saka data asli. Yèn AI sampeyan mung njlèntrèhaké visual rumit minangka “cithak biru”, sampeyan bakal kelangan kabisan kanggo nggolèki katup utawa skema kabel tartamtu ing njero.
Dina iki, kita ngrilis kulawarga model embedding multimodal paling canggih sing dikembangaké adhedhasar arsitektur ColPali lan dirancang kanggo ngrampungaké masalah iki liwat panemuan visual saka awal nganti pungkasan.
Nggawe sistem panemuan multimodal sing saèstu efektif ora mung njupuk Vision-Language Model (VLM) siap pakai banjur dikon nggolèki. Kanggo ngrampungaké tantangan sing suwé ngalangi RAG multimodal lan nggawe ColQwen3, kita nganggo strategi panggabungan lan pelatihan model.
Tinimbang fine-tuning model dhasar saka nol, kita ngrancang cara kanggo mindhah kawruh tugas panemuan saka model embedding teks sing wis ana. VLM standar ngerti carané njlèntrèhaké gambar, nanging durung mesthi ngerti carané ngurutaké kanthi semantis adhedhasar pitakon.
Kanggo ngatasi kesenjangan iki, kita nganggo strategi bobot gabungan sing disetel. Ing eksperimen, kita nemokaké yèn kabisan panemuan Qwen3-Embedding ing ruang laten teks bisa langsung dipindhah menyang ruang multimodal, lan bisa digeneralisasi kanggo panemuan gambar lan video sanajan tanpa pelatihan langsung. Kanthi migunakaké inisialisasi efektif iki minangka titik wiwitan sing kuwat, kita banjur nindakake fine-tuning model kanggo luwih ngoptimalaké performa lan njamin ketangguhan. Cara iki ningkataké performa panemuan pungkasan dibandhingaké fine-tuning saka model dhasar Qwen3-VL.
Sawisé kabisan embedding dipindhah, kita fokus ing penyelarasan. Kita nindakake panlusuran hiperparameter lan studi ablasi kanthi tliti, kalebu cacah epoch optimal, ukuran batch, learning rate, rank LoRA, lan campuran set data kanggo ngoptimalaké performa panemuan.
Kanggo set data fine-tuning, kita milih VDR, set pelatihan ColPali, visrag_syn, lan visrag_ind. Kita nganggo sampling UniMax kanggo fine-tuning. Amarga kita ngetrapaké panggabungan model lan model dhasar gabungan wis marisi sapérangan kabisan panemuan multimodal, kita nemokaké yèn nambah set data malah rada ngurangi performa. Mula, kita ora nambah set data manèh.
Iki hiperparameter sing kita pilih kanggo fine-tuning:
Rank LoRA | 32 |
Alpha LoRA | 32 |
Modul target LoRA | kabeh lapisan gambar lan teks, kejaba embedding |
Learning Rate | 5e-5 |
Token Visual Maksimal | 1280 |
Epoch Pelatihan | 1 |
Ukuran Batch Global | 512 |
Rasio Warmup | 5% |
Sadurungé, model sing nganggo embedding tingkat token “gaya ColBERT” (kaya ColPali) nawakaké performa luar biasa, nanging biaya panyimpenané larang banget. Ngindeks saben token visual ngasilaké basis data vektor gedhé sing larang banget kanggo skala perusahaan.
Strategi Optimasi: Kita ngatasi tantangan panyimpenan kanthi ngimbangi ukuran embedding kanthi tliti supaya performa maksimal tetep kajaga tanpa ndadèkaké biaya panyimpenan mundhak ora kakendhalèni. Kanggo njaga akurasi SOTA kanthi ukuran sing efisien iki, kita milih ukuran dimensi 320 amarga paling imbang ing performa panemuan lan biaya panyimpenan.
Baseline: Pendekatan standar (kaya NVIDIA Nemo-3B) mbutuhaké watara 10.3 TB kanggo nyimpen embedding 1 yuta gambar (1.802 token @ 3.072 dimensi).
ColQwen3: Nyimpen 1 yuta gambar sing padha mung ing 0.82 TB (maks. 1.280 token @ 320 dimensi).
ColQwen3 nggayuh akurasi panemuan SOTA tanpa ngentèkaké anggaran infrastruktur cloud.
Kita wis validasi pendekatan iki nganggo rangkaian tolok ukur ViDoRe. Asilé mesthèkaké yèn ColQwen3 netepaké standar anyar ing tolok ukur V3 lan V2 paling anyar (basa Inggris lan Multibasa), sinambi njaga performa kelas paling dhuwur ing tugas V1 lawas.
ColQwen3-8B unggul ing panemuan informasi basa Inggris lan Multibasa.
nDCG@5 Basa Inggris
Model | Ilmu Komputer | Energi | Keuangan | SDM | Ind. | Farmasi | Fisika | Rata-rata |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
nDCG@5 Multibasa
Model | Ilmu Komputer | Energi | Keuangan | SDM | Ind. | Farmasi | Fisika | Rata-rata |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Performa dhuwur kanthi konsisten ing ESG, Ekonomi, lan DocVQA.
Tolok ukur | Model | Skor (Rata-rata) | Kaunggulan Utama |
ViDoRe V2 (Basa Inggris) | ColQwen3-8B | 0.6772 | #1 ing ESG & BioMed |
ViDoRe V2 (Multibasa) | ColQwen3-8B | 0.6085 | #1 ing Ekonomi |
ViDoRe V1 (Basa Inggris) | Nemo ColEmbed 3B | 0.9100 | Rata-rata rada luwih dhuwur |
ViDoRe V1 (Basa Inggris) | ColQwen3-8B | 0.9076 | #1 ing ArxivQA & Syn-Gov |
Kanggo nduduhaké yèn ColQwen3 bisa digeneralisasi kanthi apik kanggo panemuan video, kita ngevaluasi model-model kasebut nganggo tolok ukur CareBench kanggo tugas teks-menyang-video (Panemuan Umum).
Kanggo evaluasi iki, kita nganggo pendekatan enkoding video mentah: model kita langsung ngenkode berkas video tanpa anotasi teks tambahan utawa input metadata. Iki nyorot kabisan model kanggo nemokaké informasi adhedhasar semantik visual waé.
Model | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Salah siji owah-owahan paling wigati sing diwujudaké ColQwen3 yaiku kabisané nganggep video padha kaya dokumen. Ing akèh perusahaan, video iku “data peteng”. Video mung kasimpen ing panyimpenan arsip lan babar pisan ora bisa digolèki, kejaba ana wong sing mènèhi tag saben berkas kanthi manual.
ColQwen3 ngowahi iki kanthi ndadèkaké panemuan saben frame ing klip sing wis disegmentasi.
Saben dina, perusahaan ngrekam ewonan jam rapat video internal lan biasané rekaman kasebut banjur ilang tanpa guna.
Alur Kerja: Kanthi otomatis mbagi rekaman rapat dawa dadi klip luwih cendhak lan runtut, banjur ngindeks nganggo ColQwen3, sampeyan bisa nggawe “memori perusahaan” sing bisa digolèki.
Pitakon: Manajer proyèk bisa takon: “Show me the clip where the engineering lead explained the latency issue with the API.”
Asil: Tinimbang ngasilaké berkas video 60 menit, sistem nemokaké segmen 45 detik sing pas nalika diagram kasebut ditampilaké ing layar lan dirembug, sanajan para pamicara ora nyebut tembung “latency” kanthi cetha ing detik kasebut.
Pangalihan menyang embedding multimodal native mbukak alur kerja anyar ing manéka industri. Kita wis nguji model iki kanthi jembar ing sawetara lingkungan data perusahaan sing paling rumit.
Kita nguji ColQwen3 kanggo ngadhepi tantangan data ing firma konsultasi kutha sing ngatur pustaka gedhé isi rencana induk, peta zonasi, lan elevasi arsitektur rumit.
Tantangan: Ing lingkungan iki, alur RAG tradhisional kerep kangèlan. Piranti OCR biasané mung mènèhi katrangan “skema” marang rencana tapak rumit, saéngga ora nangkep rincian penting ngenani aliran lalu lintas, zona ijo, utawa jarak mundur bangunan.
Performa: Tolok ukur internal kita nduduhaké yèn ColQwen3 bisa ngilangi kabutuhan praproses OCR/pènèngan katrangan sing larang. Ing pangujian gambar arsitektur kanthi kapadhetan dhuwur, model kasil nemokaké dokumen adhedhasar panandha visual tartamtu, kayata titik akses wong mlaku utawa wates zonasi sing cetha. Asilé ngungkuli baseline mung-teks kanthi nyata, sinambi njanjèkaké pangurangan gedhé ing biaya ingestasi kawruh.
Bankir investasi lan analis ngentèkaké ewonan jam kanggo nliti laporan taunan lan kumpulan slide investor.
Alur Kerja: Analis bisa takon, “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Owah-owahan: Tinimbang ngandelaké kecocokan tembung kunci, model nemokaké slide sing pas adhedhasar anané visualisasi data tartamtu, saéngga sistem RAG bisa mangsuli pitakon kanthi presisi dhuwur.
Perusahaan manufaktur nduwèni pustaka gedhé isi manual tèknis lan diagram perpipaan (P&ID).
Alur Kerja: Insinyur lapangan sing ndandani turbin bisa motret komponèn utawa takon, “Show me the wiring diagram for the hydraulic pump assembly.”
Owah-owahan: ColQwen3 ngenali representasi visual diagram kabel lan nemokaké kaca sing bener, sing bisa nyuda downtime nganti pirang-pirang jam.
Panemuan bukti hukum mbutuhaké pamriksan yuta-yuta kaca pindhean, lan informasi sing digolèki kerep awujud panandha visual.
Alur Kerja: Petugas kepatuhan bisa nggolèki “Documents signed by the CFO” utawa “Contracts containing the official ‘Confidential’ stamp.”
Owah-owahan: Model mbédakaké draf lan dokumen final adhedhasar anané tandha tangan utawa cap kanthi visual, sing kerep ora kadeteksi OCR waé.
ColQwen3 nduwèni bobot terbuka (Apache 2.0) lan saiki kasedhiya ing Hugging Face. Kita ngrancang iki minangka upgrade siap pasang kanggo alur RAG modern, kanthi nyedhiyakaké kode inferensi sing dibutuhaké kanggo langsung ngolah teks, gambar, lan video.
Kanggo perusahaan sing siyap ngluwihi panlusuran teks prasaja lan mbukak Pilihan Kecerdasan sing kakunci ing aset visualé, iki standar anyar.
Langkah Sabanjuré: Delengen kertu model lan coba demo langsung ing Hugging Face: /-colqwen3-embed-8b lan /-colqwen3-embed-4b