Selama dua tahun terakhir, “RAG” (Retrieval-Augmented Generation) hampir selalu identik dengan teks. Prosedur standarnya sederhana: ambil dokumen, ekstrak teksnya, bagi menjadi potongan, lalu indeks.
Namun, dunia perusahaan tidak berjalan dengan berkas teks biasa. Dunia perusahaan mengandalkan PDF kompleks, kumpulan slide dengan grafik padat, gambar CAD, faktur yang dipindai, dan kini makin banyak arsip rekaman video berukuran besar.
Standar industri untuk menanganinya—menggunakan OCR atau LLM visi guna “mengubah gambar menjadi keterangan teks” sebelum membuat embedding—menjadi hambatan besar. Proses ini lambat, mahal, dan pasti menghilangkan kekayaan konteks spasial serta visual dari data asli. Jika AI Anda hanya mendeskripsikan visual kompleks sebagai “cetak biru”, Anda tidak lagi dapat mencari katup atau skema pengabelan tertentu di dalamnya.
Hari ini, kami merilis rangkaian model embedding multimodal mutakhir berbasis arsitektur ColPali, yang dirancang untuk mengatasi masalah ini dengan memungkinkan pengambilan visual secara menyeluruh.
Membangun sistem pengambilan multimodal yang benar-benar efektif tidak sesederhana mengambil Model Visi-Bahasa (VLM) siap pakai dan memintanya melakukan pencarian. Untuk mengatasi tantangan yang selama ini menghambat RAG multimodal dan menciptakan ColQwen3, kami menerapkan strategi penggabungan serta pelatihan model.
Alih-alih melakukan fine-tuning model dasar dari awal, kami merancang metode untuk mentransfer pengetahuan tugas pengambilan dari model embedding tekstual yang sudah ada. VLM standar tahu cara mendeskripsikan gambar, tetapi belum tentu tahu cara memeringkatnya secara semantik terhadap suatu kueri.
Untuk menjembatani kesenjangan ini, kami menggunakan strategi pembobotan gabungan yang disetel. Dalam eksperimen kami, kemampuan pengambilan Qwen3-Embedding di ruang laten tekstual dapat langsung ditransfer ke ruang multimodal dan digeneralisasi untuk pengambilan gambar serta video, bahkan tanpa pelatihan langsung. Dengan memanfaatkan inisialisasi efektif ini sebagai titik awal yang kuat, kami kemudian melakukan fine-tuning model untuk lebih mengoptimalkan performa dan memastikan ketangguhan. Pendekatan ini meningkatkan performa pengambilan akhir dibandingkan fine-tuning dari model dasar Qwen3-VL.
Setelah kemampuan embedding ditransfer, kami berfokus pada penyelarasan. Kami melakukan pencarian hiperparameter dan studi ablasi secara cermat, termasuk jumlah epoch optimal, ukuran batch, laju pembelajaran, peringkat LoRA, dan campuran set data, untuk memaksimalkan performa pengambilan.
Untuk set data fine-tuning, kami memilih VDR, set pelatihan ColPali, visrag_syn, dan visrag_ind. Kami menggunakan sampling UniMax untuk fine-tuning. Karena kami menerapkan penggabungan model dan model dasar hasil penggabungan sudah mewarisi sebagian kemampuan pengambilan multimodal, kami mendapati bahwa menambah set data justru sedikit menurunkan performa. Karena itu, kami tidak memperluas jumlah set data.
Berikut hiperparameter yang kami pilih untuk fine-tuning:
Peringkat LoRA | 32 |
Alfa LoRA | 32 |
Modul target LoRA | semua lapisan gambar dan teks, kecuali embedding |
Laju Pembelajaran | 5e-5 |
Token Visual Maksimum | 1280 |
Epoch Pelatihan | 1 |
Ukuran Batch Global | 512 |
Rasio Pemanasan | 5% |
Secara historis, model yang menggunakan embedding tingkat token “bergaya ColBERT” (seperti ColPali) menawarkan performa luar biasa, tetapi dengan biaya penyimpanan yang sangat tinggi. Pengindeksan setiap token visual menghasilkan basis data vektor yang sangat besar dan terlalu mahal untuk skala perusahaan.
Strategi pengoptimalan: Kami mengatasi tantangan penyimpanan dengan menyeimbangkan ukuran embedding secara cermat untuk mempertahankan performa maksimal tanpa membuat biaya penyimpanan melonjak. Untuk mempertahankan akurasi SOTA dengan kebutuhan sumber daya yang efisien ini, kami memilih ukuran dimensi 320 sebagai titik keseimbangan terbaik antara performa pengambilan dan biaya penyimpanan.
Tolok ukur dasar: Pendekatan standar (seperti NVIDIA Nemo-3B) memerlukan sekitar 10,3 TB untuk menyimpan embedding 1 juta gambar (1.802 token @ 3.072 dimensi).
ColQwen3: Menyimpan 1 juta gambar yang sama hanya dalam 0,82 TB (maks. 1.280 token @ 320 dimensi).
ColQwen3 mencapai akurasi pengambilan SOTA tanpa membuat anggaran infrastruktur cloud membengkak.
Kami memvalidasi pendekatan kami pada rangkaian tolok ukur ViDoRe. Hasilnya menegaskan bahwa ColQwen3 menetapkan standar baru pada tolok ukur V3 dan V2 terbaru (bahasa Inggris dan multibahasa), sekaligus mempertahankan performa terbaik pada tugas V1 lama.
ColQwen3-8B unggul dalam pengambilan informasi berbahasa Inggris dan multibahasa.
nDCG@5 bahasa Inggris
Model | Ilmu Komputer | Energi | Keuangan | SDM | Ind. | Farmasi | Fisika | Rata-rata |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
nDCG@5 multibahasa
Model | Ilmu Komputer | Energi | Keuangan | SDM | Ind. | Farmasi | Fisika | Rata-rata |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Performa tinggi yang konsisten pada ESG, Ekonomi, dan DocVQA.
Tolok ukur | Model | Skor (rata-rata) | Keunggulan penting |
ViDoRe V2 (bahasa Inggris) | ColQwen3-8B | 0.6772 | #1 di ESG & BioMed |
ViDoRe V2 (multibahasa) | ColQwen3-8B | 0.6085 | #1 di Ekonomi |
ViDoRe V1 (bahasa Inggris) | Nemo ColEmbed 3B | 0.9100 | Rata-rata sedikit lebih tinggi |
ViDoRe V1 (bahasa Inggris) | ColQwen3-8B | 0.9076 | #1 di ArxivQA & Syn-Gov |
Untuk menunjukkan bahwa ColQwen3 mampu menggeneralisasi dengan baik pada pengambilan video, kami mengevaluasi model tersebut menggunakan tolok ukur CareBench untuk tugas teks-ke-video (Pengambilan Umum).
Untuk evaluasi ini, kami menggunakan pendekatan pengodean video mentah: model kami mengodekan berkas video secara langsung tanpa anotasi tekstual tambahan maupun masukan metadata. Hal ini menunjukkan kemampuan model untuk melakukan pengambilan informasi hanya berdasarkan semantik visual.
Model | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Salah satu perubahan terbesar yang dimungkinkan oleh ColQwen3 adalah kemampuannya memperlakukan video layaknya dokumen. Di banyak perusahaan, video merupakan “data gelap”. Video tersimpan di penyimpanan dingin dan sama sekali tidak dapat ditelusuri, kecuali seseorang menandai setiap berkas secara manual.
ColQwen3 mengubah hal ini dengan memungkinkan pengambilan per bingkai pada klip yang telah disegmentasi.
Setiap hari, perusahaan merekam ribuan jam rapat video internal dan biasanya rekaman tersebut hilang begitu saja.
Alur kerja: Dengan otomatis membagi rekaman rapat panjang menjadi klip pendek yang logis dan mengindeksnya menggunakan ColQwen3, Anda dapat membuat “memori perusahaan” yang dapat ditelusuri.
Kueri: Seorang manajer proyek dapat meminta: “Show me the clip where the engineering lead explained the latency issue with the API.”
Hasil: Alih-alih menampilkan berkas video berdurasi 60 menit, sistem mengambil segmen tepat berdurasi 45 detik saat diagram tersebut ditampilkan dan dibahas, meskipun pembicara tidak secara eksplisit mengucapkan kata “latency” pada detik itu.
Peralihan ke embedding multimodal native membuka alur kerja yang sepenuhnya baru di berbagai industri. Kami telah menguji model ini secara ekstensif terhadap sejumlah lingkungan data perusahaan yang paling kompleks.
Kami menguji ColQwen3 terhadap tantangan data yang dihadapi perusahaan konsultasi perkotaan, yang mengelola pustaka besar berisi rencana induk, peta zonasi, dan elevasi arsitektur yang kompleks.
Tantangan: Di lingkungan ini, pipeline RAG tradisional mengalami kesulitan. Alat OCR biasanya hanya memberi keterangan “skema” pada rencana tapak yang kompleks, sehingga melewatkan detail penting tentang arus lalu lintas, zona hijau, atau garis sempadan bangunan.
Performa: Tolok ukur internal kami menunjukkan bahwa ColQwen3 secara efektif meniadakan kebutuhan akan prapemrosesan OCR/pembuatan keterangan yang mahal. Dalam pengujian dengan gambar arsitektur berdensitas tinggi, model berhasil mengambil dokumen berdasarkan penanda visual tertentu, seperti titik akses pejalan kaki atau batas zonasi yang jelas. Hasilnya jauh melampaui tolok ukur berbasis teks sekaligus berpotensi memangkas drastis biaya penyerapan pengetahuan.
Bankir investasi dan analis menghabiskan ribuan jam untuk menelusuri laporan tahunan dan kumpulan slide investor.
Alur kerja: Seorang analis dapat meminta, “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Perubahan: Alih-alih mengandalkan kecocokan kata kunci, model mengambil slide yang tepat berdasarkan keberadaan visualisasi data tertentu, sehingga sistem RAG dapat menjawab pertanyaan dengan presisi tinggi.
Perusahaan manufaktur memiliki pustaka besar berisi manual teknis dan diagram perpipaan (P&ID).
Alur kerja: Teknisi lapangan yang memperbaiki turbin dapat memotret suatu komponen atau meminta, “Show me the wiring diagram for the hydraulic pump assembly.”
Perubahan: ColQwen3 mengidentifikasi representasi visual diagram pengabelan dan mengambil halaman yang tepat, sehingga berpotensi memangkas waktu henti hingga beberapa jam.
Proses penemuan bukti hukum mencakup peninjauan jutaan halaman hasil pindai, dan informasi yang dicari sering kali berupa penanda visual.
Alur kerja: Petugas kepatuhan dapat mencari “Documents signed by the CFO” atau “Contracts containing the official ‘Confidential’ stamp.”
Perubahan: Model membedakan draf dan dokumen final berdasarkan keberadaan visual tanda tangan atau stempel, yang sering terlewat oleh OCR murni.
ColQwen3 memiliki bobot terbuka (Apache 2.0) dan kini tersedia di Hugging Face. Kami merancangnya sebagai peningkatan siap pakai untuk pipeline RAG modern, lengkap dengan kode inferensi yang diperlukan untuk langsung memproses teks, gambar, dan video.
Bagi perusahaan yang siap melampaui pencarian teks sederhana dan membuka akses ke kecerdasan yang terpendam dalam aset visual mereka, inilah standar baru.
Langkah berikutnya: Jelajahi kartu model dan coba demo langsung di Hugging Face: /-colqwen3-embed-8b dan /-colqwen3-embed-4b