Sa nakalipas na dalawang taon, ang “RAG” (Retrieval-Augmented Generation) ay halos naging kasingkahulugan lamang ng text. Simple ang karaniwang proseso: kunin ang mga dokumento, i-extract ang text, hatiin ito sa mga chunk, at i-index.
Ngunit hindi plain text file ang nagpapatakbo sa mundo ng enterprise. Umaasa ito sa masalimuot na PDF, mga slide deck na puno ng chart, CAD drawing, scanned invoice, at lalo na sa napakalalaking archive ng video footage.
Napakalaking bottleneck ang pamantayan ng industriya na gumamit ng OCR o Vision LLM upang gawing text ang “caption” ng isang image bago ito i-embed. Mabagal at mahal ito, at hindi maiiwasang mawala ang mayamang spatial at visual na konteksto ng orihinal na data. Kung inilalarawan lamang ng iyong AI ang isang masalimuot na visual bilang “isang blueprint,” nawawala ang kakayahan mong hanapin ang partikular na valve o wiring schematic sa loob nito.
Ngayon, inilalabas namin ang isang pamilya ng makabagong multimodal embedding model na binuo sa ColPali architecture upang lutasin ang problemang ito sa pamamagitan ng end-to-end visual retrieval.
Hindi sapat na kumuha lang ng handa nang Vision-Language Model (VLM) at utusan itong maghanap upang makabuo ng tunay na epektibong multimodal retriever. Upang lutasin ang mga hamong matagal nang pumipigil sa multimodal RAG at mabuo ang ColQwen3, gumamit kami ng mga strategy sa model merging at training.
Sa halip na i-fine-tune mula sa simula ang isang base model, bumuo kami ng paraan upang ilipat ang kaalaman sa mga retrieval task mula sa dati nang textual embedding model. Marunong maglarawan ng mga image ang karaniwang VLM, ngunit hindi ibig sabihin na marunong itong mag-rank ayon sa kahulugan batay sa isang query.
Upang mapunan ang puwang na ito, gumamit kami ng mga tuned merged weighting strategy. Sa aming mga eksperimento, nalaman naming direktang maililipat sa multimodal space ang retrieval capability ng Qwen3-Embedding sa textual latent space, at nakakapag-generalize ito sa image at video retrieval kahit walang agarang training. Ginamit namin ang epektibong initialization na ito bilang matibay na panimulang punto, at pagkatapos ay i-fine-tune ang modelo upang higit pang i-optimize ang performance at matiyak ang tibay nito. Pinapahusay nito ang panghuling retrieval performance kumpara sa fine-tuning mula sa Qwen3-VL base model.
Matapos mailipat ang mga embedding capability, nagpokus kami sa alignment. Nagsagawa kami ng masusing hyperparameter search at ablation study, kabilang ang pinakamainam na bilang ng epoch, batch size, learning rate, LoRA rank, at halo ng mga dataset, upang i-maximize ang retrieval performance.
Para sa mga dataset, pinili namin ang VDR, ColPali train set, visrag_syn, at visrag_ind bilang aming mga fine-tuning dataset. Gumamit kami ng UniMax sampling para sa fine-tuning. Dahil gumamit kami ng model merging at namana na ng base merged model ang ilang multimodal retriever capability, nalaman naming bahagyang bababa ang performance kapag dinagdagan pa ang mga dataset. Kaya hindi na namin pinalawak ang bilang ng mga ito.
Narito ang mga hyperparameter na pinili namin para sa fine-tuning:
LoRA Rank | 32 |
LoRA Alpha | 32 |
Mga target module ng LoRA | lahat ng layer ng image at text, maliban sa embedding |
Learning Rate | 5e-5 |
Maximum na Visual Token | 1280 |
Mga Training Epoch | 1 |
Global Batch Size | 512 |
Warmup Ratio | 5% |
Noon, nag-aalok ng pambihirang performance ang mga modelong gumagamit ng “ColBERT-style” token-level embedding, gaya ng ColPali, ngunit napakalaki ng gastos sa storage. Ang pag-index sa bawat visual token ay lumikha ng napakalalaking vector database na sobrang mahal para gamitin sa enterprise scale.
Ang Strategy sa Optimization: Tinugunan namin ang hamon sa storage sa pamamagitan ng maingat na pagbabalanse sa laki ng aming mga embedding upang mapanatili ang pinakamataas na performance nang hindi sumasabog ang gastos sa storage. Upang mapanatili ang SOTA accuracy sa episyenteng footprint na ito, maingat naming pinili ang dim size na 320 para sa pinakabalanseng retrieval performance at gastos sa storage.
Baseline: Nangangailangan ang karaniwang pamamaraan, gaya ng NVIDIA Nemo-3B, ng humigit-kumulang 10.3 TB upang i-store ang mga embedding ng 1 milyong image (1,802 token @ 3,072 dim).
ColQwen3: Ini-store ang parehong 1 milyong image sa 0.82 TB lamang (maximum na 1,280 token @ 320 dim).
Nakakamit ng ColQwen3 ang SOTA retrieval accuracy nang hindi pinapalaki nang husto ang badyet sa cloud infrastructure.
Pinatunayan namin ang aming pamamaraan gamit ang ViDoRe benchmark suite. Kinukumpirma ng mga resulta na nagtatakda ang ColQwen3 ng mga bagong pamantayan sa pinakabagong V3 at V2 benchmark (English at Multilingual), habang nananatiling nangunguna sa mga lumang V1 task.
Nangunguna ang ColQwen3-8B sa English at Multilingual retrieval.
English nDCG@5
Modelo | CompSci | Enerhiya | Pananalapi | HR | Ind. | Pharma | Pisika | Avg |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Multilingual nDCG@5
Modelo | CompSci | Enerhiya | Pananalapi | HR | Ind. | Pharma | Pisika | Avg |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Tuloy-tuloy na mataas ang performance sa ESG, Economics, at DocVQA.
Benchmark | Modelo | Iskor (Avg) | Kapansin-pansing Panalo |
ViDoRe V2 (English) | ColQwen3-8B | 0.6772 | #1 sa ESG & BioMed |
ViDoRe V2 (Multi) | ColQwen3-8B | 0.6085 | #1 sa Economics |
ViDoRe V1 (English) | Nemo ColEmbed 3B | 0.9100 | Bahagyang mas mataas na average |
ViDoRe V1 (English) | ColQwen3-8B | 0.9076 | #1 sa ArxivQA & Syn-Gov |
Upang ipakitang mahusay mag-generalize ang ColQwen3 sa video retrieval, sinuri namin ang mga modelo gamit ang CareBench benchmark para sa mga text-to-video task (General Retrieval).
Para sa pagsusuring ito, gumamit kami ng raw video encoding: direktang in-encode ng aming mga modelo ang mga video file nang walang dagdag na tekstuwal na anotasyon o metadata input. Ipinapakita nito ang kakayahan ng modelo na magsagawa ng retrieval batay lamang sa visual semantics.
Modelo | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Isa sa pinakamalalaking pagbabagong hatid ng ColQwen3 ang kakayahan nitong ituring ang video na parang dokumento. Sa maraming enterprise, “dark data” ang video. Nananatili ito sa cold storage at hindi mahahanap maliban kung mano-manong nilagyan ng tag ng tao ang bawat file.
Binabago ito ng ColQwen3 sa pamamagitan ng frame-wise retrieval sa mga naka-segment na clip.
Araw-araw, nagre-record ang mga enterprise ng libo-libong oras ng mga internal video meeting, at karaniwang nawawala na lamang ang mga recording na ito.
Ang Workflow: Sa awtomatikong paghahati ng mahahabang recording ng meeting sa mas maiikli at lohikal na clip at pag-index sa mga ito gamit ang ColQwen3, nakakagawa ka ng mahahanap na “corporate memory.”
Ang Query: Maaaring itanong ng project manager: “Show me the clip where the engineering lead explained the latency issue with the API.”
Ang Resulta: Sa halip na magbalik ng 60 minutong video file, kinukuha ng system ang eksaktong 45 segundong segment kung saan ipinakita at tinalakay sa screen ang partikular na diagram, kahit hindi tahasang sinabi ng mga speaker ang salitang “latency” sa mismong sandaling iyon.
Nagbubukas ang paglipat sa native multimodal embedding ng mga ganap na bagong workflow sa iba't ibang industriya. Malawakan naming na-benchmark ang modelong ito sa ilan sa pinakamasalimuot na enterprise data environment.
Sinubukan namin ang ColQwen3 sa mga hamon sa data na kinakaharap ng mga urban consulting firm, na nangangasiwa ng napakalalaking koleksiyon ng master plan, zoning map, at masalimuot na architectural elevation.
Ang Hamon: Nahihirapan ang mga tradisyonal na RAG pipeline sa ganitong mga environment. Karaniwang inilalarawan ng mga OCR tool ang masalimuot na site plan bilang “schematic” lamang, kaya hindi nito nakukuha ang mahahalagang detalye tungkol sa daloy ng trapiko, green zone, o building setback.
Ang Performance: Ipinapakita ng aming mga internal benchmark na epektibong inaalis ng ColQwen3 ang pangangailangan sa mahal na OCR/Captioning pre-processing. Sa mga pagsubok gamit ang masisinsing architectural drawing, matagumpay na nakuha ng modelo ang mga dokumento batay sa mga partikular na visual marker gaya ng pedestrian access point o natatanging zoning boundary. Higit na mahusay ito kaysa sa text-only baseline at nangangakong lubos na babawasan ang gastos sa knowledge ingestion.
Gumugugol ang mga investment banker at analyst ng libo-libong oras sa pagsusuri ng mga annual report at investor deck.
Ang Workflow: Maaaring itanong ng analyst, “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Ang Pagbabago: Sa halip na umasa sa pagtutugma ng keyword, kinukuha ng modelo ang eksaktong slide batay sa visual na presensya ng partikular na data visualization, kaya nakakasagot ang RAG system nang may mataas na katumpakan.
May malalawak na koleksiyon ng technical manual at piping diagram (P&ID) ang mga manufacturing firm.
Ang Workflow: Maaaring kunan ng larawan ng field engineer na nagkukumpuni ng turbine ang isang piyesa o itanong, “Show me the wiring diagram for the hydraulic pump assembly.”
Ang Pagbabago: Tinutukoy ng ColQwen3 ang visual representation ng wiring diagram at kinukuha ang tamang pahina, na posibleng magpaikli sa downtime nang ilang oras.
Kasama sa legal discovery ang pagsusuri sa milyun-milyong scanned page, kung saan madalas na isang visual marker ang “karayom sa bunton ng dayami.”
Ang Workflow: Maaaring maghanap ang compliance officer ng “Documents signed by the CFO” o “Contracts containing the official ‘Confidential’ stamp.”
Ang Pagbabago: Nakikilala ng modelo ang draft at finalized na dokumento batay sa visual na presensya ng mga lagda o stamp—isang bagay na madalas hindi makita ng purong OCR.
Open-weights ang ColQwen3 (Apache 2.0) at available na ngayon sa Hugging Face. Dinisenyo namin ito bilang drop-in upgrade para sa mga modernong RAG pipeline, kasama ang inference code na kailangan upang agad na maproseso ang text, image, at video.
Para sa mga enterprise na handang lumampas sa simpleng text search at gamitin ang Intelligence na nakapaloob sa kanilang mga visual asset, ito ang bagong pamantayan.
Susunod na Hakbang: Tingnan ang card ng modelo at subukan ang live demo sa Hugging Face: /-colqwen3-embed-8b at /-colqwen3-embed-4b