Son iki yıldır “RAG” (Getirme Destekli Üretim) neredeyse yalnızca metinle eş anlamlıydı. Standart yöntem basit: belgeleri alın, metni çıkarın, parçalara ayırın ve dizine ekleyin.
Ancak kurumsal dünya düz metin dosyalarıyla çalışmıyor. Karmaşık PDF'ler, yoğun grafikler içeren sunumlar, CAD çizimleri, taranmış faturalar ve giderek büyüyen video arşivleriyle çalışıyor.
Bunu işlemek için görseli gömmeden önce OCR veya Görsel LLM'lerle metin olarak “açıklamak”, sektör standardı olsa da büyük bir darboğazdır. Bu süreç yavaş ve pahalıdır; ayrıca özgün verinin zengin mekânsal ve görsel bağlamını kaçınılmaz olarak kaybeder. Yapay zekânız karmaşık bir görseli yalnızca “bir plan” diye tanımlarsa içindeki belirli vanayı veya kablo şemasını arama olanağını kaybedersiniz.
Bugün, uçtan uca görsel getirmeyi mümkün kılarak bu sorunu çözmek üzere tasarlanan ColPali mimarisini temel alan son teknoloji çok modlu gömme modelleri ailesini yayımlıyoruz.
Gerçekten etkili bir çok modlu getirici oluşturmak, hazır bir Görsel-Dil Modeli (VLM) alıp arama yapmasını istemek kadar basit değildir. Çok modlu RAG'ı tarihsel olarak sınırlayan zorlukları aşmak ve ColQwen3'ü oluşturmak için model birleştirme ve eğitim stratejileri kullandık.
Temel bir modele sıfırdan ince ayar yapmak yerine, mevcut bir metinsel gömme modelinin getirme görevleri bilgisini aktaran bir yöntem geliştirdik. Standart bir VLM, görselleri nasıl açıklayacağını bilir ancak bunları bir sorguya göre anlamsal olarak nasıl sıralayacağını bilmeyebilir.
Bu açığı kapatmak için ayarlanmış birleşik ağırlıklandırma stratejilerinden yararlandık. Deneylerimizde, Qwen3-Embedding'in metinsel gizil uzaydaki getirme yeteneğinin doğrudan çok modlu uzaya aktarılabildiğini ve anında eğitim yapılmasa bile görsel ve video getirmeye genellenebildiğini gördük. Bu etkili başlangıç ayarını güçlü bir temel olarak kullanıp performansı daha da iyileştirmek ve dayanıklılığı sağlamak için modele ince ayar yaptık. Bu, Qwen3-VL temel modelinden başlayarak yapılan ince ayara kıyasla nihai getirme performansını artırır.
Gömme yetenekleri aktarıldıktan sonra hizalamaya odaklandık. Getirme performansını en üst düzeye çıkarmak için ideal dönem sayısı, yığın boyutu, öğrenme oranı, LoRA derecesi ve veri kümesi karışımını kapsayan titiz hiperparametre aramaları ve ablasyon çalışmaları yürüttük.
İnce ayar veri kümelerimiz olarak VDR, ColPali eğitim kümesi, visrag_syn, ve visrag_ind kümelerini seçtik. İnce ayarda UniMax örneklemesini kullandık. Model birleştirme uyguladığımız ve birleştirilmiş temel model kısmi çok modlu getirici yeteneğini zaten devraldığı için daha fazla veri kümesine çıkmanın performansı bir miktar düşürdüğünü gördük; bu nedenle veri kümesi sayısını artırmadık.
İnce ayar için seçtiğimiz hiperparametreler şunlardır:
LoRA Derecesi | 32 |
LoRA Alfa | 32 |
LoRA hedef modülleri | gömme hariç hem görsel hem metin için tüm katmanlar |
Öğrenme Oranı | 5e-5 |
Maksimum Görsel Token Sayısı | 1280 |
Eğitim Dönemleri | 1 |
Genel Yığın Boyutu | 512 |
Isınma Oranı | %5 |
“ColBERT tarzı” token düzeyinde gömmeler kullanan modeller (ColPali gibi) geçmişte olağanüstü performans sunuyor ancak aşırı depolama maliyetine yol açıyordu. Her görsel tokenı dizine eklemek, kurumsal ölçekte çok pahalı olan devasa vektör veri tabanları oluşturuyordu.
Optimizasyon Stratejisi: Depolama maliyetlerinin kontrolden çıkmasını önlerken en yüksek performansı korumak için gömmelerimizin boyutunu dikkatle dengeleyerek depolama sorununu çözdük. Bu verimli boyutta SOTA doğruluğunu korumak için getirme performansı ile depolama maliyeti arasındaki en iyi dengeyi sağlayan boyut değerini 320 olarak belirledik.
Temel yaklaşım: Standart bir yaklaşım (NVIDIA Nemo-3B gibi), 1 milyon görselin gömmelerini depolamak için yaklaşık 10,3 TB gerektirir (1.802 token @ 3.072 boyut).
ColQwen3: Aynı 1 milyon görseli yalnızca 0,82 TB içinde depolar (en fazla 1.280 token @ 320 boyut).
ColQwen3, bulut altyapısı bütçesini şişirmeden SOTA getirme doğruluğuna ulaşır.
Yaklaşımımızı ViDoRe kıyaslama paketiyle doğruladık. Sonuçlar, ColQwen3'ün eski V1 görevlerindeki en üst düzey performansını korurken en yeni V3 ve V2 kıyaslamalarında (İngilizce ve Çok Dilli) yeni standartlar belirlediğini doğruluyor.
ColQwen3-8B, İngilizce ve Çok Dilli getirmede lider.
İngilizce nDCG@5
Model | Bilgisayar Bil. | Enerji | Finans | İK | San. | İlaç | Fizik | Ort. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Çok Dilli nDCG@5
Model | Bilgisayar Bil. | Enerji | Finans | İK | San. | İlaç | Fizik | Ort. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, Ekonomi ve DocVQA genelinde istikrarlı yüksek performans.
Kıyaslama | Model | Puan (Ort.) | Önemli Başarı |
ViDoRe V2 (İngilizce) | ColQwen3-8B | 0.6772 | ESG ve BioMed'de 1. |
ViDoRe V2 (Çok Dilli) | ColQwen3-8B | 0.6085 | Ekonomide 1. |
ViDoRe V1 (İngilizce) | Nemo ColEmbed 3B | 0.9100 | Biraz daha yüksek ortalama |
ViDoRe V1 (İngilizce) | ColQwen3-8B | 0.9076 | ArxivQA ve Syn-Gov'da 1. |
ColQwen3'ün video getirmeye güçlü biçimde genellenebildiğini göstermek için modelleri, metinden videoya (Genel Getirme) görevlerine yönelik CareBench kıyaslamasında değerlendirdik.
Bu değerlendirmede ham video kodlama yaklaşımını kullandık: modellerimiz, ek metin açıklamaları veya meta veri girdileri olmadan video dosyalarını doğrudan kodladı. Bu, modelin yalnızca görsel anlamlara dayalı getirme yapabildiğini gösteriyor.
Model | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3'ün sağladığı en köklü değişimlerden biri, videoları tıpkı belgeler gibi işleyebilmesidir. Birçok kurumda video, “karanlık veridir”. Bir insan her dosyayı elle etiketlemedikçe soğuk depolamada kalır ve hiç aranamaz.
ColQwen3, bölümlere ayrılmış kliplerde kare bazında getirmeyi mümkün kılarak bunu değiştiriyor.
Kurumlar her gün binlerce saatlik şirket içi görüntülü toplantı kaydediyor ve bu kayıtlar genellikle yok olup gidiyor.
İş Akışı: Uzun toplantı kayıtlarını otomatik olarak kısa, mantıksal kliplere ayırıp ColQwen3 ile dizine ekleyerek aranabilir bir “kurumsal hafıza” oluşturabilirsiniz.
Sorgu: Bir proje yöneticisi şunu sorabilir: “Show me the clip where the engineering lead explained the latency issue with the API.”
Sonuç: Sistem, 60 dakikalık bir video dosyası yerine, konuşmacılar o saniyede “latency” sözcüğünü açıkça söylememiş olsa bile ilgili diyagramın ekranda paylaşılıp tartışıldığı 45 saniyelik bölümü getirir.
Yerel çok modlu gömmeye geçiş, sektörler genelinde tamamen yeni iş akışlarının önünü açıyor. Bu modeli en karmaşık kurumsal veri ortamlarından bazılarıyla kapsamlı biçimde kıyasladık.
ColQwen3'ü; nazım planlar, imar haritaları ve karmaşık mimari görünüşlerden oluşan dev arşivleri yöneten şehir danışmanlığı firmalarının karşılaştığı veri zorluklarıyla test ettik.
Zorluk: Geleneksel RAG işlem hatları bu ortamlarda zorlanır. OCR araçları, karmaşık vaziyet planlarını genellikle yalnızca “şema” diye tanımlar; trafik akışı, yeşil alanlar veya yapı çekme mesafeleri gibi kritik ayrıntıları kaçırır.
Performans: Şirket içi kıyaslamalarımız, ColQwen3'ün pahalı OCR/görsel açıklama ön işlemlerine duyulan ihtiyacı etkili biçimde ortadan kaldırdığını gösteriyor. Model, yoğun mimari çizimlerle yapılan testlerde yaya erişim noktaları veya belirgin imar sınırları gibi görsel işaretlere göre belgeleri başarıyla getirdi; yalnızca metin kullanan temel yaklaşımları belirgin biçimde geride bırakırken bilgi alım maliyetlerini önemli ölçüde azaltma potansiyeli gösterdi.
Yatırım bankacıları ve analistler, faaliyet raporlarıyla yatırımcı sunumlarını incelemek için binlerce saat harcıyor.
İş Akışı: Bir analist şunu sorabilir: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Değişim: Model, anahtar sözcük eşleşmelerine güvenmek yerine belirli veri görselleştirmesinin görsel varlığına dayanarak doğru slaydı getirir ve RAG sisteminin soruları yüksek doğrulukla yanıtlamasını sağlar.
Üretim şirketleri, geniş teknik kılavuz ve borulama-enstrümantasyon şeması (P&ID) arşivlerine sahiptir.
İş Akışı: Bir türbini onaran saha mühendisi parçanın fotoğrafını çekebilir veya şunu sorabilir: “Show me the wiring diagram for the hydraulic pump assembly.”
Değişim: ColQwen3, kablo şemasının görsel temsilini belirleyip doğru sayfayı getirerek kesinti süresini saatlerce azaltabilir.
Hukuki belge incelemesi, aranan “iğnenin” çoğu zaman görsel bir işaret olduğu milyonlarca taranmış sayfanın gözden geçirilmesini gerektirir.
İş Akışı: Bir uyumluluk görevlisi “Documents signed by the CFO” veya “Contracts containing the official ‘Confidential’ stamp.” sorgularını arayabilir.
Değişim: Model, yalnızca OCR'ın sıkça kaçırdığı imza veya damgaların görsel varlığına göre taslak ile tamamlanmış belgeyi ayırt eder.
ColQwen3 açık ağırlıklıdır (Apache 2.0) ve şimdi Hugging Face'te kullanılabilir. Modern RAG işlem hatlarına doğrudan eklenebilen bir yükseltme olarak tasarladık ve metin, görsel ve videoyu hemen işlemek için gereken çıkarım kodunu sağladık.
Basit metin aramasının ötesine geçerek görsel varlıklarındaki bilgiden yararlanmak isteyen kurumlar için yeni standart budur.
Sonraki Adım: Model kartını inceleyin ve Hugging Face'teki canlı demoyu deneyin: /-colqwen3-embed-8b ve /-colqwen3-embed-4b