Przez ostatnie dwa lata termin „RAG” (generowanie wspomagane wyszukiwaniem) był niemal wyłącznie kojarzony z tekstem. Standardowa procedura jest prosta: pobrać dokumenty, wyodrębnić tekst, podzielić go na fragmenty i zindeksować.
Świat biznesu nie opiera się jednak na zwykłych plikach tekstowych. Korzysta ze złożonych plików PDF, prezentacji pełnych wykresów, rysunków CAD, zeskanowanych faktur i coraz większych archiwów nagrań wideo.
Branżowy standard — używanie OCR lub wizyjnych modeli LLM do przekształcania obrazu w opis tekstowy przed utworzeniem osadzenia — stanowi ogromne wąskie gardło. Proces ten jest powolny i kosztowny, a przy tym nieuchronnie traci bogaty kontekst przestrzenny i wizualny oryginalnych danych. Jeśli AI opisze złożony materiał wizualny po prostu jako „plan techniczny”, nie będzie można wyszukać na nim konkretnego zaworu ani schematu okablowania.
Dziś udostępniamy rodzinę najnowocześniejszych multimodalnych modeli osadzania, opartych na architekturze ColPali i zaprojektowanych z myślą o rozwiązaniu tego problemu dzięki kompleksowemu wyszukiwaniu wizualnemu.
Zbudowanie naprawdę skutecznego wyszukiwacza multimodalnego nie sprowadza się do wzięcia gotowego modelu wizyjno-językowego (VLM) i zlecenia mu wyszukiwania. Aby rozwiązać problemy, które dotąd ograniczały multimodalny RAG, i stworzyć ColQwen3, wykorzystaliśmy strategie łączenia i trenowania modeli.
Zamiast dostrajać model bazowy od podstaw, opracowaliśmy metodę przenoszenia wiedzy o zadaniach wyszukiwania z istniejącego tekstowego modelu osadzania. Standardowy model VLM potrafi opisywać obrazy, ale niekoniecznie umie klasyfikować je semantycznie względem zapytania.
Aby wypełnić tę lukę, zastosowaliśmy strategie dostrojonych wag scalania. Nasze eksperymenty wykazały, że zdolność wyszukiwania modelu Qwen3-Embedding w tekstowej przestrzeni ukrytej można bezpośrednio przenieść do przestrzeni multimodalnej, uzyskując możliwość wyszukiwania obrazów i wideo nawet bez natychmiastowego trenowania. Wykorzystaliśmy tę skuteczną inicjalizację jako solidny punkt wyjścia, a następnie dostroiliśmy model, aby dodatkowo zoptymalizować jego wydajność i zapewnić odporność. Pozwala to uzyskać lepszą końcową wydajność wyszukiwania niż dostrajanie bazowego modelu Qwen3-VL.
Po przeniesieniu możliwości osadzania skupiliśmy się na dopasowaniu. Przeprowadziliśmy staranne przeszukiwanie hiperparametrów i badania ablacyjne, obejmujące optymalną liczbę epok, rozmiar partii, współczynnik uczenia, rangę LoRA oraz kombinację zbiorów danych, aby zmaksymalizować wydajność wyszukiwania.
Jako zbiory danych do dostrajania wybraliśmy VDR, zbiór treningowy ColPali, visrag_syn, oraz visrag_ind. Podczas dostrajania zastosowaliśmy próbkowanie UniMax. Ponieważ zastosowaliśmy scalanie modeli, a bazowy scalony model odziedziczył już część multimodalnych możliwości wyszukiwania, stwierdziliśmy, że zwiększenie liczby zbiorów danych nieznacznie pogarsza wydajność. Dlatego nie rozszerzyliśmy ich puli.
Oto hiperparametry wybrane do dostrajania:
Ranga LoRA | 32 |
Alfa LoRA | 32 |
Moduły docelowe LoRA | wszystkie warstwy obrazu i tekstu z wyjątkiem osadzania |
Współczynnik uczenia | 5e-5 |
Maks. liczba tokenów wizualnych | 1280 |
Epoki treningowe | 1 |
Globalny rozmiar partii | 512 |
Współczynnik rozgrzewki | 5% |
Modele wykorzystujące osadzenia na poziomie tokenów w stylu „ColBERT” (takie jak ColPali) oferowały dotąd niezwykłą wydajność, ale kosztem zaporowych wymagań pamięci masowej. Indeksowanie każdego tokenu wizualnego tworzyło ogromne wektorowe bazy danych, zbyt kosztowne do zastosowania na skalę korporacyjną.
Strategia optymalizacji: Rozwiązaliśmy problem przechowywania, starannie dobierając rozmiar osadzeń tak, aby zachować maksymalną wydajność bez gwałtownego wzrostu kosztów pamięci masowej. Aby zachować najnowocześniejszą dokładność przy tak niewielkim zapotrzebowaniu na zasoby, wybraliśmy wymiar 320, który zapewnia najlepszą równowagę między wydajnością wyszukiwania a kosztem przechowywania.
Poziom bazowy: Standardowe podejście (np. NVIDIA Nemo-3B) wymaga około 10,3 TB na osadzenia dla miliona obrazów (1802 tokeny × 3072 wymiary).
ColQwen3: Przechowuje ten sam milion obrazów na zaledwie 0,82 TB (maks. 1280 tokenów × 320 wymiarów).
ColQwen3 osiąga najnowocześniejszą dokładność wyszukiwania bez nadmiernego obciążania budżetu na infrastrukturę chmurową.
Zweryfikowaliśmy nasze podejście za pomocą zestawu testów ViDoRe. Wyniki potwierdzają, że ColQwen3 wyznacza nowe standardy w najnowszych testach V3 i V2 — zarówno angielskich, jak i wielojęzycznych — a jednocześnie utrzymuje czołową wydajność w starszych zadaniach V1.
ColQwen3-8B jest liderem wyszukiwania w języku angielskim i w wielu językach.
Angielski nDCG@5
Model | Informatyka | Energetyka | Finanse | HR | Przem. | Farmacja | Fizyka | Śr. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Wielojęzyczny nDCG@5
Model | Informatyka | Energetyka | Finanse | HR | Przem. | Farmacja | Fizyka | Śr. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Stale wysoka wydajność w zadaniach ESG, Economics i DocVQA.
Test porównawczy | Model | Wynik (śr.) | Wyróżniający wynik |
ViDoRe V2 (angielski) | ColQwen3-8B | 0.6772 | 1. miejsce w ESG i BioMed |
ViDoRe V2 (wielojęzyczny) | ColQwen3-8B | 0.6085 | 1. miejsce w Economics |
ViDoRe V1 (angielski) | Nemo ColEmbed 3B | 0.9100 | Nieco wyższa średnia |
ViDoRe V1 (angielski) | ColQwen3-8B | 0.9076 | 1. miejsce w ArxivQA i Syn-Gov |
Aby wykazać, że ColQwen3 dobrze uogólnia wyniki na wyszukiwanie wideo, oceniliśmy modele w teście CareBench dla zadań wyszukiwania wideo na podstawie tekstu (General Retrieval).
W tej ewaluacji zastosowaliśmy bezpośrednie kodowanie surowego wideo: nasze modele kodowały pliki wideo bez dodatkowych adnotacji tekstowych ani metadanych. Pokazuje to zdolność modelu do wyszukiwania wyłącznie na podstawie semantyki wizualnej.
Model | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Jedną z najważniejszych zmian, jakie umożliwia ColQwen3, jest traktowanie wideo tak samo jak dokumentów. W wielu firmach wideo stanowi „ciemne dane”. Nagrania trafiają do archiwum i pozostają całkowicie nieprzeszukiwalne, chyba że człowiek ręcznie oznaczy każdy plik.
ColQwen3 zmienia tę sytuację, umożliwiając wyszukiwanie klatka po klatce w podzielonych klipach.
Firmy codziennie nagrywają tysiące godzin wewnętrznych spotkań wideo, a nagrania te zwykle przepadają w cyfrowej otchłani.
Proces: Automatyczne dzielenie długich nagrań spotkań na krótsze, logiczne klipy i indeksowanie ich za pomocą ColQwen3 pozwala utworzyć przeszukiwalną „pamięć firmową”.
Zapytanie: Kierownik projektu może poprosić: “Show me the clip where the engineering lead explained the latency issue with the API.”
Wynik: Zamiast zwracać 60-minutowy plik wideo system wyszukuje dokładnie ten 45-sekundowy fragment, w którym pokazano na ekranie i omówiono konkretny diagram — nawet jeśli rozmówcy nie wypowiedzieli w tej chwili słowa „opóźnienie”.
Przejście na natywne osadzanie multimodalne otwiera zupełnie nowe procesy robocze w różnych branżach. Szeroko przetestowaliśmy ten model w jednych z najbardziej złożonych firmowych środowisk danych.
Przetestowaliśmy ColQwen3 na problemach z danymi, z którymi mierzą się firmy doradztwa urbanistycznego zarządzające ogromnymi zbiorami planów zagospodarowania, map strefowania i złożonych elewacji architektonicznych.
Wyzwanie: Tradycyjne potoki RAG słabo radzą sobie w takich środowiskach. Narzędzia OCR zwykle opisują złożone plany terenu po prostu jako „schemat”, pomijając kluczowe informacje o przepływie ruchu, terenach zielonych czy odległościach zabudowy od granic działki.
Wydajność: Nasze wewnętrzne testy pokazują, że ColQwen3 skutecznie eliminuje potrzebę kosztownego wstępnego przetwarzania za pomocą OCR lub generowania opisów. W testach na szczegółowych rysunkach architektonicznych model skutecznie wyszukiwał dokumenty na podstawie określonych znaczników wizualnych, takich jak wejścia dla pieszych czy wyraźne granice stref. Znacznie przewyższał rozwiązania bazujące wyłącznie na tekście, a zarazem pozwalał znacząco obniżyć koszty pozyskiwania wiedzy.
Bankierzy inwestycyjni i analitycy poświęcają tysiące godzin na przeglądanie raportów rocznych i prezentacji dla inwestorów.
Proces: Analityk może poprosić: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Zmiana: Zamiast polegać na dopasowaniu słów kluczowych, model wyszukuje dokładny slajd na podstawie wizualnej obecności określonej prezentacji danych, dzięki czemu system RAG może odpowiadać z dużą precyzją.
Firmy produkcyjne dysponują ogromnymi zbiorami instrukcji technicznych oraz schematów rurociągów i oprzyrządowania (P&ID).
Proces: Serwisant naprawiający turbinę może zrobić zdjęcie części lub poprosić: “Show me the wiring diagram for the hydraulic pump assembly.”
Zmiana: ColQwen3 rozpoznaje wizualną reprezentację schematu okablowania i wyszukuje właściwą stronę, potencjalnie skracając przestój o wiele godzin.
Elektroniczne postępowanie dowodowe wymaga przeglądania milionów zeskanowanych stron, na których poszukiwanym elementem często jest znacznik wizualny.
Proces: Specjalista ds. zgodności może wyszukać “Documents signed by the CFO” lub “Contracts containing the official ‘Confidential’ stamp.”
Zmiana: Model odróżnia wersję roboczą od dokumentu ostatecznego na podstawie wizualnej obecności podpisów lub pieczęci, które sam OCR często pomija.
ColQwen3 ma otwarte wagi (Apache 2.0) i jest już dostępny w Hugging Face. Zaprojektowaliśmy go jako bezpośrednie ulepszenie nowoczesnych potoków RAG, zapewniające kod inferencyjny potrzebny do natychmiastowego przetwarzania tekstu, obrazów i wideo.
Dla firm gotowych wyjść poza proste wyszukiwanie tekstowe i uwolnić wiedzę ukrytą w zasobach wizualnych jest to nowy standard.
Następny krok: Zapoznaj się z kartą modelu i wypróbuj demonstrację na żywo w Hugging Face: /-colqwen3-embed-8b i /-colqwen3-embed-4b