През последните две години „RAG“ (генериране с разширено извличане) беше почти изцяло синоним на текст. Стандартният подход е прост: вземате документи, извличате текста, разделяте го на фрагменти и го индексирате.
Но корпоративният свят не работи с обикновени текстови файлове. Той разчита на сложни PDF файлове, презентации с плътни диаграми, CAD чертежи, сканирани фактури и все по-често — на огромни архиви от видеоматериали.
Утвърденият в отрасъла подход — изображенията да се преобразуват в текст чрез OCR или визуални LLM модели, преди да бъдат вградени — създава огромно тясно място. Той е бавен и скъп и неизбежно губи богатия пространствен и визуален контекст на първоначалните данни. Ако вашият ИИ опише сложен визуален материал просто като „чертеж“, вече не можете да търсите конкретния вентил или електрическата схема в него.
Днес пускаме семейство от авангардни мултимодални модели за вграждане, надграждащи архитектурата ColPali. Те решават този проблем чрез цялостно визуално извличане.
Създаването на наистина ефективна мултимодална система за извличане не е толкова просто, колкото да вземете готов визуално-езиков модел (VLM) и да го накарате да търси. За да преодолеем пречките, които досега възпираха мултимодалния RAG, и да създадем ColQwen3, използвахме стратегии за сливане и обучение на модели.
Вместо да настройваме фино базов модел от нулата, разработихме метод за прехвърляне на знанията за задачи по извличане от съществуващ текстов модел за вграждане. Стандартният VLM знае как да описва изображения, но не непременно и как да ги подрежда семантично спрямо заявка.
За да преодолеем тази разлика, използвахме стратегии с настроени тегла при сливане. В експериментите си установихме, че способността на Qwen3-Embedding за извличане в латентното текстово пространство може да се прехвърли директно в мултимодалното пространство и да се обобщи за извличане на изображения и видео дори без непосредствено обучение. Използвахме тази ефективна инициализация като стабилна отправна точка, след което настроихме фино модела, за да подобрим допълнително производителността и устойчивостта му. Това подобрява крайната производителност при извличане спрямо фината настройка на базовия модел Qwen3-VL.
След прехвърлянето на способностите за вграждане се съсредоточихме върху подравняването. Проведохме внимателно търсене на хиперпараметри и аблационни изследвания, включително за оптималния брой епохи, размера на партидата, скоростта на обучение, ранга на LoRA и комбинацията от набори от данни, за да увеличим максимално производителността при извличане.
За фина настройка избрахме наборите от данни VDR, набора за обучение ColPali, visrag_syn, и visrag_ind. За фината настройка използвахме извадки по метода UniMax. Тъй като приложихме сливане на модели и базовият слят модел вече наследява частични мултимодални способности за извличане, установихме, че добавянето на още набори от данни всъщност леко влошава производителността. Затова не увеличихме броя им.
Ето избраните от нас хиперпараметри за фината настройка:
Ранг на LoRA | 32 |
Алфа на LoRA | 32 |
Целеви модули на LoRA | всички слоеве за изображения и текст без слоя за вграждане |
Скорост на обучение | 5e-5 |
Максимален брой визуални токени | 1280 |
Епохи на обучение | 1 |
Глобален размер на партидата | 512 |
Дял за загряване | 5% |
В исторически план моделите с вграждания на ниво токен в стил „ColBERT“ (като ColPali) предлагаха невероятна производителност, но при непосилни разходи за съхранение. Индексирането на всеки визуален токен създаваше огромни векторни бази данни, които бяха твърде скъпи за корпоративен мащаб.
Стратегията за оптимизация: Решихме проблема със съхранението, като внимателно балансирахме размера на вгражданията, за да запазим максимална производителност, без разходите да нарастват неконтролируемо. За да запазим авангардна точност в тези ефективни граници, внимателно избрахме размерност 320 като най-добър баланс между производителност при извличане и разходи за съхранение.
Базово решение: Стандартен подход като NVIDIA Nemo-3B изисква приблизително 10.3 TB за съхраняване на вгражданията за 1 милион изображения (1 802 токена при 3 072 измерения).
ColQwen3: Съхранява същия 1 милион изображения само в 0.82 TB (макс. 1 280 токена при 320 измерения).
ColQwen3 постига авангардна точност при извличане, без да раздува бюджета за облачна инфраструктура.
Валидирахме подхода си с набора от тестове ViDoRe. Резултатите потвърждават, че ColQwen3 задава нови стандарти в най-новите тестове V3 и V2 — както на английски, така и на множество езици — и същевременно запазва водеща производителност при по-старите задачи V1.
ColQwen3-8B е водещ при извличането на английски и на множество езици.
nDCG@5 на английски
Модел | Комп. науки | Енергетика | Финанси | ЧР | Пром. | Фармация | Физика | Средно |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Многоезичен nDCG@5
Модел | Комп. науки | Енергетика | Финанси | ЧР | Пром. | Фармация | Физика | Средно |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Устойчиво висока производителност при ESG, Economics и DocVQA.
Тест | Модел | Резултат (средно) | Значимо постижение |
ViDoRe V2 (английски) | ColQwen3-8B | 0.6772 | №1 при ESG & BioMed |
ViDoRe V2 (многоезичен) | ColQwen3-8B | 0.6085 | №1 при Economics |
ViDoRe V1 (английски) | Nemo ColEmbed 3B | 0.9100 | Малко по-висок среден резултат |
ViDoRe V1 (английски) | ColQwen3-8B | 0.9076 | №1 при ArxivQA & Syn-Gov |
За да покажем, че ColQwen3 се обобщава успешно и за извличане на видео, оценихме моделите с теста CareBench при задачи за намиране на видео по текст (General Retrieval).
За оценяването използвахме директно кодиране на необработено видео: моделите ни кодираха видеофайловете без допълнителни текстови анотации или входни метаданни. Това подчертава способността на модела да извлича съдържание единствено въз основа на визуалната семантика.
Модел | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Една от най-съществените промени, които ColQwen3 прави възможни, е способността му да обработва видеото като документ. В много предприятия видеото е „тъмни данни“. То стои в архивно хранилище и е напълно неоткриваемо, освен ако човек не е добавил ръчно етикети към всеки файл.
ColQwen3 променя това, като позволява извличане кадър по кадър от сегментирани клипове.
Всеки ден предприятията записват хиляди часове вътрешни видеосрещи и обикновено тези записи потъват в забвение.
Работният процес: Чрез автоматично разделяне на дългите записи от срещи на по-кратки логически клипове и индексирането им с ColQwen3 създавате достъпна за търсене „корпоративна памет“.
Заявката: Ръководител на проект може да попита: “Show me the clip where the engineering lead explained the latency issue with the API.”
Резултатът: Вместо 60-минутен видеофайл системата извлича точния 45-секунден откъс, в който конкретната диаграма е показана и обсъдена на екрана — дори ако говорещите не са произнесли изрично думата „latency“ точно в този момент.
Преходът към вградени мултимодални представяния открива изцяло нови работни процеси в различни отрасли. Подложихме този модел на подробни сравнителни тестове в някои от най-сложните среди с корпоративни данни.
Тествахме ColQwen3 с предизвикателствата пред консултантските фирми в градското планиране, които управляват огромни библиотеки от общи планове, карти за зониране и сложни архитектурни фасади.
Предизвикателството: В такива среди традиционните RAG конвейери срещат затруднения. Инструментите за OCR обикновено описват сложните планове на обекти просто като „схема“ и пропускат важни подробности за трафика, зелените площи или отстоянията на сградите.
Производителността: Вътрешните ни тестове показват, че ColQwen3 ефективно премахва нуждата от скъпа предварителна обработка чрез OCR и генериране на описания. При тестове с детайлни архитектурни чертежи моделът успешно извлече документи по конкретни визуални маркери, например точки за пешеходен достъп или ясно обособени граници на зони. Така той значително надмина базовите решения само с текст и обещава драстично намаляване на разходите за въвеждане на знания.
Инвестиционните банкери и анализаторите прекарват хиляди часове в преглеждане на годишни отчети и презентации за инвеститори.
Работният процес: Анализатор може да попита: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Промяната: Вместо да разчита на съвпадения по ключови думи, моделът извлича точния слайд въз основа на визуалното наличие на конкретната визуализация на данни, което позволява на RAG системата да отговаря с висока точност.
Производствените предприятия разполагат с огромни библиотеки от технически ръководства и тръбопроводни и инструментални схеми (P&ID).
Работният процес: Сервизен инженер, който ремонтира турбина, може да снима част или да попита: “Show me the wiring diagram for the hydraulic pump assembly.”
Промяната: ColQwen3 разпознава визуалното представяне на електрическата схема и извлича правилната страница, което потенциално съкращава престоя с часове.
Правният преглед включва анализ на милиони сканирани страници, в които „иглата в купата сено“ често е визуален маркер.
Работният процес: Служител по съответствието може да търси “Documents signed by the CFO” или “Contracts containing the official ‘Confidential’ stamp.”
Промяната: Моделът различава чернова от окончателен документ по визуалното наличие на подписи или печати — нещо, което чистият OCR често пропуска.
ColQwen3 е с отворени тегла (Apache 2.0) и вече е достъпен в Hugging Face. Проектирахме го като директна надстройка за съвременни RAG конвейери, с необходимия код за инференция за незабавна обработка на текст, изображения и видео.
За предприятията, готови да надхвърлят обикновеното текстово търсене и да отключат знанията във визуалните си активи, това е новият стандарт.
Следваща стъпка: Разгледайте картата на модела и изпробвайте демонстрацията на живо в Hugging Face: /-colqwen3-embed-8b и /-colqwen3-embed-4b