Головна навігація

За межами тексту: справді мультимодальний наскрізний RAG

Мультимодальні моделі представлень допомагають командам знаходити корисну інформацію безпосередньо у складних документах, зображеннях і відео.

Протягом останніх двох років RAG — генерацію з доповненням пошуком — майже виключно пов’язували з текстом. Стандартний підхід простий: взяти документи, видобути текст, розділити його на фрагменти та проіндексувати.

Але корпоративний світ не працює з простими текстовими файлами. Він спирається на складні PDF-файли, презентації з насиченими графіками, CAD-креслення, скановані рахунки та дедалі частіше — величезні архіви відеоматеріалів.

Галузевий стандарт, за яким зображення перед створенням представлення перетворюють на текстовий опис за допомогою OCR або візуальних LLM, створює величезне вузьке місце. Це повільно й дорого та неминуче призводить до втрати багатого просторового й візуального контексту вихідних даних. Якщо ШІ описує складне зображення просто як «креслення», ви втрачаєте можливість знайти на ньому конкретний клапан або схему електропроводки.

Сьогодні ми випускаємо сімейство найсучасніших мультимодальних моделей представлень на основі архітектури ColPali. Вони розв’язують цю проблему завдяки наскрізному візуальному пошуку.

Інженерія, що творить дива: передові стратегії донавчання

Щоб створити справді ефективну мультимодальну пошукову систему, недостатньо взяти готову візуально-мовну модель (VLM) і попросити її виконувати пошук. Щоб подолати проблеми, які історично стримували мультимодальний RAG, і створити ColQwen3, ми застосували стратегії об’єднання та навчання моделей.

1. Перенесення можливостей створення представлень за допомогою налаштованого зважування під час об’єднання

Замість донавчання базової моделі з нуля ми розробили метод перенесення знань про пошукові завдання з наявної моделі текстових представлень. Стандартна VLM уміє описувати зображення, але не обов’язково здатна семантично ранжувати їх відповідно до запиту.

Щоб усунути цю прогалину, ми застосували стратегії налаштованого зважування під час об’єднання. Експерименти показали, що пошукові можливості Qwen3-Embedding у прихованому текстовому просторі можна безпосередньо перенести в мультимодальний простір і узагальнити для пошуку зображень та відео навіть без додаткового навчання. Використавши цю ефективну ініціалізацію як надійну відправну точку, ми донавчили модель, щоб додатково оптимізувати продуктивність і забезпечити стійкість. Це покращує кінцеву якість пошуку порівняно з донавчанням базової моделі Qwen3-VL.

2. Ретельне налаштування гіперпараметрів

Після перенесення можливостей створення представлень ми зосередилися на узгодженні. Щоб максимізувати якість пошуку, ми провели ретельний пошук гіперпараметрів та абляційні дослідження, зокрема визначили оптимальну кількість епох, розмір пакета, швидкість навчання, ранг LoRA й поєднання наборів даних.

Для донавчання ми вибрали набори даних VDR, навчальний набір ColPali, visrag_syn, і visrag_ind. Для донавчання ми використовували вибірку UniMax. Оскільки ми об’єднали моделі, а отримана базова модель уже частково успадкувала мультимодальні пошукові можливості, ми з’ясували, що додавання більшої кількості наборів даних дещо погіршує продуктивність. Тому ми не стали розширювати їхню кількість.

Ось гіперпараметри, які ми вибрали для донавчання:

Ранг LoRA

32

Альфа LoRA

32

Цільові модулі LoRA

усі шари зображень і тексту, крім шару представлень

Швидкість навчання

5e-5

Максимум візуальних токенів

1280

Епохи навчання

1

Глобальний розмір пакета

512

Частка розігріву

5%

3. Дилема ColBERT: висока продуктивність чи вартість зберігання

Історично моделі з представленнями на рівні токенів у стилі ColBERT, як-от ColPali, забезпечували неймовірну продуктивність, але потребували неприйнятно великих витрат на зберігання. Індексування кожного візуального токена створювало величезні векторні бази даних, надто дорогі для корпоративного масштабу.

  • Стратегія оптимізації: ми розв’язали проблему зберігання, ретельно збалансувавши розмір представлень, щоб зберегти максимальну продуктивність і не допустити стрімкого зростання витрат. Щоб зберегти найсучаснішу точність за такого ефективного обсягу, ми вибрали розмірність 320 як оптимальний баланс між якістю пошуку та вартістю зберігання.

    • Базовий рівень: стандартний підхід, як-от NVIDIA Nemo-3B, потребує приблизно 10,3 ТБ для зберігання представлень 1 мільйона зображень (1 802 токени з 3 072 вимірами).

    • ColQwen3: зберігає той самий мільйон зображень лише в 0,82 ТБ (максимум 1 280 токенів із 320 вимірами).

ColQwen3 забезпечує найсучаснішу точність пошуку без надмірного збільшення бюджету на хмарну інфраструктуру.

Результати оцінювання

Ми перевірили наш підхід за допомогою набору тестів ViDoRe. Результати підтверджують, що ColQwen3 задає нові стандарти в найновіших тестах V3 і V2 — англомовних та багатомовних — і водночас зберігає найвищу продуктивність у попередніх завданнях V1.

ViDoRe v3 (найновіша версія)

ColQwen3-8B лідирує в англомовному та багатомовному пошуку.

Англійська, nDCG@5

Модель

Інформатика

Енергетика

Фінанси

HR

Пром.

Фармацевтика

Фізика

Сер.

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Багатомовний тест, nDCG@5

Модель

Інформатика

Енергетика

Фінанси

HR

Пром.

Фармацевтика

Фізика

Сер.

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Ключові результати ViDoRe v2 і v1

Стабільно висока продуктивність у ESG, економіці та DocVQA.

Тест

Модель

Оцінка (сер.)

Визначне досягнення

ViDoRe V2 (англійська)

ColQwen3-8B

0.6772

№ 1 в ESG і BioMed

ViDoRe V2 (багатомовний)

ColQwen3-8B

0.6085

№ 1 в економіці

ViDoRe V1 (англійська)

Nemo ColEmbed 3B

0.9100

Трохи вищий середній показник

ViDoRe V1 (англійська)

ColQwen3-8B

0.9076

№ 1 в ArxivQA і Syn-Gov

Пошук відео: оцінювання CareBench

Щоб продемонструвати здатність ColQwen3 ефективно узагальнювати підхід для пошуку відео, ми оцінили моделі за тестом CareBench у завданнях пошуку відео за текстовим запитом (General Retrieval).

Для цього оцінювання ми застосували безпосереднє кодування відео: наші моделі кодували відеофайли напряму, без додаткових текстових анотацій чи метаданих. Це демонструє здатність моделі здійснювати пошук виключно на основі візуальної семантики.

Модель

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Розкриття потенціалу «темних даних»: нові обрії відео

Одна з найглибших змін, яку забезпечує ColQwen3, — здатність працювати з відео так само, як із документами. У багатьох компаніях відео — це «темні дані». Вони зберігаються в холодних сховищах і залишаються недоступними для пошуку, якщо людина вручну не позначила кожен файл.

ColQwen3 змінює це, забезпечуючи покадровий пошук у сегментованих кліпах.

Приклад застосування: корпоративний банк пам’яті

Щодня компанії записують тисячі годин внутрішніх відеозустрічей, але зазвичай ці записи губляться безвісти.

  • Робочий процес: автоматично розділяючи довгі записи зустрічей на коротші логічні кліпи та індексуючи їх за допомогою ColQwen3, ви створюєте доступну для пошуку «корпоративну пам’ять».

  • Запит: керівник проєкту може попросити: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Результат: замість 60-хвилинного відеофайлу система знаходить саме той 45-секундний фрагмент, де на екрані показували й обговорювали відповідну діаграму, навіть якщо в цю мить учасники прямо не вимовляли слово «затримка».

Корпоративні сценарії застосування: розв’язання важливих завдань

Перехід до нативних мультимодальних представлень відкриває цілком нові робочі процеси в різних галузях. Ми ретельно протестували цю модель у деяких із найскладніших корпоративних середовищ даних.

1. Результати тестування: міський консалтинг та архітектура

Ми випробували ColQwen3 на завданнях із даними, з якими стикаються міські консалтингові компанії, що керують величезними бібліотеками генеральних планів, карт зонування та складних архітектурних фасадів.

  • Проблема: у таких середовищах традиційні конвеєри RAG працюють недостатньо ефективно. Інструменти OCR зазвичай описують складні плани ділянок просто як «схему», не помічаючи важливих деталей про транспортні потоки, зелені зони чи відступи будівель.

  • Продуктивність: наші внутрішні тести показують, що ColQwen3 дає змогу ефективно обійтися без дорогої попередньої обробки за допомогою OCR і створення підписів. У тестах зі складними архітектурними кресленнями модель успішно знаходила документи за конкретними візуальними ознаками, як-от точки доступу для пішоходів або чіткі межі зонування. Вона значно перевершила базові рішення, що працюють лише з текстом, і водночас продемонструвала потенціал суттєвого скорочення витрат на завантаження знань.

2. Комплексна фінансова й ринкова аналітика

Інвестиційні банкіри й аналітики витрачають тисячі годин на перегляд річних звітів і презентацій для інвесторів.

  • Робочий процес: аналітик може попросити: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Зміна: замість пошуку за ключовими словами модель знаходить потрібний слайд за візуальною наявністю конкретної діаграми, завдяки чому система RAG може відповідати на запитання з високою точністю.

3. Промислове виробництво й виїзне обслуговування

Виробничі компанії мають величезні бібліотеки технічних посібників і схем трубопроводів та КВП (P&ID).

  • Робочий процес: виїзний інженер, який ремонтує турбіну, може сфотографувати деталь або попросити: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Зміна: ColQwen3 розпізнає візуальне зображення схеми електропроводки й знаходить потрібну сторінку, потенційно скорочуючи час простою на кілька годин.

4. Юридична сфера та дотримання вимог

Пошук доказів у юридичних справах передбачає перегляд мільйонів сканованих сторінок, де шуканою «голкою» часто є візуальна позначка.

  • Робочий процес: фахівець із дотримання вимог може шукати “Documents signed by the CFO” або “Contracts containing the official ‘Confidential’ stamp.”

  • Зміна: модель відрізняє чернетку від остаточного документа за візуальною наявністю підписів або печаток — деталей, які звичайне OCR часто не помічає.

Початок роботи

ColQwen3 має відкриті ваги (Apache 2.0) і вже доступна на Hugging Face. Ми створили її як готове оновлення для сучасних конвеєрів RAG і надали код для інференсу, що дає змогу відразу обробляти текст, зображення та відео.

Для компаній, готових вийти за межі простого текстового пошуку й розкрити потенціал знань у своїх візуальних ресурсах, це новий стандарт.

Наступний крок: ознайомтеся з карткою моделі та спробуйте інтерактивну демонстрацію на Hugging Face: /-colqwen3-embed-8b і /-colqwen3-embed-4b

Автор

Xin Huang, Kye Min Tan