Основная навигация

За пределами текста: настоящий сквозной мультимодальный RAG

Модели мультимодальных эмбеддингов помогают командам находить полезную информацию непосредственно в сложных документах, изображениях и видео.

Последние два года термин RAG (генерация с дополненным поиском) почти всегда относился исключительно к тексту. Стандартный подход прост: взять документы, извлечь текст, разбить его на фрагменты и проиндексировать.

Но корпоративный мир не ограничивается обычными текстовыми файлами. В нём используются сложные PDF-файлы, презентации с насыщенными графиками, чертежи CAD, отсканированные счета и всё чаще — огромные видеоархивы.

Принятый в отрасли подход — перед созданием эмбеддинга преобразовывать изображение в текст с помощью OCR или визуальных LLM — становится серьёзным узким местом. Он медленный, дорогой и неизбежно теряет богатый пространственный и визуальный контекст исходных данных. Если ваш ИИ описывает сложное изображение просто как «чертёж», вы больше не сможете найти на нём конкретный клапан или схему проводки.

Сегодня мы выпускаем семейство передовых моделей мультимодальных эмбеддингов на базе архитектуры ColPali. Они решают эту проблему благодаря сквозному визуальному поиску.

Инженерия, стоящая за магией: продвинутые стратегии дообучения

Чтобы создать действительно эффективную мультимодальную поисковую систему, недостаточно взять готовую визуально-языковую модель (VLM) и попросить её выполнить поиск. Для создания ColQwen3 и решения проблем, которые исторически сдерживали развитие мультимодального RAG, мы применили стратегии объединения и обучения моделей.

1. Перенос возможностей эмбеддингов с помощью настроенного взвешенного объединения

Вместо дообучения базовой модели с нуля мы разработали метод переноса знаний о поисковых задачах из существующей модели текстовых эмбеддингов. Обычная VLM умеет описывать изображения, но не обязательно способна ранжировать их по семантическому соответствию запросу.

Чтобы устранить этот разрыв, мы применили стратегии настроенного взвешенного объединения. Эксперименты показали, что поисковые возможности Qwen3-Embedding в скрытом текстовом пространстве можно напрямую перенести в мультимодальное пространство и распространить на поиск изображений и видео даже без дополнительного обучения. Используя эту эффективную инициализацию как надёжную отправную точку, мы затем дообучили модель, чтобы дополнительно оптимизировать показатели и обеспечить устойчивость. Это повышает итоговую эффективность поиска по сравнению с дообучением базовой модели Qwen3-VL.

2. Тщательная настройка гиперпараметров

После переноса возможностей эмбеддингов мы сосредоточились на выравнивании. Чтобы максимально повысить эффективность поиска, мы тщательно подбирали гиперпараметры и проводили абляционные исследования, определяя оптимальное число эпох, размер пакета, скорость обучения, ранг LoRA и состав наборов данных.

Для дообучения мы выбрали наборы данных VDR, обучающий набор ColPali, visrag_syn, и visrag_ind. Для дообучения мы применяли выборку UniMax. Поскольку мы объединили модели и полученная базовая модель уже частично унаследовала возможности мультимодального поиска, увеличение числа наборов данных немного ухудшало результаты. Поэтому мы не стали добавлять новые наборы.

Для дообучения мы выбрали следующие гиперпараметры:

Ранг LoRA

32

Альфа LoRA

32

Целевые модули LoRA

все слои изображений и текста, кроме эмбеддинга

Скорость обучения

5e-5

Максимум визуальных токенов

1280

Эпохи обучения

1

Глобальный размер пакета

512

Доля разогрева

5%

3. Дилемма ColBERT: высокая эффективность или низкая стоимость хранения

Исторически модели с эмбеддингами на уровне токенов в стиле ColBERT, например ColPali, показывали впечатляющие результаты, но требовали непомерных затрат на хранение. Индексирование каждого визуального токена создавало огромные векторные базы данных, слишком дорогие для корпоративного масштаба.

  • Стратегия оптимизации: мы решили проблему хранения, тщательно подобрав размер эмбеддингов, чтобы сохранить максимальную эффективность и не допустить резкого роста затрат. Чтобы сохранить передовую точность при таком компактном размере, мы выбрали размерность 320 как оптимальный баланс эффективности поиска и стоимости хранения.

    • Базовый уровень: стандартному подходу, например NVIDIA Nemo-3B, требуется около 10,3 ТБ для хранения эмбеддингов 1 миллиона изображений (1 802 токена при 3 072 измерениях).

    • ColQwen3: хранит тот же миллион изображений всего в 0,82 ТБ (не более 1 280 токенов при 320 измерениях).

ColQwen3 обеспечивает передовую точность поиска без раздувания бюджета на облачную инфраструктуру.

Результаты оценки

Мы проверили наш подход на наборе тестов ViDoRe. Результаты подтверждают, что ColQwen3 задаёт новые стандарты в новейших тестах V3 и V2 — как англоязычных, так и многоязычных — и сохраняет лучшие показатели в прежних задачах V1.

ViDoRe v3 (новейшая версия)

ColQwen3-8B лидирует в поиске на английском и других языках.

Английский nDCG@5

Модель

Информатика

Энергетика

Финансы

HR

Пром.

Фармацевтика

Физика

Среднее

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

Многоязычный nDCG@5

Модель

Информатика

Энергетика

Финансы

HR

Пром.

Фармацевтика

Физика

Среднее

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Главные результаты ViDoRe v2 и v1

Стабильно высокие показатели в ESG, экономике и DocVQA.

Тест

Модель

Оценка (средняя)

Главное достижение

ViDoRe V2 (английский)

ColQwen3-8B

0.6772

1-е место в ESG и BioMed

ViDoRe V2 (многоязычный)

ColQwen3-8B

0.6085

1-е место в экономике

ViDoRe V1 (английский)

Nemo ColEmbed 3B

0.9100

Немного более высокий средний результат

ViDoRe V1 (английский)

ColQwen3-8B

0.9076

1-е место в ArxivQA и Syn-Gov

Поиск видео: оценка CareBench

Чтобы продемонстрировать способность ColQwen3 эффективно обобщать данные для поиска видео, мы оценили модели на тесте CareBench в задачах поиска видео по тексту (General Retrieval).

Для этой оценки мы применили прямое кодирование видео: наши модели обрабатывали видеофайлы напрямую, без дополнительных текстовых аннотаций и метаданных. Это демонстрирует способность модели выполнять поиск исключительно по визуальной семантике.

Модель

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Доступ к «тёмным данным»: передовой поиск по видео

Одно из важнейших изменений, которые открывает ColQwen3, — возможность работать с видео так же, как с документами. Во многих компаниях видео остаётся «тёмными данными»: оно хранится в архиве, где его невозможно найти, если человек вручную не снабдил тегами каждый файл.

ColQwen3 меняет ситуацию, обеспечивая покадровый поиск по разделённым на фрагменты видео.

Пример использования: корпоративная память

Каждый день компании записывают тысячи часов внутренних видеосовещаний, и обычно эти записи бесследно пропадают.

  • Процесс: автоматически разделяя длинные записи совещаний на короткие логические фрагменты и индексируя их с помощью ColQwen3, вы создаёте доступную для поиска «корпоративную память».

  • Запрос: руководитель проекта может попросить: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • Результат: вместо 60-минутного видеофайла система находит именно тот 45-секундный фрагмент, где на экране показали и обсудили нужную схему, даже если в этот момент участники прямо не произнесли слово «задержка».

Корпоративные сценарии: решение важных задач

Переход к нативным мультимодальным эмбеддингам открывает совершенно новые рабочие процессы в разных отраслях. Мы тщательно протестировали эту модель в одних из самых сложных сред с корпоративными данными.

1. Главный результат тестирования: городское планирование и архитектура

Мы протестировали ColQwen3 на задачах с данными, с которыми сталкиваются компании в сфере городского планирования: огромными архивами генеральных планов, карт зонирования и сложных архитектурных фасадов.

  • Проблема: традиционные конвейеры RAG плохо справляются с такими средами. Средства OCR обычно описывают сложные планы участков просто как «схему», упуская важные детали транспортных потоков, зелёных зон и отступов зданий.

  • Эффективность: наши внутренние тесты показывают, что ColQwen3 позволяет обойтись без дорогостоящей предварительной обработки с помощью OCR и создания описаний. В тестах с насыщенными архитектурными чертежами модель успешно находила документы по конкретным визуальным признакам, например точкам доступа для пешеходов или чётким границам зон. Она значительно превзошла решения, работающие только с текстом, и способна существенно сократить затраты на загрузку знаний.

2. Комплексная финансовая и рыночная аналитика

Инвестиционные банкиры и аналитики тратят тысячи часов на изучение годовых отчётов и презентаций для инвесторов.

  • Процесс: аналитик может попросить: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • Изменение: вместо поиска по ключевым словам модель находит нужный слайд по конкретной визуализации данных, позволяя системе RAG отвечать на вопросы с высокой точностью.

3. Промышленное производство и выездное обслуживание

Производственные компании располагают огромными архивами технических руководств и схем трубопроводов (P&ID).

  • Процесс: ремонтирующий турбину выездной инженер может сфотографировать деталь или попросить: “Show me the wiring diagram for the hydraulic pump assembly.”

  • Изменение: ColQwen3 распознаёт визуальное представление схемы проводки и находит нужную страницу, потенциально сокращая простой на несколько часов.

4. Юридическая работа и нормативное соответствие

При раскрытии юридически значимой информации приходится проверять миллионы отсканированных страниц, где важной деталью часто оказывается визуальная отметка.

  • Процесс: специалист по нормативному соответствию может искать “Documents signed by the CFO” или “Contracts containing the official ‘Confidential’ stamp.”

  • Изменение: модель отличает черновик от окончательного документа по наличию подписей или печатей — визуальных признаков, которые обычные системы OCR часто пропускают.

Начало работы

ColQwen3 имеет открытые веса, распространяется по лицензии Apache 2.0 и уже доступна на Hugging Face. Мы создали её как готовое обновление для современных конвейеров RAG и предоставили код инференса, позволяющий сразу обрабатывать текст, изображения и видео.

Для компаний, готовых выйти за рамки простого текстового поиска и раскрыть знания, скрытые в визуальных материалах, это новый стандарт.

Следующий шаг: изучите карточку модели и попробуйте интерактивную демонстрацию на Hugging Face: /-colqwen3-embed-8b и /-colqwen3-embed-4b

Автор

Xin Huang, Kye Min Tan