Последние два года термин RAG (генерация с дополненным поиском) почти всегда относился исключительно к тексту. Стандартный подход прост: взять документы, извлечь текст, разбить его на фрагменты и проиндексировать.
Но корпоративный мир не ограничивается обычными текстовыми файлами. В нём используются сложные PDF-файлы, презентации с насыщенными графиками, чертежи CAD, отсканированные счета и всё чаще — огромные видеоархивы.
Принятый в отрасли подход — перед созданием эмбеддинга преобразовывать изображение в текст с помощью OCR или визуальных LLM — становится серьёзным узким местом. Он медленный, дорогой и неизбежно теряет богатый пространственный и визуальный контекст исходных данных. Если ваш ИИ описывает сложное изображение просто как «чертёж», вы больше не сможете найти на нём конкретный клапан или схему проводки.
Сегодня мы выпускаем семейство передовых моделей мультимодальных эмбеддингов на базе архитектуры ColPali. Они решают эту проблему благодаря сквозному визуальному поиску.
Чтобы создать действительно эффективную мультимодальную поисковую систему, недостаточно взять готовую визуально-языковую модель (VLM) и попросить её выполнить поиск. Для создания ColQwen3 и решения проблем, которые исторически сдерживали развитие мультимодального RAG, мы применили стратегии объединения и обучения моделей.
Вместо дообучения базовой модели с нуля мы разработали метод переноса знаний о поисковых задачах из существующей модели текстовых эмбеддингов. Обычная VLM умеет описывать изображения, но не обязательно способна ранжировать их по семантическому соответствию запросу.
Чтобы устранить этот разрыв, мы применили стратегии настроенного взвешенного объединения. Эксперименты показали, что поисковые возможности Qwen3-Embedding в скрытом текстовом пространстве можно напрямую перенести в мультимодальное пространство и распространить на поиск изображений и видео даже без дополнительного обучения. Используя эту эффективную инициализацию как надёжную отправную точку, мы затем дообучили модель, чтобы дополнительно оптимизировать показатели и обеспечить устойчивость. Это повышает итоговую эффективность поиска по сравнению с дообучением базовой модели Qwen3-VL.
После переноса возможностей эмбеддингов мы сосредоточились на выравнивании. Чтобы максимально повысить эффективность поиска, мы тщательно подбирали гиперпараметры и проводили абляционные исследования, определяя оптимальное число эпох, размер пакета, скорость обучения, ранг LoRA и состав наборов данных.
Для дообучения мы выбрали наборы данных VDR, обучающий набор ColPali, visrag_syn, и visrag_ind. Для дообучения мы применяли выборку UniMax. Поскольку мы объединили модели и полученная базовая модель уже частично унаследовала возможности мультимодального поиска, увеличение числа наборов данных немного ухудшало результаты. Поэтому мы не стали добавлять новые наборы.
Для дообучения мы выбрали следующие гиперпараметры:
Ранг LoRA | 32 |
Альфа LoRA | 32 |
Целевые модули LoRA | все слои изображений и текста, кроме эмбеддинга |
Скорость обучения | 5e-5 |
Максимум визуальных токенов | 1280 |
Эпохи обучения | 1 |
Глобальный размер пакета | 512 |
Доля разогрева | 5% |
Исторически модели с эмбеддингами на уровне токенов в стиле ColBERT, например ColPali, показывали впечатляющие результаты, но требовали непомерных затрат на хранение. Индексирование каждого визуального токена создавало огромные векторные базы данных, слишком дорогие для корпоративного масштаба.
Стратегия оптимизации: мы решили проблему хранения, тщательно подобрав размер эмбеддингов, чтобы сохранить максимальную эффективность и не допустить резкого роста затрат. Чтобы сохранить передовую точность при таком компактном размере, мы выбрали размерность 320 как оптимальный баланс эффективности поиска и стоимости хранения.
Базовый уровень: стандартному подходу, например NVIDIA Nemo-3B, требуется около 10,3 ТБ для хранения эмбеддингов 1 миллиона изображений (1 802 токена при 3 072 измерениях).
ColQwen3: хранит тот же миллион изображений всего в 0,82 ТБ (не более 1 280 токенов при 320 измерениях).
ColQwen3 обеспечивает передовую точность поиска без раздувания бюджета на облачную инфраструктуру.
Мы проверили наш подход на наборе тестов ViDoRe. Результаты подтверждают, что ColQwen3 задаёт новые стандарты в новейших тестах V3 и V2 — как англоязычных, так и многоязычных — и сохраняет лучшие показатели в прежних задачах V1.
ColQwen3-8B лидирует в поиске на английском и других языках.
Английский nDCG@5
Модель | Информатика | Энергетика | Финансы | HR | Пром. | Фармацевтика | Физика | Среднее |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Многоязычный nDCG@5
Модель | Информатика | Энергетика | Финансы | HR | Пром. | Фармацевтика | Физика | Среднее |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Стабильно высокие показатели в ESG, экономике и DocVQA.
Тест | Модель | Оценка (средняя) | Главное достижение |
ViDoRe V2 (английский) | ColQwen3-8B | 0.6772 | 1-е место в ESG и BioMed |
ViDoRe V2 (многоязычный) | ColQwen3-8B | 0.6085 | 1-е место в экономике |
ViDoRe V1 (английский) | Nemo ColEmbed 3B | 0.9100 | Немного более высокий средний результат |
ViDoRe V1 (английский) | ColQwen3-8B | 0.9076 | 1-е место в ArxivQA и Syn-Gov |
Чтобы продемонстрировать способность ColQwen3 эффективно обобщать данные для поиска видео, мы оценили модели на тесте CareBench в задачах поиска видео по тексту (General Retrieval).
Для этой оценки мы применили прямое кодирование видео: наши модели обрабатывали видеофайлы напрямую, без дополнительных текстовых аннотаций и метаданных. Это демонстрирует способность модели выполнять поиск исключительно по визуальной семантике.
Модель | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Одно из важнейших изменений, которые открывает ColQwen3, — возможность работать с видео так же, как с документами. Во многих компаниях видео остаётся «тёмными данными»: оно хранится в архиве, где его невозможно найти, если человек вручную не снабдил тегами каждый файл.
ColQwen3 меняет ситуацию, обеспечивая покадровый поиск по разделённым на фрагменты видео.
Каждый день компании записывают тысячи часов внутренних видеосовещаний, и обычно эти записи бесследно пропадают.
Процесс: автоматически разделяя длинные записи совещаний на короткие логические фрагменты и индексируя их с помощью ColQwen3, вы создаёте доступную для поиска «корпоративную память».
Запрос: руководитель проекта может попросить: “Show me the clip where the engineering lead explained the latency issue with the API.”
Результат: вместо 60-минутного видеофайла система находит именно тот 45-секундный фрагмент, где на экране показали и обсудили нужную схему, даже если в этот момент участники прямо не произнесли слово «задержка».
Переход к нативным мультимодальным эмбеддингам открывает совершенно новые рабочие процессы в разных отраслях. Мы тщательно протестировали эту модель в одних из самых сложных сред с корпоративными данными.
Мы протестировали ColQwen3 на задачах с данными, с которыми сталкиваются компании в сфере городского планирования: огромными архивами генеральных планов, карт зонирования и сложных архитектурных фасадов.
Проблема: традиционные конвейеры RAG плохо справляются с такими средами. Средства OCR обычно описывают сложные планы участков просто как «схему», упуская важные детали транспортных потоков, зелёных зон и отступов зданий.
Эффективность: наши внутренние тесты показывают, что ColQwen3 позволяет обойтись без дорогостоящей предварительной обработки с помощью OCR и создания описаний. В тестах с насыщенными архитектурными чертежами модель успешно находила документы по конкретным визуальным признакам, например точкам доступа для пешеходов или чётким границам зон. Она значительно превзошла решения, работающие только с текстом, и способна существенно сократить затраты на загрузку знаний.
Инвестиционные банкиры и аналитики тратят тысячи часов на изучение годовых отчётов и презентаций для инвесторов.
Процесс: аналитик может попросить: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Изменение: вместо поиска по ключевым словам модель находит нужный слайд по конкретной визуализации данных, позволяя системе RAG отвечать на вопросы с высокой точностью.
Производственные компании располагают огромными архивами технических руководств и схем трубопроводов (P&ID).
Процесс: ремонтирующий турбину выездной инженер может сфотографировать деталь или попросить: “Show me the wiring diagram for the hydraulic pump assembly.”
Изменение: ColQwen3 распознаёт визуальное представление схемы проводки и находит нужную страницу, потенциально сокращая простой на несколько часов.
При раскрытии юридически значимой информации приходится проверять миллионы отсканированных страниц, где важной деталью часто оказывается визуальная отметка.
Процесс: специалист по нормативному соответствию может искать “Documents signed by the CFO” или “Contracts containing the official ‘Confidential’ stamp.”
Изменение: модель отличает черновик от окончательного документа по наличию подписей или печатей — визуальных признаков, которые обычные системы OCR часто пропускают.
ColQwen3 имеет открытые веса, распространяется по лицензии Apache 2.0 и уже доступна на Hugging Face. Мы создали её как готовое обновление для современных конвейеров RAG и предоставили код инференса, позволяющий сразу обрабатывать текст, изображения и видео.
Для компаний, готовых выйти за рамки простого текстового поиска и раскрыть знания, скрытые в визуальных материалах, это новый стандарт.
Следующий шаг: изучите карточку модели и попробуйте интерактивную демонстрацию на Hugging Face: /-colqwen3-embed-8b и /-colqwen3-embed-4b