Navegación principal

Más allá del texto: liberar el verdadero RAG multimodal integral

Los modelos de embeddings multimodales ayudan a los equipos a recuperar información útil directamente de documentos complejos, imágenes y vídeos.

Durante los dos últimos años, «RAG» (generación aumentada por recuperación) ha sido casi exclusivamente sinónimo de texto. El procedimiento habitual es sencillo: tomar documentos, extraer el texto, dividirlo en fragmentos e indexarlo.

Pero el mundo empresarial no funciona con archivos de texto sin formato. Funciona con PDF complejos, presentaciones repletas de gráficos, planos CAD, facturas escaneadas y, cada vez más, enormes archivos de grabaciones de vídeo.

El estándar del sector para procesar estos contenidos —usar OCR o LLM de visión para «describir» una imagen mediante texto antes de generar su embedding— supone un enorme cuello de botella. Es lento, caro e inevitablemente pierde el valioso contexto espacial y visual de los datos originales. Si tu IA describe un contenido visual complejo simplemente como «un plano», pierdes la posibilidad de buscar en él una válvula o un esquema de cableado concreto.

Hoy presentamos una familia de modelos de embeddings multimodales de última generación, basados en la arquitectura ColPali y diseñados para resolver este problema mediante la recuperación visual integral.

La ingeniería que hace posible la magia: estrategias avanzadas de ajuste fino

Crear un recuperador multimodal realmente eficaz no es tan sencillo como tomar un modelo de visión y lenguaje (VLM) listo para usar y pedirle que busque. Para resolver los problemas que históricamente han frenado el RAG multimodal y crear ColQwen3, empleamos estrategias de fusión y entrenamiento de modelos.

1. Transferir la capacidad de embedding mediante una ponderación de fusión ajustada

En vez de ajustar un modelo base desde cero, diseñamos un método para transferir el conocimiento sobre tareas de recuperación desde un modelo de embeddings textuales existente. Un VLM estándar sabe describir imágenes, pero no necesariamente ordenarlas semánticamente según su relevancia para una consulta.

Para salvar esta brecha, empleamos estrategias de ponderación de fusión ajustada. En nuestros experimentos, descubrimos que la capacidad de recuperación de Qwen3-Embedding en el espacio latente textual podía transferirse directamente al espacio multimodal y generalizarse a la recuperación de imágenes y vídeo incluso sin un entrenamiento inmediato. Partiendo de esta eficaz inicialización, ajustamos después el modelo para optimizar aún más el rendimiento y garantizar su robustez. Esto mejora el rendimiento final de recuperación frente al ajuste fino a partir del modelo base Qwen3-VL.

2. Ajuste minucioso de hiperparámetros

Una vez transferidas las capacidades de embedding, nos centramos en la alineación. Realizamos búsquedas minuciosas de hiperparámetros y estudios de ablación que incluyeron el número óptimo de épocas, el tamaño del lote, la tasa de aprendizaje, el rango de LoRA y la combinación de conjuntos de datos para maximizar el rendimiento de recuperación.

Como conjuntos de datos para el ajuste fino, elegimos VDR, el conjunto de entrenamiento ColPali, visrag_syn, y visrag_ind. Para el ajuste fino, utilizamos el muestreo UniMax. Como aplicamos una fusión de modelos y el modelo base fusionado ya hereda parte de la capacidad de recuperación multimodal, observamos que aumentar el número de conjuntos de datos reducía ligeramente el rendimiento, por lo que decidimos no ampliarlo.

Estos son los hiperparámetros que seleccionamos para el ajuste fino:

Rango de LoRA

32

Alfa de LoRA

32

Módulos objetivo de LoRA

todas las capas de imagen y texto, salvo la de embedding

Tasa de aprendizaje

5e-5

Máximo de tokens visuales

1280

Épocas de entrenamiento

1

Tamaño global del lote

512

Proporción de calentamiento

5 %

3. El dilema de «ColBERT»: alto rendimiento frente a coste de almacenamiento

Tradicionalmente, los modelos que usaban embeddings por token «al estilo ColBERT» —como ColPali— ofrecían un rendimiento extraordinario, pero con un coste de almacenamiento prohibitivo. Indexar cada token visual generaba enormes bases de datos vectoriales, demasiado costosas para operar a escala empresarial.

  • La estrategia de optimización: abordamos el problema del almacenamiento equilibrando cuidadosamente el tamaño de nuestros embeddings para conservar el máximo rendimiento sin disparar los costes de almacenamiento. Para mantener una precisión de última generación con este tamaño eficiente, seleccionamos cuidadosamente una dimensión de 320, que ofrece el mejor equilibrio entre rendimiento de recuperación y coste de almacenamiento.

    • Referencia: un enfoque estándar —como NVIDIA Nemo-3B— necesita aproximadamente 10,3 TB para almacenar los embeddings de 1 millón de imágenes (1 802 tokens a 3 072 dimensiones).

    • ColQwen3: almacena ese mismo millón de imágenes en tan solo 0,82 TB (máximo de 1 280 tokens a 320 dimensiones).

ColQwen3 logra una precisión de recuperación de última generación sin disparar el presupuesto de infraestructura en la nube.

Resultados de la evaluación

Validamos nuestro enfoque con el conjunto de pruebas ViDoRe. Los resultados confirman que ColQwen3 establece nuevos estándares en las pruebas V3 y V2 más recientes —tanto en inglés como multilingües—, a la vez que mantiene un rendimiento de primer nivel en las tareas V1 anteriores.

ViDoRe v3 (más reciente)

ColQwen3-8B lidera la recuperación en inglés y multilingüe.

nDCG@5 en inglés

Modelo

Informática

Energía

Finanzas

RR. HH.

Ind.

Farmacia

Física

Media

-colqwen3-8b

0,7443

0,6491

0,6823

0,6421

0,5766

0,6665

0,4747

0,6113

-colqwen3-4b

0,7419

0,6023

0,6753

0,6037

0,5787

0,6612

0,4640

0,5934

nemo-colembed-3b

0,7514

0,5838

0,6712

0,6256

0,5447

0,6524

0,4128

0,5769

jina-embeddings-v4

0,7175

0,5842

0,6417

0,6206

0,5443

0,6303

0,4191

0,5680

nDCG@5 multilingüe

Modelo

Informática

Energía

Finanzas

RR. HH.

Ind.

Farmacia

Física

Media

-colqwen3-8b

0,7194

0,6619

0,6172

0,6097

0,5164

0,6403

0,4706

0,5866

-colqwen3-4b

0,7213

0,6374

0,6019

0,5637

0,5131

0,6351

0,4636

0,5708

nemo-colembed-3b

0,7216

0,5901

0,5646

0,5504

0,4335

0,6170

0,4192

0,5383

Resultados destacados de ViDoRe v2 y v1

Rendimiento elevado y constante en ESG, economía y DocVQA.

Prueba

Modelo

Puntuación (media)

Logro destacado

ViDoRe V2 (inglés)

ColQwen3-8B

0,6772

N.º 1 en ESG y BioMed

ViDoRe V2 (multilingüe)

ColQwen3-8B

0,6085

N.º 1 en economía

ViDoRe V1 (inglés)

Nemo ColEmbed 3B

0,9100

Media ligeramente superior

ViDoRe V1 (inglés)

ColQwen3-8B

0,9076

N.º 1 en ArxivQA y Syn-Gov

Recuperación de vídeo: evaluación CareBench

Para demostrar la gran capacidad de ColQwen3 para generalizar a la recuperación de vídeo, evaluamos los modelos con la prueba CareBench en tareas de texto a vídeo (recuperación general).

Para esta evaluación, empleamos un enfoque de codificación de vídeo sin procesar: nuestros modelos codificaron directamente los archivos de vídeo sin anotaciones textuales ni metadatos adicionales. Esto pone de relieve la capacidad del modelo para realizar recuperaciones basándose únicamente en la semántica visual.

Modelo

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0,8670

0,9590

0,9850

-colqwen3-4b

0,8620

0,9570

0,9800

Care7B

0,7700

0,9560

0,9870

Liberar los «datos oscuros»: la vanguardia del vídeo

Uno de los cambios más profundos que posibilita ColQwen3 es su capacidad para tratar el vídeo como si fuera un documento. En muchas empresas, el vídeo constituye «datos oscuros». Permanece en almacenamiento inactivo, sin posibilidad alguna de búsqueda, salvo que alguien haya etiquetado manualmente cada archivo.

ColQwen3 cambia esta situación al permitir la recuperación fotograma a fotograma en clips segmentados.

Caso de uso destacado: el banco de memoria corporativa

Cada día, las empresas graban miles de horas de reuniones internas en vídeo y, por lo general, esas grabaciones caen en el olvido.

  • El flujo de trabajo: al segmentar automáticamente las grabaciones largas de reuniones en clips más breves y coherentes e indexarlos con ColQwen3, se crea una «memoria corporativa» que admite búsquedas.

  • La consulta: un responsable de proyecto puede pedir: «Muéstrame el clip en el que el responsable de ingeniería explicó el problema de latencia de la API».

  • El resultado: en lugar de devolver un archivo de vídeo de 60 minutos, el sistema recupera el segmento exacto de 45 segundos en el que se mostró y comentó ese diagrama concreto en pantalla, aunque los interlocutores no dijeran expresamente «latencia» en ese preciso segundo.

Casos de uso empresariales: resolver problemas de gran valor

La adopción de embeddings multimodales nativos abre flujos de trabajo completamente nuevos en todos los sectores. Hemos evaluado exhaustivamente este modelo en algunos de los entornos de datos empresariales más complejos.

1. Resultado destacado: consultoría urbana y arquitectura

Probamos ColQwen3 con los retos de datos que afrontan las consultoras urbanísticas, que gestionan enormes bibliotecas de planes maestros, mapas de zonificación y complejos alzados arquitectónicos.

  • El reto: en estos entornos, los procesos RAG tradicionales presentan dificultades. Las herramientas de OCR suelen describir planos complejos simplemente como «esquemas», por lo que omiten detalles esenciales sobre el flujo del tráfico, las zonas verdes o los retranqueos de los edificios.

  • El rendimiento: nuestras pruebas internas demuestran que ColQwen3 evita eficazmente la necesidad de un costoso preprocesamiento mediante OCR o generación de descripciones. En pruebas con planos arquitectónicos de alta densidad, el modelo recuperó correctamente documentos a partir de marcadores visuales concretos, como accesos peatonales o límites de zonificación diferenciados. Así, superó de forma significativa las referencias basadas solo en texto y mostró potencial para reducir drásticamente los costes de incorporación de conocimiento.

2. Inteligencia financiera y de mercado compleja

Los banqueros de inversión y los analistas dedican miles de horas a revisar informes anuales y presentaciones para inversores.

  • El flujo de trabajo: un analista puede pedir: «Busca el desglose de los ingresos de APAC frente a los de EMEA en las presentaciones de 2024».

  • El cambio: en lugar de depender de coincidencias de palabras clave, el modelo recupera la diapositiva exacta a partir de la presencia visual de la representación de datos concreta, lo que permite al sistema RAG responder con gran precisión.

3. Fabricación industrial y servicio de campo

Las empresas manufactureras disponen de amplias bibliotecas de manuales técnicos y diagramas de tuberías e instrumentación (P&ID).

  • El flujo de trabajo: un ingeniero de campo que repara una turbina puede fotografiar una pieza o pedir: «Muéstrame el diagrama de cableado del conjunto de la bomba hidráulica».

  • El cambio: ColQwen3 identifica la representación visual del diagrama de cableado y recupera la página correcta, lo que puede reducir en horas el tiempo de inactividad.

4. Ámbito jurídico y cumplimiento normativo

El descubrimiento jurídico implica revisar millones de páginas escaneadas en las que la «aguja» suele ser un marcador visual.

  • El flujo de trabajo: un responsable de cumplimiento puede buscar «Documentos firmados por el director financiero» o «Contratos con el sello oficial de “Confidencial”».

  • El cambio: el modelo distingue entre un borrador y un documento definitivo por la presencia visual de firmas o sellos, algo que el OCR por sí solo suele pasar por alto.

Primeros pasos

ColQwen3 tiene pesos abiertos (Apache 2.0) y ya está disponible en Hugging Face. Lo hemos diseñado como una actualización directa para procesos RAG modernos y proporciona el código de inferencia necesario para procesar de inmediato texto, imágenes y vídeo.

Para las empresas preparadas para superar las búsquedas de texto sencillas y liberar la inteligencia atrapada en sus recursos visuales, este es el nuevo estándar.

Siguiente paso: consulta la tarjeta del modelo y prueba la demostración en directo en Hugging Face: /-colqwen3-embed-8b y /-colqwen3-embed-4b

Autor

Xin Huang y Kye Min Tan