Durante los últimos dos años, “RAG” (generación aumentada por recuperación) ha sido casi exclusivamente sinónimo de texto. El procedimiento estándar es sencillo: tomar documentos, extraer el texto, dividirlo en fragmentos e indexarlo.
Pero el mundo empresarial no funciona con archivos de texto sin formato. Funciona con archivos PDF complejos, presentaciones con gráficos densos, dibujos CAD, facturas escaneadas y, cada vez más, enormes archivos de video.
El estándar del sector para procesar este contenido —usar OCR o LLM de visión para convertir una imagen en texto mediante una “descripción” antes de generar su incrustación— constituye un enorme cuello de botella. Es lento, costoso e inevitablemente pierde el valioso contexto espacial y visual de los datos originales. Si la IA describe un elemento visual complejo simplemente como “un plano”, se pierde la posibilidad de buscar en él una válvula específica o un esquema de cableado.
Hoy lanzamos una familia de modelos de incrustaciones multimodales de última generación, basados en la arquitectura ColPali y diseñados para resolver este problema mediante la recuperación visual de extremo a extremo.
Crear un recuperador multimodal realmente eficaz no es tan sencillo como tomar un modelo de visión y lenguaje (VLM) listo para usar y pedirle que busque. Para resolver los desafíos que históricamente han frenado el RAG multimodal y crear ColQwen3, empleamos estrategias de fusión y entrenamiento de modelos.
En lugar de ajustar un modelo base desde cero, diseñamos un método para transferir el conocimiento de las tareas de recuperación desde un modelo existente de incrustaciones textuales. Un VLM estándar sabe describir imágenes, pero no necesariamente sabe clasificarlas semánticamente en función de una consulta.
Para cerrar esta brecha, utilizamos estrategias de ponderaciones fusionadas y ajustadas. En nuestros experimentos, descubrimos que la capacidad de recuperación de Qwen3-Embedding en el espacio latente textual podía transferirse directamente al espacio multimodal y generalizarse a la recuperación de imágenes y videos, incluso sin entrenamiento inmediato. Aprovechamos esta eficaz inicialización como un punto de partida sólido y luego ajustamos el modelo para optimizar aún más el desempeño y garantizar su solidez. Esto mejora el desempeño final de recuperación frente al ajuste fino a partir del modelo base Qwen3-VL.
Una vez transferidas las capacidades de incrustación, nos enfocamos en la alineación. Realizamos búsquedas minuciosas de hiperparámetros y estudios de ablación, que incluyeron la cantidad óptima de épocas, el tamaño del lote, la tasa de aprendizaje, el rango de LoRA y la combinación de conjuntos de datos, para maximizar el desempeño de recuperación.
Para el ajuste fino, elegimos los conjuntos de datos VDR, conjunto de entrenamiento ColPali, visrag_syn, y visrag_ind. Usamos muestreo UniMax para el ajuste fino. Como aplicamos la fusión de modelos y el modelo base fusionado ya hereda parte de la capacidad multimodal de recuperación, descubrimos que aumentar la cantidad de conjuntos de datos degradaba ligeramente el desempeño. Por eso, no ampliamos su número.
Estos son los hiperparámetros que seleccionamos para el ajuste fino:
Rango de LoRA | 32 |
Alfa de LoRA | 32 |
Módulos objetivo de LoRA | todas las capas de imagen y texto, excepto la de incrustación |
Tasa de aprendizaje | 5e-5 |
Máximo de tokens visuales | 1 280 |
Épocas de entrenamiento | 1 |
Tamaño global del lote | 512 |
Proporción de calentamiento | 5 % |
Históricamente, los modelos que usaban incrustaciones a nivel de token “al estilo ColBERT”, como ColPali, ofrecían un desempeño increíble, pero con un costo de almacenamiento prohibitivo. Indexar cada token visual generaba enormes bases de datos vectoriales, demasiado costosas para operar a escala empresarial.
La estrategia de optimización: abordamos el desafío del almacenamiento al equilibrar cuidadosamente el tamaño de nuestras incrustaciones para conservar el máximo desempeño y evitar que los costos de almacenamiento se dispararan. Para mantener una precisión de vanguardia con este uso eficiente de recursos, seleccionamos cuidadosamente una dimensión de 320, que ofrece el mejor equilibrio entre desempeño de recuperación y costo de almacenamiento.
Referencia: un enfoque estándar, como NVIDIA Nemo-3B, requiere aproximadamente 10,3 TB para almacenar las incrustaciones de 1 millón de imágenes (1 802 tokens a 3 072 dimensiones).
ColQwen3: almacena el mismo millón de imágenes en solo 0,82 TB (máximo de 1 280 tokens a 320 dimensiones).
ColQwen3 alcanza una precisión de recuperación de vanguardia sin disparar el presupuesto de infraestructura en la nube.
Validamos nuestro enfoque con el conjunto de pruebas ViDoRe. Los resultados confirman que ColQwen3 establece nuevos estándares en las pruebas V3 y V2 más recientes, tanto en inglés como multilingües, y mantiene un desempeño de primer nivel en las tareas V1 anteriores.
ColQwen3-8B lidera la recuperación en inglés y multilingüe.
nDCG@5 en inglés
Modelo | Informática | Energía | Finanzas | RR. HH. | Ind. | Farmacia | Física | Prom. |
0,7443 | 0,6491 | 0,6823 | 0,6421 | 0,5766 | 0,6665 | 0,4747 | 0,6113 | |
0,7419 | 0,6023 | 0,6753 | 0,6037 | 0,5787 | 0,6612 | 0,4640 | 0,5934 | |
0,7514 | 0,5838 | 0,6712 | 0,6256 | 0,5447 | 0,6524 | 0,4128 | 0,5769 | |
0,7175 | 0,5842 | 0,6417 | 0,6206 | 0,5443 | 0,6303 | 0,4191 | 0,5680 |
nDCG@5 multilingüe
Modelo | Informática | Energía | Finanzas | RR. HH. | Ind. | Farmacia | Física | Prom. |
0,7194 | 0,6619 | 0,6172 | 0,6097 | 0,5164 | 0,6403 | 0,4706 | 0,5866 | |
0,7213 | 0,6374 | 0,6019 | 0,5637 | 0,5131 | 0,6351 | 0,4636 | 0,5708 | |
0,7216 | 0,5901 | 0,5646 | 0,5504 | 0,4335 | 0,6170 | 0,4192 | 0,5383 |
Alto desempeño constante en ESG, Economía y DocVQA.
Prueba | Modelo | Puntuación (prom.) | Logro destacado |
ViDoRe V2 (inglés) | ColQwen3-8B | 0,6772 | N.º 1 en ESG y BioMed |
ViDoRe V2 (multilingüe) | ColQwen3-8B | 0,6085 | N.º 1 en Economía |
ViDoRe V1 (inglés) | Nemo ColEmbed 3B | 0,9100 | Promedio ligeramente superior |
ViDoRe V1 (inglés) | ColQwen3-8B | 0,9076 | N.º 1 en ArxivQA y Syn-Gov |
Para demostrar la gran capacidad de ColQwen3 para generalizar a la recuperación de video, evaluamos los modelos con la prueba CareBench para tareas de texto a video (recuperación general).
Para esta evaluación, usamos un enfoque de codificación de video sin procesar: nuestros modelos codificaron directamente los archivos de video, sin anotaciones textuales adicionales ni metadatos. Esto demuestra la capacidad del modelo para realizar recuperaciones basadas exclusivamente en la semántica visual.
Modelo | Recall@1 | Recall@5 | Recall@10 |
0,8670 | 0,9590 | 0,9850 | |
0,8620 | 0,9570 | 0,9800 | |
0,7700 | 0,9560 | 0,9870 |
Uno de los cambios más profundos que permite ColQwen3 es su capacidad para tratar los videos igual que los documentos. En muchas empresas, el video es un conjunto de “datos oscuros”. Permanece en almacenamiento en frío y no se puede buscar en él a menos que una persona haya etiquetado manualmente cada archivo.
ColQwen3 cambia esto al permitir la recuperación cuadro por cuadro en clips segmentados.
Cada día, las empresas graban miles de horas de reuniones internas en video y, por lo general, estas grabaciones caen en el olvido.
El flujo de trabajo: al segmentar automáticamente las grabaciones largas de reuniones en clips más breves y coherentes e indexarlos con ColQwen3, se crea una “memoria corporativa” en la que se pueden hacer búsquedas.
La consulta: un gerente de proyecto puede pedir: “Muéstrame el clip en el que el líder de ingeniería explicó el problema de latencia de la API”.
El resultado: en lugar de devolver un archivo de video de 60 minutos, el sistema recupera el segmento exacto de 45 segundos en el que se mostró y analizó ese diagrama en pantalla, aunque los participantes no hayan dicho explícitamente la palabra “latencia” en ese preciso momento.
La transición a las incrustaciones multimodales nativas permite flujos de trabajo totalmente nuevos en diversos sectores. Hemos evaluado ampliamente este modelo en algunos de los entornos de datos empresariales más complejos.
Probamos ColQwen3 frente a los desafíos de datos que afrontan las empresas de consultoría urbana, las cuales administran enormes bibliotecas de planes maestros, mapas de zonificación y alzados arquitectónicos complejos.
El desafío: en estos entornos, los procesos RAG tradicionales tienen dificultades. Las herramientas de OCR suelen describir los planos complejos de un sitio simplemente como “esquemas”, por lo que omiten detalles esenciales sobre el flujo de tránsito, las zonas verdes o los retiros de los edificios.
El desempeño: nuestras pruebas internas demuestran que ColQwen3 evita eficazmente la necesidad del costoso preprocesamiento mediante OCR y generación de descripciones. En pruebas con dibujos arquitectónicos de alta densidad, el modelo recuperó correctamente documentos a partir de marcadores visuales específicos, como puntos de acceso peatonal o límites de zonificación definidos. Superó de manera significativa los resultados de referencia basados solo en texto y promete reducir drásticamente los costos de incorporación de conocimiento.
Los banqueros de inversión y analistas dedican miles de horas a revisar informes anuales y presentaciones para inversionistas.
El flujo de trabajo: un analista puede pedir: “Busca el desglose de los ingresos de APAC frente a los de EMEA en las presentaciones de 2024”.
El cambio: en lugar de depender de coincidencias de palabras clave, el modelo recupera la diapositiva exacta a partir de la presencia visual de la representación específica de los datos, lo que permite al sistema RAG responder preguntas con gran precisión.
Las empresas manufactureras poseen enormes bibliotecas de manuales técnicos y diagramas de tuberías e instrumentación (P&ID).
El flujo de trabajo: un ingeniero de campo que repara una turbina puede tomar una foto de una pieza o pedir: “Muéstrame el diagrama de cableado del conjunto de la bomba hidráulica”.
El cambio: ColQwen3 identifica la representación visual del diagrama de cableado y recupera la página correcta, lo que podría reducir varias horas el tiempo de inactividad.
El proceso de descubrimiento legal implica revisar millones de páginas escaneadas, donde la “aguja en el pajar” suele ser un marcador visual.
El flujo de trabajo: un responsable de cumplimiento puede buscar “Documentos firmados por el director financiero” o “Contratos con el sello oficial ‘Confidencial’”.
El cambio: el modelo distingue entre un borrador y un documento finalizado a partir de la presencia visual de firmas o sellos, algo que el OCR por sí solo suele pasar por alto.
ColQwen3 tiene pesos abiertos (Apache 2.0) y ya está disponible en Hugging Face. Lo diseñamos como una actualización directa para los procesos RAG modernos, con el código de inferencia necesario para procesar texto, imágenes y video de inmediato.
Para las empresas que están listas para superar la búsqueda de texto simple y aprovechar la inteligencia atrapada en sus recursos visuales, este es el nuevo estándar.
Siguiente paso: consulta la tarjeta del modelo y prueba la demostración en vivo en Hugging Face: /-colqwen3-embed-8b y /-colqwen3-embed-4b