Més enllà del text: RAG realment multimodal d'extrem a extrem

Els models d'incrustacions multimodals ajuden els equips a recuperar informació útil directament de documents complexos, imatges i vídeos.

Durant els dos darrers anys, "RAG" (generació augmentada per recuperació) ha estat gairebé exclusivament sinònim de text. El procediment habitual és senzill: agafar documents, extreure'n el text, dividir-lo en fragments i indexar-lo.

Però el món empresarial no funciona amb fitxers de text sense format. Funciona amb PDF complexos, presentacions amb gràfics densos, dibuixos CAD, factures escanejades i, cada cop més, arxius enormes de vídeo.

L'estàndard del sector per gestionar-ho —utilitzar OCR o LLM de visió per convertir una imatge en text mitjançant una "descripció" abans de generar-ne la incrustació— és un coll d'ampolla enorme. És lent i car, i inevitablement perd el ric context espacial i visual de les dades originals. Si la vostra IA descriu un element visual complex simplement com "un plànol", perdeu la possibilitat de cercar-hi una vàlvula concreta o l'esquema de cablejat.

Avui publiquem una família de models d'incrustacions multimodals d'avantguarda, basats en l'arquitectura ColPali i dissenyats per resoldre aquest problema mitjançant la recuperació visual d'extrem a extrem.

L'enginyeria que fa possible la màgia: estratègies avançades d'ajust fi

Crear un recuperador multimodal realment eficaç no és tan senzill com agafar un model de visió i llenguatge (VLM) estàndard i demanar-li que cerqui. Per superar els reptes que històricament han frenat el RAG multimodal i crear ColQwen3, hem emprat estratègies de fusió i entrenament de models.

1. Transferència de la capacitat d'incrustació mitjançant ponderacions de fusió ajustades

En lloc d'ajustar un model base des de zero, hem desenvolupat un mètode per transferir el coneixement de les tasques de recuperació des d'un model d'incrustacions textuals existent. Un VLM estàndard sap descriure imatges, però no necessàriament sap ordenar-les semànticament segons una consulta.

Per salvar aquesta distància, hem utilitzat estratègies de ponderació de fusió ajustades. En els nostres experiments, hem constatat que la capacitat de recuperació de Qwen3-Embedding en l'espai latent textual es podia transferir directament a l'espai multimodal i generalitzar-se a la recuperació d'imatges i vídeos fins i tot sense entrenament immediat. Després, aprofitant aquesta inicialització eficaç com a punt de partida sòlid, hem ajustat el model per optimitzar-ne encara més el rendiment i garantir-ne la robustesa. Això millora el rendiment final de recuperació respecte a l'ajust fi a partir del model base Qwen3-VL.

2. Ajust minuciós dels hiperparàmetres

Un cop transferides les capacitats d'incrustació, ens hem centrat en l'alineació. Hem fet cerques minucioses d'hiperparàmetres i estudis d'ablació, inclosos el nombre òptim d'èpoques, la mida del lot, la taxa d'aprenentatge, el rang LoRA i la combinació de conjunts de dades, per maximitzar el rendiment de recuperació.

Com a conjunts de dades per a l'ajust fi, hem triat VDR, el conjunt d'entrenament de ColPali, visrag_syn, i visrag_ind. Hem utilitzat el mostreig UniMax per a l'ajust fi. Com que hem aplicat la fusió de models i el model base fusionat ja hereta una part de la capacitat de recuperació multimodal, hem comprovat que augmentar el nombre de conjunts de dades empitjorava lleugerament el rendiment; per tant, no n'hem afegit més.

Aquests són els hiperparàmetres que hem seleccionat per a l'ajust fi:

Rang LoRA

32

Alfa LoRA

32

Mòduls objectiu de LoRA

totes les capes d'imatge i text, excepte la d'incrustació

Taxa d'aprenentatge

5e-5

Màxim de segments visuals

1280

Èpoques d'entrenament

1

Mida global del lot

512

Proporció d'escalfament

5%

3. El dilema de "ColBERT": rendiment elevat o cost d'emmagatzematge

Històricament, els models que utilitzaven incrustacions per segment a l'estil de "ColBERT", com ColPali, oferien un rendiment extraordinari, però amb un cost d'emmagatzematge prohibitiu. Indexar cada segment visual generava bases de dades vectorials enormes, massa cares per fer-les servir a escala empresarial.

  • L'estratègia d'optimització: hem abordat el repte de l'emmagatzematge equilibrant acuradament la mida de les incrustacions per mantenir el màxim rendiment sense disparar-ne els costos. Per mantenir una precisió d'avantguarda amb aquesta empremta eficient, hem seleccionat una mida de 320 dimensions, que ofereix l'equilibri òptim entre el rendiment de recuperació i el cost d'emmagatzematge.

    • Referència: un enfocament estàndard, com NVIDIA Nemo-3B, requereix aproximadament 10,3 TB per emmagatzemar les incrustacions d'un milió d'imatges (1.802 segments × 3.072 dimensions).

    • ColQwen3: emmagatzema el mateix milió d'imatges en només 0,82 TB (màxim de 1.280 segments × 320 dimensions).

ColQwen3 assoleix una precisió de recuperació d'avantguarda sense disparar el pressupost de la infraestructura al núvol.

Resultats de l'avaluació

Hem validat el nostre enfocament amb el conjunt de proves ViDoRe. Els resultats confirmen que ColQwen3 estableix nous estàndards en les últimes proves V3 i V2, tant en anglès com multilingües, i manté un rendiment de primer nivell en les tasques anteriors de V1.

ViDoRe v3 (la més recent)

ColQwen3-8B lidera la recuperació en anglès i multilingüe.

nDCG@5 en anglès

Model

Informàtica

Energia

Finances

RH

Ind.

Farmàcia

Física

Mitjana

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 multilingüe

Model

Informàtica

Energia

Finances

RH

Ind.

Farmàcia

Física

Mitjana

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Resultats destacats de ViDoRe v2 i v1

Rendiment elevat i constant en ESG, economia i DocVQA.

Prova

Model

Puntuació (mitjana)

Resultat destacat

ViDoRe V2 (anglès)

ColQwen3-8B

0.6772

Núm. 1 en ESG i BioMed

ViDoRe V2 (multilingüe)

ColQwen3-8B

0.6085

Núm. 1 en economia

ViDoRe V1 (anglès)

Nemo ColEmbed 3B

0.9100

Mitjana lleugerament superior

ViDoRe V1 (anglès)

ColQwen3-8B

0.9076

Núm. 1 en ArxivQA i Syn-Gov

Recuperació de vídeos: avaluació CareBench

Per demostrar que ColQwen3 generalitza molt bé en la recuperació de vídeos, hem avaluat els models amb la prova CareBench per a tasques de text a vídeo (recuperació general).

Per a aquesta avaluació, hem emprat un mètode de codificació de vídeo en brut: els nostres models han codificat directament els fitxers de vídeo, sense anotacions textuals addicionals ni metadades d'entrada. Això posa en relleu la capacitat del model per recuperar informació basant-se exclusivament en la semàntica visual.

Model

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Alliberar les "dades fosques": la frontera del vídeo

Un dels canvis més profunds que permet ColQwen3 és la capacitat de tractar els vídeos com si fossin documents. En moltes empreses, el vídeo és una "dada fosca". Queda desat en emmagatzematge en fred i no s'hi pot cercar res tret que una persona hagi etiquetat manualment cada fitxer.

ColQwen3 ho canvia, ja que permet recuperar fotogrames de clips segmentats.

Cas d'ús destacat: la memòria corporativa

Cada dia, les empreses enregistren milers d'hores de reunions internes en vídeo i, normalment, aquests enregistraments cauen en l'oblit.

  • El flux de treball: en segmentar automàticament els enregistraments llargs de reunions en clips més curts i coherents, i indexar-los amb ColQwen3, es crea una "memòria corporativa" consultable.

  • La consulta: un cap de projecte pot demanar: "Show me the clip where the engineering lead explained the latency issue with the API."

  • El resultat: en comptes de retornar un fitxer de vídeo de 60 minuts, el sistema recupera el segment exacte de 45 segons en què aquell diagrama concret es va mostrar a la pantalla i es va comentar, encara que els participants no diguessin explícitament la paraula "latència" en aquell precís moment.

Casos d'ús empresarials: resoldre problemes d'alt valor

El pas a les incrustacions multimodals natives obre fluxos de treball completament nous en tots els sectors. Hem sotmès aquest model a proves exhaustives en alguns dels entorns de dades empresarials més complexos.

1. Prova destacada: consultoria urbana i arquitectura

Hem provat ColQwen3 amb els reptes de dades de les consultores urbanes, que gestionen enormes biblioteques de plans directors, mapes de zonificació i alçats arquitectònics complexos.

  • El repte: en aquests entorns, els processos RAG tradicionals tenen dificultats. Les eines d'OCR solen descriure els plànols d'emplaçament complexos simplement com a "esquemes" i ometen detalls essencials sobre els fluxos de trànsit, les zones verdes o els retranquejos dels edificis.

  • El rendiment: les nostres proves internes demostren que ColQwen3 evita eficaçment la necessitat d'un preprocessament costós d'OCR o de generació de descripcions. En proves amb dibuixos arquitectònics d'alta densitat, el model ha recuperat correctament documents a partir de marcadors visuals específics, com ara accessos per a vianants o límits de zonificació diferenciats. Així, supera àmpliament els sistemes de referència basats només en text i permet reduir dràsticament els costos d'ingesta de coneixement.

2. Intel·ligència financera i de mercat complexa

Els banquers d'inversió i els analistes dediquen milers d'hores a examinar informes anuals i presentacions per a inversors.

  • El flux de treball: un analista pot demanar: "Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks."

  • El canvi: en comptes de dependre de coincidències de paraules clau, el model recupera la diapositiva exacta a partir de la presència visual de la representació de dades concreta, cosa que permet al sistema RAG respondre amb gran precisió.

3. Fabricació industrial i servei de camp

Les empreses fabricants disposen d'enormes biblioteques de manuals tècnics i diagrames de canonades i instrumentació (P&ID).

  • El flux de treball: un enginyer de camp que repara una turbina pot fer una foto d'una peça o demanar: "Show me the wiring diagram for the hydraulic pump assembly."

  • El canvi: ColQwen3 identifica la representació visual del diagrama de cablejat i recupera la pàgina correcta, fet que pot reduir en hores el temps d'inactivitat.

4. Àmbit jurídic i compliment normatiu

El descobriment de proves jurídiques implica revisar milions de pàgines escanejades en què l'element difícil de trobar sovint és un marcador visual.

  • El flux de treball: un responsable de compliment normatiu pot cercar "Documents signed by the CFO" o "Contracts containing the official 'Confidential' stamp."

  • El canvi: el model distingeix entre un esborrany i un document definitiu a partir de la presència visual de signatures o segells, un detall que l'OCR per si sol sovint no detecta.

Primers passos

ColQwen3 té pesos oberts (Apache 2.0) i ja està disponible a Hugging Face. L'hem dissenyat com una actualització directa per als processos RAG moderns, amb el codi d'inferència necessari per processar text, imatges i vídeo immediatament.

Per a les empreses preparades per anar més enllà de la cerca de text simple i aprofitar la intel·ligència atrapada en els actius visuals, aquest és el nou estàndard.

Pas següent: consulteu la fitxa del model i proveu la demostració en directe a Hugging Face: /-colqwen3-embed-8b i /-colqwen3-embed-4b

Autor

Xin Huang i Kye Min Tan