Navegação principal

Para além do texto: verdadeiro RAG multimodal ponto a ponto

Os modelos de embedding multimodal ajudam as equipas a recuperar informação útil diretamente de documentos complexos, imagens e vídeos.

Nos últimos dois anos, «RAG» (geração aumentada por recuperação) tem sido quase exclusivamente sinónimo de texto. O procedimento habitual é simples: recolher documentos, extrair o texto, dividi-lo em segmentos e indexá-lo.

Mas o mundo empresarial não funciona com ficheiros de texto simples. Funciona com PDFs complexos, apresentações repletas de gráficos, desenhos CAD, faturas digitalizadas e, cada vez mais, enormes arquivos de vídeo.

A prática habitual do setor — usar OCR ou LLMs de visão para converter uma imagem numa descrição textual antes de criar o embedding — constitui um enorme estrangulamento. É lenta, dispendiosa e perde inevitavelmente o rico contexto espacial e visual dos dados originais. Se a sua IA descrever um elemento visual complexo apenas como «uma planta», perde a capacidade de procurar a válvula específica ou o esquema elétrico que este contém.

Hoje, lançamos uma família de modelos de embedding multimodal de última geração, baseada na arquitetura ColPali e concebida para resolver este problema através da recuperação visual ponto a ponto.

A engenharia por detrás da magia: estratégias avançadas de ajuste fino

Criar um recuperador multimodal verdadeiramente eficaz não é tão simples como usar um modelo de visão e linguagem (VLM) pronto a usar e pedir-lhe que faça uma pesquisa. Para superar os desafios que historicamente limitaram o RAG multimodal e criar o ColQwen3, recorremos a estratégias de fusão e treino de modelos.

1. Transferência da capacidade de embedding através de ponderação ajustada na fusão

Em vez de ajustarmos de raiz um modelo base, desenvolvemos um método para transferir o conhecimento de tarefas de recuperação a partir de um modelo de embedding textual existente. Um VLM convencional sabe descrever imagens, mas não sabe necessariamente ordená-las por relevância semântica face a uma consulta.

Para colmatar esta lacuna, utilizámos estratégias de ponderação ajustada na fusão. Nas nossas experiências, verificámos que a capacidade de recuperação do Qwen3-Embedding no espaço latente textual podia ser diretamente transferida para o espaço multimodal, generalizando-se à recuperação de imagens e vídeos mesmo sem treino imediato. Aproveitando esta inicialização eficaz como um ponto de partida sólido, ajustámos depois o modelo para otimizar ainda mais o desempenho e garantir a robustez. Isto melhora o desempenho final de recuperação face ao ajuste fino a partir do modelo base Qwen3-VL.

2. Ajuste rigoroso dos hiperparâmetros

Depois de transferirmos as capacidades de embedding, concentrámo-nos no alinhamento. Realizámos pesquisas rigorosas de hiperparâmetros e estudos de ablação, incluindo o número ideal de épocas, o tamanho do lote, a taxa de aprendizagem, o rank LoRA e a combinação de conjuntos de dados, para maximizar o desempenho da recuperação.

Como conjuntos de dados para o ajuste fino, escolhemos VDR, o conjunto de treino ColPali, visrag_syn, e visrag_ind. Utilizámos amostragem UniMax no ajuste fino. Como aplicámos a fusão de modelos e o modelo base resultante já herda parte da capacidade de recuperação multimodal, verificámos que aumentar o número de conjuntos de dados degradava ligeiramente o desempenho, pelo que não alargámos essa escala.

Estes são os hiperparâmetros que selecionámos para o ajuste fino:

Rank LoRA

32

Alfa LoRA

32

Módulos-alvo LoRA

todas as camadas de imagem e texto, exceto o embedding

Taxa de aprendizagem

5e-5

Máximo de tokens visuais

1280

Épocas de treino

1

Tamanho global do lote

512

Proporção de aquecimento

5%

3. O dilema «ColBERT»: desempenho elevado ou custos de armazenamento

Historicamente, os modelos que utilizavam embeddings ao nível do token «ao estilo ColBERT», como o ColPali, ofereciam um desempenho extraordinário, mas com custos de armazenamento proibitivos. A indexação de cada token visual criava enormes bases de dados vetoriais, demasiado dispendiosas à escala empresarial.

  • A estratégia de otimização: resolvemos o desafio do armazenamento equilibrando cuidadosamente o tamanho dos nossos embeddings para preservar o máximo desempenho sem deixar disparar os custos de armazenamento. Para manter uma precisão de última geração com esta dimensão eficiente, escolhemos cuidadosamente 320 dimensões, que oferecem o melhor equilíbrio entre desempenho de recuperação e custos de armazenamento.

    • Referência: uma abordagem convencional, como a NVIDIA Nemo-3B, requer cerca de 10,3 TB para armazenar os embeddings de um milhão de imagens (1802 tokens × 3072 dimensões).

    • ColQwen3: armazena o mesmo milhão de imagens em apenas 0,82 TB (máximo de 1280 tokens × 320 dimensões).

O ColQwen3 alcança uma precisão de recuperação de última geração sem fazer disparar o orçamento da infraestrutura de cloud.

Resultados da avaliação

Validámos a nossa abordagem no conjunto de testes de referência ViDoRe. Os resultados confirmam que o ColQwen3 estabelece novos padrões nos mais recentes testes de referência V3 e V2, tanto em inglês como multilingues, mantendo um desempenho de topo nas tarefas V1 anteriores.

ViDoRe v3 (mais recente)

O ColQwen3-8B lidera na recuperação em inglês e multilingue.

nDCG@5 em inglês

Modelo

Ciência comp.

Energia

Finanças

RH

Ind.

Farmacêutica

Física

Média

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 multilingue

Modelo

Ciência comp.

Energia

Finanças

RH

Ind.

Farmacêutica

Física

Média

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

Destaques do ViDoRe v2 e v1

Desempenho elevado e consistente em ESG, Economia e DocVQA.

Teste de referência

Modelo

Pontuação (média)

Resultado de destaque

ViDoRe V2 (inglês)

ColQwen3-8B

0.6772

N.º 1 em ESG e BioMed

ViDoRe V2 (multilingue)

ColQwen3-8B

0.6085

N.º 1 em Economia

ViDoRe V1 (inglês)

Nemo ColEmbed 3B

0.9100

Média ligeiramente superior

ViDoRe V1 (inglês)

ColQwen3-8B

0.9076

N.º 1 em ArxivQA e Syn-Gov

Recuperação de vídeo: avaliação CareBench

Para demonstrar a forte capacidade de generalização do ColQwen3 à recuperação de vídeo, avaliámos os modelos no teste de referência CareBench para tarefas de texto para vídeo (recuperação geral).

Nesta avaliação, utilizámos uma abordagem de codificação de vídeo em bruto: os nossos modelos codificaram diretamente os ficheiros de vídeo, sem anotações textuais adicionais nem metadados. Isto demonstra a capacidade do modelo para efetuar recuperações com base apenas na semântica visual.

Modelo

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

Desbloquear os «dados obscuros»: a fronteira do vídeo

Uma das mudanças mais profundas possibilitadas pelo ColQwen3 é a sua capacidade de tratar o vídeo como se fosse um documento. Em muitas empresas, o vídeo é composto por «dados obscuros». Fica armazenado a frio e é totalmente impossível de pesquisar, a menos que alguém tenha etiquetado manualmente cada ficheiro.

O ColQwen3 muda esta realidade ao permitir a recuperação, fotograma a fotograma, em clipes segmentados.

Caso de utilização em destaque: a memória empresarial

Todos os dias, as empresas gravam milhares de horas de reuniões internas em vídeo e, normalmente, essas gravações perdem-se no vazio.

  • O fluxo de trabalho: ao segmentar automaticamente gravações longas de reuniões em clipes mais curtos e coerentes e ao indexá-los com o ColQwen3, cria-se uma «memória empresarial» pesquisável.

  • A consulta: um gestor de projeto pode pedir: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • O resultado: em vez de devolver um ficheiro de vídeo com 60 minutos, o sistema recupera o segmento exato de 45 segundos em que esse diagrama específico foi apresentado no ecrã e discutido, mesmo que os intervenientes não tenham dito explicitamente a palavra «latência» nesse preciso segundo.

Casos de utilização empresarial: resolver problemas de elevado valor

A adoção de embeddings multimodais nativos viabiliza fluxos de trabalho totalmente novos em vários setores. Testámos exaustivamente este modelo em alguns dos ambientes de dados empresariais mais complexos.

1. Destaque dos testes: consultoria urbana e arquitetura

Testámos o ColQwen3 face aos desafios de dados das empresas de consultoria urbana, que gerem enormes acervos de planos diretores, mapas de zonamento e alçados arquitetónicos complexos.

  • O desafio: nestes ambientes, os pipelines RAG tradicionais enfrentam dificuldades. As ferramentas de OCR costumam descrever planos de implantação complexos apenas como «esquemas», ignorando detalhes essenciais sobre fluxos de tráfego, zonas verdes ou recuos dos edifícios.

  • O desempenho: os nossos testes internos demonstram que o ColQwen3 elimina eficazmente a necessidade do dispendioso pré-processamento por OCR ou legendagem. Em testes com desenhos arquitetónicos de alta densidade, o modelo recuperou documentos com base em marcadores visuais específicos, como acessos pedonais ou limites de zonamento distintos, superando significativamente as referências baseadas apenas em texto e permitindo reduzir drasticamente os custos de ingestão de conhecimento.

2. Inteligência financeira e de mercado complexa

Os profissionais de banca de investimento e os analistas passam milhares de horas a examinar relatórios anuais e apresentações para investidores.

  • O fluxo de trabalho: um analista pode pedir: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • A mudança: em vez de depender da correspondência de palavras-chave, o modelo recupera o diapositivo exato com base na presença visual da representação de dados específica, permitindo ao sistema RAG responder com elevada precisão.

3. Produção industrial e assistência no terreno

As empresas de produção possuem vastos acervos de manuais técnicos e diagramas de tubagens e instrumentação (P&ID).

  • O fluxo de trabalho: um técnico no terreno que esteja a reparar uma turbina pode tirar uma fotografia de uma peça ou pedir: “Show me the wiring diagram for the hydraulic pump assembly.”

  • A mudança: o ColQwen3 identifica a representação visual do esquema elétrico e recupera a página correta, reduzindo potencialmente o tempo de inatividade em várias horas.

4. Área jurídica e conformidade

A produção de prova jurídica implica analisar milhões de páginas digitalizadas, nas quais a «agulha no palheiro» é muitas vezes um marcador visual.

  • O fluxo de trabalho: um responsável pela conformidade pode pesquisar “Documents signed by the CFO” ou “Contracts containing the official ‘Confidential’ stamp.”

  • A mudança: o modelo distingue um rascunho de um documento finalizado com base na presença visual de assinaturas ou carimbos, algo que o OCR isolado muitas vezes não deteta.

Primeiros passos

O ColQwen3 tem pesos abertos (Apache 2.0) e já está disponível no Hugging Face. Concebemo-lo como uma atualização diretamente integrável nos pipelines RAG modernos, fornecendo o código de inferência necessário para processar imediatamente texto, imagens e vídeo.

Para as empresas que estão preparadas para ultrapassar a pesquisa de texto simples e explorar a inteligência retida nos seus recursos visuais, este é o novo padrão.

Próximo passo: consulte a ficha do modelo e experimente a demonstração ao vivo no Hugging Face: /-colqwen3-embed-8b e /-colqwen3-embed-4b

Autor

Xin Huang, Kye Min Tan