ప్రధాన నావిగేషన్

వచనానికి ఆవల: నిజమైన బహుళమాధ్యమ, ఎండ్-టు-ఎండ్ RAGకు తాళం తీయడం

సంక్లిష్ట పత్రాలు, చిత్రాలు, వీడియోల నుంచి ఉపయోగకరమైన సమాచారాన్ని నేరుగా వెలికితీయడంలో బహుళమాధ్యమ ఎంబెడ్డింగ్ మోడళ్లు బృందాలకు సహాయపడతాయి.

గత రెండేళ్లుగా “RAG” (రిట్రీవల్-ఆగ్మెంటెడ్ జనరేషన్) దాదాపు పూర్తిగా వచనానికి పర్యాయపదంగా మారింది. ప్రామాణిక విధానం సరళమైనది: పత్రాలను తీసుకుని, వచనాన్ని వెలికితీసి, భాగాలుగా విభజించి, సూచీకరించడం.

కానీ సంస్థాగత ప్రపంచం సాధారణ వచన ఫైళ్లపై నడవదు. అది సంక్లిష్ట PDFలు, సాంద్రమైన చార్ట్‌లతో కూడిన స్లైడ్ సమాహారాలు, CAD చిత్రాలు, స్కాన్ చేసిన ఇన్‌వాయిస్‌లు, రోజురోజుకూ పెరుగుతున్న భారీ వీడియో ఆర్కైవ్‌లపై ఆధారపడి ఉంటుంది.

చిత్రాన్ని ఎంబెడ్ చేయడానికి ముందు OCR లేదా విజన్ LLMలతో దానికి వచన “వివరణ” రూపొందించే పరిశ్రమ ప్రమాణ పద్ధతి భారీ అవరోధంగా మారింది. ఇది నెమ్మదిగా, ఖరీదుగా ఉండటంతోపాటు అసలు డేటాలోని సమృద్ధమైన ప్రాదేశిక, దృశ్య సందర్భాన్ని తప్పనిసరిగా కోల్పోతుంది. సంక్లిష్ట దృశ్యాన్ని మీ AI కేవలం “ఒక బ్లూప్రింట్” అని వర్ణిస్తే, అందులోని నిర్దిష్ట వాల్వ్ లేదా వైరింగ్ స్కీమాటిక్‌ను వెతికే సామర్థ్యాన్ని మీరు కోల్పోయినట్లే.

ఎండ్-టు-ఎండ్ దృశ్య రిట్రీవల్‌ను సాధ్యం చేయడం ద్వారా ఈ సమస్యను పరిష్కరించేందుకు రూపొందించిన ColPali నిర్మాణంపై ఆధారపడిన అత్యాధునిక బహుళమాధ్యమ ఎంబెడ్డింగ్ మోడళ్ల శ్రేణిని నేడు విడుదల చేస్తున్నాము.

అద్భుతం వెనుక ఇంజినీరింగ్: అధునాతన ఫైన్-ట్యూనింగ్ వ్యూహాలు

నిజంగా సమర్థవంతమైన బహుళమాధ్యమ రిట్రీవర్‌ను రూపొందించడం అంటే సిద్ధంగా లభించే విజన్-లాంగ్వేజ్ మోడల్‌ను (VLM) తీసుకుని శోధించమని అడగడం అంత సులభం కాదు. చారిత్రకంగా బహుళమాధ్యమ RAGను వెనక్కి లాగిన సవాళ్లను పరిష్కరించి ColQwen3ను రూపొందించేందుకు, మేము మోడల్ విలీనం, శిక్షణ వ్యూహాలను ఉపయోగించాము.

1. సర్దుబాటు చేసిన విలీన వెయిటింగ్ ద్వారా ఎంబెడ్డింగ్ సామర్థ్య బదిలీ

ప్రాథమిక మోడల్‌ను మొదటి నుంచి ఫైన్-ట్యూన్ చేయడానికి బదులు, ఇప్పటికే ఉన్న వచన ఎంబెడ్డింగ్ మోడల్ నుంచి రిట్రీవల్ పనుల జ్ఞానాన్ని బదిలీ చేసే పద్ధతిని రూపొందించాము. ప్రామాణిక VLMకు చిత్రాలను ఎలా వర్ణించాలో తెలుసు. కానీ ప్రశ్నకు అనుగుణంగా అర్థపరంగా వాటికి ర్యాంక్ ఇవ్వడం తప్పనిసరిగా తెలియదు.

ఈ అంతరాన్ని పూడ్చేందుకు సర్దుబాటు చేసిన విలీన వెయిటింగ్ వ్యూహాలను ఉపయోగించాము. వచన గుప్త ప్రదేశంలోని Qwen3-Embedding రిట్రీవల్ సామర్థ్యాన్ని నేరుగా బహుళమాధ్యమ ప్రదేశానికి బదిలీ చేయవచ్చని మా ప్రయోగాల్లో గుర్తించాము. తక్షణ శిక్షణ లేకుండానే ఇది చిత్రం, వీడియో రిట్రీవల్‌కు సాధారణీకరించింది. ఈ సమర్థవంతమైన ప్రారంభీకరణను బలమైన పునాదిగా ఉపయోగించి, పనితీరును మరింత మెరుగుపరచడానికి, పటిష్ఠతను నిర్ధారించడానికి మోడల్‌ను ఫైన్-ట్యూన్ చేశాము. Qwen3-VL ప్రాథమిక మోడల్ నుంచి ఫైన్-ట్యూన్ చేయడంతో పోలిస్తే ఇది తుది రిట్రీవల్ పనితీరును మెరుగుపరుస్తుంది.

2. జాగ్రత్తతో హైపర్-పారామీటర్ సర్దుబాటు

ఎంబెడ్డింగ్ సామర్థ్యాలను బదిలీ చేసిన తర్వాత, మేము సమన్వయంపై దృష్టి పెట్టాము. రిట్రీవల్ పనితీరును గరిష్ఠం చేసేందుకు సరైన ఎపోక్‌ల సంఖ్య, బ్యాచ్ పరిమాణం, అభ్యాస రేటు, LoRA ర్యాంక్, డేటాసెట్‌ల మిశ్రమంతో సహా హైపర్-పారామీటర్ శోధనలు, అబ్లేషన్ అధ్యయనాలను జాగ్రత్తగా నిర్వహించాము.

ఫైన్-ట్యూనింగ్ డేటాసెట్‌లుగా VDR, ColPali శిక్షణ సమితి, visrag_syn, మరియు visrag_indను ఎంచుకున్నాము. ఫైన్-ట్యూనింగ్ కోసం UniMax శాంప్లింగ్‌ను ఉపయోగించాము. మోడల్ విలీనాన్ని వర్తింపజేయడం వల్ల విలీనమైన ప్రాథమిక మోడల్ ఇప్పటికే పాక్షిక బహుళమాధ్యమ రిట్రీవర్ సామర్థ్యాన్ని పొందింది. మరిన్ని డేటాసెట్‌లకు పెంచితే పనితీరు కొద్దిగా తగ్గుతుందని గుర్తించాము. అందువల్ల మరిన్ని డేటాసెట్‌లకు విస్తరించలేదు.

ఫైన్-ట్యూనింగ్ కోసం మేము ఎంచుకున్న హైపర్-పారామీటర్లు ఇవి:

LoRA ర్యాంక్

32

LoRA ఆల్ఫా

32

LoRA లక్ష్య మాడ్యూల్‌లు

ఎంబెడ్డింగ్ మినహా చిత్రం, వచనం రెండింటి అన్ని లేయర్‌లు

అభ్యాస రేటు

5e-5

గరిష్ఠ దృశ్య టోకెన్‌లు

1280

శిక్షణ ఎపోక్‌లు

1

గ్లోబల్ బ్యాచ్ పరిమాణం

512

వార్మప్ నిష్పత్తి

5%

3. “ColBERT” సందిగ్ధత: అధిక పనితీరు వర్సెస్ నిల్వ ఖర్చు

చారిత్రకంగా, “ColBERT-శైలి” టోకెన్-స్థాయి ఎంబెడ్డింగ్‌లను ఉపయోగించే మోడళ్లు (ColPali వంటివి) అద్భుతమైన పనితీరును అందించినా, వాటి నిల్వ ఖర్చు భరించలేనంతగా ఉండేది. ప్రతి దృశ్య టోకెన్‌ను సూచీకరించడం వల్ల సంస్థాగత స్థాయిలో భరించలేనంత ఖరీదైన భారీ వెక్టర్ డేటాబేస్‌లు ఏర్పడ్డాయి.

  • అనుకూలీకరణ వ్యూహం: గరిష్ఠ పనితీరును నిలుపుకుంటూనే నిల్వ ఖర్చులు విపరీతంగా పెరగకుండా, మా ఎంబెడ్డింగ్‌ల పరిమాణాన్ని జాగ్రత్తగా సమతుల్యం చేసి నిల్వ సవాలును పరిష్కరించాము. ఈ సమర్థవంతమైన పరిమాణంలో SOTA ఖచ్చితత్వాన్ని కొనసాగించేందుకు, రిట్రీవల్ పనితీరు, నిల్వ ఖర్చుల మధ్య ఉత్తమ సమతుల్యత కోసం డైమెన్షన్ పరిమాణాన్ని 320గా ఎంచుకున్నాము.

    • ప్రామాణిక పద్ధతి: 10 లక్షల చిత్రాల ఎంబెడ్డింగ్‌లను నిల్వ చేయడానికి సాధారణ పద్ధతికి (NVIDIA Nemo-3B వంటిది) సుమారు 10.3 TB అవసరం (1,802 టోకెన్‌లు @ 3,072 డైమెన్షన్‌లు).

    • ColQwen3: అదే 10 లక్షల చిత్రాలను కేవలం 0.82 TBలో నిల్వ చేస్తుంది (గరిష్ఠంగా 1,280 టోకెన్‌లు @ 320 డైమెన్షన్‌లు).

క్లౌడ్ మౌలిక సదుపాయాల బడ్జెట్‌ను విపరీతంగా పెంచకుండానే ColQwen3 SOTA రిట్రీవల్ ఖచ్చితత్వాన్ని సాధిస్తుంది.

మూల్యాంకన ఫలితాలు

మా విధానాన్ని ViDoRe బెంచ్‌మార్క్ సమాహారంపై ధ్రువీకరించాము. తాజా V3, V2 బెంచ్‌మార్క్‌లలో (ఆంగ్లం, బహుభాషా రెండింటిలోనూ) ColQwen3 కొత్త ప్రమాణాలను నెలకొల్పడంతోపాటు, పాత V1 పనుల్లో అగ్రశ్రేణి పనితీరును కొనసాగిస్తోందని ఫలితాలు నిర్ధారించాయి.

ViDoRe v3 (తాజాది)

ఆంగ్ల, బహుభాషా రిట్రీవల్‌లో ColQwen3-8B అగ్రస్థానంలో ఉంది.

ఆంగ్ల nDCG@5

మోడల్

కంప్యూటర్ సైన్స్

ఇంధనం

ఆర్థికం

మానవ వనరులు

పరిశ్రమ

ఔషధ రంగం

భౌతికశాస్త్రం

సగటు

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

బహుభాషా nDCG@5

మోడల్

కంప్యూటర్ సైన్స్

ఇంధనం

ఆర్థికం

మానవ వనరులు

పరిశ్రమ

ఔషధ రంగం

భౌతికశాస్త్రం

సగటు

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2, v1 ముఖ్యాంశాలు

ESG, ఆర్థికశాస్త్రం, DocVQA అంతటా స్థిరమైన అధిక పనితీరు.

బెంచ్‌మార్క్

మోడల్

స్కోర్ (సగటు)

ప్రధాన విజయం

ViDoRe V2 (ఆంగ్లం)

ColQwen3-8B

0.6772

ESG & BioMedలో #1

ViDoRe V2 (బహుభాషా)

ColQwen3-8B

0.6085

ఆర్థికశాస్త్రంలో #1

ViDoRe V1 (ఆంగ్లం)

Nemo ColEmbed 3B

0.9100

కొద్దిగా ఎక్కువ సగటు

ViDoRe V1 (ఆంగ్లం)

ColQwen3-8B

0.9076

ArxivQA & Syn-Govలో #1

వీడియో రిట్రీవల్: CareBench మూల్యాంకనం

వీడియో రిట్రీవల్‌కు ColQwen3 సమర్థంగా సాధారణీకరిస్తుందని చూపేందుకు, టెక్స్ట్-టు-వీడియో (సాధారణ రిట్రీవల్) పనుల కోసం CareBench బెంచ్‌మార్క్‌పై మోడళ్లను మూల్యాంకనం చేశాము.

ఈ మూల్యాంకనంలో ముడి వీడియో ఎన్‌కోడింగ్ విధానాన్ని ఉపయోగించాము. అదనపు వచన వివరణలు లేదా మెటాడేటా ఇన్‌పుట్‌లు లేకుండా మా మోడళ్లు వీడియో ఫైళ్లను నేరుగా ఎన్‌కోడ్ చేశాయి. కేవలం దృశ్య అర్థాల ఆధారంగానే రిట్రీవల్ చేయగల మోడల్ సామర్థ్యాన్ని ఇది స్పష్టం చేస్తుంది.

మోడల్

రీకాల్@1

రీకాల్@5

రీకాల్@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“డార్క్ డేటా”కు తాళం తీయడం: వీడియోలో అత్యాధునిక సరిహద్దు

వీడియోను కూడా పత్రాల మాదిరిగానే పరిగణించగలగడం ColQwen3 సాధ్యం చేసిన అత్యంత ప్రభావవంతమైన మార్పుల్లో ఒకటి. అనేక సంస్థల్లో వీడియో “డార్క్ డేటా”గా ఉంటుంది. ప్రతి ఫైల్‌కు ఎవరైనా స్వయంగా ట్యాగ్‌లు జోడించకపోతే, అది కోల్డ్ స్టోరేజ్‌లో శోధించలేని స్థితిలోనే ఉండిపోతుంది.

విభజించిన క్లిప్‌లలో ఫ్రేమ్‌లవారీగా రిట్రీవల్‌ను సాధ్యం చేసి ColQwen3 ఈ పరిస్థితిని మారుస్తుంది.

వినియోగ సందర్భం: సంస్థాగత జ్ఞాపక భాండాగారం

సంస్థలు ప్రతిరోజూ వేల గంటల అంతర్గత వీడియో సమావేశాలను రికార్డ్ చేస్తాయి. సాధారణంగా ఈ రికార్డింగ్‌లు ఎవరికీ అందకుండా మిగిలిపోతాయి.

  • పని విధానం: సుదీర్ఘ సమావేశ రికార్డింగ్‌లను స్వయంచాలకంగా చిన్న, తార్కిక క్లిప్‌లుగా విభజించి, ColQwen3తో సూచీకరించడం ద్వారా శోధించగల “సంస్థాగత జ్ఞాపకాన్ని” సృష్టించవచ్చు.

  • ప్రశ్న: ప్రాజెక్ట్ మేనేజర్ ఇలా అడగవచ్చు: “APIలోని జాప్య సమస్యను ఇంజినీరింగ్ లీడ్ వివరించిన క్లిప్‌ను చూపించు.”

  • ఫలితం: 60 నిమిషాల వీడియో ఫైల్‌ను చూపడానికి బదులు, ఆ నిర్దిష్ట రేఖాచిత్రాన్ని తెరపై చూపించి చర్చించిన ఖచ్చితమైన 45 సెకన్ల భాగాన్ని సిస్టమ్ వెలికితీస్తుంది. ఆ క్షణంలో వక్తలు “జాప్యం” అనే పదాన్ని స్పష్టంగా చెప్పకపోయినా ఇది సాధ్యమవుతుంది.

సంస్థాగత వినియోగ సందర్భాలు: అధిక విలువ గల సమస్యల పరిష్కారం

స్థానిక బహుళమాధ్యమ ఎంబెడ్డింగ్‌కు మారడం పరిశ్రమలన్నింటిలో పూర్తిగా కొత్త పని విధానాలను సాధ్యం చేస్తుంది. అత్యంత సంక్లిష్టమైన కొన్ని సంస్థాగత డేటా వాతావరణాలతో పోల్చి ఈ మోడల్‌ను విస్తృతంగా బెంచ్‌మార్క్ చేశాము.

1. బెంచ్‌మార్క్ ముఖ్యాంశం: పట్టణ సలహా సేవలు, వాస్తుశిల్పం

మాస్టర్ ప్లాన్‌లు, జోనింగ్ మ్యాప్‌లు, సంక్లిష్ట వాస్తు ఎలివేషన్‌ల భారీ భాండాగారాలను నిర్వహించే పట్టణ సలహా సంస్థలు ఎదుర్కొనే డేటా సవాళ్లపై ColQwen3ను పరీక్షించాము.

  • సవాలు: ఈ వాతావరణాల్లో సంప్రదాయ RAG పైప్‌లైన్‌లు ఇబ్బంది పడతాయి. OCR సాధనాలు సంక్లిష్ట సైట్ ప్లాన్‌లను సాధారణంగా “స్కీమాటిక్” అని మాత్రమే వర్ణిస్తాయి. దీంతో ట్రాఫిక్ ప్రవాహం, హరిత మండలాలు లేదా భవనాల వెనుకంజ దూరాల వంటి కీలక వివరాలు తప్పిపోతాయి.

  • పనితీరు: ఖరీదైన OCR/క్యాప్షనింగ్ ముందస్తు ప్రాసెసింగ్ అవసరాన్ని ColQwen3 సమర్థంగా తొలగిస్తుందని మా అంతర్గత బెంచ్‌మార్క్‌లు చూపుతున్నాయి. అధిక సాంద్రత గల వాస్తు చిత్రాల పరీక్షల్లో, పాదచారుల ప్రవేశ మార్గాలు లేదా స్పష్టమైన జోనింగ్ సరిహద్దుల వంటి నిర్దిష్ట దృశ్య గుర్తుల ఆధారంగా మోడల్ పత్రాలను విజయవంతంగా వెలికితీసింది. ఇది వచన-ఆధారిత ప్రామాణిక పద్ధతుల కంటే గణనీయంగా మెరుగైన పనితీరు చూపడంతోపాటు, జ్ఞానాన్ని చేర్చే ఖర్చులను భారీగా తగ్గించే అవకాశాన్ని అందిస్తుంది.

2. సంక్లిష్ట ఆర్థిక, మార్కెట్ ఇంటెలిజెన్స్

పెట్టుబడి బ్యాంకర్లు, విశ్లేషకులు వార్షిక నివేదికలు, పెట్టుబడిదారుల స్లైడ్ సమాహారాలను పరిశీలించడానికి వేల గంటలు వెచ్చిస్తారు.

  • పని విధానం: విశ్లేషకుడు ఇలా అడగవచ్చు: “2024 స్లైడ్ సమాహారాల్లో APAC ఆదాయం, EMEA ఆదాయం విభజనను కనుగొను.”

  • మార్పు: కీలకపదాల సరిపోలికపై ఆధారపడటానికి బదులు, నిర్దిష్ట డేటా విజువలైజేషన్ దృశ్యరూపం ఆధారంగా మోడల్ ఖచ్చితమైన స్లైడ్‌ను వెలికితీస్తుంది. దీనివల్ల RAG సిస్టమ్ అత్యంత ఖచ్చితంగా సమాధానాలు ఇవ్వగలదు.

3. పారిశ్రామిక తయారీ, క్షేత్ర సేవలు

తయారీ సంస్థల వద్ద సాంకేతిక మాన్యువల్‌లు, పైపింగ్ రేఖాచిత్రాల (P&IDలు) భారీ భాండాగారాలు ఉంటాయి.

  • పని విధానం: టర్బైన్‌ను మరమ్మతు చేస్తున్న క్షేత్ర ఇంజినీర్ ఒక భాగాన్ని ఫొటో తీసి లేదా “హైడ్రాలిక్ పంప్ అసెంబ్లీ వైరింగ్ రేఖాచిత్రాన్ని చూపించు” అని అడగవచ్చు.

  • మార్పు: వైరింగ్ రేఖాచిత్రపు దృశ్య రూపాన్ని ColQwen3 గుర్తించి, సరైన పేజీని వెలికితీస్తుంది. దీనివల్ల పనులు నిలిచిపోయే సమయం గంటల మేర తగ్గవచ్చు.

4. చట్టపరమైన వ్యవహారాలు, నియమానుగుణత

చట్టపరమైన అన్వేషణలో లక్షలాది స్కాన్ చేసిన పేజీలను సమీక్షించాల్సి ఉంటుంది. అందులో వెతికే “సూది” తరచూ ఒక దృశ్య గుర్తుగా ఉంటుంది.

  • పని విధానం: నియమానుగుణత అధికారి “CFO సంతకం చేసిన పత్రాలు” లేదా “అధికారిక ‘రహస్యం’ ముద్ర ఉన్న ఒప్పందాలు” అని శోధించవచ్చు.

  • మార్పు: సంతకాలు లేదా ముద్రల దృశ్య ఉనికి ఆధారంగా ముసాయిదా, తుది పత్రం మధ్య తేడాను మోడల్ గుర్తిస్తుంది. కేవలం OCR తరచూ గుర్తించలేని అంశమిది.

ప్రారంభించడం

ColQwen3 ఓపెన్-వెయిట్స్ (Apache 2.0)తో ఇప్పుడు Hugging Faceలో అందుబాటులో ఉంది. ఆధునిక RAG పైప్‌లైన్‌లకు నేరుగా జోడించగల అప్‌గ్రేడ్‌గా దీన్ని రూపొందించాము. వచనం, చిత్రాలు, వీడియోను వెంటనే ప్రాసెస్ చేయడానికి అవసరమైన ఇన్‌ఫరెన్స్ కోడ్‌ను ఇది అందిస్తుంది.

సాధారణ వచన శోధనను అధిగమించి, తమ దృశ్య వనరుల్లో చిక్కుకుపోయిన ఇంటెలిజెన్స్‌ను వెలికితీయడానికి సిద్ధంగా ఉన్న సంస్థలకు ఇదే కొత్త ప్రమాణం.

తదుపరి దశ: మోడల్ కార్డ్‌ను పరిశీలించి, Hugging Faceలో ప్రత్యక్ష ప్రదర్శనను ప్రయత్నించండి: /-colqwen3-embed-8b మరియు /-colqwen3-embed-4b

రచయిత

Xin Huang, Kye Min Tan