గత రెండేళ్లుగా “RAG” (రిట్రీవల్-ఆగ్మెంటెడ్ జనరేషన్) దాదాపు పూర్తిగా వచనానికి పర్యాయపదంగా మారింది. ప్రామాణిక విధానం సరళమైనది: పత్రాలను తీసుకుని, వచనాన్ని వెలికితీసి, భాగాలుగా విభజించి, సూచీకరించడం.
కానీ సంస్థాగత ప్రపంచం సాధారణ వచన ఫైళ్లపై నడవదు. అది సంక్లిష్ట PDFలు, సాంద్రమైన చార్ట్లతో కూడిన స్లైడ్ సమాహారాలు, CAD చిత్రాలు, స్కాన్ చేసిన ఇన్వాయిస్లు, రోజురోజుకూ పెరుగుతున్న భారీ వీడియో ఆర్కైవ్లపై ఆధారపడి ఉంటుంది.
చిత్రాన్ని ఎంబెడ్ చేయడానికి ముందు OCR లేదా విజన్ LLMలతో దానికి వచన “వివరణ” రూపొందించే పరిశ్రమ ప్రమాణ పద్ధతి భారీ అవరోధంగా మారింది. ఇది నెమ్మదిగా, ఖరీదుగా ఉండటంతోపాటు అసలు డేటాలోని సమృద్ధమైన ప్రాదేశిక, దృశ్య సందర్భాన్ని తప్పనిసరిగా కోల్పోతుంది. సంక్లిష్ట దృశ్యాన్ని మీ AI కేవలం “ఒక బ్లూప్రింట్” అని వర్ణిస్తే, అందులోని నిర్దిష్ట వాల్వ్ లేదా వైరింగ్ స్కీమాటిక్ను వెతికే సామర్థ్యాన్ని మీరు కోల్పోయినట్లే.
ఎండ్-టు-ఎండ్ దృశ్య రిట్రీవల్ను సాధ్యం చేయడం ద్వారా ఈ సమస్యను పరిష్కరించేందుకు రూపొందించిన ColPali నిర్మాణంపై ఆధారపడిన అత్యాధునిక బహుళమాధ్యమ ఎంబెడ్డింగ్ మోడళ్ల శ్రేణిని నేడు విడుదల చేస్తున్నాము.
నిజంగా సమర్థవంతమైన బహుళమాధ్యమ రిట్రీవర్ను రూపొందించడం అంటే సిద్ధంగా లభించే విజన్-లాంగ్వేజ్ మోడల్ను (VLM) తీసుకుని శోధించమని అడగడం అంత సులభం కాదు. చారిత్రకంగా బహుళమాధ్యమ RAGను వెనక్కి లాగిన సవాళ్లను పరిష్కరించి ColQwen3ను రూపొందించేందుకు, మేము మోడల్ విలీనం, శిక్షణ వ్యూహాలను ఉపయోగించాము.
ప్రాథమిక మోడల్ను మొదటి నుంచి ఫైన్-ట్యూన్ చేయడానికి బదులు, ఇప్పటికే ఉన్న వచన ఎంబెడ్డింగ్ మోడల్ నుంచి రిట్రీవల్ పనుల జ్ఞానాన్ని బదిలీ చేసే పద్ధతిని రూపొందించాము. ప్రామాణిక VLMకు చిత్రాలను ఎలా వర్ణించాలో తెలుసు. కానీ ప్రశ్నకు అనుగుణంగా అర్థపరంగా వాటికి ర్యాంక్ ఇవ్వడం తప్పనిసరిగా తెలియదు.
ఈ అంతరాన్ని పూడ్చేందుకు సర్దుబాటు చేసిన విలీన వెయిటింగ్ వ్యూహాలను ఉపయోగించాము. వచన గుప్త ప్రదేశంలోని Qwen3-Embedding రిట్రీవల్ సామర్థ్యాన్ని నేరుగా బహుళమాధ్యమ ప్రదేశానికి బదిలీ చేయవచ్చని మా ప్రయోగాల్లో గుర్తించాము. తక్షణ శిక్షణ లేకుండానే ఇది చిత్రం, వీడియో రిట్రీవల్కు సాధారణీకరించింది. ఈ సమర్థవంతమైన ప్రారంభీకరణను బలమైన పునాదిగా ఉపయోగించి, పనితీరును మరింత మెరుగుపరచడానికి, పటిష్ఠతను నిర్ధారించడానికి మోడల్ను ఫైన్-ట్యూన్ చేశాము. Qwen3-VL ప్రాథమిక మోడల్ నుంచి ఫైన్-ట్యూన్ చేయడంతో పోలిస్తే ఇది తుది రిట్రీవల్ పనితీరును మెరుగుపరుస్తుంది.
ఎంబెడ్డింగ్ సామర్థ్యాలను బదిలీ చేసిన తర్వాత, మేము సమన్వయంపై దృష్టి పెట్టాము. రిట్రీవల్ పనితీరును గరిష్ఠం చేసేందుకు సరైన ఎపోక్ల సంఖ్య, బ్యాచ్ పరిమాణం, అభ్యాస రేటు, LoRA ర్యాంక్, డేటాసెట్ల మిశ్రమంతో సహా హైపర్-పారామీటర్ శోధనలు, అబ్లేషన్ అధ్యయనాలను జాగ్రత్తగా నిర్వహించాము.
ఫైన్-ట్యూనింగ్ డేటాసెట్లుగా VDR, ColPali శిక్షణ సమితి, visrag_syn, మరియు visrag_indను ఎంచుకున్నాము. ఫైన్-ట్యూనింగ్ కోసం UniMax శాంప్లింగ్ను ఉపయోగించాము. మోడల్ విలీనాన్ని వర్తింపజేయడం వల్ల విలీనమైన ప్రాథమిక మోడల్ ఇప్పటికే పాక్షిక బహుళమాధ్యమ రిట్రీవర్ సామర్థ్యాన్ని పొందింది. మరిన్ని డేటాసెట్లకు పెంచితే పనితీరు కొద్దిగా తగ్గుతుందని గుర్తించాము. అందువల్ల మరిన్ని డేటాసెట్లకు విస్తరించలేదు.
ఫైన్-ట్యూనింగ్ కోసం మేము ఎంచుకున్న హైపర్-పారామీటర్లు ఇవి:
LoRA ర్యాంక్ | 32 |
LoRA ఆల్ఫా | 32 |
LoRA లక్ష్య మాడ్యూల్లు | ఎంబెడ్డింగ్ మినహా చిత్రం, వచనం రెండింటి అన్ని లేయర్లు |
అభ్యాస రేటు | 5e-5 |
గరిష్ఠ దృశ్య టోకెన్లు | 1280 |
శిక్షణ ఎపోక్లు | 1 |
గ్లోబల్ బ్యాచ్ పరిమాణం | 512 |
వార్మప్ నిష్పత్తి | 5% |
చారిత్రకంగా, “ColBERT-శైలి” టోకెన్-స్థాయి ఎంబెడ్డింగ్లను ఉపయోగించే మోడళ్లు (ColPali వంటివి) అద్భుతమైన పనితీరును అందించినా, వాటి నిల్వ ఖర్చు భరించలేనంతగా ఉండేది. ప్రతి దృశ్య టోకెన్ను సూచీకరించడం వల్ల సంస్థాగత స్థాయిలో భరించలేనంత ఖరీదైన భారీ వెక్టర్ డేటాబేస్లు ఏర్పడ్డాయి.
అనుకూలీకరణ వ్యూహం: గరిష్ఠ పనితీరును నిలుపుకుంటూనే నిల్వ ఖర్చులు విపరీతంగా పెరగకుండా, మా ఎంబెడ్డింగ్ల పరిమాణాన్ని జాగ్రత్తగా సమతుల్యం చేసి నిల్వ సవాలును పరిష్కరించాము. ఈ సమర్థవంతమైన పరిమాణంలో SOTA ఖచ్చితత్వాన్ని కొనసాగించేందుకు, రిట్రీవల్ పనితీరు, నిల్వ ఖర్చుల మధ్య ఉత్తమ సమతుల్యత కోసం డైమెన్షన్ పరిమాణాన్ని 320గా ఎంచుకున్నాము.
ప్రామాణిక పద్ధతి: 10 లక్షల చిత్రాల ఎంబెడ్డింగ్లను నిల్వ చేయడానికి సాధారణ పద్ధతికి (NVIDIA Nemo-3B వంటిది) సుమారు 10.3 TB అవసరం (1,802 టోకెన్లు @ 3,072 డైమెన్షన్లు).
ColQwen3: అదే 10 లక్షల చిత్రాలను కేవలం 0.82 TBలో నిల్వ చేస్తుంది (గరిష్ఠంగా 1,280 టోకెన్లు @ 320 డైమెన్షన్లు).
క్లౌడ్ మౌలిక సదుపాయాల బడ్జెట్ను విపరీతంగా పెంచకుండానే ColQwen3 SOTA రిట్రీవల్ ఖచ్చితత్వాన్ని సాధిస్తుంది.
మా విధానాన్ని ViDoRe బెంచ్మార్క్ సమాహారంపై ధ్రువీకరించాము. తాజా V3, V2 బెంచ్మార్క్లలో (ఆంగ్లం, బహుభాషా రెండింటిలోనూ) ColQwen3 కొత్త ప్రమాణాలను నెలకొల్పడంతోపాటు, పాత V1 పనుల్లో అగ్రశ్రేణి పనితీరును కొనసాగిస్తోందని ఫలితాలు నిర్ధారించాయి.
ఆంగ్ల, బహుభాషా రిట్రీవల్లో ColQwen3-8B అగ్రస్థానంలో ఉంది.
ఆంగ్ల nDCG@5
మోడల్ | కంప్యూటర్ సైన్స్ | ఇంధనం | ఆర్థికం | మానవ వనరులు | పరిశ్రమ | ఔషధ రంగం | భౌతికశాస్త్రం | సగటు |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
బహుభాషా nDCG@5
మోడల్ | కంప్యూటర్ సైన్స్ | ఇంధనం | ఆర్థికం | మానవ వనరులు | పరిశ్రమ | ఔషధ రంగం | భౌతికశాస్త్రం | సగటు |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, ఆర్థికశాస్త్రం, DocVQA అంతటా స్థిరమైన అధిక పనితీరు.
బెంచ్మార్క్ | మోడల్ | స్కోర్ (సగటు) | ప్రధాన విజయం |
ViDoRe V2 (ఆంగ్లం) | ColQwen3-8B | 0.6772 | ESG & BioMedలో #1 |
ViDoRe V2 (బహుభాషా) | ColQwen3-8B | 0.6085 | ఆర్థికశాస్త్రంలో #1 |
ViDoRe V1 (ఆంగ్లం) | Nemo ColEmbed 3B | 0.9100 | కొద్దిగా ఎక్కువ సగటు |
ViDoRe V1 (ఆంగ్లం) | ColQwen3-8B | 0.9076 | ArxivQA & Syn-Govలో #1 |
వీడియో రిట్రీవల్కు ColQwen3 సమర్థంగా సాధారణీకరిస్తుందని చూపేందుకు, టెక్స్ట్-టు-వీడియో (సాధారణ రిట్రీవల్) పనుల కోసం CareBench బెంచ్మార్క్పై మోడళ్లను మూల్యాంకనం చేశాము.
ఈ మూల్యాంకనంలో ముడి వీడియో ఎన్కోడింగ్ విధానాన్ని ఉపయోగించాము. అదనపు వచన వివరణలు లేదా మెటాడేటా ఇన్పుట్లు లేకుండా మా మోడళ్లు వీడియో ఫైళ్లను నేరుగా ఎన్కోడ్ చేశాయి. కేవలం దృశ్య అర్థాల ఆధారంగానే రిట్రీవల్ చేయగల మోడల్ సామర్థ్యాన్ని ఇది స్పష్టం చేస్తుంది.
మోడల్ | రీకాల్@1 | రీకాల్@5 | రీకాల్@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
వీడియోను కూడా పత్రాల మాదిరిగానే పరిగణించగలగడం ColQwen3 సాధ్యం చేసిన అత్యంత ప్రభావవంతమైన మార్పుల్లో ఒకటి. అనేక సంస్థల్లో వీడియో “డార్క్ డేటా”గా ఉంటుంది. ప్రతి ఫైల్కు ఎవరైనా స్వయంగా ట్యాగ్లు జోడించకపోతే, అది కోల్డ్ స్టోరేజ్లో శోధించలేని స్థితిలోనే ఉండిపోతుంది.
విభజించిన క్లిప్లలో ఫ్రేమ్లవారీగా రిట్రీవల్ను సాధ్యం చేసి ColQwen3 ఈ పరిస్థితిని మారుస్తుంది.
సంస్థలు ప్రతిరోజూ వేల గంటల అంతర్గత వీడియో సమావేశాలను రికార్డ్ చేస్తాయి. సాధారణంగా ఈ రికార్డింగ్లు ఎవరికీ అందకుండా మిగిలిపోతాయి.
పని విధానం: సుదీర్ఘ సమావేశ రికార్డింగ్లను స్వయంచాలకంగా చిన్న, తార్కిక క్లిప్లుగా విభజించి, ColQwen3తో సూచీకరించడం ద్వారా శోధించగల “సంస్థాగత జ్ఞాపకాన్ని” సృష్టించవచ్చు.
ప్రశ్న: ప్రాజెక్ట్ మేనేజర్ ఇలా అడగవచ్చు: “APIలోని జాప్య సమస్యను ఇంజినీరింగ్ లీడ్ వివరించిన క్లిప్ను చూపించు.”
ఫలితం: 60 నిమిషాల వీడియో ఫైల్ను చూపడానికి బదులు, ఆ నిర్దిష్ట రేఖాచిత్రాన్ని తెరపై చూపించి చర్చించిన ఖచ్చితమైన 45 సెకన్ల భాగాన్ని సిస్టమ్ వెలికితీస్తుంది. ఆ క్షణంలో వక్తలు “జాప్యం” అనే పదాన్ని స్పష్టంగా చెప్పకపోయినా ఇది సాధ్యమవుతుంది.
స్థానిక బహుళమాధ్యమ ఎంబెడ్డింగ్కు మారడం పరిశ్రమలన్నింటిలో పూర్తిగా కొత్త పని విధానాలను సాధ్యం చేస్తుంది. అత్యంత సంక్లిష్టమైన కొన్ని సంస్థాగత డేటా వాతావరణాలతో పోల్చి ఈ మోడల్ను విస్తృతంగా బెంచ్మార్క్ చేశాము.
మాస్టర్ ప్లాన్లు, జోనింగ్ మ్యాప్లు, సంక్లిష్ట వాస్తు ఎలివేషన్ల భారీ భాండాగారాలను నిర్వహించే పట్టణ సలహా సంస్థలు ఎదుర్కొనే డేటా సవాళ్లపై ColQwen3ను పరీక్షించాము.
సవాలు: ఈ వాతావరణాల్లో సంప్రదాయ RAG పైప్లైన్లు ఇబ్బంది పడతాయి. OCR సాధనాలు సంక్లిష్ట సైట్ ప్లాన్లను సాధారణంగా “స్కీమాటిక్” అని మాత్రమే వర్ణిస్తాయి. దీంతో ట్రాఫిక్ ప్రవాహం, హరిత మండలాలు లేదా భవనాల వెనుకంజ దూరాల వంటి కీలక వివరాలు తప్పిపోతాయి.
పనితీరు: ఖరీదైన OCR/క్యాప్షనింగ్ ముందస్తు ప్రాసెసింగ్ అవసరాన్ని ColQwen3 సమర్థంగా తొలగిస్తుందని మా అంతర్గత బెంచ్మార్క్లు చూపుతున్నాయి. అధిక సాంద్రత గల వాస్తు చిత్రాల పరీక్షల్లో, పాదచారుల ప్రవేశ మార్గాలు లేదా స్పష్టమైన జోనింగ్ సరిహద్దుల వంటి నిర్దిష్ట దృశ్య గుర్తుల ఆధారంగా మోడల్ పత్రాలను విజయవంతంగా వెలికితీసింది. ఇది వచన-ఆధారిత ప్రామాణిక పద్ధతుల కంటే గణనీయంగా మెరుగైన పనితీరు చూపడంతోపాటు, జ్ఞానాన్ని చేర్చే ఖర్చులను భారీగా తగ్గించే అవకాశాన్ని అందిస్తుంది.
పెట్టుబడి బ్యాంకర్లు, విశ్లేషకులు వార్షిక నివేదికలు, పెట్టుబడిదారుల స్లైడ్ సమాహారాలను పరిశీలించడానికి వేల గంటలు వెచ్చిస్తారు.
పని విధానం: విశ్లేషకుడు ఇలా అడగవచ్చు: “2024 స్లైడ్ సమాహారాల్లో APAC ఆదాయం, EMEA ఆదాయం విభజనను కనుగొను.”
మార్పు: కీలకపదాల సరిపోలికపై ఆధారపడటానికి బదులు, నిర్దిష్ట డేటా విజువలైజేషన్ దృశ్యరూపం ఆధారంగా మోడల్ ఖచ్చితమైన స్లైడ్ను వెలికితీస్తుంది. దీనివల్ల RAG సిస్టమ్ అత్యంత ఖచ్చితంగా సమాధానాలు ఇవ్వగలదు.
తయారీ సంస్థల వద్ద సాంకేతిక మాన్యువల్లు, పైపింగ్ రేఖాచిత్రాల (P&IDలు) భారీ భాండాగారాలు ఉంటాయి.
పని విధానం: టర్బైన్ను మరమ్మతు చేస్తున్న క్షేత్ర ఇంజినీర్ ఒక భాగాన్ని ఫొటో తీసి లేదా “హైడ్రాలిక్ పంప్ అసెంబ్లీ వైరింగ్ రేఖాచిత్రాన్ని చూపించు” అని అడగవచ్చు.
మార్పు: వైరింగ్ రేఖాచిత్రపు దృశ్య రూపాన్ని ColQwen3 గుర్తించి, సరైన పేజీని వెలికితీస్తుంది. దీనివల్ల పనులు నిలిచిపోయే సమయం గంటల మేర తగ్గవచ్చు.
చట్టపరమైన అన్వేషణలో లక్షలాది స్కాన్ చేసిన పేజీలను సమీక్షించాల్సి ఉంటుంది. అందులో వెతికే “సూది” తరచూ ఒక దృశ్య గుర్తుగా ఉంటుంది.
పని విధానం: నియమానుగుణత అధికారి “CFO సంతకం చేసిన పత్రాలు” లేదా “అధికారిక ‘రహస్యం’ ముద్ర ఉన్న ఒప్పందాలు” అని శోధించవచ్చు.
మార్పు: సంతకాలు లేదా ముద్రల దృశ్య ఉనికి ఆధారంగా ముసాయిదా, తుది పత్రం మధ్య తేడాను మోడల్ గుర్తిస్తుంది. కేవలం OCR తరచూ గుర్తించలేని అంశమిది.
ColQwen3 ఓపెన్-వెయిట్స్ (Apache 2.0)తో ఇప్పుడు Hugging Faceలో అందుబాటులో ఉంది. ఆధునిక RAG పైప్లైన్లకు నేరుగా జోడించగల అప్గ్రేడ్గా దీన్ని రూపొందించాము. వచనం, చిత్రాలు, వీడియోను వెంటనే ప్రాసెస్ చేయడానికి అవసరమైన ఇన్ఫరెన్స్ కోడ్ను ఇది అందిస్తుంది.
సాధారణ వచన శోధనను అధిగమించి, తమ దృశ్య వనరుల్లో చిక్కుకుపోయిన ఇంటెలిజెన్స్ను వెలికితీయడానికి సిద్ధంగా ఉన్న సంస్థలకు ఇదే కొత్త ప్రమాణం.
తదుపరి దశ: మోడల్ కార్డ్ను పరిశీలించి, Hugging Faceలో ప్రత్యక్ష ప్రదర్శనను ప్రయత్నించండి: /-colqwen3-embed-8b మరియు /-colqwen3-embed-4b