گزشتہ دو برسوں سے ”RAG“، یعنی بازیافت سے تقویت یافتہ تخلیق، تقریباً صرف متن کا مترادف رہا ہے. معیاری طریقہ سادہ ہے: دستاویزات لیں، متن نکالیں، اسے حصوں میں تقسیم کریں اور اشاریہ بنائیں.
مگر ادارہ جاتی دنیا سادہ متنی فائلوں پر نہیں چلتی. وہ پیچیدہ PDF، گنجان چارٹوں والی پیشکشوں، CAD نقشوں، اسکین شدہ رسیدوں اور تیزی سے بڑھتے ویڈیو ذخائر پر چلتی ہے.
ادغام سے پہلے OCR یا بصری LLM کے ذریعے تصویر کو متن میں ”بیان“ کرنے کا صنعتی معیار ایک بہت بڑی رکاوٹ ہے. یہ سست اور مہنگا ہے، اور اصل ڈیٹا کا بھرپور مکانی اور بصری سیاق لازماً کھو دیتا ہے. اگر آپ کی AI کسی پیچیدہ منظر کو صرف ”ایک نقشہ“ کہتی ہے تو آپ اس کے اندر موجود مخصوص صمام یا برقی تاروں کا خاکہ تلاش نہیں کر سکتے.
آج ہم ColPali ساخت پر مبنی جدید ترین کثیر طرز ادغام ماڈلز کا مجموعہ جاری کر رہے ہیں، جو سراسر بصری بازیافت ممکن بنا کر یہ مسئلہ حل کرنے کے لیے تیار کیا گیا ہے.
واقعی مؤثر کثیر طرز بازیافت کنندہ بنانا اتنا سادہ نہیں کہ تیار شدہ بصری لسانی ماڈل (VLM) لے کر اسے تلاش کرنے کا کہہ دیا جائے. کثیر طرز RAG کو تاریخی طور پر محدود رکھنے والے مسائل حل کرنے اور ColQwen3 بنانے کے لیے ہم نے ماڈل انضمام اور تربیتی حکمت عملیاں استعمال کیں.
بنیادی ماڈل کو ابتدا سے باریک موافق کرنے کے بجائے ہم نے موجودہ متنی ادغام ماڈل سے بازیافتی کاموں کا علم منتقل کرنے کا طریقہ بنایا. معیاری VLM تصاویر بیان کرنا جانتا ہے، مگر ضروری نہیں کہ وہ کسی استفسار کے مقابلے میں مفہوم کے لحاظ سے ان کی درجہ بندی بھی کر سکے.
اس خلا کو پُر کرنے کے لیے ہم نے موافق کردہ ادغامی اوزان کی حکمت عملیاں استعمال کیں. اپنے تجربات میں ہم نے پایا کہ متنی مخفی فضا میں Qwen3-Embedding کی بازیافتی صلاحیت براہ راست کثیر طرز فضا میں منتقل کی جا سکتی ہے اور فوری تربیت کے بغیر بھی تصویر اور ویڈیو بازیافت پر عمومی اطلاق کرتی ہے. اس مؤثر ابتدائی تشکیل کو مضبوط نقطۂ آغاز بنا کر ہم نے کارکردگی مزید بہتر اور مضبوطی یقینی بنانے کے لیے ماڈل کو باریک موافق کیا. یہ Qwen3-VL بنیادی ماڈل سے باریک موافقت کے مقابلے میں حتمی بازیافتی کارکردگی بہتر بناتا ہے.
ادغامی صلاحیتیں منتقل ہونے کے بعد ہم نے ہم آہنگی پر توجہ دی. بازیافتی کارکردگی زیادہ سے زیادہ کرنے کے لیے ہم نے بالائی متغیرات کی محتاط تلاش اور اخراجی مطالعات کیے، جن میں ادوار کی بہترین تعداد، بیچ حجم، شرحِ تعلم، LoRA درجہ اور ڈیٹا مجموعوں کا امتزاج شامل تھا.
باریک موافقت کے ڈیٹا مجموعوں کے طور پر ہم نے VDR، ColPali تربیتی مجموعہ، visrag_syn، اور visrag_ind منتخب کیے. باریک موافقت کے لیے ہم نے UniMax نمونہ بندی استعمال کی. چونکہ ہم نے ماڈل انضمام استعمال کیا اور بنیادی ادغام شدہ ماڈل پہلے ہی جزوی کثیر طرز بازیافتی صلاحیت رکھتا ہے، اس لیے ہم نے پایا کہ مزید ڈیٹا مجموعے شامل کرنے سے کارکردگی قدرے کم ہوتی ہے؛ چنانچہ ہم نے ان کی تعداد نہیں بڑھائی.
باریک موافقت کے لیے ہمارے منتخب کردہ بالائی متغیرات یہ ہیں:
LoRA درجہ | 32 |
LoRA الفا | 32 |
LoRA ہدفی ماڈیول | ادغام کے سوا تصویر اور متن، دونوں کی تمام پرتیں |
شرحِ تعلم | 5e-5 |
زیادہ سے زیادہ بصری ٹوکن | 1280 |
تربیتی ادوار | 1 |
مجموعی بیچ حجم | 512 |
ابتدائی تیاری کا تناسب | 5% |
تاریخی طور پر ”ColBERT طرز“ کے ٹوکن سطحی ادغام استعمال کرنے والے ماڈلز، جیسے ColPali، شاندار کارکردگی دیتے تھے مگر ذخیرے کی لاگت ناقابل برداشت تھی. ہر بصری ٹوکن کی اشاریہ سازی سے ایسے بڑے سمتیہ ڈیٹا بیس بنتے تھے جو ادارہ جاتی پیمانے پر بہت مہنگے تھے.
بہتری کی حکمت عملی: ہم نے اپنے ادغام کا حجم احتیاط سے متوازن کرکے ذخیرے کا مسئلہ حل کیا، تاکہ زیادہ سے زیادہ کارکردگی برقرار رہے اور ذخیرے کی لاگت بے قابو نہ ہو. اس مؤثر حجم میں جدید ترین درستگی برقرار رکھنے کے لیے ہم نے بازیافتی کارکردگی اور ذخیرے کی لاگت کے بہترین توازن کی خاطر بُعد کا حجم 320 منتخب کیا.
بنیادی معیار: معیاری طریقے، جیسے NVIDIA Nemo-3B، کو 10 لاکھ تصاویر کے ادغام محفوظ کرنے کے لیے تقریباً 10.3 TB درکار ہوتے ہیں (1,802 ٹوکن @ 3,072 ابعاد).
ColQwen3: یہی 10 لاکھ تصاویر صرف 0.82 TB میں محفوظ کرتا ہے (زیادہ سے زیادہ 1,280 ٹوکن @ 320 ابعاد).
ColQwen3 بادل بنیادی ڈھانچے کا بجٹ بڑھائے بغیر جدید ترین بازیافتی درستگی حاصل کرتا ہے.
ہم نے ViDoRe بینچ مارک مجموعے پر اپنے طریقۂ کار کی توثیق کی. نتائج تصدیق کرتے ہیں کہ ColQwen3 جدید ترین V3 اور V2 بینچ مارکس، انگریزی اور کثیر لسانی دونوں، پر نئے معیار قائم کرتا ہے، جبکہ پرانے V1 کاموں پر اعلیٰ درجے کی کارکردگی برقرار رکھتا ہے.
ColQwen3-8B انگریزی اور کثیر لسانی بازیافت میں سب سے آگے ہے.
انگریزی nDCG@5
ماڈل | کمپیوٹر سائنس | توانائی | مالیات | انسانی وسائل | صنعت | ادویہ سازی | طبیعیات | اوسط |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
کثیر لسانی nDCG@5
ماڈل | کمپیوٹر سائنس | توانائی | مالیات | انسانی وسائل | صنعت | ادویہ سازی | طبیعیات | اوسط |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG، معاشیات اور DocVQA میں مسلسل اعلیٰ کارکردگی.
بینچ مارک | ماڈل | اسکور (اوسط) | نمایاں کامیابی |
ViDoRe V2 (انگریزی) | ColQwen3-8B | 0.6772 | ESG اور BioMed میں پہلا مقام |
ViDoRe V2 (کثیر لسانی) | ColQwen3-8B | 0.6085 | معاشیات میں پہلا مقام |
ViDoRe V1 (انگریزی) | Nemo ColEmbed 3B | 0.9100 | قدرے زیادہ اوسط |
ViDoRe V1 (انگریزی) | ColQwen3-8B | 0.9076 | ArxivQA اور Syn-Gov میں پہلا مقام |
یہ ثابت کرنے کے لیے کہ ColQwen3 ویڈیو بازیافت پر بھی مؤثر انداز میں عمومی اطلاق کرتا ہے، ہم نے متن سے ویڈیو کے کاموں (عمومی بازیافت) کے لیے CareBench بینچ مارک پر ماڈلز کا جائزہ لیا.
اس جائزے میں ہم نے خام ویڈیو رمز بندی کا طریقہ اپنایا: ہمارے ماڈلز نے کسی اضافی متنی تشریح یا میٹا ڈیٹا کے بغیر ویڈیو فائلوں کو براہ راست رمز بند کیا. یہ صرف بصری مفہوم کی بنیاد پر بازیافت کرنے کی ماڈل کی صلاحیت نمایاں کرتا ہے.
ماڈل | بازیابی@1 | بازیابی@5 | بازیابی@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 سے آنے والی سب سے اہم تبدیلیوں میں سے ایک یہ ہے کہ یہ ویڈیو کو بھی دستاویزات کی طرح برت سکتا ہے. بہت سے اداروں میں ویڈیو ”تاریک ڈیٹا“ ہوتی ہے. وہ سرد ذخیرے میں پڑی رہتی ہے اور اس وقت تک بالکل ناقابل تلاش ہوتی ہے جب تک کوئی شخص ہر فائل کو دستی طور پر ٹیگ نہ کرے.
ColQwen3 منقسم کلپس میں فریم بہ فریم بازیافت ممکن بنا کر یہ صورت حال بدل دیتا ہے.
ادارے ہر روز ہزاروں گھنٹوں کی داخلی ویڈیو میٹنگز ریکارڈ کرتے ہیں، مگر عموماً یہ ریکارڈنگز گمنامی میں کھو جاتی ہیں.
عملی طریقہ: طویل میٹنگ ریکارڈنگز کو خودکار طور پر مختصر، منطقی کلپس میں تقسیم کرکے اور ColQwen3 سے ان کی اشاریہ سازی کرکے آپ قابل تلاش ”ادارہ جاتی یادداشت“ بنا سکتے ہیں.
استفسار: منصوبہ منتظم پوچھ سکتا ہے: ”وہ کلپ دکھائیں جس میں انجینئرنگ سربراہ نے API میں تاخیر کا مسئلہ سمجھایا تھا.“
نتیجہ: 60 منٹ کی ویڈیو فائل دینے کے بجائے نظام عین وہ 45 سیکنڈ کا حصہ بازیافت کرتا ہے جس میں مخصوص خاکہ اسکرین پر دکھا کر زیر بحث لایا گیا تھا، خواہ مقررین نے اسی لمحے ”تاخیر“ کا لفظ واضح طور پر نہ کہا ہو.
مقامی کثیر طرز ادغام کی جانب پیش رفت تمام صنعتوں میں بالکل نئے عملی طریقوں کی راہ کھولتی ہے. ہم نے بعض انتہائی پیچیدہ ادارہ جاتی ڈیٹا ماحول کے مقابلے میں اس ماڈل کی وسیع پیمانے پر بینچ مارک جانچ کی ہے.
ہم نے ColQwen3 کو شہری مشاورتی اداروں کے درپیش ڈیٹا مسائل پر آزمایا، جو جامع منصوبوں، زوننگ نقشوں اور پیچیدہ تعمیراتی بلندیوں کے بڑے ذخائر سنبھالتے ہیں.
مسئلہ: ان ماحول میں روایتی RAG سلسلہ ہائے عمل مشکلات کا شکار ہوتے ہیں. OCR آلات عموماً پیچیدہ مقامی منصوبوں کو صرف ”خاکہ“ قرار دیتے ہیں اور آمدورفت، سبز علاقوں یا عمارتوں کے فاصلے جیسی اہم تفصیلات کھو دیتے ہیں.
کارکردگی: ہمارے داخلی بینچ مارکس ظاہر کرتے ہیں کہ ColQwen3 مہنگی OCR یا توضیحی پیش کاری کی ضرورت مؤثر طور پر ختم کر دیتا ہے. گنجان تعمیراتی نقشوں کے تجربات میں ماڈل نے پیدل رسائی کے مقامات یا منفرد زوننگ حدود جیسے مخصوص بصری نشانات کی بنیاد پر دستاویزات کامیابی سے بازیافت کیں، متن تک محدود بنیادی طریقوں سے نمایاں بہتر کارکردگی دکھائی اور معلومات شامل کرنے کی لاگت میں بڑی کمی کی امید دلائی.
سرمایہ کاری بینکار اور تجزیہ کار سالانہ رپورٹوں اور سرمایہ کاروں کی پیشکشوں کو چھاننے میں ہزاروں گھنٹے صرف کرتے ہیں.
عملی طریقہ: تجزیہ کار پوچھ سکتا ہے، ”2024 کی پیشکشوں سے APAC اور EMEA کی آمدنی کی تفصیلی تقسیم تلاش کریں.“
تبدیلی: کلیدی الفاظ کی مماثلت پر انحصار کرنے کے بجائے ماڈل مخصوص ڈیٹا منظر نگاری کی بصری موجودگی کی بنیاد پر عین سلائیڈ بازیافت کرتا ہے، جس سے RAG نظام انتہائی درست جواب دے سکتا ہے.
پیداواری اداروں کے پاس فنی کتابچوں اور پائپنگ خاکوں (P&IDs) کے وسیع ذخائر ہوتے ہیں.
عملی طریقہ: ٹربائن درست کرنے والا میدانی انجینئر کسی پرزے کی تصویر لے سکتا ہے یا پوچھ سکتا ہے، ”ہائیڈرولک پمپ مجموعے کے لیے برقی تاروں کا خاکہ دکھائیں.“
تبدیلی: ColQwen3 برقی تاروں کے خاکے کی بصری نمائندگی شناخت کرکے درست صفحہ بازیافت کرتا ہے، جس سے ممکنہ طور پر تعطل کئی گھنٹے کم ہو سکتا ہے.
قانونی دریافت میں لاکھوں اسکین شدہ صفحات کا جائزہ شامل ہوتا ہے، جہاں مطلوبہ چیز اکثر کوئی بصری نشان ہوتی ہے.
عملی طریقہ: تعمیل افسر ”مالیاتی سربراہ کے دستخط شدہ دستاویزات“ یا ”سرکاری ’خفیہ‘ مہر والے معاہدے“ تلاش کر سکتا ہے.
تبدیلی: ماڈل دستخط یا مہروں کی بصری موجودگی سے مسودے اور حتمی دستاویز میں فرق کرتا ہے، جو خالص OCR اکثر نہیں پکڑ پاتا.
ColQwen3 کے اوزان کھلے ہیں (Apache 2.0) اور یہ اب Hugging Face پر دستیاب ہے. ہم نے اسے جدید RAG سلسلہ ہائے عمل کے لیے فوری متبادل کے طور پر بنایا ہے اور متن، تصاویر اور ویڈیو فوراً سنبھالنے کے لیے ضروری استنتاجی رمز فراہم کیا ہے.
سادہ متنی تلاش سے آگے بڑھ کر اپنے بصری اثاثوں میں پوشیدہ انٹیلیجنس تک رسائی کے لیے تیار اداروں کے واسطے یہی نیا معیار ہے.
اگلا قدم: ماڈل کارڈ دیکھیں اور Hugging Face پر براہ راست نمونہ آزمائیں: /-colqwen3-embed-8b اور /-colqwen3-embed-4b