على مدى العامين الماضيين، كاد مصطلح «RAG» (التوليد المعزز بالاسترجاع) أن يقتصر على النصوص. النهج المعتاد بسيط: خذ المستندات، واستخرج النص، وقسّمه إلى أجزاء، ثم افهرسه.
لكن عالم المؤسسات لا يعتمد على الملفات النصية البسيطة. بل يعتمد على ملفات PDF معقدة، وعروض تقديمية حافلة بالمخططات، ورسومات CAD، وفواتير ممسوحة ضوئيًا، وعلى نحو متزايد أرشيفات ضخمة من تسجيلات الفيديو.
يمثل النهج الشائع في القطاع لمعالجة ذلك، باستخدام OCR أو نماذج اللغة الكبيرة البصرية لتحويل الصورة إلى وصف نصي قبل تضمينها، عنق زجاجة هائلًا. فهو بطيء ومكلف، ويُفقد البيانات الأصلية حتمًا سياقها المكاني والبصري الغني. إذا وصف ذكاؤك الاصطناعي عنصرًا بصريًا معقدًا بأنه مجرد «مخطط هندسي»، فستفقد القدرة على البحث عن صمام محدد أو مخطط توصيلات بداخله.
نطلق اليوم عائلة من أحدث نماذج التضمين متعددة الوسائط، مبنية على بنية ColPali ومصممة لحل هذه المشكلة عبر إتاحة الاسترجاع البصري المتكامل من البداية إلى النهاية.
لا يكفي لبناء نظام استرجاع فعال حقًا متعدد الوسائط أن تأخذ نموذجًا جاهزًا للرؤية واللغة (VLM) وتطلب منه البحث. لحل التحديات التي أعاقت تاريخيًا RAG متعدد الوسائط وإنشاء ColQwen3، استخدمنا استراتيجيات لدمج النماذج وتدريبها.
بدلًا من ضبط نموذج أساسي من الصفر، طورنا طريقة لنقل معرفة مهام الاسترجاع من نموذج تضمين نصي قائم. يعرف نموذج VLM القياسي كيف يصف الصور، لكنه لا يعرف بالضرورة كيف يرتبها دلاليًا وفقًا لاستعلام.
لسد هذه الفجوة، استخدمنا استراتيجيات أوزان دمج مضبوطة. وجدنا في تجاربنا أن قدرة Qwen3-Embedding على الاسترجاع في الفضاء الكامن النصي يمكن نقلها مباشرةً إلى الفضاء متعدد الوسائط، لتعميم الاسترجاع على الصور والفيديو حتى من دون تدريب فوري. ثم استفدنا من هذه التهيئة الفعالة كنقطة انطلاق قوية وضبطنا النموذج بدقة لتحسين الأداء أكثر وضمان المتانة. يحسن ذلك أداء الاسترجاع النهائي مقارنةً بالضبط الدقيق انطلاقًا من نموذج Qwen3-VL الأساسي.
بعد نقل قدرات التضمين، ركزنا على المحاذاة. أجرينا عمليات بحث دقيقة عن المعلمات الفائقة ودراسات استئصال شملت العدد الأمثل لحقب التدريب وحجم الدفعة ومعدل التعلم ورتبة LoRA ومزيج مجموعات البيانات، بهدف تعظيم أداء الاسترجاع.
اخترنا للضبط الدقيق مجموعات البيانات VDR ومجموعة تدريب ColPali وvisrag_syn، وvisrag_ind. استخدمنا أخذ عينات UniMax في الضبط الدقيق. نظرًا إلى استخدامنا دمج النماذج وامتلاك النموذج الأساسي المدمج بالفعل بعض قدرات الاسترجاع متعدد الوسائط، وجدنا أن زيادة مجموعات البيانات تقلل الأداء قليلًا، ولذلك لم نتوسع إلى مجموعات إضافية.
فيما يلي المعلمات الفائقة التي اخترناها للضبط الدقيق:
رتبة LoRA | 32 |
ألفا LoRA | 32 |
الوحدات المستهدفة في LoRA | كل طبقات الصور والنصوص باستثناء التضمين |
معدل التعلم | 5e-5 |
الحد الأقصى للرموز البصرية | 1280 |
حقب التدريب | 1 |
حجم الدفعة الإجمالي | 512 |
نسبة الإحماء | 5% |
قدمت النماذج التي تستخدم تاريخيًا تضمينات على مستوى الرمز بأسلوب «ColBERT»، مثل ColPali، أداءً مذهلًا لكن بتكلفة تخزين باهظة. أدت فهرسة كل رمز بصري إلى إنشاء قواعد بيانات متجهية ضخمة وباهظة التكلفة على نطاق المؤسسات.
استراتيجية التحسين: عالجنا تحدي التخزين عبر الموازنة الدقيقة لحجم التضمينات، للحفاظ على أقصى أداء ومنع تضخم تكاليف التخزين. للحفاظ على دقة رائدة ضمن هذه البصمة الفعالة، اخترنا بعناية بُعدًا حجمه 320 لتحقيق أفضل توازن بين أداء الاسترجاع وتكلفة التخزين.
خط الأساس: يتطلب النهج القياسي، مثل NVIDIA Nemo-3B، نحو 10.3 تيرابايت لتخزين تضمينات مليون صورة (1,802 رمزًا × 3,072 بُعدًا).
ColQwen3: يخزن المليون صورة نفسها في 0.82 تيرابايت فقط (1,280 رمزًا كحد أقصى × 320 بُعدًا).
يحقق ColQwen3 دقة استرجاع رائدة من دون تضخيم ميزانية البنية التحتية السحابية.
تحققنا من صحة نهجنا باستخدام حزمة اختبارات ViDoRe. تؤكد النتائج أن ColQwen3 يضع معايير جديدة في أحدث اختبارات V3 وV2، بالإنجليزية ومتعددة اللغات، مع الحفاظ على أداء رائد في مهام V1 السابقة.
يتصدر ColQwen3-8B الاسترجاع بالإنجليزية ومتعدد اللغات.
nDCG@5 بالإنجليزية
النموذج | علوم الحاسوب | الطاقة | التمويل | الموارد البشرية | الصناعة | الأدوية | الفيزياء | المتوسط |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
nDCG@5 متعدد اللغات
النموذج | علوم الحاسوب | الطاقة | التمويل | الموارد البشرية | الصناعة | الأدوية | الفيزياء | المتوسط |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
أداء مرتفع ومتسق في ESG والاقتصاد وDocVQA.
الاختبار المعياري | النموذج | النتيجة (المتوسط) | إنجاز بارز |
ViDoRe V2 (الإنجليزية) | ColQwen3-8B | 0.6772 | المركز الأول في ESG وBioMed |
ViDoRe V2 (متعدد اللغات) | ColQwen3-8B | 0.6085 | المركز الأول في الاقتصاد |
ViDoRe V1 (الإنجليزية) | Nemo ColEmbed 3B | 0.9100 | متوسط أعلى قليلًا |
ViDoRe V1 (الإنجليزية) | ColQwen3-8B | 0.9076 | المركز الأول في ArxivQA وSyn-Gov |
لإثبات قدرة ColQwen3 القوية على التعميم في استرجاع الفيديو، قيّمنا النماذج باستخدام اختبار CareBench لمهام تحويل النص إلى فيديو (الاسترجاع العام).
استخدمنا في هذا التقييم نهج ترميز الفيديو الخام؛ إذ رمّزت نماذجنا ملفات الفيديو مباشرةً، من دون أي تعليقات نصية إضافية أو مدخلات بيانات وصفية. يبرز ذلك قدرة النموذج على الاسترجاع اعتمادًا على الدلالات البصرية وحدها.
النموذج | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
من أبرز التحولات التي يتيحها ColQwen3 قدرته على التعامل مع الفيديو كما يتعامل مع المستندات. يُعد الفيديو في مؤسسات كثيرة «بيانات مظلمة»؛ إذ يبقى في التخزين البارد ويتعذر البحث فيه تمامًا ما لم يضع شخص وسومًا لكل ملف يدويًا.
يغيّر ColQwen3 ذلك عبر إتاحة الاسترجاع إطارًا بإطار من المقاطع المجزأة.
تسجل المؤسسات يوميًا آلاف الساعات من اجتماعات الفيديو الداخلية، وغالبًا ما تضيع هذه التسجيلات بلا أثر.
سير العمل: عبر تقسيم تسجيلات الاجتماعات الطويلة تلقائيًا إلى مقاطع أقصر ومنطقية وفهرستها باستخدام ColQwen3، تنشئ «ذاكرة مؤسسية» قابلة للبحث.
الاستعلام: يمكن لمدير المشروع أن يطلب: “Show me the clip where the engineering lead explained the latency issue with the API.”
النتيجة: بدلًا من إرجاع ملف فيديو مدته 60 دقيقة، يسترجع النظام المقطع المحدد ومدته 45 ثانية الذي عُرض فيه ذلك المخطط على الشاشة ونوقش، حتى لو لم يقل المتحدثون صراحةً كلمة «زمن الاستجابة» في تلك اللحظة.
يتيح الانتقال إلى التضمين الأصلي متعدد الوسائط مسارات عمل جديدة كليًا في مختلف القطاعات. أجرينا اختبارات معيارية موسعة لهذا النموذج في بعض أكثر بيئات بيانات المؤسسات تعقيدًا.
اختبرنا ColQwen3 في مواجهة تحديات البيانات لدى شركات الاستشارات الحضرية التي تدير مكتبات ضخمة من المخططات الرئيسية وخرائط تقسيم المناطق والواجهات المعمارية المعقدة.
التحدي: تواجه مسارات RAG التقليدية صعوبة في هذه البيئات. عادةً ما تصف أدوات OCR مخططات المواقع المعقدة بكلمة «رسم تخطيطي» فحسب، فتفوتها تفاصيل مهمة عن حركة المرور أو المساحات الخضراء أو ارتدادات المباني.
الأداء: تُظهر اختباراتنا الداخلية أن ColQwen3 يتجاوز بفاعلية الحاجة إلى المعالجة المسبقة المكلفة بتقنيات OCR أو توليد الأوصاف. في اختبارات الرسومات المعمارية عالية الكثافة، نجح النموذج في استرجاع المستندات بناءً على علامات بصرية محددة، مثل نقاط دخول المشاة أو حدود تقسيم المناطق المميزة، متفوقًا بوضوح على خطوط الأساس النصية وواعدًا بخفض كبير في تكاليف استيعاب المعرفة.
يقضي المصرفيون الاستثماريون والمحللون آلاف الساعات في تمحيص التقارير السنوية وعروض المستثمرين.
سير العمل: يمكن للمحلل أن يطلب: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
التحول: بدلًا من الاعتماد على مطابقة الكلمات المفتاحية، يسترجع النموذج الشريحة المطلوبة استنادًا إلى الظهور البصري لتمثيل البيانات المحدد، ما يتيح لنظام RAG الإجابة بدقة عالية.
تمتلك شركات التصنيع مكتبات ضخمة من الأدلة الفنية ومخططات الأنابيب وأجهزة القياس والتحكم (P&IDs).
سير العمل: يستطيع مهندس ميداني يصلح توربينًا التقاط صورة لقطعة أو أن يطلب: “Show me the wiring diagram for the hydraulic pump assembly.”
التحول: يتعرف ColQwen3 على التمثيل البصري لمخطط التوصيلات ويسترجع الصفحة الصحيحة، ما قد يقلص وقت التعطل بساعات.
يتطلب الاكتشاف القانوني مراجعة ملايين الصفحات الممسوحة ضوئيًا، حيث تكون المعلومة المنشودة غالبًا علامة بصرية.
سير العمل: يمكن لمسؤول الامتثال البحث عن “Documents signed by the CFO” أو “Contracts containing the official ‘Confidential’ stamp.”
التحول: يميز النموذج بين المسودة والمستند النهائي استنادًا إلى الظهور البصري للتوقيعات أو الأختام، وهو ما غالبًا ما يفوت OCR وحده.
يأتي ColQwen3 بأوزان مفتوحة (Apache 2.0)، وهو متاح الآن على Hugging Face. صممناه ليكون ترقية مباشرة لمسارات RAG الحديثة، مع توفير كود الاستدلال اللازم لمعالجة النصوص والصور والفيديو فورًا.
هذا هو المعيار الجديد للمؤسسات المستعدة لتجاوز البحث النصي البسيط وإطلاق إمكانات الذكاء الكامنة في أصولها البصرية.
الخطوة التالية: اطّلع على بطاقة النموذج وجرّب العرض التوضيحي المباشر على Hugging Face: /-colqwen3-embed-8b و/-colqwen3-embed-4b