التنقل الرئيسي

ما بعد النص: إطلاق قدرات RAG الحقيقي متعدد الوسائط والمتكامل

تساعد نماذج التضمين متعددة الوسائط الفرق على استرجاع معلومات مفيدة مباشرةً من المستندات المعقدة والصور ومقاطع الفيديو.

على مدى العامين الماضيين، كاد مصطلح «RAG» (التوليد المعزز بالاسترجاع) أن يقتصر على النصوص. النهج المعتاد بسيط: خذ المستندات، واستخرج النص، وقسّمه إلى أجزاء، ثم افهرسه.

لكن عالم المؤسسات لا يعتمد على الملفات النصية البسيطة. بل يعتمد على ملفات PDF معقدة، وعروض تقديمية حافلة بالمخططات، ورسومات CAD، وفواتير ممسوحة ضوئيًا، وعلى نحو متزايد أرشيفات ضخمة من تسجيلات الفيديو.

يمثل النهج الشائع في القطاع لمعالجة ذلك، باستخدام OCR أو نماذج اللغة الكبيرة البصرية لتحويل الصورة إلى وصف نصي قبل تضمينها، عنق زجاجة هائلًا. فهو بطيء ومكلف، ويُفقد البيانات الأصلية حتمًا سياقها المكاني والبصري الغني. إذا وصف ذكاؤك الاصطناعي عنصرًا بصريًا معقدًا بأنه مجرد «مخطط هندسي»، فستفقد القدرة على البحث عن صمام محدد أو مخطط توصيلات بداخله.

نطلق اليوم عائلة من أحدث نماذج التضمين متعددة الوسائط، مبنية على بنية ColPali ومصممة لحل هذه المشكلة عبر إتاحة الاسترجاع البصري المتكامل من البداية إلى النهاية.

الهندسة وراء هذا الإنجاز: استراتيجيات متقدمة للضبط الدقيق

لا يكفي لبناء نظام استرجاع فعال حقًا متعدد الوسائط أن تأخذ نموذجًا جاهزًا للرؤية واللغة (VLM) وتطلب منه البحث. لحل التحديات التي أعاقت تاريخيًا RAG متعدد الوسائط وإنشاء ColQwen3، استخدمنا استراتيجيات لدمج النماذج وتدريبها.

1. نقل قدرة التضمين عبر أوزان دمج مضبوطة

بدلًا من ضبط نموذج أساسي من الصفر، طورنا طريقة لنقل معرفة مهام الاسترجاع من نموذج تضمين نصي قائم. يعرف نموذج VLM القياسي كيف يصف الصور، لكنه لا يعرف بالضرورة كيف يرتبها دلاليًا وفقًا لاستعلام.

لسد هذه الفجوة، استخدمنا استراتيجيات أوزان دمج مضبوطة. وجدنا في تجاربنا أن قدرة Qwen3-Embedding على الاسترجاع في الفضاء الكامن النصي يمكن نقلها مباشرةً إلى الفضاء متعدد الوسائط، لتعميم الاسترجاع على الصور والفيديو حتى من دون تدريب فوري. ثم استفدنا من هذه التهيئة الفعالة كنقطة انطلاق قوية وضبطنا النموذج بدقة لتحسين الأداء أكثر وضمان المتانة. يحسن ذلك أداء الاسترجاع النهائي مقارنةً بالضبط الدقيق انطلاقًا من نموذج Qwen3-VL الأساسي.

2. الضبط الدقيق للمعلمات الفائقة

بعد نقل قدرات التضمين، ركزنا على المحاذاة. أجرينا عمليات بحث دقيقة عن المعلمات الفائقة ودراسات استئصال شملت العدد الأمثل لحقب التدريب وحجم الدفعة ومعدل التعلم ورتبة LoRA ومزيج مجموعات البيانات، بهدف تعظيم أداء الاسترجاع.

اخترنا للضبط الدقيق مجموعات البيانات VDR ومجموعة تدريب ColPali وvisrag_syn، وvisrag_ind. استخدمنا أخذ عينات UniMax في الضبط الدقيق. نظرًا إلى استخدامنا دمج النماذج وامتلاك النموذج الأساسي المدمج بالفعل بعض قدرات الاسترجاع متعدد الوسائط، وجدنا أن زيادة مجموعات البيانات تقلل الأداء قليلًا، ولذلك لم نتوسع إلى مجموعات إضافية.

فيما يلي المعلمات الفائقة التي اخترناها للضبط الدقيق:

رتبة LoRA

32

ألفا LoRA

32

الوحدات المستهدفة في LoRA

كل طبقات الصور والنصوص باستثناء التضمين

معدل التعلم

5e-5

الحد الأقصى للرموز البصرية

1280

حقب التدريب

1

حجم الدفعة الإجمالي

512

نسبة الإحماء

5%

3. معضلة «ColBERT»: الأداء العالي في مقابل تكلفة التخزين

قدمت النماذج التي تستخدم تاريخيًا تضمينات على مستوى الرمز بأسلوب «ColBERT»، مثل ColPali، أداءً مذهلًا لكن بتكلفة تخزين باهظة. أدت فهرسة كل رمز بصري إلى إنشاء قواعد بيانات متجهية ضخمة وباهظة التكلفة على نطاق المؤسسات.

  • استراتيجية التحسين: عالجنا تحدي التخزين عبر الموازنة الدقيقة لحجم التضمينات، للحفاظ على أقصى أداء ومنع تضخم تكاليف التخزين. للحفاظ على دقة رائدة ضمن هذه البصمة الفعالة، اخترنا بعناية بُعدًا حجمه 320 لتحقيق أفضل توازن بين أداء الاسترجاع وتكلفة التخزين.

    • خط الأساس: يتطلب النهج القياسي، مثل NVIDIA Nemo-3B، نحو 10.3 تيرابايت لتخزين تضمينات مليون صورة (1,802 رمزًا × 3,072 بُعدًا).

    • ColQwen3: يخزن المليون صورة نفسها في 0.82 تيرابايت فقط (1,280 رمزًا كحد أقصى × 320 بُعدًا).

يحقق ColQwen3 دقة استرجاع رائدة من دون تضخيم ميزانية البنية التحتية السحابية.

نتائج التقييم

تحققنا من صحة نهجنا باستخدام حزمة اختبارات ViDoRe. تؤكد النتائج أن ColQwen3 يضع معايير جديدة في أحدث اختبارات V3 وV2، بالإنجليزية ومتعددة اللغات، مع الحفاظ على أداء رائد في مهام V1 السابقة.

ViDoRe v3 (الأحدث)

يتصدر ColQwen3-8B الاسترجاع بالإنجليزية ومتعدد اللغات.

nDCG@5 بالإنجليزية

النموذج

علوم الحاسوب

الطاقة

التمويل

الموارد البشرية

الصناعة

الأدوية

الفيزياء

المتوسط

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 متعدد اللغات

النموذج

علوم الحاسوب

الطاقة

التمويل

الموارد البشرية

الصناعة

الأدوية

الفيزياء

المتوسط

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

أبرز نتائج ViDoRe v2 وv1

أداء مرتفع ومتسق في ESG والاقتصاد وDocVQA.

الاختبار المعياري

النموذج

النتيجة (المتوسط)

إنجاز بارز

ViDoRe V2 (الإنجليزية)

ColQwen3-8B

0.6772

المركز الأول في ESG وBioMed

ViDoRe V2 (متعدد اللغات)

ColQwen3-8B

0.6085

المركز الأول في الاقتصاد

ViDoRe V1 (الإنجليزية)

Nemo ColEmbed 3B

0.9100

متوسط أعلى قليلًا

ViDoRe V1 (الإنجليزية)

ColQwen3-8B

0.9076

المركز الأول في ArxivQA وSyn-Gov

استرجاع الفيديو: تقييم CareBench

لإثبات قدرة ColQwen3 القوية على التعميم في استرجاع الفيديو، قيّمنا النماذج باستخدام اختبار CareBench لمهام تحويل النص إلى فيديو (الاسترجاع العام).

استخدمنا في هذا التقييم نهج ترميز الفيديو الخام؛ إذ رمّزت نماذجنا ملفات الفيديو مباشرةً، من دون أي تعليقات نصية إضافية أو مدخلات بيانات وصفية. يبرز ذلك قدرة النموذج على الاسترجاع اعتمادًا على الدلالات البصرية وحدها.

النموذج

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

إطلاق إمكانات «البيانات المظلمة»: آفاق الفيديو الرائدة

من أبرز التحولات التي يتيحها ColQwen3 قدرته على التعامل مع الفيديو كما يتعامل مع المستندات. يُعد الفيديو في مؤسسات كثيرة «بيانات مظلمة»؛ إذ يبقى في التخزين البارد ويتعذر البحث فيه تمامًا ما لم يضع شخص وسومًا لكل ملف يدويًا.

يغيّر ColQwen3 ذلك عبر إتاحة الاسترجاع إطارًا بإطار من المقاطع المجزأة.

حالة استخدام بارزة: بنك الذاكرة المؤسسية

تسجل المؤسسات يوميًا آلاف الساعات من اجتماعات الفيديو الداخلية، وغالبًا ما تضيع هذه التسجيلات بلا أثر.

  • سير العمل: عبر تقسيم تسجيلات الاجتماعات الطويلة تلقائيًا إلى مقاطع أقصر ومنطقية وفهرستها باستخدام ColQwen3، تنشئ «ذاكرة مؤسسية» قابلة للبحث.

  • الاستعلام: يمكن لمدير المشروع أن يطلب: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • النتيجة: بدلًا من إرجاع ملف فيديو مدته 60 دقيقة، يسترجع النظام المقطع المحدد ومدته 45 ثانية الذي عُرض فيه ذلك المخطط على الشاشة ونوقش، حتى لو لم يقل المتحدثون صراحةً كلمة «زمن الاستجابة» في تلك اللحظة.

حالات الاستخدام المؤسسية: حل المشكلات عالية القيمة

يتيح الانتقال إلى التضمين الأصلي متعدد الوسائط مسارات عمل جديدة كليًا في مختلف القطاعات. أجرينا اختبارات معيارية موسعة لهذا النموذج في بعض أكثر بيئات بيانات المؤسسات تعقيدًا.

1. أبرز نتائج الاختبار: الاستشارات الحضرية والعمارة

اختبرنا ColQwen3 في مواجهة تحديات البيانات لدى شركات الاستشارات الحضرية التي تدير مكتبات ضخمة من المخططات الرئيسية وخرائط تقسيم المناطق والواجهات المعمارية المعقدة.

  • التحدي: تواجه مسارات RAG التقليدية صعوبة في هذه البيئات. عادةً ما تصف أدوات OCR مخططات المواقع المعقدة بكلمة «رسم تخطيطي» فحسب، فتفوتها تفاصيل مهمة عن حركة المرور أو المساحات الخضراء أو ارتدادات المباني.

  • الأداء: تُظهر اختباراتنا الداخلية أن ColQwen3 يتجاوز بفاعلية الحاجة إلى المعالجة المسبقة المكلفة بتقنيات OCR أو توليد الأوصاف. في اختبارات الرسومات المعمارية عالية الكثافة، نجح النموذج في استرجاع المستندات بناءً على علامات بصرية محددة، مثل نقاط دخول المشاة أو حدود تقسيم المناطق المميزة، متفوقًا بوضوح على خطوط الأساس النصية وواعدًا بخفض كبير في تكاليف استيعاب المعرفة.

2. المعلومات المالية والسوقية المعقدة

يقضي المصرفيون الاستثماريون والمحللون آلاف الساعات في تمحيص التقارير السنوية وعروض المستثمرين.

  • سير العمل: يمكن للمحلل أن يطلب: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • التحول: بدلًا من الاعتماد على مطابقة الكلمات المفتاحية، يسترجع النموذج الشريحة المطلوبة استنادًا إلى الظهور البصري لتمثيل البيانات المحدد، ما يتيح لنظام RAG الإجابة بدقة عالية.

3. التصنيع الصناعي والخدمات الميدانية

تمتلك شركات التصنيع مكتبات ضخمة من الأدلة الفنية ومخططات الأنابيب وأجهزة القياس والتحكم (P&IDs).

  • سير العمل: يستطيع مهندس ميداني يصلح توربينًا التقاط صورة لقطعة أو أن يطلب: “Show me the wiring diagram for the hydraulic pump assembly.”

  • التحول: يتعرف ColQwen3 على التمثيل البصري لمخطط التوصيلات ويسترجع الصفحة الصحيحة، ما قد يقلص وقت التعطل بساعات.

4. الشؤون القانونية والامتثال

يتطلب الاكتشاف القانوني مراجعة ملايين الصفحات الممسوحة ضوئيًا، حيث تكون المعلومة المنشودة غالبًا علامة بصرية.

  • سير العمل: يمكن لمسؤول الامتثال البحث عن “Documents signed by the CFO” أو “Contracts containing the official ‘Confidential’ stamp.”

  • التحول: يميز النموذج بين المسودة والمستند النهائي استنادًا إلى الظهور البصري للتوقيعات أو الأختام، وهو ما غالبًا ما يفوت OCR وحده.

بدء الاستخدام

يأتي ColQwen3 بأوزان مفتوحة (Apache 2.0)، وهو متاح الآن على Hugging Face. صممناه ليكون ترقية مباشرة لمسارات RAG الحديثة، مع توفير كود الاستدلال اللازم لمعالجة النصوص والصور والفيديو فورًا.

هذا هو المعيار الجديد للمؤسسات المستعدة لتجاوز البحث النصي البسيط وإطلاق إمكانات الذكاء الكامنة في أصولها البصرية.

الخطوة التالية: اطّلع على بطاقة النموذج وجرّب العرض التوضيحي المباشر على Hugging Face: /-colqwen3-embed-8b و/-colqwen3-embed-4b

المؤلف

Xin Huang وKye Min Tan