ناوبری اصلی

فراتر از متن: دستیابی به RAG چندوجهی و سرتاسری واقعی

مدل‌های تعبیه چندوجهی به تیم‌ها کمک می‌کنند اطلاعات مفید را مستقیماً از اسناد پیچیده، تصاویر و ویدئوها بازیابی کنند.

در دو سال گذشته، «RAG» (تولید تقویت‌شده با بازیابی) تقریباً فقط مترادف متن بوده است. روال استاندارد ساده است: اسناد را بگیرید، متنشان را استخراج کنید، آن را به قطعه‌ها تقسیم و نمایه‌سازی کنید.

اما دنیای سازمانی با فایل‌های متن ساده اداره نمی‌شود. این دنیا بر PDFهای پیچیده، اسلایدهای مملو از نمودار، نقشه‌های CAD، صورت‌حساب‌های اسکن‌شده و بیش از پیش، آرشیوهای عظیم ویدئویی متکی است.

روش رایج صنعت برای پردازش این محتوا—استفاده از OCR یا مدل‌های زبانی بزرگ بینایی برای تبدیل تصویر به شرح متنی پیش از تعبیه—گلوگاهی بزرگ است. این روش کند و پرهزینه است و ناگزیر بافت غنی فضایی و بصری داده اصلی را از بین می‌برد. اگر هوش مصنوعی شما یک تصویر پیچیده را فقط «نقشه فنی» توصیف کند، دیگر نمی‌توانید شیر یا نقشه سیم‌کشی مشخصی را که درون آن است جست‌وجو کنید.

امروز خانواده‌ای از مدل‌های پیشرفته تعبیه چندوجهی را منتشر می‌کنیم که بر پایه معماری ColPali ساخته شده‌اند و با فراهم کردن بازیابی بصری سرتاسری این مشکل را حل می‌کنند.

مهندسی پشت این جادو: راهبردهای پیشرفته تنظیم دقیق

ساخت یک بازیاب چندوجهی واقعاً مؤثر به سادگی برداشتن یک مدل آماده بینایی‌ـ‌زبان (VLM) و درخواست جست‌وجو از آن نیست. برای حل چالش‌هایی که در گذشته مانع پیشرفت RAG چندوجهی بوده‌اند و ساخت ColQwen3، از راهبردهای ادغام و آموزش مدل استفاده کردیم.

۱. انتقال قابلیت تعبیه با وزن‌دهی ادغام‌شده و تنظیم‌شده

به‌جای تنظیم دقیق یک مدل پایه از ابتدا، روشی طراحی کردیم تا دانش وظایف بازیابی از یک مدل تعبیه متنی موجود منتقل شود. یک VLM استاندارد می‌داند چگونه تصاویر را توصیف کند، اما لزوماً نمی‌داند چگونه آن‌ها را از نظر معنایی در برابر یک پرس‌وجو رتبه‌بندی کند.

برای پر کردن این شکاف، از راهبردهای وزن‌دهی ادغام‌شده و تنظیم‌شده بهره گرفتیم. در آزمایش‌ها دریافتیم که قابلیت بازیابی Qwen3-Embedding در فضای نهفته متنی را می‌توان مستقیماً به فضای چندوجهی منتقل کرد؛ به‌گونه‌ای که حتی بدون آموزش فوری، به بازیابی تصویر و ویدئو تعمیم می‌یابد. سپس با استفاده از این مقداردهی اولیه مؤثر به‌عنوان نقطه شروعی قدرتمند، مدل را تنظیم دقیق کردیم تا عملکرد بیشتر بهینه و استحکام آن تضمین شود. این کار در مقایسه با تنظیم دقیق مدل پایه Qwen3-VL، عملکرد نهایی بازیابی را بهبود می‌دهد.

۲. تنظیم دقیق ابرپارامترها

پس از انتقال قابلیت‌های تعبیه، بر هم‌ترازی تمرکز کردیم. برای به حداکثر رساندن عملکرد بازیابی، جست‌وجوی دقیق ابرپارامترها و مطالعات حذف مؤلفه انجام دادیم؛ از جمله تعیین تعداد بهینه دوره‌ها، اندازه دسته، نرخ یادگیری، رتبه LoRA و ترکیب مجموعه‌داده‌ها.

برای تنظیم دقیق، مجموعه‌داده‌های VDR، مجموعه آموزشی ColPali، visrag_syn، و visrag_ind را انتخاب کردیم. برای تنظیم دقیق از نمونه‌گیری UniMax استفاده کردیم. از آنجا که ادغام مدل را به کار بردیم و مدل پایه ادغام‌شده از قبل بخشی از قابلیت بازیابی چندوجهی را به ارث برده بود، دریافتیم افزایش تعداد مجموعه‌داده‌ها در واقع عملکرد را اندکی کاهش می‌دهد؛ بنابراین تعداد آن‌ها را افزایش ندادیم.

ابرپارامترهای انتخابی ما برای تنظیم دقیق عبارت‌اند از:

رتبه LoRA

32

آلفای LoRA

32

ماژول‌های هدف LoRA

همه لایه‌های تصویر و متن، به‌جز تعبیه

نرخ یادگیری

5e-5

حداکثر توکن‌های بصری

1280

دوره‌های آموزش

1

اندازه دسته سراسری

512

نسبت گرم‌کردن

5%

۳. دوراهی «ColBERT»: عملکرد بالا در برابر هزینه ذخیره‌سازی

در گذشته، مدل‌هایی با تعبیه‌های سطح توکن به سبک «ColBERT» مانند ColPali، عملکردی فوق‌العاده داشتند اما هزینه ذخیره‌سازی‌شان بازدارنده بود. نمایه‌سازی تک‌تک توکن‌های بصری، پایگاه‌های داده برداری عظیمی ایجاد می‌کرد که برای مقیاس سازمانی بیش از حد پرهزینه بودند.

  • راهبرد بهینه‌سازی: برای حل چالش ذخیره‌سازی، اندازه تعبیه‌ها را با دقت متعادل کردیم تا ضمن حفظ حداکثر عملکرد، از جهش هزینه‌های ذخیره‌سازی جلوگیری شود. برای حفظ دقت پیشرفته در این ابعاد بهینه، اندازه بُعد را ۳۲۰ انتخاب کردیم تا بهترین تعادل میان عملکرد بازیابی و هزینه ذخیره‌سازی برقرار شود.

    • مبنای مقایسه: روشی استاندارد مانند NVIDIA Nemo-3B برای ذخیره تعبیه‌های ۱ میلیون تصویر تقریباً به ۱۰٫۳ ترابایت فضا نیاز دارد (۱٬۸۰۲ توکن با ۳٬۰۷۲ بُعد).

    • ColQwen3: همان ۱ میلیون تصویر را تنها در ۰٫۸۲ ترابایت ذخیره می‌کند (حداکثر ۱٬۲۸۰ توکن با ۳۲۰ بُعد).

ColQwen3 بدون تحمیل هزینه‌ای سنگین به زیرساخت ابری، به دقت پیشرفته در بازیابی دست می‌یابد.

نتایج ارزیابی

رویکرد خود را با مجموعه بنچمارک ViDoRe اعتبارسنجی کردیم. نتایج تأیید می‌کنند که ColQwen3 در جدیدترین بنچمارک‌های V3 و V2، هم انگلیسی و هم چندزبانه، استانداردهای تازه‌ای تعیین کرده و هم‌زمان عملکرد برتر خود را در وظایف قدیمی V1 حفظ می‌کند.

ViDoRe v3 (جدیدترین)

ColQwen3-8B در بازیابی انگلیسی و چندزبانه پیشتاز است.

nDCG@5 انگلیسی

مدل

علوم کامپیوتر

انرژی

مالی

منابع انسانی

صنعت

داروسازی

فیزیک

میانگین

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 چندزبانه

مدل

علوم کامپیوتر

انرژی

مالی

منابع انسانی

صنعت

داروسازی

فیزیک

میانگین

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

نکات برجسته ViDoRe v2 و v1

عملکرد بالای پایدار در ESG، اقتصاد و DocVQA.

بنچمارک

مدل

امتیاز (میانگین)

برتری شاخص

ViDoRe V2 (انگلیسی)

ColQwen3-8B

0.6772

رتبه ۱ در ESG و BioMed

ViDoRe V2 (چندزبانه)

ColQwen3-8B

0.6085

رتبه ۱ در اقتصاد

ViDoRe V1 (انگلیسی)

Nemo ColEmbed 3B

0.9100

میانگین اندکی بالاتر

ViDoRe V1 (انگلیسی)

ColQwen3-8B

0.9076

رتبه ۱ در ArxivQA و Syn-Gov

بازیابی ویدئو: ارزیابی CareBench

برای نشان دادن تعمیم‌پذیری بالای ColQwen3 در بازیابی ویدئو، مدل‌ها را با بنچمارک CareBench در وظایف متن‌به‌ویدئو (بازیابی عمومی) ارزیابی کردیم.

در این ارزیابی از روش رمزگذاری خام ویدئو استفاده کردیم: مدل‌های ما فایل‌های ویدئویی را مستقیماً و بدون هیچ شرح متنی یا ورودی فراداده‌ای رمزگذاری کردند. این نتیجه توانایی مدل در بازیابی صرفاً بر پایه معنای بصری را نشان می‌دهد.

مدل

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

گشودن قفل «داده‌های تاریک»: مرز پیشروی ویدئو

یکی از عمیق‌ترین تحولاتی که ColQwen3 ممکن کرده، توانایی آن در برخورد با ویدئو درست مانند اسناد است. در بسیاری از سازمان‌ها، ویدئو «داده تاریک» است؛ در فضای ذخیره‌سازی سرد می‌ماند و تا زمانی که انسانی همه فایل‌ها را دستی برچسب‌گذاری نکند، اصلاً قابل جست‌وجو نیست.

ColQwen3 با فراهم کردن بازیابی فریم‌به‌فریم در کلیپ‌های بخش‌بندی‌شده، این وضعیت را تغییر می‌دهد.

نمونه کاربردی: مخزن حافظه سازمانی

سازمان‌ها هر روز هزاران ساعت جلسه ویدئویی داخلی ضبط می‌کنند و معمولاً این ضبط‌ها به فراموشی سپرده می‌شوند.

  • گردش کار: با تقسیم خودکار ضبط‌های طولانی جلسات به کلیپ‌های کوتاه‌تر و منسجم و نمایه‌سازی آن‌ها با ColQwen3، یک «حافظه سازمانی» قابل جست‌وجو می‌سازید.

  • پرس‌وجو: مدیر پروژه می‌تواند بپرسد: “Show me the clip where the engineering lead explained the latency issue with the API.”

  • نتیجه: سیستم به‌جای بازگرداندن یک فایل ویدئویی ۶۰ دقیقه‌ای، دقیقاً همان بخش ۴۵ ثانیه‌ای را بازیابی می‌کند که نمودار موردنظر روی صفحه نمایش داده و درباره‌اش صحبت شده است؛ حتی اگر گویندگان در همان لحظه صریحاً واژه «تأخیر» را نگفته باشند.

کاربردهای سازمانی: حل مسائل باارزش

گذار به تعبیه چندوجهی بومی، گردش‌های کاری کاملاً تازه‌ای را در صنایع مختلف ممکن می‌کند. این مدل را به‌طور گسترده در برابر برخی از پیچیده‌ترین محیط‌های داده سازمانی بنچمارک کرده‌ایم.

۱. نکته برجسته بنچمارک: مشاوره شهری و معماری

ColQwen3 را در برابر چالش‌های داده‌ای شرکت‌های مشاوره شهری آزمودیم؛ شرکت‌هایی که آرشیوهای عظیمی از طرح‌های جامع، نقشه‌های منطقه‌بندی و نماهای پیچیده معماری را مدیریت می‌کنند.

  • چالش: خطوط پردازش سنتی RAG در چنین محیط‌هایی با مشکل روبه‌رو می‌شوند. ابزارهای OCR معمولاً طرح‌های پیچیده سایت را صرفاً «شماتیک» توصیف می‌کنند و جزئیات مهمی مانند جریان ترافیک، فضاهای سبز یا عقب‌نشینی ساختمان را از دست می‌دهند.

  • عملکرد: بنچمارک‌های داخلی ما نشان می‌دهند که ColQwen3 نیاز به پیش‌پردازش پرهزینه OCR یا شرح‌نویسی را عملاً برطرف می‌کند. در آزمایش‌های انجام‌شده روی نقشه‌های معماری پرتراکم، مدل توانست اسناد را بر اساس نشانه‌های بصری مشخصی مانند نقاط دسترسی عابران یا مرزهای متمایز منطقه‌بندی بازیابی کند؛ عملکردی که به‌مراتب از مبناهای صرفاً متنی بهتر بود و نوید کاهش چشمگیر هزینه ورود دانش را می‌دهد.

۲. هوشمندی پیچیده مالی و بازار

بانکداران سرمایه‌گذاری و تحلیلگران هزاران ساعت صرف بررسی گزارش‌های سالانه و اسلایدهای سرمایه‌گذاران می‌کنند.

  • گردش کار: تحلیلگر می‌تواند بپرسد: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • تحول: مدل به‌جای اتکا به تطبیق کلیدواژه‌ها، اسلاید دقیق را بر اساس حضور بصری نمودار داده موردنظر بازیابی می‌کند و به سیستم RAG امکان می‌دهد با دقت بالا به پرسش‌ها پاسخ دهد.

۳. تولید صنعتی و خدمات میدانی

شرکت‌های تولیدی آرشیوهای عظیمی از راهنماهای فنی و نمودارهای لوله‌کشی (P&ID) دارند.

  • گردش کار: مهندس میدانی هنگام تعمیر توربین می‌تواند از یک قطعه عکس بگیرد یا بپرسد: “Show me the wiring diagram for the hydraulic pump assembly.”

  • تحول: ColQwen3 بازنمایی بصری نقشه سیم‌کشی را شناسایی و صفحه درست را بازیابی می‌کند؛ کاری که می‌تواند زمان توقف را چند ساعت کاهش دهد.

۴. حقوقی و انطباق

کشف حقوقی مستلزم بررسی میلیون‌ها صفحه اسکن‌شده است که سرنخ اصلی در آن‌ها اغلب یک نشانه بصری است.

  • گردش کار: مسئول انطباق می‌تواند عبارت‌های “Documents signed by the CFO” یا “Contracts containing the official ‘Confidential’ stamp.” را جست‌وجو کند.

  • تحول: مدل با تشخیص بصری امضاها یا مهرها، پیش‌نویس را از سند نهایی تمیز می‌دهد؛ قابلیتی که OCR صرف اغلب از دست می‌دهد.

شروع کار

ColQwen3 با وزن‌های باز (Apache 2.0) اکنون در Hugging Face در دسترس است. آن را به‌عنوان ارتقایی بی‌دردسر برای خطوط پردازش مدرن RAG طراحی کرده‌ایم و کد استنتاج لازم برای پردازش فوری متن، تصویر و ویدئو را ارائه می‌دهد.

برای سازمان‌هایی که آماده‌اند از جست‌وجوی ساده متن فراتر بروند و هوشمندی نهفته در دارایی‌های بصری خود را آزاد کنند، این استاندارد جدید است.

گام بعدی: کارت مدل را ببینید و دموی زنده را در Hugging Face امتحان کنید: /-colqwen3-embed-8b و /-colqwen3-embed-4b

نویسنده

Xin Huang،‏ Kye Min Tan