در دو سال گذشته، «RAG» (تولید تقویتشده با بازیابی) تقریباً فقط مترادف متن بوده است. روال استاندارد ساده است: اسناد را بگیرید، متنشان را استخراج کنید، آن را به قطعهها تقسیم و نمایهسازی کنید.
اما دنیای سازمانی با فایلهای متن ساده اداره نمیشود. این دنیا بر PDFهای پیچیده، اسلایدهای مملو از نمودار، نقشههای CAD، صورتحسابهای اسکنشده و بیش از پیش، آرشیوهای عظیم ویدئویی متکی است.
روش رایج صنعت برای پردازش این محتوا—استفاده از OCR یا مدلهای زبانی بزرگ بینایی برای تبدیل تصویر به شرح متنی پیش از تعبیه—گلوگاهی بزرگ است. این روش کند و پرهزینه است و ناگزیر بافت غنی فضایی و بصری داده اصلی را از بین میبرد. اگر هوش مصنوعی شما یک تصویر پیچیده را فقط «نقشه فنی» توصیف کند، دیگر نمیتوانید شیر یا نقشه سیمکشی مشخصی را که درون آن است جستوجو کنید.
امروز خانوادهای از مدلهای پیشرفته تعبیه چندوجهی را منتشر میکنیم که بر پایه معماری ColPali ساخته شدهاند و با فراهم کردن بازیابی بصری سرتاسری این مشکل را حل میکنند.
ساخت یک بازیاب چندوجهی واقعاً مؤثر به سادگی برداشتن یک مدل آماده بیناییـزبان (VLM) و درخواست جستوجو از آن نیست. برای حل چالشهایی که در گذشته مانع پیشرفت RAG چندوجهی بودهاند و ساخت ColQwen3، از راهبردهای ادغام و آموزش مدل استفاده کردیم.
بهجای تنظیم دقیق یک مدل پایه از ابتدا، روشی طراحی کردیم تا دانش وظایف بازیابی از یک مدل تعبیه متنی موجود منتقل شود. یک VLM استاندارد میداند چگونه تصاویر را توصیف کند، اما لزوماً نمیداند چگونه آنها را از نظر معنایی در برابر یک پرسوجو رتبهبندی کند.
برای پر کردن این شکاف، از راهبردهای وزندهی ادغامشده و تنظیمشده بهره گرفتیم. در آزمایشها دریافتیم که قابلیت بازیابی Qwen3-Embedding در فضای نهفته متنی را میتوان مستقیماً به فضای چندوجهی منتقل کرد؛ بهگونهای که حتی بدون آموزش فوری، به بازیابی تصویر و ویدئو تعمیم مییابد. سپس با استفاده از این مقداردهی اولیه مؤثر بهعنوان نقطه شروعی قدرتمند، مدل را تنظیم دقیق کردیم تا عملکرد بیشتر بهینه و استحکام آن تضمین شود. این کار در مقایسه با تنظیم دقیق مدل پایه Qwen3-VL، عملکرد نهایی بازیابی را بهبود میدهد.
پس از انتقال قابلیتهای تعبیه، بر همترازی تمرکز کردیم. برای به حداکثر رساندن عملکرد بازیابی، جستوجوی دقیق ابرپارامترها و مطالعات حذف مؤلفه انجام دادیم؛ از جمله تعیین تعداد بهینه دورهها، اندازه دسته، نرخ یادگیری، رتبه LoRA و ترکیب مجموعهدادهها.
برای تنظیم دقیق، مجموعهدادههای VDR، مجموعه آموزشی ColPali، visrag_syn، و visrag_ind را انتخاب کردیم. برای تنظیم دقیق از نمونهگیری UniMax استفاده کردیم. از آنجا که ادغام مدل را به کار بردیم و مدل پایه ادغامشده از قبل بخشی از قابلیت بازیابی چندوجهی را به ارث برده بود، دریافتیم افزایش تعداد مجموعهدادهها در واقع عملکرد را اندکی کاهش میدهد؛ بنابراین تعداد آنها را افزایش ندادیم.
ابرپارامترهای انتخابی ما برای تنظیم دقیق عبارتاند از:
رتبه LoRA | 32 |
آلفای LoRA | 32 |
ماژولهای هدف LoRA | همه لایههای تصویر و متن، بهجز تعبیه |
نرخ یادگیری | 5e-5 |
حداکثر توکنهای بصری | 1280 |
دورههای آموزش | 1 |
اندازه دسته سراسری | 512 |
نسبت گرمکردن | 5% |
در گذشته، مدلهایی با تعبیههای سطح توکن به سبک «ColBERT» مانند ColPali، عملکردی فوقالعاده داشتند اما هزینه ذخیرهسازیشان بازدارنده بود. نمایهسازی تکتک توکنهای بصری، پایگاههای داده برداری عظیمی ایجاد میکرد که برای مقیاس سازمانی بیش از حد پرهزینه بودند.
راهبرد بهینهسازی: برای حل چالش ذخیرهسازی، اندازه تعبیهها را با دقت متعادل کردیم تا ضمن حفظ حداکثر عملکرد، از جهش هزینههای ذخیرهسازی جلوگیری شود. برای حفظ دقت پیشرفته در این ابعاد بهینه، اندازه بُعد را ۳۲۰ انتخاب کردیم تا بهترین تعادل میان عملکرد بازیابی و هزینه ذخیرهسازی برقرار شود.
مبنای مقایسه: روشی استاندارد مانند NVIDIA Nemo-3B برای ذخیره تعبیههای ۱ میلیون تصویر تقریباً به ۱۰٫۳ ترابایت فضا نیاز دارد (۱٬۸۰۲ توکن با ۳٬۰۷۲ بُعد).
ColQwen3: همان ۱ میلیون تصویر را تنها در ۰٫۸۲ ترابایت ذخیره میکند (حداکثر ۱٬۲۸۰ توکن با ۳۲۰ بُعد).
ColQwen3 بدون تحمیل هزینهای سنگین به زیرساخت ابری، به دقت پیشرفته در بازیابی دست مییابد.
رویکرد خود را با مجموعه بنچمارک ViDoRe اعتبارسنجی کردیم. نتایج تأیید میکنند که ColQwen3 در جدیدترین بنچمارکهای V3 و V2، هم انگلیسی و هم چندزبانه، استانداردهای تازهای تعیین کرده و همزمان عملکرد برتر خود را در وظایف قدیمی V1 حفظ میکند.
ColQwen3-8B در بازیابی انگلیسی و چندزبانه پیشتاز است.
nDCG@5 انگلیسی
مدل | علوم کامپیوتر | انرژی | مالی | منابع انسانی | صنعت | داروسازی | فیزیک | میانگین |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
nDCG@5 چندزبانه
مدل | علوم کامپیوتر | انرژی | مالی | منابع انسانی | صنعت | داروسازی | فیزیک | میانگین |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
عملکرد بالای پایدار در ESG، اقتصاد و DocVQA.
بنچمارک | مدل | امتیاز (میانگین) | برتری شاخص |
ViDoRe V2 (انگلیسی) | ColQwen3-8B | 0.6772 | رتبه ۱ در ESG و BioMed |
ViDoRe V2 (چندزبانه) | ColQwen3-8B | 0.6085 | رتبه ۱ در اقتصاد |
ViDoRe V1 (انگلیسی) | Nemo ColEmbed 3B | 0.9100 | میانگین اندکی بالاتر |
ViDoRe V1 (انگلیسی) | ColQwen3-8B | 0.9076 | رتبه ۱ در ArxivQA و Syn-Gov |
برای نشان دادن تعمیمپذیری بالای ColQwen3 در بازیابی ویدئو، مدلها را با بنچمارک CareBench در وظایف متنبهویدئو (بازیابی عمومی) ارزیابی کردیم.
در این ارزیابی از روش رمزگذاری خام ویدئو استفاده کردیم: مدلهای ما فایلهای ویدئویی را مستقیماً و بدون هیچ شرح متنی یا ورودی فرادادهای رمزگذاری کردند. این نتیجه توانایی مدل در بازیابی صرفاً بر پایه معنای بصری را نشان میدهد.
مدل | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
یکی از عمیقترین تحولاتی که ColQwen3 ممکن کرده، توانایی آن در برخورد با ویدئو درست مانند اسناد است. در بسیاری از سازمانها، ویدئو «داده تاریک» است؛ در فضای ذخیرهسازی سرد میماند و تا زمانی که انسانی همه فایلها را دستی برچسبگذاری نکند، اصلاً قابل جستوجو نیست.
ColQwen3 با فراهم کردن بازیابی فریمبهفریم در کلیپهای بخشبندیشده، این وضعیت را تغییر میدهد.
سازمانها هر روز هزاران ساعت جلسه ویدئویی داخلی ضبط میکنند و معمولاً این ضبطها به فراموشی سپرده میشوند.
گردش کار: با تقسیم خودکار ضبطهای طولانی جلسات به کلیپهای کوتاهتر و منسجم و نمایهسازی آنها با ColQwen3، یک «حافظه سازمانی» قابل جستوجو میسازید.
پرسوجو: مدیر پروژه میتواند بپرسد: “Show me the clip where the engineering lead explained the latency issue with the API.”
نتیجه: سیستم بهجای بازگرداندن یک فایل ویدئویی ۶۰ دقیقهای، دقیقاً همان بخش ۴۵ ثانیهای را بازیابی میکند که نمودار موردنظر روی صفحه نمایش داده و دربارهاش صحبت شده است؛ حتی اگر گویندگان در همان لحظه صریحاً واژه «تأخیر» را نگفته باشند.
گذار به تعبیه چندوجهی بومی، گردشهای کاری کاملاً تازهای را در صنایع مختلف ممکن میکند. این مدل را بهطور گسترده در برابر برخی از پیچیدهترین محیطهای داده سازمانی بنچمارک کردهایم.
ColQwen3 را در برابر چالشهای دادهای شرکتهای مشاوره شهری آزمودیم؛ شرکتهایی که آرشیوهای عظیمی از طرحهای جامع، نقشههای منطقهبندی و نماهای پیچیده معماری را مدیریت میکنند.
چالش: خطوط پردازش سنتی RAG در چنین محیطهایی با مشکل روبهرو میشوند. ابزارهای OCR معمولاً طرحهای پیچیده سایت را صرفاً «شماتیک» توصیف میکنند و جزئیات مهمی مانند جریان ترافیک، فضاهای سبز یا عقبنشینی ساختمان را از دست میدهند.
عملکرد: بنچمارکهای داخلی ما نشان میدهند که ColQwen3 نیاز به پیشپردازش پرهزینه OCR یا شرحنویسی را عملاً برطرف میکند. در آزمایشهای انجامشده روی نقشههای معماری پرتراکم، مدل توانست اسناد را بر اساس نشانههای بصری مشخصی مانند نقاط دسترسی عابران یا مرزهای متمایز منطقهبندی بازیابی کند؛ عملکردی که بهمراتب از مبناهای صرفاً متنی بهتر بود و نوید کاهش چشمگیر هزینه ورود دانش را میدهد.
بانکداران سرمایهگذاری و تحلیلگران هزاران ساعت صرف بررسی گزارشهای سالانه و اسلایدهای سرمایهگذاران میکنند.
گردش کار: تحلیلگر میتواند بپرسد: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
تحول: مدل بهجای اتکا به تطبیق کلیدواژهها، اسلاید دقیق را بر اساس حضور بصری نمودار داده موردنظر بازیابی میکند و به سیستم RAG امکان میدهد با دقت بالا به پرسشها پاسخ دهد.
شرکتهای تولیدی آرشیوهای عظیمی از راهنماهای فنی و نمودارهای لولهکشی (P&ID) دارند.
گردش کار: مهندس میدانی هنگام تعمیر توربین میتواند از یک قطعه عکس بگیرد یا بپرسد: “Show me the wiring diagram for the hydraulic pump assembly.”
تحول: ColQwen3 بازنمایی بصری نقشه سیمکشی را شناسایی و صفحه درست را بازیابی میکند؛ کاری که میتواند زمان توقف را چند ساعت کاهش دهد.
کشف حقوقی مستلزم بررسی میلیونها صفحه اسکنشده است که سرنخ اصلی در آنها اغلب یک نشانه بصری است.
گردش کار: مسئول انطباق میتواند عبارتهای “Documents signed by the CFO” یا “Contracts containing the official ‘Confidential’ stamp.” را جستوجو کند.
تحول: مدل با تشخیص بصری امضاها یا مهرها، پیشنویس را از سند نهایی تمیز میدهد؛ قابلیتی که OCR صرف اغلب از دست میدهد.
ColQwen3 با وزنهای باز (Apache 2.0) اکنون در Hugging Face در دسترس است. آن را بهعنوان ارتقایی بیدردسر برای خطوط پردازش مدرن RAG طراحی کردهایم و کد استنتاج لازم برای پردازش فوری متن، تصویر و ویدئو را ارائه میدهد.
برای سازمانهایی که آمادهاند از جستوجوی ساده متن فراتر بروند و هوشمندی نهفته در داراییهای بصری خود را آزاد کنند، این استاندارد جدید است.
گام بعدی: کارت مدل را ببینید و دموی زنده را در Hugging Face امتحان کنید: /-colqwen3-embed-8b و /-colqwen3-embed-4b