গত দুই বছর ধরে “RAG” (Retrieval-Augmented Generation) প্রায় একচেটিয়াভাবে টেক্সটের সমার্থক হয়ে আছে. মানক পদ্ধতি সহজ: ডকুমেন্ট নিন, টেক্সট বের করুন, সেটিকে খণ্ডে ভাগ করুন, তারপর ইনডেক্স করুন.
কিন্তু এন্টারপ্রাইজ জগৎ সাধারণ টেক্সট ফাইলে চলে না. এটি চলে জটিল PDF, ঘন চার্টসমৃদ্ধ স্লাইড ডেক, CAD অঙ্কন, স্ক্যান করা ইনভয়েস এবং ক্রমশ আরও বেশি করে ভিডিও ফুটেজের বিশাল আর্কাইভের ওপর.
এটি সামলাতে OCR বা Vision LLM ব্যবহার করে এমবেডিংয়ের আগে একটি ছবিকে টেক্সটে “ক্যাপশন” করার শিল্পমান পদ্ধতি একটি বিশাল বাধা. এটি ধীর, ব্যয়বহুল এবং অবশ্যম্ভাবীভাবে মূল ডেটার সমৃদ্ধ স্থানিক ও ভিজ্যুয়াল প্রেক্ষাপট হারিয়ে ফেলে. আপনার AI যদি কোনো জটিল ভিজ্যুয়ালকে শুধু “একটি ব্লুপ্রিন্ট” বলে বর্ণনা করে, তবে তার ভেতরের নির্দিষ্ট ভালভ বা ওয়্যারিং স্কিম্যাটিক খুঁজে বের করার ক্ষমতা আপনি হারিয়েছেন.
আজ আমরা ColPali আর্কিটেকচারের ওপর ভিত্তি করে তৈরি অত্যাধুনিক মাল্টিমোডাল এমবেডিং মডেলের একটি পরিবার প্রকাশ করছি, যা এন্ড-টু-এন্ড ভিজ্যুয়াল রিট্রিভাল সক্ষম করে এই সমস্যা সমাধানের জন্য নকশা করা হয়েছে.
সত্যিকারের কার্যকর মাল্টিমোডাল রিট্রিভার তৈরি করা কোনো প্রস্তুত Vision-Language Model (VLM) নিয়ে তাকে খুঁজতে বলার মতো সহজ নয়. ঐতিহাসিকভাবে মাল্টিমোডাল RAG-কে পিছিয়ে রাখা চ্যালেঞ্জগুলো সমাধান করে ColQwen3 তৈরি করতে আমরা মডেল মার্জিং ও প্রশিক্ষণ কৌশল ব্যবহার করেছি.
শূন্য থেকে একটি বেস মডেল ফাইন-টিউন করার বদলে, আমরা বিদ্যমান টেক্সটচুয়াল এমবেডিং মডেল থেকে রিট্রিভাল কাজের জ্ঞান স্থানান্তরের একটি পদ্ধতি তৈরি করেছি. একটি সাধারণ VLM ছবি বর্ণনা করতে জানে, কিন্তু কোনো কোয়েরির বিপরীতে সেগুলোকে অর্থগতভাবে র্যাঙ্ক করতে সে আবশ্যিকভাবে জানে না.
এই ব্যবধান কমাতে আমরা টিউন করা মার্জড ওয়েটিং কৌশল ব্যবহার করেছি. আমাদের পরীক্ষায় দেখা গেছে, টেক্সটচুয়াল ল্যাটেন্ট স্পেসে Qwen3-Embedding-এর রিট্রিভাল সক্ষমতা সরাসরি মাল্টিমোডাল স্পেসে স্থানান্তর করা যায়, যা তাৎক্ষণিক প্রশিক্ষণ ছাড়াই ছবি ও ভিডিও রিট্রিভালে সাধারণীকরণ করে. এই কার্যকর ইনিশিয়ালাইজেশনকে শক্তিশালী সূচনা বিন্দু হিসেবে কাজে লাগিয়ে আমরা এরপর পারফরম্যান্স আরও অপ্টিমাইজ করতে এবং স্থিতিশীলতা নিশ্চিত করতে মডেলটি ফাইন-টিউন করেছি. এটি Qwen3-VL বেস মডেল থেকে ফাইন-টিউন করার তুলনায় চূড়ান্ত রিট্রিভাল পারফরম্যান্স উন্নত করে.
এমবেডিং সক্ষমতাগুলো স্থানান্তরিত হওয়ার পর আমরা অ্যালাইনমেন্টে মনোযোগ দিয়েছি. রিট্রিভাল পারফরম্যান্স সর্বাধিক করতে আমরা উপযুক্ত epoch সংখ্যা, batch size, learning rate, LoRA rank এবং dataset mix সহ সতর্ক হাইপার-প্যারামিটার অনুসন্ধান ও ablation study করেছি.
ডেটাসেট হিসেবে আমরা ফাইন-টিউনিংয়ের জন্য VDR, ColPali train set, visrag_syn, এবং visrag_ind বেছে নিয়েছি. ফাইন-টিউনিংয়ের জন্য আমরা UniMax sampling ব্যবহার করেছি. যেহেতু আমরা মডেল মার্জিং প্রয়োগ করেছি এবং বেস মার্জড মডেলটি ইতিমধ্যেই আংশিক রিট্রিভার মাল্টিমোডাল সক্ষমতা উত্তরাধিকারসূত্রে পেয়েছে, আমরা দেখেছি আরও বেশি ডেটাসেটে বাড়ালে পারফরম্যান্স সামান্য কমে যায়; তাই আমরা আরও ডেটাসেটে স্কেল করিনি.
ফাইন-টিউনিংয়ের জন্য আমরা যে হাইপার-প্যারামিটারগুলো বেছে নিয়েছি সেগুলো হলো:
LoRA Rank | 32 |
LoRA Alpha | 32 |
LoRA টার্গেট মডিউল | এমবেডিং ছাড়া ছবি ও টেক্সট উভয়ের সব স্তর |
লার্নিং রেট | 5e-5 |
সর্বোচ্চ ভিজ্যুয়াল টোকেন | 1280 |
প্রশিক্ষণ Epochs | 1 |
গ্লোবাল Batch Size | 512 |
Warmup Ratio | 5% |
ঐতিহাসিকভাবে, “ColBERT-style” টোকেন-স্তরের এমবেডিং ব্যবহার করা মডেলগুলো (যেমন ColPali) অসাধারণ পারফরম্যান্স দিলেও স্টোরেজ খরচ ছিল অত্যন্ত বেশি. প্রতিটি ভিজ্যুয়াল টোকেন ইনডেক্স করার ফলে বিশাল ভেক্টর ডেটাবেস তৈরি হতো, যা এন্টারপ্রাইজ স্কেলের জন্য খুব ব্যয়বহুল ছিল.
অপ্টিমাইজেশন কৌশল: স্টোরেজ খরচ যেন হঠাৎ বেড়ে না যায়, আবার সর্বোচ্চ পারফরম্যান্সও থাকে—এজন্য আমাদের এমবেডিংয়ের আকার সতর্কভাবে ভারসাম্য করে আমরা স্টোরেজ চ্যালেঞ্জ সমাধান করেছি. এই দক্ষ পরিসরে SOTA নির্ভুলতা ধরে রাখতে, আমরা রিট্রিভাল পারফরম্যান্স ও স্টোরেজ খরচের সবচেয়ে ভারসাম্যপূর্ণ মান হিসেবে dim size 320 বেছে নিয়েছি.
বেসলাইন: একটি মানক পদ্ধতিতে (যেমন NVIDIA Nemo-3B) ১ মিলিয়ন ছবির এমবেডিং সংরক্ষণ করতে প্রায় 10.3 TB লাগে (1,802 টোকেন @ 3,072 dims).
ColQwen3: একই ১ মিলিয়ন ছবি মাত্র 0.82 TB-তে সংরক্ষণ করে (সর্বোচ্চ 1,280 টোকেন @ 320 dims).
ColQwen3 ক্লাউড অবকাঠামোর বাজেট ফুলিয়ে না দিয়েই SOTA রিট্রিভাল নির্ভুলতা অর্জন করে.
আমরা ViDoRe বেঞ্চমার্ক স্যুটে আমাদের পদ্ধতিটি যাচাই করেছি. ফলাফল নিশ্চিত করে যে ColQwen3 সর্বশেষ V3 ও V2 বেঞ্চমার্কে (ইংরেজি ও বহুভাষিক উভয়ই) নতুন মানদণ্ড স্থাপন করেছে, পাশাপাশি পুরোনো V1 কাজগুলোতেও শীর্ষ-স্তরের পারফরম্যান্স বজায় রেখেছে.
ColQwen3-8B ইংরেজি ও বহুভাষিক রিট্রিভালে এগিয়ে.
ইংরেজি nDCG@5
মডেল | কম্পিউটার বিজ্ঞান | জ্বালানি | অর্থায়ন | HR | শিল্প | ফার্মা | পদার্থবিদ্যা | গড় |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
বহুভাষিক nDCG@5
মডেল | কম্পিউটার বিজ্ঞান | জ্বালানি | অর্থায়ন | HR | শিল্প | ফার্মা | পদার্থবিদ্যা | গড় |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, অর্থনীতি ও DocVQA জুড়ে ধারাবাহিক উচ্চ পারফরম্যান্স.
বেঞ্চমার্ক | মডেল | স্কোর (গড়) | উল্লেখযোগ্য জয় |
ViDoRe V2 (ইংরেজি) | ColQwen3-8B | 0.6772 | ESG ও BioMed-এ #1 |
ViDoRe V2 (বহুভাষিক) | ColQwen3-8B | 0.6085 | অর্থনীতিতে #1 |
ViDoRe V1 (ইংরেজি) | Nemo ColEmbed 3B | 0.9100 | গড় সামান্য বেশি |
ViDoRe V1 (ইংরেজি) | ColQwen3-8B | 0.9076 | ArxivQA ও Syn-Gov-এ #1 |
ColQwen3 যে ভিডিও রিট্রিভালে শক্তিশালীভাবে সাধারণীকরণ করতে পারে, তা দেখাতে আমরা টেক্সট-টু-ভিডিও (সাধারণ রিট্রিভাল) কাজের জন্য CareBench বেঞ্চমার্কে মডেলগুলো মূল্যায়ন করেছি.
এই মূল্যায়নে আমরা কাঁচা ভিডিও এনকোডিং পদ্ধতি ব্যবহার করেছি: আমাদের মডেলগুলো কোনো অতিরিক্ত টেক্সট অ্যানোটেশন বা মেটাডেটা ইনপুট ছাড়াই সরাসরি ভিডিও ফাইল এনকোড করেছে. এটি কেবল ভিজ্যুয়াল অর্থবস্তুর ভিত্তিতে রিট্রিভাল করার মডেলটির ক্ষমতা তুলে ধরে.
মডেল | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 যে গভীরতম পরিবর্তনগুলোর একটি সম্ভব করেছে, তা হলো ভিডিওকে ডকুমেন্টের মতোই ব্যবহারের ক্ষমতা. অনেক প্রতিষ্ঠানে ভিডিও হলো “ডার্ক ডেটা”. মানুষের হাতে প্রতিটি ফাইল ট্যাগ করা না থাকলে এগুলো কোল্ড স্টোরেজে পড়ে থাকে, একেবারেই অনুসন্ধানযোগ্য নয়.
সেগমেন্ট করা ক্লিপে ফ্রেমভিত্তিক রিট্রিভাল সক্ষম করে ColQwen3 এটি বদলে দেয়.
প্রতিদিন প্রতিষ্ঠানগুলো হাজার হাজার ঘণ্টার অভ্যন্তরীণ ভিডিও মিটিং রেকর্ড করে, আর সাধারণত এসব রেকর্ডিং শূন্যে হারিয়ে যায়.
ওয়ার্কফ্লো: দীর্ঘ মিটিং রেকর্ডিং স্বয়ংক্রিয়ভাবে ছোট, যুক্তিসংগত ক্লিপে ভাগ করে ColQwen3 দিয়ে ইনডেক্স করলে আপনি অনুসন্ধানযোগ্য “কর্পোরেট মেমোরি” তৈরি করেন.
কোয়েরি: একজন প্রকল্প ব্যবস্থাপক জিজ্ঞেস করতে পারেন: “API-এর ল্যাটেন্সি সমস্যাটি ইঞ্জিনিয়ারিং লিড যেখানে ব্যাখ্যা করেছিলেন, সেই ক্লিপটি দেখাও.”
ফলাফল: ৬০ মিনিটের ভিডিও ফাইল ফেরত দেওয়ার বদলে সিস্টেমটি ঠিক সেই ৪৫ সেকেন্ডের অংশটি উদ্ধার করে, যেখানে নির্দিষ্ট ডায়াগ্রামটি স্ক্রিনে দেখানো ও আলোচনা করা হয়েছিল, এমনকি বক্তারা সেই মুহূর্তে “ল্যাটেন্সি” শব্দটি স্পষ্টভাবে না বললেও.
নেটিভ মাল্টিমোডাল এমবেডিংয়ে অগ্রসর হওয়া বিভিন্ন শিল্পে সম্পূর্ণ নতুন ওয়ার্কফ্লো উন্মুক্ত করে. আমরা সবচেয়ে জটিল কিছু এন্টারপ্রাইজ ডেটা পরিবেশের বিপরীতে এই মডেলটি বিস্তৃতভাবে বেঞ্চমার্ক করেছি.
আমরা নগর পরামর্শক প্রতিষ্ঠানগুলোর ডেটা-চ্যালেঞ্জের বিপরীতে ColQwen3 পরীক্ষা করেছি; তারা মাস্টার প্ল্যান, জোনিং মানচিত্র এবং জটিল স্থাপত্য এলিভেশনের বিশাল লাইব্রেরি পরিচালনা করে.
চ্যালেঞ্জ: এসব পরিবেশে প্রচলিত RAG পাইপলাইন হিমশিম খায়. OCR টুলগুলো সাধারণত জটিল সাইট প্ল্যানকে শুধু “স্কিম্যাটিক” বলে ক্যাপশন দেয়, ফলে ট্রাফিক প্রবাহ, সবুজ অঞ্চল বা ভবনের সেটব্যাক সম্পর্কিত গুরুত্বপূর্ণ বিবরণ হারিয়ে যায়.
পারফরম্যান্স: আমাদের অভ্যন্তরীণ বেঞ্চমার্ক দেখায় যে ColQwen3 ব্যয়বহুল OCR/ক্যাপশনিং প্রি-প্রসেসিংয়ের প্রয়োজন কার্যকরভাবে এড়িয়ে যায়. উচ্চ-ঘনত্বের স্থাপত্য অঙ্কন নিয়ে পরীক্ষায়, মডেলটি পথচারী প্রবেশপথ বা স্বতন্ত্র জোনিং সীমানার মতো নির্দিষ্ট ভিজ্যুয়াল মার্কারের ভিত্তিতে সফলভাবে ডকুমেন্ট উদ্ধার করেছে; এতে এটি টেক্সট-ভিত্তিক বেসলাইনের তুলনায় অনেক ভালো করে এবং জ্ঞান ইনজেশন খরচ বড় মাত্রায় কমানোর সম্ভাবনা দেখায়.
ইনভেস্টমেন্ট ব্যাংকার ও বিশ্লেষকেরা বার্ষিক প্রতিবেদন ও ইনভেস্টর ডেক খুঁটিয়ে দেখতে হাজার হাজার ঘণ্টা ব্যয় করেন.
ওয়ার্কফ্লো: একজন বিশ্লেষক জিজ্ঞেস করতে পারেন, “২০২৪ সালের স্লাইড ডেকগুলো থেকে APAC রাজস্ব বনাম EMEA রাজস্বের বিভাজন খুঁজে বের করো.”
পরিবর্তন: কীওয়ার্ড মিলের ওপর নির্ভর না করে, মডেলটি নির্দিষ্ট ডেটা ভিজ্যুয়ালাইজেশনের ভিজ্যুয়াল উপস্থিতির ভিত্তিতে ঠিক সেই স্লাইডটি উদ্ধার করে, ফলে RAG সিস্টেম উচ্চ নির্ভুলতায় প্রশ্নের উত্তর দিতে পারে.
উৎপাদনকারী প্রতিষ্ঠানগুলোর কাছে প্রযুক্তিগত ম্যানুয়াল ও পাইপিং ডায়াগ্রামের (P&IDs) বিশাল লাইব্রেরি থাকে.
ওয়ার্কফ্লো: টারবাইন মেরামতরত একজন ফিল্ড ইঞ্জিনিয়ার কোনো যন্ত্রাংশের ছবি তুলতে পারেন বা জিজ্ঞেস করতে পারেন, “হাইড্রলিক পাম্প অ্যাসেম্বলির ওয়্যারিং ডায়াগ্রাম দেখাও.”
পরিবর্তন: ColQwen3 ওয়্যারিং ডায়াগ্রামের ভিজ্যুয়াল উপস্থাপনাটি শনাক্ত করে সঠিক পৃষ্ঠা উদ্ধার করে, যা সম্ভাব্যভাবে ঘণ্টার পর ঘণ্টা ডাউনটাইম কমাতে পারে.
আইনি ডিসকভারিতে লাখো স্ক্যান করা পৃষ্ঠা পর্যালোচনা করতে হয়, যেখানে “সুঁই”টি প্রায়ই একটি ভিজ্যুয়াল মার্কার.
ওয়ার্কফ্লো: একজন কমপ্লায়েন্স কর্মকর্তা “CFO স্বাক্ষরিত ডকুমেন্ট” বা “অফিশিয়াল ‘Confidential’ স্ট্যাম্প থাকা চুক্তি” খুঁজতে পারেন.
পরিবর্তন: স্বাক্ষর বা স্ট্যাম্পের ভিজ্যুয়াল উপস্থিতির ভিত্তিতে মডেলটি খসড়া ও চূড়ান্ত ডকুমেন্ট আলাদা করতে পারে—যা শুধু OCR প্রায়ই ধরতে পারে না.
ColQwen3 open-weights (Apache 2.0) এবং এখন Hugging Face-এ উপলভ্য. এটি আধুনিক RAG পাইপলাইনের জন্য ড্রপ-ইন আপগ্রেড হিসেবে নকশা করা হয়েছে, যাতে টেক্সট, ছবি ও ভিডিও তাৎক্ষণিকভাবে প্রক্রিয়াকরণের প্রয়োজনীয় ইনফারেন্স কোড দেওয়া আছে.
যেসব এন্টারপ্রাইজ সরল টেক্সট সার্চের বাইরে গিয়ে তাদের ভিজ্যুয়াল সম্পদে আটকে থাকা বুদ্ধিমত্তা উন্মুক্ত করতে প্রস্তুত, তাদের জন্য এটিই নতুন মানদণ্ড.
পরবর্তী ধাপ: মডেল কার্ড দেখুন এবং Hugging Face-এ লাইভ ডেমো চেষ্টা করুন: /-colqwen3-embed-8b এবং /-colqwen3-embed-4b