টেক্সটের বাইরে: সত্যিকারের মাল্টিমোডাল, এন্ড-টু-এন্ড RAG উন্মোচন

মাল্টিমোডাল এমবেডিং মডেল দলগুলোকে জটিল ডকুমেন্ট, ছবি ও ভিডিও থেকে সরাসরি দরকারি তথ্য উদ্ধার করতে সাহায্য করে.

গত দুই বছর ধরে “RAG” (Retrieval-Augmented Generation) প্রায় একচেটিয়াভাবে টেক্সটের সমার্থক হয়ে আছে. মানক পদ্ধতি সহজ: ডকুমেন্ট নিন, টেক্সট বের করুন, সেটিকে খণ্ডে ভাগ করুন, তারপর ইনডেক্স করুন.

কিন্তু এন্টারপ্রাইজ জগৎ সাধারণ টেক্সট ফাইলে চলে না. এটি চলে জটিল PDF, ঘন চার্টসমৃদ্ধ স্লাইড ডেক, CAD অঙ্কন, স্ক্যান করা ইনভয়েস এবং ক্রমশ আরও বেশি করে ভিডিও ফুটেজের বিশাল আর্কাইভের ওপর.

এটি সামলাতে OCR বা Vision LLM ব্যবহার করে এমবেডিংয়ের আগে একটি ছবিকে টেক্সটে “ক্যাপশন” করার শিল্পমান পদ্ধতি একটি বিশাল বাধা. এটি ধীর, ব্যয়বহুল এবং অবশ্যম্ভাবীভাবে মূল ডেটার সমৃদ্ধ স্থানিক ও ভিজ্যুয়াল প্রেক্ষাপট হারিয়ে ফেলে. আপনার AI যদি কোনো জটিল ভিজ্যুয়ালকে শুধু “একটি ব্লুপ্রিন্ট” বলে বর্ণনা করে, তবে তার ভেতরের নির্দিষ্ট ভালভ বা ওয়্যারিং স্কিম্যাটিক খুঁজে বের করার ক্ষমতা আপনি হারিয়েছেন.

আজ আমরা ColPali আর্কিটেকচারের ওপর ভিত্তি করে তৈরি অত্যাধুনিক মাল্টিমোডাল এমবেডিং মডেলের একটি পরিবার প্রকাশ করছি, যা এন্ড-টু-এন্ড ভিজ্যুয়াল রিট্রিভাল সক্ষম করে এই সমস্যা সমাধানের জন্য নকশা করা হয়েছে.

জাদুর পেছনের প্রকৌশল: উন্নত ফাইন-টিউনিং কৌশল

সত্যিকারের কার্যকর মাল্টিমোডাল রিট্রিভার তৈরি করা কোনো প্রস্তুত Vision-Language Model (VLM) নিয়ে তাকে খুঁজতে বলার মতো সহজ নয়. ঐতিহাসিকভাবে মাল্টিমোডাল RAG-কে পিছিয়ে রাখা চ্যালেঞ্জগুলো সমাধান করে ColQwen3 তৈরি করতে আমরা মডেল মার্জিং ও প্রশিক্ষণ কৌশল ব্যবহার করেছি.

১. টিউন করা মার্জড ওয়েটিংয়ের মাধ্যমে এমবেডিং সক্ষমতা স্থানান্তর

শূন্য থেকে একটি বেস মডেল ফাইন-টিউন করার বদলে, আমরা বিদ্যমান টেক্সটচুয়াল এমবেডিং মডেল থেকে রিট্রিভাল কাজের জ্ঞান স্থানান্তরের একটি পদ্ধতি তৈরি করেছি. একটি সাধারণ VLM ছবি বর্ণনা করতে জানে, কিন্তু কোনো কোয়েরির বিপরীতে সেগুলোকে অর্থগতভাবে র‍্যাঙ্ক করতে সে আবশ্যিকভাবে জানে না.

এই ব্যবধান কমাতে আমরা টিউন করা মার্জড ওয়েটিং কৌশল ব্যবহার করেছি. আমাদের পরীক্ষায় দেখা গেছে, টেক্সটচুয়াল ল্যাটেন্ট স্পেসে Qwen3-Embedding-এর রিট্রিভাল সক্ষমতা সরাসরি মাল্টিমোডাল স্পেসে স্থানান্তর করা যায়, যা তাৎক্ষণিক প্রশিক্ষণ ছাড়াই ছবি ও ভিডিও রিট্রিভালে সাধারণীকরণ করে. এই কার্যকর ইনিশিয়ালাইজেশনকে শক্তিশালী সূচনা বিন্দু হিসেবে কাজে লাগিয়ে আমরা এরপর পারফরম্যান্স আরও অপ্টিমাইজ করতে এবং স্থিতিশীলতা নিশ্চিত করতে মডেলটি ফাইন-টিউন করেছি. এটি Qwen3-VL বেস মডেল থেকে ফাইন-টিউন করার তুলনায় চূড়ান্ত রিট্রিভাল পারফরম্যান্স উন্নত করে.

২. সতর্ক হাইপার-প্যারামিটার টিউনিং

এমবেডিং সক্ষমতাগুলো স্থানান্তরিত হওয়ার পর আমরা অ্যালাইনমেন্টে মনোযোগ দিয়েছি. রিট্রিভাল পারফরম্যান্স সর্বাধিক করতে আমরা উপযুক্ত epoch সংখ্যা, batch size, learning rate, LoRA rank এবং dataset mix সহ সতর্ক হাইপার-প্যারামিটার অনুসন্ধান ও ablation study করেছি.

ডেটাসেট হিসেবে আমরা ফাইন-টিউনিংয়ের জন্য VDR, ColPali train set, visrag_syn, এবং visrag_ind বেছে নিয়েছি. ফাইন-টিউনিংয়ের জন্য আমরা UniMax sampling ব্যবহার করেছি. যেহেতু আমরা মডেল মার্জিং প্রয়োগ করেছি এবং বেস মার্জড মডেলটি ইতিমধ্যেই আংশিক রিট্রিভার মাল্টিমোডাল সক্ষমতা উত্তরাধিকারসূত্রে পেয়েছে, আমরা দেখেছি আরও বেশি ডেটাসেটে বাড়ালে পারফরম্যান্স সামান্য কমে যায়; তাই আমরা আরও ডেটাসেটে স্কেল করিনি.

ফাইন-টিউনিংয়ের জন্য আমরা যে হাইপার-প্যারামিটারগুলো বেছে নিয়েছি সেগুলো হলো:

LoRA Rank

32

LoRA Alpha

32

LoRA টার্গেট মডিউল

এমবেডিং ছাড়া ছবি ও টেক্সট উভয়ের সব স্তর

লার্নিং রেট

5e-5

সর্বোচ্চ ভিজ্যুয়াল টোকেন

1280

প্রশিক্ষণ Epochs

1

গ্লোবাল Batch Size

512

Warmup Ratio

5%

৩. “ColBERT” দোটানা: উচ্চ পারফরম্যান্স বনাম স্টোরেজ খরচ

ঐতিহাসিকভাবে, “ColBERT-style” টোকেন-স্তরের এমবেডিং ব্যবহার করা মডেলগুলো (যেমন ColPali) অসাধারণ পারফরম্যান্স দিলেও স্টোরেজ খরচ ছিল অত্যন্ত বেশি. প্রতিটি ভিজ্যুয়াল টোকেন ইনডেক্স করার ফলে বিশাল ভেক্টর ডেটাবেস তৈরি হতো, যা এন্টারপ্রাইজ স্কেলের জন্য খুব ব্যয়বহুল ছিল.

  • অপ্টিমাইজেশন কৌশল: স্টোরেজ খরচ যেন হঠাৎ বেড়ে না যায়, আবার সর্বোচ্চ পারফরম্যান্সও থাকে—এজন্য আমাদের এমবেডিংয়ের আকার সতর্কভাবে ভারসাম্য করে আমরা স্টোরেজ চ্যালেঞ্জ সমাধান করেছি. এই দক্ষ পরিসরে SOTA নির্ভুলতা ধরে রাখতে, আমরা রিট্রিভাল পারফরম্যান্স ও স্টোরেজ খরচের সবচেয়ে ভারসাম্যপূর্ণ মান হিসেবে dim size 320 বেছে নিয়েছি.

    • বেসলাইন: একটি মানক পদ্ধতিতে (যেমন NVIDIA Nemo-3B) ১ মিলিয়ন ছবির এমবেডিং সংরক্ষণ করতে প্রায় 10.3 TB লাগে (1,802 টোকেন @ 3,072 dims).

    • ColQwen3: একই ১ মিলিয়ন ছবি মাত্র 0.82 TB-তে সংরক্ষণ করে (সর্বোচ্চ 1,280 টোকেন @ 320 dims).

ColQwen3 ক্লাউড অবকাঠামোর বাজেট ফুলিয়ে না দিয়েই SOTA রিট্রিভাল নির্ভুলতা অর্জন করে.

মূল্যায়নের ফলাফল

আমরা ViDoRe বেঞ্চমার্ক স্যুটে আমাদের পদ্ধতিটি যাচাই করেছি. ফলাফল নিশ্চিত করে যে ColQwen3 সর্বশেষ V3 ও V2 বেঞ্চমার্কে (ইংরেজি ও বহুভাষিক উভয়ই) নতুন মানদণ্ড স্থাপন করেছে, পাশাপাশি পুরোনো V1 কাজগুলোতেও শীর্ষ-স্তরের পারফরম্যান্স বজায় রেখেছে.

ViDoRe v3 (সর্বশেষ)

ColQwen3-8B ইংরেজি ও বহুভাষিক রিট্রিভালে এগিয়ে.

ইংরেজি nDCG@5

মডেল

কম্পিউটার বিজ্ঞান

জ্বালানি

অর্থায়ন

HR

শিল্প

ফার্মা

পদার্থবিদ্যা

গড়

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

বহুভাষিক nDCG@5

মডেল

কম্পিউটার বিজ্ঞান

জ্বালানি

অর্থায়ন

HR

শিল্প

ফার্মা

পদার্থবিদ্যা

গড়

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 ও v1-এর মূল দিকগুলো

ESG, অর্থনীতি ও DocVQA জুড়ে ধারাবাহিক উচ্চ পারফরম্যান্স.

বেঞ্চমার্ক

মডেল

স্কোর (গড়)

উল্লেখযোগ্য জয়

ViDoRe V2 (ইংরেজি)

ColQwen3-8B

0.6772

ESG ও BioMed-এ #1

ViDoRe V2 (বহুভাষিক)

ColQwen3-8B

0.6085

অর্থনীতিতে #1

ViDoRe V1 (ইংরেজি)

Nemo ColEmbed 3B

0.9100

গড় সামান্য বেশি

ViDoRe V1 (ইংরেজি)

ColQwen3-8B

0.9076

ArxivQA ও Syn-Gov-এ #1

ভিডিও রিট্রিভাল: CareBench মূল্যায়ন

ColQwen3 যে ভিডিও রিট্রিভালে শক্তিশালীভাবে সাধারণীকরণ করতে পারে, তা দেখাতে আমরা টেক্সট-টু-ভিডিও (সাধারণ রিট্রিভাল) কাজের জন্য CareBench বেঞ্চমার্কে মডেলগুলো মূল্যায়ন করেছি.

এই মূল্যায়নে আমরা কাঁচা ভিডিও এনকোডিং পদ্ধতি ব্যবহার করেছি: আমাদের মডেলগুলো কোনো অতিরিক্ত টেক্সট অ্যানোটেশন বা মেটাডেটা ইনপুট ছাড়াই সরাসরি ভিডিও ফাইল এনকোড করেছে. এটি কেবল ভিজ্যুয়াল অর্থবস্তুর ভিত্তিতে রিট্রিভাল করার মডেলটির ক্ষমতা তুলে ধরে.

মডেল

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“ডার্ক ডেটা” উন্মুক্ত করা: ভিডিওর নতুন সীমান্ত

ColQwen3 যে গভীরতম পরিবর্তনগুলোর একটি সম্ভব করেছে, তা হলো ভিডিওকে ডকুমেন্টের মতোই ব্যবহারের ক্ষমতা. অনেক প্রতিষ্ঠানে ভিডিও হলো “ডার্ক ডেটা”. মানুষের হাতে প্রতিটি ফাইল ট্যাগ করা না থাকলে এগুলো কোল্ড স্টোরেজে পড়ে থাকে, একেবারেই অনুসন্ধানযোগ্য নয়.

সেগমেন্ট করা ক্লিপে ফ্রেমভিত্তিক রিট্রিভাল সক্ষম করে ColQwen3 এটি বদলে দেয়.

ব্যবহারক্ষেত্রের ফোকাস: কর্পোরেট মেমোরি ব্যাংক

প্রতিদিন প্রতিষ্ঠানগুলো হাজার হাজার ঘণ্টার অভ্যন্তরীণ ভিডিও মিটিং রেকর্ড করে, আর সাধারণত এসব রেকর্ডিং শূন্যে হারিয়ে যায়.

  • ওয়ার্কফ্লো: দীর্ঘ মিটিং রেকর্ডিং স্বয়ংক্রিয়ভাবে ছোট, যুক্তিসংগত ক্লিপে ভাগ করে ColQwen3 দিয়ে ইনডেক্স করলে আপনি অনুসন্ধানযোগ্য “কর্পোরেট মেমোরি” তৈরি করেন.

  • কোয়েরি: একজন প্রকল্প ব্যবস্থাপক জিজ্ঞেস করতে পারেন: “API-এর ল্যাটেন্সি সমস্যাটি ইঞ্জিনিয়ারিং লিড যেখানে ব্যাখ্যা করেছিলেন, সেই ক্লিপটি দেখাও.”

  • ফলাফল: ৬০ মিনিটের ভিডিও ফাইল ফেরত দেওয়ার বদলে সিস্টেমটি ঠিক সেই ৪৫ সেকেন্ডের অংশটি উদ্ধার করে, যেখানে নির্দিষ্ট ডায়াগ্রামটি স্ক্রিনে দেখানো ও আলোচনা করা হয়েছিল, এমনকি বক্তারা সেই মুহূর্তে “ল্যাটেন্সি” শব্দটি স্পষ্টভাবে না বললেও.

এন্টারপ্রাইজ ব্যবহারক্ষেত্র: উচ্চ-মূল্যের সমস্যা সমাধান

নেটিভ মাল্টিমোডাল এমবেডিংয়ে অগ্রসর হওয়া বিভিন্ন শিল্পে সম্পূর্ণ নতুন ওয়ার্কফ্লো উন্মুক্ত করে. আমরা সবচেয়ে জটিল কিছু এন্টারপ্রাইজ ডেটা পরিবেশের বিপরীতে এই মডেলটি বিস্তৃতভাবে বেঞ্চমার্ক করেছি.

১. বেঞ্চমার্কের মূল দিক: নগর পরামর্শ ও স্থাপত্য

আমরা নগর পরামর্শক প্রতিষ্ঠানগুলোর ডেটা-চ্যালেঞ্জের বিপরীতে ColQwen3 পরীক্ষা করেছি; তারা মাস্টার প্ল্যান, জোনিং মানচিত্র এবং জটিল স্থাপত্য এলিভেশনের বিশাল লাইব্রেরি পরিচালনা করে.

  • চ্যালেঞ্জ: এসব পরিবেশে প্রচলিত RAG পাইপলাইন হিমশিম খায়. OCR টুলগুলো সাধারণত জটিল সাইট প্ল্যানকে শুধু “স্কিম্যাটিক” বলে ক্যাপশন দেয়, ফলে ট্রাফিক প্রবাহ, সবুজ অঞ্চল বা ভবনের সেটব্যাক সম্পর্কিত গুরুত্বপূর্ণ বিবরণ হারিয়ে যায়.

  • পারফরম্যান্স: আমাদের অভ্যন্তরীণ বেঞ্চমার্ক দেখায় যে ColQwen3 ব্যয়বহুল OCR/ক্যাপশনিং প্রি-প্রসেসিংয়ের প্রয়োজন কার্যকরভাবে এড়িয়ে যায়. উচ্চ-ঘনত্বের স্থাপত্য অঙ্কন নিয়ে পরীক্ষায়, মডেলটি পথচারী প্রবেশপথ বা স্বতন্ত্র জোনিং সীমানার মতো নির্দিষ্ট ভিজ্যুয়াল মার্কারের ভিত্তিতে সফলভাবে ডকুমেন্ট উদ্ধার করেছে; এতে এটি টেক্সট-ভিত্তিক বেসলাইনের তুলনায় অনেক ভালো করে এবং জ্ঞান ইনজেশন খরচ বড় মাত্রায় কমানোর সম্ভাবনা দেখায়.

২. জটিল আর্থিক ও বাজার বুদ্ধিমত্তা

ইনভেস্টমেন্ট ব্যাংকার ও বিশ্লেষকেরা বার্ষিক প্রতিবেদন ও ইনভেস্টর ডেক খুঁটিয়ে দেখতে হাজার হাজার ঘণ্টা ব্যয় করেন.

  • ওয়ার্কফ্লো: একজন বিশ্লেষক জিজ্ঞেস করতে পারেন, “২০২৪ সালের স্লাইড ডেকগুলো থেকে APAC রাজস্ব বনাম EMEA রাজস্বের বিভাজন খুঁজে বের করো.”

  • পরিবর্তন: কীওয়ার্ড মিলের ওপর নির্ভর না করে, মডেলটি নির্দিষ্ট ডেটা ভিজ্যুয়ালাইজেশনের ভিজ্যুয়াল উপস্থিতির ভিত্তিতে ঠিক সেই স্লাইডটি উদ্ধার করে, ফলে RAG সিস্টেম উচ্চ নির্ভুলতায় প্রশ্নের উত্তর দিতে পারে.

৩. শিল্প উৎপাদন ও ফিল্ড সার্ভিস

উৎপাদনকারী প্রতিষ্ঠানগুলোর কাছে প্রযুক্তিগত ম্যানুয়াল ও পাইপিং ডায়াগ্রামের (P&IDs) বিশাল লাইব্রেরি থাকে.

  • ওয়ার্কফ্লো: টারবাইন মেরামতরত একজন ফিল্ড ইঞ্জিনিয়ার কোনো যন্ত্রাংশের ছবি তুলতে পারেন বা জিজ্ঞেস করতে পারেন, “হাইড্রলিক পাম্প অ্যাসেম্বলির ওয়্যারিং ডায়াগ্রাম দেখাও.”

  • পরিবর্তন: ColQwen3 ওয়্যারিং ডায়াগ্রামের ভিজ্যুয়াল উপস্থাপনাটি শনাক্ত করে সঠিক পৃষ্ঠা উদ্ধার করে, যা সম্ভাব্যভাবে ঘণ্টার পর ঘণ্টা ডাউনটাইম কমাতে পারে.

৪. আইন ও কমপ্লায়েন্স

আইনি ডিসকভারিতে লাখো স্ক্যান করা পৃষ্ঠা পর্যালোচনা করতে হয়, যেখানে “সুঁই”টি প্রায়ই একটি ভিজ্যুয়াল মার্কার.

  • ওয়ার্কফ্লো: একজন কমপ্লায়েন্স কর্মকর্তা “CFO স্বাক্ষরিত ডকুমেন্ট” বা “অফিশিয়াল ‘Confidential’ স্ট্যাম্প থাকা চুক্তি” খুঁজতে পারেন.

  • পরিবর্তন: স্বাক্ষর বা স্ট্যাম্পের ভিজ্যুয়াল উপস্থিতির ভিত্তিতে মডেলটি খসড়া ও চূড়ান্ত ডকুমেন্ট আলাদা করতে পারে—যা শুধু OCR প্রায়ই ধরতে পারে না.

শুরু করা

ColQwen3 open-weights (Apache 2.0) এবং এখন Hugging Face-এ উপলভ্য. এটি আধুনিক RAG পাইপলাইনের জন্য ড্রপ-ইন আপগ্রেড হিসেবে নকশা করা হয়েছে, যাতে টেক্সট, ছবি ও ভিডিও তাৎক্ষণিকভাবে প্রক্রিয়াকরণের প্রয়োজনীয় ইনফারেন্স কোড দেওয়া আছে.

যেসব এন্টারপ্রাইজ সরল টেক্সট সার্চের বাইরে গিয়ে তাদের ভিজ্যুয়াল সম্পদে আটকে থাকা বুদ্ধিমত্তা উন্মুক্ত করতে প্রস্তুত, তাদের জন্য এটিই নতুন মানদণ্ড.

পরবর্তী ধাপ: মডেল কার্ড দেখুন এবং Hugging Face-এ লাইভ ডেমো চেষ্টা করুন: /-colqwen3-embed-8b এবং /-colqwen3-embed-4b

লেখক

Xin Huang, Kye Min Tan