ก้าวข้ามข้อความ: ปลดล็อก RAG แบบมัลติโมดัลครบวงจรอย่างแท้จริง

โมเดล embedding แบบมัลติโมดัลช่วยให้ทีมค้นคืนข้อมูลที่เป็นประโยชน์ได้โดยตรงจากเอกสาร รูปภาพ และวิดีโอที่ซับซ้อน

ในช่วงสองปีที่ผ่านมา “RAG” (Retrieval-Augmented Generation) แทบจะมีความหมายพ้องกับข้อความเพียงอย่างเดียว แนวทางมาตรฐานนั้นเรียบง่าย: นำเอกสารมาแยกข้อความ แบ่งเป็นส่วนย่อย แล้วจัดทำดัชนี

แต่โลกขององค์กรไม่ได้ขับเคลื่อนด้วยไฟล์ข้อความล้วน สิ่งที่องค์กรใช้งานจริงคือ PDF ที่ซับซ้อน ชุดสไลด์ที่อัดแน่นด้วยแผนภูมิ แบบ CAD ใบแจ้งหนี้ที่สแกน และคลังวิดีโอขนาดมหาศาลที่เพิ่มขึ้นเรื่อยๆ

มาตรฐานของอุตสาหกรรมที่ใช้ OCR หรือ Vision LLM เพื่อ “บรรยาย” รูปภาพเป็นข้อความก่อนสร้าง embedding กลายเป็นคอขวดขนาดใหญ่ กระบวนการนี้ช้า มีค่าใช้จ่ายสูง และย่อมสูญเสียบริบทเชิงพื้นที่และภาพอันละเอียดของข้อมูลต้นฉบับ หาก AI ของคุณอธิบายภาพที่ซับซ้อนเพียงว่า “พิมพ์เขียว” คุณก็จะค้นหาวาล์วหรือแผนผังการเดินสายเฉพาะจุดภายในภาพนั้นไม่ได้อีกต่อไป

วันนี้ เราเปิดตัวตระกูลโมเดล embedding แบบมัลติโมดัลที่ล้ำสมัย ซึ่งต่อยอดจากสถาปัตยกรรม ColPali และออกแบบมาเพื่อแก้ปัญหานี้ด้วยการรองรับการค้นคืนด้วยภาพแบบครบวงจร

วิศวกรรมเบื้องหลังความมหัศจรรย์: กลยุทธ์การปรับแต่งขั้นสูง

การสร้างระบบค้นคืนแบบมัลติโมดัลที่มีประสิทธิภาพอย่างแท้จริง ไม่ได้ง่ายเพียงแค่นำ Vision-Language Model (VLM) สำเร็จรูปมาใช้ค้นหา เพื่อแก้ความท้าทายที่ขัดขวาง RAG แบบมัลติโมดัลมาโดยตลอดและสร้าง ColQwen3 เราใช้กลยุทธ์การผสานและฝึกโมเดล

1. ถ่ายทอดความสามารถด้าน embedding ด้วยการปรับค่าน้ำหนักการผสาน

แทนที่จะปรับแต่งโมเดลฐานตั้งแต่ต้น เราพัฒนาวิธีถ่ายทอดความรู้ด้านงานค้นคืนจากโมเดล embedding ข้อความที่มีอยู่แล้ว VLM มาตรฐานรู้วิธีอธิบายรูปภาพ แต่ไม่ได้หมายความว่าจะจัดอันดับรูปภาพตามความหมายเทียบกับคำค้นได้

เพื่อเชื่อมช่องว่างนี้ เราใช้กลยุทธ์ปรับค่าน้ำหนักการผสาน จากการทดลอง เราพบว่าความสามารถในการค้นคืนของ Qwen3-Embedding ในปริภูมิแฝงของข้อความสามารถถ่ายทอดสู่ปริภูมิมัลติโมดัลได้โดยตรง และประยุกต์ใช้กับการค้นคืนรูปภาพและวิดีโอได้แม้ยังไม่ได้ฝึกเพิ่มเติมทันที จากการกำหนดค่าเริ่มต้นที่มีประสิทธิภาพนี้ เราจึงปรับแต่งโมเดลเพิ่มเติมเพื่อเพิ่มประสิทธิภาพและความทนทาน แนวทางนี้ช่วยเพิ่มประสิทธิภาพการค้นคืนขั้นสุดท้าย เมื่อเทียบกับการปรับแต่งจากโมเดลฐาน Qwen3-VL

2. การปรับไฮเปอร์พารามิเตอร์อย่างพิถีพิถัน

เมื่อถ่ายทอดความสามารถด้าน embedding แล้ว เรามุ่งเน้นการจัดแนวให้สอดคล้องกัน เราค้นหาไฮเปอร์พารามิเตอร์และทำการศึกษาแบบตัดองค์ประกอบอย่างละเอียด ครอบคลุมจำนวนรอบการฝึก ขนาดแบตช์ อัตราการเรียนรู้ อันดับ LoRA และสัดส่วนชุดข้อมูลที่เหมาะสม เพื่อเพิ่มประสิทธิภาพการค้นคืนสูงสุด

สำหรับชุดข้อมูล เราเลือก VDR, ชุดฝึก ColPali, visrag_syn, และ visrag_ind เพื่อใช้ปรับแต่งโมเดล เราใช้การสุ่มตัวอย่างแบบ UniMax ในการปรับแต่ง เนื่องจากเราใช้การผสานโมเดล และโมเดลฐานที่ผสานแล้วได้รับความสามารถบางส่วนในการค้นคืนแบบมัลติโมดัล เราจึงพบว่าการเพิ่มชุดข้อมูลกลับทำให้ประสิทธิภาพลดลงเล็กน้อย และไม่ได้ขยายจำนวนชุดข้อมูลเพิ่มเติม

ต่อไปนี้คือไฮเปอร์พารามิเตอร์ที่เราเลือกใช้ในการปรับแต่ง:

อันดับ LoRA

32

อัลฟา LoRA

32

โมดูลเป้าหมายของ LoRA

ทุกเลเยอร์ของทั้งภาพและข้อความ ยกเว้น embedding

อัตราการเรียนรู้

5e-5

จำนวน Token ภาพสูงสุด

1280

จำนวนรอบการฝึก

1

ขนาดแบตช์รวม

512

สัดส่วนวอร์มอัป

5%

3. โจทย์ยากของ “ColBERT”: ประสิทธิภาพสูงเทียบกับต้นทุนพื้นที่จัดเก็บ

ที่ผ่านมา โมเดลที่ใช้ embedding ระดับ Token “แบบ ColBERT” เช่น ColPali ให้ประสิทธิภาพยอดเยี่ยม แต่มีต้นทุนพื้นที่จัดเก็บสูงเกินไป การจัดทำดัชนี Token ภาพทุกตัวทำให้ฐานข้อมูลเวกเตอร์มีขนาดมหาศาลและมีค่าใช้จ่ายสูงเกินกว่าจะใช้งานในระดับองค์กร

  • กลยุทธ์การเพิ่มประสิทธิภาพ: เราแก้ปัญหาพื้นที่จัดเก็บด้วยการปรับสมดุลขนาด embedding อย่างรอบคอบ เพื่อรักษาประสิทธิภาพสูงสุดโดยไม่ปล่อยให้ต้นทุนพื้นที่จัดเก็บพุ่งสูง เพื่อรักษาความแม่นยำระดับ SOTA ภายในขนาดที่มีประสิทธิภาพนี้ เราเลือกมิติขนาด 320 อย่างรอบคอบ เพื่อให้สมดุลที่สุดระหว่างประสิทธิภาพการค้นคืนกับต้นทุนพื้นที่จัดเก็บ

    • เกณฑ์อ้างอิง: แนวทางมาตรฐานอย่าง NVIDIA Nemo-3B ต้องใช้พื้นที่ประมาณ 10.3 TB เพื่อจัดเก็บ embedding ของรูปภาพ 1 ล้านภาพ (1,802 Token @ 3,072 มิติ)

    • ColQwen3: จัดเก็บรูปภาพ 1 ล้านภาพเท่ากันโดยใช้พื้นที่เพียง 0.82 TB (สูงสุด 1,280 Token @ 320 มิติ)

ColQwen3 ให้ความแม่นยำในการค้นคืนระดับ SOTA โดยไม่ทำให้งบโครงสร้างพื้นฐานคลาวด์บานปลาย

ผลการประเมิน

เราตรวจสอบความถูกต้องของแนวทางนี้ด้วยชุดเกณฑ์มาตรฐาน ViDoRe ผลลัพธ์ยืนยันว่า ColQwen3 สร้างมาตรฐานใหม่บนเกณฑ์มาตรฐาน V3 และ V2 ล่าสุด ทั้งภาษาอังกฤษและหลายภาษา พร้อมรักษาประสิทธิภาพระดับแนวหน้าในงาน V1 เดิม

ViDoRe v3 (ล่าสุด)

ColQwen3-8B เป็นผู้นำด้านการค้นคืนทั้งภาษาอังกฤษและหลายภาษา

nDCG@5 ภาษาอังกฤษ

โมเดล

วิทยาการคอมพิวเตอร์

พลังงาน

การเงิน

ทรัพยากรบุคคล

อุตสาหกรรม

เภสัชกรรม

ฟิสิกส์

เฉลี่ย

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

nDCG@5 หลายภาษา

โมเดล

วิทยาการคอมพิวเตอร์

พลังงาน

การเงิน

ทรัพยากรบุคคล

อุตสาหกรรม

เภสัชกรรม

ฟิสิกส์

เฉลี่ย

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ผลลัพธ์เด่นของ ViDoRe v2 และ v1

ให้ประสิทธิภาพสูงอย่างสม่ำเสมอใน ESG เศรษฐศาสตร์ และ DocVQA

เกณฑ์มาตรฐาน

โมเดล

คะแนน (เฉลี่ย)

ผลงานเด่น

ViDoRe V2 (อังกฤษ)

ColQwen3-8B

0.6772

อันดับ 1 ใน ESG และ BioMed

ViDoRe V2 (หลายภาษา)

ColQwen3-8B

0.6085

อันดับ 1 ในเศรษฐศาสตร์

ViDoRe V1 (อังกฤษ)

Nemo ColEmbed 3B

0.9100

ค่าเฉลี่ยสูงกว่าเล็กน้อย

ViDoRe V1 (อังกฤษ)

ColQwen3-8B

0.9076

อันดับ 1 ใน ArxivQA และ Syn-Gov

การค้นคืนวิดีโอ: การประเมินด้วย CareBench

เพื่อแสดงให้เห็นว่า ColQwen3 สามารถประยุกต์ใช้กับการค้นคืนวิดีโอได้อย่างมีประสิทธิภาพ เราประเมินโมเดลด้วยเกณฑ์มาตรฐาน CareBench สำหรับงานค้นหาวิดีโอจากข้อความ (General Retrieval)

ในการประเมินนี้ เราใช้แนวทางเข้ารหัสวิดีโอดิบ โดยให้โมเดลเข้ารหัสไฟล์วิดีโอโดยตรงโดยไม่มีคำอธิบายข้อความหรือข้อมูลเมตาเพิ่มเติม ผลลัพธ์นี้ตอกย้ำความสามารถของโมเดลในการค้นคืนโดยอาศัยความหมายเชิงภาพเพียงอย่างเดียว

โมเดล

Recall@1

Recall@5

Recall@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

ปลดล็อก “ข้อมูลมืด”: พรมแดนใหม่แห่งวิดีโอ

หนึ่งในการเปลี่ยนแปลงครั้งสำคัญที่สุดที่ ColQwen3 ทำให้เกิดขึ้น คือความสามารถในการจัดการวิดีโอได้เช่นเดียวกับเอกสาร ในหลายองค์กร วิดีโอคือ “ข้อมูลมืด” ที่ถูกเก็บไว้ในพื้นที่จัดเก็บระยะยาวและค้นหาไม่ได้เลย เว้นแต่จะมีคนติดแท็กแต่ละไฟล์ด้วยตนเอง

ColQwen3 เปลี่ยนสถานการณ์นี้ด้วยการค้นคืนทีละเฟรมจากคลิปที่แบ่งเป็นช่วงแล้ว

เจาะลึกกรณีใช้งาน: คลังความทรงจำขององค์กร

ทุกวัน องค์กรบันทึกวิดีโอการประชุมภายในนับพันชั่วโมง และโดยมากบันทึกเหล่านี้ก็สูญหายไปอย่างไร้ร่องรอย

  • ขั้นตอนการทำงาน: แบ่งบันทึกการประชุมที่ยาวออกเป็นคลิปสั้นตามเนื้อหาโดยอัตโนมัติ แล้วจัดทำดัชนีด้วย ColQwen3 เพื่อสร้าง “ความทรงจำขององค์กร” ที่ค้นหาได้

  • คำค้น: ผู้จัดการโครงการสามารถถามว่า “Show me the clip where the engineering lead explained the latency issue with the API.”

  • ผลลัพธ์: แทนที่จะส่งคืนไฟล์วิดีโอความยาว 60 นาที ระบบจะค้นคืนช่วงเวลา 45 วินาทีที่มีการแสดงและอธิบายแผนภาพนั้นบนหน้าจอได้อย่างแม่นยำ แม้ผู้พูดจะไม่ได้เอ่ยคำว่า “latency” ในวินาทีนั้นโดยตรง

กรณีใช้งานในองค์กร: แก้ปัญหาที่สร้างมูลค่าสูง

การเปลี่ยนมาใช้ embedding แบบมัลติโมดัลโดยตรงช่วยเปิดทางให้เกิดขั้นตอนการทำงานรูปแบบใหม่ในหลากหลายอุตสาหกรรม เราได้ทดสอบโมเดลนี้อย่างครอบคลุมกับสภาพแวดล้อมข้อมูลระดับองค์กรที่ซับซ้อนที่สุดหลายรูปแบบ

1. ผลทดสอบเด่น: ที่ปรึกษาด้านเมืองและสถาปัตยกรรม

เราทดสอบ ColQwen3 กับความท้าทายด้านข้อมูลของบริษัทที่ปรึกษาด้านเมือง ซึ่งต้องบริหารคลังข้อมูลขนาดใหญ่ ทั้งผังแม่บท แผนที่การแบ่งเขต และรูปด้านสถาปัตยกรรมที่ซับซ้อน

  • ความท้าทาย: ไปป์ไลน์ RAG แบบเดิมทำงานได้ไม่ดีในสภาพแวดล้อมเหล่านี้ โดยทั่วไป เครื่องมือ OCR จะอธิบายผังบริเวณที่ซับซ้อนเพียงว่า “แผนผัง” จึงพลาดรายละเอียดสำคัญเกี่ยวกับการจราจร พื้นที่สีเขียว หรือระยะร่นอาคาร

  • ประสิทธิภาพ: เกณฑ์มาตรฐานภายในของเราแสดงให้เห็นว่า ColQwen3 ช่วยลดความจำเป็นในการประมวลผลล่วงหน้าด้วย OCR หรือการสร้างคำบรรยายที่มีค่าใช้จ่ายสูงได้อย่างมีประสิทธิภาพ ในการทดสอบกับแบบสถาปัตยกรรมที่มีข้อมูลหนาแน่น โมเดลสามารถค้นคืนเอกสารจากสัญลักษณ์ภาพเฉพาะ เช่น จุดทางเข้าสำหรับคนเดินเท้าหรือแนวแบ่งเขตที่ชัดเจน โดยทำผลงานเหนือกว่าเกณฑ์อ้างอิงที่ใช้ข้อความเพียงอย่างเดียวอย่างมาก และมีแนวโน้มช่วยลดต้นทุนการนำเข้าความรู้ได้อย่างมหาศาล

2. ข้อมูลเชิงลึกด้านการเงินและตลาดที่ซับซ้อน

วาณิชธนากรและนักวิเคราะห์ใช้เวลานับพันชั่วโมงค้นหาข้อมูลจากรายงานประจำปีและชุดสไลด์สำหรับนักลงทุน

  • ขั้นตอนการทำงาน: นักวิเคราะห์สามารถถามว่า “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”

  • การเปลี่ยนแปลง: แทนที่จะพึ่งพาการจับคู่คีย์เวิร์ด โมเดลจะค้นคืนสไลด์ที่ตรงกันจากการตรวจพบภาพแสดงข้อมูลนั้นโดยเฉพาะ ทำให้ระบบ RAG ตอบคำถามได้อย่างแม่นยำสูง

3. การผลิตภาคอุตสาหกรรมและบริการภาคสนาม

บริษัทผู้ผลิตมีคลังคู่มือทางเทคนิคและแผนผังท่อและเครื่องมือวัด (P&ID) ขนาดใหญ่

  • ขั้นตอนการทำงาน: วิศวกรภาคสนามที่กำลังซ่อมกังหันสามารถถ่ายภาพชิ้นส่วนหรือถามว่า “Show me the wiring diagram for the hydraulic pump assembly.”

  • การเปลี่ยนแปลง: ColQwen3 ระบุภาพของแผนผังการเดินสายและค้นคืนหน้าที่ถูกต้อง ซึ่งอาจช่วยลดเวลาหยุดทำงานได้หลายชั่วโมง

4. กฎหมายและการกำกับดูแล

การสืบค้นพยานหลักฐานทางกฎหมายต้องตรวจสอบหน้าสแกนนับล้านหน้า ซึ่งข้อมูลสำคัญที่ค้นหามักเป็นสัญลักษณ์ภาพ

  • ขั้นตอนการทำงาน: เจ้าหน้าที่กำกับดูแลสามารถค้นหา “Documents signed by the CFO” หรือ “Contracts containing the official ‘Confidential’ stamp.”

  • การเปลี่ยนแปลง: โมเดลแยกแยะเอกสารฉบับร่างกับฉบับสมบูรณ์จากลายเซ็นหรือตราประทับที่ปรากฏให้เห็นได้ ซึ่ง OCR เพียงอย่างเดียวมักตรวจไม่พบ

เริ่มต้นใช้งาน

ColQwen3 เป็นโมเดลแบบเปิดเผยค่าน้ำหนัก (Apache 2.0) และพร้อมใช้งานแล้วบน Hugging Face เราออกแบบให้เป็นการอัปเกรดแบบแทนที่ได้ทันทีสำหรับไปป์ไลน์ RAG สมัยใหม่ พร้อมโค้ดอนุมานที่จำเป็นสำหรับประมวลผลข้อความ รูปภาพ และวิดีโอได้ทันที

สำหรับองค์กรที่พร้อมก้าวข้ามการค้นหาข้อความแบบพื้นฐาน และปลดล็อกข้อมูลเชิงลึกที่ซ่อนอยู่ในสินทรัพย์ภาพ นี่คือมาตรฐานใหม่

ขั้นตอนถัดไป: อ่านเอกสารกำกับโมเดลและทดลองเดโมสดบน Hugging Face: /-colqwen3-embed-8b และ /-colqwen3-embed-4b

ผู้เขียน

Xin HuangและKye Min Tan