ในช่วงสองปีที่ผ่านมา “RAG” (Retrieval-Augmented Generation) แทบจะมีความหมายพ้องกับข้อความเพียงอย่างเดียว แนวทางมาตรฐานนั้นเรียบง่าย: นำเอกสารมาแยกข้อความ แบ่งเป็นส่วนย่อย แล้วจัดทำดัชนี
แต่โลกขององค์กรไม่ได้ขับเคลื่อนด้วยไฟล์ข้อความล้วน สิ่งที่องค์กรใช้งานจริงคือ PDF ที่ซับซ้อน ชุดสไลด์ที่อัดแน่นด้วยแผนภูมิ แบบ CAD ใบแจ้งหนี้ที่สแกน และคลังวิดีโอขนาดมหาศาลที่เพิ่มขึ้นเรื่อยๆ
มาตรฐานของอุตสาหกรรมที่ใช้ OCR หรือ Vision LLM เพื่อ “บรรยาย” รูปภาพเป็นข้อความก่อนสร้าง embedding กลายเป็นคอขวดขนาดใหญ่ กระบวนการนี้ช้า มีค่าใช้จ่ายสูง และย่อมสูญเสียบริบทเชิงพื้นที่และภาพอันละเอียดของข้อมูลต้นฉบับ หาก AI ของคุณอธิบายภาพที่ซับซ้อนเพียงว่า “พิมพ์เขียว” คุณก็จะค้นหาวาล์วหรือแผนผังการเดินสายเฉพาะจุดภายในภาพนั้นไม่ได้อีกต่อไป
วันนี้ เราเปิดตัวตระกูลโมเดล embedding แบบมัลติโมดัลที่ล้ำสมัย ซึ่งต่อยอดจากสถาปัตยกรรม ColPali และออกแบบมาเพื่อแก้ปัญหานี้ด้วยการรองรับการค้นคืนด้วยภาพแบบครบวงจร
การสร้างระบบค้นคืนแบบมัลติโมดัลที่มีประสิทธิภาพอย่างแท้จริง ไม่ได้ง่ายเพียงแค่นำ Vision-Language Model (VLM) สำเร็จรูปมาใช้ค้นหา เพื่อแก้ความท้าทายที่ขัดขวาง RAG แบบมัลติโมดัลมาโดยตลอดและสร้าง ColQwen3 เราใช้กลยุทธ์การผสานและฝึกโมเดล
แทนที่จะปรับแต่งโมเดลฐานตั้งแต่ต้น เราพัฒนาวิธีถ่ายทอดความรู้ด้านงานค้นคืนจากโมเดล embedding ข้อความที่มีอยู่แล้ว VLM มาตรฐานรู้วิธีอธิบายรูปภาพ แต่ไม่ได้หมายความว่าจะจัดอันดับรูปภาพตามความหมายเทียบกับคำค้นได้
เพื่อเชื่อมช่องว่างนี้ เราใช้กลยุทธ์ปรับค่าน้ำหนักการผสาน จากการทดลอง เราพบว่าความสามารถในการค้นคืนของ Qwen3-Embedding ในปริภูมิแฝงของข้อความสามารถถ่ายทอดสู่ปริภูมิมัลติโมดัลได้โดยตรง และประยุกต์ใช้กับการค้นคืนรูปภาพและวิดีโอได้แม้ยังไม่ได้ฝึกเพิ่มเติมทันที จากการกำหนดค่าเริ่มต้นที่มีประสิทธิภาพนี้ เราจึงปรับแต่งโมเดลเพิ่มเติมเพื่อเพิ่มประสิทธิภาพและความทนทาน แนวทางนี้ช่วยเพิ่มประสิทธิภาพการค้นคืนขั้นสุดท้าย เมื่อเทียบกับการปรับแต่งจากโมเดลฐาน Qwen3-VL
เมื่อถ่ายทอดความสามารถด้าน embedding แล้ว เรามุ่งเน้นการจัดแนวให้สอดคล้องกัน เราค้นหาไฮเปอร์พารามิเตอร์และทำการศึกษาแบบตัดองค์ประกอบอย่างละเอียด ครอบคลุมจำนวนรอบการฝึก ขนาดแบตช์ อัตราการเรียนรู้ อันดับ LoRA และสัดส่วนชุดข้อมูลที่เหมาะสม เพื่อเพิ่มประสิทธิภาพการค้นคืนสูงสุด
สำหรับชุดข้อมูล เราเลือก VDR, ชุดฝึก ColPali, visrag_syn, และ visrag_ind เพื่อใช้ปรับแต่งโมเดล เราใช้การสุ่มตัวอย่างแบบ UniMax ในการปรับแต่ง เนื่องจากเราใช้การผสานโมเดล และโมเดลฐานที่ผสานแล้วได้รับความสามารถบางส่วนในการค้นคืนแบบมัลติโมดัล เราจึงพบว่าการเพิ่มชุดข้อมูลกลับทำให้ประสิทธิภาพลดลงเล็กน้อย และไม่ได้ขยายจำนวนชุดข้อมูลเพิ่มเติม
ต่อไปนี้คือไฮเปอร์พารามิเตอร์ที่เราเลือกใช้ในการปรับแต่ง:
อันดับ LoRA | 32 |
อัลฟา LoRA | 32 |
โมดูลเป้าหมายของ LoRA | ทุกเลเยอร์ของทั้งภาพและข้อความ ยกเว้น embedding |
อัตราการเรียนรู้ | 5e-5 |
จำนวน Token ภาพสูงสุด | 1280 |
จำนวนรอบการฝึก | 1 |
ขนาดแบตช์รวม | 512 |
สัดส่วนวอร์มอัป | 5% |
ที่ผ่านมา โมเดลที่ใช้ embedding ระดับ Token “แบบ ColBERT” เช่น ColPali ให้ประสิทธิภาพยอดเยี่ยม แต่มีต้นทุนพื้นที่จัดเก็บสูงเกินไป การจัดทำดัชนี Token ภาพทุกตัวทำให้ฐานข้อมูลเวกเตอร์มีขนาดมหาศาลและมีค่าใช้จ่ายสูงเกินกว่าจะใช้งานในระดับองค์กร
กลยุทธ์การเพิ่มประสิทธิภาพ: เราแก้ปัญหาพื้นที่จัดเก็บด้วยการปรับสมดุลขนาด embedding อย่างรอบคอบ เพื่อรักษาประสิทธิภาพสูงสุดโดยไม่ปล่อยให้ต้นทุนพื้นที่จัดเก็บพุ่งสูง เพื่อรักษาความแม่นยำระดับ SOTA ภายในขนาดที่มีประสิทธิภาพนี้ เราเลือกมิติขนาด 320 อย่างรอบคอบ เพื่อให้สมดุลที่สุดระหว่างประสิทธิภาพการค้นคืนกับต้นทุนพื้นที่จัดเก็บ
เกณฑ์อ้างอิง: แนวทางมาตรฐานอย่าง NVIDIA Nemo-3B ต้องใช้พื้นที่ประมาณ 10.3 TB เพื่อจัดเก็บ embedding ของรูปภาพ 1 ล้านภาพ (1,802 Token @ 3,072 มิติ)
ColQwen3: จัดเก็บรูปภาพ 1 ล้านภาพเท่ากันโดยใช้พื้นที่เพียง 0.82 TB (สูงสุด 1,280 Token @ 320 มิติ)
ColQwen3 ให้ความแม่นยำในการค้นคืนระดับ SOTA โดยไม่ทำให้งบโครงสร้างพื้นฐานคลาวด์บานปลาย
เราตรวจสอบความถูกต้องของแนวทางนี้ด้วยชุดเกณฑ์มาตรฐาน ViDoRe ผลลัพธ์ยืนยันว่า ColQwen3 สร้างมาตรฐานใหม่บนเกณฑ์มาตรฐาน V3 และ V2 ล่าสุด ทั้งภาษาอังกฤษและหลายภาษา พร้อมรักษาประสิทธิภาพระดับแนวหน้าในงาน V1 เดิม
ColQwen3-8B เป็นผู้นำด้านการค้นคืนทั้งภาษาอังกฤษและหลายภาษา
nDCG@5 ภาษาอังกฤษ
โมเดล | วิทยาการคอมพิวเตอร์ | พลังงาน | การเงิน | ทรัพยากรบุคคล | อุตสาหกรรม | เภสัชกรรม | ฟิสิกส์ | เฉลี่ย |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
nDCG@5 หลายภาษา
โมเดล | วิทยาการคอมพิวเตอร์ | พลังงาน | การเงิน | ทรัพยากรบุคคล | อุตสาหกรรม | เภสัชกรรม | ฟิสิกส์ | เฉลี่ย |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ให้ประสิทธิภาพสูงอย่างสม่ำเสมอใน ESG เศรษฐศาสตร์ และ DocVQA
เกณฑ์มาตรฐาน | โมเดล | คะแนน (เฉลี่ย) | ผลงานเด่น |
ViDoRe V2 (อังกฤษ) | ColQwen3-8B | 0.6772 | อันดับ 1 ใน ESG และ BioMed |
ViDoRe V2 (หลายภาษา) | ColQwen3-8B | 0.6085 | อันดับ 1 ในเศรษฐศาสตร์ |
ViDoRe V1 (อังกฤษ) | Nemo ColEmbed 3B | 0.9100 | ค่าเฉลี่ยสูงกว่าเล็กน้อย |
ViDoRe V1 (อังกฤษ) | ColQwen3-8B | 0.9076 | อันดับ 1 ใน ArxivQA และ Syn-Gov |
เพื่อแสดงให้เห็นว่า ColQwen3 สามารถประยุกต์ใช้กับการค้นคืนวิดีโอได้อย่างมีประสิทธิภาพ เราประเมินโมเดลด้วยเกณฑ์มาตรฐาน CareBench สำหรับงานค้นหาวิดีโอจากข้อความ (General Retrieval)
ในการประเมินนี้ เราใช้แนวทางเข้ารหัสวิดีโอดิบ โดยให้โมเดลเข้ารหัสไฟล์วิดีโอโดยตรงโดยไม่มีคำอธิบายข้อความหรือข้อมูลเมตาเพิ่มเติม ผลลัพธ์นี้ตอกย้ำความสามารถของโมเดลในการค้นคืนโดยอาศัยความหมายเชิงภาพเพียงอย่างเดียว
โมเดล | Recall@1 | Recall@5 | Recall@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
หนึ่งในการเปลี่ยนแปลงครั้งสำคัญที่สุดที่ ColQwen3 ทำให้เกิดขึ้น คือความสามารถในการจัดการวิดีโอได้เช่นเดียวกับเอกสาร ในหลายองค์กร วิดีโอคือ “ข้อมูลมืด” ที่ถูกเก็บไว้ในพื้นที่จัดเก็บระยะยาวและค้นหาไม่ได้เลย เว้นแต่จะมีคนติดแท็กแต่ละไฟล์ด้วยตนเอง
ColQwen3 เปลี่ยนสถานการณ์นี้ด้วยการค้นคืนทีละเฟรมจากคลิปที่แบ่งเป็นช่วงแล้ว
ทุกวัน องค์กรบันทึกวิดีโอการประชุมภายในนับพันชั่วโมง และโดยมากบันทึกเหล่านี้ก็สูญหายไปอย่างไร้ร่องรอย
ขั้นตอนการทำงาน: แบ่งบันทึกการประชุมที่ยาวออกเป็นคลิปสั้นตามเนื้อหาโดยอัตโนมัติ แล้วจัดทำดัชนีด้วย ColQwen3 เพื่อสร้าง “ความทรงจำขององค์กร” ที่ค้นหาได้
คำค้น: ผู้จัดการโครงการสามารถถามว่า “Show me the clip where the engineering lead explained the latency issue with the API.”
ผลลัพธ์: แทนที่จะส่งคืนไฟล์วิดีโอความยาว 60 นาที ระบบจะค้นคืนช่วงเวลา 45 วินาทีที่มีการแสดงและอธิบายแผนภาพนั้นบนหน้าจอได้อย่างแม่นยำ แม้ผู้พูดจะไม่ได้เอ่ยคำว่า “latency” ในวินาทีนั้นโดยตรง
การเปลี่ยนมาใช้ embedding แบบมัลติโมดัลโดยตรงช่วยเปิดทางให้เกิดขั้นตอนการทำงานรูปแบบใหม่ในหลากหลายอุตสาหกรรม เราได้ทดสอบโมเดลนี้อย่างครอบคลุมกับสภาพแวดล้อมข้อมูลระดับองค์กรที่ซับซ้อนที่สุดหลายรูปแบบ
เราทดสอบ ColQwen3 กับความท้าทายด้านข้อมูลของบริษัทที่ปรึกษาด้านเมือง ซึ่งต้องบริหารคลังข้อมูลขนาดใหญ่ ทั้งผังแม่บท แผนที่การแบ่งเขต และรูปด้านสถาปัตยกรรมที่ซับซ้อน
ความท้าทาย: ไปป์ไลน์ RAG แบบเดิมทำงานได้ไม่ดีในสภาพแวดล้อมเหล่านี้ โดยทั่วไป เครื่องมือ OCR จะอธิบายผังบริเวณที่ซับซ้อนเพียงว่า “แผนผัง” จึงพลาดรายละเอียดสำคัญเกี่ยวกับการจราจร พื้นที่สีเขียว หรือระยะร่นอาคาร
ประสิทธิภาพ: เกณฑ์มาตรฐานภายในของเราแสดงให้เห็นว่า ColQwen3 ช่วยลดความจำเป็นในการประมวลผลล่วงหน้าด้วย OCR หรือการสร้างคำบรรยายที่มีค่าใช้จ่ายสูงได้อย่างมีประสิทธิภาพ ในการทดสอบกับแบบสถาปัตยกรรมที่มีข้อมูลหนาแน่น โมเดลสามารถค้นคืนเอกสารจากสัญลักษณ์ภาพเฉพาะ เช่น จุดทางเข้าสำหรับคนเดินเท้าหรือแนวแบ่งเขตที่ชัดเจน โดยทำผลงานเหนือกว่าเกณฑ์อ้างอิงที่ใช้ข้อความเพียงอย่างเดียวอย่างมาก และมีแนวโน้มช่วยลดต้นทุนการนำเข้าความรู้ได้อย่างมหาศาล
วาณิชธนากรและนักวิเคราะห์ใช้เวลานับพันชั่วโมงค้นหาข้อมูลจากรายงานประจำปีและชุดสไลด์สำหรับนักลงทุน
ขั้นตอนการทำงาน: นักวิเคราะห์สามารถถามว่า “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
การเปลี่ยนแปลง: แทนที่จะพึ่งพาการจับคู่คีย์เวิร์ด โมเดลจะค้นคืนสไลด์ที่ตรงกันจากการตรวจพบภาพแสดงข้อมูลนั้นโดยเฉพาะ ทำให้ระบบ RAG ตอบคำถามได้อย่างแม่นยำสูง
บริษัทผู้ผลิตมีคลังคู่มือทางเทคนิคและแผนผังท่อและเครื่องมือวัด (P&ID) ขนาดใหญ่
ขั้นตอนการทำงาน: วิศวกรภาคสนามที่กำลังซ่อมกังหันสามารถถ่ายภาพชิ้นส่วนหรือถามว่า “Show me the wiring diagram for the hydraulic pump assembly.”
การเปลี่ยนแปลง: ColQwen3 ระบุภาพของแผนผังการเดินสายและค้นคืนหน้าที่ถูกต้อง ซึ่งอาจช่วยลดเวลาหยุดทำงานได้หลายชั่วโมง
การสืบค้นพยานหลักฐานทางกฎหมายต้องตรวจสอบหน้าสแกนนับล้านหน้า ซึ่งข้อมูลสำคัญที่ค้นหามักเป็นสัญลักษณ์ภาพ
ขั้นตอนการทำงาน: เจ้าหน้าที่กำกับดูแลสามารถค้นหา “Documents signed by the CFO” หรือ “Contracts containing the official ‘Confidential’ stamp.”
การเปลี่ยนแปลง: โมเดลแยกแยะเอกสารฉบับร่างกับฉบับสมบูรณ์จากลายเซ็นหรือตราประทับที่ปรากฏให้เห็นได้ ซึ่ง OCR เพียงอย่างเดียวมักตรวจไม่พบ
ColQwen3 เป็นโมเดลแบบเปิดเผยค่าน้ำหนัก (Apache 2.0) และพร้อมใช้งานแล้วบน Hugging Face เราออกแบบให้เป็นการอัปเกรดแบบแทนที่ได้ทันทีสำหรับไปป์ไลน์ RAG สมัยใหม่ พร้อมโค้ดอนุมานที่จำเป็นสำหรับประมวลผลข้อความ รูปภาพ และวิดีโอได้ทันที
สำหรับองค์กรที่พร้อมก้าวข้ามการค้นหาข้อความแบบพื้นฐาน และปลดล็อกข้อมูลเชิงลึกที่ซ่อนอยู่ในสินทรัพย์ภาพ นี่คือมาตรฐานใหม่
ขั้นตอนถัดไป: อ่านเอกสารกำกับโมเดลและทดลองเดโมสดบน Hugging Face: /-colqwen3-embed-8b และ /-colqwen3-embed-4b