การสร้างเอเจนต์แชตที่ปลอดภัยสำหรับธุรกิจความเสี่ยงสูง

เมื่อสร้างแชตบอตให้เป็นตัวแทนแบรนด์ แค่ปลอดภัยยังไม่พอ แต่ต้องสื่อสารได้อย่างเป็นตัวตนของแบรนด์อย่างแท้จริงด้วย

บทสรุปสำหรับผู้บริหาร

  • แอปพลิเคชัน LLM ที่เปิดให้สาธารณชนใช้งานอาจทำให้แบรนด์เสี่ยงต่อความเสียหายด้านชื่อเสียงและการเงิน

  • เราใช้ตัวกรองจำแนกประเภทหลายชั้นเพื่อลดอันตรายจากการเจลเบรก LLM และพฤติกรรมที่ไม่พึงประสงค์อื่นๆ ของ LLM

  • เราได้นำแนวทางนี้ไปใช้กับแอปพลิเคชันในระบบใช้งานจริงที่รองรับข้อความวันละ 40,000 ข้อความ และยังเพิ่มขึ้นอย่างต่อเนื่อง

บทนำ

ตลอดปีที่ผ่านมา เราร่วมมือกับผู้พัฒนาเกมชั้นนำเพื่อนำแชตบอต GenAI มาใช้งาน โดยรองรับข้อความจากฐานผู้เล่นซึ่งรวมถึงเด็กๆ ประมาณ 40,000 ข้อความต่อวัน สิ่งสำคัญคือต้องสร้างสมดุลระหว่างความเร็ว ความแม่นยำ ความปลอดภัย และความสนุก

เมื่อสร้างแชตบอตให้เป็นตัวแทนแบรนด์ แค่ปลอดภัยยังไม่พอ แต่ต้องสื่อสารได้อย่างเป็นตัวตนของแบรนด์อย่างแท้จริงด้วย

สำหรับบริษัทเกม นั่นหมายถึงการผสานความปลอดภัยเข้ากับความสนุกและความตื่นเต้นของผู้ใช้ โดยเฉพาะกลุ่มผู้ใช้อายุน้อย

LLM ซึ่งเป็นพื้นฐานของแอปพลิเคชัน GenAI สมัยใหม่มีความยืดหยุ่นสูง จึงประยุกต์ใช้กับปัญหาได้หลากหลาย แต่ก็มีข้อจำกัดกำกับไม่มากพอเช่นกัน นั่นหมายความว่า LLM อาจออกนอกกรอบและส่งคืนข้อความได้สารพัดรูปแบบ ซึ่งบางส่วนอาจไม่เหมาะสม

การเปิดให้สาธารณชนโต้ตอบกับ LLM โดยตรงย่อมนำไปสู่พฤติกรรมที่คาดไม่ถึง และหากไม่มีมาตรการลดความเสี่ยงที่เหมาะสม ก็อาจเกิดความเสี่ยงดังต่อไปนี้

  • “การเจลเบรก” ซึ่งผู้ใช้จงใจชักนำแชตบอตให้สร้างเนื้อหาที่เป็นอันตรายหรือไม่ได้รับอนุญาต (เกร็ดสนุกๆ คือทุกคนเข้าเว็บไซต์นี้เพื่อทดลองเจลเบรก LLM ผ่านเกมได้…) หรือ

  • การแสดงเนื้อหาที่น่ารังเกียจ ล่วงละเมิด หรือเป็นอันตรายโดยไม่ได้ตั้งใจ ในหลายกรณี เหตุการณ์นี้อาจเป็นอันตรายต่อสวัสดิภาพของผู้ใช้ หรือสร้างความเสียหายด้านการเงินและชื่อเสียงแก่ผู้ให้บริการแอป

ภาพรวมความเสี่ยงที่เกิดขึ้นจริง…

พาดหัวข่าวเกี่ยวกับการใช้ LLM ที่ผิดไปจากเจตนา

เหตุการณ์เหล่านี้ตอกย้ำว่า การสร้างและรักษาความปลอดภัยในระบบ GenAI ไม่ใช่สิ่งที่เลือกทำหรือไม่ทำก็ได้ ยิ่งเมื่อมีเด็กเล็กเข้ามาเกี่ยวข้อง ก็ไม่อาจพึ่งพาเพียงข้อความปฏิเสธความรับผิดชอบได้ แต่จำเป็นต้องมีมาตรการป้องกันที่รัดกุมเพื่อให้เนื้อหายังคงเหมาะสม

แนวทางของเรา: การจำแนกประเภทหลายชั้นและการแคชพรอมต์

เช่นเดียวกับระบบ RAG (การสร้างคำตอบเสริมด้วยการค้นคืนข้อมูล) ที่เราพัฒนาให้ลูกค้า เราใช้องค์ประกอบ AI หลายส่วนเพื่อลดความเสี่ยงจากการเจลเบรก พร้อมคงประสิทธิภาพไว้ในระดับสูง

แผนภาพแสดงแนวทางของเรา: การจำแนกประเภทหลายชั้นและการแคชพรอมต์

แผนภาพสถาปัตยกรรมระบบของเราแบบย่อ

เพื่อให้ระบบปลอดภัย เราใช้ตัวจำแนกประเภท LLM กับทั้งข้อมูลขาเข้าและขาออก

  1. การจำแนกประเภทข้อมูลขาเข้า (ทำงานพร้อมกัน)

  • เราใช้สคีมา Pydantic ร่วมกับผลลัพธ์แบบมีโครงสร้างของ LLM เพื่อติดป้ายกำกับคำถามของผู้ใช้ (เช่น SAFE, SUSPICIOUS, CHILD_HARM_RISK และ VIOLENT) นอกจากนี้ยังมีแฟล็กสำหรับระบุการเจลเบรกหรือพฤติกรรมที่ไม่ได้รับอนุญาต

  • การใช้ตัวจำแนกหลายตัวแยกตามหัวข้อให้ประสิทธิภาพดีกว่าตัวจำแนกขนาดใหญ่เพียงตัวเดียวที่พยายาม “ครอบคลุมทุกอย่าง” อย่างชัดเจน

  • ตัวอย่าง few-shot จำนวนมากมีความสำคัญอย่างยิ่ง เพื่อให้ตัวจำแนกแยกแยะระหว่าง “I keep being killed by this character” (กล่าวถึงเหตุการณ์ในเกม) กับ “I am being hurt by my parent” (สัญญาณว่าเด็กอาจถูกทำร้าย) ได้

  • การทำงานร่วมกับลูกค้าและทีมผู้เชี่ยวชาญด้านความน่าเชื่อถือและความปลอดภัยอย่างใกล้ชิด ช่วยให้ตัวจำแนกของเราสะท้อนวิธีที่ทีมเหล่านี้ใช้ประเมินข้อความความเสี่ยงสูงในสถานการณ์จริง

แผนภาพแสดงแนวทางของเรา: การจำแนกประเภทหลายชั้นและการแคชพรอมต์

  1. การสร้างคำตอบ

  • LLM หลักจะสร้างคำตอบเมื่อข้อมูลขาเข้าได้รับการประเมินว่าปลอดภัย

  • มิฉะนั้น ระบบอาจเพิกเฉยต่อข้อความนั้นหากเป็นการเจลเบรก หรือส่งต่อให้เจ้าหน้าที่หากคำถามมีสัญญาณปัญหาด้านความปลอดภัย

  1. การจำแนกประเภทข้อมูลขาออก

  • ก่อนส่งคำตอบออกจากแอปพลิเคชัน เราจะจำแนกคำตอบของโมเดลเป็นขั้นตอนสุดท้ายก่อนส่งมอบ

  • เนื่องจากคำตอบบางส่วนอาจใช้เทคนิค RAG กับข้อมูลที่รวบรวมจากอินเทอร์เน็ต ขั้นตอนนี้จึงช่วยป้องกันการวางยาพิษข้อมูล

  • หากคำตอบมีเนื้อหาที่ไม่ได้รับอนุญาต ระบบจะเข้าควบคุมและแทนที่ด้วยข้อความทั่วไป ในทางปฏิบัติ เราแทบไม่พบกรณีนี้ แต่ยังคงใช้เป็นมาตรการป้องกันเสริมเพื่อให้พฤติกรรมของเอเจนต์เหมาะสมอยู่เสมอ

เพื่อคงไว้ซึ่งความเร็วและต้นทุนที่เข้าถึงได้

  • เราจัดเก็บพรอมต์และบทสนทนาบางส่วนที่ใช้บ่อย พร้อมชุดตัวอย่าง few-shot ที่คัดสรรมาแล้ว

  • การแคชนี้ช่วยให้เราใช้ตัวจำแนกประเภท LLM ได้อย่างรวดเร็วและประหยัด โดยไม่ต้องสร้างบริบทใหม่ทุกครั้ง

แผนภาพแสดงแนวทางของเรา: การจำแนกประเภทหลายชั้นและการแคชพรอมต์

มองไปข้างหน้า: ตัวจำแนกตามหลักธรรมนูญ

งานวิจัยล่าสุดของ Anthropic อธิบายถึง Constitutional Classifiers ซึ่งเป็นระบบที่ใช้ตัวจำแนกเพิ่มเติมซึ่งฝึกด้วยกฎ “ตามหลักธรรมนูญ” เพื่อตรวจจับคำขอที่มุ่งร้ายหรือไม่ปลอดภัย งานวิจัยดังกล่าวรายงานว่า

  • มีความทนทานสูงต่อการทำ red teaming โดยมนุษย์เป็นเวลาหลายพันชั่วโมง

  • มีอัตราการปฏิเสธเกินจำเป็นต่ำมาก และใช้ทรัพยากรประมวลผลเพิ่มเติมในระดับปานกลาง

เรามองเห็นอนาคตที่แนวทางตามหลักธรรมนูญเหล่านี้จะเข้ามาเสริมหรือแม้แต่แทนที่ชั้นการจำแนกแบบเดิม เพื่อป้องกันกลวิธีเจลเบรกที่พัฒนาอยู่เสมอได้ครอบคลุมยิ่งขึ้น

สรุป: บทเรียนที่เราได้รับ

  1. ตัวกรองขนาดเบาที่ทำงานคู่ขนาน

ชั้นการจำแนกช่วยไม่ให้คำถามมุ่งร้ายไปถึงแกนหลักที่สร้างคำตอบ และทำให้มั่นใจว่าจะไม่มีการส่งมอบผลลัพธ์ที่ไม่เหมาะสม

  1. ประสบการณ์ของผู้ใช้เป็นเรื่องสำคัญ

เมื่อคำเตือนและข้อความปฏิเสธสนุก ขี้เล่น และสอดคล้องกับเรื่องราวในโลกของเกม ผู้ใช้ก็มีแนวโน้มยอมรับข้อจำกัดของระบบมากขึ้น

  1. อย่าลดทอนขั้นตอนการทดสอบและติดตามตรวจสอบ

การทำ red teaming เป็นประจำควบคู่กับการติดตามพฤติกรรมผู้เล่นอย่างสม่ำเสมอ จะช่วยให้พบช่องโหว่ก่อนที่ผู้เล่นในวงกว้างจะรับรู้ จากนั้นจึงนำข้อมูลเหล่านี้กลับไปเพิ่มในพรอมต์ของตัวจำแนก few-shot เพื่อป้องกันไม่ให้มีการใช้ช่องโหว่ดังกล่าวในอนาคต ปัจจุบันยังเป็นกระบวนการที่ทำด้วยตนเอง แต่สามารถทำให้เป็นระบบอัตโนมัติได้

สร้างระบบ GenAI ที่ปลอดภัยและน่าสนใจสำหรับอนาคต

ไม่ว่าคุณจะเป็นบริษัทเกม ธนาคาร หรือแม้แต่หน่วยงานภาครัฐ หากต้องการนำแชตบอตบริการลูกค้ามาใช้ในวงกว้าง คุณต้องให้ความสำคัญทั้งกับการออกแบบประสบการณ์ผู้ใช้และความน่าเชื่อถือ

เราสร้างโซลูชันที่ให้บริการลูกค้าโดยตรงสำหรับองค์กรและแบรนด์ที่ให้ความสำคัญกับสิ่งต่อไปนี้

  1. ความปลอดภัยสำคัญที่สุด—แชตบอตต้องมอบคุณค่าแก่ผู้ใช้ พร้อมปกป้องผู้ใช้อย่างเคร่งครัดจากเนื้อหาที่เป็นอันตราย

  2. ชื่อเสียงต้องได้รับการปกป้อง—เราออกแบบการป้องกันหลายชั้นเพื่อรักษาชื่อเสียงของแบรนด์ แม้ผู้ใช้จะพยายามผลักดันระบบให้เกินขีดจำกัด

  3. กฎระเบียบจำกัดทางเลือกของคุณ—เราติดตามแนวทางการปฏิบัติตามข้อกำหนดล่าสุดอยู่เสมอ เพื่อให้คุณขยายโซลูชันได้โดยไม่ต้องกังวลว่าแอปพลิเคชันจะถูกเจลเบรก

ผู้เขียน

Andrew Liubinas