Xây dựng tác nhân trò chuyện an toàn cho doanh nghiệp có rủi ro cao

Khi tạo chatbot đại diện cho thương hiệu, bạn không chỉ muốn nó an toàn mà còn phải thể hiện đúng bản sắc của mình.

Tóm tắt nội dung chính

  • Các ứng dụng Mô hình ngôn ngữ lớn (LLM) phục vụ công chúng có thể khiến thương hiệu đối mặt với rủi ro về danh tiếng và tài chính.

  • Chúng tôi sử dụng nhiều lớp bộ lọc phân loại để giảm tác hại từ việc bẻ khóa LLM và các hành vi ngoài dự kiến khác của LLM.

  • Chúng tôi đã áp dụng phương pháp này trong một ứng dụng thực tế có lưu lượng lớn, hiện xử lý 40.000 tin nhắn mỗi ngày và vẫn đang tăng.

Giới thiệu

Trong năm qua, chúng tôi đã hợp tác với một nhà phát triển trò chơi hàng đầu để triển khai chatbot AI tạo sinh, xử lý khoảng 40.000 tin nhắn mỗi ngày từ cộng đồng người chơi có cả trẻ em. Điều thiết yếu là phải cân bằng tốc độ, độ chính xác, độ an toàn và tính giải trí:

Khi tạo chatbot đại diện cho thương hiệu, bạn không chỉ muốn nó an toàn mà còn phải thể hiện đúng bản sắc của mình.

Với một công ty trò chơi, điều đó có nghĩa là kết hợp sự an toàn với niềm vui và hứng thú của người dùng—đặc biệt là người dùng nhỏ tuổi.

Các LLM làm nền tảng cho ứng dụng AI tạo sinh hiện đại rất linh hoạt—nhờ đó có thể khái quát hóa tốt cho nhiều bài toán—nhưng cũng chưa được ràng buộc chặt chẽ. Vì vậy, chúng thường có thể đi chệch hướng và trả về nhiều loại văn bản khác nhau, trong đó có nội dung không phù hợp.

Việc cho công chúng tiếp cận trực tiếp một LLM chắc chắn sẽ dẫn đến hành vi ngoài dự kiến và nếu không có biện pháp giảm thiểu phù hợp, có thể gây ra nguy cơ:

Điểm qua những rủi ro trong thực tế…

Các tiêu đề tin tức về việc sử dụng LLM ngoài dự kiến:

Những sự cố này cho thấy việc xây dựng và duy trì tính an toàn trong các hệ thống AI tạo sinh là yêu cầu bắt buộc. Điều này đặc biệt đúng khi có trẻ nhỏ tham gia. Không thể chỉ dựa vào tuyên bố miễn trừ trách nhiệm—cần có các cơ chế bảo vệ vững chắc để duy trì nội dung phù hợp.

Phương pháp của chúng tôi: phân loại nhiều lớp và lưu câu lệnh vào bộ nhớ đệm

Tương tự các hệ thống RAG (Tạo sinh tăng cường truy xuất) mà chúng tôi đã xây dựng cho khách hàng, chúng tôi tận dụng nhiều thành phần AI để giảm nguy cơ bẻ khóa mà vẫn duy trì hiệu suất cao.

Sơ đồ minh họa phương pháp của chúng tôi: phân loại nhiều lớp và lưu câu lệnh vào bộ nhớ đệm.

Sơ đồ kiến trúc đơn giản hóa của hệ thống

Để bảo đảm an toàn cho hệ thống, chúng tôi sử dụng các bộ phân loại LLM cho cả đầu vào lẫn đầu ra:

  1. Phân loại đầu vào (chạy đồng thời)

  • Chúng tôi dùng lược đồ Pydantic cùng đầu ra có cấu trúc của LLM để gắn nhãn truy vấn người dùng (ví dụ: SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, v.v.). Quy trình này cũng bao gồm các cờ để nhận diện hành vi bẻ khóa hoặc hành vi bị cấm.

  • Việc sử dụng nhiều bộ phân loại cho từng chủ đề mang lại hiệu suất cao hơn đáng kể so với một bộ phân loại khổng lồ kiểu “bao quát tất cả”.

  • Một tập hợp phong phú các ví dụ ít mẫu đóng vai trò then chốt để bộ phân loại phân biệt được giữa “I keep being killed by this character” (nói về trò chơi) và “I am being hurt by my parent” (dấu hiệu trẻ em bị xâm hại).

  • Việc hợp tác chặt chẽ với khách hàng cùng các nhóm chuyên trách về lòng tin và an toàn của họ giúp bảo đảm rằng bộ phân loại phản ánh đúng cách họ đánh giá những tin nhắn có rủi ro cao trong thực tế.

Sơ đồ minh họa phương pháp của chúng tôi: phân loại nhiều lớp và lưu câu lệnh vào bộ nhớ đệm.

  1. Tạo phản hồi

  • LLM chính sẽ tạo phản hồi nếu đầu vào được đánh giá là an toàn.

  • Nếu không, hệ thống có thể bỏ qua tin nhắn (trong trường hợp bẻ khóa) hoặc chuyển cho nhân viên xử lý (nếu truy vấn bị gắn cờ về vấn đề an toàn).

  1. Phân loại đầu ra

  • Trước khi phản hồi rời khỏi ứng dụng, chúng tôi phân loại phản hồi của mô hình rồi mới gửi đến người dùng.

  • Do một số phản hồi có thể sử dụng kỹ thuật RAG với dữ liệu thu thập từ Internet, bước này giúp chúng tôi tránh nguy cơ đầu độc dữ liệu.

  • Nếu phản hồi chứa nội dung bị cấm, hệ thống sẽ can thiệp và thay thế bằng một thông báo chung. Trong thực tế, trường hợp này hiếm khi xảy ra, nhưng đây là một lớp bảo vệ thận trọng nhằm bảo đảm hành vi của tác nhân luôn phù hợp.

Để duy trì tốc độ và chi phí hợp lý:

  • Chúng tôi lưu trữ các câu lệnh thường dùng và những đoạn hội thoại chưa hoàn chỉnh, cùng một bộ ví dụ ít mẫu được tuyển chọn.

  • Nhờ cơ chế lưu vào bộ nhớ đệm này, chúng tôi có thể áp dụng các bộ phân loại LLM nhanh chóng và tiết kiệm mà không phải dựng lại ngữ cảnh mỗi lần.

Sơ đồ minh họa phương pháp của chúng tôi: phân loại nhiều lớp và lưu câu lệnh vào bộ nhớ đệm.

Hướng tới tương lai: bộ phân loại hiến định

Một nghiên cứu gần đây của Anthropic mô tả Bộ phân loại hiến định—một hệ thống dựa vào các bộ phân loại bổ sung, được huấn luyện theo những quy tắc “hiến định”, để phát hiện yêu cầu độc hại hoặc không an toàn. Họ báo cáo rằng hệ thống đạt được:

  • Khả năng chống chịu cao trước hàng nghìn giờ kiểm thử đội đỏ (red team) do con người thực hiện.

  • Tỷ lệ từ chối quá mức ở mức tối thiểu và chi phí điện toán bổ sung vừa phải.

Chúng tôi hình dung trong tương lai, những phương pháp hiến định này có thể bổ trợ hoặc thậm chí thay thế các lớp phân loại truyền thống, qua đó tạo ra cơ chế phòng vệ toàn diện hơn trước các chiến thuật bẻ khóa không ngừng biến đổi.

Tóm tắt: những bài học chúng tôi rút ra

  1. Các bộ lọc gọn nhẹ, chạy song song

Các lớp phân loại ngăn truy vấn độc hại tiếp cận lõi tạo sinh ngay từ đầu, đồng thời bảo đảm đầu ra kém chất lượng không bao giờ được gửi đến người dùng.

  1. Trải nghiệm người dùng rất quan trọng

Khi các cảnh báo và lời từ chối mang tính vui nhộn, dí dỏm và gắn với cốt truyện, người dùng sẽ dễ chấp nhận các giới hạn của hệ thống hơn.

  1. Không được xem nhẹ việc kiểm thử và giám sát

Việc kiểm thử đội đỏ (red team) định kỳ, kết hợp với thường xuyên giám sát hành vi của người chơi, sẽ giúp phát hiện lỗ hổng trước khi cộng đồng người chơi biết đến. Sau đó, các lỗ hổng này có thể được đưa trở lại vào câu lệnh ít mẫu của bộ phân loại để ngăn chúng bị khai thác trong tương lai (hiện đây là quy trình thủ công nhưng có thể tự động hóa).

Xây dựng hệ thống AI tạo sinh an toàn và hấp dẫn cho tương lai

Dù là công ty trò chơi, ngân hàng hay cơ quan chính phủ, nếu muốn triển khai chatbot dịch vụ khách hàng trên quy mô lớn, bạn phải chú trọng CẢ thiết kế trải nghiệm người dùng lẫn độ tin cậy.

Chúng tôi xây dựng các giải pháp hướng đến khách hàng cho những tổ chức và thương hiệu cần:

  1. Đặt an toàn lên hàng đầu—chatbot mang lại giá trị cho người dùng, đồng thời bảo vệ họ nghiêm ngặt khỏi nội dung có hại

  2. Bảo vệ danh tiếng—chúng tôi thiết kế nhiều lớp bảo vệ để giữ vững uy tín thương hiệu, ngay cả khi người dùng cố đẩy hệ thống vượt quá giới hạn

  3. Tuân thủ các ràng buộc pháp lý—chúng tôi luôn cập nhật những hướng dẫn tuân thủ mới nhất để bạn có thể mở rộng giải pháp mà không phải lo ứng dụng bị bẻ khóa

Tác giả

Andrew Liubinas