Ý nghĩa của các mô hình gpt-oss-safeguard của OpenAI đối với an toàn AI

Đánh giá ban đầu về các mô hình gpt-oss-safeguard của OpenAI cho thấy mô hình an toàn chuyên biệt có thể củng cố hệ thống AI sản xuất ở đâu.

Trong hai năm qua, chúng tôi đã xây dựng những giải pháp có thể mở rộng an toàn đến hàng triệu người dùng. Một phần trọng yếu của công việc này là thiết kế các hệ thống kiểm duyệt nhanh chóng và chính xác. Kiểm duyệt hiệu quả giúp doanh nghiệp tự tin triển khai các giải pháp AI tiên tiến, bảo vệ người dùng cuối khỏi tác hại và giữ an toàn cho thương hiệu bằng cách phát hiện nội dung không mong muốn trước khi chúng trở thành vấn đề.

Gần đây, OpenAI đã phát hành các mô hình GPT-OSS-Safeguard: những phiên bản được tinh chỉnh từ các mô hình OSS 20B và 120B ra mắt vào đầu năm nay. Các mô hình này có thể diễn giải trực tiếp chính sách của người dùng trong lúc suy luận, mang đến một phương pháp kiểm duyệt nội dung linh hoạt và mạnh mẽ. Các mô hình này đang ở giai đoạn xem trước phục vụ nghiên cứu, nên chắc chắn sẽ tiếp tục được cải thiện theo thời gian.

Trước khi sản phẩm được phát hành, chúng tôi đã hợp tác với OpenAI và tiến hành các đánh giá trong thực tế để hỗ trợ quá trình phát triển mô hình. Trong bài viết này, chúng tôi chia sẻ những hiểu biết từ quá trình hợp tác đó và tìm hiểu ý nghĩa của các bước tiến này đối với tương lai của hoạt động kiểm duyệt trong các hệ thống AI sản xuất.

Hoạt động kiểm duyệt trong môi trường sản xuất hiện nay diễn ra như thế nào?

Hiện nay, các giải pháp kiểm duyệt thường được triển khai dưới dạng nhiều lớp bảo vệ bao quanh ứng dụng. Chúng tôi thường xuyên áp dụng mô hình này cho các hệ thống công khai có lưu lượng lớn. Để tìm hiểu sâu hơn, bạn có thể đọc bài viết của chúng tôi về chủ đề này tại đây.

  1. Phân loại đồng thời đầu vào (không để câu lệnh xấu lọt vào): Các bộ phân loại nhỏ, chuyên biệt theo chủ đề chạy song song để gắn nhãn từng tin nhắn của người dùng. Chúng tôi nhận thấy các bộ phân loại có phạm vi hẹp đạt độ tin cậy cao hơn rõ rệt so với một bộ phân loại duy nhất xử lý mọi thứ. Các ví dụ ít mẫu được lựa chọn kỹ trong câu lệnh có thể giúp phân biệt giữa “I keep getting killed by this boss” (bối cảnh trò chơi, hoàn toàn vô hại) và một dấu hiệu nguy hại ngoài đời thực.

    • An toàn → Tạo nội dung như bình thường

    • Bẻ khóa → Bỏ qua hoặc chuyển hướng bằng lời từ chối phù hợp với thương hiệu

    • Rủi ro về an toàn hoặc sức khỏe tinh thần → chuyển cho nhân viên xử lý kèm đầy đủ ngữ cảnh

  2. Phân loại đầu ra (không gửi câu trả lời không phù hợp): Mọi câu trả lời dự kiến đều được kiểm tra lại trước khi gửi. Điều này giúp bảo vệ hệ thống trước hiện tượng sai lệch mô hình, dữ liệu RAG bị đầu độc và các trường hợp ngoại lệ tinh vi trong chính sách như nội dung có hại, lộ PII hoặc rò rỉ thông tin nhạy cảm. Nếu bị gắn cờ, chúng tôi thay câu trả lời do LLM tạo ra bằng một thông báo an toàn, phù hợp với thương hiệu hoặc chuyển cho nhân viên xử lý, thay vì gửi đi nội dung có thể khiến mình hối tiếc.

  3. Đảm bảo tốc độ và chi phí hợp lý: Việc xây dựng câu lệnh dưới dạng các khối có thể tái sử dụng cho phép bạn lưu vào bộ nhớ đệm các đoạn câu lệnh, ví dụ ít mẫu của bộ phân loại và phần mở đầu hội thoại thường dùng. Phương pháp này giúp giảm cả độ trễ lẫn chi phí của các lớp bảo vệ.

  4. Xem an toàn là một phần của trải nghiệm sản phẩmLời từ chối và cảnh báo được viết đúng giọng điệu thương hiệu (ví dụ: vui nhộn với trò chơi, trang trọng với tài chính). Khi trải nghiệm người dùng tôn trọng ý định của họ, mức độ chấp nhận các lớp bảo vệ sẽ tăng và số lần tìm cách Bẻ khóa sẽ giảm

  5. Giám sát, kiểm thử đối kháng và khép kín vòng phản hồiHoạt động kiểm thử đội đỏ (red team) liên tục cùng các bảng điều khiển an toàn trực tiếp giúp phát hiện tình trạng suy giảm trước khi ảnh hưởng đến người dùng. Chúng ta có thể dạy mô hình nhận biết mọi dạng tấn công mới bằng cách bổ sung các ví dụ ít mẫu và/hoặc quy tắc định tuyến, nhờ đó hệ thống ngày càng khó bị phá vỡ mà không ảnh hưởng đến hiệu suất ứng dụng.

Thách thức khi xây dựng giải pháp kiểm duyệt hiện nay

Việc xây dựng và duy trì các lớp bảo vệ hiệu quả không hề dễ dàng.

Trên thực tế, quá trình này đòi hỏi sự phối hợp chặt chẽ giữa các bên liên quan chủ chốt trong doanh nghiệp và đội ngũ phát triển để xây dựng chính sách rõ ràng. Sau khi chính sách được xác định, kiến trúc và hành vi của hệ thống phải được xây dựng rồi điều chỉnh.

Sự xuất hiện của các mô hình suy luận an toàn mở như gpt-oss-safeguard có thể giải quyết một số điểm khó trong quy trình này, cung cấp nền tảng kiểm duyệt nội dung linh hoạt và sẵn sàng sử dụng hơn.

Tiềm năng của các mô hình an toàn chuyên biệt

Gpt-oss-safeguard hướng đến giải quyết một số thách thức phổ biến khi xây dựng các hệ thống kiểm duyệt hiện nay. Các mô hình nhỏ, chuyên biệt này được tinh chỉnh để suy luận dựa trên chính sách mục tiêu trong lúc suy luận, nhằm phát hiện nội dung có hại hoặc nhạy cảm như các hành vi Bẻ khóa, lộ PII và những vi phạm chính sách khác.

Bằng cách tích hợp suy luận vào quá trình phân loại, chúng cung cấp khả năng kiểm duyệt chính xác, bền vững và khó bị qua mặt hơn. Là các biến thể an toàn chuyên biệt của GPT-OSS 20B và 120B, chúng mang lại hiệu suất an toàn tiên tiến nhất, đồng thời chỉ cần rất ít công sức thiết lập nhờ các định nghĩa chính sách tùy chỉnh.

Nội dung chúng tôi đã thử nghiệm

Chúng tôi đánh giá gpt-oss-safeguard 20B và 120B trên nhiều tác vụ mô phỏng môi trường sản xuất: trợ lý giọng nói thời gian thực, bot hỗ trợ người chơi trong trò chơi, hệ thống chủ động kiểm duyệt trò chuyện và quy trình rà soát nội dung độc hại đa ngôn ngữ (tiếng Tây Ban Nha, Pháp, Ý, Bồ Đào Nha, Nga và Thổ Nhĩ Kỳ).

Những gì chúng tôi phát hiện

  • Kiểm duyệt giọng nói nhạy cảm với độ trễ: Trong các thử nghiệm giọng nói thời gian thực (chẳng hạn phân loại trực tiếp trong cuộc trò chuyện, nơi câu trả lời phải được phân tích và phân luồng như khi kiểm duyệt trò chuyện trong trò chơi), gpt-oss-safeguard-20B đã thu hẹp khoảng 80% chênh lệch độ chính xác giữa GPT-OSS-20B và GPT-5-Mini (0,71 so với 0,78, tăng từ 0,45), đồng thời có độ trễ thấp hơn đáng kể.

  • Chuyển cấp yêu cầu hỗ trợ người chơi: Trong quá trình phân loại yêu cầu hỗ trợ người chơi, gpt-oss-safeguard-20B đã thu hẹp khoảng 90% chênh lệch giữa GPT-OSS-20b và GPT-5-Mini (0,66 so với 0,67, tăng từ 0,57). Mô hình này cũng đạt độ chính xác vĩ mô cao nhất trong nhóm, độ bao phủ 88% với nội dung lành tính và độ chính xác 87% khi phát hiện người dùng dễ bị tổn thương—hữu ích nếu bạn muốn chuyển cấp thận trọng, có độ tin cậy cao mà không khiến đội ngũ đánh giá bị quá tải.

  • Kiểm duyệt trò chuyện theo chính sách dày đặc ở quy mô lớn: Trong bài đánh giá khắt khe nhất—yêu cầu hệ thống kiểm duyệt chủ động gắn cờ tin nhắn trong trò chơi theo một tài liệu chính sách dày đặc—gpt-oss-safeguard vượt trội rõ rệt so với mức cơ sở OSS, đạt mức cải thiện tương đối khoảng 35% và xử lý hiệu quả các chính sách dài. Đây là trường hợp sử dụng đặc biệt nhạy cảm, đòi hỏi cả độ bao phủ và độ chính xác cao. Nếu độ bao phủ quá thấp, nhiều tin nhắn có hại sẽ bị bỏ sót. Còn độ chính xác thấp sẽ khiến nhiều tin nhắn không liên quan bị gắn cờ để kiểm duyệt viên xem xét, làm phân tán sự chú ý khỏi những trường hợp thực sự khó.

  • Hiệu suất đa ngôn ngữ: Trên một tập dữ liệu cân bằng về nội dung độc hại bằng sáu ngôn ngữ, gpt-oss-safeguard bám sát GPT-5-Mini, thường chỉ chênh 3–5 điểm phần trăm về độ chính xác; riêng gpt-oss-safeguard-120B nhỉnh hơn ở tiếng Tây Ban Nha. Chúng tôi ghi nhận chênh lệch lớn hơn đôi chút ở các ngôn ngữ có ít tài nguyên như tiếng Thổ Nhĩ Kỳ, nhưng nhìn chung hiệu suất xuyên ngôn ngữ vẫn vững vàng, với độ bao phủ tăng ổn định khi chuyển từ 20B lên 120B.

Chúng tôi cũng nhận thấy các mô hình gpt-oss-safeguard hoạt động tốt ở những lĩnh vực mà LLM vốn thường yếu khi kiểm duyệt, chẳng hạn dữ liệu PII. Các mô hình phổ biến thường thiên về nhận diện PII theo kiểu Hoa Kỳ và đạt hiệu suất thấp hơn ở những khu vực địa lý khác. Vì vậy, chúng tôi tin rằng gpt-oss-safeguard sẽ giúp đơn giản hóa việc thiết lập hệ thống kiểm duyệt bằng cách giảm sự phụ thuộc vào các công cụ thiết kế riêng để phát hiện những vi phạm chính sách nhỏ mà các LLM đa dụng hơn không thể xử lý.

Sức mạnh của việc tinh chỉnh có mục tiêu

Như vậy, các đánh giá của chúng tôi đã chứng minh rằng những “mô hình kiểm duyệt nền tảng” như gpt-oss-safeguard-20B và gpt-oss-safeguard-120B có thể nhanh chóng mang lại kết quả đáng kể. Tuy nhiên, các mô hình được tinh chỉnh theo miền cụ thể vẫn là chuẩn mực khi hệ thống đòi hỏi mức độ an toàn và tính đặc thù cao nhất.

Ảnh chụp màn hình minh họa sức mạnh của việc tinh chỉnh có mục tiêu.

Với trường hợp kiểm duyệt trong trò chơi, chúng tôi đã tinh chỉnh một bộ phân loại Qwen3-0.6B bằng phương pháp tinh chỉnh có giám sát trên khoảng 10.000 quyết định trước đây của kiểm duyệt viên và kết quả áp dụng chính sách. Mô hình này vượt trội đáng kể so với mọi mô hình cơ sở mà chúng tôi thử nghiệm cho tác vụ này, đạt độ chính xác 57% so với 15% (gpt-oss-safeguard-120B, ước tính theo tỷ lệ hiệu suất của GPT-4.1-nano), tức tăng 42 điểm phần trăm, tương đương khoảng 280%. Các kết quả này phù hợp với hướng dẫn của OpenAI rằng những bộ phân loại nhỏ, chuyên dụng và được huấn luyện trên các ví dụ có nhãn có thể vượt trội hơn các mô hình bảo vệ trong những miền chuyên biệt.

Kết luận rất rõ ràng: khi chính sách có nhiều sắc thái và trường hợp ngoại lệ, một mô hình nhỏ được tinh chỉnh theo miền vẫn là tiêu chuẩn vàng. Quá trình tinh chỉnh đưa chính sách và các trường hợp ngoại lệ của bạn trực tiếp vào tham số, giúp mô hình hoạt động ổn định hơn trong môi trường sản xuất phức tạp, đồng thời có độ trễ và chi phí cực thấp.

Tinh chỉnh có giám sát chỉ là một trong nhiều phương pháp khả thi để thực hiện điều này. Cũng có thể tận dụng những kỹ thuật huấn luyện mạnh mẽ khác như học tăng cường hoặc chưng cất theo chính sách để tối ưu hóa hơn nữa hành vi của mô hình.

Điểm cần lưu ý khi tinh chỉnh

Tinh chỉnh thường đòi hỏi lượng dữ liệu lớn. Tập dữ liệu dùng để tinh chỉnh bộ phân loại Qwen3-0.6B này được các kiểm duyệt viên con người gắn nhãn thủ công, vì vậy đây là một nguồn dữ liệu chuẩn, sạch và đáng tin cậy.

Trong nhiều dự án, lợi thế về nguồn dữ liệu phong phú này có thể chưa tồn tại ngay từ đầu. Do đó, chúng tôi thường xem tinh chỉnh là một bước tối ưu hóa có thể thực hiện ở giai đoạn sau trong chu kỳ phát triển giải pháp. Sau khi cấu trúc giải pháp đã ổn định và thu thập được một lượng dữ liệu thực tế từ người dùng, các nhà phát triển có thể áp dụng tinh chỉnh có mục tiêu để nâng giải pháp kiểm duyệt lên một tầm cao mới.

Lời kết

Các mô hình kiểm duyệt nền tảng như gpt-oss-safeguard là những khối cấu trúc mới đầy tiềm năng. Chúng có tiềm năng đơn giản hóa đáng kể thiết kế hệ thống kiểm duyệt, đồng thời giảm độ trễ cho các ứng dụng thời gian thực. Kết hợp chúng với các bộ phân loại nhỏ, được thiết kế riêng sẽ giúp bạn xây dựng một hệ thống an toàn hơn, nhanh hơn và có ít thành phần vận hành hơn so với phương pháp dựa trên câu lệnh dùng các mô hình đa dụng lớn.

Nếu đang triển khai hoặc nâng cấp hệ thống kiểm duyệt, hãy cân nhắc bắt đầu với các mô hình như gpt-oss-safeguard, đo lường hiệu suất rồi bổ sung những cải tiến có mục tiêu bằng các bộ phân loại thiết kế riêng (dựa trên câu lệnh hoặc được tinh chỉnh) tại những điểm mà dữ liệu cho thấy còn thiếu sót.

Bạn muốn tìm hiểu thêm? Hãy nhắn tin cho chúng tôi.

Tác giả

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke