Navigasi utama

Arti model gpt-oss-safeguard OpenAI bagi keamanan AI

Evaluasi awal model gpt-oss-safeguard OpenAI menunjukkan peran model keamanan khusus dalam memperkuat sistem AI produksi.

Selama dua tahun terakhir, kami telah membangun solusi yang dapat ditingkatkan dengan aman hingga melayani jutaan pengguna. Bagian penting dari pekerjaan ini adalah merancang sistem moderasi yang cepat dan akurat. Moderasi yang efektif memungkinkan perusahaan menerapkan solusi AI mutakhir dengan percaya diri, melindungi pengguna akhir dari bahaya, dan menjaga keamanan merek dengan mendeteksi keluaran yang tidak diinginkan sebelum menjadi masalah.

Baru-baru ini, OpenAI merilis model GPT-OSS-Safeguard: versi hasil fine-tuning dari model OSS 20B dan 120B yang diperkenalkan awal tahun ini. Model-model ini dapat menafsirkan kebijakan pengguna secara langsung saat inferensi, sehingga menawarkan pendekatan moderasi konten yang fleksibel dan andal. Model-model ini masih dalam pratinjau riset dan tentunya akan terus disempurnakan seiring waktu.

Menjelang peluncuran ini, kami berkolaborasi dengan OpenAI untuk melakukan evaluasi di dunia nyata sebagai bahan pengembangan model. Dalam artikel ini, kami membagikan wawasan dari kolaborasi tersebut dan membahas arti kemajuan ini bagi masa depan moderasi dalam sistem AI produksi.

Bagaimana moderasi diterapkan dalam produksi saat ini?

Saat ini, solusi moderasi umumnya berupa lapisan perlindungan yang mengelilingi aplikasi. Kami sering menggunakan pola ini dalam penerapan bervolume tinggi yang dapat diakses publik. Untuk pembahasan lebih mendalam, baca blog kami mengenai topik ini di sini.

  1. Klasifikasikan masukan secara paralel (jangan biarkan prompt berbahaya masuk): Pengklasifikasi kecil yang berfokus pada topik tertentu berjalan bersamaan untuk memberi label pada setiap pesan pengguna. Kami mendapati bahwa pengklasifikasi dengan fokus sempit terbukti lebih andal daripada satu pengklasifikasi serbaguna. Contoh few-shot yang dipilih dengan cermat dalam prompt dapat membantu membedakan “I keep getting killed by this boss” (konteks game yang sama sekali tidak berbahaya) dari sinyal bahaya di dunia nyata.

    • Aman → Buat keluaran seperti biasa

    • Jailbreak → Abaikan atau alihkan dengan penolakan yang sesuai dengan karakter merek

    • Risiko keselamatan atau kesejahteraan → eskalasikan kepada manusia dengan konteks lengkap

  2. Klasifikasikan keluaran (jangan kirim jawaban yang buruk): Setiap calon respons diperiksa kembali sebelum dikirim. Langkah ini melindungi dari penyimpangan model, peracunan data RAG, dan kasus khusus kebijakan yang samar, seperti konten berbahaya, paparan PII, atau kebocoran informasi sensitif. Jika ditandai, kami mengganti jawaban buatan LLM dengan pesan aman yang selaras dengan merek atau meneruskannya kepada manusia, alih-alih mengirim sesuatu yang kelak disesali.

  3. Pastikan cepat dan terjangkau: Merancang prompt sebagai komponen yang dapat digunakan kembali memungkinkan Anda menyimpan fragmen prompt, contoh few-shot pengklasifikasi, dan awalan dialog umum dalam cache. Pendekatan ini mengurangi latensi sekaligus biaya pagar pengaman Anda.

  4. Perlakukan keselamatan sebagai bagian dari produk Penolakan dan peringatan ditulis dengan gaya yang sesuai (misalnya, ceria untuk game dan formal untuk keuangan). Ketika UX menghormati maksud pengguna, penerimaan terhadap pagar pengaman meningkat dan upaya jailbreak menurun.

  5. Pantau, lakukan red teaming, dan tindak lanjuti hasilnya Red teaming berkelanjutan dan dasbor keselamatan langsung membantu mendeteksi kemunduran sebelum berdampak pada pengguna. Kami dapat mengajarkan pola serangan baru kepada model dengan menambahkan contoh few-shot dan/atau aturan perutean, sehingga sistem makin sulit ditembus tanpa mengorbankan performa aplikasi.

Tantangan membangun solusi moderasi saat ini

Membangun dan memelihara pagar pengaman yang efektif bukanlah hal mudah.

Dalam praktiknya, diperlukan kolaborasi erat antara pemangku kepentingan utama bisnis dan developer untuk menyusun kebijakan yang jelas. Setelah kebijakan ditetapkan, desain dan perilaku sistem harus dibangun serta disesuaikan.

Kehadiran model penalaran keamanan terbuka seperti gpt-oss-safeguard berpotensi mengatasi sejumlah kendala dalam proses ini dengan menyediakan fondasi moderasi konten yang lebih siap digunakan dan serbaguna.

Potensi model keamanan khusus

Gpt-oss-safeguard dirancang untuk mengatasi sejumlah tantangan yang umum dijumpai saat membangun sistem moderasi masa kini. Model-model kecil dan khusus ini menjalani fine-tuning agar dapat menalar berdasarkan kebijakan target saat inferensi serta mencari konten berbahaya atau sensitif, seperti jailbreak, paparan PII, dan pelanggaran kebijakan lainnya.

Dengan mengintegrasikan penalaran ke dalam proses klasifikasinya, model-model ini menghasilkan moderasi yang lebih akurat, tangguh, dan sulit diakali. Sebagai varian keamanan khusus dari GPT-OSS 20B dan 120B, model-model ini menghadirkan performa keamanan mutakhir dengan persiapan minimal melalui definisi kebijakan khusus.

Yang kami uji

Kami mengevaluasi gpt-oss-safeguard 20B dan 120B pada sejumlah tugas yang menyerupai lingkungan produksi: asisten suara waktu nyata, bot dukungan pemain dalam game, sistem moderasi percakapan proaktif, dan pemindaian toksisitas multibahasa (Spanyol, Prancis, Italia, Portugis, Rusia, dan Turki).

Temuan kami

  • Moderasi suara yang sensitif terhadap latensi: Dalam pengujian suara waktu nyata kami—bayangkan klasifikasi langsung dalam percakapan ketika respons harus dianalisis dan diprioritaskan, seperti moderasi percakapan dalam game—gpt-oss-safeguard-20B memangkas sekitar 80% selisih akurasi antara GPT-OSS-20B dan GPT-5-Mini (0,71 dibandingkan 0,78, naik dari 0,45), dengan latensi yang jauh lebih rendah.

  • Eskalasi dukungan pemain: Dalam triase dukungan pemain, gpt-oss-safeguard-20B memangkas sekitar 90% selisih antara GPT-OSS-20b dan GPT-5-Mini (0,66 dibandingkan 0,67, naik dari 0,57). Model ini juga menghasilkan presisi makro terbaik dalam rangkaian pengujian, recall 88% untuk konten aman, dan presisi 87% dalam mendeteksi pengguna rentan—berguna jika Anda menginginkan eskalasi yang konservatif dan sangat tepercaya tanpa membanjiri peninjau manusia.

  • Moderasi percakapan berskala besar dengan kebijakan kompleks: Dalam evaluasi tersulit kami, yang mengharuskan sistem moderasi menandai pesan dalam game secara proaktif berdasarkan dokumen kebijakan yang kompleks, gpt-oss-safeguard jelas mengungguli tolok ukur OSS dengan peningkatan relatif sekitar 35% dan mampu menangani kebijakan panjang secara efektif. Ini adalah kasus penggunaan yang sangat sensitif dan menuntut recall serta presisi tinggi. Jika recall terlalu rendah, banyak pesan berbahaya akan lolos. Sementara itu, presisi yang rendah akan membuat banyak pesan yang tidak relevan ditandai untuk moderator manusia, sehingga mengalihkan perhatian mereka dari kasus yang benar-benar sulit.

  • Performa multibahasa: Pada dataset toksisitas berimbang dalam enam bahasa, performa gpt-oss-safeguard mendekati GPT-5-Mini, biasanya dengan selisih akurasi 3–5 poin persentase, sementara gpt-oss-safeguard-120B sedikit unggul dalam bahasa Spanyol. Kami mengamati selisih yang sedikit lebih besar pada bahasa dengan sumber daya terbatas seperti bahasa Turki. Namun, secara keseluruhan, performa lintas bahasanya tetap kuat, dengan peningkatan recall yang konsisten saat beralih dari 20B ke 120B.

Kami juga mengamati bahwa model gpt-oss-safeguard bekerja sangat baik pada area moderasi yang biasanya menjadi kelemahan LLM, seperti data PII. Model umum cenderung lebih berfokus pada identifikasi PII dengan format AS dan berkinerja lebih lemah di wilayah lain. Karena itu, kami yakin gpt-oss-safeguard akan membantu menyederhanakan penyiapan moderasi dengan mengurangi ketergantungan pada alat khusus untuk mendeteksi pelanggaran kecil terhadap kebijakan yang tidak dapat ditangani oleh LLM yang lebih umum.

Keunggulan fine-tuning terarah

Evaluasi kami menunjukkan bahwa “model moderasi fondasi” seperti gpt-oss-safeguard-20B dan gpt-oss-safeguard-120B dapat memberi hasil yang jauh lebih baik dengan cepat. Namun, fine-tuning khusus domain tetap menjadi tolok ukur saat sistem menuntut standar keamanan dan kekhususan tertinggi.

Tangkapan layar yang menggambarkan keunggulan fine-tuning terarah.

Untuk kasus penggunaan moderasi dalam game, kami melakukan fine-tuning pada pengklasifikasi Qwen3-0.6B menggunakan fine-tuning dengan supervisi berdasarkan sekitar 10 ribu tindakan moderator dan hasil kebijakan sebelumnya. Model ini jauh mengungguli setiap model dasar yang kami uji untuk tugas ini, dengan akurasi 57% dibandingkan 15% (gpt-oss-safeguard-120B, diperkirakan dari rasio performa GPT-4.1-nano), yakni peningkatan 42 poin atau sekitar 280%. Hasil ini selaras dengan panduan OpenAI bahwa pengklasifikasi khusus yang lebih kecil dan dilatih dengan contoh berlabel dapat mengungguli model pengamanan pada domain tertentu.

Kesimpulannya jelas: ketika kebijakan memiliki banyak nuansa dan kasus khusus, model kecil yang disesuaikan untuk domain tertentu tetap menjadi standar terbaik. Proses fine-tuning menanamkan kebijakan dan kasus khusus Anda langsung ke dalam parameter sehingga perilaku model lebih konsisten dalam lingkungan produksi yang kompleks, dengan latensi dan biaya yang sangat rendah.

Fine-tuning dengan supervisi hanyalah salah satu dari beberapa pendekatan yang dapat digunakan. Teknik pelatihan canggih lainnya, seperti reinforcement learning atau distilasi on-policy, juga dapat dimanfaatkan untuk lebih mengoptimalkan perilaku model.

Keterbatasan fine-tuning

Fine-tuning biasanya membutuhkan banyak data. Dataset untuk melakukan fine-tuning pada pengklasifikasi Qwen3-0.6B ini diberi label secara manual oleh moderator manusia sehingga menjadi sumber acuan yang bersih dan tepercaya.

Dalam banyak proyek, keunggulan berupa data yang kaya ini mungkin belum tersedia pada tahap awal. Karena itu, kami cenderung memandang fine-tuning sebagai pengoptimalan yang dapat dilakukan pada tahap selanjutnya dalam siklus pengembangan solusi. Setelah bentuk solusi stabil dan sejumlah data pengguna nyata terkumpul, developer dapat mulai menggunakan fine-tuning terarah untuk meningkatkan solusi moderasi mereka ke tahap berikutnya.

Penutup

Model moderasi fondasi seperti gpt-oss-safeguard merupakan komponen dasar baru yang andal. Model-model ini berpotensi menyederhanakan desain sistem moderasi secara signifikan sekaligus mengurangi latensi aplikasi waktu nyata. Padukan model-model tersebut dengan pengklasifikasi kecil yang dirancang khusus untuk membangun sistem yang lebih aman dan cepat, dengan lebih sedikit komponen dibandingkan pendekatan berbasis prompt yang memakai model umum berukuran besar.

Jika Anda sedang membangun atau meningkatkan sistem moderasi, pertimbangkan untuk memulai dengan model seperti gpt-oss-safeguard, ukur performanya, lalu tambahkan peningkatan terarah melalui pengklasifikasi khusus—berbasis prompt atau hasil fine-tuning—pada bagian yang masih memiliki kekurangan menurut data.

Ingin mempelajari lebih lanjut? Kirim pesan kepada kami.

Penulis

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke