Sajrone rong taun kepungkur, kita wis mbangun solusi sing bisa dikembangake kanthi aman nganti jutaan pangguna. Bagéan wigati saka karya iki yaiku ngrancang sistem moderasi sing cepet lan akurat. Moderasi sing efektif ngidini perusahaan ngetrapake solusi AI paling anyar kanthi yakin, nglindhungi pangguna pungkasan saka bebaya, lan njaga keamanan merek kanthi nyegah asil sing ora dikarepake sadurunge dadi masalah.
Bubar iki, OpenAI ngrilis model GPT-OSS-Safeguard: versi 20B lan 120B saka model OSS sing diluncurake sadurunge taun iki lan wis di-fine-tuning. Model-model iki bisa napsirake kabijakan pangguna langsung nalika inferensi, menehi pendekatan sing luwes lan ampuh kanggo moderasi konten. Model-model iki isih ana ing tahap pratinjau riset, mula mesthi bakal terus saya apik.
Kita makarya bareng karo OpenAI sadurunge rilis iki kanthi nindakake evaluasi ing kahanan nyata kanggo ndhukung pangembangan model. Ing artikel iki, kita nuduhake wawasan saka kolaborasi kasebut lan nliti teges kemajuan iki tumrap masa depan moderasi ing sistem AI produksi.
Saiki, solusi moderasi biasane awujud lapisan-lapisan perlindungan sing mbungkus aplikasi. Kita kerep nggunakake pola iki ing implementasi publik kanthi volume dhuwur. Kanggo katrangan luwih jero, wacanen blog kita babagan iki ing kéné.
Klasifikasikake input kanthi paralel (aja nglilani prompt ala mlebu): Klasifikator cilik khusus topik mlaku bebarengan kanggo menehi label saben pesen pangguna. Miturut temuan kita, klasifikator sing fokuse sempit luwih bisa dipercaya kanthi nyata tinimbang siji klasifikator kanggo kabeh perkara. Conto sithik sing dipilih kanthi tliti ing prompt bisa mbantu mbedakake “I keep getting killed by this boss” (konteks game, babar pisan ora mbebayani) saka pratandha bebaya ing donya nyata.
Aman → Gawe asil kaya biasane
Jailbreak → Abaikna utawa tangkis kanthi panolakan sing selaras karo merek
Risiko keamanan utawa karaharjan → eskalasikake menyang manungsa kanthi konteks pepak
Klasifikasikake output (aja ngirim jawaban ala): Saben calon tanggapan dipriksa maneh sadurunge dikirim. Iki nglindhungi saka owahing model, peracunan data RAG, lan kasus pinggiran kabijakan sing ora ketara, kayata konten mbebayani, kabukake PII, utawa bocore informasi sensitif. Yen ditandhani, jawaban sing digawe LLM diganti nganggo pesen aman sing selaras karo merek utawa dieskalasikake menyang manungsa, tinimbang ngirim perkara sing mengko bakal disesali.
Gawe supaya cepet lan murah: Kanthi nyusun prompt minangka komponen sing bisa digunakake maneh, sampeyan bisa nyimpen fragmen prompt, conto sithik kanggo klasifikator, lan ater-ater dialog umum ing cache. Pendekatan iki bisa nyuda latensi lan biaya pagar pengaman sampeyan.
Anggep keamanan minangka bagéan saka produk Panolakan lan pepeling ditulis nganggo gaya sing cocog, kayata nyenengake kanggo game lan resmi kanggo keuangan. Nalika UX ngajeni maksude pangguna, pagar pengaman luwih ditampa lan upaya jailbreak saya suda.
Pantau, tindakake red teaming, lan tutup sikluse Red teaming terus-terusan lan dasbor keamanan langsung mbantu ndeteksi kemunduran sadurunge kena pangguna. Kita bisa mulangake pola serangan anyar apa wae marang model kanthi menehi conto sithik lan/utawa aturan rute tambahan, saengga sistem saya angel dibobol tanpa ngorbanake kinerja aplikasi.
Mbangun lan njaga pagar pengaman sing efektif iku angel.
Ing praktik, iki mbutuhake kolaborasi kanthi tliti antarane para pemangku kepentingan bisnis utama lan pangembang kanggo nggawe kabijakan sing cetha. Sawise kabijakan ditemtokake, rancangan lan prilaku sistem kudu dibangun lan disetel.
Anane model nalar keamanan terbuka kayata gpt-oss-safeguard bisa ngrampungake sawetara kendala ing proses iki lan nyedhiyakake landhesan moderasi konten sing luwih siap digunakake lan serbaguna.
Gpt-oss-safeguard dirancang kanggo ngatasi sawetara tantangan umum nalika mbangun sistem moderasi saiki. Model cilik lan khusus iki di-fine-tuning supaya bisa nggunakake nalar adhedhasar kabijakan sasaran nalika inferensi, kanggo nggoleki konten mbebayani utawa sensitif kayata jailbreak, kabukake PII, lan pelanggaran kabijakan liyane.
Kanthi nggabungake nalar ing proses klasifikasi, model kasebut ngasilake moderasi sing luwih akurat, luwih tangguh, lan luwih angel diliwati. Minangka varian keamanan khusus saka GPT-OSS 20B lan 120B, model-model iki nyedhiyakake kinerja keamanan paling maju kanthi persiyapan minimal liwat definisi kabijakan khusus.
Kita ngevaluasi gpt-oss-safeguard 20B lan 120B ing sawetara tugas sing nggambarake produksi: asisten swara wektu nyata, bot dhukungan pemain ing game, sistem moderasi obrolan proaktif, lan pemeriksaan toksisitas multibasa (Spanyol, Prancis, Italia, Portugis, Rusia, lan Turki).
Moderasi swara sing sensitif marang latensi: Ing tes swara wektu nyata—yaiku klasifikasi langsung ing sajrone obrolan nalika tanggapan kudu dianalisis lan dipilah, kayata moderasi obrolan game—gpt-oss-safeguard-20B nutup watara 80% selisih akurasi antarane GPT-OSS-20B lan GPT-5-Mini (0,71 vs. 0,78, mundhak saka 0,45), kanthi latensi sing luwih endhek banget.
Eskalasi dhukungan pemain: Ing pamilahe dhukungan pemain, gpt-oss-safeguard-20B nutup watara 90% selisih saka GPT-OSS-20b menyang GPT-5-Mini (0,66 vs. 0,67, mundhak saka 0,57). Model iki uga menehi presisi makro paling apik ing set tes, recall 88% kanggo konten sing ora mbebayani, lan presisi 87% kanggo ndeteksi pangguna rentan—migunani yen sampeyan pengin eskalasi sing ati-ati lan bisa dipercaya tanpa mbanjiri pemeriksa manungsa.
Moderasi obrolan kanthi kabijakan padhet ing skala gedhe: Ing evaluasi paling abot, sing mbutuhake sistem moderasi menehi tandha kanthi proaktif marang pesen ing game miturut dokumen kabijakan sing padhet, gpt-oss-safeguard ngluwihi garis dhasar OSS kanthi selisih cetha, ngasilake peningkatan relatif watara 35%, lan bisa nangani kabijakan dawa kanthi efektif. Iki kasus panggunaan sing sensitif banget lan mbutuhake recall lan presisi dhuwur. Yen recall kurang banget, akeh pesen mbebayani ora bakal kadeteksi. Presisi sing kurang uga bakal nyebabake akeh pesen sing ora relevan ditandhani kanggo moderator manungsa, saengga perhatiane buyar saka kasus sing pancen angel.
Kinerja multibasa: Ing set data toksisitas sing imbang kanggo enem basa, kinerja gpt-oss-safeguard cedhak karo GPT-5-Mini, biasane mung beda akurasi 3–5 poin persentase, lan gpt-oss-safeguard-120B rada luwih unggul ing basa Spanyol. Kita ndeleng selisih rada luwih gedhe ing basa kanthi sumber daya winates kayata basa Turki, nanging pola umum nuduhake kinerja lintas basa sing kuwat, kanthi peningkatan recall sing konsisten saka 20B menyang 120B.
Kita uga weruh manawa model gpt-oss-safeguard nduweni kinerja kuwat ing bab sing biasane dadi kekurangane LLM kanggo moderasi, kayata data PII. Model umum cenderung luwih condhong ndeteksi PII gaya AS lan kinerjane luwih ringkih ing wilayah liyane. Mula, kita yakin gpt-oss-safeguard bakal migunani kanggo nyederhanakake persiyapan moderasi kanthi nyuda katergantungan marang piranti khusus kanggo ndeteksi pelanggaran cilik sing ora bisa ditangani LLM kanthi cakupan luwih amba.
Dadi, evaluasi kita mbuktekake manawa “model moderasi dhasar” kayata gpt-oss-safeguard-20B lan gpt-oss-safeguard-120B bisa ngasilake kemajuan gedhe kanthi cepet. Nanging, fine-tuning khusus domain isih dadi pathokan nalika sistem mbutuhake standar keamanan lan kekhususan paling dhuwur.


Kanggo kasus panggunaan moderasi ing game, kita nindakake fine-tuning marang klasifikator Qwen3-0.6B nganggo panyetel diawasi adhedhasar watara 10 ewu tumindak moderator lan asil kabijakan historis. Model iki ngluwihi kabeh model dhasar sing kita uji kanggo tugas iki kanthi selisih gedhe, kanthi akurasi 57% dibandhing 15% (gpt-oss-safeguard-120B, prakiraan saka rasio kinerja GPT-4.1-nano), yaiku mundhak 42 poin utawa watara 280%. Asil iki selaras karo pandhuan OpenAI manawa klasifikator cilik lan khusus sing dilatih nganggo conto berlabel bisa ngluwihi model pengaman ing domain khusus.
Intine cetha: nalika kabijakan nduweni akeh nuansa lan kasus pinggiran, model cilik sing disetel kanggo domain tartamtu tetep dadi standar paling apik. Proses fine-tuning nandur kabijakan lan kasus pinggiran langsung menyang paramèter, saengga prilaku luwih stabil ing kahanan produksi sing ruwet, kanthi latensi lan biaya sing sithik banget.
Panyetel diawasi mung salah siji saka sawetara pendekatan sing bisa digunakake. Teknik latihan liya sing ampuh, kayata sinau penguatan utawa distilasi on-policy, uga bisa digunakake kanggo luwih ngoptimalake prilaku model.
Fine-tuning biasane mbutuhake data akeh. Set data kanggo fine-tuning klasifikator Qwen3-0.6B iki diwenehi label kanthi manual dening moderator manungsa, mula dadi sumber bebener utama sing resik.
Ing akeh proyek, kauntungan saka data sing sugih iki bisa uga durung ana nalika wiwitan. Mula, kita nganggep fine-tuning minangka optimasi sing bisa ditindakake mengko sajrone siklus pangembangan solusi. Sawise wujud solusi wis stabil lan sawetara data pangguna nyata wis diklumpukake, pangembang bisa miwiti fine-tuning kanthi sasaran kanggo ningkatake solusi moderasi.
Model moderasi dhasar kayata gpt-oss-safeguard minangka komponen anyar sing kuwat. Model-model iki bisa nyederhanakake rancangan sistem moderasi kanthi nyata, sinambi nyuda latensi kanggo aplikasi wektu nyata. Yen dipasangake karo klasifikator cilik sing digawe mligi, sampeyan bisa mbangun sistem sing luwih aman lan luwih cepet, kanthi komponen luwih sithik tinimbang pendekatan adhedhasar prompt sing nggunakake model umum gedhe.
Yen saiki sampeyan lagi mbangun utawa nganyari moderasi, coba wiwiti nganggo model kayata gpt-oss-safeguard, ukur kinerjane, banjur tambahake peningkatan kanthi sasaran liwat klasifikator khusus—adhedhasar prompt utawa fine-tuning—ing bagean sing isih kurang miturut data.
Kepengin sinau luwih akeh? Kirimi kita pesen.