Sa nakalipas na dalawang taon, nakabuo kami ng mga solusyong ligtas na lumawak para makapaglingkod sa milyon-milyong user. Mahalagang bahagi ng gawaing ito ang pagdidisenyo ng mabilis at tumpak na mga moderation system. Dahil sa epektibong moderation, buong kumpiyansang makakapag-deploy ang mga kumpanya ng makabagong solusyon sa AI, mapoprotektahan ang mga end user sa pinsala, at mapapanatiling ligtas ang brand sa pamamagitan ng pagsala sa mga hindi kanais-nais na output bago maging problema ang mga ito.
Kamakailan, inilabas ng OpenAI ang kanilang mga modelong GPT-OSS-Safeguard: mga fine-tuned na bersyon ng mga modelong 20B at 120B OSS na ipinakilala noong unang bahagi ng taong ito. Direktang nauunawaan ng mga modelong ito ang patakaran ng user sa oras ng inference, kaya nagbibigay ang mga ito ng naiaangkop at makapangyarihang paraan ng content moderation. Nasa research preview pa ang mga modelong ito, kaya tiyak na patuloy pang huhusay ang mga ito.
Nakipagtulungan kami sa OpenAI bago ang release na ito at nagsagawa ng mga pagsusuri sa totoong paggamit upang makatulong sa pagbuo ng modelo. Sa artikulong ito, ibinabahagi namin ang mga natutuhan mula sa pakikipagtulungang iyon at sinusuri ang kahulugan ng mga pagsulong na ito para sa hinaharap ng moderation sa mga production AI system.
Sa kasalukuyan, karaniwang binubuo ang mga solusyon sa moderation bilang magkakapatong na proteksiyong nakapalibot sa application. Madalas naming gamitin ang paraang ito sa mga pampublikong deployment na napakaraming gumagamit. Para sa mas malalim na talakayan, basahin ang aming blog tungkol dito rito.
Uriin nang sabay-sabay ang mga input (huwag papasukin ang masasamang prompt): Magkakasabay na tumatakbo ang maliliit at partikular-sa-paksang classifier upang lagyan ng label ang bawat mensahe ng user. Nakita naming mas maaasahan nang nasusukat ang mga classifier na makitid ang pokus kaysa sa iisang classifier para sa lahat. Makakatulong ang maingat na piniling mga halimbawang few-shot sa prompt upang matukoy ang pagkakaiba ng “I keep getting killed by this boss” (konteksto ng laro, ganap na hindi nakakapinsala) at isang senyales ng pinsala sa totoong mundo.
Ligtas → Bumuo ng sagot gaya ng dati
Mga jailbreak → Balewalain o ilihis gamit ang pagtangging naaayon sa brand
Mga panganib sa kaligtasan o kapakanan → ipasa sa tao nang may detalyadong konteksto
Uriin ang mga output (huwag maglabas ng masamang sagot): Muling sinusuri ang bawat posibleng sagot bago ito ihatid. Pinoprotektahan nito laban sa model drift, paglalason ng data sa RAG, at maseselang pambihirang kaso sa patakaran gaya ng mapaminsalang content, pagkalantad ng PII, o pagtagas ng sensitibong impormasyon. Kung ma-flag, pinapalitan namin ang sagot na ginawa ng LLM ng isang ligtas at naaayon-sa-brand na mensahe o ipinapasa ito sa tao, sa halip na maglabas ng bagay na pagsisisihan namin.
Gawin itong mabilis at abot-kaya: Sa pagbuo ng mga prompt bilang muling magagamit na bahagi, maaari mong i-cache ang mga fragment ng prompt, mga halimbawang few-shot ng classifier, at karaniwang panimula ng diyalogo. Binabawasan ng paraang ito ang latency at gastos ng iyong mga guardrail.
Ituring ang kaligtasan bilang bahagi ng produktoIsinusulat ang mga pagtanggi at babala sa tinig ng brand—halimbawa, masayahin para sa mga laro at pormal para sa pananalapi. Kapag iginagalang ng UX ang layunin ng user, mas tinatanggap ang mga guardrail at nababawasan ang mga pagtatangka ng jailbreak.
Subaybayan, magsagawa ng red teaming, at kumpletuhin ang feedback loopNakakatulong ang tuloy-tuloy na red teaming at mga live safety dashboard na matukoy ang mga pag-urong bago maapektuhan ang mga user. Maituturo natin sa modelo ang anumang bagong pattern ng pag-atake sa pamamagitan ng karagdagang mga halimbawang few-shot at/o routing rule, kaya mas humihirap sirain ang system habang lumilipas ang panahon nang hindi naaapektuhan ang performance ng application.
Mahirap bumuo at magpanatili ng mga epektibong guardrail.
Sa aktuwal na paggawa, kailangan ng maingat na pagtutulungan ng mahahalagang stakeholder ng negosyo at mga developer upang makabuo ng malinaw na patakaran. Kapag natukoy na ang patakaran, kailangan namang buuin at iangkop ang disenyo at kilos ng system.
May potensyal ang pagdating ng mga bukas na safety reasoning model gaya ng gpt-oss-safeguard na lutasin ang ilang suliranin sa prosesong ito at magbigay ng mas handa at naiaangkop na pundasyon para sa content moderation.
Layunin ng Gpt-oss-safeguard na tugunan ang ilan sa mga karaniwang hamon sa pagbuo ng mga moderation system ngayon. Fine-tuned ang maliliit at espesyalisadong modelong ito upang mangatwiran batay sa isang target na patakaran sa oras ng inference at maghanap ng mapaminsala o sensitibong content gaya ng mga jailbreak, pagkalantad ng PII, at iba pang paglabag sa patakaran.
Sa pagsasama ng pangangatwiran sa proseso ng pag-uuri, nagbibigay ang mga ito ng mas tumpak at matatag na moderation na mas mahirap lusutan. Bilang mga espesyalisadong safety variant ng GPT-OSS 20B at 120B, nagbibigay ang mga ito ng makabagong safety performance habang kaunting setup lang ang kailangan sa pamamagitan ng mga pasadyang depinisyon ng patakaran.
Sinuri namin ang gpt-oss-safeguard 20B at 120B sa ilang gawaing tulad ng aktuwal na production: isang real-time na voice assistant, bot para sa suporta sa player sa loob ng laro, proactive na chat moderation system, at pagsusuri ng toxicity sa maraming wika—Spanish, French, Italian, Portuguese, Russian, at Turkish.
Voice moderation na sensitibo sa latency: Sa aming mga real-time na pagsubok sa boses—live na pag-uuri sa isang usapan kung saan kailangang suriin at i-triage ang sagot, gaya ng moderation ng gameplay chat—napunan ng gpt-oss-safeguard-20B ang humigit-kumulang 80% ng agwat sa katumpakan sa pagitan ng GPT-OSS-20B at GPT-5-Mini (0.71 kumpara sa 0.78, mula sa 0.45), habang tumatakbo nang may napakababang latency.
Pag-escalate ng suporta sa player: Sa pag-triage ng suporta sa player, napunan ng gpt-oss-safeguard-20B ang humigit-kumulang 90% ng agwat mula GPT-OSS-20b hanggang GPT-5-Mini (0.66 kumpara sa 0.67, mula sa 0.57). Nakamit din nito ang pinakamahusay na macro precision sa grupo, 88% recall sa hindi mapaminsalang content, at 87% precision sa pagtukoy ng mga bulnerableng user—kapaki-pakinabang para sa maingat at lubos na mapagkakatiwalaang pag-escalate nang hindi binabaha ng mga kaso ang mga taong reviewer.
Malawakang chat moderation para sa masinsing patakaran: Sa aming pinakamahirap na pagsusuri, kung saan kailangang aktibong i-flag ng moderation system ang mga mensahe sa laro ayon sa isang masinsing dokumento ng patakaran, malinaw na nahigitan ng gpt-oss-safeguard ang OSS baseline, na may humigit-kumulang 35% relatibong pagtaas at epektibong pagproseso sa mahahabang patakaran. Isa itong napakasensitibong sitwasyon ng paggamit na nangangailangan ng mataas na recall at precision. Kung masyadong mababa ang recall, maraming mapaminsalang mensahe ang hindi matutukoy. Kung mababa naman ang precision, maraming walang-kaugnayang mensahe ang mapi-flag para sa mga taong moderator, kaya malilihis ang kanilang pansin mula sa mga tunay na mahihirap na kaso.
Performance sa maraming wika: Sa isang balanseng toxicity dataset sa anim na wika, malapit ang performance ng gpt-oss-safeguard sa GPT-5-Mini—karaniwang 3–5 percentage point lang ang agwat sa katumpakan—at bahagyang nanguna ang gpt-oss-safeguard-120B sa Spanish. Nakakita kami ng bahagyang mas malalaking agwat sa mga wikang mas kakaunti ang mapagkukunan, gaya ng Turkish, ngunit matatag ang pangkalahatang performance sa iba’t ibang wika, at pare-parehong tumaas ang recall mula 20B patungong 120B.
Napansin din naming mahusay ang mga modelong gpt-oss-safeguard sa mga bahaging karaniwang mahina ang mga LLM sa moderation, gaya ng PII data. Mas may pagkiling ang mga pangunahing modelo sa pagtukoy ng PII data na istilong US at mas mahina ang performance sa ibang rehiyon. Dahil dito, naniniwala kaming makakatulong ang gpt-oss-safeguard na pasimplehin ang pag-setup ng moderation sa pamamagitan ng pagbawas sa pag-asa sa mga pasadyang tool para tuklasin ang maliliit na paglabag sa patakarang hindi kayang pangasiwaan ng mas malawak na mga LLM.
Kaya, pinatunayan ng aming mga pagsusuri na malayo at mabilis ang mararating mo gamit ang mga “pundasyong modelo sa moderation” gaya ng gpt-oss-safeguard-20B at gpt-oss-safeguard-120B. Gayunman, ang mga fine-tune na partikular sa isang domain pa rin ang pamantayan kapag kailangan ng mga system ang pinakamataas na antas ng kaligtasan at pagiging partikular.


Para sa moderation sa loob ng laro, nag-fine-tune kami ng Qwen3-0.6B classifier gamit ang pinangangasiwaang pag-fine-tune sa humigit-kumulang 10k dating pagkilos ng mga moderator at resulta ng patakaran. Nahigitan ng modelong ito nang malaki ang bawat base modelong sinubukan namin sa gawaing ito, na may 57% katumpakan kumpara sa 15% (gpt-oss-safeguard-120B, tinantya mula sa ratio ng performance ng GPT-4.1-nano)—pagtaas na +42 puntos o humigit-kumulang 280%. Tugma ang mga resultang ito sa gabay ng OpenAI na maaaring higitan ng mas maliliit at nakalaang classifier na sinanay sa mga may label na halimbawa ang mga safeguard model para sa mga espesyalisadong domain.
Malinaw ang aral: kapag masalimuot ang mga patakaran at maraming pambihirang kaso, isang maliit na modelong iniangkop sa domain pa rin ang pinakamainam na pamantayan. Direktang isinasama ng proseso ng pag-fine-tune ang iyong patakaran at mga pambihirang kaso sa mga parameter, kaya mas matatag ang kilos sa magulong kapaligiran ng production habang napakababa ng latency at gastos.
Isa lamang ang pinangangasiwaang pag-fine-tune sa ilang posibleng paraan para rito. Maaari ding gamitin ang iba pang makapangyarihang diskarte sa pagsasanay, gaya ng pagpapatibay ng pag-aaral o on-policy distillation, upang higit pang i-optimize ang kilos ng modelo.
Karaniwang nangangailangan ng maraming data ang pag-fine-tune. Ang dataset na ginamit sa pag-fine-tune ng Qwen3-0.6B classifier na ito ay manu-manong nilagyan ng label ng mga taong moderator, kaya isa itong malinis at mapagkakatiwalaang batayan ng katotohanan.
Sa maraming proyekto, maaaring wala pa sa simula ang bentahe ng ganito kayamang data. Kaya karaniwan naming itinuturing ang pag-fine-tune bilang pag-optimize na maaaring gawin sa bandang huli ng development cycle ng isang solusyon. Kapag matatag na ang anyo ng solusyon at may nakolekta nang aktuwal na data ng user, maaaring gumamit ang mga developer ng naka-target na pag-fine-tune upang higit pang paghusayin ang kanilang mga solusyon sa moderation.
Mahuhusay na bagong pundasyon ang mga modelo sa moderation gaya ng gpt-oss-safeguard. Malaki ang potensyal nilang pasimplehin ang disenyo ng mga moderation system habang binabawasan ang latency para sa mga real-time na application. Ipagsama ang mga ito sa maliliit at pasadyang classifier upang makabuo ng mas ligtas at mas mabilis na system na mas kaunti ang gumagalaw na bahagi kaysa sa pamamaraang nakabatay sa prompt na gumagamit ng malalaking pangkalahatang modelo.
Kung nagtatayo o nag-a-upgrade ka ng moderation ngayon, isaalang-alang na magsimula sa mga modelong gaya ng gpt-oss-safeguard, sukatin ang performance, at magdagdag ng mga naka-target na pagpapahusay gamit ang mga pasadyang classifier—nakabatay man sa prompt o fine-tuned—kung saan nagpapakita ng mga puwang ang data.
Gusto mo bang matuto pa? Magpadala sa amin ng mensahe.