Per pastaruosius dvejus metus sukūrėme sprendimų, kurie saugiai išplėsti milijonams naudotojų. Svarbi šio darbo dalis buvo greitų ir tikslių moderavimo sistemų kūrimas. Veiksmingas moderavimas leidžia įmonėms užtikrintai diegti pažangiausius DI sprendimus: apsaugoti galutinius naudotojus nuo žalos ir prekės ženklo reputaciją, aptinkant nepageidaujamą sugeneruotą turinį dar prieš jam tampant problema.
Neseniai OpenAI išleido GPT-OSS-Safeguard modelius – papildomai išmokytas šių metų pradžioje pristatytų 20B ir 120B OSS modelių versijas. Šie modeliai gali tiesiogiai interpretuoti naudotojo politiką išvedimo metu, todėl turinį galima moderuoti lanksčiai ir veiksmingai. Šie modeliai pateikiami kaip bandomoji tyrimų versija, todėl laikui bėgant neabejotinai tobulės.
Prieš šį leidimą bendradarbiavome su OpenAI ir atlikome vertinimus realiomis sąlygomis, kad padėtume tobulinti modelį. Šiame straipsnyje dalijamės šio bendradarbiavimo įžvalgomis ir nagrinėjame, ką ši pažanga reiškia moderavimo ateičiai realiai naudojamose DI sistemose.
Šiandien moderavimo sprendimai paprastai kuriami kaip programą gaubiantys apsaugos sluoksniai. Šį modelį dažnai taikome didelės apimties viešai prieinamose sistemose. Jei norite išsamiau susipažinti, skaitykite mūsų tinklaraščio įrašą čia.
Lygiagrečiai klasifikuokite įvestis (nepraleiskite žalingų užklausų): nedideli konkrečioms temoms skirti klasifikatoriai vienu metu žymi kiekvieną naudotojo pranešimą. Nustatėme, kad siauros paskirties klasifikatoriai yra pastebimai patikimesni už vieną universalų klasifikatorių. Kruopščiai parinkti užklausoje naudojami keli pavyzdžiai gali padėti atskirti „I keep getting killed by this boss“ (žaidimo kontekstas, visiškai nepavojinga) nuo realios žalos požymio.
Saugu → generuoti įprastai
Apribojimų apėjimas → nepaisyti arba nukreipti pokalbį prekės ženklo stilių atitinkančiu atsisakymu
Saugos ar gerovės rizika → perduoti žmogui ir pateikti išsamų kontekstą
Klasifikuokite išvestis (nepateikite netinkamo atsakymo): prieš pateikiant kiekvienas galimas atsakymas patikrinamas dar kartą. Tai apsaugo nuo modelio nuokrypio, RAG duomenų apnuodijimo ir subtilių išimtinių politikos atvejų, pavyzdžiui, žalingo turinio, asmens identifikavimo informacijos atskleidimo ar neskelbtinos informacijos nutekinimo. Jei atsakymas pažymimas, užuot pateikę LLM sugeneruotą atsakymą, jį pakeičiame saugiu, prekės ženklą atitinkančiu pranešimu arba perduodame žmogui.
Užtikrinkite greitį ir prieinamą kainą: kuriant užklausas kaip daugkartinio naudojimo komponentus, galima podėlyje saugoti užklausų fragmentus, klasifikatorių pavyzdžius ir dažnas dialogų pradžias. Taip galima sumažinti ir apsaugos priemonių delsą, ir jų sąnaudas.
Saugą laikykite produkto sąsajos dalimiAtsisakymai ir įspėjimai rašomi tinkamu stiliumi, pavyzdžiui, žaismingai žaidimuose ar formaliai finansų srityje. Kai naudotojo patirtis atitinka jo ketinimus, apsaugos priemonės priimamos palankiau, o bandymų apeiti apribojimus mažėja.
Stebėkite, testuokite spragoms nustatyti ir užtikrinkite grįžtamąjį ryšįNuolatinis testavimas spragoms nustatyti ir realiojo laiko saugos suvestinės padeda aptikti regresijas prieš joms paveikiant naudotojus. Pateikdami papildomų pavyzdžių ir (arba) nukreipimo taisyklių, galime išmokyti modelį atpažinti naujus atakų modelius, kad ilgainiui sistemą būtų sunkiau pažeisti nepabloginant programos veikimo.
Sukurti ir prižiūrėti veiksmingas apsaugos priemones sudėtinga.
Praktiškai tam reikia glaudaus pagrindinių verslo suinteresuotųjų šalių ir kūrėjų bendradarbiavimo, kad būtų parengta aiškiai apibrėžta politika. Apibrėžus politiką, reikia sukurti ir suderinti sistemos architektūrą bei elgseną.
Atviri saugos protavimo modeliai, tokie kaip gpt-oss-safeguard, gali pašalinti dalį šio proceso sunkumų ir suteikti universalesnį, beveik iš karto naudoti paruoštą turinio moderavimo pagrindą.
Gpt-oss-safeguard siekia išspręsti kai kuriuos iššūkius, su kuriais dažnai susiduriama kuriant šiuolaikines moderavimo sistemas. Šie nedideli specializuoti modeliai papildomai išmokyti išvedimo metu samprotauti pagal tikslinę politiką ir ieškoti žalingo ar neskelbtino turinio, pavyzdžiui, apribojimų apėjimo, asmens identifikavimo informacijos atskleidimo ir kitų politikos pažeidimų.
Į klasifikavimo procesą įtraukus protavimą, moderavimas tampa tikslesnis, atsparesnis ir sunkiau apeinamas. Tai specializuotos saugos GPT-OSS 20B ir 120B versijos, kurios, apibrėžus pasirinktinę politiką, užtikrina pažangiausią saugos našumą ir reikalauja minimalių diegimo pastangų.
gpt-oss-safeguard 20B ir 120B įvertinome atlikdami kelias realų naudojimą atitinkančias užduotis: realiojo laiko balso asistento, žaidimo žaidėjų palaikymo roboto, aktyvios pokalbių moderavimo sistemos ir daugiakalbio toksiškumo tikrinimo ispanų, prancūzų, italų, portugalų, rusų ir turkų kalbomis.
Delsai jautrus balso moderavimas: atliekant realiojo laiko balso bandymus, kai atsakymą reikia analizuoti ir skirstyti tiesiog pokalbio metu, pavyzdžiui, moderuojant žaidimo pokalbį, gpt-oss-safeguard-20B panaikino apie 80 % tikslumo skirtumo tarp GPT-OSS-20B ir GPT-5-Mini (0,71 ir 0,78, palyginti su ankstesniu 0,45 rezultatu), o jo delsa buvo gerokai mažesnė.
Žaidėjų palaikymo užklausų perdavimas: rūšiuojant žaidėjų palaikymo užklausas, gpt-oss-safeguard-20B panaikino apie 90 % skirtumo tarp GPT-OSS-20b ir GPT-5-Mini (0,66 ir 0,67, palyginti su ankstesniu 0,57 rezultatu). Jis taip pat pasiekė geriausią rinkinyje makrovidutinį preciziškumą, 88 % jautrumą nekenksmingam turiniui ir 87 % preciziškumą nustatant pažeidžiamus naudotojus. Tai naudinga, kai reikia konservatyviai ir patikimai perduoti atvejus neapkraunant juos peržiūrinčių žmonių.
Didelio masto pokalbių moderavimas pagal išsamią politiką: atliekant sudėtingiausią vertinimą, kai moderavimo sistema turėjo aktyviai žymėti žaidimo pranešimus pagal išsamų politikos dokumentą, gpt-oss-safeguard aiškiai pranoko bazinį OSS modelį: santykinis rezultatas pagerėjo apie 35 %, o ilgos politikos buvo apdorojamos veiksmingai. Tai itin jautrus naudojimo atvejis, kuriam reikia didelio jautrumo ir preciziškumo. Jei jautrumas per mažas, daugelis žalingų pranešimų lieka neaptikti. O dėl mažo preciziškumo moderatoriams būtų pažymima daug nesusijusių pranešimų, todėl jie skirtų mažiau dėmesio išties sudėtingiems atvejams.
Daugiakalbis veikimas: naudojant subalansuotą šešių kalbų toksiškumo duomenų rinkinį, gpt-oss-safeguard rezultatai buvo artimi GPT-5-Mini – tikslumas paprastai skyrėsi 3–5 proc. punktais, o ispanų kalba gpt-oss-safeguard-120B šiek tiek pirmavo. Mažiau išteklių turinčioms kalboms, pavyzdžiui, turkų, pastebėjome šiek tiek didesnių skirtumų, tačiau apskritai rezultatai skirtingomis kalbomis buvo geri, o pereinant nuo 20B prie 120B jautrumas nuosekliai didėjo.
Taip pat pastebėjome, kad gpt-oss-safeguard modeliai gerai veikia tose moderavimo srityse, kuriose LLM tradiciškai būna silpnesni, pavyzdžiui, aptinkant asmens identifikavimo informaciją. Įprasti modeliai dažniau atpažįsta JAV būdingą tokio pobūdžio informaciją, o kitų regionų duomenis aptinka prasčiau. Todėl manome, kad gpt-oss-safeguard padės supaprastinti moderavimo sistemų diegimą, nes sumažins priklausomybę nuo specialių įrankių, skirtų aptikti smulkiems politikos pažeidimams, kurių bendresnės paskirties LLM neįveikia.
Taigi, mūsų vertinimai parodė, kad tokie baziniai moderavimo modeliai kaip gpt-oss-safeguard-20B ir gpt-oss-safeguard-120B leidžia greitai pasiekti gerų rezultatų. Vis dėlto, kai sistemoms keliami aukščiausi saugos ir konkretumo reikalavimai, specialiai konkrečiai sričiai papildomai išmokyti modeliai tebėra etalonas.


Žaidimų moderavimo atvejui Qwen3-0.6B klasifikatorių suderinome taikydami prižiūrimą suderinimą ir naudodami apie 10 tūkst. ankstesnių moderatorių veiksmų bei politikos taikymo rezultatų. Atliekant šią užduotį, šis modelis gerokai pranoko visus mūsų išbandytus bazinius modelius: jo tikslumas siekė 57 %, palyginti su 15 % (gpt-oss-safeguard-120B rezultatas, įvertintas pagal GPT-4.1-nano našumo santykį), t. y. padidėjo 42 proc. punktais, arba apie 280 %. Šie rezultatai atitinka OpenAI rekomendaciją: mažesni specializuoti klasifikatoriai, išmokyti naudojant sužymėtus pavyzdžius, konkrečiose srityse gali pranokti apsaugos modelius.
Išvada aiški: kai politika turi daug niuansų ir išimtinių atvejų, nedidelis konkrečiai sričiai pritaikytas modelis tebėra aukso standartas. Papildomai mokant, jūsų politika ir išimtiniai atvejai tiesiogiai įtvirtinami modelio parametruose, todėl sudėtingomis realaus naudojimo sąlygomis jo elgsena būna stabilesnė, o delsa ir sąnaudos – itin mažos.
Prižiūrimas suderinimas – tik vienas iš kelių galimų būdų tai pasiekti. Modelio elgseną galima toliau optimizuoti ir kitais veiksmingais mokymo metodais, pavyzdžiui, skatinamuoju mokymusi arba distiliavimu pagal dabartinę politiką.
Papildomam mokymui paprastai reikia daug duomenų. Šiam Qwen3-0.6B klasifikatoriui papildomai mokyti naudotą duomenų rinkinį rankiniu būdu sužymėjo moderatoriai, todėl tai buvo švarus ir patikimas atskaitos duomenų šaltinis.
Daugelio projektų pradžioje tokio vertingų duomenų pranašumo gali nebūti. Todėl papildomą mokymą paprastai laikome optimizavimo etapu, kurį galima atlikti vėliau kuriant sprendimą. Kai sprendimo struktūra nusistovi ir surenkama realių naudotojų duomenų, kūrėjai gali pradėti taikyti tikslinį papildomą mokymą, kad dar labiau patobulintų moderavimo sprendimus.
Tokie baziniai moderavimo modeliai kaip gpt-oss-safeguard yra veiksmingi nauji sprendimų komponentai. Jie gali gerokai supaprastinti moderavimo sistemų kūrimą ir kartu sumažinti realiojo laiko programų delsą. Suderinus juos su nedideliais specialiai pritaikytais klasifikatoriais, galima sukurti saugesnę ir greitesnę sistemą, turinčią mažiau komponentų nei užklausomis ir dideliais bendrosios paskirties modeliais grindžiamas sprendimas.
Jei šiandien diegiate ar atnaujinate moderavimo sistemą, pirmiausia apsvarstykite tokius modelius kaip gpt-oss-safeguard, išmatuokite jų našumą, o ten, kur duomenys atskleidžia spragas, įtraukite tikslinių patobulinimų su specialiai pritaikytais klasifikatoriais, grindžiamais užklausomis arba papildomu mokymu.
Norite sužinoti daugiau? Parašykite mums.