Hlavná navigácia

Čo znamenajú modely gpt-oss-safeguard od OpenAI pre bezpečnosť AI

Prvé hodnotenie modelov gpt-oss-safeguard od OpenAI ukazuje, kde môžu špecializované bezpečnostné modely posilniť produkčné systémy AI.

Za posledné dva roky sme vytvorili riešenia, ktoré sa bezpečne rozšírili na milióny používateľov. Kľúčovou súčasťou tejto práce bol návrh rýchlych a presných systémov moderovania. Efektívne moderovanie umožňuje firmám s istotou nasadzovať špičkové riešenia AI. Chráni koncových používateľov pred ujmou a dobré meno značky tým, že zachytí neželané výstupy skôr, než spôsobia problém.

OpenAI nedávno uviedla svoje modely GPT-OSS-Safeguard: doladené verzie modelov OSS s 20B a 120B parametrami, ktoré predstavila začiatkom tohto roka. Tieto modely dokážu interpretovať pravidlá používateľa priamo počas inferencie, a ponúkajú tak flexibilný a účinný prístup k moderovaniu obsahu. Tieto modely sú dostupné ako výskumná ukážka, takže sa budú nepochybne ďalej zlepšovať.

Pred uvedením modelov sme spolupracovali s OpenAI a vykonávali hodnotenia v reálnych podmienkach, ktoré pomohli usmerniť ich vývoj. V tomto článku prinášame poznatky z tejto spolupráce a skúmame, čo tieto pokroky znamenajú pre budúcnosť moderovania v produkčných systémoch AI.

Ako dnes funguje moderovanie v produkcii?

Riešenia moderovania majú dnes zvyčajne podobu viacerých ochranných vrstiev obklopujúcich aplikáciu. Tento model často používame pri verejne dostupných nasadeniach s vysokým objemom prevádzky. Podrobnejšie sa tejto téme venujeme v našom blogu, ktorý nájdete tu.

  1. Paralelne klasifikujte vstupy (nepúšťajte dnu škodlivé príkazy): Malé tematicky zamerané klasifikátory súbežne označujú každú správu používateľa. Zistili sme, že úzko zamerané klasifikátory sú preukázateľne spoľahlivejšie než jediný univerzálny klasifikátor. Starostlivo zvolené príklady pre učenie s niekoľkými príkladmi v príkaze môžu pomôcť rozlíšiť medzi vetou „I keep getting killed by this boss“ (kontext hry, úplne neškodný) a signálom skutočnej ujmy.

    • Bezpečné → Generovať bežným spôsobom

    • Jailbreaky → Ignorovať alebo odkloniť vhodne formulovaným odmietnutím v štýle značky

    • Riziká pre bezpečnosť alebo duševnú pohodu → postúpiť človeku s bohatým kontextom

  2. Klasifikujte výstupy (neodosielajte škodlivú odpoveď): Každá navrhovaná odpoveď sa pred doručením opätovne preverí. Chráni to pred odchýlkami modelu, otravou dát RAG a nenápadnými hraničnými prípadmi pravidiel, ako sú škodlivý obsah, odhalenie osobných údajov alebo únik citlivých informácií. Ak systém odpoveď označí, výstup vygenerovaný LLM nahradíme bezpečnou správou zodpovedajúcou značke alebo ho postúpime človeku, namiesto toho, aby sme odoslali niečo, čo by sme neskôr ľutovali.

  3. Zaistite rýchlosť a dostupnú cenu: Vytváranie príkazov ako opakovane použiteľných stavebných prvkov umožňuje ukladať do vyrovnávacej pamäte časti príkazov, príklady pre klasifikátory s niekoľkými príkladmi aj bežné úvody dialógov. Tento prístup znižuje latenciu aj náklady ochranných mechanizmov.

  4. Vnímajte bezpečnosť ako súčasť produktuOdmietnutia a upozornenia píšte v štýle značky, napríklad hravo pri hrách a formálne vo financiách. Keď používateľské prostredie rešpektuje zámer používateľa, prijatie ochranných mechanizmov rastie a pokusov o jailbreak ubúda.

  5. Monitorujte, vykonávajte red teaming a uzatvárajte spätnú väzbuPriebežný red teaming a živé bezpečnostné panely pomáhajú zachytiť regresie skôr, než zasiahnu používateľov. Model môžeme naučiť rozpoznávať nové vzorce útokov pridaním príkladov pre učenie s niekoľkými príkladmi alebo pravidiel smerovania. Systém sa tak postupne stáva odolnejším bez zníženia výkonu aplikácie.

Výzvy pri tvorbe riešenia moderovania v súčasnosti

Vytvoriť a udržiavať účinné ochranné mechanizmy je náročné.

V praxi si vytvorenie jasne definovaných pravidiel vyžaduje úzku spoluprácu medzi kľúčovými zainteresovanými stranami firmy a vývojármi. Po definovaní pravidiel treba navrhnúť systém, vytvoriť jeho správanie a následne ho vyladiť.

Príchod otvorených bezpečnostných modelov s uvažovaním, ako je gpt-oss-safeguard, môže odstrániť niektoré problematické časti tohto procesu a poskytnúť univerzálnejší, takmer okamžite použiteľný základ na moderovanie obsahu.

Prísľub špecializovaných bezpečnostných modelov

Gpt-oss-safeguard má riešiť niektoré bežné problémy pri tvorbe dnešných systémov moderovania. Tieto malé špecializované modely sú doladené tak, aby počas inferencie uvažovali nad cieľovými pravidlami a vyhľadávali škodlivý či citlivý obsah, ako sú jailbreaky, odhalenie osobných údajov a ďalšie porušenia pravidiel.

Začlenením uvažovania do klasifikácie poskytujú presnejšie a odolnejšie moderovanie, ktoré sa ťažšie obchádza. Ako špecializované bezpečnostné varianty modelov GPT-OSS 20B a 120B prinášajú špičkovú úroveň bezpečnosti a vďaka vlastným definíciám pravidiel si vyžadujú len minimálne úvodné nastavenie.

Čo sme testovali

Modely gpt-oss-safeguard 20B a 120B sme hodnotili v niekoľkých úlohách pripomínajúcich produkčné prostredie: hlasový asistent v reálnom čase, herný bot podpory hráčov, systém proaktívneho moderovania chatu a viacjazyčná kontrola toxicity v španielčine, francúzštine, taliančine, portugalčine, ruštine a turečtine.

Čo sme zistili

  • Hlasové moderovanie citlivé na latenciu: V našich hlasových testoch v reálnom čase – teda pri živej klasifikácii v rozhovore, kde treba odpoveď analyzovať a zatriediť, podobne ako pri moderovaní herného chatu – gpt-oss-safeguard-20B odstránil približne 80 % rozdielu v správnosti medzi GPT-OSS-20B a GPT-5-Mini (0,71 oproti 0,78, nárast z 0,45), a to pri výrazne nižšej latencii.

  • Eskalácia podpory hráčov: Pri triedení požiadaviek podpory hráčov odstránil gpt-oss-safeguard-20B približne 90 % rozdielu medzi GPT-OSS-20b a GPT-5-Mini (0,66 oproti 0,67, nárast z 0,57). Dosiahol tiež najlepšiu makroprecíznosť v testovanej skupine, 88 % citlivosť pri neškodnom obsahu a 87 % precíznosť pri odhaľovaní zraniteľných používateľov. To je užitočné, ak chcete opatrnú a vysoko dôveryhodnú eskaláciu bez zahltenia ľudských kontrolórov.

  • Rozsiahle moderovanie chatu s komplexnými pravidlami: V našom najnáročnejšom hodnotení, kde musel systém moderovania proaktívne označovať správy v hre podľa podrobného dokumentu pravidiel, gpt-oss-safeguard jednoznačne prekonal základný model OSS, dosiahol približne 35 % relatívne zlepšenie a účinne spracoval aj dlhé pravidlá. Ide o mimoriadne citlivý prípad použitia, ktorý vyžaduje vysokú citlivosť aj precíznosť. Pri príliš nízkej citlivosti systém prehliadne množstvo škodlivých správ. Nízka precíznosť by zasa spôsobila, že ľudským moderátorom by sa označovalo množstvo nerelevantných správ, čo by odvádzalo ich pozornosť od skutočne náročných prípadov.

  • Výkon vo viacerých jazykoch: Na vyváženom súbore dát o toxicite v šiestich jazykoch dosahoval gpt-oss-safeguard výsledky blízke GPT-5-Mini, pričom rozdiel v správnosti bol zvyčajne 3 až 5 percentuálnych bodov. V španielčine mal gpt-oss-safeguard-120B mierny náskok. O niečo väčšie rozdiely sme zaznamenali pri jazykoch s menším množstvom dostupných dát, napríklad pri turečtine. Celkovo však modely podávali stabilný výkon naprieč jazykmi a pri prechode z 20B na 120B sa citlivosť konzistentne zvyšovala.

Zistili sme tiež, že modely gpt-oss-safeguard dosahujú dobré výsledky v oblastiach, kde sú LLM pri moderovaní tradične slabšie, napríklad pri osobných údajoch. Bežné modely sa totiž viac zameriavajú na formáty osobných údajov používané v USA a v iných regiónoch dosahujú slabší výkon. Preto sa domnievame, že gpt-oss-safeguard pomôže zjednodušiť nastavenie moderovania tým, že zníži závislosť od nástrojov na mieru určených na zachytávanie drobných porušení pravidiel, s ktorými si všeobecnejšie LLM neporadia.

Sila cieleného dolaďovania

Naše hodnotenia teda ukázali, že „základné modely moderovania“, ako sú gpt-oss-safeguard-20B a gpt-oss-safeguard-120B, vás rýchlo posunú ďaleko. Ak však systémy vyžadujú najvyššiu úroveň bezpečnosti a špecifickosti, štandard naďalej určujú doladené modely pre konkrétnu doménu.

Snímka obrazovky ilustrujúca silu cieleného dolaďovania.

Pre moderovanie priamo v hre sme klasifikátor Qwen3-0.6B doladili pod dohľadom na približne 10-tisíc historických zásahoch moderátorov a výsledkoch uplatňovania pravidiel. Tento model v danej úlohe výrazne prekonáva všetky základné modely, ktoré sme testovali: dosiahol správnosť 57 % oproti 15 % pri gpt-oss-safeguard-120B (odhad podľa pomeru výkonu GPT-4.1-nano), čo je nárast o 42 percentuálnych bodov, teda približne o 280 %. Tieto výsledky sú v súlade s odporúčaním OpenAI, podľa ktorého môžu menšie špecializované klasifikátory trénované na označených príkladoch v konkrétnych oblastiach prekonať ochranné modely.

Záver je jasný: keď sú pravidlá zložité a obsahujú množstvo hraničných prípadov, malý model doladený pre danú doménu zostáva zlatým štandardom. Dolaďovanie začlení vaše pravidlá a hraničné prípady priamo do parametrov, čím zabezpečí stabilnejšie správanie v nepredvídateľnom produkčnom prostredí, a to s minimálnou latenciou a nákladmi.

Dolaďovanie pod dohľadom je len jedným z viacerých možných prístupov. Na ďalšiu optimalizáciu správania modelu možno využiť aj iné účinné tréningové techniky, napríklad učenie posilňovaním alebo destiláciu podľa aktuálnej stratégie.

Úskalie dolaďovania

Dolaďovanie zvyčajne vyžaduje veľké množstvo dát. Súbor dát použitý na doladenie klasifikátora Qwen3-0.6B ručne označili ľudskí moderátori, takže predstavoval čistý a spoľahlivý zdroj referenčných údajov.

Mnohé projekty však na začiatku nemajú k dispozícii takéto kvalitné dáta. Dolaďovanie preto zvyčajne vnímame ako optimalizáciu, ktorú možno zaradiť až do neskoršej fázy vývoja riešenia. Keď sa podoba riešenia ustáli a nazbierajú sa reálne používateľské dáta, vývojári môžu pomocou cieleného dolaďovania posunúť svoje riešenia moderovania na vyššiu úroveň.

Záverečné myšlienky

Základné modely moderovania, ako je gpt-oss-safeguard, sú výkonnými novými stavebnými prvkami. Môžu výrazne zjednodušiť návrh systémov moderovania a zároveň znížiť latenciu aplikácií pracujúcich v reálnom čase. V kombinácii s malými klasifikátormi na mieru umožňujú vytvoriť bezpečnejší a rýchlejší systém s menším počtom komponentov než prístup založený na príkazoch a veľkých všeobecných modeloch.

Ak dnes zavádzate alebo modernizujete moderovanie, zvážte, či najprv nezačať s modelmi ako gpt-oss-safeguard. Zmerajte ich výkon a tam, kde dáta odhalia nedostatky, pridajte cielené vylepšenia pomocou klasifikátorov na mieru založených na príkazoch alebo dolaďovaní.

Chcete sa dozvedieť viac? Napíšte nám.

Autor

Douglas Adams, Romain Bourboulou, David Jasek a Atharva Tidke