Za poslední dva roky jsme vytvořili řešení, která bezpečně obsluhují miliony uživatelů. Klíčovou součástí této práce byl návrh rychlých a přesných moderačních systémů. Efektivní moderování umožňuje firmám s důvěrou nasazovat špičková řešení AI. Chrání koncové uživatele před újmou i dobrou pověst značky tím, že zachytí nežádoucí výstupy dříve, než způsobí problém.
Společnost OpenAI nedávno vydala své modely GPT-OSS-Safeguard: doladěné verze modelů OSS 20B a 120B představených začátkem tohoto roku. Tyto modely dokážou interpretovat pravidla uživatele přímo během odvozování, a nabízejí tak flexibilní a účinný přístup k moderování obsahu. Modely jsou zatím dostupné v rámci výzkumného náhledu, takže se budou nepochybně dále zlepšovat.
Před vydáním jsme spolupracovali s OpenAI a prováděli hodnocení v reálném prostředí, která pomohla nasměrovat vývoj modelu. V tomto článku sdílíme poznatky z této spolupráce a zkoumáme, co tento pokrok znamená pro budoucnost moderování v produkčních systémech AI.
Moderační řešení dnes obvykle tvoří několik ochranných vrstev obklopujících aplikaci. Tento vzorec často používáme u veřejně dostupných systémů s vysokým provozem. Podrobnější informace najdete v našem blogovém článku zde.
Paralelně klasifikujte vstupy (nepouštějte dovnitř škodlivé prompty): Malé klasifikátory zaměřené na konkrétní témata souběžně označují každou zprávu uživatele. Zjistili jsme, že úzce zaměřené klasifikátory jsou prokazatelně spolehlivější než jediný univerzální klasifikátor. Pečlivě vybrané příklady pro učení na několika příkladech v promptu mohou pomoci rozlišit mezi větou „I keep getting killed by this boss“ (herní kontext, zcela neškodný) a skutečným signálem hrozící újmy.
Bezpečné → Generovat běžným způsobem
Jailbreak → Ignorovat nebo odmítnout způsobem odpovídajícím značce
Rizika pro bezpečnost nebo duševní pohodu → předat člověku s podrobným kontextem
Klasifikujte výstupy (neodesílejte nevhodnou odpověď): Každá navržená odpověď se před odesláním znovu zkontroluje. Tento postup chrání před posunem chování modelu, otravou dat pro RAG a nenápadnými okrajovými případy pravidel, jako jsou škodlivý obsah, odhalení osobních údajů nebo únik citlivých informací. Pokud systém odpověď označí, nahradíme výstup vygenerovaný LLM bezpečnou zprávou odpovídající značce nebo jej předáme člověku, místo abychom odeslali něco, čeho bychom později litovali.
Zajistěte rychlost a dostupnou cenu: Tvorba promptů z opakovaně použitelných stavebních prvků umožňuje ukládat do mezipaměti části promptů, příklady pro učení na několika příkladech používané klasifikátorem a běžné úvody dialogů. Tento přístup snižuje latenci i náklady ochranných mechanismů.
Přistupujte k bezpečnosti jako k součásti produktuOdmítnutí a varování formulujte v tónu značky, například hravě u her a formálně ve finančnictví. Když uživatelské prostředí respektuje záměr uživatele, roste přijetí ochranných mechanismů a ubývá pokusů o jailbreak.
Monitorujte, provádějte red-teaming a využívejte zpětnou vazbuPrůběžný red-teaming a živé bezpečnostní přehledy pomáhají zachytit zhoršení dříve, než zasáhne uživatele. Model můžeme naučit rozpoznávat nové vzorce útoků přidáním dalších příkladů pro učení na několika příkladech nebo pravidel směrování. Systém je tak postupně odolnější, aniž by utrpěl výkon aplikace.
Vytvořit a udržovat účinné ochranné mechanismy je obtížné.
V praxi vyžaduje vytvoření jasně definovaných pravidel úzkou spolupráci klíčových zainteresovaných osob z firmy s vývojáři. Jakmile jsou pravidla stanovena, je nutné navrhnout systém, implementovat jeho chování a vše vyladit.
Nástup otevřených bezpečnostních modelů s uvažováním, jako je gpt-oss-safeguard, může některé problematické části tohoto procesu vyřešit a poskytnout univerzálnější základ pro moderování obsahu, který lze snáze nasadit.
Gpt-oss-safeguard má řešit některé běžné problémy při tvorbě současných moderačních systémů. Tyto malé specializované modely jsou doladěné tak, aby během odvozování uvažovaly nad zadanými pravidly a vyhledávaly škodlivý či citlivý obsah, jako jsou jailbreak, odhalení osobních údajů a další porušení pravidel.
Zapojením uvažování do klasifikace zajišťují přesnější a odolnější moderování, které lze hůře obejít. Jako specializované bezpečnostní varianty modelů GPT-OSS 20B a 120B poskytují špičkový bezpečnostní výkon a díky vlastním definicím pravidel vyžadují jen minimální úsilí při nasazení.
Modely gpt-oss-safeguard 20B a 120B jsme hodnotili na několika úlohách odpovídajících produkčnímu provozu: hlasovém asistentovi v reálném čase, herním botovi pro podporu hráčů, systému proaktivního moderování chatu a vícejazyčné kontrole toxicity ve španělštině, francouzštině, italštině, portugalštině, ruštině a turečtině.
Hlasové moderování citlivé na latenci: V našich testech hlasové komunikace v reálném čase – tedy živé klasifikace v konverzaci, kde je nutné odpověď analyzovat a rozhodnout o jejím dalším zpracování, například při moderování herního chatu – odstranil gpt-oss-safeguard-20B přibližně 80 % rozdílu v přesnosti mezi GPT-OSS-20B a GPT-5-Mini (0,71 oproti 0,78, nárůst z 0,45), a přitom pracoval s výrazně nižší latencí.
Eskalace podpory hráčů: Při třídění požadavků na podporu hráčů odstranil gpt-oss-safeguard-20B přibližně 90 % rozdílu mezi GPT-OSS-20b a GPT-5-Mini (0,66 oproti 0,67, nárůst z 0,57). Dosáhl také nejlepší makro přesnosti v testované skupině, 88% úplnosti u neškodného obsahu a 87% přesnosti při odhalování zranitelných uživatelů. To je užitečné, pokud požadujete konzervativní a důvěryhodné eskalace, aniž byste zahltili lidské posuzovatele.
Moderování chatu s rozsáhlými pravidly ve velkém měřítku: V našem nejnáročnějším hodnocení, které vyžaduje, aby moderační systém proaktivně označoval herní zprávy podle rozsáhlého dokumentu s pravidly, překonal gpt-oss-safeguard základní model OSS o jasný rozdíl. Dosáhl relativního zlepšení přibližně o 35 % a efektivně zpracovával dlouhá pravidla. Jde o mimořádně citlivý případ použití, který vyžaduje vysokou úplnost i přesnost. Při příliš nízké úplnosti zůstane mnoho škodlivých zpráv neodhaleno. Nízká přesnost by zase vedla k označování mnoha nerelevantních zpráv pro lidské moderátory a odváděla jejich pozornost od skutečně obtížných případů.
Výkon ve více jazycích: Na vyvážené datové sadě toxicity v šesti jazycích si gpt-oss-safeguard vedl podobně jako GPT-5-Mini. Rozdíl v přesnosti se obvykle pohyboval mezi 3 až 5 procentními body a ve španělštině měl gpt-oss-safeguard-120B mírný náskok. O něco větší rozdíly jsme zaznamenali u jazyků s menším množstvím dostupných dat, například turečtiny. Celkově však modely podávaly spolehlivý výkon napříč jazyky a přechod z 20B na 120B soustavně zvyšoval úplnost.
Zjistili jsme také, že modely gpt-oss-safeguard dosahují dobrých výsledků v oblastech, kde jsou LLM při moderování tradičně slabší, například u osobních údajů. Běžné modely mají tendenci lépe rozpoznávat osobní údaje v americkém formátu a v jiných regionech podávají horší výkon. Proto se domníváme, že gpt-oss-safeguard usnadní nasazování moderování tím, že sníží závislost na nástrojích na míru určených k odhalování drobných porušení pravidel, která obecnější LLM nedokážou zpracovat.
Naše hodnocení tedy ukázala, že „základní modely pro moderování“, jako jsou gpt-oss-safeguard-20B a gpt-oss-safeguard-120B, vás rychle posunou daleko. Pokud však systémy vyžadují nejvyšší úroveň bezpečnosti a přesného zaměření, standard stále určují modely doladěné pro konkrétní oblast.


Pro moderování ve hře jsme pomocí vylaďování pod dohledem doladili klasifikátor Qwen3-0.6B na přibližně 10 tisících historických zásazích moderátorů a výsledcích uplatňování pravidel. Tento model v daném úkolu výrazně překonal všechny testované základní modely: dosáhl přesnosti 57 % oproti 15 % (gpt-oss-safeguard-120B, odhad podle poměru k výkonu GPT-4.1-nano), tedy zlepšení o 42 procentních bodů neboli přibližně 280 %. Tyto výsledky odpovídají doporučení OpenAI, podle něhož mohou menší specializované klasifikátory trénované na označených příkladech ve specifických oblastech překonat ochranné modely.
Závěr je jasný: pokud jsou pravidla složitá a zahrnují mnoho okrajových případů, zůstává zlatým standardem malý model vyladěný pro danou oblast. Dolaďování zakotví vaše pravidla a okrajové případy přímo do parametrů. Model se pak chová stabilněji i v nepřehledném produkčním prostředí, a to s minimální latencí a náklady.
Vylaďování pod dohledem je jen jedním z několika možných přístupů. Chování modelu lze dále optimalizovat i jinými účinnými trénovacími metodami, například učením posilováním nebo destilací podle aktuální strategie.
Dolaďování obvykle vyžaduje velké množství dat. Datová sada použitá k doladění klasifikátoru Qwen3-0.6B byla ručně označena lidskými moderátory, a představovala tak čistý a spolehlivý referenční zdroj.
U mnoha projektů však takto kvalitní data zpočátku nejsou k dispozici. Dolaďování proto obvykle vnímáme jako optimalizaci, která může přijít až v pozdější fázi vývoje řešení. Jakmile se podoba řešení ustálí a podaří se shromáždit skutečná uživatelská data, mohou vývojáři pomocí cíleného dolaďování posunout své moderační řešení na vyšší úroveň.
Základní modely pro moderování, jako je gpt-oss-safeguard, jsou novými výkonnými stavebními prvky. Mohou výrazně zjednodušit návrh moderačních systémů a současně snížit latenci aplikací pracujících v reálném čase. V kombinaci s malými klasifikátory na míru umožňují vytvořit bezpečnější a rychlejší systém s menším počtem komponent než přístup založený na promptech a velkých obecných modelech.
Pokud dnes zavádíte nebo modernizujete moderování, zvažte, zda nezačít s modely jako gpt-oss-safeguard. Změřte jejich výkon a tam, kde data odhalí mezery, přidejte cílená vylepšení pomocí klasifikátorů na míru založených na promptech nebo dolaďování.
Chcete se dozvědět více? Napište nám.