Шта OpenAI модели gpt-oss-safeguard значе за безбедност вештачке интелигенције

Рана евалуација OpenAI модела gpt-oss-safeguard показује где специјализовани безбедносни модели могу ојачати продукционе AI системе.

Током протекле две године изградили смо решења која су безбедно проширена на милионе корисника. Кључни део тог рада било је пројектовање брзих и прецизних система за модерацију. Ефикасна модерација омогућава компанијама да поуздано примењују најсавременија AI решења, штите крајње кориснике од штете и чувају безбедност бренда тако што откривају нежељене генерисане садржаје пре него што постану проблем.

Недавно је OpenAI објавио своје моделе GPT-OSS-Safeguard: фино подешене верзије OSS модела 20B и 120B представљених раније ове године. Ови модели могу директно да тумаче корисничке смернице током извршавања, пружајући флексибилан и моћан приступ модерацији садржаја. Ови модели су доступни у истраживачкој претпрегледној верзији и несумњиво ће се временом побољшавати.

Пре овог издања сарађивали смо са компанијом OpenAI и спроводили евалуације у стварним условима како бисмо допринели развоју модела. У овом чланку преносимо увиде из те сарадње и разматрамо шта ова достигнућа значе за будућност модерације у продукционим AI системима.

Како модерација данас функционише у продукцији?

Решења за модерацију данас се обично састоје од више заштитних слојева постављених око апликације. Овај образац често користимо у јавним системима с великим обимом саобраћаја. За детаљнији преглед прочитајте наш блог о овој теми овде.

  1. Паралелно класификујте улазе (не пропуштајте штетне инструкције): Мали класификатори усмерени на одређене теме истовремено означавају сваку корисничку поруку. Утврдили смо да су уско специјализовани класификатори мерљиво поузданији од једног универзалног класификатора. Пажљиво одабрани примери с малим бројем уноса у инструкцији могу помоћи да се разликује „I keep getting killed by this boss“ (контекст игре, потпуно безопасно) од сигнала стварне опасности.

    • Безбедно → Генеришите уобичајено

    • Заобилажење безбедносних мера → Игноришите или преусмерите одговор одбијањем у стилу бренда

    • Ризици по безбедност или добробит → проследите човеку уз детаљан контекст

  2. Класификујте излазе (не испоручујте лош одговор): Сваки предложени одговор поново се проверава пре испоруке. То штити од одступања модела, тровања RAG података и суптилних граничних случајева у смерницама, као што су штетан садржај, откривање података који могу да идентификују особу (PII) или цурење осетљивих информација. Ако је одговор означен, уместо одговора који је генерисао велики језички модел (LLM) шаљемо безбедну поруку усклађену с брендом или га прослеђујемо човеку, уместо да испоручимо нешто због чега бисмо зажалили.

  3. Обезбедите брзину и приступачну цену: Ако инструкције правите као градивне елементе за вишекратну употребу, можете кеширати њихове делове, примере с малим бројем уноса за класификаторе и уобичајене почетке дијалога. Овај приступ смањује и кашњење и трошкове заштитних мера.

  4. Посматрајте безбедност као део производа: Одбијања и упозорења пишу се у стилу бренда — на пример, разиграно за игре, а формално за финансије. Када корисничко искуство уважава намеру корисника, прихватање заштитних мера расте, а покушаји заобилажења безбедносних мера опадају.

  5. Надгледајте, ангажујте црвену команду и затворите повратну петљу: Континуирани рад црвене команде и контролне табле за праћење безбедности уживо помажу да се регресије открију пре него што стигну до корисника. Модел можемо научити сваком новом обрасцу напада додавањем примера с малим бројем уноса и/или правила усмеравања, тако да систем временом постаје отпорнији без нарушавања перформанси апликације.

Изазови савремене изградње решења за модерацију

Изградња и одржавање ефикасних заштитних мера није лако.

У пракси је за израду јасно дефинисаних смерница неопходна пажљива сарадња кључних пословних актера и програмера. Када се смернице дефинишу, потребно је изградити и подесити архитектуру и понашање система.

Појава отворених безбедносних модела за резоновање, као што је gpt-oss-safeguard, могла би да отклони неке потешкоће у овом процесу и пружи свестранију основу за модерацију садржаја, спремну за употребу.

Потенцијал специјализованих безбедносних модела

Gpt-oss-safeguard настоји да реши неке од уобичајених изазова при изградњи савремених система за модерацију. Ови мали, специјализовани модели фино су подешени да током извршавања резонују на основу циљних смерница и траже штетан или осетљив садржај, попут заобилажења безбедносних мера, откривања података који могу да идентификују особу (PII) и других кршења смерница.

Укључивањем резоновања у поступак класификације пружају прецизнију и отпорнију модерацију коју је теже заобићи. Као специјализоване безбедносне варијанте модела GPT-OSS 20B и 120B, омогућавају врхунске безбедносне перформансе уз минималан труд око подешавања, захваљујући прилагођеним дефиницијама смерница.

Шта смо тестирали

Оценили смо gpt-oss-safeguard 20B и 120B на неколико задатака обликованих према продукционим условима: гласовном асистенту у реалном времену, боту за подршку играчима у игри, систему за проактивну модерацију ћаскања и вишејезичној провери токсичности на шпанском, француском, италијанском, португалском, руском и турском.

Шта смо утврдили

  • Гласовна модерација осетљива на кашњење: У нашим тестовима гласа у реалном времену — замислите класификацију уживо током разговора, где одговор треба анализирати и одредити му приоритет, као код модерације ћаскања током игре — gpt-oss-safeguard-20B смањио је око 80% разлике у тачности између GPT-OSS-20B и GPT-5-Mini (0,71 према 0,78, у односу на почетних 0,45), уз знатно мање кашњење.

  • Прослеђивање подршке играчима: При одређивању приоритета захтева за подршку играчима, gpt-oss-safeguard-20B смањио је око 90% разлике између GPT-OSS-20b и GPT-5-Mini (0,66 према 0,67, у односу на почетних 0,57). Такође је остварио најбољу макропрецизност у скупу, одзив од 88% за безопасан садржај и прецизност од 87% при откривању рањивих корисника — корисно ако желите опрезно и поуздано прослеђивање без затрпавања људских контролора.

  • Модерација ћаскања с детаљним смерницама у великом обиму: У нашој најзахтевнијој евалуацији, која од система за модерацију захтева да проактивно означава поруке у игри према детаљном документу са смерницама, gpt-oss-safeguard је јасно надмашио основни OSS модел, остваривши релативно побољшање од око 35%, уз ефикасну обраду дугачких смерница. Ово је посебно осетљив случај употребе који захтева висок одзив и прецизност. Ако је одзив пренизак, многе штетне поруке остаће неоткривене. Ниска прецизност би, с друге стране, довела до тога да се људским модераторима означи много небитних порука, одвлачећи им пажњу од заиста тешких случајева.

  • Вишејезичне перформансе: На уравнотеженом скупу података о токсичности на шест језика, gpt-oss-safeguard је углавном пратио GPT-5-Mini, обично заостајући 3–5 процентних поена у тачности, док је gpt-oss-safeguard-120B био нешто бољи на шпанском. Уочили смо нешто веће разлике код језика с мање доступних ресурса, као што је турски, али је општи образац показао солидне вишејезичне перформансе и доследно повећање одзива при преласку са 20B на 120B.

Такође смо приметили да су модели gpt-oss-safeguard веома успешни у областима у којима су велики језички модели (LLM) традиционално слабији за модерацију, попут података који могу да идентификују особу (PII). Уобичајени модели су склонији препознавању PII података у америчком формату и слабије раде у другим регионима. Због тога верујемо да ће gpt-oss-safeguard поједноставити постављање модерације тако што ће смањити зависност од наменских алата за откривање мањих кршења смерница која општији велики језички модели (LLM) не могу да обраде.

Моћ циљаног финог подешавања

Наше евалуације су, дакле, показале да „темељни модели за модерацију“, као што су gpt-oss-safeguard-20B и gpt-oss-safeguard-120B, могу брзо да вас доведу далеко. Међутим, фино подешени модели за одређене домене и даље постављају стандард када системи захтевају највиши ниво безбедности и прецизности.

Снимак екрана који показује моћ циљаног финог подешавања.

За модерацију у игри фино смо подесили класификатор Qwen3-0.6B методом финог подешавања под надзором, користећи око 10.000 историјских одлука модератора и исхода примене смерница. Овај модел је на овом задатку убедљиво надмашио све основне моделе које смо тестирали, уз тачност од 57% наспрам 15% (gpt-oss-safeguard-120B, процењено на основу односа са резултатом модела GPT-4.1-nano), што је раст од 42 процентна поена, односно око 280%. Ови резултати су у складу са смерницама компаније OpenAI да мањи, наменски класификатори обучени на означеним примерима могу надмашити заштитне моделе у специјализованим доменима.

Закључак је јасан: када су смернице сложене и имају много граничних случајева, мали модел прилагођен домену остаје златни стандард. Фино подешавање уграђује ваше смернице и граничне случајеве директно у параметре, чиме обезбеђује стабилније понашање у непредвидивом продукционом окружењу, уз минимално кашњење и трошкове.

Фино подешавање под надзором само је један од неколико могућих приступа. За додатну оптимизацију понашања модела могу се применити и друге моћне технике обуке, као што су подстицајно учење или дестилација на основу актуелне политике.

Ограничење финог подешавања

Фино подешавање обично захтева много података. Скуп података коришћен за фино подешавање класификатора Qwen3-0.6B ручно су означили модератори, па је представљао чист и поуздан извор истине.

У многим пројектима овако богати подаци нису доступни на самом почетку. Зато фино подешавање обично посматрамо као оптимизацију која долази касније у развојном циклусу решења. Када се структура решења устали и прикупе стварни кориснички подаци, програмери могу применити циљано фино подешавање како би решења за модерацију подигли на виши ниво.

Завршна разматрања

Темељни модели за модерацију, као што је gpt-oss-safeguard, представљају нове и моћне градивне елементе. Они могу знатно да поједноставе пројектовање система за модерацију и истовремено смање кашњење у апликацијама које раде у реалном времену. Упарите их с малим, наменским класификаторима и можете изградити безбеднији и бржи систем, с мање компоненти него код приступа заснованог на инструкцијама и великим моделима опште намене.

Ако данас успостављате или унапређујете модерацију, размислите о томе да прво примените моделе као што је gpt-oss-safeguard, измерите учинак, а затим уведете циљана побољшања помоћу наменских класификатора — заснованих на инструкцијама или фино подешених — тамо где подаци покажу недостатке.

Желите да сазнате више? Пошаљите нам поруку.

Autor

Douglas Adams, Romain Bourboulou, David Jasek и Atharva Tidke