Во изминатите две години изградивме решенија што безбедно се проширија до милиони корисници. Клучен дел од оваа работа беше осмислувањето брзи и прецизни системи за модерирање. Ефикасното модерирање им овозможува на компаниите самоуверено да применуваат најсовремени решенија со вештачка интелигенција, да ги заштитат крајните корисници од штета и да го зачуваат угледот на брендот, откривајќи ги несаканите генерирани содржини пред да станат проблем.
Неодамна, OpenAI ги објави своите модели GPT-OSS-Safeguard: фино прилагодени верзии на моделите OSS 20B и 120B претставени претходно годинава. Овие модели можат директно да ја толкуваат политиката на корисникот при извршување, нудејќи флексибилен и моќен пристап кон модерирањето содржини. Овие модели се во истражувачка претпрегледна верзија, па несомнено ќе продолжат да се подобруваат.
Пред објавувањето соработувавме со OpenAI и спроведовме процени во реални услови за да придонесеме во развојот на моделот. Во оваа статија ги споделуваме сознанијата од таа соработка и истражуваме што значи овој напредок за иднината на модерирањето во продукциските системи со вештачка интелигенција.
Денешните решенија за модерирање обично се состојат од повеќе заштитни слоеви околу апликацијата. Овој модел на работа често го применуваме кај јавно достапни системи со голем обем. За подетален преглед, прочитајте го нашиот блог на оваа тема овде.
Класифицирајте ги влезовите паралелно (не пропуштајте штетни промптови): Мали класификатори за конкретни теми работат истовремено и ја означуваат секоја корисничка порака. Утврдивме дека тесно насочените класификатори се мерливо посигурни од еден универзален класификатор. Внимателно избраните примери за промпт со мал број примери може да помогнат да се разликува „I keep getting killed by this boss“ (контекст од игра, сосема безопасен) од вистински сигнал за штета во реалниот свет.
Безбедно → Генерирај вообичаено
Пробивања → Игнорирај или пренасочи со одбивање во стилот на брендот
Ризици по безбедноста или благосостојбата → проследи до човек со детален контекст
Класифицирајте ги излезите (не испраќајте лош одговор): Секој предложен одговор повторно се проверува пред испораката. Ова штити од отстапување на моделот, труење на RAG-податоците и суптилни гранични случаи во политиките, како штетна содржина, изложување лични податоци или протекување чувствителни информации. Ако одговорот е означен, наместо да испратиме нешто за што ќе зажалиме, одговорот генериран од големи јазични модели (LLM) го заменуваме со безбедна порака усогласена со брендот или го проследуваме до човек.
Обезбедете брзина и пристапна цена: Создавањето промптови како повеќекратно употребливи составни елементи овозможува кеширање делови од промптот, примери за класификаторски промпт со мал број примери и вообичаени почетоци на дијалози. Овој пристап ги намалува и доцнењето и трошоците на вашите заштитни механизми.
Третирајте ја безбедноста како дел од производотОдбивањата и предупредувањата се пишуваат во стилот на производот (на пр., разиграно за игри, формално за финансии). Кога корисничкото искуство ја почитува намерата на корисникот, прифаќањето на заштитните механизми расте, а обидите за пробивање се намалуваат
Следете, тестирајте ја отпорноста и затворете го циклусотКонтинуираното тестирање на отпорноста и контролните табли за безбедност во живо помагаат да се откријат влошувањата пред да стигнат до корисниците. Можеме да го запознаеме моделот со секој нов образец на напад преку дополнителни примери за промпт со мал број примери и/или правила за насочување, така што системот со текот на времето станува поотпорен без да се нарушат перформансите на апликацијата.
Создавањето и одржувањето ефикасни заштитни механизми е тешко.
Во практиката, тоа бара внимателна соработка меѓу клучните деловни чинители и програмерите за да се создаде јасно дефинирана политика. Откако ќе се дефинира политиката, мора да се изгради и приспособи дизајнот и однесувањето на системот.
Појавата на отворени безбедносни модели со расудување, како gpt-oss-safeguard, може да реши дел од тешкотиите во овој процес и да обезбеди поразновидна основа за модерирање содржини што е веднаш подготвена за употреба.
Gpt-oss-safeguard има цел да одговори на некои од вообичаените предизвици при создавањето современи системи за модерирање. Овие мали, специјализирани модели се фино прилагодени при извршување да расудуваат според целната политика и да бараат штетна или чувствителна содржина, како пробивања, изложување лични податоци и други прекршувања на политиката.
Со вклучување расудување во процесот на класификација, тие овозможуваат попрецизно и поотпорно модерирање што потешко се заобиколува. Како специјализирани безбедносни варијанти на GPT-OSS 20B и 120B, тие овозможуваат врвни безбедносни перформанси со минимални трошоци за поставување, благодарение на приспособените дефиниции на политиките.
Ги проценивме gpt-oss-safeguard 20B и 120B на неколку задачи слични на продукциски услови: гласовен асистент во реално време, бот за поддршка на играчи во игра, проактивен систем за модерирање разговори и повеќејазична проверка за токсичност (шпански, француски, италијански, португалски, руски и турски).
Гласовно модерирање чувствително на доцнење: Во нашите гласовни тестови во реално време (замислете класификација во живо среде разговор, каде одговорот мора да се анализира и распореди по приоритет, како при модерирање разговор во игра), gpt-oss-safeguard-20B намали околу 80% од разликата во точноста меѓу GPT-OSS-20B и GPT-5-Mini (0,71 наспроти 0,78, зголемено од 0,45), притоа работејќи со значително помало доцнење.
Ескалација на поддршката за играчи: При одредување на приоритетите за поддршка на играчи, gpt-oss-safeguard-20B намали околу 90% од разликата меѓу GPT-OSS-20b и GPT-5-Mini (0,66 наспроти 0,67, зголемено од 0,57). Исто така, постигна најдобра макропрецизност во групата, 88% одзив за безопасна содржина и 87% прецизност при откривање ранливи корисници — корисно за внимателни ескалации со висока доверба, без преоптоварување на човечките проверувачи.
Масовно модерирање разговори со детални политики: Во нашата најсложена процена, која бара системот за модерирање проактивно да ги означува пораките во игра според детален документ со политики, gpt-oss-safeguard јасно ја надмина основната верзија OSS, постигнувајќи релативно подобрување од околу 35% и ефикасно обработувајќи долги политики. Ова е особено чувствителен случај на употреба што бара висок одзив и висока прецизност. Ако одзивот е пренизок, многу штетни пораки ќе останат неоткриени. Ниската прецизност, пак, би довела до означување многу неважни пораки за човечките модератори, одвлекувајќи им го вниманието од навистина тешките случаи.
Повеќејазични перформанси: На урамнотежено множество податоци за токсичност на шест јазици, gpt-oss-safeguard постигна резултати блиски до GPT-5-Mini, обично со разлика од 3 до 5 процентни поени во точноста, додека gpt-oss-safeguard-120B беше малку подобар на шпански. Забележавме малку поголеми разлики кај јазиците со помалку ресурси, како турскиот, но целокупниот образец покажа солидни меѓујазични перформанси и доследно подобрување на одзивот при премин од 20B на 120B.
Забележавме и дека моделите gpt-oss-safeguard постигнуваат добри резултати во областите каде големите јазични модели (LLM) традиционално се послаби во модерирањето, како личните податоци. Вообичаените модели почесто препознаваат лични податоци во формат карактеристичен за САД, а се послаби за други географски подрачја. Затоа веруваме дека gpt-oss-safeguard ќе помогне да се поедностави поставувањето на модерирањето, намалувајќи ја зависноста од наменски алатки за откривање помали прекршувања на политиките со кои пошироките големи јазични модели (LLM) не можат да се справат.
Нашите процени покажаа дека „основните модели за модерирање“, како gpt-oss-safeguard-20B и gpt-oss-safeguard-120B, можат брзо да ве одведат далеку. Сепак, фините прилагодувања за конкретен домен сè уште го поставуваат стандардот кога системите бараат највисоко ниво на безбедност и специфичност.


За модерирањето во игра, фино прилагодивме класификатор Qwen3-0.6B преку надгледувано фино прилагодување врз околу 10 илјади историски одлуки на модератори и исходи од политиките. Овој модел значително ги надминува сите основни модели што ги тестиравме за оваа задача, постигнувајќи точност од 57% наспроти 15% (gpt-oss-safeguard-120B, проценето според соодносот со перформансите на GPT-4.1-nano), односно зголемување од 42 процентни поени или околу 280%. Овие резултати се во согласност со насоките на OpenAI дека помалите, наменски класификатори обучени со означени примери можат да ги надминат заштитните модели во специјализирани домени.
Заклучокот е јасен: кога политиките се нијансирани и имаат многу гранични случаи, мал модел приспособен за конкретниот домен останува златен стандард. Со финото прилагодување, политиката и граничните случаи директно се вградуваат во параметрите, што овозможува постабилно однесување во непредвидливата продукциска средина, со минимални доцнење и трошоци.
Надгледуваното фино прилагодување е само еден од неколкуте можни пристапи. За дополнително оптимизирање на однесувањето на моделот може да се применат и други моќни техники за обука, како зајакнување на учењето или дестилација според активната политика.
Финото прилагодување обично бара големо количество податоци. Множеството податоци за фино прилагодување на класификаторот Qwen3-0.6B беше рачно означено од модератори и затоа претставуваше чист, референтен извор на точни податоци.
Кај многу проекти, оваа предност од богати податоци можеби не постои на почетокот. Затоа, финото прилагодување обично го сметаме за оптимизација што може да се примени подоцна во развојниот циклус на решението. Откако решението ќе се стабилизира и ќе се соберат реални кориснички податоци, програмерите може да применат насочено фино прилагодување за дополнително да ги унапредат решенијата за модерирање.
Основните модели за модерирање, како gpt-oss-safeguard, се моќни нови составни елементи. Тие можат значително да го поедностават дизајнот на системите за модерирање, а истовремено да го намалат доцнењето кај апликациите во реално време. Во комбинација со мали, наменски класификатори, овозможуваат создавање побезбеден и побрз систем со помалку подвижни делови отколку пристапот заснован на промпт со големи модели за општа намена.
Ако денес воспоставувате или надградувате модерирање, почнете со модели како gpt-oss-safeguard, измерете ги перформансите и воведете насочени подобрувања со наменски класификатори — засновани на промпт или фино прилагодени — таму каде што податоците откриваат недостатоци.
Сакате да дознаете повеќе? Испратете ни порака.