През последните две години изградихме решения, които безопасно се мащабираха до милиони потребители. Ключова част от тази работа беше проектирането на бързи и точни системи за модериране. Ефективното модериране позволява на компаниите уверено да внедряват авангардни решения с ИИ, като предпазват крайните потребители от вреди и защитават марката чрез откриване на нежеланото генерирано съдържание, преди то да се превърне в проблем.
Наскоро OpenAI пусна своите модели GPT-OSS-Safeguard — прецизирани версии на моделите OSS с 20B и 120B параметъра, представени по-рано тази година. Тези модели могат да интерпретират правилата на потребителя директно при изпълнение, предлагайки гъвкав и мощен подход към модерирането на съдържание. Моделите са в изследователска предварителна версия и несъмнено ще продължат да се подобряват.
Преди пускането им си сътрудничихме с OpenAI и проведохме оценки в реални условия, които да подпомогнат разработването на моделите. В тази статия споделяме изводите от сътрудничеството и разглеждаме какво означава този напредък за бъдещето на модерирането в реални системи с ИИ.
Днес решенията за модериране обикновено представляват защитни слоеве около приложението. Често използваме този модел при публични внедрявания с голям обем. За повече подробности прочетете публикацията ни по темата тук.
Класифицирайте входните данни паралелно (не допускайте лоши подкани): Малки класификатори за конкретни теми работят едновременно, за да етикетират всяко потребителско съобщение. Установихме, че тясно специализираните класификатори са измеримо по-надеждни от един универсален класификатор. Внимателно подбраните примери с малко повторения в подканата могат да помогнат да се различи „I keep getting killed by this boss“ (контекст от игра, напълно безобиден) от сигнал за реална опасност.
Безопасно → Генерирайте нормално
Джейлбрейкове → Игнорирайте или отклонете с отказ в стила на марката
Рискове за безопасността или благосъстоянието → ескалирайте към човек с подробен контекст
Класифицирайте изходните данни (не изпращайте лош отговор): Всеки възможен отговор се проверява повторно преди изпращане. Това предпазва от отклоняване на модела, отравяне на RAG данни и деликатни гранични случаи в правилата, като вредно съдържание, разкриване на лични данни или изтичане на чувствителна информация. Ако бъде маркиран, заменяме отговора, генериран от големи езикови модели, с безопасно съобщение в стила на марката или го ескалираме към човек, вместо да изпратим нещо, за което ще съжаляваме.
Осигурете бързина и достъпна цена: Изграждането на подкани като многократно използваеми компоненти позволява кеширане на фрагменти от подкани, примери за класификатора с малко повторения и често срещани начала на диалози. Този подход намалява както забавянето, така и разходите за защитните механизми.
Третирайте безопасността като част от продуктаОтказите и предупрежденията следват стила на марката — например закачлив при игрите и официален при финансите. Когато потребителското изживяване уважава намерението на потребителя, приемането на защитните механизми се повишава, а опитите за джейлбрейк намаляват.
Наблюдавайте, тествайте с червен отбор и затворете цикълаНепрекъснатите стрес тестове с червен отбор и таблата за безопасност в реално време помагат за откриване на регресии, преди да засегнат потребителите. Можем да запознаем модела с нови модели на атака чрез допълнителни примери с малко повторения и/или правила за маршрутизиране, така че системата с времето да става по-трудна за пробив, без да се влошава производителността на приложението.
Изграждането и поддържането на ефективни защитни механизми е трудно.
На практика това изисква тясно сътрудничество между ключовите заинтересовани страни от бизнеса и разработчиците, за да се създадат ясно определени правила. След като правилата бъдат определени, трябва да се изгради и настрои архитектурата и поведението на системата.
Появата на отворени модели за безопасност със структурирано анализиране, като gpt-oss-safeguard, може да отстрани някои от трудностите в този процес, като осигури по-универсална и готова за използване основа за модериране на съдържание.
Gpt-oss-safeguard цели да преодолее някои от обичайните предизвикателства при изграждането на съвременни системи за модериране. Тези малки специализирани модели са прецизирани да анализират целевите правила при изпълнение и да търсят вредно или чувствително съдържание, като джейлбрейкове, разкриване на лични данни и други нарушения на правилата.
Като включват структурирано анализиране в процеса на класификация, те осигуряват по-точно и устойчиво модериране, което по-трудно може да бъде заобиколено. Като специализирани варианти за безопасност на GPT-OSS 20B и 120B те предлагат най-съвременни резултати в безопасността, а персонализираните дефиниции на правила свеждат първоначалната настройка до минимум.
Оценихме gpt-oss-safeguard 20B и 120B в няколко задачи, близки до реалната експлоатация: гласов асистент в реално време, бот за поддръжка на играчи, проактивна система за модериране на чат и многоезично откриване на токсично съдържание на испански, френски, италиански, португалски, руски и турски.
Гласово модериране с чувствителност към забавяне: В тестовете ни с глас в реално време — класификация по време на разговор, при която отговорът трябва да бъде анализиран и насочен, както при модериране на чат в игра — gpt-oss-safeguard-20B преодоля около 80% от разликата в точността между GPT-OSS-20B и GPT-5-Mini (0,71 спрямо 0,78 при изходни 0,45), при значително по-малко забавяне.
Ескалиране при поддръжка на играчи: При разпределянето на случаи за поддръжка на играчи gpt-oss-safeguard-20B преодоля около 90% от разликата между GPT-OSS-20b и GPT-5-Mini (0,66 спрямо 0,67 при изходни 0,57). Той постигна и най-добрата макропрецизност сред тестваните модели, 88% пълнота при безобидно съдържание и 87% прецизност при откриване на уязвими потребители — полезно за предпазливи и надеждни ескалации, без да се претоварват проверяващите служители.
Мащабно модериране на чат със сложни правила: В най-взискателната ни оценка, при която система за модериране трябва проактивно да маркира съобщения в игра според подробен документ с правила, gpt-oss-safeguard значително превъзхожда базовия OSS модел с относителен ръст от около 35% и обработва ефективно дълги правила. Това е особено чувствителен случай на употреба, който изисква висока пълнота и прецизност. При твърде ниска пълнота много вредни съобщения ще останат неоткрити. Ниската прецизност пък би довела до маркиране на много неуместни съобщения за проверка от модератори и би отклонила вниманието им от наистина трудните случаи.
Многоезична производителност: При балансиран набор от данни за токсично съдържание на шест езика gpt-oss-safeguard се представи близо до GPT-5-Mini — обикновено в рамките на 3–5 процентни пункта по точност, а gpt-oss-safeguard-120B го изпревари леко на испански. Наблюдавахме малко по-големи разлики при езици с по-малко ресурси, като турския, но общият модел показа стабилни резултати между различните езици и последователно повишаване на пълнотата при преминаване от 20B към 120B.
Установихме също, че моделите gpt-oss-safeguard се представят добре в области, в които големите езикови модели традиционно са по-слаби при модериране, например личните данни. Масовите модели обикновено са по-склонни да разпознават лични данни във формати, характерни за САЩ, и се справят по-слабо с други региони. Затова смятаме, че gpt-oss-safeguard ще опрости конфигурациите за модериране, като намали зависимостта от специализирани инструменти за откриване на дребни нарушения на правила, с които по-общите големи езикови модели не могат да се справят.
Оценките ни показаха, че „базови модели за модериране“ като gpt-oss-safeguard-20B и gpt-oss-safeguard-120B могат бързо да постигнат много. Когато обаче системите изискват най-високи нива на безопасност и специфичност, специализираното за дадена област прецизиране остава еталонът.


За модерирането в игри прецизирахме класификатор Qwen3-0.6B чрез контролирано прецизиране върху около 10 хил. исторически решения на модератори и резултати от прилагането на правилата. Този модел значително превъзхожда всеки базов модел, който тествахме за задачата, като постига точност от 57% спрямо 15% при gpt-oss-safeguard-120B (оценка въз основа на съотношението спрямо резултата на GPT-4.1-nano) — ръст от 42 процентни пункта, или около 280%. Тези резултати съответстват на насоките на OpenAI, че по-малки специализирани класификатори, обучени с етикетирани примери, могат да превъзхождат защитните модели в специализирани области.
Изводът е ясен: когато правилата са нюансирани и включват много гранични случаи, малък модел, адаптиран към конкретната област, остава златният стандарт. Прецизирането вгражда правилата и граничните случаи директно в параметрите, което осигурява по-последователно поведение в сложната реална среда при минимални забавяне и разходи.
Контролираното прецизиране е само един от няколкото възможни подхода. Могат да се използват и други мощни техники за обучение, като обучение с утвърждение или дестилация по текущата политика, за допълнително оптимизиране на поведението на модела.
Прецизирането обикновено изисква голямо количество данни. Наборът от данни за прецизирането на този класификатор Qwen3-0.6B беше ръчно етикетиран от модератори и затова представляваше чист и надежден еталонен източник.
При много проекти това предимство — наличието на богати данни — може да липсва в началото. Затова обикновено разглеждаме прецизирането като оптимизация, която може да се приложи на по-късен етап от разработването на решението. След като решението се стабилизира и бъдат събрани реални потребителски данни, разработчиците могат да използват целево прецизиране, за да изведат решенията си за модериране на следващо ниво.
Базовите модели за модериране като gpt-oss-safeguard са нови и надеждни градивни елементи. Те могат значително да опростят проектирането на системи за модериране и същевременно да намалят забавянето при приложения в реално време. В съчетание с малки класификатори по поръчка те позволяват изграждането на по-безопасна и по-бърза система с по-малко компоненти от подхода с подкани и големи модели с общо предназначение.
Ако днес изграждате или надграждате система за модериране, започнете с модели като gpt-oss-safeguard, измерете резултатите и добавете целеви подобрения чрез класификатори по поръчка — базирани на подкани или прецизирани — там, където данните показват пропуски.
Искате ли да научите повече? Пишете ни.