Основна навигация

Какво означават моделите gpt-oss-safeguard на OpenAI за безопасността на ИИ

Ранна оценка на моделите gpt-oss-safeguard на OpenAI показва как специализираните модели за безопасност могат да подсилят реалните системи с ИИ.

През последните две години изградихме решения, които безопасно се мащабираха до милиони потребители. Ключова част от тази работа беше проектирането на бързи и точни системи за модериране. Ефективното модериране позволява на компаниите уверено да внедряват авангардни решения с ИИ, като предпазват крайните потребители от вреди и защитават марката чрез откриване на нежеланото генерирано съдържание, преди то да се превърне в проблем.

Наскоро OpenAI пусна своите модели GPT-OSS-Safeguard — прецизирани версии на моделите OSS с 20B и 120B параметъра, представени по-рано тази година. Тези модели могат да интерпретират правилата на потребителя директно при изпълнение, предлагайки гъвкав и мощен подход към модерирането на съдържание. Моделите са в изследователска предварителна версия и несъмнено ще продължат да се подобряват.

Преди пускането им си сътрудничихме с OpenAI и проведохме оценки в реални условия, които да подпомогнат разработването на моделите. В тази статия споделяме изводите от сътрудничеството и разглеждаме какво означава този напредък за бъдещето на модерирането в реални системи с ИИ.

Как работи модерирането в реални системи днес?

Днес решенията за модериране обикновено представляват защитни слоеве около приложението. Често използваме този модел при публични внедрявания с голям обем. За повече подробности прочетете публикацията ни по темата тук.

  1. Класифицирайте входните данни паралелно (не допускайте лоши подкани): Малки класификатори за конкретни теми работят едновременно, за да етикетират всяко потребителско съобщение. Установихме, че тясно специализираните класификатори са измеримо по-надеждни от един универсален класификатор. Внимателно подбраните примери с малко повторения в подканата могат да помогнат да се различи „I keep getting killed by this boss“ (контекст от игра, напълно безобиден) от сигнал за реална опасност.

    • Безопасно → Генерирайте нормално

    • Джейлбрейкове → Игнорирайте или отклонете с отказ в стила на марката

    • Рискове за безопасността или благосъстоянието → ескалирайте към човек с подробен контекст

  2. Класифицирайте изходните данни (не изпращайте лош отговор): Всеки възможен отговор се проверява повторно преди изпращане. Това предпазва от отклоняване на модела, отравяне на RAG данни и деликатни гранични случаи в правилата, като вредно съдържание, разкриване на лични данни или изтичане на чувствителна информация. Ако бъде маркиран, заменяме отговора, генериран от големи езикови модели, с безопасно съобщение в стила на марката или го ескалираме към човек, вместо да изпратим нещо, за което ще съжаляваме.

  3. Осигурете бързина и достъпна цена: Изграждането на подкани като многократно използваеми компоненти позволява кеширане на фрагменти от подкани, примери за класификатора с малко повторения и често срещани начала на диалози. Този подход намалява както забавянето, така и разходите за защитните механизми.

  4. Третирайте безопасността като част от продуктаОтказите и предупрежденията следват стила на марката — например закачлив при игрите и официален при финансите. Когато потребителското изживяване уважава намерението на потребителя, приемането на защитните механизми се повишава, а опитите за джейлбрейк намаляват.

  5. Наблюдавайте, тествайте с червен отбор и затворете цикълаНепрекъснатите стрес тестове с червен отбор и таблата за безопасност в реално време помагат за откриване на регресии, преди да засегнат потребителите. Можем да запознаем модела с нови модели на атака чрез допълнителни примери с малко повторения и/или правила за маршрутизиране, така че системата с времето да става по-трудна за пробив, без да се влошава производителността на приложението.

Предизвикателства при изграждането на решение за модериране днес

Изграждането и поддържането на ефективни защитни механизми е трудно.

На практика това изисква тясно сътрудничество между ключовите заинтересовани страни от бизнеса и разработчиците, за да се създадат ясно определени правила. След като правилата бъдат определени, трябва да се изгради и настрои архитектурата и поведението на системата.

Появата на отворени модели за безопасност със структурирано анализиране, като gpt-oss-safeguard, може да отстрани някои от трудностите в този процес, като осигури по-универсална и готова за използване основа за модериране на съдържание.

Потенциалът на специализираните модели за безопасност

Gpt-oss-safeguard цели да преодолее някои от обичайните предизвикателства при изграждането на съвременни системи за модериране. Тези малки специализирани модели са прецизирани да анализират целевите правила при изпълнение и да търсят вредно или чувствително съдържание, като джейлбрейкове, разкриване на лични данни и други нарушения на правилата.

Като включват структурирано анализиране в процеса на класификация, те осигуряват по-точно и устойчиво модериране, което по-трудно може да бъде заобиколено. Като специализирани варианти за безопасност на GPT-OSS 20B и 120B те предлагат най-съвременни резултати в безопасността, а персонализираните дефиниции на правила свеждат първоначалната настройка до минимум.

Какво тествахме

Оценихме gpt-oss-safeguard 20B и 120B в няколко задачи, близки до реалната експлоатация: гласов асистент в реално време, бот за поддръжка на играчи, проактивна система за модериране на чат и многоезично откриване на токсично съдържание на испански, френски, италиански, португалски, руски и турски.

Какво установихме

  • Гласово модериране с чувствителност към забавяне: В тестовете ни с глас в реално време — класификация по време на разговор, при която отговорът трябва да бъде анализиран и насочен, както при модериране на чат в игра — gpt-oss-safeguard-20B преодоля около 80% от разликата в точността между GPT-OSS-20B и GPT-5-Mini (0,71 спрямо 0,78 при изходни 0,45), при значително по-малко забавяне.

  • Ескалиране при поддръжка на играчи: При разпределянето на случаи за поддръжка на играчи gpt-oss-safeguard-20B преодоля около 90% от разликата между GPT-OSS-20b и GPT-5-Mini (0,66 спрямо 0,67 при изходни 0,57). Той постигна и най-добрата макропрецизност сред тестваните модели, 88% пълнота при безобидно съдържание и 87% прецизност при откриване на уязвими потребители — полезно за предпазливи и надеждни ескалации, без да се претоварват проверяващите служители.

  • Мащабно модериране на чат със сложни правила: В най-взискателната ни оценка, при която система за модериране трябва проактивно да маркира съобщения в игра според подробен документ с правила, gpt-oss-safeguard значително превъзхожда базовия OSS модел с относителен ръст от около 35% и обработва ефективно дълги правила. Това е особено чувствителен случай на употреба, който изисква висока пълнота и прецизност. При твърде ниска пълнота много вредни съобщения ще останат неоткрити. Ниската прецизност пък би довела до маркиране на много неуместни съобщения за проверка от модератори и би отклонила вниманието им от наистина трудните случаи.

  • Многоезична производителност: При балансиран набор от данни за токсично съдържание на шест езика gpt-oss-safeguard се представи близо до GPT-5-Mini — обикновено в рамките на 3–5 процентни пункта по точност, а gpt-oss-safeguard-120B го изпревари леко на испански. Наблюдавахме малко по-големи разлики при езици с по-малко ресурси, като турския, но общият модел показа стабилни резултати между различните езици и последователно повишаване на пълнотата при преминаване от 20B към 120B.

Установихме също, че моделите gpt-oss-safeguard се представят добре в области, в които големите езикови модели традиционно са по-слаби при модериране, например личните данни. Масовите модели обикновено са по-склонни да разпознават лични данни във формати, характерни за САЩ, и се справят по-слабо с други региони. Затова смятаме, че gpt-oss-safeguard ще опрости конфигурациите за модериране, като намали зависимостта от специализирани инструменти за откриване на дребни нарушения на правила, с които по-общите големи езикови модели не могат да се справят.

Силата на целевото прецизиране

Оценките ни показаха, че „базови модели за модериране“ като gpt-oss-safeguard-20B и gpt-oss-safeguard-120B могат бързо да постигнат много. Когато обаче системите изискват най-високи нива на безопасност и специфичност, специализираното за дадена област прецизиране остава еталонът.

Екранна снимка, илюстрираща силата на целевото прецизиране.

За модерирането в игри прецизирахме класификатор Qwen3-0.6B чрез контролирано прецизиране върху около 10 хил. исторически решения на модератори и резултати от прилагането на правилата. Този модел значително превъзхожда всеки базов модел, който тествахме за задачата, като постига точност от 57% спрямо 15% при gpt-oss-safeguard-120B (оценка въз основа на съотношението спрямо резултата на GPT-4.1-nano) — ръст от 42 процентни пункта, или около 280%. Тези резултати съответстват на насоките на OpenAI, че по-малки специализирани класификатори, обучени с етикетирани примери, могат да превъзхождат защитните модели в специализирани области.

Изводът е ясен: когато правилата са нюансирани и включват много гранични случаи, малък модел, адаптиран към конкретната област, остава златният стандарт. Прецизирането вгражда правилата и граничните случаи директно в параметрите, което осигурява по-последователно поведение в сложната реална среда при минимални забавяне и разходи.

Контролираното прецизиране е само един от няколкото възможни подхода. Могат да се използват и други мощни техники за обучение, като обучение с утвърждение или дестилация по текущата политика, за допълнително оптимизиране на поведението на модела.

Условностите при прецизирането

Прецизирането обикновено изисква голямо количество данни. Наборът от данни за прецизирането на този класификатор Qwen3-0.6B беше ръчно етикетиран от модератори и затова представляваше чист и надежден еталонен източник.

При много проекти това предимство — наличието на богати данни — може да липсва в началото. Затова обикновено разглеждаме прецизирането като оптимизация, която може да се приложи на по-късен етап от разработването на решението. След като решението се стабилизира и бъдат събрани реални потребителски данни, разработчиците могат да използват целево прецизиране, за да изведат решенията си за модериране на следващо ниво.

Заключителни мисли

Базовите модели за модериране като gpt-oss-safeguard са нови и надеждни градивни елементи. Те могат значително да опростят проектирането на системи за модериране и същевременно да намалят забавянето при приложения в реално време. В съчетание с малки класификатори по поръчка те позволяват изграждането на по-безопасна и по-бърза система с по-малко компоненти от подхода с подкани и големи модели с общо предназначение.

Ако днес изграждате или надграждате система за модериране, започнете с модели като gpt-oss-safeguard, измерете резултатите и добавете целеви подобрения чрез класификатори по поръчка — базирани на подкани или прецизирани — там, където данните показват пропуски.

Искате ли да научите повече? Пишете ни.

Автор

Douglas Adams, Romain Bourboulou, David Jasek и Atharva Tidke