Головна навігація

Що моделі gpt-oss-safeguard від OpenAI означають для безпеки ШІ

Перші оцінювання моделей gpt-oss-safeguard від OpenAI показують, як спеціалізовані моделі безпеки можуть посилити робочі системи ШІ.

За останні два роки ми створили рішення, які безпечно масштабувалися до мільйонів користувачів. Ключовою частиною цієї роботи було проєктування швидких і точних систем модерації. Ефективна модерація дає компаніям змогу впевнено впроваджувати передові рішення на основі ШІ, захищати кінцевих користувачів від шкоди та репутацію бренду, виявляючи небажаний згенерований вміст до того, як він стане проблемою.

Нещодавно OpenAI випустила моделі GPT-OSS-Safeguard — донавчені версії моделей OSS із 20 і 120 млрд параметрів, представлених раніше цього року. Ці моделі можуть інтерпретувати політику користувача безпосередньо під час інференсу, забезпечуючи гнучкий і потужний підхід до модерації вмісту. Ці моделі доступні в дослідницькій попередній версії, тож із часом вони, безперечно, удосконалюватимуться.

Напередодні випуску ми співпрацювали з OpenAI та проводили оцінювання в реальних умовах, щоб допомогти в розробці моделей. У цій статті ми ділимося висновками з цієї співпраці та розглядаємо, що ці досягнення означають для майбутнього модерації в робочих системах ШІ.

Як сьогодні працює модерація в робочих системах?

Сьогодні рішення для модерації зазвичай реалізують як кілька рівнів захисту навколо застосунку. Ми часто застосовуємо цю схему в загальнодоступних системах із великим навантаженням. Докладніше про це можна прочитати в нашому блозі тут.

  1. Паралельно класифікуйте вхідні дані (не пропускайте шкідливі запити): невеликі тематичні класифікатори одночасно присвоюють мітку кожному повідомленню користувача. Ми з’ясували, що вузькоспеціалізовані класифікатори помітно надійніші за один універсальний. Ретельно підібрані приклади для запиту з кількома прикладами допомагають відрізнити “I keep getting killed by this boss” (цілком нешкідливий ігровий контекст) від сигналу про реальну загрозу.

    • Безпечно → генерувати як зазвичай

    • Джейлбрейки → ігнорувати або відхиляти у стилі бренду

    • Ризики для безпеки чи добробуту → передати фахівцю разом із докладним контекстом

  2. Класифікуйте вихідні дані (не надсилайте шкідливу відповідь): кожна потенційна відповідь проходить повторну перевірку перед надсиланням. Це захищає від дрейфу моделі, отруєння даних RAG і неочевидних граничних випадків політики, як-от шкідливий вміст, розкриття PII або витік конфіденційної інформації. Якщо відповідь позначено, замість згенерованої LLM відповіді ми надсилаємо безпечне повідомлення в стилі бренду або передаємо її фахівцю, щоб не надсилати те, про що потім пошкодуємо.

  3. Забезпечте швидкість і доступність: створення запитів із багаторазово використовуваних блоків дає змогу кешувати фрагменти запитів, приклади для класифікатора з кількома прикладами та типові початки діалогів. Такий підхід зменшує і затримку, і вартість захисних механізмів.

  4. Ставтеся до безпеки як до складової продукту. Відмови й попередження мають відповідати стилю бренду: наприклад, бути грайливими в іграх і формальними у фінансовій сфері. Коли інтерфейс ураховує намір користувача, люди краще сприймають захисні механізми, а кількість спроб джейлбрейку зменшується.

  5. Відстежуйте, перевіряйте на вразливості й ризики та замикайте цикл. Безперервна перевірка на вразливості та ризики й активні панелі моніторингу безпеки допомагають виявляти регресії до того, як із ними зіткнуться користувачі. Ми можемо навчати модель розпізнавати нові схеми атак, додаючи приклади з кількома прикладами та/або правила маршрутизації. Так систему з часом стає важче зламати без погіршення продуктивності застосунку.

Сучасні виклики під час створення рішення для модерації

Створювати й підтримувати ефективні захисні механізми складно.

На практиці для створення чітко визначеної політики потрібна тісна співпраця ключових представників бізнесу та розробників. Після визначення політики потрібно спроєктувати й налаштувати саму систему та її поведінку.

Поява відкритих моделей міркування для безпеки, як-от gpt-oss-safeguard, може усунути деякі труднощі цього процесу, надавши універсальнішу й майже готову до використання основу для модерації вмісту.

Потенціал спеціалізованих моделей безпеки

Gpt-oss-safeguard покликана розв’язати деякі типові проблеми, що виникають під час створення сучасних систем модерації. Ці невеликі спеціалізовані моделі донавчені аналізувати цільову політику під час інференсу та виявляти шкідливий або конфіденційний вміст, як-от джейлбрейки, розкриття PII та інші порушення політики.

Завдяки міркуванню в процесі класифікації вони забезпечують точнішу й стійкішу модерацію, яку важче обійти. Як спеціалізовані безпекові версії GPT-OSS 20B і 120B, вони забезпечують передовий рівень безпеки та потребують мінімального налаштування завдяки власним визначенням політик.

Що ми тестували

Ми оцінили gpt-oss-safeguard 20B і 120B на кількох завданнях, наближених до реальних: голосовому асистенті реального часу, ігровому боті підтримки гравців, системі проактивної модерації чатів і багатомовному виявленні токсичності іспанською, французькою, італійською, португальською, російською та турецькою мовами.

Що ми з’ясували

  • Голосова модерація з жорсткими вимогами до затримки: у наших тестах голосової взаємодії в реальному часі — тобто класифікації безпосередньо під час розмови, коли відповідь потрібно проаналізувати й визначити її пріоритет, як у модерації ігрового чату, — gpt-oss-safeguard-20B усунула приблизно 80% розриву в точності між GPT-OSS-20B і GPT-5-Mini (0,71 проти 0,78 порівняно з початковими 0,45) за значно меншої затримки.

  • Передавання звернень службі підтримки гравців: під час сортування звернень gpt-oss-safeguard-20B усунула приблизно 90% розриву між GPT-OSS-20b і GPT-5-Mini (0,66 проти 0,67 порівняно з початковими 0,57). Вона також показала найкращу в групі макроточність, 88% повноти для нешкідливого вмісту та 87% точності у виявленні вразливих користувачів. Це корисно для обережного передавання лише надійно визначених випадків без перевантаження фахівців.

  • Масштабна модерація чатів зі складними політиками: у нашому найвимогливішому оцінюванні, де система модерації мала проактивно позначати внутрішньоігрові повідомлення відповідно до докладного документа політики, gpt-oss-safeguard упевнено перевершила базову OSS-модель, забезпечивши відносний приріст приблизно на 35% та ефективно обробляючи довгі політики. Це особливо чутливий сценарій, що вимагає високої повноти й точності. За надто низької повноти система пропустить багато шкідливих повідомлень. А низька точність призведе до того, що модераторам надходитиме багато нерелевантних повідомлень, відволікаючи їх від справді складних випадків.

  • Багатомовна ефективність: на збалансованому наборі даних про токсичність шістьма мовами gpt-oss-safeguard демонструвала результати, близькі до GPT-5-Mini: різниця в точності зазвичай становила 3–5 в. п., а gpt-oss-safeguard-120B трохи випередила її для іспанської мови. Ми спостерігали дещо більші розриви для мов із меншою кількістю ресурсів, як-от турецька. Однак загалом модель стабільно працювала різними мовами, а перехід від 20B до 120B послідовно підвищував повноту.

Ми також помітили, що моделі gpt-oss-safeguard показують високі результати в аспектах модерації, де LLM традиційно слабші, зокрема для даних PII. Поширені моделі зазвичай краще розпізнають PII у форматах США й гірше працюють із даними інших регіонів. Тому ми вважаємо, що gpt-oss-safeguard допоможе спростити налаштування модерації, зменшивши залежність від спеціалізованих інструментів для виявлення дрібних порушень політик, з якими не можуть упоратися універсальні LLM.

Можливості цільового донавчання

Отже, наші оцінювання показали, що «базові моделі модерації», як-от gpt-oss-safeguard-20B і gpt-oss-safeguard-120B, дають змогу швидко досягти значних результатів. Однак коли системи мають відповідати найвищим стандартам безпеки й точності, еталоном досі залишається донавчання для конкретної предметної області.

Знімок екрана, що демонструє можливості цільового донавчання.

Для модерації в грі ми виконали кероване донавчання класифікатора Qwen3-0.6B приблизно на 10 тис. історичних рішень модераторів і результатів застосування політик. Ця модель зі значним відривом перевершує всі базові моделі, які ми тестували для цього завдання: точність становить 57% проти 15% у gpt-oss-safeguard-120B (оцінено за співвідношенням із результатом GPT-4.1-nano), тобто на 42 в. п. і приблизно на 280% більше. Ці результати узгоджуються з рекомендаціями OpenAI: менші спеціалізовані класифікатори, навчені на розмічених прикладах, можуть перевершувати захисні моделі у вузьких предметних областях.

Висновок очевидний: коли політики мають багато нюансів і граничних випадків, найкращим рішенням залишається невелика модель, налаштована для конкретної предметної області. Під час донавчання політика та граничні випадки безпосередньо закладаються в параметри моделі. Це забезпечує стабільнішу поведінку в непередбачуваних реальних умовах із мінімальними затримкою та витратами.

Кероване донавчання — лише один із кількох можливих підходів. Для подальшої оптимізації поведінки моделі можна також використовувати інші потужні методи навчання, як-от навчання з підкріпленням або дистиляція на даних поточної політики.

Застереження щодо донавчання

Зазвичай для донавчання потрібен великий обсяг даних. Набір даних для донавчання цього класифікатора Qwen3-0.6B був вручну розмічений модераторами, а тому слугував чистим і надійним еталонним джерелом.

На початку багатьох проєктів такої переваги у вигляді якісних даних може не бути. Тому ми зазвичай розглядаємо донавчання як оптимізацію, яку можна провести на пізнішому етапі розробки рішення. Коли структура рішення стабілізується й буде зібрано достатньо реальних даних користувачів, розробники зможуть застосувати цільове донавчання, щоб вивести свої рішення для модерації на новий рівень.

Підсумки

Базові моделі модерації на кшталт gpt-oss-safeguard — це нові потужні складові для побудови систем. Вони можуть суттєво спростити проєктування систем модерації та водночас зменшити затримку в застосунках реального часу. Поєднавши їх із невеликими спеціалізованими класифікаторами, можна створити безпечнішу та швидшу систему з меншою кількістю компонентів, ніж у підході на основі запитів із великими моделями загального призначення.

Якщо ви створюєте або модернізуєте систему модерації, спершу розгляньте моделі на кшталт gpt-oss-safeguard, виміряйте їхню ефективність, а там, де дані виявлять прогалини, додайте цільові вдосконалення за допомогою спеціалізованих класифікаторів — на основі запитів або донавчених.

Хочете дізнатися більше? Напишіть нам.

Автор

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke