За последние два года мы создали решения, которые безопасно масштабировались на миллионы пользователей. Важной частью этой работы стало проектирование быстрых и точных систем модерации. Эффективная модерация позволяет компаниям уверенно внедрять передовые решения на основе ИИ: защищать конечных пользователей от вреда и репутацию бренда, выявляя нежелательный контент до того, как он станет проблемой.
Недавно OpenAI выпустила модели GPT-OSS-Safeguard — тонко настроенные версии представленных ранее в этом году открытых моделей 20B и 120B. Эти модели могут интерпретировать пользовательскую политику непосредственно во время вывода, обеспечивая гибкий и мощный подход к модерации контента. Пока модели доступны в предварительной исследовательской версии и, несомненно, будут со временем совершенствоваться.
Перед выпуском мы сотрудничали с OpenAI и проводили оценку моделей в реальных условиях, чтобы помочь в их разработке. В этой статье мы делимся выводами из совместной работы и рассматриваем, как эти достижения могут повлиять на будущее модерации в промышленных системах ИИ.
Сегодня решения для модерации обычно представляют собой несколько уровней защиты, окружающих приложение. Мы часто применяем эту схему в общедоступных системах с высокой нагрузкой. Подробнее об этом можно прочитать в нашем блоге.
Параллельно классифицируйте входные данные (не пропускайте вредоносные промпты): небольшие тематические классификаторы одновременно присваивают метки каждому сообщению пользователя. Мы обнаружили, что узкоспециализированные классификаторы заметно надежнее одного универсального. Тщательно подобранные few-shot-примеры в промпте помогают отличить фразу “I keep getting killed by this boss” (игровой контекст, совершенно безвредный) от сигнала о реальной угрозе.
Безопасно → Сгенерировать обычный ответ
Джейлбрейки → Игнорировать или отклонить с помощью отказа в стиле бренда
Риски для безопасности или благополучия → передать специалисту с подробным контекстом
Классифицируйте выходные данные (не отправляйте плохой ответ): каждый возможный ответ повторно проверяется перед отправкой. Это защищает от дрейфа модели, отравления данных RAG и неочевидных пограничных случаев политики, включая вредоносный контент, раскрытие персональных данных и утечку конфиденциальной информации. Если ответ помечен как небезопасный, вместо сгенерированного LLM ответа мы отправляем безопасное сообщение в стиле бренда или передаем случай специалисту.
Обеспечьте скорость и доступную стоимость: промпты в виде многократно используемых блоков позволяют кэшировать их фрагменты, few-shot-примеры классификатора и типовые начала диалогов. Такой подход сокращает и задержки, и стоимость защитных механизмов.
Сделайте безопасность частью продуктаОтказы и предупреждения должны соответствовать стилю продукта: например, быть шутливыми в играх и официальными в финансах. Когда интерфейс учитывает намерения пользователя, защитные механизмы воспринимаются лучше, а попыток джейлбрейка становится меньше.
Ведите мониторинг, проводите red teaming и используйте обратную связьНепрерывный red teaming и актуальные панели мониторинга безопасности помогают выявлять регрессии до того, как они затронут пользователей. Модель можно обучать новым схемам атак с помощью дополнительных few-shot-примеров и правил маршрутизации. Так систему со временем становится сложнее взломать без ущерба для производительности приложения.
Создавать и поддерживать эффективные защитные механизмы непросто.
На практике для разработки четкой политики необходимо тесное сотрудничество ключевых представителей бизнеса и разработчиков. После определения политики необходимо спроектировать систему и настроить ее поведение.
Появление открытых моделей рассуждений для обеспечения безопасности, таких как gpt-oss-safeguard, может устранить некоторые сложности этого процесса и предоставить более универсальную, практически готовую основу для модерации контента.
Gpt-oss-safeguard призвана решить некоторые распространенные проблемы, возникающие при создании современных систем модерации. Эти небольшие специализированные модели тонко настроены для анализа целевой политики во время вывода и выявляют вредоносный или конфиденциальный контент, включая джейлбрейки, раскрытие персональных данных и другие нарушения политики.
Используя рассуждения при классификации, они обеспечивают более точную и устойчивую модерацию, которую сложнее обойти. Будучи специализированными версиями GPT-OSS 20B и 120B для обеспечения безопасности, они достигают передовых результатов при минимальных затратах на настройку благодаря пользовательским определениям политик.
Мы оценили gpt-oss-safeguard 20B и 120B в нескольких задачах, приближенных к промышленным условиям: голосовой помощник реального времени, внутриигровой бот поддержки игроков, система проактивной модерации чатов и выявление токсичности на нескольких языках — испанском, французском, итальянском, португальском, русском и турецком.
Голосовая модерация с жесткими требованиями к задержке: в наших тестах голосовой связи в реальном времени — то есть при классификации внутри разговора, когда ответ нужно сразу проанализировать и определить его приоритет, как в модерации игрового чата, — gpt-oss-safeguard-20B сократила примерно 80% разрыва в точности между GPT-OSS-20B и GPT-5-Mini (0,71 против 0,78, по сравнению с исходными 0,45) при значительно меньшей задержке.
Передача обращений в поддержку игроков: при сортировке обращений gpt-oss-safeguard-20B сократила примерно 90% разрыва между GPT-OSS-20b и GPT-5-Mini (0,66 против 0,67, по сравнению с исходными 0,57). Она также показала лучшую в наборе макроусредненную точность, полноту 88% для безопасного контента и точность 87% при выявлении уязвимых пользователей. Это полезно для осторожной и надежной эскалации, не перегружающей модераторов.
Масштабная модерация чатов со сложной политикой: в нашей самой трудной оценке, где система должна была проактивно помечать игровые сообщения на основании объемного документа с политикой, gpt-oss-safeguard заметно превзошла базовую OSS-модель, обеспечив относительный прирост примерно на 35% и эффективно обрабатывая длинные политики. Это особенно ответственная задача, требующая высокой полноты и точности. При низкой полноте система пропустит множество вредоносных сообщений. А низкая точность приведет к тому, что модераторам будут передаваться многочисленные нерелевантные сообщения, отвлекая их от действительно сложных случаев.
Многоязычность: на сбалансированном наборе данных о токсичности на шести языках gpt-oss-safeguard демонстрировала результаты, близкие к GPT-5-Mini: разница в точности обычно составляла 3–5 п. п., а на испанском gpt-oss-safeguard-120B немного вышла вперед. В языках с меньшим объемом доступных данных, например турецком, разрыв был немного больше. Однако в целом модель стабильно работала на разных языках, а при переходе с 20B на 120B полнота неизменно повышалась.
Мы также обнаружили, что модели gpt-oss-safeguard показывают хорошие результаты в областях, где LLM традиционно слабее справляются с модерацией. Например, при выявлении персональных данных популярные модели обычно ориентированы на форматы США и хуже работают с данными из других регионов. Поэтому мы считаем, что gpt-oss-safeguard поможет упростить настройку модерации и снизить зависимость от специализированных инструментов для выявления мелких нарушений политик, с которыми не справляются универсальные LLM.
Итак, наши оценки показали, что «базовые модели модерации», такие как gpt-oss-safeguard-20B и gpt-oss-safeguard-120B, позволяют быстро добиться многого. Однако когда от системы требуются высочайшие стандарты безопасности и точности, специализированные тонко настроенные модели по-прежнему остаются эталоном.


Для модерации в игре мы выполнили контролируемую тонкую настройку классификатора Qwen3-0.6B примерно на 10 тыс. исторических решений модераторов и результатов применения политик. Эта модель значительно превзошла все протестированные нами базовые модели в данной задаче: точность составила 57% против 15% у gpt-oss-safeguard-120B (оценка по соотношению с результатом GPT-4.1-nano), то есть выросла на 42 п. п., или примерно на 280%. Эти результаты согласуются с рекомендациями OpenAI: небольшие специализированные классификаторы, обученные на размеченных примерах, в узких областях могут превосходить защитные модели.
Вывод очевиден: если политика содержит множество нюансов и пограничных случаев, небольшая модель, настроенная для конкретной области, остается золотым стандартом. В ходе тонкой настройки политика и пограничные случаи встраиваются непосредственно в параметры модели. Это обеспечивает более стабильное поведение в непредсказуемых реальных условиях при минимальных задержках и затратах.
Контролируемая тонкая настройка — лишь один из нескольких возможных подходов. Для дальнейшей оптимизации поведения модели можно также применять другие мощные методы обучения, например обучение с подкреплением или дистилляцию на данных текущей политики.
Для тонкой настройки обычно требуется большой объем данных. Набор данных для тонкой настройки классификатора Qwen3-0.6B был вручную размечен модераторами и потому представлял собой чистый, эталонный источник достоверных данных.
Во многих проектах на начальном этапе таких ценных данных может не быть. Поэтому мы обычно рассматриваем тонкую настройку как оптимизацию, которую можно провести на более позднем этапе разработки решения. Когда общая архитектура решения стабилизируется и будут собраны реальные пользовательские данные, разработчики смогут применить целевую тонкую настройку, чтобы вывести модерацию на новый уровень.
Базовые модели модерации, такие как gpt-oss-safeguard, — это новые мощные компоненты. Они способны заметно упростить проектирование систем модерации и сократить задержки в приложениях реального времени. Сочетая их с небольшими специализированными классификаторами, можно создать более безопасную и быструю систему с меньшим числом компонентов, чем при использовании больших универсальных моделей на основе промптов.
Если вы сегодня создаете или обновляете систему модерации, начните с моделей вроде gpt-oss-safeguard, оцените их эффективность, а там, где данные выявят пробелы, добавьте целевые улучшения на основе специализированных классификаторов — с промптами или тонкой настройкой.
Хотите узнать больше? Напишите нам.