Son iki yılda milyonlarca kullanıcıya güvenle ölçeklenen çözümler geliştirdik. Bu çalışmanın önemli bir parçası, hızlı ve doğru moderasyon sistemleri tasarlamaktı. Etkili moderasyon, istenmeyen üretimleri soruna dönüşmeden yakalayarak son kullanıcıları zarardan korur, marka güvenliğini sağlar ve şirketlerin son teknoloji yapay zekâ çözümlerini güvenle kullanıma sunmasına olanak tanır.
OpenAI kısa süre önce, bu yılın başlarında tanıtılan 20B ve 120B OSS modellerinin ince ayarlı sürümleri olan GPT-OSS-Safeguard modellerini yayımladı. Bu modeller, çıkarım sırasında kullanıcının politikasını doğrudan yorumlayarak içerik moderasyonuna esnek ve güçlü bir yaklaşım sunabiliyor. Araştırma önizlemesinde olan bu modeller kuşkusuz zaman içinde gelişmeye devam edecek.
Bu sürümden önce OpenAI ile iş birliği yaparak model geliştirme sürecine yön vermek üzere gerçek dünya değerlendirmeleri gerçekleştirdik. Bu makalede, söz konusu iş birliğinden edindiğimiz bilgileri paylaşıyor ve bu ilerlemelerin üretim ortamındaki yapay zekâ sistemlerinde moderasyonun geleceği açısından ne anlama geldiğini inceliyoruz.
Günümüzde moderasyon çözümleri genellikle uygulamayı çevreleyen koruma katmanları şeklinde tasarlanıyor. Bu modeli, yüksek hacimli ve son kullanıcıya açık uygulamalarımızda sıkça kullanıyoruz. Daha ayrıntılı bilgi için bu konudaki blog yazımıza buradan ulaşabilirsiniz.
Girdileri paralel olarak sınıflandırın (zararlı prompt'ları içeri almayın): Küçük ve konuya özel sınıflandırıcılar, her kullanıcı mesajını etiketlemek için eş zamanlı çalışır. Dar bir alana odaklanan sınıflandırıcıların, her şeyi kapsayan tek bir sınıflandırıcıdan ölçülebilir düzeyde daha güvenilir olduğunu gördük. Prompt'ta özenle seçilmiş az örnekli örnekler, “I keep getting killed by this boss” (oyun bağlamında tamamen zararsız) ifadesiyle gerçek dünyadaki bir zarar sinyalini ayırt etmeye yardımcı olabilir.
Güvenli → Normal şekilde üret
Jailbreak'ler → Yok say veya marka üslubuna uygun bir ret yanıtıyla savuştur
Güvenlik veya esenlik riskleri → Zengin bağlamla bir insana aktar
Çıktıları sınıflandırın (kötü bir yanıt sunmayın): Her aday yanıt, kullanıcıya iletilmeden önce yeniden taranır. Bu; model sapmasına, RAG veri zehirlenmesine ve zararlı içerik, kişisel bilgilerin açığa çıkması veya hassas bilgi sızıntısı gibi incelikli politika istisnalarına karşı koruma sağlar. İşaretlenen LLM üretimi yanıtı kullanıcıya sunup sonradan pişman olmak yerine, güvenli ve marka üslubuna uygun bir mesajla değiştirir ya da incelenmek üzere bir insana aktarırız.
Hızlı ve uygun maliyetli hâle getirin: Prompt'ları yeniden kullanılabilir yapı taşları olarak tasarlamak; prompt parçalarını, sınıflandırıcıların az örnekli örneklerini ve yaygın diyalog ön eklerini önbelleğe almanızı sağlar. Bu yaklaşım, güvenlik önlemlerinizin hem gecikmesini hem de maliyetini azaltır.
Güvenliği ürün deneyiminin bir parçası olarak ele alınRet yanıtları ve uyarılar uygun bir üslupla yazılır (ör. oyunlarda eğlenceli, finansta resmî). Kullanıcı deneyimi kullanıcının niyetine saygı gösterdiğinde, güvenlik önlemlerinin kabulü artar ve jailbreak girişimleri azalır.
İzleyin, red teaming uygulayın ve geri bildirim döngüsünü tamamlayınSürekli red teaming ve canlı güvenlik panoları, gerilemeleri kullanıcılara ulaşmadan yakalamaya yardımcı olur. Ek az örnekli örnekler ve/veya yönlendirme kuralları sağlayarak modele yeni saldırı kalıplarını öğretebiliriz. Böylece uygulama performansından ödün vermeden sistemin aşılması zamanla zorlaşır.
Etkili güvenlik önlemleri geliştirmek ve sürdürmek zordur.
Uygulamada, net biçimde tanımlanmış bir politika oluşturmak için başlıca iş paydaşlarıyla geliştiricilerin dikkatli bir iş birliği yürütmesi gerekir. Politika tanımlandıktan sonra sistemin tasarlanması, davranışlarının oluşturulması ve ayarlanması gerekir.
gpt-oss-safeguard gibi açık güvenlik akıl yürütme modellerinin ortaya çıkışı, içerik moderasyonu için daha kullanıma hazır ve çok yönlü bir temel sunarak bu süreçteki bazı sorunları çözme potansiyeli taşıyor.
gpt-oss-safeguard, günümüz moderasyon sistemlerini geliştirirken sık karşılaşılan bazı zorlukları ele almayı amaçlıyor. Bu küçük ve özel modeller; jailbreak'ler, kişisel bilgilerin açığa çıkması ve diğer politika ihlalleri gibi zararlı veya hassas içerikleri arayarak çıkarım sırasında hedef politika üzerinde akıl yürütmek üzere ince ayarlanmıştır.
Sınıflandırma süreçlerine akıl yürütmeyi dâhil ederek aşılması daha zor, daha doğru ve dayanıklı bir moderasyon sağlarlar. GPT-OSS 20B ve 120B'nin özel güvenlik varyantları olarak, özel politika tanımları sayesinde çok az kurulum yüküyle son teknoloji güvenlik performansı sunarlar.
gpt-oss-safeguard 20B ve 120B'yi üretim koşullarına benzer çeşitli görevlerde değerlendirdik: gerçek zamanlı sesli asistan, oyun içi oyuncu destek botu, proaktif sohbet moderasyon sistemi ve çok dilli toksisite taraması (İspanyolca, Fransızca, İtalyanca, Portekizce, Rusça ve Türkçe).
Gecikmeye duyarlı ses moderasyonu: Gerçek zamanlı ses testlerimizde (oyun sohbeti moderasyonunda olduğu gibi bir yanıtın analiz edilip önceliklendirilmesi gereken konuşma içi canlı sınıflandırmayı düşünün) gpt-oss-safeguard-20B, çok daha düşük gecikmeyle çalışırken GPT-OSS-20B ile GPT-5-Mini arasındaki doğruluk farkının yaklaşık %80'ini kapattı (0,45'ten 0,71'e karşı 0,78).
Oyuncu desteğine aktarma: Oyuncu desteği önceliklendirmesinde gpt-oss-safeguard-20B, GPT-OSS-20b ile GPT-5-Mini arasındaki farkın yaklaşık %90'ını kapattı (0,57'den 0,66'ya karşı 0,67). Ayrıca test grubundaki en iyi makro kesinlik değerini, zararsız içerikte %88 duyarlılığı ve savunmasız kullanıcıları tespit etmede %87 kesinliği sağladı. Bu, insan incelemecileri gereksiz vakalara boğmadan temkinli ve güvenilir aktarımlar yapmak isteyenler için yararlı.
Ölçekli ve yoğun politikalı sohbet moderasyonu: Bir moderasyon sisteminin kapsamlı bir politika belgesine göre oyun içi mesajları proaktif biçimde işaretlemesini gerektiren en zorlu değerlendirmemizde gpt-oss-safeguard, OSS temel modelinden açık ara daha iyi performans gösterdi; yaklaşık %35 göreli artış sağladı ve uzun politikaları etkili biçimde işledi. Bu, yüksek duyarlılık ve kesinlik gerektiren özellikle hassas bir kullanım senaryosudur. Duyarlılık çok düşük olursa birçok zararlı mesaj gözden kaçar. Kesinliğin düşük olması ise çok sayıda ilgisiz mesajın insan moderatörlere iletilmesine ve dikkatlerinin gerçekten zor vakalardan dağılmasına yol açar.
Çok dilli performans: Altı dilde dengelenmiş bir toksisite veri kümesinde gpt-oss-safeguard, doğruluk bakımından genellikle 3-5 yüzde puanı farkla GPT-5-Mini'ye yakın performans gösterdi; İspanyolcada ise gpt-oss-safeguard-120B az farkla öne geçti. Türkçe gibi daha az kaynaklı dillerde biraz daha büyük farklar gözlemledik. Ancak genel tablo, güçlü diller arası performans ve 20B'den 120B'ye geçerken tutarlı duyarlılık artışlarıydı.
Ayrıca gpt-oss-safeguard modellerinin, LLM'lerin moderasyonda geleneksel olarak daha zayıf olduğu alanlarda güçlü performans sergilediğini gördük. Buna, yaygın modellerin ABD tipi kişisel bilgileri belirlemeye daha yatkın olduğu ve diğer coğrafyalarda daha zayıf kaldığı kişisel bilgi verileri de dâhil. Bu nedenle gpt-oss-safeguard'ın, daha geniş kapsamlı LLM'lerin ele alamadığı küçük politika ihlallerini yakalamak için özel araçlara duyulan ihtiyacı azaltarak moderasyon kurulumlarını basitleştirmede yararlı olacağına inanıyoruz.
Değerlendirmelerimiz, gpt-oss-safeguard-20B ve gpt-oss-safeguard-120B gibi “temel moderasyon modellerinin” hızlıca önemli yol katetmenizi sağladığını ortaya koydu. Ancak sistemlerin en yüksek güvenlik ve özgüllük standartlarını karşılaması gerektiğinde çıtayı hâlâ alana özel ince ayarlı modeller belirliyor.


Oyun içi moderasyon kullanım senaryosunda, yaklaşık 10 bin geçmiş moderatör işlemi ve politika sonucu üzerinde denetimli ince ayar uygulayarak bir Qwen3-0.6B sınıflandırıcısına ince ayar yaptık. Bu model, söz konusu görevde test ettiğimiz tüm temel modellerden açık ara daha iyi performans göstererek %15'e karşı %57 doğruluğa ulaştı (gpt-oss-safeguard-120B sonucu, GPT-4.1-nano performans oranından tahmin edilmiştir); bu, 42 yüzde puanlık ve yaklaşık %280'lik bir artış demek. Bu sonuçlar, etiketli örneklerle eğitilen küçük ve özel amaçlı sınıflandırıcıların uzmanlık alanlarında güvenlik modellerinden daha iyi performans gösterebileceğine ilişkin OpenAI yönlendirmesiyle tutarlı.
Sonuç açık: Politikalar çok nüanslı ve istisnai durumlarla dolu olduğunda, alana göre ayarlanmış küçük bir model hâlâ altın standarttır. İnce ayar süreci, politikanızı ve istisnai durumları doğrudan parametrelere işler; böylece üretim ortamının karmaşasında daha tutarlı davranış, çok düşük gecikme ve maliyetle sağlanır.
Denetimli ince ayar, bunun için kullanılabilecek çeşitli yaklaşımlardan yalnızca biridir. Model davranışını daha da optimize etmek için pekiştirmeli öğrenme veya politika içi damıtma gibi diğer güçlü eğitim tekniklerinden de yararlanılabilir.
İnce ayar genellikle büyük miktarda veri gerektirir. Bu Qwen3-0.6B sınıflandırıcısına ince ayar yapmak için kullanılan veri kümesi, insan moderatörlerce elle etiketlenmişti ve bu nedenle temiz, güvenilir bir referans kaynağıydı.
Birçok projede başlangıçta böyle zengin bir veri avantajı bulunmayabilir. Bu nedenle ince ayarı, çözümün geliştirme döngüsünün ilerleyen aşamalarında uygulanabilecek bir optimizasyon olarak görüyoruz. Çözümün yapısı oturup gerçek kullanıcı verileri toplandıktan sonra geliştiriciler, moderasyon çözümlerini bir üst düzeye taşımak için hedefli ince ayara yönelebilir.
gpt-oss-safeguard gibi temel moderasyon modelleri, güçlü yeni yapı taşlarıdır. Gerçek zamanlı uygulamalarda gecikmeyi azaltırken moderasyon sistemlerinin tasarımını önemli ölçüde basitleştirebilirler. Bunları küçük, özel sınıflandırıcılarla birleştirerek büyük genel amaçlı modeller kullanan prompt tabanlı bir yaklaşıma kıyasla daha az bileşene sahip, daha güvenli ve hızlı bir sistem kurabilirsiniz.
Bugün bir moderasyon sistemi kuruyor veya mevcut sistemi yükseltiyorsanız önce gpt-oss-safeguard gibi modellerle başlamayı, performansı ölçmeyi ve verilerin boşluklara işaret ettiği yerlerde özel sınıflandırıcılarla (prompt tabanlı veya ince ayarlı) hedefli iyileştirmeler yapmayı değerlendirin.
Daha fazla bilgi edinmek ister misiniz? Bize mesaj gönderin.