Herkese açık LLM uygulamaları, markaları itibar ve finansal risklerle karşı karşıya bırakabilir.
LLM jailbreak’lerinden ve LLM’lerin diğer istenmeyen davranışlarından doğabilecek zararları azaltmak için katmanlı sınıflandırma filtreleri kullanıyoruz.
Bu yaklaşımı, günde 40.000’i aşkın ve giderek artan sayıda mesaj alan, yüksek hacimli bir canlı uygulamada hayata geçirdik.
Geçtiğimiz yıl, çocukların da bulunduğu bir oyuncu kitlesinden günde yaklaşık 40.000 mesaj alan bir GenAI sohbet botunu kullanıma sunmak için önde gelen bir oyun geliştiricisiyle iş birliği yaptık. Hız, doğruluk, güvenlik ve eğlence arasında denge kurmak çok önemlidir:
Markanızı temsil edecek bir sohbet botu oluştururken yalnızca güvenli olmasını istemezsiniz; aynı zamanda markanızın özgün sesini yansıtması gerekir.
Bir oyun şirketi söz konusu olduğunda bu, özellikle genç kitleler için güvenliği eğlence ve kullanıcı heyecanıyla birleştirmek demektir.
Modern GenAI uygulamalarının temelindeki LLM’ler oldukça esnektir; bu sayede pek çok probleme başarıyla genellenebilirler, ancak aynı zamanda yeterince kısıtlanmamışlardır. Bu nedenle sık sık belirlenen rotanın dışına çıkıp bazıları uygunsuz olabilecek çok çeşitli metinler üretebilirler.
Bir LLM’yi doğrudan halka açmak kaçınılmaz olarak beklenmedik davranışlara yol açar ve uygun önlemler alınmazsa şu riskleri doğurabilir:
Kullanıcıların sohbet botunu zararlı veya izin verilmeyen içerikler üretmesi için kasıtlı olarak manipüle ettiği “jailbreak” saldırıları (eğlenceli bir bilgi: Herkes bu web sitesini ziyaret edip bir oyun aracılığıyla LLM jailbreak yöntemlerini keşfedebilir…) veya
İstemeden rahatsız edici, saldırgan veya tehlikeli içerikler sunulması. Bu durum çoğu zaman kullanıcıların esenliğini riske atabilir veya uygulama sağlayıcısının maddi zarara ya da itibar kaybına uğramasına yol açabilir.
LLM’lerin istenmeyen kullanımına ilişkin haber başlıkları:
Bu olaylar, GenAI sistemlerinde güvenliği sağlamanın ve sürdürmenin neden isteğe bağlı olmadığını gösteriyor. Bu, özellikle küçük çocuklar söz konusu olduğunda geçerlidir. Yalnızca sorumluluk reddi beyanlarına güvenemezsiniz; içeriği uygun tutmak için sağlam koruyucu önlemler şarttır.
Müşterilerimiz için geliştirdiğimiz RAG (Bilgi Getirme Destekli Üretim) sistemlerinde olduğu gibi, performansı yüksek tutarken jailbreak risklerini azaltmak için birden fazla yapay zekâ bileşeninden yararlanıyoruz.


Sistemimizin basitleştirilmiş mimari şeması
Sistem güvenliğini sağlamak için hem girdilerde hem de çıktılarda LLM sınıflandırıcıları kullanıyoruz:
Girdi Sınıflandırması (eş zamanlı çalışır)
Kullanıcı sorgularını etiketlemek için LLM yapılandırılmış çıktılarıyla birlikte Pydantic şemaları kullandık (ör. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT vb.). Buna jailbreak girişimlerini veya izin verilmeyen davranışları belirlemeye yönelik işaretler de dâhildi.
Her konu için ayrı sınıflandırıcılar kullanmak, her şeyi yakalamaya çalışan tek bir dev sınıflandırıcıdan çok daha iyi performans sağladı.
Sınıflandırıcıların “I keep being killed by this character” (oyuna atıfta bulunur) ile “I am being hurt by my parent” (çocuğa zarar verildiğinin göstergesi) ifadelerini ayırt edebilmesi için kapsamlı az örnekli örnekler kritik önem taşıdı.
Müşteriyle ve uzman güven ve güvenlik ekipleriyle yakın iş birliği yapmak, sınıflandırıcılarımızın gerçek hayattaki yüksek riskli mesajları onların değerlendireceği biçimde değerlendirmesini sağladı.


Yanıt Üretimi
Girdi güvenli kabul edilirse ana LLM bir yanıt üretir.
Aksi takdirde mesaj yok sayılabilir (jailbreak durumunda) veya bir insana aktarılabilir (sorgu bir güvenlik sorununa işaret ediyorsa).
Çıktı Sınıflandırması
Modelin yanıtını kullanıcıya iletmeden önce uygulamamızda sınıflandırıyoruz.
Bazı yanıtlar internetten alınmış veriler üzerinde RAG tekniklerini kullanabildiğinden bu adım, bizi veri zehirleme saldırılarına karşı korur.
Yanıt izin verilmeyen içerik barındırıyorsa sistem devreye girer ve yanıtı genel bir mesajla değiştirir. Uygulamada bu durumla nadiren karşılaştık; yine de ajanın davranışının uygun kalmasını sağlamak için ihtiyatlı bir ek koruma katmanı görevi görür.
Hızı ve maliyet avantajını korumak için:
Yaygın kullanılan promptları ve kısmi diyalogları, özenle seçilmiş az örnekli örneklerle birlikte saklıyoruz.
Bu önbelleğe alma yöntemi, her seferinde bağlamı yeniden oluşturmadan LLM sınıflandırıcılarını hızlı ve düşük maliyetli biçimde uygulamamızı sağlıyor.


Anthropic’in yakın tarihli bir araştırması, kötü niyetli veya güvenli olmayan istekleri tespit etmek için “anayasal” kurallarla eğitilmiş ek sınıflandırıcılardan yararlanan Anayasal Sınıflandırıcılar adlı sistemi tanıttı. Bildirilen sonuçlar:
Binlerce saatlik insan odaklı red teaming çalışmasına karşı yüksek dayanıklılık.
Minimum düzeyde gereksiz ret oranı ve makul hesaplama yükü.
Gelecekte bu anayasal yaklaşımların geleneksel sınıflandırma katmanlarını tamamlayabileceğini, hatta bunların yerini alarak gelişen jailbreak taktiklerine karşı daha kapsamlı bir savunma sunabileceğini düşünüyoruz.
Paralel ve Hafif Filtreler
Sınıflandırma katmanları, kötü niyetli sorguların üretken çekirdeğe ulaşmasını ve yetersiz çıktıların kullanıcılara iletilmesini önler.
Kullanıcı Deneyimi Önemlidir
Eğlenceli, oyun evrenine uygun uyarılara ve neşeli ret yanıtlarına odaklanıldığında kullanıcıların sistem kısıtlamalarını kabul etme olasılığı artar.
Test ve İzlemeden Ödün Vermeyin
Düzenli red teaming çalışmalarının yanı sıra oyuncu davranışlarının sık sık izlenmesi, güvenlik açıklarının geniş oyuncu kitlesi tarafından öğrenilmeden önce tespit edilmesine yardımcı olur. Bunlar daha sonra, gelecekte kullanılmalarını önlemek için az örnekli sınıflandırıcı promptlarına eklenebilir. Bu işlem şu anda manuel olarak yapılıyor ancak otomatikleştirilebilir.
İster bir oyun şirketi, ister banka, ister kamu kurumu olun; geniş ölçekte bir müşteri hizmetleri sohbet botu kullanacaksanız hem kullanıcı deneyimini hem de güvenilirliği hedeflemeniz gerekir.
Şu önceliklere sahip kuruluşlar ve markalar için müşteriye yönelik çözümler geliştiriyoruz:
Güvenlik her şeyden önemlidir—sohbet botları kullanıcılara değer sunarken onları zararlı içeriklerden sıkı biçimde korur
İtibar korunur—kullanıcılar sistemi sınırlarının ötesine zorlamaya çalışsa bile marka itibarını koruyan çok katmanlı önlemler tasarlarız
Mevzuat seçeneklerinizi sınırlar—uygulamanızın jailbreak’e uğramasından endişe etmeden çözümlerinizi ölçekleyebilmeniz için en güncel uyumluluk yönergelerini yakından takip ederiz