Yüksek riskli işletmeler için güvenli sohbet ajanları geliştirme

Markanızı temsil edecek bir sohbet botu oluştururken yalnızca güvenli olmasını istemezsiniz; aynı zamanda markanızın özgün sesini yansıtması gerekir.

Yönetici özeti

  • Herkese açık LLM uygulamaları, markaları itibar ve finansal risklerle karşı karşıya bırakabilir.

  • LLM jailbreak’lerinden ve LLM’lerin diğer istenmeyen davranışlarından doğabilecek zararları azaltmak için katmanlı sınıflandırma filtreleri kullanıyoruz.

  • Bu yaklaşımı, günde 40.000’i aşkın ve giderek artan sayıda mesaj alan, yüksek hacimli bir canlı uygulamada hayata geçirdik.

Giriş

Geçtiğimiz yıl, çocukların da bulunduğu bir oyuncu kitlesinden günde yaklaşık 40.000 mesaj alan bir GenAI sohbet botunu kullanıma sunmak için önde gelen bir oyun geliştiricisiyle iş birliği yaptık. Hız, doğruluk, güvenlik ve eğlence arasında denge kurmak çok önemlidir:

Markanızı temsil edecek bir sohbet botu oluştururken yalnızca güvenli olmasını istemezsiniz; aynı zamanda markanızın özgün sesini yansıtması gerekir.

Bir oyun şirketi söz konusu olduğunda bu, özellikle genç kitleler için güvenliği eğlence ve kullanıcı heyecanıyla birleştirmek demektir.

Modern GenAI uygulamalarının temelindeki LLM’ler oldukça esnektir; bu sayede pek çok probleme başarıyla genellenebilirler, ancak aynı zamanda yeterince kısıtlanmamışlardır. Bu nedenle sık sık belirlenen rotanın dışına çıkıp bazıları uygunsuz olabilecek çok çeşitli metinler üretebilirler.

Bir LLM’yi doğrudan halka açmak kaçınılmaz olarak beklenmedik davranışlara yol açar ve uygun önlemler alınmazsa şu riskleri doğurabilir:

Gerçek dünyadaki risklere kısa bir bakış…

LLM’lerin istenmeyen kullanımına ilişkin haber başlıkları:

Bu olaylar, GenAI sistemlerinde güvenliği sağlamanın ve sürdürmenin neden isteğe bağlı olmadığını gösteriyor. Bu, özellikle küçük çocuklar söz konusu olduğunda geçerlidir. Yalnızca sorumluluk reddi beyanlarına güvenemezsiniz; içeriği uygun tutmak için sağlam koruyucu önlemler şarttır.

Yaklaşımımız: katmanlı sınıflandırma ve prompt önbelleğe alma

Müşterilerimiz için geliştirdiğimiz RAG (Bilgi Getirme Destekli Üretim) sistemlerinde olduğu gibi, performansı yüksek tutarken jailbreak risklerini azaltmak için birden fazla yapay zekâ bileşeninden yararlanıyoruz.

Yaklaşımımızı gösteren şema: Katmanlı sınıflandırma ve prompt önbelleğe alma.

Sistemimizin basitleştirilmiş mimari şeması

Sistem güvenliğini sağlamak için hem girdilerde hem de çıktılarda LLM sınıflandırıcıları kullanıyoruz:

  1. Girdi Sınıflandırması (eş zamanlı çalışır)

  • Kullanıcı sorgularını etiketlemek için LLM yapılandırılmış çıktılarıyla birlikte Pydantic şemaları kullandık (ör. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT vb.). Buna jailbreak girişimlerini veya izin verilmeyen davranışları belirlemeye yönelik işaretler de dâhildi.

  • Her konu için ayrı sınıflandırıcılar kullanmak, her şeyi yakalamaya çalışan tek bir dev sınıflandırıcıdan çok daha iyi performans sağladı.

  • Sınıflandırıcıların “I keep being killed by this character” (oyuna atıfta bulunur) ile “I am being hurt by my parent” (çocuğa zarar verildiğinin göstergesi) ifadelerini ayırt edebilmesi için kapsamlı az örnekli örnekler kritik önem taşıdı.

  • Müşteriyle ve uzman güven ve güvenlik ekipleriyle yakın iş birliği yapmak, sınıflandırıcılarımızın gerçek hayattaki yüksek riskli mesajları onların değerlendireceği biçimde değerlendirmesini sağladı.

Yaklaşımımızı gösteren şema: Katmanlı sınıflandırma ve prompt önbelleğe alma.

  1. Yanıt Üretimi

  • Girdi güvenli kabul edilirse ana LLM bir yanıt üretir.

  • Aksi takdirde mesaj yok sayılabilir (jailbreak durumunda) veya bir insana aktarılabilir (sorgu bir güvenlik sorununa işaret ediyorsa).

  1. Çıktı Sınıflandırması

  • Modelin yanıtını kullanıcıya iletmeden önce uygulamamızda sınıflandırıyoruz.

  • Bazı yanıtlar internetten alınmış veriler üzerinde RAG tekniklerini kullanabildiğinden bu adım, bizi veri zehirleme saldırılarına karşı korur.

  • Yanıt izin verilmeyen içerik barındırıyorsa sistem devreye girer ve yanıtı genel bir mesajla değiştirir. Uygulamada bu durumla nadiren karşılaştık; yine de ajanın davranışının uygun kalmasını sağlamak için ihtiyatlı bir ek koruma katmanı görevi görür.

Hızı ve maliyet avantajını korumak için:

  • Yaygın kullanılan promptları ve kısmi diyalogları, özenle seçilmiş az örnekli örneklerle birlikte saklıyoruz.

  • Bu önbelleğe alma yöntemi, her seferinde bağlamı yeniden oluşturmadan LLM sınıflandırıcılarını hızlı ve düşük maliyetli biçimde uygulamamızı sağlıyor.

Yaklaşımımızı gösteren şema: Katmanlı sınıflandırma ve prompt önbelleğe alma.

Geleceğe bakış: anayasal sınıflandırıcılar

Anthropic’in yakın tarihli bir araştırması, kötü niyetli veya güvenli olmayan istekleri tespit etmek için “anayasal” kurallarla eğitilmiş ek sınıflandırıcılardan yararlanan Anayasal Sınıflandırıcılar adlı sistemi tanıttı. Bildirilen sonuçlar:

  • Binlerce saatlik insan odaklı red teaming çalışmasına karşı yüksek dayanıklılık.

  • Minimum düzeyde gereksiz ret oranı ve makul hesaplama yükü.

Gelecekte bu anayasal yaklaşımların geleneksel sınıflandırma katmanlarını tamamlayabileceğini, hatta bunların yerini alarak gelişen jailbreak taktiklerine karşı daha kapsamlı bir savunma sunabileceğini düşünüyoruz.

Özet: çıkardığımız dersler

  1. Paralel ve Hafif Filtreler

Sınıflandırma katmanları, kötü niyetli sorguların üretken çekirdeğe ulaşmasını ve yetersiz çıktıların kullanıcılara iletilmesini önler.

  1. Kullanıcı Deneyimi Önemlidir

Eğlenceli, oyun evrenine uygun uyarılara ve neşeli ret yanıtlarına odaklanıldığında kullanıcıların sistem kısıtlamalarını kabul etme olasılığı artar.

  1. Test ve İzlemeden Ödün Vermeyin

Düzenli red teaming çalışmalarının yanı sıra oyuncu davranışlarının sık sık izlenmesi, güvenlik açıklarının geniş oyuncu kitlesi tarafından öğrenilmeden önce tespit edilmesine yardımcı olur. Bunlar daha sonra, gelecekte kullanılmalarını önlemek için az örnekli sınıflandırıcı promptlarına eklenebilir. Bu işlem şu anda manuel olarak yapılıyor ancak otomatikleştirilebilir.

Gelecek için güvenli ve ilgi çekici GenAI sistemleri geliştirmek

İster bir oyun şirketi, ister banka, ister kamu kurumu olun; geniş ölçekte bir müşteri hizmetleri sohbet botu kullanacaksanız hem kullanıcı deneyimini hem de güvenilirliği hedeflemeniz gerekir.

Şu önceliklere sahip kuruluşlar ve markalar için müşteriye yönelik çözümler geliştiriyoruz:

  1. Güvenlik her şeyden önemlidir—sohbet botları kullanıcılara değer sunarken onları zararlı içeriklerden sıkı biçimde korur

  2. İtibar korunur—kullanıcılar sistemi sınırlarının ötesine zorlamaya çalışsa bile marka itibarını koruyan çok katmanlı önlemler tasarlarız

  3. Mevzuat seçeneklerinizi sınırlar—uygulamanızın jailbreak’e uğramasından endişe etmeden çözümlerinizi ölçekleyebilmeniz için en güncel uyumluluk yönergelerini yakından takip ederiz

Yazar

Andrew Liubinas