Bygg säkra chattagenter för högriskverksamheter

När du skapar en chattbot som ska representera ditt varumärke räcker det inte att den är säker – den måste också låta som just er.

Sammanfattning

  • Publika applikationer baserade på stora språkmodeller (LLM) kan utsätta varumärken för anseendemässiga och ekonomiska risker.

  • Vi använder klassificeringsfilter i flera lager för att minska skador från jailbreaks och andra oönskade beteenden hos LLM.

  • Vi har tillämpat detta i en produktionsapplikation med stora volymer som hanterar 40 000 meddelanden per dag, och antalet ökar.

Introduktion

Under det senaste året har vi samarbetat med en ledande spelutvecklare för att lansera en GenAI-chattbot som hanterar omkring 40 000 meddelanden om dagen från en spelarbas där även barn ingår. Det är avgörande att balansera snabbhet, precision, säkerhet och nöje:

När du skapar en chattbot som ska representera ditt varumärke räcker det inte att den är säker – den måste också låta som just er.

För ett spelföretag innebär det att förena säkerhet med nöje och spelglädje – särskilt för yngre målgrupper.

De LLM som ligger till grund för moderna GenAI-applikationer är mycket flexibla – vilket gör att de kan generalisera så väl till många problem – men de har också för få begränsningar. Det innebär att de ofta kan lämna spåret och generera många olika slags texter, varav vissa kan vara olämpliga.

Att göra en LLM direkt tillgänglig för allmänheten leder garanterat till oväntade beteenden och kan utan lämpliga skyddsåtgärder medföra risk för:

En inblick i riskerna i verkligheten …

Nyhetsrubriker om oavsiktlig användning av LLM:

Dessa incidenter visar varför det inte är valfritt att bygga in och upprätthålla säkerheten i GenAI-system. Det gäller särskilt när små barn berörs. Det räcker inte med friskrivningar – robusta skyddsräcken är avgörande för att innehållet ska förbli lämpligt.

Vår metod: klassificering i flera lager och promptcachelagring

Precis som i de RAG-system (Retrieval-Augmented Generation) som vi har byggt åt kunder använder vi flera AI-komponenter för att minska riskerna för jailbreaks och samtidigt bibehålla höga prestanda.

Diagram över vår metod: klassificering i flera lager och promptcachelagring.

Ett förenklat arkitekturdiagram över vårt system

För att säkerställa systemets säkerhet använder vi LLM-klassificerare för både indata och utdata:

  1. Klassificering av indata (körs parallellt)

  • Vi använde Pydantic-scheman tillsammans med Strukturerade utdata från LLM för att märka användarfrågor (t.ex. SAFE, SUSPICIOUS, CHILD_HARM_RISK och VIOLENT). Detta omfattade även flaggor för att identifiera jailbreaks eller otillåtna beteenden.

  • Flera klassificerare för enskilda ämnen gav betydligt bättre resultat än en enda enorm klassificerare som skulle fånga allt.

  • Omfattande Few-shot-exempel var avgörande för att klassificerarna skulle kunna skilja mellan “I keep being killed by this character” (om spelet) och “I am being hurt by my parent” (ett tecken på att ett barn far illa).

  • Ett nära samarbete med kunden och dennes specialiserade tillits- och säkerhetsteam säkerställde att våra klassificerare återspeglade hur de skulle bedöma högriskmeddelanden i verkligheten.

Diagram över vår metod: klassificering i flera lager och promptcachelagring.

  1. Generering av svar

  • Den huvudsakliga LLM:en genererar ett svar om indatan bedöms vara säker.

  • Annars kan meddelandet ignoreras vid jailbreaks eller eskaleras till en människa om frågan flaggas som en säkerhetsrisk.

  1. Klassificering av utdata

  • Innan svaret lämnar applikationen klassificerar vi Modellens svar en sista gång.

  • Eftersom vissa svar kan använda RAG-tekniker med data som har hämtats från internet skyddar detta steg oss mot dataförgiftning.

  • Om svaret innehåller otillåtet material ingriper systemet och ersätter det med ett allmänt meddelande. I praktiken har detta inträffat mycket sällan, men det fungerar som ett extra försiktighetslager som säkerställer att Agentens beteende förblir lämpligt.

För att bibehålla snabbhet och kostnadseffektivitet:

  • Vi lagrar vanliga promptar och delar av dialoger tillsammans med en noga utvald uppsättning Few-shot-exempel.

  • Denna cachelagring gör att vi snabbt och kostnadseffektivt kan använda LLM-klassificerarna utan att behöva återskapa kontexten varje gång.

Diagram över vår metod: klassificering i flera lager och promptcachelagring.

Framtidsutsikter: konstitutionella klassificerare

En aktuell studie från Anthropic beskrev konstitutionella klassificerare – ett system som använder ytterligare klassificerare, tränade med ”konstitutionella” regler, för att upptäcka skadliga eller osäkra förfrågningar. De rapporterade:

  • Hög motståndskraft mot tusentals timmar av mänsklig red teaming.

  • Minimal andel överdrivna avvisningar och måttlig beräkningskostnad.

Vi ser en framtid där dessa konstitutionella metoder kan komplettera eller till och med ersätta traditionella klassificeringslager och ge ett mer heltäckande skydd mot nya jailbreak-taktiker.

Sammanfattning: våra lärdomar

  1. Parallella, resurssnåla filter

Klassificeringslager hindrar skadliga frågor från att nå den generativa kärnan och säkerställer att bristfälliga utdata aldrig levereras.

  1. Användarupplevelsen är viktig

Genom att använda roliga varningar förankrade i spelvärlden och lekfulla avvisningar blir användarna mer benägna att acceptera systemets begränsningar.

  1. Ta inga genvägar med testning och övervakning

Regelbunden red teaming och frekvent övervakning av spelarnas beteenden hjälper till att upptäcka sårbarheter innan de blir kända bland den bredare spelarbasen. Dessa kan sedan återföras till klassificerarnas promptar med få exempel för att förhindra att de utnyttjas framöver. I dagsläget görs detta manuellt, men processen skulle kunna automatiseras.

Bygg morgondagens säkra och engagerande GenAI-system

Oavsett om ni är ett spelföretag, en bank eller en myndighet måste en storskalig chattbot för kundtjänst utformas med fokus på BÅDE användarupplevelse och tillförlitlighet.

Vi bygger kundinriktade lösningar för organisationer och varumärken där:

  1. Säkerheten är avgörande – chattbotar som skapar värde för användarna men samtidigt ger dem ett strikt skydd mot skadligt innehåll

  2. Anseendet skyddas – vi utformar flera skyddslager som bevarar varumärkets anseende, även om användare försöker pressa systemet bortom dess gränser

  3. Regelverk begränsar era alternativ – vi håller oss uppdaterade om de senaste efterlevnadsriktlinjerna så att ni kan skala upp lösningar utan att oroa er för att applikationen utsätts för jailbreaks

Författare

Andrew Liubinas