Publika applikationer baserade på stora språkmodeller (LLM) kan utsätta varumärken för anseendemässiga och ekonomiska risker.
Vi använder klassificeringsfilter i flera lager för att minska skador från jailbreaks och andra oönskade beteenden hos LLM.
Vi har tillämpat detta i en produktionsapplikation med stora volymer som hanterar 40 000 meddelanden per dag, och antalet ökar.
Under det senaste året har vi samarbetat med en ledande spelutvecklare för att lansera en GenAI-chattbot som hanterar omkring 40 000 meddelanden om dagen från en spelarbas där även barn ingår. Det är avgörande att balansera snabbhet, precision, säkerhet och nöje:
När du skapar en chattbot som ska representera ditt varumärke räcker det inte att den är säker – den måste också låta som just er.
För ett spelföretag innebär det att förena säkerhet med nöje och spelglädje – särskilt för yngre målgrupper.
De LLM som ligger till grund för moderna GenAI-applikationer är mycket flexibla – vilket gör att de kan generalisera så väl till många problem – men de har också för få begränsningar. Det innebär att de ofta kan lämna spåret och generera många olika slags texter, varav vissa kan vara olämpliga.
Att göra en LLM direkt tillgänglig för allmänheten leder garanterat till oväntade beteenden och kan utan lämpliga skyddsåtgärder medföra risk för:
”Jailbreaks”, där användare avsiktligt manipulerar chattboten så att den skapar skadligt eller otillåtet innehåll (ett roligt tips: vem som helst kan besöka den här webbplatsen och utforska jailbreaks för LLM genom ett underhållande spel …), eller
Att oavsiktligt tillhandahålla stötande, kränkande eller farligt innehåll. I många fall kan detta äventyra användarnas välbefinnande eller skada applikationsleverantörens ekonomi och varumärke.
Nyhetsrubriker om oavsiktlig användning av LLM:
Dessa incidenter visar varför det inte är valfritt att bygga in och upprätthålla säkerheten i GenAI-system. Det gäller särskilt när små barn berörs. Det räcker inte med friskrivningar – robusta skyddsräcken är avgörande för att innehållet ska förbli lämpligt.
Precis som i de RAG-system (Retrieval-Augmented Generation) som vi har byggt åt kunder använder vi flera AI-komponenter för att minska riskerna för jailbreaks och samtidigt bibehålla höga prestanda.


Ett förenklat arkitekturdiagram över vårt system
För att säkerställa systemets säkerhet använder vi LLM-klassificerare för både indata och utdata:
Klassificering av indata (körs parallellt)
Vi använde Pydantic-scheman tillsammans med Strukturerade utdata från LLM för att märka användarfrågor (t.ex. SAFE, SUSPICIOUS, CHILD_HARM_RISK och VIOLENT). Detta omfattade även flaggor för att identifiera jailbreaks eller otillåtna beteenden.
Flera klassificerare för enskilda ämnen gav betydligt bättre resultat än en enda enorm klassificerare som skulle fånga allt.
Omfattande Few-shot-exempel var avgörande för att klassificerarna skulle kunna skilja mellan “I keep being killed by this character” (om spelet) och “I am being hurt by my parent” (ett tecken på att ett barn far illa).
Ett nära samarbete med kunden och dennes specialiserade tillits- och säkerhetsteam säkerställde att våra klassificerare återspeglade hur de skulle bedöma högriskmeddelanden i verkligheten.


Generering av svar
Den huvudsakliga LLM:en genererar ett svar om indatan bedöms vara säker.
Annars kan meddelandet ignoreras vid jailbreaks eller eskaleras till en människa om frågan flaggas som en säkerhetsrisk.
Klassificering av utdata
Innan svaret lämnar applikationen klassificerar vi Modellens svar en sista gång.
Eftersom vissa svar kan använda RAG-tekniker med data som har hämtats från internet skyddar detta steg oss mot dataförgiftning.
Om svaret innehåller otillåtet material ingriper systemet och ersätter det med ett allmänt meddelande. I praktiken har detta inträffat mycket sällan, men det fungerar som ett extra försiktighetslager som säkerställer att Agentens beteende förblir lämpligt.
För att bibehålla snabbhet och kostnadseffektivitet:
Vi lagrar vanliga promptar och delar av dialoger tillsammans med en noga utvald uppsättning Few-shot-exempel.
Denna cachelagring gör att vi snabbt och kostnadseffektivt kan använda LLM-klassificerarna utan att behöva återskapa kontexten varje gång.


En aktuell studie från Anthropic beskrev konstitutionella klassificerare – ett system som använder ytterligare klassificerare, tränade med ”konstitutionella” regler, för att upptäcka skadliga eller osäkra förfrågningar. De rapporterade:
Hög motståndskraft mot tusentals timmar av mänsklig red teaming.
Minimal andel överdrivna avvisningar och måttlig beräkningskostnad.
Vi ser en framtid där dessa konstitutionella metoder kan komplettera eller till och med ersätta traditionella klassificeringslager och ge ett mer heltäckande skydd mot nya jailbreak-taktiker.
Parallella, resurssnåla filter
Klassificeringslager hindrar skadliga frågor från att nå den generativa kärnan och säkerställer att bristfälliga utdata aldrig levereras.
Användarupplevelsen är viktig
Genom att använda roliga varningar förankrade i spelvärlden och lekfulla avvisningar blir användarna mer benägna att acceptera systemets begränsningar.
Ta inga genvägar med testning och övervakning
Regelbunden red teaming och frekvent övervakning av spelarnas beteenden hjälper till att upptäcka sårbarheter innan de blir kända bland den bredare spelarbasen. Dessa kan sedan återföras till klassificerarnas promptar med få exempel för att förhindra att de utnyttjas framöver. I dagsläget görs detta manuellt, men processen skulle kunna automatiseras.
Oavsett om ni är ett spelföretag, en bank eller en myndighet måste en storskalig chattbot för kundtjänst utformas med fokus på BÅDE användarupplevelse och tillförlitlighet.
Vi bygger kundinriktade lösningar för organisationer och varumärken där:
Säkerheten är avgörande – chattbotar som skapar värde för användarna men samtidigt ger dem ett strikt skydd mot skadligt innehåll
Anseendet skyddas – vi utformar flera skyddslager som bevarar varumärkets anseende, även om användare försöker pressa systemet bortom dess gränser
Regelverk begränsar era alternativ – vi håller oss uppdaterade om de senaste efterlevnadsriktlinjerna så att ni kan skala upp lösningar utan att oroa er för att applikationen utsätts för jailbreaks