Offentlig tilgjengelige LLM-applikasjoner kan utsette merkevarer for omdømme- og økonomisk risiko.
Vi bruker klassifiseringsfiltre i flere lag for å redusere skade fra LLM-jailbreak og annen utilsiktet LLM-atferd.
Vi har tatt dette i bruk i en produksjonsapplikasjon med stort volum, som håndterer 40 000 meldinger daglig – og tallet stiger.
Det siste året har vi samarbeidet med en ledende spillutvikler om å lansere en GenAI-chatbot som håndterer omtrent 40 000 meldinger om dagen fra en spillerbase som også omfatter barn. Det er avgjørende å balansere hastighet, nøyaktighet, sikkerhet og underholdning:
Når du lager en chatbot som skal representere merkevaren din, holder det ikke at den er trygg – den må også høres ut som dere.
For et spillselskap betyr det å kombinere sikkerhet med moro og engasjement – særlig for yngre målgrupper.
LLM-ene som moderne GenAI-applikasjoner bygger på, er svært fleksible – derfor kan de også generalisere så godt på tvers av mange problemer – men de har samtidig for få begrensninger. Det betyr at de ofte kan havne på avveie og returnere svært ulike typer tekst, der noe kan være upassende.
Å gjøre en LLM direkte tilgjengelig for offentligheten vil utvilsomt føre til uventet atferd og kan uten egnede mottiltak medføre risiko for:
«Jailbreak», der brukere med vilje manipulerer chatboten til å produsere skadelig eller forbudt innhold (et lite tips: Alle kan besøke dette nettstedet og utforske LLM-jailbreak gjennom et morsomt spill …), eller
utilsiktet levering av usmakelig, støtende eller farlig innhold. I mange tilfeller kan dette sette brukerens velferd i fare eller påføre appleverandøren økonomisk skade eller omdømmeskade.
Nyhetsoverskrifter om utilsiktet bruk av LLM-er:
Disse hendelsene understreker hvorfor det ikke er valgfritt å bygge inn og opprettholde sikkerhet i GenAI-systemer. Dette gjelder særlig når små barn er involvert. Da holder det ikke med ansvarsfraskrivelser – robuste sikkerhetsmekanismer er avgjørende for å sikre at innholdet er passende.
På samme måte som i RAG-systemene (Retrieval-Augmented Generation) vi har bygget for kunder, bruker vi flere KI-komponenter for å redusere risikoen for jailbreak og samtidig opprettholde høy ytelse.


Et forenklet arkitekturdiagram over systemet vårt
For å ivareta systemsikkerheten bruker vi LLM-klassifikatorer på både inndata og utdata:
Klassifisering av inndata (kjøres parallelt)
Vi brukte Pydantic-skjemaer sammen med strukturerte utdata fra LLM-er for å merke brukerforespørsler (f.eks. SAFE, SUSPICIOUS, CHILD_HARM_RISK og VIOLENT). Dette omfattet også flagg for å identifisere jailbreak eller forbudt atferd.
Flere klassifikatorer for hvert enkelt tema ga betydelig bedre ytelse enn én stor klassifikator som skulle fange opp alt.
Omfattende eksempler med få eksempler var avgjørende for at klassifikatorene skulle skille mellom «I keep being killed by this character» (om spillet) og «I am being hurt by my parent» (en indikasjon på at et barn blir skadet).
Tett samarbeid med kunden og deres spesialister på tillit og sikkerhet sikret at klassifikatorene våre gjenspeilte hvordan de ville ha vurdert høyrisikomeldinger i virkeligheten.


Generering av svar
Hoved-LLM-en genererer et svar dersom inndataene vurderes som trygge.
Ellers kan meldingen ignoreres ved jailbreak eller eskaleres til et menneske dersom forespørselen utløser et sikkerhetsvarsel.
Klassifisering av utdata
Før svaret sendes ut fra applikasjonen vår, klassifiserer vi modellens svar før endelig levering.
Ettersom enkelte svar kan bruke RAG-teknikker basert på data hentet fra internett, beskytter dette trinnet oss mot dataforgiftning.
Hvis svaret inneholder forbudt innhold, griper systemet inn og erstatter det med en generell melding. I praksis har dette sjelden skjedd, men det fungerer som et ekstra føre-var-lag som sikrer at agentens atferd forblir passende.
For å opprettholde høy hastighet og lave kostnader:
Vi lagrer ofte brukte prompter og deler av dialoger sammen med et kuratert sett med eksempler med få eksempler.
Denne hurtigbufringen gjør at vi kan bruke LLM-klassifikatorene raskt og rimelig, uten å måtte bygge opp konteksten på nytt hver gang.


En nyere studie fra Anthropic beskrev Constitutional Classifiers – et system som bruker flere klassifikatorer, trent med «konstitusjonelle» regler, for å oppdage ondsinnede eller utrygge forespørsler. De rapporterte:
Høy robusthet mot tusenvis av timer med menneskelig red teaming.
Minimal grad av unødvendige avvisninger og moderat ekstra beregningsbehov.
Vi ser for oss at slike konstitusjonelle tilnærminger kan utfylle eller til og med erstatte tradisjonelle klassifiseringslag og gi et mer helhetlig forsvar mot jailbreak-taktikker i stadig utvikling.
Parallelle, lette filtre
Klassifiseringslag hindrer at ondsinnede forespørsler når den generative kjernen – og sikrer at dårlige utdata aldri leveres.
Brukeropplevelsen er viktig
Ved å bruke morsomme advarsler forankret i spillets univers og lekne avvisninger blir brukerne mer tilbøyelige til å godta systemets begrensninger.
Ikke ta snarveier med testing og overvåking
Regelmessig red teaming og hyppig overvåking av spilleratferd gjør det lettere å oppdage sårbarheter før resten av spillerbasen blir kjent med dem. Disse funnene kan deretter mates tilbake til klassifikatorpromptene med få eksempler, slik at sårbarhetene ikke kan utnyttes senere. Dette gjøres nå manuelt, men kan automatiseres.
Enten du jobber i et spillselskap, en bank eller et offentlig organ, må en kundeservice-chatbot i stor skala utformes med mål om BÅDE en god brukeropplevelse og høy pålitelighet.
Vi bygger kundevendte løsninger for organisasjoner og merkevarer der:
Sikkerhet har høyeste prioritet – chatbotene gir brukerne verdi, men beskytter dem samtidig konsekvent mot skadelig innhold
Omdømmet må beskyttes – vi utformer flere beskyttelseslag som ivaretar merkevarens omdømme, selv når brukere prøver å presse systemet forbi grensene
Regelverket begrenser valgmulighetene – vi holder oss oppdatert på de nyeste retningslinjene for etterlevelse, slik at dere kan skalere løsningene uten å bekymre dere for jailbreak av applikasjonen