Offentligt tilgængelige applikationer baseret på store sprogmodeller (LLM'er) kan udsætte brands for omdømmemæssige og økonomiske risici.
Vi bruger klassifikationsfiltre i flere lag til at reducere skader fra LLM-jailbreaks og anden utilsigtet LLM-adfærd.
Vi har anvendt denne tilgang i en produktionsapplikation med stor trafik, som håndterer 40.000 beskeder om dagen – og antallet stiger.
Det seneste år har vi samarbejdet med en førende spiludvikler om at implementere en GenAI-chatbot, der håndterer omkring 40.000 beskeder om dagen fra en spillerbase, der også omfatter børn. Det er afgørende at skabe balance mellem hastighed, nøjagtighed, sikkerhed og underholdning:
Når du skaber en chatbot, der skal repræsentere dit brand, er det ikke nok, at den er sikker – den skal også lyde autentisk som jer.
For en spilvirksomhed betyder det, at sikkerhed skal gå hånd i hånd med sjov og begejstring hos brugerne – især de yngre målgrupper.
De LLM'er, der ligger til grund for moderne GenAI-applikationer, er meget fleksible – og derfor kan de generalisere så godt på tværs af mange problemstillinger – men de er samtidig ikke tilstrækkeligt begrænsede. Det betyder, at de ofte kan komme på afveje og returnere mange forskellige typer tekst, hvoraf nogle kan være upassende.
Hvis en LLM gøres direkte tilgængelig for offentligheden, vil det uundgåeligt føre til uventet adfærd, og uden de rette modforanstaltninger er der risiko for:
Jailbreaks, hvor brugere med vilje manipulerer chatbotten til at producere skadeligt eller forbudt indhold (sjov detalje: Alle kan besøge dette websted og udforske LLM-jailbreaking gennem et underholdende spil …), eller
Utilsigtet levering af stødende, krænkende eller farligt indhold. I mange tilfælde kan det true en brugers trivsel eller påføre applikationsudbyderen økonomisk skade eller skade på brandet.
Nyhedsoverskrifter om utilsigtet brug af LLM'er:
Disse hændelser understreger, hvorfor det ikke er valgfrit at opbygge og opretholde sikkerheden i GenAI-systemer. Det gælder især, når små børn er involveret. Her kan man ikke nøjes med ansvarsfraskrivelser – robuste sikkerhedsforanstaltninger er afgørende for at sikre passende indhold.
Ligesom i de RAG-systemer (Retrieval-Augmented Generation), vi har bygget til kunder, bruger vi flere AI-komponenter til at reducere risikoen for jailbreaking og samtidig bevare en høj ydeevne.


Et forenklet arkitekturdiagram over vores system
For at sikre systemet bruger vi LLM-klassifikatorer på både input og output:
Klassifikation af input (kører parallelt)
Vi brugte Pydantic-skemaer sammen med strukturerede LLM-outputs til at mærke brugerforespørgsler (f.eks. SAFE, SUSPICIOUS, CHILD_HARM_RISK og VIOLENT). Det omfattede også markeringer til at identificere jailbreaking eller ikke-tilladt adfærd.
Flere klassifikatorer til individuelle emner gav markant bedre resultater end én stor klassifikator, der skulle kunne håndtere alt.
Omfattende eksempler med få eksempler var afgørende for, at klassifikatorerne kunne skelne mellem “I keep being killed by this character” (med henvisning til spillet) og “I am being hurt by my parent” (et tegn på, at et barn udsættes for skade).
Et tæt samarbejde med kunden og dennes specialiserede teams for tillid og sikkerhed sikrede, at vores klassifikatorer afspejlede, hvordan de i praksis ville vurdere højrisikobeskeder.


Generering af svar
Den primære LLM genererer et svar, hvis inputtet vurderes som sikkert.
Ellers kan beskeden ignoreres ved jailbreaks eller sendes videre til et menneske, hvis forespørgslen udløser en sikkerhedsadvarsel.
Klassifikation af output
Før det endelige svar forlader vores applikation, klassificerer vi modellens svar.
Da nogle svar kan anvende RAG-teknikker med data indsamlet fra internettet, beskytter dette trin os mod dataforgiftning.
Hvis svaret indeholder ikke-tilladt indhold, griber systemet ind og erstatter det med en generel besked. I praksis er det sjældent sket, men laget fungerer som en ekstra sikkerhedsforanstaltning, der sikrer, at agentens adfærd forbliver passende.
For at sikre hastighed og lave omkostninger:
Vi gemmer ofte anvendte prompter og delvise dialoger sammen med et nøje udvalgt sæt eksempler med få eksempler.
Denne caching gør det muligt at anvende LLM-klassifikatorerne hurtigt og billigt uden at skulle genopbygge konteksten hver gang.


Et nyligt studie fra Anthropic beskrev konstitutionelle klassifikatorer – et system, der anvender yderligere klassifikatorer, som er trænet ud fra »konstitutionelle« regler, til at opdage ondsindede eller usikre forespørgsler. De rapporterede:
Stor robusthed over for tusindvis af timers menneskelig red-teaming.
Meget få unødvendige afvisninger og moderat ekstra beregningsforbrug.
Vi ser en fremtid, hvor disse konstitutionelle tilgange kan supplere eller ligefrem erstatte traditionelle klassifikationslag og dermed yde et mere omfattende forsvar mod nye jailbreaking-taktikker.
Parallelle, lette filtre
Klassifikationslag forhindrer ondsindede forespørgsler i overhovedet at nå den generative kerne og sikrer, at dårlige outputs aldrig leveres.
Brugeroplevelsen er vigtig
Når advarslerne er underholdende og forankret i spillets univers, og afvisningerne er legende, er brugerne mere tilbøjelige til at acceptere systemets begrænsninger.
Gå ikke på kompromis med test og overvågning
Regelmæssig red-teaming og hyppig overvågning af spillernes adfærd hjælper med at opdage sårbarheder, før den brede spillerbase får kendskab til dem. De kan derefter føres tilbage til klassifikatorprompterne med få eksempler, så de ikke kan udnyttes fremover. Det er i øjeblikket en manuel proces, men den kan automatiseres.
Uanset om I er en spilvirksomhed, en bank eller en offentlig myndighed, skal I prioritere BÅDE brugerdesign og troværdighed, hvis I vil implementere en kundeservicechatbot i stor skala.
Vi bygger kundevendte løsninger til organisationer og brands, hvor:
Sikkerheden er altafgørende – chatbots, der skaber værdi for brugerne, men samtidig beskytter dem konsekvent mod skadeligt indhold
Omdømmet skal beskyttes – vi designer flere beskyttelseslag, der værner om brandets omdømme, selv når brugere forsøger at presse systemet ud over dets grænser
Regler begrænser jeres muligheder – vi holder os ajour med de nyeste retningslinjer for compliance, så I kan skalere løsningerne uden at bekymre jer om jailbreaks af applikationen