Sikre chatagenter til virksomheder med høj risiko

Når du skaber en chatbot, der skal repræsentere dit brand, er det ikke nok, at den er sikker – den skal også lyde autentisk som jer.

Resumé

  • Offentligt tilgængelige applikationer baseret på store sprogmodeller (LLM'er) kan udsætte brands for omdømmemæssige og økonomiske risici.

  • Vi bruger klassifikationsfiltre i flere lag til at reducere skader fra LLM-jailbreaks og anden utilsigtet LLM-adfærd.

  • Vi har anvendt denne tilgang i en produktionsapplikation med stor trafik, som håndterer 40.000 beskeder om dagen – og antallet stiger.

Introduktion

Det seneste år har vi samarbejdet med en førende spiludvikler om at implementere en GenAI-chatbot, der håndterer omkring 40.000 beskeder om dagen fra en spillerbase, der også omfatter børn. Det er afgørende at skabe balance mellem hastighed, nøjagtighed, sikkerhed og underholdning:

Når du skaber en chatbot, der skal repræsentere dit brand, er det ikke nok, at den er sikker – den skal også lyde autentisk som jer.

For en spilvirksomhed betyder det, at sikkerhed skal gå hånd i hånd med sjov og begejstring hos brugerne – især de yngre målgrupper.

De LLM'er, der ligger til grund for moderne GenAI-applikationer, er meget fleksible – og derfor kan de generalisere så godt på tværs af mange problemstillinger – men de er samtidig ikke tilstrækkeligt begrænsede. Det betyder, at de ofte kan komme på afveje og returnere mange forskellige typer tekst, hvoraf nogle kan være upassende.

Hvis en LLM gøres direkte tilgængelig for offentligheden, vil det uundgåeligt føre til uventet adfærd, og uden de rette modforanstaltninger er der risiko for:

Et indblik i risiciene i den virkelige verden …

Nyhedsoverskrifter om utilsigtet brug af LLM'er:

Disse hændelser understreger, hvorfor det ikke er valgfrit at opbygge og opretholde sikkerheden i GenAI-systemer. Det gælder især, når små børn er involveret. Her kan man ikke nøjes med ansvarsfraskrivelser – robuste sikkerhedsforanstaltninger er afgørende for at sikre passende indhold.

Vores tilgang: klassifikation i flere lag og caching af prompter

Ligesom i de RAG-systemer (Retrieval-Augmented Generation), vi har bygget til kunder, bruger vi flere AI-komponenter til at reducere risikoen for jailbreaking og samtidig bevare en høj ydeevne.

Diagram over vores tilgang: klassifikation i flere lag og caching af prompter.

Et forenklet arkitekturdiagram over vores system

For at sikre systemet bruger vi LLM-klassifikatorer på både input og output:

  1. Klassifikation af input (kører parallelt)

  • Vi brugte Pydantic-skemaer sammen med strukturerede LLM-outputs til at mærke brugerforespørgsler (f.eks. SAFE, SUSPICIOUS, CHILD_HARM_RISK og VIOLENT). Det omfattede også markeringer til at identificere jailbreaking eller ikke-tilladt adfærd.

  • Flere klassifikatorer til individuelle emner gav markant bedre resultater end én stor klassifikator, der skulle kunne håndtere alt.

  • Omfattende eksempler med få eksempler var afgørende for, at klassifikatorerne kunne skelne mellem “I keep being killed by this character” (med henvisning til spillet) og “I am being hurt by my parent” (et tegn på, at et barn udsættes for skade).

  • Et tæt samarbejde med kunden og dennes specialiserede teams for tillid og sikkerhed sikrede, at vores klassifikatorer afspejlede, hvordan de i praksis ville vurdere højrisikobeskeder.

Diagram over vores tilgang: klassifikation i flere lag og caching af prompter.

  1. Generering af svar

  • Den primære LLM genererer et svar, hvis inputtet vurderes som sikkert.

  • Ellers kan beskeden ignoreres ved jailbreaks eller sendes videre til et menneske, hvis forespørgslen udløser en sikkerhedsadvarsel.

  1. Klassifikation af output

  • Før det endelige svar forlader vores applikation, klassificerer vi modellens svar.

  • Da nogle svar kan anvende RAG-teknikker med data indsamlet fra internettet, beskytter dette trin os mod dataforgiftning.

  • Hvis svaret indeholder ikke-tilladt indhold, griber systemet ind og erstatter det med en generel besked. I praksis er det sjældent sket, men laget fungerer som en ekstra sikkerhedsforanstaltning, der sikrer, at agentens adfærd forbliver passende.

For at sikre hastighed og lave omkostninger:

  • Vi gemmer ofte anvendte prompter og delvise dialoger sammen med et nøje udvalgt sæt eksempler med få eksempler.

  • Denne caching gør det muligt at anvende LLM-klassifikatorerne hurtigt og billigt uden at skulle genopbygge konteksten hver gang.

Diagram over vores tilgang: klassifikation i flere lag og caching af prompter.

Fremtidsperspektiver: konstitutionelle klassifikatorer

Et nyligt studie fra Anthropic beskrev konstitutionelle klassifikatorer – et system, der anvender yderligere klassifikatorer, som er trænet ud fra »konstitutionelle« regler, til at opdage ondsindede eller usikre forespørgsler. De rapporterede:

  • Stor robusthed over for tusindvis af timers menneskelig red-teaming.

  • Meget få unødvendige afvisninger og moderat ekstra beregningsforbrug.

Vi ser en fremtid, hvor disse konstitutionelle tilgange kan supplere eller ligefrem erstatte traditionelle klassifikationslag og dermed yde et mere omfattende forsvar mod nye jailbreaking-taktikker.

Opsummering: Det har vi lært

  1. Parallelle, lette filtre

Klassifikationslag forhindrer ondsindede forespørgsler i overhovedet at nå den generative kerne og sikrer, at dårlige outputs aldrig leveres.

  1. Brugeroplevelsen er vigtig

Når advarslerne er underholdende og forankret i spillets univers, og afvisningerne er legende, er brugerne mere tilbøjelige til at acceptere systemets begrænsninger.

  1. Gå ikke på kompromis med test og overvågning

Regelmæssig red-teaming og hyppig overvågning af spillernes adfærd hjælper med at opdage sårbarheder, før den brede spillerbase får kendskab til dem. De kan derefter føres tilbage til klassifikatorprompterne med få eksempler, så de ikke kan udnyttes fremover. Det er i øjeblikket en manuel proces, men den kan automatiseres.

Sådan bygger vi fremtidens sikre og engagerende GenAI-systemer

Uanset om I er en spilvirksomhed, en bank eller en offentlig myndighed, skal I prioritere BÅDE brugerdesign og troværdighed, hvis I vil implementere en kundeservicechatbot i stor skala.

Vi bygger kundevendte løsninger til organisationer og brands, hvor:

  1. Sikkerheden er altafgørende – chatbots, der skaber værdi for brugerne, men samtidig beskytter dem konsekvent mod skadeligt indhold

  2. Omdømmet skal beskyttes – vi designer flere beskyttelseslag, der værner om brandets omdømme, selv når brugere forsøger at presse systemet ud over dets grænser

  3. Regler begrænser jeres muligheder – vi holder os ajour med de nyeste retningslinjer for compliance, så I kan skalere løsningerne uden at bekymre jer om jailbreaks af applikationen

Forfatter

Andrew Liubinas