Veilige chatagents bouwen voor bedrijven met een hoog risicoprofiel

Als je een chatbot maakt die je merk vertegenwoordigt, wil je niet alleen dat deze veilig is, maar ook dat de chatbot echt klinkt zoals jouw merk.

Samenvatting

  • Publiek toegankelijke LLM-toepassingen kunnen merken blootstellen aan reputatie- en financiële risico's.

  • We gebruiken gelaagde classificatiefilters om de schade door LLM-jailbreaks en ander onbedoeld LLM-gedrag te beperken.

  • We hebben dit toegepast in een productieomgeving met een hoog volume, waarin dagelijks 40.000 berichten worden verwerkt en dat aantal blijft stijgen.

Inleiding

Het afgelopen jaar werkten we samen met een toonaangevende gameontwikkelaar aan de implementatie van een GenAI-chatbot die dagelijks ongeveer 40.000 berichten verwerkt van een spelersgroep waar ook kinderen deel van uitmaken. Een goede balans tussen snelheid, nauwkeurigheid, veiligheid en plezier is essentieel:

Als je een chatbot maakt die je merk vertegenwoordigt, wil je niet alleen dat deze veilig is, maar ook dat de chatbot echt klinkt zoals jouw merk.

Voor een gamebedrijf betekent dit dat veiligheid hand in hand moet gaan met plezier en enthousiasme bij gebruikers, zeker bij een jonger publiek.

De LLM's waarop moderne GenAI-toepassingen zijn gebaseerd, zijn zeer flexibel (waardoor ze zo goed inzetbaar zijn voor uiteenlopende problemen), maar ook onvoldoende begrensd. Daardoor kunnen ze vaak van het beoogde pad afwijken en allerlei soorten tekst retourneren, waarvan sommige mogelijk ongepast zijn.

Als een LLM rechtstreeks toegankelijk is voor het publiek, leidt dat onvermijdelijk tot onverwacht gedrag. Zonder passende maatregelen ontstaat het risico op:

Een blik op de risico's in de praktijk…

Nieuwsberichten over onbedoeld LLM-gebruik:

Deze incidenten onderstrepen waarom het opbouwen en in stand houden van veiligheid in GenAI-systemen geen vrijblijvende keuze is. Dit geldt des te meer wanneer er jonge kinderen bij betrokken zijn. Alleen waarschuwingen volstaan niet: robuuste veiligheidsmaatregelen zijn essentieel om content passend te houden.

Onze aanpak: gelaagde classificatie en promptcaching

Net als bij de RAG-systemen (Retrieval-Augmented Generation) die we voor klanten hebben gebouwd, zetten we meerdere AI-componenten in om het risico op jailbreaks te verkleinen en tegelijkertijd hoge prestaties te behouden.

Diagram van onze aanpak: gelaagde classificatie en promptcaching.

Een vereenvoudigd architectuurdiagram van ons systeem

Om de veiligheid van het systeem te waarborgen, gebruiken we LLM-classifiers voor zowel de input als de output:

  1. Inputclassificatie (gelijktijdig uitgevoerd)

  • We gebruikten Pydantic-schema's in combinatie met gestructureerde output van LLM's om vragen van gebruikers te labelen (bijvoorbeeld SAFE, SUSPICIOUS, CHILD_HARM_RISK en VIOLENT). Dit omvatte ook markeringen om jailbreaks of niet-toegestaan gedrag te herkennen.

  • Meerdere classifiers voor afzonderlijke onderwerpen presteerden aanzienlijk beter dan één allesomvattende megaclassifier.

  • Uitgebreide few-shotvoorbeelden waren cruciaal om ervoor te zorgen dat de classifiers onderscheid maakten tussen "I keep being killed by this character" (een verwijzing naar de game) en "I am being hurt by my parent" (een aanwijzing voor kindermishandeling).

  • Dankzij nauwe samenwerking met de klant en diens gespecialiseerde teams voor vertrouwen en veiligheid sloten onze classifiers aan op de manier waarop zij berichten met een hoog risico in de praktijk zouden beoordelen.

Diagram van onze aanpak: gelaagde classificatie en promptcaching.

  1. Antwoordgeneratie

  • De belangrijkste LLM genereert een antwoord als de input als veilig wordt beoordeeld.

  • Anders kan het bericht worden genegeerd (bij jailbreaks) of aan een medewerker worden voorgelegd (als de vraag op een veiligheidsprobleem wijst).

  1. Outputclassificatie

  • Voordat het antwoord onze toepassing verlaat en definitief wordt geleverd, classificeren we de reactie van het model.

  • Omdat sommige antwoorden met RAG-technieken gebruikmaken van gegevens die van internet zijn verzameld, beschermt deze stap ons tegen datavergiftiging.

  • Als het antwoord niet-toegestane content bevat, grijpt het systeem in en vervangt het die door een algemene melding. In de praktijk komt dit zelden voor, maar het is een extra voorzorgslaag om te zorgen dat het gedrag van de agent passend blijft.

Om snelheid en betaalbaarheid te waarborgen:

  • We slaan veelgebruikte prompts en gedeeltelijke dialogen op, samen met een zorgvuldig samengestelde reeks few-shotvoorbeelden.

  • Dankzij deze caching kunnen we de LLM-classifiers snel en voordelig toepassen, zonder de context telkens opnieuw te hoeven opbouwen.

Diagram van onze aanpak: gelaagde classificatie en promptcaching.

Blik op de toekomst: constitutionele classifiers

Een recente studie van Anthropic beschreef Constitutional Classifiers: een systeem dat gebruikmaakt van aanvullende classifiers die aan de hand van "constitutionele" regels zijn getraind om kwaadaardige of onveilige verzoeken te herkennen. Ze rapporteerden:

  • Hoge weerbaarheid tegen duizenden uren menselijke red teaming.

  • Een minimaal percentage onterechte weigeringen en een matige extra rekenbelasting.

We voorzien een toekomst waarin deze constitutionele benaderingen traditionele classificatielagen kunnen aanvullen of zelfs vervangen, en zo een uitgebreidere verdediging bieden tegen voortdurend veranderende jailbreaktactieken.

Samenvatting: wat we hebben geleerd

  1. Parallelle, lichtgewicht filters

Classificatielagen voorkomen dat kwaadaardige vragen ooit de generatieve kern bereiken en zorgen dat slechte output nooit bij de gebruiker terechtkomt.

  1. De gebruikerservaring is belangrijk

Door waarschuwingen leuk en passend bij de spelwereld te maken en verzoeken op speelse wijze te weigeren, zijn gebruikers eerder geneigd de beperkingen van het systeem te accepteren.

  1. Bezuinig niet op tests en monitoring

Regelmatige red teaming en frequente monitoring van spelersgedrag helpen kwetsbaarheden te ontdekken voordat ze bij de bredere spelersgroep bekend worden. Deze inzichten kunnen vervolgens worden verwerkt in de few-shotprompts van de classifiers om toekomstig misbruik te voorkomen. Momenteel gebeurt dit handmatig, maar het proces kan worden geautomatiseerd.

Veilige en aantrekkelijke GenAI-systemen bouwen voor de toekomst

Of je nu een gamebedrijf, een bank of zelfs een overheidsdienst bent: als je op grote schaal een klantenservicechatbot wilt inzetten, moet je zowel naar het gebruikersontwerp als naar betrouwbaarheid streven.

We bouwen klantgerichte oplossingen voor organisaties en merken waarvoor geldt dat:

  1. Veiligheid vooropstaat—chatbots bieden gebruikers meerwaarde, maar beschermen hen strikt tegen schadelijke content

  2. De reputatie wordt beschermd—we ontwerpen meerdere beschermingslagen die de merkreputatie intact houden, zelfs als gebruikers proberen het systeem over zijn grenzen te duwen

  3. Regelgeving je mogelijkheden beperkt—we blijven op de hoogte van de nieuwste compliancerichtlijnen, zodat je oplossingen kunt opschalen zonder je zorgen te maken dat je toepassing wordt gejailbreakt

Auteur

Andrew Liubinas