Creació d'agents de xat segurs per a empreses d'alt risc

Quan creeu un bot de xat que representi la vostra marca, no n'hi ha prou que sigui segur: també ha de sonar autènticament vostre.

Resum executiu

  • Les aplicacions públiques de models de llenguatge extensos (LLM) poden exposar les marques a riscos financers i reputacionals.

  • Fem servir filtres de classificació per capes per reduir els danys causats per les evasions de proteccions de seguretat i altres comportaments imprevistos dels LLM.

  • Hem aplicat aquest enfocament en una aplicació en producció de gran volum que rep 40.000 missatges diaris, i la xifra continua augmentant.

Introducció

Durant l'últim any, hem col·laborat amb un desenvolupador de videojocs líder per desplegar un bot de xat d'IA generativa que gestiona uns 40.000 missatges al dia d'una base de jugadors que inclou infants. És essencial equilibrar la velocitat, la precisió, la seguretat i la diversió:

Quan creeu un bot de xat que representi la vostra marca, no n'hi ha prou que sigui segur: també ha de sonar autènticament vostre.

En el cas d'una empresa de videojocs, això vol dir combinar la seguretat amb la diversió i l'entusiasme dels usuaris, sobretot entre el públic més jove.

Els LLM en què es basen les aplicacions modernes d'IA generativa són molt flexibles —per això es poden generalitzar tan bé a molts problemes—, però també tenen poques restriccions. Això vol dir que sovint es poden desviar del guió i retornar una gran varietat de textos, alguns dels quals poden ser inadequats.

Exposar un LLM directament al públic sens dubte provocarà comportaments inesperats i, sense les mesures de mitigació adequades, pot comportar el risc de:

Un cop d'ull als riscos reals...

Titulars sobre usos imprevistos dels LLM:

Aquests incidents demostren per què crear i mantenir la seguretat en els sistemes d'IA generativa no és opcional. Això és especialment cert quan hi ha infants petits implicats: no es pot confiar només en advertiments legals; calen mesures de protecció sòlides per garantir que el contingut sigui adequat.

El nostre enfocament: classificació per capes i memòria cau d'indicacions

Com en els sistemes RAG (generació augmentada per recuperació) que hem creat per a clients, aprofitem diversos components d'IA per reduir els riscos d'evasió de proteccions de seguretat i mantenir un rendiment elevat.

Diagrama del nostre enfocament: classificació per capes i memòria cau d'indicacions.

Diagrama simplificat de l'arquitectura del nostre sistema

Per garantir la seguretat del sistema, fem servir classificadors LLM tant per a les entrades com per a les sortides:

  1. Classificació d'entrades (executada simultàniament)

  • Vam utilitzar esquemes de Pydantic juntament amb resultats estructurats dels LLM per etiquetar les consultes dels usuaris (p. ex., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, etc.). També incloïa indicadors per identificar evasions de proteccions de seguretat o comportaments no permesos.

  • L'ús de diversos classificadors per a temes concrets va oferir un rendiment molt millor que un únic classificador generalista capaç de "detectar-ho tot".

  • Disposar de molts exemples amb pocs exemples va ser fonamental perquè els classificadors distingissin entre "I keep being killed by this character" (en referència al joc) i "I am being hurt by my parent" (un indici de maltractament infantil).

  • L'estreta col·laboració amb el client i els seus equips especialitzats en confiança i seguretat va garantir que els nostres classificadors reflectissin com avaluarien els missatges d'alt risc en situacions reals.

Diagrama del nostre enfocament: classificació per capes i memòria cau d'indicacions.

  1. Generació de respostes

  • El LLM principal genera una resposta si l'entrada es considera segura.

  • En cas contrari, el missatge es pot ignorar —si és una evasió de proteccions de seguretat— o derivar a una persona —si la consulta activa una alerta de seguretat—.

  1. Classificació de sortides

  • Abans que surti de l'aplicació, classifiquem la resposta del model abans de lliurar-la definitivament.

  • Com que algunes respostes poden aplicar tècniques RAG a dades extretes d'Internet, aquest pas ens protegeix contra l'enverinament de dades.

  • Si conté contingut no permès, el sistema intervé i el substitueix per un missatge general. A la pràctica, rarament ens hi hem trobat, però és una capa addicional de prudència per garantir que el comportament de l'agent continuï sent adequat.

Per mantenir la velocitat i un cost assequible:

  • Emmagatzemem les indicacions i els diàlegs parcials d'ús habitual, juntament amb un conjunt seleccionat d'exemples amb pocs exemples.

  • Aquesta memòria cau ens permet aplicar els classificadors LLM amb rapidesa i a baix cost, sense haver de reconstruir el context cada vegada.

Diagrama del nostre enfocament: classificació per capes i memòria cau d'indicacions.

Mirant cap al futur: classificadors constitucionals

Un estudi recent d'Anthropic va descriure els classificadors constitucionals: un sistema basat en classificadors addicionals, entrenats mitjançant regles "constitucionals", per detectar sol·licituds malicioses o insegures. Els resultats indicaven:

  • Gran robustesa davant de milers d'hores de proves humanes d'equip vermell.

  • Índexs mínims de rebuig excessiu i una sobrecàrrega de còmput moderada.

Preveiem un futur en què aquests enfocaments constitucionals puguin complementar o fins i tot substituir les capes de classificació tradicionals, tot oferint una defensa més completa contra unes tàctiques d'evasió de proteccions de seguretat en evolució constant.

Resum: què hem après

  1. Filtres lleugers i en paral·lel

Les capes de classificació impedeixen que les consultes malicioses arribin al nucli generatiu i garanteixen que les sortides deficients no es lliurin mai.

  1. L'experiència d'usuari és important

Si es prioritzen la diversió, els avisos inspirats en l'univers del joc i els rebutjos amb un toc lúdic, els usuaris tendeixen més a acceptar les restriccions del sistema.

  1. No escatimeu en proves ni supervisió

Les proves periòdiques d'equip vermell i la supervisió freqüent del comportament dels jugadors ajudaran a detectar vulnerabilitats abans que les conegui el conjunt dels jugadors. Després, es poden incorporar a les indicacions del classificador amb pocs exemples per evitar que s'aprofitin en el futur. Actualment, aquest procés és manual, però es podria automatitzar.

Creació de sistemes d'IA generativa segurs i atractius per al futur

Tant si sou una empresa de videojocs, un banc o fins i tot un organisme públic, si voleu implementar a gran escala un bot de xat d'atenció al client, heu de prioritzar TANT el disseny de l'experiència d'usuari com la fiabilitat.

Creem solucions orientades al client per a organitzacions i marques en què:

  1. La seguretat és primordial: bots de xat que aporten valor als usuaris, però que els protegeixen estrictament del contingut perjudicial

  2. La reputació està protegida: dissenyem diverses capes de protecció que preserven la reputació de la marca, encara que els usuaris intentin dur el sistema més enllà dels seus límits

  3. La normativa limita les vostres opcions: ens mantenim al dia de les directrius de compliment més recents perquè pugueu ampliar les solucions sense preocupar-vos que la vostra aplicació pateixi una evasió de proteccions de seguretat

Autor

Andrew Liubinas