Aplicațiile LLM destinate publicului pot expune mărcile unor riscuri reputaționale și financiare.
Folosim filtre de clasificare pe mai multe niveluri pentru a reduce efectele negative ale jailbreakurilor și ale altor comportamente neintenționate ale LLM-urilor.
Am aplicat această abordare într-o aplicație de producție cu volum mare, care procesează zilnic 40.000 de mesaje, iar numărul lor continuă să crească.
În ultimul an, am colaborat cu un dezvoltator important de jocuri pentru a implementa un chatbot GenAI care gestionează aproximativ 40.000 de mesaje pe zi de la o comunitate de jucători din care fac parte și copii. Este esențial să găsim echilibrul între viteză, precizie, siguranță și distracție:
Când creezi un chatbot care să-ți reprezinte marca, nu este suficient să fie sigur, ci trebuie să transmită în mod autentic identitatea mărcii.
În cazul unei companii de jocuri, aceasta înseamnă să îmbini siguranța cu distracția și entuziasmul utilizatorilor, mai ales când publicul este tânăr.
LLM-urile pe care se bazează aplicațiile GenAI moderne sunt foarte flexibile, motiv pentru care se adaptează atât de bine la numeroase probleme, dar au și prea puține constrângeri. Prin urmare, se pot abate adesea de la traseu și pot returna texte foarte variate, dintre care unele pot fi nepotrivite.
Expunerea directă a unui LLM către public va produce inevitabil comportamente neașteptate și, fără măsuri adecvate de protecție, poate genera riscul de:
„Jailbreakuri”, prin care utilizatorii manipulează intenționat chatbotul pentru a genera conținut dăunător sau interzis (fapt interesant: oricine poate vizita acest site pentru a explora jailbreakurile LLM printr-un joc distractiv…); sau
Furnizarea neintenționată de conținut neplăcut, ofensator sau periculos. În multe cazuri, acest lucru poate pune în pericol bunăstarea utilizatorilor sau poate cauza furnizorului aplicației prejudicii financiare ori de imagine.
Titluri din presă despre utilizări neintenționate ale LLM-urilor:
Aceste incidente demonstrează de ce integrarea și menținerea siguranței în sistemele GenAI nu sunt opționale. Acest lucru este cu atât mai important când sunt implicați copii mici: simplele avertismente nu sunt suficiente, iar măsurile robuste de protecție sunt esențiale pentru ca materialele să rămână adecvate.
La fel ca în cazul sistemelor RAG (generare augmentată prin regăsire) pe care le-am construit pentru clienți, folosim mai multe componente de IA pentru a reduce riscul de jailbreak, menținând totodată performanțe ridicate.


Diagramă simplificată a arhitecturii sistemului nostru
Pentru a garanta siguranța sistemului, folosim clasificatoare LLM atât pentru intrări, cât și pentru ieșiri:
Clasificarea intrărilor (efectuată simultan)
Am folosit scheme Pydantic împreună cu funcția speech-to-speech a LLM-urilor pentru a eticheta interogările utilizatorilor (de exemplu, SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT etc.). Aceasta a inclus și marcaje pentru identificarea jailbreakurilor sau a comportamentelor interzise.
Folosirea mai multor clasificatoare pentru subiecte individuale a oferit performanțe semnificativ mai bune decât un singur clasificator universal.
Folosirea extensivă a câtorva exemple a fost esențială pentru ca clasificatoarele să distingă între “I keep being killed by this character” (referire la joc) și “I am being hurt by my parent” (indiciu că un copil este rănit).
Colaborarea strânsă cu clientul și cu echipele sale specializate în încredere și siguranță a asigurat faptul că clasificatoarele noastre reflectau modul în care acestea ar evalua în practică mesajele cu risc ridicat.


Generarea răspunsului
LLM-ul principal generează un răspuns dacă intrarea este considerată sigură.
În caz contrar, mesajul poate fi ignorat, dacă este vorba despre un jailbreak, sau transmis unei persoane, dacă interogarea semnalează o problemă de siguranță.
Clasificarea ieșirilor
Înainte de livrarea finală și de ieșirea din aplicație, clasificăm răspunsul modelului.
Deoarece unele răspunsuri pot folosi tehnici RAG bazate pe date extrase de pe internet, acest pas protejează sistemul împotriva otrăvirii datelor.
Dacă răspunsul conține materiale interzise, sistemul intervine și îl înlocuiește cu un mesaj general. În practică, rareori ne-am confruntat cu această situație, dar este un strat suplimentar de precauție, care asigură menținerea unui comportament adecvat al agentului.
Pentru a menține viteza și costurile accesibile:
Stocăm solicitările utilizate frecvent și dialogurile parțiale, împreună cu un set atent selectat de câteva exemple.
Memorarea în cache ne permite să aplicăm clasificatoarele LLM rapid și cu costuri reduse, fără să reconstruim contextul de fiecare dată.


Un studiu recent realizat de Anthropic a descris clasificatoarele constituționale, un sistem bazat pe clasificatoare suplimentare, antrenate cu ajutorul unor reguli „constituționale”, pentru a detecta solicitările rău-intenționate sau nesigure. Autorii au raportat:
Rezistență ridicată la mii de ore de red teaming realizat de oameni.
Rate minime de refuz excesiv și un consum suplimentar moderat de resurse de calcul.
Preconizăm un viitor în care aceste abordări constituționale pot completa sau chiar înlocui nivelurile tradiționale de clasificare, oferind o apărare mai cuprinzătoare împotriva tacticilor de jailbreak aflate în continuă evoluție.
Filtre paralele și eficiente
Nivelurile de clasificare împiedică interogările rău-intenționate să ajungă la nucleul generativ și asigură că rezultatele necorespunzătoare nu sunt livrate niciodată.
Experiența utilizatorului contează
Dacă avertismentele sunt distractive și integrate în universul narativ, iar refuzurile au un ton jucăuș, utilizatorii vor fi mai dispuși să accepte constrângerile sistemului.
Nu faceți compromisuri la testare și monitorizare
Sesiunile periodice de red teaming și monitorizarea frecventă a comportamentului jucătorilor ajută la identificarea vulnerabilităților înainte ca acestea să devină cunoscute comunității mai largi. Aceste vulnerabilități pot fi apoi reintegrate în solicitările clasificatorului sub forma câtorva exemple, pentru a preveni exploatarea lor în viitor. În prezent, procesul este manual, dar ar putea fi automatizat.
Indiferent dacă reprezentați o companie de jocuri, o bancă sau chiar o instituție publică, implementarea la scară largă a unui chatbot pentru relații cu clienții trebuie să urmărească DEOPOTRIVĂ o experiență bună pentru utilizatori și fiabilitatea.
Construim soluții destinate clienților pentru organizații și mărci în cazul cărora:
Siguranța este primordială — chatboturi care le oferă valoare utilizatorilor, protejându-i totodată cu strictețe de conținutul dăunător
Reputația trebuie protejată — proiectăm mai multe niveluri de protecție care mențin intactă reputația mărcii, chiar dacă utilizatorii încearcă să forțeze sistemul dincolo de limitele sale
Reglementările vă limitează opțiunile — urmărim îndeaproape cele mai recente cerințe de conformitate, astfel încât să puteți extinde soluțiile fără grija că aplicația va fi compromisă printr-un jailbreak