Glavna navigacija

Izrada sigurnih agenata za razgovor za visokorizične djelatnosti

Kada izrađujete chatbot koji predstavlja vašu robnu marku, nije dovoljno da bude samo siguran – mora i zvučati autentično, baš poput vas.

Sažetak

  • Javno dostupne aplikacije koje se temelje na velikim jezičnim modelima (LLM-ovima) mogu izložiti robne marke reputacijskim i financijskim rizicima.

  • Koristimo višeslojne klasifikacijske filtre kako bismo smanjili štetu koju mogu prouzročiti jailbreakovi i druga neželjena ponašanja LLM-ova.

  • Taj smo pristup primijenili u produkcijskoj aplikaciji velikog opsega koja svakodnevno obrađuje 40.000 poruka, a taj broj i dalje raste.

Uvod

Tijekom protekle godine surađivali smo s vodećim razvojnim studijem za videoigre na uvođenju GenAI chatbota koji obrađuje otprilike 40.000 poruka dnevno, a među njegovim su korisnicima i djeca. Ključno je uskladiti brzinu, točnost, sigurnost i zabavu:

Kada izrađujete chatbot koji predstavlja vašu robnu marku, nije dovoljno da bude samo siguran – mora i zvučati autentično, baš poput vas.

Za tvrtku koja se bavi videoigrama to znači spojiti sigurnost sa zabavom i uzbuđenjem korisnika, osobito mlađe publike.

LLM-ovi na kojima se temelje moderne GenAI aplikacije vrlo su fleksibilni, zbog čega se tako dobro mogu primijeniti na brojne probleme, ali istodobno nemaju dovoljno ograničenja. Zbog toga često mogu skrenuti s predviđenog puta i vratiti vrlo raznolike tekstove, od kojih neki mogu biti neprikladni.

Ako se LLM izravno izloži javnosti, sigurno će doći do neočekivanog ponašanja, a bez odgovarajućih zaštitnih mjera postoji rizik od:

Kratak pregled stvarnih rizika…

Novinski naslovi o neželjenim načinima upotrebe LLM-ova:

Ti incidenti pokazuju zašto izgradnja i održavanje sigurnosti GenAI sustava nisu neobavezni. To je osobito važno kada su uključena mala djeca: nije dovoljno osloniti se na izjave o odricanju od odgovornosti – robusne zaštitne ograde ključne su za primjerenost sadržaja.

Naš pristup: višeslojna klasifikacija i predmemoriranje upita

Slično sustavima RAG (generiranje prošireno dohvaćanjem) koje smo izradili za klijente, koristimo više komponenti umjetne inteligencije kako bismo smanjili rizik od jailbreakova i zadržali visoke performanse.

Dijagram koji prikazuje naš pristup: višeslojnu klasifikaciju i predmemoriranje upita.

Pojednostavnjeni dijagram arhitekture našeg sustava

Kako bismo osigurali sigurnost sustava, koristimo LLM klasifikatore i za ulazne i za izlazne podatke:

  1. Klasifikacija ulaznih podataka (izvodi se istodobno)

  • Koristili smo Pydantic sheme i strukturirane izlaze LLM-ova kako bismo označili korisničke upite (npr. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT itd.). To je uključivalo i oznake za prepoznavanje jailbreakova ili nedopuštenog ponašanja.

  • Više klasifikatora za pojedinačne teme dalo je znatno bolje rezultate od jednog golemog klasifikatora koji pokušava obuhvatiti sve.

  • Opsežni primjeri za učenje s malim brojem primjera bili su ključni kako bi klasifikatori razlikovali „I keep being killed by this character” (odnosi se na igru) od „I am being hurt by my parent” (upućuje na ugroženost djeteta).

  • Bliska suradnja s klijentom i njegovim stručnim timovima za povjerenje i sigurnost osigurala je da naši klasifikatori odražavaju način na koji bi oni u stvarnim situacijama procjenjivali visokorizične poruke.

Dijagram koji prikazuje naš pristup: višeslojnu klasifikaciju i predmemoriranje upita.

  1. Generiranje odgovora

  • Glavni LLM generira odgovor ako se ulazni sadržaj procijeni sigurnim.

  • U suprotnom se poruka može zanemariti (u slučaju jailbreaka) ili proslijediti osobi (ako upit upozorava na sigurnosni problem).

  1. Klasifikacija izlaznih podataka

  • Prije nego što odgovor napusti našu aplikaciju i bude isporučen, klasificiramo odgovor modela.

  • Budući da neki odgovori mogu primjenjivati RAG tehnike na podatke prikupljene s interneta, taj nas korak štiti od trovanja podataka.

  • Ako odgovor sadržava nedopušten sadržaj, sustav intervenira i zamjenjuje ga općenitom porukom. U praksi smo to rijetko doživjeli, no riječ je o dodatnom opreznom zaštitnom sloju koji osigurava da ponašanje agenta ostane primjereno.

Kako bismo održali brzinu i pristupačnu cijenu:

  • Pohranjujemo često korištene upite i dijelove dijaloga, zajedno s pažljivo odabranim skupom primjera za učenje s malim brojem primjera.

  • To nam predmemoriranje omogućuje brzu i povoljnu primjenu LLM klasifikatora, bez potrebe za ponovnom izgradnjom konteksta pri svakoj upotrebi.

Dijagram koji prikazuje naš pristup: višeslojnu klasifikaciju i predmemoriranje upita.

Pogled u budućnost: ustavni klasifikatori

Nedavna studija tvrtke Anthropic opisala je ustavne klasifikatore – sustav koji se oslanja na dodatne klasifikatore obučene prema „ustavnim” pravilima radi otkrivanja zlonamjernih ili nesigurnih zahtjeva. Izvijestili su o sljedećem:

  • Visoka otpornost tijekom tisuća sati ljudskog red-team testiranja.

  • Minimalna stopa prekomjernog odbijanja i umjereno dodatno računalno opterećenje.

Predviđamo budućnost u kojoj ti ustavni pristupi mogu nadopuniti ili čak zamijeniti tradicionalne klasifikacijske slojeve, pružajući sveobuhvatniju zaštitu od novih taktika jailbreaka.

Sažetak: što smo naučili

  1. Paralelni i lagani filtri

Klasifikacijski slojevi sprječavaju da zlonamjerni upiti uopće dosegnu generativnu jezgru i osiguravaju da se loši izlazi nikada ne isporuče.

  1. Korisničko iskustvo je važno

Kada su upozorenja zabavna i usklađena sa svijetom igre, a odbijanja razigrana, korisnici su skloniji prihvatiti ograničenja sustava.

  1. Ne štedite na testiranju i nadzoru

Redovito red-team testiranje i često praćenje ponašanja igrača pomažu otkriti ranjivosti prije nego što za njih sazna šira zajednica igrača. Te se ranjivosti zatim mogu uvrstiti u upite klasifikatora za učenje s malim brojem primjera kako bi se ubuduće spriječila njihova zloupotreba (to je trenutačno ručni postupak, ali mogao bi se automatizirati).

Izgradnja sigurnih i privlačnih GenAI sustava budućnosti

Bilo da ste tvrtka za videoigre, banka ili čak državno tijelo, ako planirate uvesti chatbot za korisničku podršku velikog opsega, morate težiti I dobrom korisničkom dizajnu I pouzdanosti.

Izrađujemo korisnička rješenja za organizacije i robne marke kojima je važno sljedeće:

  1. Sigurnost je najvažnija – chatbotovi korisnicima pružaju vrijednost, ali ih istodobno strogo štite od štetnog sadržaja

  2. Ugled je zaštićen – osmišljavamo više slojeva zaštite koji čuvaju ugled robne marke čak i kada korisnici pokušaju gurnuti sustav izvan njegovih granica

  3. Propisi ograničavaju vaše mogućnosti – pratimo najnovije smjernice za usklađenost kako biste mogli proširivati rješenja bez bojazni da će vaša aplikacija biti probijena jailbreakom

Autor

Andrew Liubinas