Javno dostupne aplikacije koje se temelje na velikim jezičnim modelima (LLM-ovima) mogu izložiti robne marke reputacijskim i financijskim rizicima.
Koristimo višeslojne klasifikacijske filtre kako bismo smanjili štetu koju mogu prouzročiti jailbreakovi i druga neželjena ponašanja LLM-ova.
Taj smo pristup primijenili u produkcijskoj aplikaciji velikog opsega koja svakodnevno obrađuje 40.000 poruka, a taj broj i dalje raste.
Tijekom protekle godine surađivali smo s vodećim razvojnim studijem za videoigre na uvođenju GenAI chatbota koji obrađuje otprilike 40.000 poruka dnevno, a među njegovim su korisnicima i djeca. Ključno je uskladiti brzinu, točnost, sigurnost i zabavu:
Kada izrađujete chatbot koji predstavlja vašu robnu marku, nije dovoljno da bude samo siguran – mora i zvučati autentično, baš poput vas.
Za tvrtku koja se bavi videoigrama to znači spojiti sigurnost sa zabavom i uzbuđenjem korisnika, osobito mlađe publike.
LLM-ovi na kojima se temelje moderne GenAI aplikacije vrlo su fleksibilni, zbog čega se tako dobro mogu primijeniti na brojne probleme, ali istodobno nemaju dovoljno ograničenja. Zbog toga često mogu skrenuti s predviđenog puta i vratiti vrlo raznolike tekstove, od kojih neki mogu biti neprikladni.
Ako se LLM izravno izloži javnosti, sigurno će doći do neočekivanog ponašanja, a bez odgovarajućih zaštitnih mjera postoji rizik od:
„Jailbreakova”, pri kojima korisnici namjerno navode chatbot na stvaranje štetnog ili nedopuštenog sadržaja (zanimljivost: na ovom web-mjestu svatko može kroz zabavnu igru istražiti jailbreakove LLM-ova…); ili
Nenamjernog pružanja neukusnog, uvredljivog ili opasnog sadržaja. U mnogim slučajevima to može ugroziti dobrobit korisnika ili prouzročiti financijsku i reputacijsku štetu pružatelju aplikacije.
Novinski naslovi o neželjenim načinima upotrebe LLM-ova:
Ti incidenti pokazuju zašto izgradnja i održavanje sigurnosti GenAI sustava nisu neobavezni. To je osobito važno kada su uključena mala djeca: nije dovoljno osloniti se na izjave o odricanju od odgovornosti – robusne zaštitne ograde ključne su za primjerenost sadržaja.
Slično sustavima RAG (generiranje prošireno dohvaćanjem) koje smo izradili za klijente, koristimo više komponenti umjetne inteligencije kako bismo smanjili rizik od jailbreakova i zadržali visoke performanse.


Pojednostavnjeni dijagram arhitekture našeg sustava
Kako bismo osigurali sigurnost sustava, koristimo LLM klasifikatore i za ulazne i za izlazne podatke:
Klasifikacija ulaznih podataka (izvodi se istodobno)
Koristili smo Pydantic sheme i strukturirane izlaze LLM-ova kako bismo označili korisničke upite (npr. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT itd.). To je uključivalo i oznake za prepoznavanje jailbreakova ili nedopuštenog ponašanja.
Više klasifikatora za pojedinačne teme dalo je znatno bolje rezultate od jednog golemog klasifikatora koji pokušava obuhvatiti sve.
Opsežni primjeri za učenje s malim brojem primjera bili su ključni kako bi klasifikatori razlikovali „I keep being killed by this character” (odnosi se na igru) od „I am being hurt by my parent” (upućuje na ugroženost djeteta).
Bliska suradnja s klijentom i njegovim stručnim timovima za povjerenje i sigurnost osigurala je da naši klasifikatori odražavaju način na koji bi oni u stvarnim situacijama procjenjivali visokorizične poruke.


Generiranje odgovora
Glavni LLM generira odgovor ako se ulazni sadržaj procijeni sigurnim.
U suprotnom se poruka može zanemariti (u slučaju jailbreaka) ili proslijediti osobi (ako upit upozorava na sigurnosni problem).
Klasifikacija izlaznih podataka
Prije nego što odgovor napusti našu aplikaciju i bude isporučen, klasificiramo odgovor modela.
Budući da neki odgovori mogu primjenjivati RAG tehnike na podatke prikupljene s interneta, taj nas korak štiti od trovanja podataka.
Ako odgovor sadržava nedopušten sadržaj, sustav intervenira i zamjenjuje ga općenitom porukom. U praksi smo to rijetko doživjeli, no riječ je o dodatnom opreznom zaštitnom sloju koji osigurava da ponašanje agenta ostane primjereno.
Kako bismo održali brzinu i pristupačnu cijenu:
Pohranjujemo često korištene upite i dijelove dijaloga, zajedno s pažljivo odabranim skupom primjera za učenje s malim brojem primjera.
To nam predmemoriranje omogućuje brzu i povoljnu primjenu LLM klasifikatora, bez potrebe za ponovnom izgradnjom konteksta pri svakoj upotrebi.


Nedavna studija tvrtke Anthropic opisala je ustavne klasifikatore – sustav koji se oslanja na dodatne klasifikatore obučene prema „ustavnim” pravilima radi otkrivanja zlonamjernih ili nesigurnih zahtjeva. Izvijestili su o sljedećem:
Visoka otpornost tijekom tisuća sati ljudskog red-team testiranja.
Minimalna stopa prekomjernog odbijanja i umjereno dodatno računalno opterećenje.
Predviđamo budućnost u kojoj ti ustavni pristupi mogu nadopuniti ili čak zamijeniti tradicionalne klasifikacijske slojeve, pružajući sveobuhvatniju zaštitu od novih taktika jailbreaka.
Paralelni i lagani filtri
Klasifikacijski slojevi sprječavaju da zlonamjerni upiti uopće dosegnu generativnu jezgru i osiguravaju da se loši izlazi nikada ne isporuče.
Korisničko iskustvo je važno
Kada su upozorenja zabavna i usklađena sa svijetom igre, a odbijanja razigrana, korisnici su skloniji prihvatiti ograničenja sustava.
Ne štedite na testiranju i nadzoru
Redovito red-team testiranje i često praćenje ponašanja igrača pomažu otkriti ranjivosti prije nego što za njih sazna šira zajednica igrača. Te se ranjivosti zatim mogu uvrstiti u upite klasifikatora za učenje s malim brojem primjera kako bi se ubuduće spriječila njihova zloupotreba (to je trenutačno ručni postupak, ali mogao bi se automatizirati).
Bilo da ste tvrtka za videoigre, banka ili čak državno tijelo, ako planirate uvesti chatbot za korisničku podršku velikog opsega, morate težiti I dobrom korisničkom dizajnu I pouzdanosti.
Izrađujemo korisnička rješenja za organizacije i robne marke kojima je važno sljedeće:
Sigurnost je najvažnija – chatbotovi korisnicima pružaju vrijednost, ali ih istodobno strogo štite od štetnog sadržaja
Ugled je zaštićen – osmišljavamo više slojeva zaštite koji čuvaju ugled robne marke čak i kada korisnici pokušaju gurnuti sustav izvan njegovih granica
Propisi ograničavaju vaše mogućnosti – pratimo najnovije smjernice za usklađenost kako biste mogli proširivati rješenja bez bojazni da će vaša aplikacija biti probijena jailbreakom