Javno dostopne aplikacije velikih jezikovnih modelov (LLM) lahko blagovne znamke izpostavijo tveganjem za ugled in finančnim tveganjem.
Z večplastnimi klasifikacijskimi filtri zmanjšujemo škodo zaradi prebijanja varnostnih mehanizmov in drugega neželenega vedenja velikih jezikovnih modelov.
Ta pristop smo uporabili v zelo obremenjeni produkcijski aplikaciji, ki dnevno obdela 40.000 sporočil, njihovo število pa še narašča.
V zadnjem letu smo v sodelovanju z vodilnim razvijalcem iger uvedli klepetalnega robota z generativno umetno inteligenco, ki obravnava približno 40.000 sporočil na dan, pri čemer so med igralci tudi otroci. Ključno je ravnovesje med hitrostjo, natančnostjo, varnostjo in zabavo:
Ko ustvarjate klepetalnega robota, ki predstavlja vašo blagovno znamko, ni dovolj, da je varen – zveneti mora pristno in v skladu z vašo identiteto.
Pri igralnem podjetju to pomeni združevanje varnosti z zabavo in navdušenjem uporabnikov, zlasti pri mlajšem občinstvu.
Veliki jezikovni modeli, na katerih temeljijo sodobne aplikacije generativne umetne inteligence, so zelo prilagodljivi, zato jih je mogoče posplošiti na številne probleme, vendar so tudi premalo omejeni. Zato lahko pogosto zaidejo s predvidene poti in vrnejo zelo raznolika besedila, med katerimi so lahko tudi neprimerna.
Neposredna javna uporaba velikega jezikovnega modela bo zagotovo povzročila nepričakovano vedenje in lahko brez ustreznih zaščitnih ukrepov privede do:
»Prebijanja varnostnih mehanizmov«, pri katerem uporabniki klepetalnega robota namenoma pripravijo do ustvarjanja škodljive ali nedovoljene vsebine (zanimivost: na tem spletnem mestu lahko vsakdo skozi zabavno igro razišče prebijanje varnostnih mehanizmov velikih jezikovnih modelov …); ali
nenamernega podajanja neokusne, žaljive ali nevarne vsebine. To lahko pogosto ogrozi dobrobit uporabnikov ali ponudniku aplikacije povzroči finančno škodo oziroma škodo za ugled blagovne znamke.
Novinarski naslovi o neželeni uporabi velikih jezikovnih modelov:
Ti dogodki kažejo, zakaj sta vzpostavitev in ohranjanje varnosti v sistemih generativne umetne inteligence nujna. To še posebej velja, kadar so vključeni majhni otroci: zgolj izjave o omejitvi odgovornosti niso dovolj – za ohranjanje primerne vsebine so nujne zanesljive varovalke.
Podobno kot pri sistemih RAG (generiranje z razširjenim pridobivanjem podatkov), ki smo jih razvili za naročnike, uporabljamo več komponent umetne inteligence, da zmanjšamo tveganja prebijanja varnostnih mehanizmov in hkrati ohranimo visoko zmogljivost.


Poenostavljen diagram arhitekture našega sistema
Za zagotavljanje varnosti sistema uporabljamo klasifikatorje velikih jezikovnih modelov tako pri vhodnih kot izhodnih podatkih:
Klasifikacija vhodnih podatkov (izvaja se sočasno)
Za označevanje uporabniških poizvedb smo uporabili sheme Pydantic in strukturirane izhode velikih jezikovnih modelov (npr. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT itd.). Vključili smo tudi oznake za prepoznavanje prebijanja varnostnih mehanizmov ali nedovoljenega vedenja.
Več klasifikatorjev za posamezne teme je bilo bistveno učinkovitejših od enega samega velikega »vseobsegajočega« klasifikatorja.
Številni primeri za učenje iz malo primerov so bili ključni, da so klasifikatorji razlikovali med »I keep being killed by this character« (kar se nanaša na igro) in »I am being hurt by my parent« (kar nakazuje ogroženost otroka).
Tesno sodelovanje z naročnikom ter njegovimi strokovnimi ekipami za zaupanje in varnost je zagotovilo, da so naši klasifikatorji odražali njihovo presojo visoko tveganih sporočil v resničnem svetu.


Ustvarjanje odgovora
Glavni veliki jezikovni model ustvari odgovor, če je vhodna vsebina ocenjena kot varna.
Sicer je mogoče sporočilo prezreti (pri prebijanju varnostnih mehanizmov) ali ga predati človeku (če poizvedba sproži opozorilo glede varnosti).
Klasifikacija izhodnih podatkov
Preden odgovor zapusti našo aplikacijo in je dokončno dostavljen, ga klasificiramo.
Ker lahko nekateri odgovori uporabljajo tehnike RAG s podatki, pridobljenimi s spletnih strani, nas ta korak ščiti pred zastrupljanjem podatkov.
Če odgovor vsebuje nedovoljeno vsebino, sistem posreduje in ga nadomesti s splošnim sporočilom. V praksi se to zgodi redko, vendar gre za dodaten previdnostni ukrep, ki zagotavlja, da vedenje agenta ostane primerno.
Za ohranjanje hitrosti in cenovne dostopnosti:
Shranjujemo pogosto uporabljene pozive in dele dialogov ter skrbno izbran nabor primerov za učenje iz malo primerov.
To predpomnjenje nam omogoča hitro in stroškovno učinkovito uporabo klasifikatorjev velikih jezikovnih modelov, ne da bi morali vsakič znova ustvariti kontekst.


Nedavna raziskava podjetja Anthropic je predstavila ustavne klasifikatorje – sistem, ki se pri odkrivanju zlonamernih ali nevarnih zahtev opira na dodatne klasifikatorje, naučene z »ustavnimi« pravili. Poročali so o:
Visoki odpornosti na več tisoč ur simuliranega iskanja šibkih točk v nadzorovanem okolju, ki so ga izvajali ljudje.
Minimalnem deležu neupravičenih zavrnitev in zmerni dodatni računski obremenitvi.
Menimo, da bodo lahko ti ustavni pristopi v prihodnosti dopolnili ali celo nadomestili tradicionalne klasifikacijske plasti ter ponudili celovitejšo zaščito pred razvijajočimi se načini prebijanja varnostnih mehanizmov.
Vzporedni, lahki filtri
Klasifikacijske plasti preprečijo, da bi zlonamerne poizvedbe sploh dosegle generativno jedro, in zagotovijo, da neustrezni rezultati niso nikoli dostavljeni.
Uporabniška izkušnja je pomembna
Če uporabljamo zabavna opozorila, povezana z zgodbo sveta igre, in igrive zavrnitve, uporabniki lažje sprejmejo omejitve sistema.
Pri preizkušanju in spremljanju ne ubirajte bližnjic
Redno simulirano iskanje šibkih točk v nadzorovanem okolju in pogosto spremljanje vedenja igralcev pomagata odkriti ranljivosti, še preden zanje izve širša skupnost igralcev. Te ugotovitve lahko nato vključimo v pozive klasifikatorjev za učenje iz malo primerov in tako preprečimo prihodnje izkoriščanje ranljivosti (trenutno je postopek ročen, vendar bi ga bilo mogoče avtomatizirati).
Ne glede na to, ali ste igralno podjetje, banka ali celo državni organ, morate pri obsežni uvedbi klepetalnega robota za podporo strankam poskrbeti TAKO za dobro uporabniško zasnovo KOT za zanesljivost.
Za organizacije in blagovne znamke razvijamo rešitve, namenjene strankam, pri katerih:
Je varnost najpomembnejša – klepetalni roboti uporabnikom zagotavljajo vrednost, hkrati pa jih dosledno varujejo pred škodljivo vsebino.
Je ugled zaščiten – oblikujemo več plasti zaščite, ki ohranjajo ugled blagovne znamke, tudi če uporabniki poskušajo sistem potisniti prek njegovih meja.
Predpisi omejujejo vaše možnosti – spremljamo najnovejše smernice za skladnost, da lahko rešitve razširjate brez skrbi, da bi kdo prebil varnostne mehanizme vaše aplikacije.