Avalikud suurtel keelemudelitel (LLM-idel) põhinevad rakendused võivad tekitada brändidele maine- ja finantsriske.
Kasutame mitmekihilisi klassifitseerimisfiltreid, et vähendada LLM-ide jailbreak’ide ja muu soovimatu käitumisega kaasnevat kahju.
Oleme seda rakendanud suure kasutusmahuga tootmisrakenduses, mis töötleb päevas 40 000 sõnumit ja mille maht aina kasvab.
Oleme viimase aasta jooksul teinud koostööd juhtiva mänguarendajaga, et võtta kasutusele GenAI vestlusrobot, mis töötleb umbes 40 000 sõnumit päevas mängijatelt, kelle hulgas on ka lapsi. Kiiruse, täpsuse, ohutuse ja lõbususe tasakaalustamine on hädavajalik:
Brändi esindava vestlusroboti loomisel ei piisa üksnes ohutusest – see peab ka kõlama ehedalt teie moodi.
Mänguettevõtte puhul tähendab see ohutuse ühendamist lõbususe ja kasutajate elevusega, eriti noorema sihtrühma jaoks.
Tänapäevastel GenAI rakendustel põhinevad LLM-id on väga paindlikud – seepärast saab neid nii hästi kasutada paljude probleemide lahendamiseks –, kuid samas pole nende tegevus piisavalt piiratud. Seetõttu võivad need sageli ettenähtud rajalt kõrvale kalduda ja tagastada väga erinevat teksti, millest osa ei pruugi olla sobiv.
LLM-i vahetu avalikustamine toob kindlasti kaasa ootamatut käitumist ning piisavate kaitsemeetmeteta tekib oht, et:
toimuvad „jailbreak’id“, mille käigus kasutajad manipuleerivad vestlusrobotit tahtlikult kahjulikku või keelatud sisu looma (lõbus fakt: sellel veebisaidil saab igaüks mängu kaudu LLM-i jailbreak’imist proovida…); või
tahtmatult esitatakse maitsetut, solvavat või ohtlikku sisu. Paljudel juhtudel võib see ohustada kasutaja heaolu või põhjustada rakenduse pakkujale rahalist või mainekahju.
Uudiste pealkirjad LLM-ide soovimatu kasutuse kohta:
Need juhtumid näitavad, miks pole GenAI süsteemide ohutuse loomine ja säilitamine vabatahtlik. See on eriti oluline väikelaste puhul: üksnes vastutusest loobumise teadetele ei saa loota – sisu sobivuse tagamiseks on vaja tugevaid kaitsepiirdeid.
Nagu klientidele loodud RAG-süsteemides (otsinguga täiendatud genereerimine), kasutame ka siin mitut tehisintellekti komponenti, et vähendada jailbreak’ide riski ja säilitada suur jõudlus.


Meie süsteemi lihtsustatud arhitektuuriskeem
Süsteemi ohutuse tagamiseks kasutame LLM-klassifikaatoreid nii sisendite kui ka väljundite puhul:
Sisendi klassifitseerimine (toimub paralleelselt)
Kasutasime kasutajapäringute märgendamiseks Pydanticu skeeme koos LLM-i struktureeritud väljunditega (nt SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT jne). See hõlmas ka märgiseid jailbreak’ide või keelatud käitumise tuvastamiseks.
Eri teemade jaoks loodud mitu klassifikaatorit toimisid märksa paremini kui üks kõikehõlmav megaklassifikaator.
Ulatuslikud väheste näidetega juhised olid hädavajalikud, et klassifikaatorid eristaksid lauseid „I keep being killed by this character“ (viide mängule) ja „I am being hurt by my parent“ (märk lapse kahjustamisest).
Tihe koostöö kliendi ning tema usalduse ja ohutuse spetsialistidega tagas, et meie klassifikaatorid hindaksid suure riskiga sõnumeid nii nagu nemad päriselus.


Vastuse genereerimine
Kui sisend loetakse ohutuks, loob peamine LLM vastuse.
Vastasel juhul võib sõnumit eirata (jailbreak’i korral) või suunata selle inimesele (kui päring viitab ohutusprobleemile).
Väljundi klassifitseerimine
Enne lõplikku edastamist ja meie rakendusest väljumist klassifitseerime mudeli vastuse.
Kuna mõne vastuse loomisel võidakse kasutada internetist kogutud andmetel põhinevaid RAG-tehnikaid, kaitseb see etapp meid andmemürgituse eest.
Kui vastus sisaldab keelatud sisu, sekkub süsteem ja asendab selle üldise sõnumiga. Praktikas oleme seda harva kohanud, kuid see on täiendav ettevaatusabinõu, mis aitab tagada agendi sobiva käitumise.
Kiiruse ja taskukohasuse säilitamiseks:
Salvestame sageli kasutatavad viibad ja dialoogide osad koos hoolikalt valitud väheste näidetega.
Vahemällu salvestamine võimaldab meil LLM-klassifikaatoreid kiiresti ja soodsalt rakendada, ilma et peaksime iga kord konteksti uuesti looma.


Anthropicu hiljutises uuringus kirjeldati konstitutsioonilisi klassifikaatoreid – süsteemi, mis kasutab pahatahtlike või ohtlike päringute tuvastamiseks „konstitutsiooniliste“ reeglite järgi treenitud lisaklassifikaatoreid. Uuringus toodi esile:
Suur vastupidavus tuhandete tundide pikkusele inimeste tehtud lööktestimisele.
Väga väike põhjendamatute keeldumiste määr ja mõõdukas arvutuskoormus.
Tulevikus võivad sellised konstitutsioonilised lähenemisviisid täiendada või isegi asendada tavapäraseid klassifitseerimiskihte, pakkudes põhjalikumat kaitset arenevate jailbreak’i taktikate vastu.
Paralleelsed kerged filtrid
Klassifitseerimiskihid takistavad pahatahtlike päringute jõudmist generatiivse tuumani ja tagavad, et kehvi väljundeid ei edastata.
Kasutajakogemus on oluline
Lõbusad, mängu pärimusest lähtuvad hoiatused ja mängulised keeldumised aitavad kasutajatel süsteemi piirangutega paremini leppida.
Ärge tehke testimise ja seire arvelt järeleandmisi
Korrapärane lööktestimine ja mängijate käitumise sage seire aitavad haavatavused avastada enne, kui laiem mängijaskond neist teada saab. Seejärel saab need lisada väheste näidetega klassifikaatoriviipudesse, et haavatavusi ei saaks tulevikus ära kasutada. Praegu toimub see käsitsi, kuid protsessi saaks automatiseerida.
Olgu tegu mänguettevõtte, panga või riigiasutusega – klienditeeninduse vestlusroboti laialdasel kasutuselevõtul tuleb võrdselt tähtsustada nii kasutajakogemust kui ka usaldusväärsust.
Loome organisatsioonidele ja brändidele kliendilahendusi, milles:
ohutus on esmatähtis – vestlusrobotid pakuvad kasutajatele väärtust, kaitstes neid samal ajal rangelt kahjuliku sisu eest
maine on kaitstud – loome mitu kaitsekihti, mis hoiavad brändi maine puutumatuna ka siis, kui kasutajad püüavad süsteemi piire ületada
õigusnormid piiravad valikuid – järgime uusimaid nõuetele vastavuse suuniseid, et saaksite lahendusi muretult laiendada, kartmata oma rakenduse jailbreak’imist