Ohutute vestlusagentide loomine suure riskiga ettevõtetele

Brändi esindava vestlusroboti loomisel ei piisa üksnes ohutusest – see peab ka kõlama ehedalt teie moodi.

Kokkuvõte

  • Avalikud suurtel keelemudelitel (LLM-idel) põhinevad rakendused võivad tekitada brändidele maine- ja finantsriske.

  • Kasutame mitmekihilisi klassifitseerimisfiltreid, et vähendada LLM-ide jailbreak’ide ja muu soovimatu käitumisega kaasnevat kahju.

  • Oleme seda rakendanud suure kasutusmahuga tootmisrakenduses, mis töötleb päevas 40 000 sõnumit ja mille maht aina kasvab.

Sissejuhatus

Oleme viimase aasta jooksul teinud koostööd juhtiva mänguarendajaga, et võtta kasutusele GenAI vestlusrobot, mis töötleb umbes 40 000 sõnumit päevas mängijatelt, kelle hulgas on ka lapsi. Kiiruse, täpsuse, ohutuse ja lõbususe tasakaalustamine on hädavajalik:

Brändi esindava vestlusroboti loomisel ei piisa üksnes ohutusest – see peab ka kõlama ehedalt teie moodi.

Mänguettevõtte puhul tähendab see ohutuse ühendamist lõbususe ja kasutajate elevusega, eriti noorema sihtrühma jaoks.

Tänapäevastel GenAI rakendustel põhinevad LLM-id on väga paindlikud – seepärast saab neid nii hästi kasutada paljude probleemide lahendamiseks –, kuid samas pole nende tegevus piisavalt piiratud. Seetõttu võivad need sageli ettenähtud rajalt kõrvale kalduda ja tagastada väga erinevat teksti, millest osa ei pruugi olla sobiv.

LLM-i vahetu avalikustamine toob kindlasti kaasa ootamatut käitumist ning piisavate kaitsemeetmeteta tekib oht, et:

Pilguheit tegelikele riskidele…

Uudiste pealkirjad LLM-ide soovimatu kasutuse kohta:

Need juhtumid näitavad, miks pole GenAI süsteemide ohutuse loomine ja säilitamine vabatahtlik. See on eriti oluline väikelaste puhul: üksnes vastutusest loobumise teadetele ei saa loota – sisu sobivuse tagamiseks on vaja tugevaid kaitsepiirdeid.

Meie lähenemine: kihiline klassifitseerimine ja viipade vahemällu salvestamine

Nagu klientidele loodud RAG-süsteemides (otsinguga täiendatud genereerimine), kasutame ka siin mitut tehisintellekti komponenti, et vähendada jailbreak’ide riski ja säilitada suur jõudlus.

Meie lähenemist kujutav skeem: kihiline klassifitseerimine ja viipade vahemällu salvestamine.

Meie süsteemi lihtsustatud arhitektuuriskeem

Süsteemi ohutuse tagamiseks kasutame LLM-klassifikaatoreid nii sisendite kui ka väljundite puhul:

  1. Sisendi klassifitseerimine (toimub paralleelselt)

  • Kasutasime kasutajapäringute märgendamiseks Pydanticu skeeme koos LLM-i struktureeritud väljunditega (nt SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT jne). See hõlmas ka märgiseid jailbreak’ide või keelatud käitumise tuvastamiseks.

  • Eri teemade jaoks loodud mitu klassifikaatorit toimisid märksa paremini kui üks kõikehõlmav megaklassifikaator.

  • Ulatuslikud väheste näidetega juhised olid hädavajalikud, et klassifikaatorid eristaksid lauseid „I keep being killed by this character“ (viide mängule) ja „I am being hurt by my parent“ (märk lapse kahjustamisest).

  • Tihe koostöö kliendi ning tema usalduse ja ohutuse spetsialistidega tagas, et meie klassifikaatorid hindaksid suure riskiga sõnumeid nii nagu nemad päriselus.

Meie lähenemist kujutav skeem: kihiline klassifitseerimine ja viipade vahemällu salvestamine.

  1. Vastuse genereerimine

  • Kui sisend loetakse ohutuks, loob peamine LLM vastuse.

  • Vastasel juhul võib sõnumit eirata (jailbreak’i korral) või suunata selle inimesele (kui päring viitab ohutusprobleemile).

  1. Väljundi klassifitseerimine

  • Enne lõplikku edastamist ja meie rakendusest väljumist klassifitseerime mudeli vastuse.

  • Kuna mõne vastuse loomisel võidakse kasutada internetist kogutud andmetel põhinevaid RAG-tehnikaid, kaitseb see etapp meid andmemürgituse eest.

  • Kui vastus sisaldab keelatud sisu, sekkub süsteem ja asendab selle üldise sõnumiga. Praktikas oleme seda harva kohanud, kuid see on täiendav ettevaatusabinõu, mis aitab tagada agendi sobiva käitumise.

Kiiruse ja taskukohasuse säilitamiseks:

  • Salvestame sageli kasutatavad viibad ja dialoogide osad koos hoolikalt valitud väheste näidetega.

  • Vahemällu salvestamine võimaldab meil LLM-klassifikaatoreid kiiresti ja soodsalt rakendada, ilma et peaksime iga kord konteksti uuesti looma.

Meie lähenemist kujutav skeem: kihiline klassifitseerimine ja viipade vahemällu salvestamine.

Tulevikku vaadates: konstitutsioonilised klassifikaatorid

Anthropicu hiljutises uuringus kirjeldati konstitutsioonilisi klassifikaatoreid – süsteemi, mis kasutab pahatahtlike või ohtlike päringute tuvastamiseks „konstitutsiooniliste“ reeglite järgi treenitud lisaklassifikaatoreid. Uuringus toodi esile:

  • Suur vastupidavus tuhandete tundide pikkusele inimeste tehtud lööktestimisele.

  • Väga väike põhjendamatute keeldumiste määr ja mõõdukas arvutuskoormus.

Tulevikus võivad sellised konstitutsioonilised lähenemisviisid täiendada või isegi asendada tavapäraseid klassifitseerimiskihte, pakkudes põhjalikumat kaitset arenevate jailbreak’i taktikate vastu.

Kokkuvõte: meie õppetunnid

  1. Paralleelsed kerged filtrid

Klassifitseerimiskihid takistavad pahatahtlike päringute jõudmist generatiivse tuumani ja tagavad, et kehvi väljundeid ei edastata.

  1. Kasutajakogemus on oluline

Lõbusad, mängu pärimusest lähtuvad hoiatused ja mängulised keeldumised aitavad kasutajatel süsteemi piirangutega paremini leppida.

  1. Ärge tehke testimise ja seire arvelt järeleandmisi

Korrapärane lööktestimine ja mängijate käitumise sage seire aitavad haavatavused avastada enne, kui laiem mängijaskond neist teada saab. Seejärel saab need lisada väheste näidetega klassifikaatoriviipudesse, et haavatavusi ei saaks tulevikus ära kasutada. Praegu toimub see käsitsi, kuid protsessi saaks automatiseerida.

Ohutute ja kaasahaaravate tuleviku GenAI süsteemide loomine

Olgu tegu mänguettevõtte, panga või riigiasutusega – klienditeeninduse vestlusroboti laialdasel kasutuselevõtul tuleb võrdselt tähtsustada nii kasutajakogemust kui ka usaldusväärsust.

Loome organisatsioonidele ja brändidele kliendilahendusi, milles:

  1. ohutus on esmatähtis – vestlusrobotid pakuvad kasutajatele väärtust, kaitstes neid samal ajal rangelt kahjuliku sisu eest

  2. maine on kaitstud – loome mitu kaitsekihti, mis hoiavad brändi maine puutumatuna ka siis, kui kasutajad püüavad süsteemi piire ületada

  3. õigusnormid piiravad valikuid – järgime uusimaid nõuetele vastavuse suuniseid, et saaksite lahendusi muretult laiendada, kartmata oma rakenduse jailbreak’imist

Autor

Andrew Liubinas