Galvenā navigācija

Droši tērzēšanas aģenti augsta riska uzņēmumiem

Veidojot tērzēšanas robotu, kas pārstāv jūsu zīmolu, nepietiek tikai ar drošību — tam jāskan patiesi un autentiski kā jums.

Kopsavilkums

  • Publiski pieejamas lielo valodu modeļu (LVM) lietotnes var radīt zīmoliem reputācijas un finanšu riskus.

  • Mēs izmantojam vairāku līmeņu klasifikācijas filtrus, lai mazinātu kaitējumu, ko rada LVM ierobežojumu apiešana un cita neparedzēta LVM darbība.

  • Šo pieeju esam izmantojuši lielas noslodzes produkcijas lietotnē, kas ik dienu apstrādā 40 000 ziņojumu, un šis skaits turpina augt.

Ievads

Pēdējā gada laikā sadarbībā ar vadošu spēļu izstrādātāju esam ieviesuši ģeneratīvā MI tērzēšanas robotu, kas apstrādā aptuveni 40 000 ziņojumu dienā no spēlētājiem, kuru vidū ir arī bērni. Ir būtiski līdzsvarot ātrumu, precizitāti, drošību un izklaidējošu pieredzi:

Veidojot tērzēšanas robotu, kas pārstāv jūsu zīmolu, nepietiek tikai ar drošību — tam jāskan patiesi un autentiski kā jums.

Spēļu uzņēmumam tas nozīmē apvienot drošību ar aizraujošu un jautru pieredzi, īpaši gados jaunākai auditorijai.

Mūsdienu ģeneratīvā MI lietotņu pamatā esošie LVM ir ļoti elastīgi, tāpēc tos var labi izmantot daudzu problēmu risināšanai, taču to darbība nav pietiekami ierobežota. Tas nozīmē, ka tie bieži var novirzīties no paredzētā ceļa un ģenerēt ļoti dažādu tekstu, no kura daļa var nebūt piemērota.

Ja LVM ir tieši pieejams sabiedrībai, neparedzama darbība ir neizbēgama un bez atbilstošiem aizsardzības pasākumiem pastāv šādi riski:

Ieskats reālajos riskos…

Ziņu virsraksti par neparedzētu LVM izmantošanu:

Šie incidenti uzsver, ka ģeneratīvā MI sistēmu drošības izveide un uzturēšana nav izvēles jautājums. Tas ir īpaši svarīgi, ja lietotāju vidū ir mazi bērni: ar atrunām vien nepietiek — piemērotu saturu var nodrošināt tikai stingri aizsargmehānismi.

Mūsu pieeja: vairāku līmeņu klasifikācija un uzvedņu kešatmiņa

Līdzīgi klientiem izveidotajām RAG jeb izguves papildinātas ģenerēšanas sistēmām mēs izmantojam vairākus MI komponentus, lai mazinātu ierobežojumu apiešanas riskus, vienlaikus saglabājot augstu veiktspēju.

Shēma, kas ilustrē mūsu pieeju: vairāku līmeņu klasifikāciju un uzvedņu kešatmiņu.

Vienkāršota mūsu sistēmas arhitektūras shēma

Lai garantētu sistēmas drošību, gan ievades, gan izvades datiem izmantojam LVM klasifikatorus:

  1. Ievades klasifikācija (notiek vienlaikus)

  • Lietotāju vaicājumu marķēšanai izmantojām Pydantic shēmas kopā ar LVM strukturētajiem rezultātiem (piemēram, SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT u. c.). Tika izmantoti arī indikatori, lai konstatētu ierobežojumu apiešanu vai neatļautu rīcību.

  • Vairāki atsevišķām tēmām paredzēti klasifikatori darbojās ievērojami labāk nekā viens universāls klasifikators.

  • Plašs dažpiemēru piemēru kopums bija būtisks, lai klasifikatori spētu atšķirt “I keep being killed by this character” (runa ir par spēli) no “I am being hurt by my parent” (norāde uz kaitējumu bērnam).

  • Cieša sadarbība ar klientu un tā specializētajām uzticamības un drošības komandām nodrošināja, ka mūsu klasifikatori atspoguļoja to, kā šīs komandas reālajā dzīvē vērtētu augsta riska ziņojumus.

Shēma, kas ilustrē mūsu pieeju: vairāku līmeņu klasifikāciju un uzvedņu kešatmiņu.

  1. Atbildes ģenerēšana

  • Ja ievade tiek atzīta par drošu, galvenais LVM ģenerē atbildi.

  • Pretējā gadījumā ziņojumu var ignorēt, ja notiek ierobežojumu apiešana, vai nodot cilvēkam, ja vaicājums norāda uz drošības problēmu.

  1. Izvades klasifikācija

  • Pirms galīgās piegādes un atbildes nosūtīšanas no lietotnes mēs klasificējam modeļa atbildi.

  • Tā kā dažas atbildes var tikt veidotas ar RAG metodēm, izmantojot internetā ievāktus datus, šis posms mūs pasargā no datu saindēšanas.

  • Ja atbildē ir neatļauts saturs, sistēma iejaucas un aizstāj to ar vispārīgu ziņojumu. Praksē tas noticis reti, tomēr šis papildu piesardzības slānis palīdz nodrošināt, ka aģenta darbība joprojām ir piemērota.

Lai saglabātu ātrumu un pieejamas izmaksas:

  • Mēs glabājam bieži izmantotās uzvednes un dialogu fragmentus, kā arī rūpīgi atlasītu dažpiemēru piemēru kopumu.

  • Šī kešatmiņa ļauj ātri un lēti izmantot LVM klasifikatorus, katru reizi no jauna neveidojot kontekstu.

Shēma, kas ilustrē mūsu pieeju: vairāku līmeņu klasifikāciju un uzvedņu kešatmiņu.

Skats nākotnē: konstitucionālie klasifikatori

Nesenā Anthropic pētījumā aprakstīti konstitucionālie klasifikatori — sistēma, kas ļaunprātīgu vai nedrošu pieprasījumu noteikšanai izmanto papildu klasifikatorus, kuri apmācīti saskaņā ar „konstitucionāliem” noteikumiem. Pētījumā tika ziņots par:

  • Augstu noturību pret tūkstošiem stundu ilgiem cilvēku veiktiem imitētiem uzbrukumiem.

  • Minimālu nepamatotu atteikumu īpatsvaru un mērenu papildu skaitļošanas slodzi.

Mēs paredzam, ka nākotnē šīs konstitucionālās pieejas varēs papildināt vai pat aizstāt tradicionālos klasifikācijas slāņus, nodrošinot visaptverošāku aizsardzību pret mainīgām ierobežojumu apiešanas metodēm.

Kopsavilkums: gūtās atziņas

  1. Paralēli un resursefektīvi filtri

Klasifikācijas slāņi neļauj ļaunprātīgiem vaicājumiem sasniegt ģeneratīvo kodolu un nodrošina, ka nekvalitatīvi rezultāti netiek piegādāti.

  1. Lietotāju pieredzei ir nozīme

Ja brīdinājumi un atteikumi ir rotaļīgi, izklaidējoši un balstīti spēles pasaules vēsturē, lietotāji labprātāk pieņem sistēmas ierobežojumus.

  1. Netaupiet uz testēšanas un uzraudzības rēķina

Regulāri imitēti uzbrukumi un bieža spēlētāju rīcības uzraudzība palīdz atklāt ievainojamības, pirms par tām uzzina plašāka spēlētāju kopiena. Pēc tam šos atklājumus var iekļaut dažpiemēru klasifikatoru uzvednēs, lai turpmāk novērstu ievainojamību izmantošanu. Pašlaik tas tiek darīts manuāli, taču procesu varētu automatizēt.

Drošu un saistošu ģeneratīvā MI sistēmu veidošana nākotnei

Neatkarīgi no tā, vai pārstāvat spēļu uzņēmumu, banku vai valsts iestādi, plašā mērogā ieviešot klientu apkalpošanas tērzēšanas robotu, vienlīdz svarīga ir gan lietotāju pieredze, gan uzticamība.

Mēs veidojam klientiem paredzētus risinājumus organizācijām un zīmoliem, kuriem:

  1. Drošība ir vissvarīgākā — tērzēšanas roboti sniedz lietotājiem vērtību, vienlaikus stingri aizsargājot viņus no kaitīga satura

  2. Reputācija ir jāaizsargā — mēs izstrādājam vairākus aizsardzības līmeņus, kas saglabā zīmola reputāciju pat tad, ja lietotāji mēģina pārkāpt sistēmas robežas

  3. Regulējums ierobežo izvēles iespējas — mēs sekojam jaunākajām atbilstības vadlīnijām, lai jūs varētu mērogot risinājumus, neuztraucoties par lietotnes ierobežojumu apiešanu

Autors

Andrew Liubinas