Publiski pieejamas lielo valodu modeļu (LVM) lietotnes var radīt zīmoliem reputācijas un finanšu riskus.
Mēs izmantojam vairāku līmeņu klasifikācijas filtrus, lai mazinātu kaitējumu, ko rada LVM ierobežojumu apiešana un cita neparedzēta LVM darbība.
Šo pieeju esam izmantojuši lielas noslodzes produkcijas lietotnē, kas ik dienu apstrādā 40 000 ziņojumu, un šis skaits turpina augt.
Pēdējā gada laikā sadarbībā ar vadošu spēļu izstrādātāju esam ieviesuši ģeneratīvā MI tērzēšanas robotu, kas apstrādā aptuveni 40 000 ziņojumu dienā no spēlētājiem, kuru vidū ir arī bērni. Ir būtiski līdzsvarot ātrumu, precizitāti, drošību un izklaidējošu pieredzi:
Veidojot tērzēšanas robotu, kas pārstāv jūsu zīmolu, nepietiek tikai ar drošību — tam jāskan patiesi un autentiski kā jums.
Spēļu uzņēmumam tas nozīmē apvienot drošību ar aizraujošu un jautru pieredzi, īpaši gados jaunākai auditorijai.
Mūsdienu ģeneratīvā MI lietotņu pamatā esošie LVM ir ļoti elastīgi, tāpēc tos var labi izmantot daudzu problēmu risināšanai, taču to darbība nav pietiekami ierobežota. Tas nozīmē, ka tie bieži var novirzīties no paredzētā ceļa un ģenerēt ļoti dažādu tekstu, no kura daļa var nebūt piemērota.
Ja LVM ir tieši pieejams sabiedrībai, neparedzama darbība ir neizbēgama un bez atbilstošiem aizsardzības pasākumiem pastāv šādi riski:
ierobežojumu apiešana, kad lietotāji apzināti manipulē ar tērzēšanas robotu, lai tas radītu kaitīgu vai neatļautu saturu (interesants fakts — šajā vietnē ikviens var spēles veidā izmēģināt LVM ierobežojumu apiešanu…); vai
netīša nepiedienīga, aizskaroša vai bīstama satura sniegšana. Daudzos gadījumos tas var apdraudēt lietotāju labklājību vai radīt lietotnes nodrošinātājam finansiālus zaudējumus un kaitējumu zīmolam.
Ziņu virsraksti par neparedzētu LVM izmantošanu:
Šie incidenti uzsver, ka ģeneratīvā MI sistēmu drošības izveide un uzturēšana nav izvēles jautājums. Tas ir īpaši svarīgi, ja lietotāju vidū ir mazi bērni: ar atrunām vien nepietiek — piemērotu saturu var nodrošināt tikai stingri aizsargmehānismi.
Līdzīgi klientiem izveidotajām RAG jeb izguves papildinātas ģenerēšanas sistēmām mēs izmantojam vairākus MI komponentus, lai mazinātu ierobežojumu apiešanas riskus, vienlaikus saglabājot augstu veiktspēju.


Vienkāršota mūsu sistēmas arhitektūras shēma
Lai garantētu sistēmas drošību, gan ievades, gan izvades datiem izmantojam LVM klasifikatorus:
Ievades klasifikācija (notiek vienlaikus)
Lietotāju vaicājumu marķēšanai izmantojām Pydantic shēmas kopā ar LVM strukturētajiem rezultātiem (piemēram, SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT u. c.). Tika izmantoti arī indikatori, lai konstatētu ierobežojumu apiešanu vai neatļautu rīcību.
Vairāki atsevišķām tēmām paredzēti klasifikatori darbojās ievērojami labāk nekā viens universāls klasifikators.
Plašs dažpiemēru piemēru kopums bija būtisks, lai klasifikatori spētu atšķirt “I keep being killed by this character” (runa ir par spēli) no “I am being hurt by my parent” (norāde uz kaitējumu bērnam).
Cieša sadarbība ar klientu un tā specializētajām uzticamības un drošības komandām nodrošināja, ka mūsu klasifikatori atspoguļoja to, kā šīs komandas reālajā dzīvē vērtētu augsta riska ziņojumus.


Atbildes ģenerēšana
Ja ievade tiek atzīta par drošu, galvenais LVM ģenerē atbildi.
Pretējā gadījumā ziņojumu var ignorēt, ja notiek ierobežojumu apiešana, vai nodot cilvēkam, ja vaicājums norāda uz drošības problēmu.
Izvades klasifikācija
Pirms galīgās piegādes un atbildes nosūtīšanas no lietotnes mēs klasificējam modeļa atbildi.
Tā kā dažas atbildes var tikt veidotas ar RAG metodēm, izmantojot internetā ievāktus datus, šis posms mūs pasargā no datu saindēšanas.
Ja atbildē ir neatļauts saturs, sistēma iejaucas un aizstāj to ar vispārīgu ziņojumu. Praksē tas noticis reti, tomēr šis papildu piesardzības slānis palīdz nodrošināt, ka aģenta darbība joprojām ir piemērota.
Lai saglabātu ātrumu un pieejamas izmaksas:
Mēs glabājam bieži izmantotās uzvednes un dialogu fragmentus, kā arī rūpīgi atlasītu dažpiemēru piemēru kopumu.
Šī kešatmiņa ļauj ātri un lēti izmantot LVM klasifikatorus, katru reizi no jauna neveidojot kontekstu.


Nesenā Anthropic pētījumā aprakstīti konstitucionālie klasifikatori — sistēma, kas ļaunprātīgu vai nedrošu pieprasījumu noteikšanai izmanto papildu klasifikatorus, kuri apmācīti saskaņā ar „konstitucionāliem” noteikumiem. Pētījumā tika ziņots par:
Augstu noturību pret tūkstošiem stundu ilgiem cilvēku veiktiem imitētiem uzbrukumiem.
Minimālu nepamatotu atteikumu īpatsvaru un mērenu papildu skaitļošanas slodzi.
Mēs paredzam, ka nākotnē šīs konstitucionālās pieejas varēs papildināt vai pat aizstāt tradicionālos klasifikācijas slāņus, nodrošinot visaptverošāku aizsardzību pret mainīgām ierobežojumu apiešanas metodēm.
Paralēli un resursefektīvi filtri
Klasifikācijas slāņi neļauj ļaunprātīgiem vaicājumiem sasniegt ģeneratīvo kodolu un nodrošina, ka nekvalitatīvi rezultāti netiek piegādāti.
Lietotāju pieredzei ir nozīme
Ja brīdinājumi un atteikumi ir rotaļīgi, izklaidējoši un balstīti spēles pasaules vēsturē, lietotāji labprātāk pieņem sistēmas ierobežojumus.
Netaupiet uz testēšanas un uzraudzības rēķina
Regulāri imitēti uzbrukumi un bieža spēlētāju rīcības uzraudzība palīdz atklāt ievainojamības, pirms par tām uzzina plašāka spēlētāju kopiena. Pēc tam šos atklājumus var iekļaut dažpiemēru klasifikatoru uzvednēs, lai turpmāk novērstu ievainojamību izmantošanu. Pašlaik tas tiek darīts manuāli, taču procesu varētu automatizēt.
Neatkarīgi no tā, vai pārstāvat spēļu uzņēmumu, banku vai valsts iestādi, plašā mērogā ieviešot klientu apkalpošanas tērzēšanas robotu, vienlīdz svarīga ir gan lietotāju pieredze, gan uzticamība.
Mēs veidojam klientiem paredzētus risinājumus organizācijām un zīmoliem, kuriem:
Drošība ir vissvarīgākā — tērzēšanas roboti sniedz lietotājiem vērtību, vienlaikus stingri aizsargājot viņus no kaitīga satura
Reputācija ir jāaizsargā — mēs izstrādājam vairākus aizsardzības līmeņus, kas saglabā zīmola reputāciju pat tad, ja lietotāji mēģina pārkāpt sistēmas robežas
Regulējums ierobežo izvēles iespējas — mēs sekojam jaunākajām atbilstības vadlīnijām, lai jūs varētu mērogot risinājumus, neuztraucoties par lietotnes ierobežojumu apiešanu