Päänavigointi

Turvallisten chat-agenttien rakentaminen suuren riskin toimialoille

Brändiäsi edustavan chatbotin ei pidä olla vain turvallinen – sen on myös kuulostettava aidosti teiltä.

Tiivistelmä

  • Julkiset suuriin kielimalleihin (LLM) perustuvat sovellukset voivat altistaa brändit maine- ja talousriskeille.

  • Vähennämme LLM:ien rajoitusten kiertämisestä (jailbreak) ja muusta tahattomasta toiminnasta aiheutuvia haittoja monitasoisilla luokittelusuodattimilla.

  • Olemme soveltaneet tätä suuren volyymin tuotantosovelluksessa, joka käsittelee päivittäin 40 000 viestiä – ja määrä kasvaa.

Johdanto

Olemme viime vuoden ajan kehittäneet johtavan pelinkehittäjän kanssa generatiiviseen tekoälyyn perustuvaa chatbotia, joka käsittelee noin 40 000 viestiä päivässä pelaajakunnalta, johon kuuluu myös lapsia. Nopeuden, tarkkuuden, turvallisuuden ja hauskuuden tasapainottaminen on olennaista:

Brändiäsi edustavan chatbotin ei pidä olla vain turvallinen – sen on myös kuulostettava aidosti teiltä.

Peliyhtiölle tämä tarkoittaa turvallisuuden yhdistämistä hauskuuteen ja käyttäjien innostamiseen – etenkin nuorempien yleisöjen kohdalla.

Nykyaikaisten generatiivisen tekoälyn sovellusten perustana olevat LLM:t ovat erittäin joustavia, minkä ansiosta ne soveltuvat monenlaisiin ongelmiin, mutta niiden toimintaa ei myöskään ole rajattu tarkasti. Siksi ne voivat usein poiketa tarkoitetulta polulta ja tuottaa hyvin monenlaista tekstiä, josta osa voi olla sopimatonta.

LLM:n tarjoaminen suoraan yleisön käyttöön johtaa väistämättä odottamattomaan toimintaan. Ilman asianmukaisia suojatoimia vaarana ovat:

Katsaus todellisiin riskeihin…

Tahattomasta LLM:n käytöstä syntyneitä uutisotsikoita:

Nämä tapaukset osoittavat, ettei turvallisuuden rakentaminen ja ylläpitäminen generatiivisen tekoälyn järjestelmissä ole valinnaista. Tämä korostuu etenkin pienten lasten kohdalla: pelkät vastuuvapauslausekkeet eivät riitä, vaan sisällön asianmukaisuus edellyttää vahvoja suojakaiteita.

Lähestymistapamme: monitasoinen luokittelu ja kehotteiden välimuisti

Kuten asiakkaillemme rakentamissamme RAG-järjestelmissä (hakua hyödyntävä generointi), hyödynnämme useita tekoälykomponentteja vähentääksemme rajoitusten kiertämisen riskejä suorituskyvystä tinkimättä.

Lähestymistapaamme esittelevä kaavio: monitasoinen luokittelu ja kehotteiden välimuisti.

Järjestelmämme yksinkertaistettu arkkitehtuurikaavio

Järjestelmän turvallisuuden varmistamiseksi luokittelemme sekä syötteet että tuotokset LLM-luokittimilla:

  1. Syötteiden luokittelu (suoritetaan rinnakkain)

  • Merkitsimme käyttäjien kyselyt Pydantic-skeemojen ja LLM:n strukturoitujen tuotosten avulla eri luokkiin (esim. SAFE, SUSPICIOUS, CHILD_HARM_RISK ja VIOLENT). Mukana oli myös tunnisteita rajoitusten kiertämisen ja kielletyn toiminnan havaitsemiseen.

  • Useat aihekohtaiset luokittimet toimivat huomattavasti paremmin kuin yksi kaiken kattava jättiluokitin.

  • Kattavat, muutamalla esimerkillä opettamiseen tarkoitetut esimerkit olivat ratkaisevan tärkeitä, jotta luokittimet erottivat toisistaan ilmaukset “I keep being killed by this character” (viittaus peliin) ja “I am being hurt by my parent” (merkki lapseen kohdistuvasta vahingosta).

  • Tiivis yhteistyö asiakkaan sekä sen luottamukseen ja turvallisuuteen erikoistuneiden tiimien kanssa varmisti, että luokittimemme arvioivat suuren riskin viestejä heidän käytännön arviointiperusteidensa mukaisesti.

Lähestymistapaamme esittelevä kaavio: monitasoinen luokittelu ja kehotteiden välimuisti.

  1. Vastauksen luominen

  • Pääasiallinen LLM luo vastauksen, jos syöte arvioidaan turvalliseksi.

  • Muussa tapauksessa viesti voidaan ohittaa, jos kyse on rajoitusten kiertämisestä, tai siirtää ihmisen käsiteltäväksi, jos kysely viittaa turvallisuusongelmaan.

  1. Tuotoksen luokittelu

  • Luokittelemme mallin vastauksen ennen kuin se lähtee sovelluksestamme käyttäjälle.

  • Koska osa vastauksista voidaan tuottaa verkosta kerättyä dataa hyödyntävillä RAG-tekniikoilla, tämä vaihe suojaa meitä datan myrkyttämiseltä.

  • Jos vastaus sisältää kiellettyä sisältöä, järjestelmä puuttuu tilanteeseen ja korvaa sen yleisluontoisella viestillä. Käytännössä tätä tapahtuu harvoin, mutta varovainen lisäsuojakerros auttaa varmistamaan, että agentin toiminta pysyy asianmukaisena.

Nopeuden ja kustannustehokkuuden säilyttämiseksi:

  • Tallennamme usein käytettyjä kehotteita ja keskustelujen osia sekä huolella valitun kokoelman muutamalla esimerkillä opettamiseen tarkoitettuja esimerkkejä.

  • Välimuistin ansiosta voimme käyttää LLM-luokittimia nopeasti ja edullisesti tarvitsematta rakentaa kontekstia joka kerta uudelleen.

Lähestymistapaamme esittelevä kaavio: monitasoinen luokittelu ja kehotteiden välimuisti.

Katse tulevaisuuteen: perustuslailliset luokittimet

Anthropicin tuoreessa tutkimuksessa esiteltiin Constitutional Classifiers -järjestelmä, joka havaitsee haitalliset ja vaaralliset pyynnöt ”perustuslaillisten” sääntöjen avulla koulutetuilla lisäluokittimilla. Tutkimuksessa raportoitiin seuraavista tuloksista:

  • Vahva kestävyys tuhansien tuntien ihmisten tekemää hyökkäävää tietoturvatestausta vastaan.

  • Vain vähän tarpeettomia kieltäytymisiä ja kohtuullinen laskennallinen lisäkuorma.

Uskomme, että tulevaisuudessa nämä perustuslailliset menetelmät voivat täydentää perinteisiä luokittelukerroksia tai jopa korvata ne ja tarjota kattavamman suojan kehittyviä rajoitusten kiertämisen menetelmiä vastaan.

Yhteenveto: mitä opimme

  1. Rinnakkaiset, kevyet suodattimet

Luokittelukerrokset estävät haitallisia kyselyitä pääsemästä generatiiviseen ytimeen asti ja varmistavat, ettei huonoja tuotoksia toimiteta käyttäjille.

  1. Käyttäjäkokemuksella on merkitystä

Kun varoitukset ja kieltäytymiset ovat hauskoja, leikkisiä ja pelimaailman tarinaan sopivia, käyttäjät hyväksyvät järjestelmän rajoitukset helpommin.

  1. Testauksesta ja valvonnasta ei pidä tinkiä

Säännöllinen hyökkäävä tietoturvatestaus ja pelaajien toiminnan jatkuva seuranta auttavat löytämään haavoittuvuudet ennen kuin laajempi pelaajakunta saa niistä tietää. Havainnot voidaan syöttää takaisin muutamalla esimerkillä opetettavien luokittimien kehotteisiin, jotta haavoittuvuuksia ei voi hyödyntää jatkossa. Tämä tehdään nykyisin manuaalisesti, mutta prosessi voitaisiin automatisoida.

Turvallisten ja innostavien generatiivisen tekoälyn järjestelmien rakentaminen tulevaisuutta varten

Olipa kyseessä peliyhtiö, pankki tai valtion virasto, laajamittaisen asiakaspalveluchatbotin toteutuksessa on panostettava sekä käyttäjälähtöiseen suunnitteluun että luotettavuuteen.

Rakennamme asiakasrajapinnan ratkaisuja organisaatioille ja brändeille, joille:

  1. Turvallisuus on ensisijaista – chatbotit tuottavat käyttäjille arvoa mutta suojaavat heitä tiukasti haitalliselta sisällöltä

  2. Maineen suojaaminen on tärkeää – suunnittelemme useita suojakerroksia, jotka turvaavat brändin maineen, vaikka käyttäjät yrittäisivät ylittää järjestelmän rajat

  3. Sääntely rajaa vaihtoehtoja – seuraamme uusimpia vaatimustenmukaisuusohjeita, jotta ratkaisuja voidaan skaalata ilman huolta sovelluksen rajoitusten kiertämisestä

Kirjoittaja

Andrew Liubinas