Julkiset suuriin kielimalleihin (LLM) perustuvat sovellukset voivat altistaa brändit maine- ja talousriskeille.
Vähennämme LLM:ien rajoitusten kiertämisestä (jailbreak) ja muusta tahattomasta toiminnasta aiheutuvia haittoja monitasoisilla luokittelusuodattimilla.
Olemme soveltaneet tätä suuren volyymin tuotantosovelluksessa, joka käsittelee päivittäin 40 000 viestiä – ja määrä kasvaa.
Olemme viime vuoden ajan kehittäneet johtavan pelinkehittäjän kanssa generatiiviseen tekoälyyn perustuvaa chatbotia, joka käsittelee noin 40 000 viestiä päivässä pelaajakunnalta, johon kuuluu myös lapsia. Nopeuden, tarkkuuden, turvallisuuden ja hauskuuden tasapainottaminen on olennaista:
Brändiäsi edustavan chatbotin ei pidä olla vain turvallinen – sen on myös kuulostettava aidosti teiltä.
Peliyhtiölle tämä tarkoittaa turvallisuuden yhdistämistä hauskuuteen ja käyttäjien innostamiseen – etenkin nuorempien yleisöjen kohdalla.
Nykyaikaisten generatiivisen tekoälyn sovellusten perustana olevat LLM:t ovat erittäin joustavia, minkä ansiosta ne soveltuvat monenlaisiin ongelmiin, mutta niiden toimintaa ei myöskään ole rajattu tarkasti. Siksi ne voivat usein poiketa tarkoitetulta polulta ja tuottaa hyvin monenlaista tekstiä, josta osa voi olla sopimatonta.
LLM:n tarjoaminen suoraan yleisön käyttöön johtaa väistämättä odottamattomaan toimintaan. Ilman asianmukaisia suojatoimia vaarana ovat:
Rajoitusten kiertäminen (jailbreak), jossa käyttäjät manipuloivat chatbotia tarkoituksellisesti tuottamaan haitallista tai kiellettyä sisältöä (hauska vinkki: tällä sivustolla kuka tahansa voi tutustua LLM:n rajoitusten kiertämiseen pelin avulla…); tai
Mauttoman, loukkaavan tai vaarallisen sisällön tahaton tarjoaminen. Monissa tapauksissa tämä voi vaarantaa käyttäjän hyvinvoinnin tai aiheuttaa sovelluksen tarjoajalle taloudellista tai mainehaittaa.
Tahattomasta LLM:n käytöstä syntyneitä uutisotsikoita:
Nämä tapaukset osoittavat, ettei turvallisuuden rakentaminen ja ylläpitäminen generatiivisen tekoälyn järjestelmissä ole valinnaista. Tämä korostuu etenkin pienten lasten kohdalla: pelkät vastuuvapauslausekkeet eivät riitä, vaan sisällön asianmukaisuus edellyttää vahvoja suojakaiteita.
Kuten asiakkaillemme rakentamissamme RAG-järjestelmissä (hakua hyödyntävä generointi), hyödynnämme useita tekoälykomponentteja vähentääksemme rajoitusten kiertämisen riskejä suorituskyvystä tinkimättä.


Järjestelmämme yksinkertaistettu arkkitehtuurikaavio
Järjestelmän turvallisuuden varmistamiseksi luokittelemme sekä syötteet että tuotokset LLM-luokittimilla:
Syötteiden luokittelu (suoritetaan rinnakkain)
Merkitsimme käyttäjien kyselyt Pydantic-skeemojen ja LLM:n strukturoitujen tuotosten avulla eri luokkiin (esim. SAFE, SUSPICIOUS, CHILD_HARM_RISK ja VIOLENT). Mukana oli myös tunnisteita rajoitusten kiertämisen ja kielletyn toiminnan havaitsemiseen.
Useat aihekohtaiset luokittimet toimivat huomattavasti paremmin kuin yksi kaiken kattava jättiluokitin.
Kattavat, muutamalla esimerkillä opettamiseen tarkoitetut esimerkit olivat ratkaisevan tärkeitä, jotta luokittimet erottivat toisistaan ilmaukset “I keep being killed by this character” (viittaus peliin) ja “I am being hurt by my parent” (merkki lapseen kohdistuvasta vahingosta).
Tiivis yhteistyö asiakkaan sekä sen luottamukseen ja turvallisuuteen erikoistuneiden tiimien kanssa varmisti, että luokittimemme arvioivat suuren riskin viestejä heidän käytännön arviointiperusteidensa mukaisesti.


Vastauksen luominen
Pääasiallinen LLM luo vastauksen, jos syöte arvioidaan turvalliseksi.
Muussa tapauksessa viesti voidaan ohittaa, jos kyse on rajoitusten kiertämisestä, tai siirtää ihmisen käsiteltäväksi, jos kysely viittaa turvallisuusongelmaan.
Tuotoksen luokittelu
Luokittelemme mallin vastauksen ennen kuin se lähtee sovelluksestamme käyttäjälle.
Koska osa vastauksista voidaan tuottaa verkosta kerättyä dataa hyödyntävillä RAG-tekniikoilla, tämä vaihe suojaa meitä datan myrkyttämiseltä.
Jos vastaus sisältää kiellettyä sisältöä, järjestelmä puuttuu tilanteeseen ja korvaa sen yleisluontoisella viestillä. Käytännössä tätä tapahtuu harvoin, mutta varovainen lisäsuojakerros auttaa varmistamaan, että agentin toiminta pysyy asianmukaisena.
Nopeuden ja kustannustehokkuuden säilyttämiseksi:
Tallennamme usein käytettyjä kehotteita ja keskustelujen osia sekä huolella valitun kokoelman muutamalla esimerkillä opettamiseen tarkoitettuja esimerkkejä.
Välimuistin ansiosta voimme käyttää LLM-luokittimia nopeasti ja edullisesti tarvitsematta rakentaa kontekstia joka kerta uudelleen.


Anthropicin tuoreessa tutkimuksessa esiteltiin Constitutional Classifiers -järjestelmä, joka havaitsee haitalliset ja vaaralliset pyynnöt ”perustuslaillisten” sääntöjen avulla koulutetuilla lisäluokittimilla. Tutkimuksessa raportoitiin seuraavista tuloksista:
Vahva kestävyys tuhansien tuntien ihmisten tekemää hyökkäävää tietoturvatestausta vastaan.
Vain vähän tarpeettomia kieltäytymisiä ja kohtuullinen laskennallinen lisäkuorma.
Uskomme, että tulevaisuudessa nämä perustuslailliset menetelmät voivat täydentää perinteisiä luokittelukerroksia tai jopa korvata ne ja tarjota kattavamman suojan kehittyviä rajoitusten kiertämisen menetelmiä vastaan.
Rinnakkaiset, kevyet suodattimet
Luokittelukerrokset estävät haitallisia kyselyitä pääsemästä generatiiviseen ytimeen asti ja varmistavat, ettei huonoja tuotoksia toimiteta käyttäjille.
Käyttäjäkokemuksella on merkitystä
Kun varoitukset ja kieltäytymiset ovat hauskoja, leikkisiä ja pelimaailman tarinaan sopivia, käyttäjät hyväksyvät järjestelmän rajoitukset helpommin.
Testauksesta ja valvonnasta ei pidä tinkiä
Säännöllinen hyökkäävä tietoturvatestaus ja pelaajien toiminnan jatkuva seuranta auttavat löytämään haavoittuvuudet ennen kuin laajempi pelaajakunta saa niistä tietää. Havainnot voidaan syöttää takaisin muutamalla esimerkillä opetettavien luokittimien kehotteisiin, jotta haavoittuvuuksia ei voi hyödyntää jatkossa. Tämä tehdään nykyisin manuaalisesti, mutta prosessi voitaisiin automatisoida.
Olipa kyseessä peliyhtiö, pankki tai valtion virasto, laajamittaisen asiakaspalveluchatbotin toteutuksessa on panostettava sekä käyttäjälähtöiseen suunnitteluun että luotettavuuteen.
Rakennamme asiakasrajapinnan ratkaisuja organisaatioille ja brändeille, joille:
Turvallisuus on ensisijaista – chatbotit tuottavat käyttäjille arvoa mutta suojaavat heitä tiukasti haitalliselta sisällöltä
Maineen suojaaminen on tärkeää – suunnittelemme useita suojakerroksia, jotka turvaavat brändin maineen, vaikka käyttäjät yrittäisivät ylittää järjestelmän rajat
Sääntely rajaa vaihtoehtoja – seuraamme uusimpia vaatimustenmukaisuusohjeita, jotta ratkaisuja voidaan skaalata ilman huolta sovelluksen rajoitusten kiertämisestä