Viešai prieinamos LLM programos gali kelti reputacinę ir finansinę riziką prekių ženklams.
Siekdami sumažinti žalą dėl LLM apribojimų apėjimo ir kitokios nenumatytos LLM elgsenos, naudojame kelių lygių klasifikavimo filtrus.
Šį metodą pritaikėme didelės apkrovos produkcinėje programoje, kuri kasdien apdoroja 40 000 žinučių, o jų skaičius vis auga.
Pastaruosius metus bendradarbiavome su pirmaujančia žaidimų kūrėja diegdami generatyvinio DI pokalbių robotą, kuris iš žaidėjų, tarp jų ir vaikų, gauna maždaug 40 000 žinučių per dieną. Būtina suderinti spartą, tikslumą, saugumą ir smagumą:
Kuriant jūsų prekių ženklui atstovaujantį pokalbių robotą nepakanka vien saugumo – jis turi autentiškai perteikti jūsų balsą.
Žaidimų bendrovei tai reiškia derinti saugumą su smagumu ir žaidėjų įsitraukimu, ypač kai auditorija jaunesnė.
Šiuolaikinių generatyvinio DI programų pagrindą sudarantys LLM yra labai lankstūs (todėl puikiai pritaikomi įvairioms problemoms), tačiau jų veikimas nepakankamai apribotas. Todėl jie neretai gali nukrypti nuo numatyto kelio ir pateikti labai įvairų tekstą, kurio dalis gali būti netinkama.
Suteikus visuomenei tiesioginę prieigą prie LLM, neišvengiamai pasitaikys netikėtos elgsenos, o be tinkamų apsaugos priemonių kyla rizika, kad:
naudotojai sąmoningai apeis apribojimus ir manipuliuos pokalbių robotu, kad šis sukurtų žalingą ar neleistiną turinį (beje, šioje svetainėje kiekvienas gali smagiai, žaisdamas išbandyti LLM apribojimų apėjimą…); arba
netyčia bus pateiktas atstumiantis, įžeidžiamas ar pavojingas turinys. Daugeliu atvejų tai gali kelti grėsmę naudotojo gerovei arba padaryti finansinės žalos ar pakenkti programos teikėjo prekių ženklui.
Naujienų antraštės apie nenumatytą LLM naudojimą:
Šie incidentai rodo, kodėl generatyvinio DI sistemose užtikrinti ir nuolat palaikyti saugumą yra būtina. Tai ypač svarbu, kai sistemomis naudojasi maži vaikai: vien įspėjimų nepakanka – tinkamam turiniui užtikrinti būtinos patikimos apsaugos priemonės.
Kaip ir klientams sukurtose RAG (paieška papildytos generacijos) sistemose, pasitelkiame kelis DI komponentus, kad sumažintume apribojimų apėjimo riziką ir kartu išlaikytume didelę spartą.


Supaprastinta mūsų sistemos architektūros schema
Sistemos saugumui užtikrinti tiek įvestims, tiek išvestims naudojame LLM klasifikatorius:
Įvesties klasifikavimas (vykdomas lygiagrečiai)
Naudotojų užklausoms žymėti pasitelkėme „Pydantic“ schemas ir LLM susistemintas išvestis (pvz., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT ir kt.). Taip pat naudojome žymas, padedančias atpažinti bandymus apeiti apribojimus ar kitą neleistiną elgseną.
Keli atskiroms temoms skirti klasifikatoriai veikė gerokai geriau nei vienas didžiulis universalus klasifikatorius.
Kad klasifikatoriai atskirtų „I keep being killed by this character“ (kalbama apie žaidimą) nuo „I am being hurt by my parent“ (galimos žalos vaikui požymis), buvo itin svarbu pateikti daug pavyzdžių.
Glaudžiai bendradarbiaudami su klientu ir jo pasitikėjimo bei saugos specialistų komandomis užtikrinome, kad mūsų klasifikatoriai didelės rizikos žinutes vertintų taip pat, kaip šie specialistai jas vertintų tikrovėje.


Atsakymo generavimas
Jei įvestis pripažįstama saugia, pagrindinis LLM sugeneruoja atsakymą.
Priešingu atveju žinutę galima ignoruoti, jei bandoma apeiti apribojimus, arba perduoti žmogui, jei užklausa nurodo saugos problemą.
Išvesties klasifikavimas
Prieš pateikdami modelio atsakymą naudotojui, jį suklasifikuojame savo programoje.
Kadangi kai kurie atsakymai gali būti generuojami RAG metodais iš internete surinktų duomenų, šis etapas apsaugo mus nuo duomenų užteršimo.
Jei atsakyme aptinkama neleistino turinio, sistema įsikiša ir pakeičia jį bendro pobūdžio žinute. Praktiškai su tuo susiduriame retai, tačiau tai papildomas atsargumo lygmuo, užtikrinantis, kad agento elgsena išliktų tinkama.
Kad sistema veiktų greitai ir nebrangiai:
Saugome dažnai naudojamas užklausas, dialogų fragmentus ir atrinktą pavyzdžių rinkinį.
Šis podėliavimas leidžia greitai ir nebrangiai taikyti LLM klasifikatorius, kaskart iš naujo nekuriant konteksto.


Neseniai paskelbtame „Anthropic“ tyrime aprašyti konstituciniai klasifikatoriai – sistema, kuri kenkėjiškoms ar nesaugioms užklausoms aptikti naudoja papildomus pagal „konstitucines“ taisykles išmokytus klasifikatorius. Tyrėjai nurodė šiuos rezultatus:
Didelis atsparumas tūkstančius valandų trukusiam žmonių atliekamam testavimui spragoms nustatyti.
Itin mažai nepagrįstų atsisakymų ir nedidelės papildomos skaičiavimo sąnaudos.
Ateityje šie konstituciniai metodai gali papildyti ar net pakeisti tradicinius klasifikavimo lygmenis ir visapusiškiau apsaugoti nuo nuolat kintančių apribojimų apėjimo būdų.
Lygiagretūs ir lengvi filtrai
Klasifikavimo lygmenys neleidžia kenkėjiškoms užklausoms pasiekti generavimo branduolio ir užtikrina, kad prasti atsakymai nebūtų pateikti naudotojams.
Naudotojo patirtis yra svarbi
Kai įspėjimai ir atsisakymai yra žaismingi, smagūs ir paremti žaidimo pasaulio istorija, naudotojai yra labiau linkę priimti sistemos apribojimus.
Netaupykite testavimo ir stebėsenos sąskaita
Reguliarus testavimas spragoms nustatyti ir dažna žaidėjų elgsenos stebėsena padeda aptikti pažeidžiamumus anksčiau, nei apie juos sužino platesnė žaidėjų bendruomenė. Šiuos atvejus galima įtraukti į klasifikatorių užklausas kaip papildomus pavyzdžius, kad ateityje pažeidžiamumais nebūtų pasinaudota. Šiuo metu tai daroma rankiniu būdu, tačiau procesą būtų galima automatizuoti.
Nesvarbu, ar esate žaidimų bendrovė, bankas ar net valdžios institucija: jei ketinate plačiai diegti klientų aptarnavimo pokalbių robotą, turite vienodai siekti geros naudotojo patirties ir patikimumo.
Organizacijoms ir prekių ženklams kuriame į klientus orientuotus sprendimus, kuriuose:
Saugumas yra svarbiausias – pokalbių robotai suteikia naudotojams vertę ir kartu patikimai apsaugo juos nuo žalingo turinio
Reputacija yra apsaugota – projektuojame kelis apsaugos lygmenis, kurie padeda išsaugoti prekių ženklo reputaciją, net jei naudotojai mėgina peržengti sistemos ribas
Reglamentavimas riboja jūsų pasirinkimą – nuolat sekame naujausias atitikties gaires, kad galėtumėte plėsti sprendimus nesibaimindami, jog bus apeiti jūsų programos apribojimai