A nyilvánosan elérhető LLM-alkalmazások hírnévbeli és pénzügyi kockázatoknak tehetik ki a márkákat.
Többrétegű osztályozási szűrőkkel mérsékeljük az LLM-ek jailbreakjeiből és egyéb nem kívánt viselkedéséből eredő károkat.
Ezt egy nagy forgalmú, éles alkalmazásban vezettük be, amely naponta 40 000 – és egyre több – üzenetet kezel.
Az elmúlt évben egy vezető játékfejlesztővel együttműködve vezettünk be egy generatív MI-n alapuló chatbotot, amely a gyermekeket is magában foglaló játékosközösségtől naponta körülbelül 40 000 üzenetet kezel. Elengedhetetlen a sebesség, a pontosság, a biztonság és a szórakoztató élmény egyensúlya:
Ha a márkáját képviselő chatbotot készít, nem elég, hogy biztonságos legyen: hitelesen az Ön márkájának hangján kell megszólalnia.
Egy játékfejlesztő esetében ez azt jelenti, hogy a biztonságot szórakoztató és izgalmas felhasználói élménnyel kell ötvözni – különösen a fiatalabb közönség számára.
A modern generatív MI-alkalmazások alapjául szolgáló LLM-ek rendkívül rugalmasak – ezért alkalmazhatók jól sokféle problémára –, ugyanakkor kevés korlátozás szab nekik határt. Emiatt gyakran letérhetnek a kijelölt útról, és igen változatos – esetenként nem megfelelő – szöveget adhatnak válaszul.
Ha egy LLM-et közvetlenül elérhetővé teszünk a nyilvánosság számára, biztosan számíthatunk váratlan viselkedésre, megfelelő óvintézkedések nélkül pedig fennáll a következők kockázata:
„Jailbreakek”, amelyek során a felhasználók szándékosan úgy manipulálják a chatbotot, hogy káros vagy tiltott tartalmat hozzon létre (érdekesség: ezen a webhelyen bárki játékos formában ismerkedhet meg az LLM-ek jailbreakelésével…); vagy
Ízléstelen, sértő vagy veszélyes tartalom akaratlan közlése. Ez sok esetben veszélyeztetheti a felhasználó jóllétét, illetve pénzügyi vagy hírnévbeli kárt okozhat az alkalmazás szolgáltatójának.
Az LLM-ek nem kívánt használatáról szóló hírek:
Ezek az esetek is bizonyítják, hogy a generatív MI-rendszerek biztonságának kialakítása és fenntartása nem választható lehetőség. Ez különösen igaz kisgyermekek esetében: nem lehet pusztán figyelmeztetésekre hagyatkozni – a megfelelő tartalom biztosításához szilárd védőkorlátokra van szükség.
Az ügyfeleinknek készített RAG- (visszakereséssel támogatott generálási) rendszerekhez hasonlóan több MI-komponenst alkalmazunk, hogy a kiváló teljesítmény fenntartása mellett mérsékeljük a jailbreakek kockázatát.


Rendszerünk egyszerűsített architektúra-ábrája
A rendszer biztonsága érdekében a bemeneteken és a kimeneteken egyaránt LLM-osztályozókat alkalmazunk:
Bemeneti osztályozás (párhuzamosan fut)
Pydantic-sémákat és az LLM strukturált kimeneteit használtuk a felhasználói lekérdezések címkézésére (például SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT stb.). Ez a jailbreakek és a tiltott viselkedés felismerésére szolgáló jelzőket is tartalmazott.
Az egyes témákhoz használt külön osztályozók lényegesen jobb teljesítményt nyújtottak, mint egyetlen, mindenre kiterjedő „gyűjtőosztályozó”.
A sok kevés lövéses példa kulcsfontosságú volt ahhoz, hogy az osztályozók különbséget tegyenek az „I keep being killed by this character” (a játékra utal) és az „I am being hurt by my parent” (gyermekbántalmazásra utal) kijelentés között.
Az ügyféllel, valamint annak bizalmi és biztonsági szakértőivel folytatott szoros együttműködés biztosította, hogy osztályozóink a valós életben alkalmazott megítélésük szerint értékeljék a magas kockázatú üzeneteket.


Válaszgenerálás
Ha a bemenet biztonságosnak minősül, a fő LLM választ generál.
Ellenkező esetben az üzenet figyelmen kívül hagyható – jailbreak esetén –, vagy emberi munkatárshoz továbbítható, ha a lekérdezés biztonsági problémát jelez.
Kimeneti osztályozás
A végső kézbesítés előtt, még az alkalmazásunkon belül osztályozzuk a modell válaszát.
Mivel egyes válaszok az internetről begyűjtött adatokon alkalmaznak RAG-technikákat, ez a lépés az adatmérgezés ellen is védelmet nyújt.
Ha a válasz tiltott tartalmat foglal magában, a rendszer közbelép, és általános üzenettel helyettesíti. A gyakorlatban ezt ritkán tapasztaltuk, de konzervatív kiegészítő védelmet nyújt annak biztosítására, hogy az ügynök viselkedése megfelelő maradjon.
A gyorsaság és a megfizethetőség fenntartása érdekében:
A gyakran használt utasításokat és párbeszédrészleteket egy gondosan válogatott, kevés lövéses példakészlettel együtt tároljuk.
A gyorsítótárazás révén gyorsan és alacsony költséggel alkalmazhatjuk az LLM-osztályozókat anélkül, hogy minden alkalommal újra fel kellene építenünk a kontextust.


Az Anthropic egyik közelmúltbeli tanulmánya bemutatta az alkotmányos osztályozókat: ez a rendszer „alkotmányos” szabályok alapján betanított további osztályozókkal észleli a rosszindulatú vagy veszélyes kéréseket. A következő eredményekről számoltak be:
Magas fokú ellenálló képesség több ezer órányi emberi támadásszimulációval szemben.
Minimális túlzott elutasítási arány és mérsékelt számítási többletigény.
Olyan jövőt képzelünk el, amelyben ezek az alkotmányos megközelítések kiegészíthetik, sőt akár fel is válthatják a hagyományos osztályozási rétegeket, átfogóbb védelmet nyújtva a folyamatosan fejlődő jailbreaktechnikákkal szemben.
Párhuzamos, kis erőforrás-igényű szűrők
Az osztályozási rétegek megakadályozzák, hogy a rosszindulatú lekérdezések elérjék a generatív magot, és biztosítják, hogy a hibás kimenetek soha ne jussanak el a felhasználókhoz.
Fontos a felhasználói élmény
A szórakoztató, a játék történetvilágába illő figyelmeztetések és játékos elutasítások hatására a felhasználók hajlamosabbak elfogadni a rendszer korlátait.
Ne spóroljon a tesztelésen és a felügyeleten
A rendszeres támadásszimuláció és a játékosok viselkedésének gyakori nyomon követése segít felismerni a sebezhetőségeket, mielőtt a szélesebb játékosközösség tudomást szerezne róluk. Ezeket aztán vissza lehet építeni a kevés lövéses osztályozók utasításaiba, hogy a jövőben ne lehessen kihasználni őket. Ez jelenleg manuális folyamat, de automatizálható lenne.
Legyen szó játékfejlesztőről, bankról vagy akár állami intézményről, egy nagy léptékű ügyfélszolgálati chatbot bevezetésekor a felhasználóközpontú kialakításra ÉS a megbízhatóságra egyaránt törekedni kell.
Ügyfeleknek szánt megoldásokat készítünk olyan szervezetek és márkák számára, ahol:
A biztonság mindennél fontosabb – a chatbotok értéket nyújtanak a felhasználóknak, ugyanakkor szigorúan megóvják őket a káros tartalmaktól
A hírnév védelmet élvez – többrétegű védelmet tervezünk, amely akkor is megőrzi a márka jó hírnevét, ha a felhasználók megpróbálják túllépni a rendszer határait
A szabályozás korlátozza a lehetőségeket – naprakészen követjük a legújabb megfelelőségi irányelveket, így megoldásai anélkül méretezhetők, hogy az alkalmazás jailbreakelése miatt kellene aggódnia