Veřejně dostupné aplikace využívající LLM mohou značky vystavit reputačním a finančním rizikům.
Ke zmírnění škod způsobených jailbreaky a dalším nežádoucím chováním LLM používáme několik vrstev klasifikačních filtrů.
Tento přístup jsme nasadili v produkční aplikaci s vysokým provozem, která denně zpracuje 40 000 zpráv – a jejich počet roste.
Během uplynulého roku jsme ve spolupráci s předním herním vývojářem nasadili chatbot využívající generativní AI, který od hráčské komunity zahrnující i děti přijímá přibližně 40 000 zpráv denně. Zásadní je najít rovnováhu mezi rychlostí, přesností, bezpečností a zábavou:
Když vytváříte chatbota, který má reprezentovat vaši značku, nestačí, aby byl bezpečný – musí také autenticky vyjadřovat její osobnost.
U herní společnosti to znamená spojit bezpečnost se zábavou a nadšením uživatelů – zejména těch mladších.
LLM, na nichž stojí moderní aplikace generativní AI, jsou velmi flexibilní (proto je lze tak dobře zobecnit na mnoho problémů), ale zároveň nemají dostatečně pevně vymezené hranice. Často proto mohou sejít z vytyčené cesty a vracet nejrůznější texty, z nichž některé nemusí být vhodné.
Pokud LLM zpřístupníte přímo veřejnosti, nevyhnutelně se setkáte s neočekávaným chováním. Bez vhodných ochranných opatření hrozí:
„Jailbreaky“, při nichž uživatelé chatbota záměrně přimějí vytvářet škodlivý nebo zakázaný obsah (zajímavost: na tomto webu si může kdokoli vyzkoušet jailbreak LLM formou zábavné hry…), nebo
neúmyslné poskytování nevkusného, urážlivého či nebezpečného obsahu. V mnoha případech to může ohrozit duševní či fyzickou pohodu uživatele nebo poskytovateli aplikace způsobit finanční škodu či poškodit jeho značku.
Novinové titulky o nežádoucím použití LLM:
Tyto případy ukazují, proč je zajištění a udržování bezpečnosti systémů generativní AI naprostou nutností. To platí zejména tehdy, když systém používají malé děti. Nestačí spoléhat na upozornění – k zachování vhodnosti obsahu jsou nezbytná důkladná ochranná opatření.
Podobně jako u systémů RAG (generování rozšířeného o vyhledávání), které jsme vytvořili pro klienty, využíváme několik komponent AI, abychom omezili rizika jailbreaků a zároveň zachovali vysoký výkon.


Zjednodušené schéma architektury našeho systému
Bezpečnost systému zajišťujeme pomocí klasifikátorů založených na LLM, které kontrolují vstupy i výstupy:
Klasifikace vstupů (probíhá souběžně)
Pomocí schémat Pydantic a strukturovaných výstupů LLM jsme uživatelské dotazy označovali štítky, jako jsou SAFE, SUSPICIOUS, CHILD_HARM_RISK nebo VIOLENT. Součástí byly také příznaky pro rozpoznání jailbreaků a zakázaného chování.
Použití několika klasifikátorů zaměřených na jednotlivá témata přineslo výrazně lepší výsledky než jediný univerzální klasifikátor.
Rozsáhlé příklady pro učení na několika příkladech byly nezbytné, aby klasifikátory rozlišily mezi „I keep being killed by this character“ (odkazem na hru) a „I am being hurt by my parent“ (náznakem ubližování dítěti).
Díky úzké spolupráci s klientem a jeho specializovanými týmy pro důvěryhodnost a bezpečnost naše klasifikátory posuzovaly vysoce rizikové zprávy stejně jako tyto týmy v praxi.


Generování odpovědi
Pokud je vstup vyhodnocen jako bezpečný, hlavní LLM vygeneruje odpověď.
V opačném případě lze zprávu ignorovat (u jailbreaků) nebo předat člověku (pokud dotaz upozorňuje na bezpečnostní problém).
Klasifikace výstupů
Než odpověď modelu opustí naši aplikaci a dostane se k uživateli, nejprve ji klasifikujeme.
Některé odpovědi mohou využívat techniky RAG a data získaná z internetu, takže nás tento krok chrání před záměrně podvrženými daty.
Pokud odpověď obsahuje zakázaný obsah, systém zasáhne a nahradí ji obecnou zprávou. V praxi k tomu dochází jen zřídka. Jde spíše o dodatečnou preventivní vrstvu, která zajišťuje, že chování agenta zůstane vhodné.
Abychom zachovali rychlost a dostupnou cenu:
Ukládáme často používané prompty a části dialogů společně s pečlivě vybranou sadou příkladů pro učení na několika příkladech.
Díky této mezipaměti můžeme klasifikátory založené na LLM používat rychle a levně, aniž bychom museli pokaždé znovu sestavovat kontext.


Nedávná studie společnosti Anthropic popsala konstituční klasifikátory – systém využívající další klasifikátory vycvičené pomocí „konstitučních“ pravidel k odhalování škodlivých či nebezpečných požadavků. Studie uvádí:
Vysokou odolnost vůči tisícům hodin red-teamingu prováděného lidmi.
Minimální míru zbytečného odmítání požadavků a přiměřenou výpočetní režii.
Do budoucna mohou tyto konstituční přístupy doplnit, nebo dokonce nahradit tradiční klasifikační vrstvy a nabídnout komplexnější ochranu před neustále se vyvíjejícími taktikami jailbreaků.
Paralelní, nenáročné filtry
Klasifikační vrstvy brání škodlivým dotazům, aby se vůbec dostaly ke generativnímu jádru, a zajišťují, že se nekvalitní výstupy nikdy nedostanou k uživatelům.
Na uživatelském prostředí záleží
Když jsou upozornění zábavná, vycházejí z příběhového světa hry a odmítnutí působí hravě, uživatelé přijímají omezení systému ochotněji.
Testování a monitorování nepodceňujte
Pravidelný red-teaming společně s častým sledováním chování hráčů pomáhá odhalit zranitelnosti dříve, než se o nich dozví širší hráčská komunita. Tyto poznatky lze následně zapracovat do promptů klasifikátoru využívajícího učení na několika příkladech, aby dané zranitelnosti nebylo možné v budoucnu zneužít. V současnosti jde o ruční proces, který by však bylo možné automatizovat.
Ať už jste herní společnost, banka, nebo třeba úřad, při rozsáhlém nasazení chatbota pro zákaznickou podporu musíte usilovat o OBOJÍ: kvalitní uživatelský návrh i důvěryhodnost.
Pro organizace a značky vytváříme zákaznická řešení, u nichž:
Bezpečnost je na prvním místě – chatboti přinášejí uživatelům hodnotu a zároveň je důsledně chrání před škodlivým obsahem.
Dobrá pověst zůstává chráněna – navrhujeme několik vrstev ochrany, které chrání pověst značky, i když se uživatelé snaží systém dostat za hranice jeho možností.
Regulace omezuje vaše možnosti – sledujeme nejnovější požadavky na soulad s předpisy, abyste mohli svá řešení rozšiřovat bez obav, že někdo vaši aplikaci prolomí pomocí jailbreaku.