Hlavní navigace

Tvorba bezpečných chatovacích agentů pro vysoce rizikové firmy

Když vytváříte chatbota, který má reprezentovat vaši značku, nestačí, aby byl bezpečný – musí také autenticky vyjadřovat její osobnost.

Shrnutí

  • Veřejně dostupné aplikace využívající LLM mohou značky vystavit reputačním a finančním rizikům.

  • Ke zmírnění škod způsobených jailbreaky a dalším nežádoucím chováním LLM používáme několik vrstev klasifikačních filtrů.

  • Tento přístup jsme nasadili v produkční aplikaci s vysokým provozem, která denně zpracuje 40 000 zpráv – a jejich počet roste.

Úvod

Během uplynulého roku jsme ve spolupráci s předním herním vývojářem nasadili chatbot využívající generativní AI, který od hráčské komunity zahrnující i děti přijímá přibližně 40 000 zpráv denně. Zásadní je najít rovnováhu mezi rychlostí, přesností, bezpečností a zábavou:

Když vytváříte chatbota, který má reprezentovat vaši značku, nestačí, aby byl bezpečný – musí také autenticky vyjadřovat její osobnost.

U herní společnosti to znamená spojit bezpečnost se zábavou a nadšením uživatelů – zejména těch mladších.

LLM, na nichž stojí moderní aplikace generativní AI, jsou velmi flexibilní (proto je lze tak dobře zobecnit na mnoho problémů), ale zároveň nemají dostatečně pevně vymezené hranice. Často proto mohou sejít z vytyčené cesty a vracet nejrůznější texty, z nichž některé nemusí být vhodné.

Pokud LLM zpřístupníte přímo veřejnosti, nevyhnutelně se setkáte s neočekávaným chováním. Bez vhodných ochranných opatření hrozí:

Pohled na skutečná rizika…

Novinové titulky o nežádoucím použití LLM:

Tyto případy ukazují, proč je zajištění a udržování bezpečnosti systémů generativní AI naprostou nutností. To platí zejména tehdy, když systém používají malé děti. Nestačí spoléhat na upozornění – k zachování vhodnosti obsahu jsou nezbytná důkladná ochranná opatření.

Náš přístup: vícevrstvá klasifikace a ukládání promptů do mezipaměti

Podobně jako u systémů RAG (generování rozšířeného o vyhledávání), které jsme vytvořili pro klienty, využíváme několik komponent AI, abychom omezili rizika jailbreaků a zároveň zachovali vysoký výkon.

Schéma znázorňující náš přístup: vícevrstvou klasifikaci a ukládání promptů do mezipaměti.

Zjednodušené schéma architektury našeho systému

Bezpečnost systému zajišťujeme pomocí klasifikátorů založených na LLM, které kontrolují vstupy i výstupy:

  1. Klasifikace vstupů (probíhá souběžně)

  • Pomocí schémat Pydantic a strukturovaných výstupů LLM jsme uživatelské dotazy označovali štítky, jako jsou SAFE, SUSPICIOUS, CHILD_HARM_RISK nebo VIOLENT. Součástí byly také příznaky pro rozpoznání jailbreaků a zakázaného chování.

  • Použití několika klasifikátorů zaměřených na jednotlivá témata přineslo výrazně lepší výsledky než jediný univerzální klasifikátor.

  • Rozsáhlé příklady pro učení na několika příkladech byly nezbytné, aby klasifikátory rozlišily mezi „I keep being killed by this character“ (odkazem na hru) a „I am being hurt by my parent“ (náznakem ubližování dítěti).

  • Díky úzké spolupráci s klientem a jeho specializovanými týmy pro důvěryhodnost a bezpečnost naše klasifikátory posuzovaly vysoce rizikové zprávy stejně jako tyto týmy v praxi.

Schéma znázorňující náš přístup: vícevrstvou klasifikaci a ukládání promptů do mezipaměti.

  1. Generování odpovědi

  • Pokud je vstup vyhodnocen jako bezpečný, hlavní LLM vygeneruje odpověď.

  • V opačném případě lze zprávu ignorovat (u jailbreaků) nebo předat člověku (pokud dotaz upozorňuje na bezpečnostní problém).

  1. Klasifikace výstupů

  • Než odpověď modelu opustí naši aplikaci a dostane se k uživateli, nejprve ji klasifikujeme.

  • Některé odpovědi mohou využívat techniky RAG a data získaná z internetu, takže nás tento krok chrání před záměrně podvrženými daty.

  • Pokud odpověď obsahuje zakázaný obsah, systém zasáhne a nahradí ji obecnou zprávou. V praxi k tomu dochází jen zřídka. Jde spíše o dodatečnou preventivní vrstvu, která zajišťuje, že chování agenta zůstane vhodné.

Abychom zachovali rychlost a dostupnou cenu:

  • Ukládáme často používané prompty a části dialogů společně s pečlivě vybranou sadou příkladů pro učení na několika příkladech.

  • Díky této mezipaměti můžeme klasifikátory založené na LLM používat rychle a levně, aniž bychom museli pokaždé znovu sestavovat kontext.

Schéma znázorňující náš přístup: vícevrstvou klasifikaci a ukládání promptů do mezipaměti.

Výhled do budoucna: konstituční klasifikátory

Nedávná studie společnosti Anthropic popsala konstituční klasifikátory – systém využívající další klasifikátory vycvičené pomocí „konstitučních“ pravidel k odhalování škodlivých či nebezpečných požadavků. Studie uvádí:

  • Vysokou odolnost vůči tisícům hodin red-teamingu prováděného lidmi.

  • Minimální míru zbytečného odmítání požadavků a přiměřenou výpočetní režii.

Do budoucna mohou tyto konstituční přístupy doplnit, nebo dokonce nahradit tradiční klasifikační vrstvy a nabídnout komplexnější ochranu před neustále se vyvíjejícími taktikami jailbreaků.

Shrnutí získaných poznatků

  1. Paralelní, nenáročné filtry

Klasifikační vrstvy brání škodlivým dotazům, aby se vůbec dostaly ke generativnímu jádru, a zajišťují, že se nekvalitní výstupy nikdy nedostanou k uživatelům.

  1. Na uživatelském prostředí záleží

Když jsou upozornění zábavná, vycházejí z příběhového světa hry a odmítnutí působí hravě, uživatelé přijímají omezení systému ochotněji.

  1. Testování a monitorování nepodceňujte

Pravidelný red-teaming společně s častým sledováním chování hráčů pomáhá odhalit zranitelnosti dříve, než se o nich dozví širší hráčská komunita. Tyto poznatky lze následně zapracovat do promptů klasifikátoru využívajícího učení na několika příkladech, aby dané zranitelnosti nebylo možné v budoucnu zneužít. V současnosti jde o ruční proces, který by však bylo možné automatizovat.

Tvorba bezpečných a poutavých systémů generativní AI pro budoucnost

Ať už jste herní společnost, banka, nebo třeba úřad, při rozsáhlém nasazení chatbota pro zákaznickou podporu musíte usilovat o OBOJÍ: kvalitní uživatelský návrh i důvěryhodnost.

Pro organizace a značky vytváříme zákaznická řešení, u nichž:

  1. Bezpečnost je na prvním místě – chatboti přinášejí uživatelům hodnotu a zároveň je důsledně chrání před škodlivým obsahem.

  2. Dobrá pověst zůstává chráněna – navrhujeme několik vrstev ochrany, které chrání pověst značky, i když se uživatelé snaží systém dostat za hranice jeho možností.

  3. Regulace omezuje vaše možnosti – sledujeme nejnovější požadavky na soulad s předpisy, abyste mohli svá řešení rozšiřovat bez obav, že někdo vaši aplikaci prolomí pomocí jailbreaku.

Autor

Andrew Liubinas