Hlavná navigácia

Tvorba bezpečných chatovacích agentov pre vysokorizikové podniky

Pri tvorbe chatbota, ktorý má reprezentovať vašu značku, nestačí, aby bol bezpečný – musí znieť autenticky ako vy.

Zhrnutie

  • Verejne dostupné aplikácie LLM môžu značky vystaviť reputačným a finančným rizikám.

  • Na obmedzenie škôd spôsobených jailbreakmi a ďalším neželaným správaním LLM používame viacvrstvové klasifikačné filtre.

  • Tento prístup sme nasadili v produkčnej aplikácii s vysokou prevádzkou, ktorá denne spracuje 40 000 správ a ich počet rastie.

Úvod

Počas uplynulého roka sme v spolupráci s popredným herným vývojárom nasadili GenAI chatbot, ktorý spracúva približne 40 000 správ denne od hráčskej komunity zahŕňajúcej aj deti. Nevyhnutné je nájsť rovnováhu medzi rýchlosťou, presnosťou, bezpečnosťou a zábavou:

Pri tvorbe chatbota, ktorý má reprezentovať vašu značku, nestačí, aby bol bezpečný – musí znieť autenticky ako vy.

V prípade hernej spoločnosti to znamená spojiť bezpečnosť so zábavou a nadšením používateľov – najmä tých mladších.

LLM, na ktorých sú založené moderné aplikácie GenAI, sú veľmi flexibilné, vďaka čomu sa dobre uplatňujú pri mnohých problémoch, no zároveň nemajú dostatočne pevné obmedzenia. Preto sa často môžu odkloniť od očakávaného správania a vracať najrôznejšie texty, z ktorých niektoré nemusia byť vhodné.

Priamy prístup verejnosti k LLM nevyhnutne povedie k neočakávanému správaniu a bez vhodných ochranných opatrení vzniká riziko:

Pohľad na riziká z reálneho sveta…

Novinové titulky o neželanom používaní LLM:

Tieto incidenty ukazujú, prečo je budovanie a udržiavanie bezpečnosti systémov GenAI nevyhnutné. Platí to najmä vtedy, keď systém používajú malé deti. Nestačí sa spoliehať na upozornenia – na zachovanie vhodnosti obsahu sú nevyhnutné spoľahlivé ochranné mechanizmy.

Náš prístup: viacvrstvová klasifikácia a ukladanie príkazov do vyrovnávacej pamäte

Podobne ako pri systémoch RAG (generovanie rozšírené o vyhľadávanie), ktoré sme vytvorili pre klientov, využívame viaceré komponenty AI, aby sme obmedzili riziko jailbreakov a zároveň zachovali vysoký výkon.

Schéma znázorňujúca náš prístup: viacvrstvovú klasifikáciu a ukladanie príkazov do vyrovnávacej pamäte.

Zjednodušená schéma architektúry nášho systému

Na zaistenie bezpečnosti systému používame klasifikátory LLM pre vstupy aj výstupy:

  1. Klasifikácia vstupu (prebieha súbežne)

  • Pomocou schém Pydantic a štruktúrovaných výstupov LLM sme označovali otázky používateľov (napr. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT atď.). Súčasťou boli aj príznaky na rozpoznanie jailbreakov alebo zakázaného správania.

  • Viaceré klasifikátory zamerané na jednotlivé témy dosahovali výrazne lepšie výsledky než jeden obrovský univerzálny klasifikátor.

  • Rozsiahly súbor niekoľkopríkladových ukážok bol zásadný, aby klasifikátory rozlišovali medzi „I keep being killed by this character“ (odkazom na hru) a „I am being hurt by my parent“ (náznakom ubližovania dieťaťu).

  • Vďaka úzkej spolupráci s klientom a jeho špecializovanými tímami pre dôveryhodnosť a bezpečnosť naše klasifikátory posudzovali vysokorizikové správy tak, ako by ich tieto tímy posúdili v praxi.

Schéma znázorňujúca náš prístup: viacvrstvovú klasifikáciu a ukladanie príkazov do vyrovnávacej pamäte.

  1. Generovanie odpovede

  • Ak je vstup vyhodnotený ako bezpečný, hlavný LLM vygeneruje odpoveď.

  • V opačnom prípade možno správu ignorovať, ak ide o jailbreak, alebo postúpiť človeku, ak otázka signalizuje bezpečnostný problém.

  1. Klasifikácia výstupu

  • Pred odoslaním odpovede z našej aplikácie ju najskôr klasifikujeme.

  • Keďže niektoré odpovede môžu využívať techniky RAG založené na údajoch zozbieraných z internetu, tento krok nás chráni pred otravou dát.

  • Ak odpoveď obsahuje zakázaný obsah, systém zasiahne a nahradí ju všeobecnou správou. V praxi sa to stáva len zriedka, ide však o dodatočnú preventívnu vrstvu, ktorá zaisťuje, že správanie agenta zostane primerané.

Na zachovanie rýchlosti a cenovej dostupnosti:

  • Ukladáme často používané príkazy a časti dialógov spolu so starostlivo vybraným súborom niekoľkopríkladových ukážok.

  • Vďaka tejto vyrovnávacej pamäti môžeme klasifikátory LLM používať rýchlo a lacno bez toho, aby sme zakaždým museli nanovo vytvárať kontext.

Schéma znázorňujúca náš prístup: viacvrstvovú klasifikáciu a ukladanie príkazov do vyrovnávacej pamäte.

Pohľad do budúcnosti: konštitučné klasifikátory

Nedávna štúdia spoločnosti Anthropic opísala konštitučné klasifikátory – systém využívajúci ďalšie klasifikátory vytrénované pomocou „konštitučných“ pravidiel na odhaľovanie škodlivých alebo nebezpečných požiadaviek. Autori uviedli:

  • Vysokú odolnosť voči tisícom hodín red teamingu vykonávaného ľuďmi.

  • Minimálnu mieru nadmerného odmietania a mierne zvýšenie výpočtovej náročnosti.

V budúcnosti by tieto konštitučné prístupy mohli doplniť alebo dokonca nahradiť tradičné klasifikačné vrstvy a ponúknuť komplexnejšiu ochranu pred vyvíjajúcimi sa taktikami jailbreakov.

Zhrnutie: čo sme sa naučili

  1. Paralelné, nenáročné filtre

Klasifikačné vrstvy zabraňujú, aby sa škodlivé otázky vôbec dostali ku generatívnemu jadru, a zaisťujú, že nekvalitné výstupy sa nikdy neodošlú.

  1. Na používateľskom zážitku záleží

Ak sú upozornenia zábavné, vychádzajú z príbehového sveta hry a odmietnutia sú hravé, používatelia ľahšie prijmú obmedzenia systému.

  1. Nešetrite na testovaní a monitorovaní

Pravidelný red teaming spolu s častým monitorovaním správania hráčov pomáha odhaliť zraniteľnosti skôr, než sa o nich dozvie širšia hráčska komunita. Tieto poznatky potom možno zapracovať do niekoľkopríkladových príkazov klasifikátora, aby sa zraniteľnosti v budúcnosti nedali zneužiť. V súčasnosti ide o manuálny proces, ktorý by však bolo možné automatizovať.

Tvorba bezpečných a pútavých systémov GenAI budúcnosti

Či už ste herná spoločnosť, banka alebo štátny orgán, pri rozsiahlom nasadení chatbota pre zákaznícke služby sa musíte zamerať na používateľský dizajn AJ dôveryhodnosť.

Vytvárame riešenia pre zákazníkov organizácií a značiek, pre ktoré platí:

  1. Bezpečnosť je prvoradá – chatboty prinášajú používateľom hodnotu a zároveň ich dôsledne chránia pred škodlivým obsahom

  2. Dobré meno musí zostať chránené – navrhujeme viacero ochranných vrstiev, ktoré chránia povesť značky, aj keď sa používatelia pokúšajú dostať systém za hranice jeho možností

  3. Regulácia obmedzuje vaše možnosti – sledujeme najnovšie usmernenia na dodržiavanie predpisov, aby ste mohli riešenia rozširovať bez obáv, že vaša aplikácia podľahne jailbreaku

Autor

Andrew Liubinas