Glavna navigacija

Izrada sigurnih chat agenata za visokorizična preduzeća

Kada pravite chatbot koji predstavlja vaš brend, nije dovoljno da bude siguran — mora autentično zvučati kao vi.

Sažetak za rukovodioce

  • Javno dostupne LLM aplikacije mogu izložiti brendove reputacijskim i finansijskim rizicima.

  • Koristimo višeslojne klasifikacijske filtere kako bismo smanjili štetu od jailbreak napada i drugih neželjenih ponašanja LLM-a.

  • Ovaj smo pristup primijenili u produkcijskoj aplikaciji velikog obima koja dnevno obrađuje 40.000 poruka, a taj broj i dalje raste.

Uvod

Tokom protekle godine sarađivali smo s vodećim proizvođačem igara na uvođenju GenAI chatbota koji obrađuje oko 40.000 poruka dnevno od igrača među kojima ima i djece. Ključno je uskladiti brzinu, tačnost, sigurnost i zabavu:

Kada pravite chatbot koji predstavlja vaš brend, nije dovoljno da bude siguran — mora autentično zvučati kao vi.

Za kompaniju koja proizvodi igre to znači spojiti sigurnost sa zabavom i uzbuđenjem korisnika — naročito mlađe publike.

LLM-ovi na kojima se zasnivaju moderne GenAI aplikacije veoma su fleksibilni, zbog čega se tako dobro mogu primijeniti na brojne probleme, ali ujedno nemaju dovoljno ograničenja. Zbog toga često mogu skrenuti s predviđenog puta i vratiti vrlo raznovrstan tekst, od kojeg dio možda nije primjeren.

Ako se LLM direktno izloži javnosti, sigurno će doći do neočekivanog ponašanja, a bez odgovarajućih mjera postoji rizik od:

Kratak pregled stvarnih rizika…

Novinski naslovi o neželjenoj upotrebi LLM-a:

Ovi slučajevi pokazuju zašto izgradnja i održavanje sigurnosti GenAI sistema nisu stvar izbora. To je naročito važno kada su uključena mala djeca: nije dovoljno osloniti se na odricanje od odgovornosti — pouzdane zaštitne mjere neophodne su kako bi sadržaj ostao primjeren.

Naš pristup: višeslojna klasifikacija i predmemoriranje upita

Kao i kod RAG sistema (generiranje potpomognuto dohvaćanjem) koje smo izradili za klijente, koristimo više AI komponenti kako bismo smanjili rizike od jailbreak napada, a zadržali visoke performanse.

Dijagram koji prikazuje naš pristup: višeslojnu klasifikaciju i predmemoriranje upita.

Pojednostavljeni dijagram arhitekture našeg sistema

Kako bismo osigurali sigurnost sistema, koristimo LLM klasifikatore i za ulazne i za izlazne podatke:

  1. Klasifikacija ulaza (izvodi se istovremeno)

  • Koristili smo Pydantic sheme zajedno sa strukturiranim izlazima LLM-a kako bismo označili korisničke upite (npr. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT itd.). To je obuhvatalo i oznake za prepoznavanje jailbreak napada ili nedozvoljenog ponašanja.

  • Više klasifikatora za pojedinačne teme pružilo je znatno bolje rezultate od jednog velikog klasifikatora koji pokušava obuhvatiti sve.

  • Opsežni primjeri za učenje s malim brojem primjera bili su presudni kako bi klasifikatori razlikovali „I keep being killed by this character“ (odnosi se na igru) od „I am being hurt by my parent“ (ukazuje na ugrožavanje djeteta).

  • Bliska saradnja s klijentom i njegovim stručnim timovima za povjerenje i sigurnost osigurala je da naši klasifikatori odražavaju način na koji bi oni procijenili visokorizične poruke u stvarnom životu.

Dijagram koji prikazuje naš pristup: višeslojnu klasifikaciju i predmemoriranje upita.

  1. Generiranje odgovora

  • Glavni LLM generira odgovor ako se ulaz procijeni sigurnim.

  • U suprotnom se poruka može zanemariti ako je riječ o jailbreak napadu ili proslijediti osobi ako upit ukazuje na sigurnosni problem.

  1. Klasifikacija izlaza

  • Prije nego što odgovor napusti našu aplikaciju, klasificiramo odgovor modela prije konačne isporuke.

  • Budući da se neki odgovori mogu služiti RAG tehnikama i podacima prikupljenim s interneta, ovaj korak pruža zaštitu od trovanja podataka.

  • Ako odgovor sadrži nedozvoljeni sadržaj, sistem intervenira i zamjenjuje ga općom porukom. U praksi smo se s tim rijetko susretali, ali riječ je o dodatnom opreznom sloju koji osigurava da ponašanje agenta ostane primjereno.

Za održavanje brzine i pristupačne cijene:

  • Pohranjujemo često korištene upite i dijelove dijaloga, zajedno s pažljivo odabranim skupom primjera za učenje s malim brojem primjera.

  • Ovo predmemoriranje omogućava nam da LLM klasifikatore primjenjujemo brzo i povoljno, bez ponovne izgradnje konteksta pri svakoj upotrebi.

Dijagram koji prikazuje naš pristup: višeslojnu klasifikaciju i predmemoriranje upita.

Pogled u budućnost: ustavni klasifikatori

Nedavna studija kompanije Anthropic opisala je ustavne klasifikatore — sistem koji se oslanja na dodatne klasifikatore obučene pomoću „ustavnih“ pravila radi otkrivanja zlonamjernih ili nesigurnih zahtjeva. Naveli su sljedeće rezultate:

  • Visoka otpornost na hiljade sati ljudskog red teaminga.

  • Minimalne stope neopravdanog odbijanja i umjereno dodatno računarsko opterećenje.

Očekujemo budućnost u kojoj će ovi ustavni pristupi dopunjavati ili čak zamijeniti tradicionalne klasifikacijske slojeve, pružajući sveobuhvatniju zaštitu od jailbreak taktika koje se stalno mijenjaju.

Sažetak: šta smo naučili

  1. Paralelni, lagani filteri

Klasifikacijski slojevi sprečavaju da zlonamjerni upiti uopće stignu do generativne jezgre i osiguravaju da se loši izlazi nikada ne isporuče.

  1. Korisničko iskustvo je važno

Kada upozorenja i razigrana odbijanja učinimo zabavnim i usklađenim sa svijetom igre, korisnici su skloniji prihvatiti ograničenja sistema.

  1. Ne pravite kompromise pri testiranju i nadzoru

Redovan red teaming i često praćenje ponašanja igrača pomažu u otkrivanju ranjivosti prije nego što za njih sazna šira zajednica igrača. Ta se saznanja zatim mogu ugraditi u upite klasifikatora s malim brojem primjera kako bi se spriječila njihova buduća zloupotreba. To je trenutno ručni proces, ali mogao bi se automatizirati.

Izgradnja sigurnih i privlačnih GenAI sistema za budućnost

Bilo da ste kompanija za igre, banka ili državni organ, ako namjeravate u velikom obimu uvesti chatbot za korisničku podršku, morate težiti I kvalitetnom korisničkom dizajnu I pouzdanosti.

Izrađujemo rješenja namijenjena korisnicima za organizacije i brendove kojima je važno sljedeće:

  1. Sigurnost je najvažnija — chatbotovi koji korisnicima pružaju vrijednost, ali ih istovremeno strogo štite od štetnog sadržaja

  2. Reputacija je zaštićena — projektujemo više zaštitnih slojeva koji čuvaju reputaciju brenda čak i kada korisnici pokušaju pomjeriti sistem izvan njegovih granica

  3. Propisi ograničavaju vaše mogućnosti — pratimo najnovije smjernice za usklađenost kako biste mogli širiti rješenja bez brige da će vaša aplikacija biti izložena jailbreak napadu

Autor

Andrew Liubinas