Navigazzjoni prinċipali

Nibnu aġenti taċ-chat sikuri għal negozji b’riskju għoli

Meta toħloq chatbot biex jirrappreżenta l-marka tiegħek, mhux biżżejjed li jkun sikur—irid jinstema’ awtentikament bħalek.

Sommarju eżekuttiv

  • Applikazzjonijiet pubbliċi bbażati fuq LLM jistgħu jesponu lill-marki għal riskji finanzjarji u għar-reputazzjoni.

  • Nużaw filtri ta’ klassifikazzjoni f’diversi saffi biex innaqqsu l-ħsara minn jailbreaks ta’ LLM u minn imġiba oħra mhux intenzjonata tal-LLM.

  • Applikajna dan f’applikazzjoni ta’ produzzjoni b’volum għoli li tirċievi 40,000 messaġġ kuljum, u n-numru qed jiżdied.

Introduzzjoni

Matul is-sena li għaddiet, ħdimna ma’ żviluppatur ewlieni tal-logħob biex inniedu chatbot tal-GenAI li jieħu ħsieb madwar 40,000 messaġġ kuljum mingħand komunità ta’ plejers li tinkludi wkoll tfal. Huwa essenzjali li jinżamm bilanċ bejn il-ħeffa, il-preċiżjoni, is-sikurezza u d-divertiment:

Meta toħloq chatbot biex jirrappreżenta l-marka tiegħek, mhux biżżejjed li jkun sikur—irid jinstema’ awtentikament bħalek.

Għal kumpanija tal-logħob, dan ifisser li tgħaqqad is-sikurezza mad-divertiment u l-entużjażmu tal-utenti—speċjalment fost udjenzi iżgħar fl-età.

L-LLMs li fuqhom huma mibnija l-applikazzjonijiet moderni tal-GenAI huma flessibbli ħafna—u għalhekk jadattaw tajjeb għal ħafna problemi—iżda mhumiex ristretti biżżejjed. Dan ifisser li spiss jistgħu joħorġu ’l barra mil-limiti mistennija u jipproduċu firxa wiesgħa ta’ testi, li xi wħud minnhom jistgħu ma jkunux xierqa.

Jekk LLM jiġi espost direttament għall-pubbliku, żgur li se juri mġiba mhux mistennija u, mingħajr miżuri ta’ mitigazzjoni xierqa, jista’ jwassal għal:

Ħarsa lejn ir-riskji fid-dinja reali…

Aħbarijiet ewlenin dwar użu mhux intenzjonat tal-LLM:

Dawn l-inċidenti juru għaliex il-bini u ż-żamma tas-sikurezza fis-sistemi tal-GenAI mhumiex fakultattivi. Dan jgħodd b’mod speċjali meta jkunu involuti tfal żgħar: ma tistax tiddependi biss fuq ċaħdiet ta’ responsabbiltà—huma essenzjali miżuri ta’ protezzjoni robusti biex il-kontenut jibqa’ xieraq.

L-approċċ tagħna: klassifikazzjoni f’diversi saffi u caching tal-prompts

Bħas-sistemi RAG (Ġenerazzjoni Awmentata bl-Irkupru) li bnejna għall-klijenti, nużaw diversi komponenti tal-IA biex innaqqsu r-riskji tal-jailbreaking filwaqt li nżommu prestazzjoni għolja.

Dijagramma li turi l-approċċ tagħna: klassifikazzjoni f’diversi saffi u caching tal-prompts.

Dijagramma simplifikata tal-arkitettura tas-sistema tagħna

Biex niżguraw is-sikurezza tas-sistema, nużaw klassifikaturi tal-LLM kemm fuq l-inputs kif ukoll fuq l-outputs:

  1. Klassifikazzjoni tal-Input (titħaddem b’mod parallel)

  • Użajna skemi Pydantic flimkien ma’ outputs strutturati tal-LLM biex nikkategorizzaw it-talbiet tal-utenti (eż. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, eċċ.). Dan kien jinkludi wkoll indikaturi biex jidentifikaw il-jailbreaking jew imġiba mhux permessa.

  • L-użu ta’ diversi klassifikaturi għal suġġetti individwali ta prestazzjoni ferm aħjar minn klassifikatur wieħed enormi li jipprova “jaqbad kollox”.

  • Eżempji estensivi few-shot kienu kruċjali biex il-klassifikaturi jiddistingwu bejn “I keep being killed by this character” (b’referenza għal-logħba) u “I am being hurt by my parent” (indikazzjoni ta’ ħsara fuq tifel jew tifla).

  • Kollaborazzjoni mill-qrib mal-klijent u mat-timijiet speċjalizzati tiegħu tal-fiduċja u s-sikurezza żgurat li l-klassifikaturi tagħna jirriflettu kif huma jevalwaw messaġġi ta’ riskju għoli fil-ħajja reali.

Dijagramma li turi l-approċċ tagħna: klassifikazzjoni f’diversi saffi u caching tal-prompts.

  1. Ġenerazzjoni tat-Tweġiba

  • L-LLM ewlieni jiġġenera tweġiba jekk l-input jitqies sikur.

  • Inkella, il-messaġġ jista’ jiġi injorat fil-każ ta’ jailbreaks jew mgħoddi lil persuna jekk it-talba tindika kwistjoni ta’ sikurezza.

  1. Klassifikazzjoni tal-Output

  • Qabel it-tweġiba titlaq mill-applikazzjoni tagħna, nikklassifikaw it-tweġiba tal-mudell qabel ma titwassal.

  • Peress li xi tweġibiet jistgħu jużaw tekniki RAG ibbażati fuq data miġbura mill-internet, dan il-pass jipproteġina mill-avvelenament tad-data.

  • Jekk ikun fiha kontenut mhux permess, is-sistema tintervjeni u tissostitwixxiha b’messaġġ ġenerali. Fil-prattika, dan rari seħħ, iżda huwa saff addizzjonali ta’ prekawzjoni biex jiżgura li l-imġiba tal-aġent tibqa’ xierqa.

Biex inżommu l-ħeffa u l-affordabbiltà:

  • Naħżnu prompts u djalogi parzjali li jintużaw ta’ spiss, flimkien ma’ sett magħżul ta’ eżempji few-shot.

  • Dan il-caching jippermettilna napplikaw il-klassifikaturi tal-LLM malajr u bi spiża baxxa, mingħajr ma jkollna nibnu mill-ġdid il-kuntest kull darba.

Dijagramma li turi l-approċċ tagħna: klassifikazzjoni f’diversi saffi u caching tal-prompts.

Ħarsa lejn il-futur: klassifikaturi kostituzzjonali

Studju reċenti minn Anthropic iddeskriva l-Klassifikaturi Kostituzzjonali—sistema li tiddependi fuq klassifikaturi addizzjonali, imħarrġa permezz ta’ regoli “kostituzzjonali”, biex tidentifika talbiet malizzjużi jew mhux sikuri. Huma rrappurtaw:

  • Reżiljenza għolja għal eluf ta’ sigħat ta’ red teaming minn persuni.

  • Rati minimi ta’ rifjut żejjed u piż komputazzjonali moderat.

Nemmnu li fil-futur dawn l-approċċi kostituzzjonali jistgħu jikkomplementaw jew saħansitra jissostitwixxu s-saffi tradizzjonali ta’ klassifikazzjoni—u joffru difiża aktar komprensiva kontra t-tattiċi tal-jailbreaking li dejjem jevolvu.

Sommarju: dak li tgħallimna

  1. Filtri Ħfief u Paralleli

Is-saffi ta’ klassifikazzjoni jwaqqfu talbiet malizzjużi milli jaslu sal-qalba ġenerattiva—u jiżguraw li outputs ħżiena qatt ma jitwasslu.

  1. L-Esperjenza tal-Utent Hija Importanti

Meta t-twissijiet ikunu divertenti u marbuta mad-dinja tal-logħba, u r-rifjuti jingħataw b’mod ferrieħi, l-utenti jkunu aktar lesti jaċċettaw ir-restrizzjonijiet tas-sistema.

  1. Taqtax Kantunieri fl-Ittestjar u l-Monitoraġġ

Red teaming regolari, flimkien ma’ monitoraġġ frekwenti tal-imġiba tal-plejers, jgħin biex jiġu identifikati l-vulnerabbiltajiet qabel ma jindunaw bihom il-bqija tal-plejers. Dawn imbagħad jistgħu jerġgħu jiddaħħlu fil-prompts few-shot tal-klassifikaturi biex ma jkunux jistgħu jiġu sfruttati fil-futur. Bħalissa dan huwa proċess manwali, iżda jista’ jiġi awtomatizzat.

Nibnu sistemi tal-GenAI sikuri u attraenti għall-futur

Kemm jekk int kumpanija tal-logħob, bank jew dipartiment tal-gvern, jekk se timplimenta chatbot tas-servizz tal-klijenti fuq skala kbira, trid timmira KEMM għal disinn iffukat fuq l-utent KIF UKOLL għall-affidabbiltà.

Nibnu soluzzjonijiet għall-klijenti ta’ organizzazzjonijiet u marki fejn:

  1. Is-sikurezza hija prijorità assoluta—chatbots li joffru valur lill-utenti filwaqt li jipproteġuhom b’mod strett minn kontenut ta’ ħsara

  2. Ir-reputazzjoni hija protetta—niddisinjaw diversi saffi ta’ protezzjoni li jħarsu r-reputazzjoni tal-marka, anki jekk l-utenti jippruvaw jimbuttaw is-sistema lil hinn mil-limiti tagħha

  3. Ir-regolamenti jillimitaw l-għażliet tiegħek—inżommu ruħna aġġornati mal-aħħar linji gwida dwar il-konformità biex tkun tista’ tkabbar is-soluzzjonijiet mingħajr ma tinkwieta li l-applikazzjoni tiegħek tiġi jailbroken

Awtur

Andrew Liubinas