Applikazzjonijiet pubbliċi bbażati fuq LLM jistgħu jesponu lill-marki għal riskji finanzjarji u għar-reputazzjoni.
Nużaw filtri ta’ klassifikazzjoni f’diversi saffi biex innaqqsu l-ħsara minn jailbreaks ta’ LLM u minn imġiba oħra mhux intenzjonata tal-LLM.
Applikajna dan f’applikazzjoni ta’ produzzjoni b’volum għoli li tirċievi 40,000 messaġġ kuljum, u n-numru qed jiżdied.
Matul is-sena li għaddiet, ħdimna ma’ żviluppatur ewlieni tal-logħob biex inniedu chatbot tal-GenAI li jieħu ħsieb madwar 40,000 messaġġ kuljum mingħand komunità ta’ plejers li tinkludi wkoll tfal. Huwa essenzjali li jinżamm bilanċ bejn il-ħeffa, il-preċiżjoni, is-sikurezza u d-divertiment:
Meta toħloq chatbot biex jirrappreżenta l-marka tiegħek, mhux biżżejjed li jkun sikur—irid jinstema’ awtentikament bħalek.
Għal kumpanija tal-logħob, dan ifisser li tgħaqqad is-sikurezza mad-divertiment u l-entużjażmu tal-utenti—speċjalment fost udjenzi iżgħar fl-età.
L-LLMs li fuqhom huma mibnija l-applikazzjonijiet moderni tal-GenAI huma flessibbli ħafna—u għalhekk jadattaw tajjeb għal ħafna problemi—iżda mhumiex ristretti biżżejjed. Dan ifisser li spiss jistgħu joħorġu ’l barra mil-limiti mistennija u jipproduċu firxa wiesgħa ta’ testi, li xi wħud minnhom jistgħu ma jkunux xierqa.
Jekk LLM jiġi espost direttament għall-pubbliku, żgur li se juri mġiba mhux mistennija u, mingħajr miżuri ta’ mitigazzjoni xierqa, jista’ jwassal għal:
“Jailbreaks”, fejn l-utenti jimmanipulaw intenzjonalment liċ-chatbot biex jipproduċi kontenut ta’ ħsara jew mhux permess (kurżità divertenti: kulħadd jista’ jżur dan is-sit biex jesplora l-jailbreaking tal-LLM permezz ta’ logħba divertenti…); jew
Il-provvista mhux intenzjonata ta’ kontenut offensiv, ta’ togħma ħażina jew perikoluż. F’ħafna każijiet, dan jista’ jipperikola l-benesseri tal-utenti jew jikkawża ħsara finanzjarja jew lir-reputazzjoni tal-fornitur tal-applikazzjoni.
Aħbarijiet ewlenin dwar użu mhux intenzjonat tal-LLM:
Dawn l-inċidenti juru għaliex il-bini u ż-żamma tas-sikurezza fis-sistemi tal-GenAI mhumiex fakultattivi. Dan jgħodd b’mod speċjali meta jkunu involuti tfal żgħar: ma tistax tiddependi biss fuq ċaħdiet ta’ responsabbiltà—huma essenzjali miżuri ta’ protezzjoni robusti biex il-kontenut jibqa’ xieraq.
Bħas-sistemi RAG (Ġenerazzjoni Awmentata bl-Irkupru) li bnejna għall-klijenti, nużaw diversi komponenti tal-IA biex innaqqsu r-riskji tal-jailbreaking filwaqt li nżommu prestazzjoni għolja.


Dijagramma simplifikata tal-arkitettura tas-sistema tagħna
Biex niżguraw is-sikurezza tas-sistema, nużaw klassifikaturi tal-LLM kemm fuq l-inputs kif ukoll fuq l-outputs:
Klassifikazzjoni tal-Input (titħaddem b’mod parallel)
Użajna skemi Pydantic flimkien ma’ outputs strutturati tal-LLM biex nikkategorizzaw it-talbiet tal-utenti (eż. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, eċċ.). Dan kien jinkludi wkoll indikaturi biex jidentifikaw il-jailbreaking jew imġiba mhux permessa.
L-użu ta’ diversi klassifikaturi għal suġġetti individwali ta prestazzjoni ferm aħjar minn klassifikatur wieħed enormi li jipprova “jaqbad kollox”.
Eżempji estensivi few-shot kienu kruċjali biex il-klassifikaturi jiddistingwu bejn “I keep being killed by this character” (b’referenza għal-logħba) u “I am being hurt by my parent” (indikazzjoni ta’ ħsara fuq tifel jew tifla).
Kollaborazzjoni mill-qrib mal-klijent u mat-timijiet speċjalizzati tiegħu tal-fiduċja u s-sikurezza żgurat li l-klassifikaturi tagħna jirriflettu kif huma jevalwaw messaġġi ta’ riskju għoli fil-ħajja reali.


Ġenerazzjoni tat-Tweġiba
L-LLM ewlieni jiġġenera tweġiba jekk l-input jitqies sikur.
Inkella, il-messaġġ jista’ jiġi injorat fil-każ ta’ jailbreaks jew mgħoddi lil persuna jekk it-talba tindika kwistjoni ta’ sikurezza.
Klassifikazzjoni tal-Output
Qabel it-tweġiba titlaq mill-applikazzjoni tagħna, nikklassifikaw it-tweġiba tal-mudell qabel ma titwassal.
Peress li xi tweġibiet jistgħu jużaw tekniki RAG ibbażati fuq data miġbura mill-internet, dan il-pass jipproteġina mill-avvelenament tad-data.
Jekk ikun fiha kontenut mhux permess, is-sistema tintervjeni u tissostitwixxiha b’messaġġ ġenerali. Fil-prattika, dan rari seħħ, iżda huwa saff addizzjonali ta’ prekawzjoni biex jiżgura li l-imġiba tal-aġent tibqa’ xierqa.
Biex inżommu l-ħeffa u l-affordabbiltà:
Naħżnu prompts u djalogi parzjali li jintużaw ta’ spiss, flimkien ma’ sett magħżul ta’ eżempji few-shot.
Dan il-caching jippermettilna napplikaw il-klassifikaturi tal-LLM malajr u bi spiża baxxa, mingħajr ma jkollna nibnu mill-ġdid il-kuntest kull darba.


Studju reċenti minn Anthropic iddeskriva l-Klassifikaturi Kostituzzjonali—sistema li tiddependi fuq klassifikaturi addizzjonali, imħarrġa permezz ta’ regoli “kostituzzjonali”, biex tidentifika talbiet malizzjużi jew mhux sikuri. Huma rrappurtaw:
Reżiljenza għolja għal eluf ta’ sigħat ta’ red teaming minn persuni.
Rati minimi ta’ rifjut żejjed u piż komputazzjonali moderat.
Nemmnu li fil-futur dawn l-approċċi kostituzzjonali jistgħu jikkomplementaw jew saħansitra jissostitwixxu s-saffi tradizzjonali ta’ klassifikazzjoni—u joffru difiża aktar komprensiva kontra t-tattiċi tal-jailbreaking li dejjem jevolvu.
Filtri Ħfief u Paralleli
Is-saffi ta’ klassifikazzjoni jwaqqfu talbiet malizzjużi milli jaslu sal-qalba ġenerattiva—u jiżguraw li outputs ħżiena qatt ma jitwasslu.
L-Esperjenza tal-Utent Hija Importanti
Meta t-twissijiet ikunu divertenti u marbuta mad-dinja tal-logħba, u r-rifjuti jingħataw b’mod ferrieħi, l-utenti jkunu aktar lesti jaċċettaw ir-restrizzjonijiet tas-sistema.
Taqtax Kantunieri fl-Ittestjar u l-Monitoraġġ
Red teaming regolari, flimkien ma’ monitoraġġ frekwenti tal-imġiba tal-plejers, jgħin biex jiġu identifikati l-vulnerabbiltajiet qabel ma jindunaw bihom il-bqija tal-plejers. Dawn imbagħad jistgħu jerġgħu jiddaħħlu fil-prompts few-shot tal-klassifikaturi biex ma jkunux jistgħu jiġu sfruttati fil-futur. Bħalissa dan huwa proċess manwali, iżda jista’ jiġi awtomatizzat.
Kemm jekk int kumpanija tal-logħob, bank jew dipartiment tal-gvern, jekk se timplimenta chatbot tas-servizz tal-klijenti fuq skala kbira, trid timmira KEMM għal disinn iffukat fuq l-utent KIF UKOLL għall-affidabbiltà.
Nibnu soluzzjonijiet għall-klijenti ta’ organizzazzjonijiet u marki fejn:
Is-sikurezza hija prijorità assoluta—chatbots li joffru valur lill-utenti filwaqt li jipproteġuhom b’mod strett minn kontenut ta’ ħsara
Ir-reputazzjoni hija protetta—niddisinjaw diversi saffi ta’ protezzjoni li jħarsu r-reputazzjoni tal-marka, anki jekk l-utenti jippruvaw jimbuttaw is-sistema lil hinn mil-limiti tagħha
Ir-regolamenti jillimitaw l-għażliet tiegħek—inżommu ruħna aġġornati mal-aħħar linji gwida dwar il-konformità biex tkun tista’ tkabbar is-soluzzjonijiet mingħajr ma tinkwieta li l-applikazzjoni tiegħek tiġi jailbroken