Aplikacionet publike të Modeleve të Mëdha Gjuhësore (LLM) mund t’i ekspozojnë markat ndaj rreziqeve financiare dhe të reputacionit.
Përdorim filtra klasifikimi me disa shtresa për të zvogëluar dëmet nga heqja e kufizimeve mbrojtëse të LLM-ve dhe sjellje të tjera të paqëllimshme të tyre.
Këtë qasje e kemi zbatuar në një aplikacion prodhimi me volum të lartë, i cili përpunon 40 000 mesazhe në ditë dhe ky numër vazhdon të rritet.
Gjatë vitit të fundit, kemi bashkëpunuar me një zhvillues kryesor lojërash për të vënë në përdorim një chatbot me GenAI, i cili u përgjigjet rreth 40 000 mesazheve në ditë nga një bazë lojtarësh ku përfshihen edhe fëmijë. Është thelbësore të ruhet ekuilibri mes shpejtësisë, saktësisë, sigurisë dhe argëtimit:
Kur krijoni një chatbot që përfaqëson markën tuaj, nuk mjafton vetëm të jetë i sigurt—duhet të tingëllojë vërtet si ju.
Në rastin e një kompanie lojërash, kjo do të thotë të ndërthurësh sigurinë me argëtimin dhe entuziazmin e përdoruesve—sidomos për audiencat më të reja.
LLM-të që qëndrojnë në themel të aplikacioneve moderne GenAI janë shumë fleksibël, prandaj përgjithësojnë kaq mirë për shumë probleme, por njëkohësisht nuk kanë kufizime të mjaftueshme. Kjo do të thotë se shpesh mund të dalin nga shinat dhe të gjenerojnë lloje të ndryshme tekstesh, disa prej të cilave mund të jenë të papërshtatshme.
Ekspozimi i drejtpërdrejtë i një LLM-je ndaj publikut do të sjellë patjetër sjellje të papritura dhe, pa masat e duhura mbrojtëse, mund të krijojë rrezikun e:
“Heqjes së kufizimeve mbrojtëse”, ku përdoruesit e manipulojnë qëllimisht chatbot-in për të prodhuar përmbajtje të dëmshme ose të ndaluar (një fakt interesant: kushdo mund ta vizitojë këtë faqe për të eksploruar heqjen e kufizimeve mbrojtëse të LLM-ve përmes një loje argëtuese…); ose
Ofrimit të paqëllimshëm të përmbajtjeve të papëlqyeshme, fyese ose të rrezikshme. Në shumë raste, kjo mund të rrezikojë mirëqenien e përdoruesit ose t’i shkaktojë ofruesit të aplikacionit dëme financiare apo të reputacionit të markës.
Tituj lajmesh për përdorimin e paqëllimshëm të LLM-ve:
Këto incidente tregojnë pse krijimi dhe ruajtja e sigurisë në sistemet GenAI nuk është diçka fakultative. Kjo vlen sidomos kur përfshihen fëmijë të vegjël: nuk mund të mbështeteni vetëm te deklaratat për kufizimin e përgjegjësisë—masat e forta mbrojtëse janë thelbësore për ta mbajtur përmbajtjen të përshtatshme.
Ashtu si në sistemet RAG (gjenerim i përforcuar me rikthim informacioni) që kemi ndërtuar për klientët, përdorim disa komponentë të IA-së për të zvogëluar rrezikun e heqjes së kufizimeve mbrojtëse, duke ruajtur njëkohësisht performancën e lartë.


Diagram i thjeshtuar i arkitekturës së sistemit tonë
Për të garantuar sigurinë e sistemit, përdorim klasifikues LLM si për inputet, ashtu edhe për outputet:
Klasifikimi i inputit (kryhet paralelisht)
Përdorëm skema Pydantic së bashku me outpute të strukturuara të LLM-së për të etiketuar kërkesat e përdoruesve (p.sh. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT etj.). Kjo përfshinte edhe sinjalizime për të identifikuar heqjen e kufizimeve mbrojtëse ose sjelljet e ndaluara.
Përdorimi i disa klasifikuesve për tema të veçanta dha rezultate dukshëm më të mira sesa një klasifikues i vetëm gjigant që synonte të mbulonte gjithçka.
Shembujt e shumtë me pak shembuj ishin vendimtarë që klasifikuesit të dallonin mes “I keep being killed by this character” (duke iu referuar lojës) dhe “I am being hurt by my parent” (tregues i dëmtimit të një fëmije).
Bashkëpunimi i ngushtë me klientin dhe ekipet e tij të specializuara për besimin dhe sigurinë siguroi që klasifikuesit tanë të pasqyronin mënyrën se si ata do t’i vlerësonin në praktikë mesazhet me rrezik të lartë.


Gjenerimi i përgjigjes
LLM-ja kryesore gjeneron një përgjigje nëse inputi vlerësohet si i sigurt.
Përndryshe, mesazhi mund të shpërfillet në rast përpjekjeje për heqjen e kufizimeve mbrojtëse ose t’i përcillet një personi nëse kërkesa sinjalizon një problem sigurie.
Klasifikimi i outputit
Para se të dalë nga aplikacioni ynë, përgjigjja e modelit klasifikohet përpara dërgimit përfundimtar.
Meqë disa përgjigje mund të përdorin teknika RAG me të dhëna të mbledhura nga interneti, ky hap na mbron nga helmimi i të dhënave.
Nëse përgjigjja përmban material të ndaluar, sistemi ndërhyn dhe e zëvendëson me një mesazh të përgjithshëm. Në praktikë, kjo ka ndodhur rrallë, por shërben si një shtresë shtesë parandaluese për të siguruar që sjellja e agjentit të mbetet e përshtatshme.
Për të ruajtur shpejtësinë dhe koston e përballueshme:
Ruajmë kërkesat e përdorura shpesh dhe dialogët e pjesshëm, së bashku me një grup të përzgjedhur shembujsh me pak shembuj.
Kjo ruajtje në memorien e përkohshme na mundëson t’i zbatojmë klasifikuesit LLM shpejt dhe me kosto të ulët, pa qenë nevoja ta rindërtojmë kontekstin çdo herë.


Një studim i fundit nga Anthropic përshkroi Klasifikuesit Kushtetues—një sistem që mbështetet në klasifikues shtesë, të trajnuar sipas rregullave “kushtetuese”, për të zbuluar kërkesa keqdashëse ose të pasigurta. Ata raportuan:
Rezistencë të lartë ndaj mijëra orëve simulimi sulmesh nga njerëzit.
Norma minimale të refuzimeve të tepërta dhe ngarkesë të moderuar llogaritëse.
Parashikojmë një të ardhme ku këto qasje kushtetuese mund të plotësojnë ose edhe të zëvendësojnë shtresat tradicionale të klasifikimit, duke ofruar mbrojtje më gjithëpërfshirëse ndaj taktikave në zhvillim për heqjen e kufizimeve mbrojtëse.
Filtra paralelë dhe të lehtë
Shtresat e klasifikimit i ndalojnë kërkesat keqdashëse para se të arrijnë te bërthama gjeneruese dhe sigurojnë që outputet e dobëta të mos dërgohen kurrë.
Përvoja e përdoruesit ka rëndësi
Duke përdorur paralajmërime argëtuese të frymëzuara nga historia e lojës dhe refuzime lozonjare, përdoruesit priren t’i pranojnë më lehtë kufizimet e sistemit.
Mos bëni kompromise në testim dhe monitorim
Simulimi i rregullt i sulmeve, së bashku me monitorimin e shpeshtë të sjelljes së lojtarëve, ndihmon në zbulimin e dobësive para se ato të njihen nga komuniteti më i gjerë i lojtarëve. Më pas, këto mund të përfshihen sërish në kërkesat e klasifikuesve me pak shembuj për të parandaluar përdorimin e tyre në të ardhmen. Aktualisht ky është një proces manual, por mund të automatizohet.
Pavarësisht nëse jeni kompani lojërash, bankë apo edhe institucion qeveritar, nëse do të zbatoni në shkallë të gjerë një chatbot për shërbimin ndaj klientit, duhet të synoni NJËKOHËSISHT një përvojë të mirë përdoruesi dhe besueshmëri.
Ne ndërtojmë zgjidhje për klientët e organizatave dhe markave ku:
Siguria është parësore—chatbot-ë që u ofrojnë vlerë përdoruesve, por njëkohësisht i mbrojnë me rigorozitet nga përmbajtjet e dëmshme
Reputacioni mbrohet—projektojmë disa shtresa mbrojtëse që e ruajnë reputacionin e markës, edhe kur përdoruesit përpiqen ta shtyjnë sistemin përtej kufijve të tij
Rregulloret i kufizojnë mundësitë tuaja—ndjekim udhëzimet më të fundit të pajtueshmërisë, që t’i zgjeroni zgjidhjet pa u shqetësuar se aplikacionit tuaj mund t’i hiqen kufizimet mbrojtëse