Navigimi kryesor

Krijimi i agjentëve të sigurt të bisedës për biznese me rrezik të lartë

Kur krijoni një chatbot që përfaqëson markën tuaj, nuk mjafton vetëm të jetë i sigurt—duhet të tingëllojë vërtet si ju.

Përmbledhje ekzekutive

  • Aplikacionet publike të Modeleve të Mëdha Gjuhësore (LLM) mund t’i ekspozojnë markat ndaj rreziqeve financiare dhe të reputacionit.

  • Përdorim filtra klasifikimi me disa shtresa për të zvogëluar dëmet nga heqja e kufizimeve mbrojtëse të LLM-ve dhe sjellje të tjera të paqëllimshme të tyre.

  • Këtë qasje e kemi zbatuar në një aplikacion prodhimi me volum të lartë, i cili përpunon 40 000 mesazhe në ditë dhe ky numër vazhdon të rritet.

Hyrje

Gjatë vitit të fundit, kemi bashkëpunuar me një zhvillues kryesor lojërash për të vënë në përdorim një chatbot me GenAI, i cili u përgjigjet rreth 40 000 mesazheve në ditë nga një bazë lojtarësh ku përfshihen edhe fëmijë. Është thelbësore të ruhet ekuilibri mes shpejtësisë, saktësisë, sigurisë dhe argëtimit:

Kur krijoni një chatbot që përfaqëson markën tuaj, nuk mjafton vetëm të jetë i sigurt—duhet të tingëllojë vërtet si ju.

Në rastin e një kompanie lojërash, kjo do të thotë të ndërthurësh sigurinë me argëtimin dhe entuziazmin e përdoruesve—sidomos për audiencat më të reja.

LLM-të që qëndrojnë në themel të aplikacioneve moderne GenAI janë shumë fleksibël, prandaj përgjithësojnë kaq mirë për shumë probleme, por njëkohësisht nuk kanë kufizime të mjaftueshme. Kjo do të thotë se shpesh mund të dalin nga shinat dhe të gjenerojnë lloje të ndryshme tekstesh, disa prej të cilave mund të jenë të papërshtatshme.

Ekspozimi i drejtpërdrejtë i një LLM-je ndaj publikut do të sjellë patjetër sjellje të papritura dhe, pa masat e duhura mbrojtëse, mund të krijojë rrezikun e:

Një vështrim mbi rreziqet reale…

Tituj lajmesh për përdorimin e paqëllimshëm të LLM-ve:

Këto incidente tregojnë pse krijimi dhe ruajtja e sigurisë në sistemet GenAI nuk është diçka fakultative. Kjo vlen sidomos kur përfshihen fëmijë të vegjël: nuk mund të mbështeteni vetëm te deklaratat për kufizimin e përgjegjësisë—masat e forta mbrojtëse janë thelbësore për ta mbajtur përmbajtjen të përshtatshme.

Qasja jonë: klasifikim me shtresa dhe ruajtje e kërkesave në memorien e përkohshme

Ashtu si në sistemet RAG (gjenerim i përforcuar me rikthim informacioni) që kemi ndërtuar për klientët, përdorim disa komponentë të IA-së për të zvogëluar rrezikun e heqjes së kufizimeve mbrojtëse, duke ruajtur njëkohësisht performancën e lartë.

Diagram që ilustron qasjen tonë: klasifikim me shtresa dhe ruajtje e kërkesave në memorien e përkohshme.

Diagram i thjeshtuar i arkitekturës së sistemit tonë

Për të garantuar sigurinë e sistemit, përdorim klasifikues LLM si për inputet, ashtu edhe për outputet:

  1. Klasifikimi i inputit (kryhet paralelisht)

  • Përdorëm skema Pydantic së bashku me outpute të strukturuara të LLM-së për të etiketuar kërkesat e përdoruesve (p.sh. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT etj.). Kjo përfshinte edhe sinjalizime për të identifikuar heqjen e kufizimeve mbrojtëse ose sjelljet e ndaluara.

  • Përdorimi i disa klasifikuesve për tema të veçanta dha rezultate dukshëm më të mira sesa një klasifikues i vetëm gjigant që synonte të mbulonte gjithçka.

  • Shembujt e shumtë me pak shembuj ishin vendimtarë që klasifikuesit të dallonin mes “I keep being killed by this character” (duke iu referuar lojës) dhe “I am being hurt by my parent” (tregues i dëmtimit të një fëmije).

  • Bashkëpunimi i ngushtë me klientin dhe ekipet e tij të specializuara për besimin dhe sigurinë siguroi që klasifikuesit tanë të pasqyronin mënyrën se si ata do t’i vlerësonin në praktikë mesazhet me rrezik të lartë.

Diagram që ilustron qasjen tonë: klasifikim me shtresa dhe ruajtje e kërkesave në memorien e përkohshme.

  1. Gjenerimi i përgjigjes

  • LLM-ja kryesore gjeneron një përgjigje nëse inputi vlerësohet si i sigurt.

  • Përndryshe, mesazhi mund të shpërfillet në rast përpjekjeje për heqjen e kufizimeve mbrojtëse ose t’i përcillet një personi nëse kërkesa sinjalizon një problem sigurie.

  1. Klasifikimi i outputit

  • Para se të dalë nga aplikacioni ynë, përgjigjja e modelit klasifikohet përpara dërgimit përfundimtar.

  • Meqë disa përgjigje mund të përdorin teknika RAG me të dhëna të mbledhura nga interneti, ky hap na mbron nga helmimi i të dhënave.

  • Nëse përgjigjja përmban material të ndaluar, sistemi ndërhyn dhe e zëvendëson me një mesazh të përgjithshëm. Në praktikë, kjo ka ndodhur rrallë, por shërben si një shtresë shtesë parandaluese për të siguruar që sjellja e agjentit të mbetet e përshtatshme.

Për të ruajtur shpejtësinë dhe koston e përballueshme:

  • Ruajmë kërkesat e përdorura shpesh dhe dialogët e pjesshëm, së bashku me një grup të përzgjedhur shembujsh me pak shembuj.

  • Kjo ruajtje në memorien e përkohshme na mundëson t’i zbatojmë klasifikuesit LLM shpejt dhe me kosto të ulët, pa qenë nevoja ta rindërtojmë kontekstin çdo herë.

Diagram që ilustron qasjen tonë: klasifikim me shtresa dhe ruajtje e kërkesave në memorien e përkohshme.

Vështrim drejt së ardhmes: klasifikuesit kushtetues

Një studim i fundit nga Anthropic përshkroi Klasifikuesit Kushtetues—një sistem që mbështetet në klasifikues shtesë, të trajnuar sipas rregullave “kushtetuese”, për të zbuluar kërkesa keqdashëse ose të pasigurta. Ata raportuan:

  • Rezistencë të lartë ndaj mijëra orëve simulimi sulmesh nga njerëzit.

  • Norma minimale të refuzimeve të tepërta dhe ngarkesë të moderuar llogaritëse.

Parashikojmë një të ardhme ku këto qasje kushtetuese mund të plotësojnë ose edhe të zëvendësojnë shtresat tradicionale të klasifikimit, duke ofruar mbrojtje më gjithëpërfshirëse ndaj taktikave në zhvillim për heqjen e kufizimeve mbrojtëse.

Përmbledhje: mësimet që nxorëm

  1. Filtra paralelë dhe të lehtë

Shtresat e klasifikimit i ndalojnë kërkesat keqdashëse para se të arrijnë te bërthama gjeneruese dhe sigurojnë që outputet e dobëta të mos dërgohen kurrë.

  1. Përvoja e përdoruesit ka rëndësi

Duke përdorur paralajmërime argëtuese të frymëzuara nga historia e lojës dhe refuzime lozonjare, përdoruesit priren t’i pranojnë më lehtë kufizimet e sistemit.

  1. Mos bëni kompromise në testim dhe monitorim

Simulimi i rregullt i sulmeve, së bashku me monitorimin e shpeshtë të sjelljes së lojtarëve, ndihmon në zbulimin e dobësive para se ato të njihen nga komuniteti më i gjerë i lojtarëve. Më pas, këto mund të përfshihen sërish në kërkesat e klasifikuesve me pak shembuj për të parandaluar përdorimin e tyre në të ardhmen. Aktualisht ky është një proces manual, por mund të automatizohet.

Ndërtimi i sistemeve GenAI të sigurta dhe tërheqëse për të ardhmen

Pavarësisht nëse jeni kompani lojërash, bankë apo edhe institucion qeveritar, nëse do të zbatoni në shkallë të gjerë një chatbot për shërbimin ndaj klientit, duhet të synoni NJËKOHËSISHT një përvojë të mirë përdoruesi dhe besueshmëri.

Ne ndërtojmë zgjidhje për klientët e organizatave dhe markave ku:

  1. Siguria është parësore—chatbot-ë që u ofrojnë vlerë përdoruesve, por njëkohësisht i mbrojnë me rigorozitet nga përmbajtjet e dëmshme

  2. Reputacioni mbrohet—projektojmë disa shtresa mbrojtëse që e ruajnë reputacionin e markës, edhe kur përdoruesit përpiqen ta shtyjnë sistemin përtej kufijve të tij

  3. Rregulloret i kufizojnë mundësitë tuaja—ndjekim udhëzimet më të fundit të pajtueshmërisë, që t’i zgjeroni zgjidhjet pa u shqetësuar se aplikacionit tuaj mund t’i hiqen kufizimet mbrojtëse

Autor

Andrew Liubinas