Uelekezaji mkuu

Kuunda wakala salama wa mazungumzo kwa biashara zenye hatari kubwa

Unapounda roboti ya mazungumzo kuwakilisha chapa yako, haitoshi iwe salama—lazima pia isikike kama chapa yako halisi.

Muhtasari mkuu

  • Programu za LLM zinazotumiwa na umma zinaweza kuhatarisha sifa na fedha za chapa.

  • Tunatumia vichujio vya uainishaji vya tabaka nyingi ili kupunguza madhara ya jailbreak za LLM na tabia nyingine zisizokusudiwa za LLM.

  • Tumetumia mbinu hii katika programu ya uzalishaji yenye matumizi makubwa, inayopokea jumbe 40,000 kwa siku, na idadi hiyo inaendelea kuongezeka.

Utangulizi

Katika mwaka uliopita, tumeshirikiana na msanidi maarufu wa michezo kusambaza roboti ya mazungumzo ya GenAI inayoshughulikia takriban jumbe 40,000 kwa siku kutoka kwa wachezaji wanaojumuisha watoto. Ni muhimu kusawazisha kasi, usahihi, usalama na burudani:

Unapounda roboti ya mazungumzo kuwakilisha chapa yako, haitoshi iwe salama—lazima pia isikike kama chapa yako halisi.

Kwa kampuni ya michezo, hilo linamaanisha kuunganisha usalama na burudani pamoja na kuwasisimua watumiaji—hasa hadhira changa.

LLM zinazowezesha programu za kisasa za GenAI zina unyumbufu mkubwa—ndiyo maana zinaweza kutatua matatizo mengi vizuri—lakini pia hazina vizuizi vya kutosha. Hii inamaanisha kwamba mara nyingi zinaweza kupotoka na kutoa aina nyingi za maandishi, ambayo baadhi yake huenda yasifae.

Kuruhusu umma kutumia LLM moja kwa moja bila shaka kutasababisha tabia zisizotarajiwa na, bila hatua mwafaka za kupunguza hatari, kunaweza kusababisha:

Muhtasari wa hatari halisi…

Vichwa vya habari kuhusu matumizi yasiyokusudiwa ya LLM:

Matukio haya yanaonyesha kwa nini kujenga na kudumisha usalama katika mifumo ya GenAI si jambo la hiari. Hili ni muhimu hasa watoto wadogo wanapohusika; huwezi kutegemea tu kanusho—vizuizi thabiti vya usalama ni muhimu ili kuhakikisha maudhui yanafaa.

Mbinu yetu: uainishaji wa tabaka nyingi na uhifadhi wa dokeza kwenye akiba

Kama ilivyo kwa mifumo ya RAG (Retrieval-Augmented Generation) tuliyowajengea wateja, tunatumia vipengele vingi vya AI kupunguza hatari za jailbreak huku tukidumisha utendaji bora.

Mchoro unaoonyesha mbinu yetu: uainishaji wa tabaka nyingi na uhifadhi wa dokeza kwenye akiba.

Mchoro uliorahisishwa wa usanifu wa mfumo wetu

Ili kuhakikisha usalama wa mfumo, tunatumia viainishaji vya LLM kwa data zinazoingia na matokeo yanayotoka:

  1. Uainishaji wa Data Zinazoingia (unaofanywa kwa wakati mmoja)

  • Tulitumia miundo ya Pydantic pamoja na matokeo yaliyopangwa ya LLM kuweka lebo kwenye maswali ya watumiaji (k.m., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, n.k.). Hii pia ilijumuisha viashiria vya kutambua jailbreak au tabia iliyopigwa marufuku.

  • Kutumia viainishaji kadhaa kwa mada mahususi kulitoa matokeo bora zaidi kuliko kiainishaji kimoja kikubwa cha “kushughulikia kila kitu.”

  • Mifano mingi ya sampuli-chache ilikuwa muhimu ili kuhakikisha viainishaji vinatofautisha kati ya “I keep being killed by this character” (ikirejelea mchezo) na “I am being hurt by my parent” (ishara ya mtoto kudhuriwa).

  • Ushirikiano wa karibu na mteja pamoja na timu zake maalumu za uaminifu na usalama ulihakikisha viainishaji vyetu vinaakisi jinsi ambavyo wangetathmini jumbe zenye hatari kubwa katika hali halisi.

Mchoro unaoonyesha mbinu yetu: uainishaji wa tabaka nyingi na uhifadhi wa dokeza kwenye akiba.

  1. Uundaji wa Majibu

  • LLM kuu huunda jibu ikiwa data iliyoingizwa imeonekana kuwa salama.

  • Vinginevyo, ujumbe unaweza kupuuzwa ikiwa ni jailbreak au kuwasilishwa kwa binadamu ikiwa swali linaashiria tatizo la usalama.

  1. Uainishaji wa Matokeo

  • Kabla jibu halijatoka kwenye programu yetu, tunaliainisha jibu la muundo kabla ya kuliwasilisha.

  • Kwa kuwa baadhi ya majibu yanaweza kutumia mbinu za RAG zinazotegemea data iliyokusanywa mtandaoni, hatua hii hutulinda dhidi ya uchafuzi wa data.

  • Ikiwa jibu lina maudhui yaliyopigwa marufuku, mfumo huingilia kati na kulibadilisha kwa ujumbe wa jumla. Kwa kawaida hili limetokea mara chache sana, lakini ni safu ya ziada ya tahadhari inayohakikisha tabia ya wakala inaendelea kufaa.

Ili kudumisha kasi na gharama nafuu:

  • Tunahifadhi dokeza zinazotumiwa mara nyingi na sehemu za mazungumzo, pamoja na mkusanyiko ulioteuliwa wa mifano ya sampuli-chache.

  • Uhifadhi huu kwenye akiba hutuwezesha kutumia viainishaji vya LLM kwa haraka na kwa gharama nafuu bila kuunda upya muktadha kila wakati.

Mchoro unaoonyesha mbinu yetu: uainishaji wa tabaka nyingi na uhifadhi wa dokeza kwenye akiba.

Tukitazama siku zijazo: viainishaji vya kikatiba

Utafiti wa hivi karibuni wa Anthropic ulielezea Viainishaji vya Kikatiba—mfumo unaotegemea viainishaji vya ziada vilivyofunzwa kwa kutumia kanuni za “kikatiba” ili kutambua maombi yenye nia mbaya au yasiyo salama. Waliripoti:

  • Ustahimilivu mkubwa baada ya maelfu ya saa za jaribio la binadamu la kubaini udhaifu wa mfumo.

  • Viwango vya chini vya kukataa kupita kiasi na ongezeko la wastani la matumizi ya rasilimali za kompyuta.

Tunaona siku zijazo ambapo mbinu hizi za kikatiba zinaweza kukamilisha au hata kuchukua nafasi ya tabaka za kawaida za uainishaji—zikitoa ulinzi mpana zaidi dhidi ya mbinu za jailbreak zinazoendelea kubadilika.

Muhtasari: mafunzo tuliyopata

  1. Vichujio Vyepesi Vinavyofanya Kazi Sambamba

Tabaka za uainishaji huzuia maswali yenye nia mbaya yasifikie kabisa kiini cha uzalishaji—na huhakikisha matokeo duni hayawasilishwi kamwe.

  1. Uzoefu wa Mtumiaji ni Muhimu

Kwa kutumia maonyo ya kufurahisha yanayotokana na historia ya mchezo na majibu ya kukataa yenye ucheshi, watumiaji huwa tayari zaidi kukubali vizuizi vya mfumo.

  1. Usipunguze Umakini katika Majaribio na Ufuatiliaji

Jaribio la mara kwa mara la kubaini udhaifu wa mfumo, pamoja na kufuatilia mara kwa mara tabia za wachezaji, litasaidia kutambua udhaifu kabla haujajulikana kwa wachezaji wengi. Udhaifu huo unaweza kuongezwa kwenye dokeza za viainishaji vya sampuli-chache ili usiweze kutumiwa siku zijazo. Kwa sasa, mchakato huu hufanywa mwenyewe, lakini unaweza kuendeshwa kiotomatiki.

Kuunda mifumo salama na inayovutia ya GenAI kwa ajili ya kesho

Iwe wewe ni kampuni ya michezo, benki au hata idara ya serikali, ukitaka kutekeleza roboti ya mazungumzo ya huduma kwa wateja kwa kiwango kikubwa, lazima ulengwe kwa pamoja usanifu bora kwa watumiaji NA uaminifu.

Tunajenga suluhisho zinazotumiwa na wateja kwa mashirika na chapa ambapo:

  1. Usalama ndio muhimu zaidi—roboti za mazungumzo zinazowanufaisha watumiaji huku zikiwalinda kikamilifu dhidi ya maudhui hatari

  2. Sifa inalindwa—tunabuni tabaka nyingi za ulinzi zinazodumisha sifa ya chapa, hata watumiaji wakijaribu kuusukuma mfumo uvuke mipaka yake

  3. Kanuni zinadhibiti chaguo zako—tunafuatilia miongozo mipya zaidi ya uzingatiaji ili uweze kupanua suluhisho bila kuhofia programu yako kufanyiwa jailbreak

Mwandishi

Andrew Liubinas