Израда безбедних чет-агената за високоризична предузећа

Када правите чет-бот који представља ваш бренд, није довољно да буде безбедан — мора и аутентично да звучи као ви.

Резиме

  • Јавно доступне апликације засноване на великим језичким моделима (LLM) могу изложити брендове репутационим и финансијским ризицима.

  • Користимо вишеслојне филтере за класификацију како бисмо смањили штету од заобилажења безбедносних мера и других нежељених понашања великих језичких модела (LLM).

  • Ово смо применили у веома оптерећеној продукционој апликацији која дневно обрађује 40.000 порука, а тај број и даље расте.

Увод

Током протекле године сарађивали смо с водећим произвођачем игара на примени GenAI чет-бота који прима око 40.000 порука дневно од играча међу којима има и деце. Кључно је успоставити равнотежу између брзине, тачности, безбедности и забаве:

Када правите чет-бот који представља ваш бренд, није довољно да буде безбедан — мора и аутентично да звучи као ви.

Код компаније за игре то значи спојити безбедност са забавом и узбуђењем корисника — нарочито када је реч о млађој публици.

Велики језички модели (LLM), који су основа савремених GenAI апликација, веома су флексибилни — зато се тако добро прилагођавају разним проблемима — али су и недовољно ограничени. То значи да често могу да скрену с пута и врате веома разноврстан текст, од којег неки можда није примерен.

Ако се великом језичком моделу (LLM) омогући директна комуникација с јавношћу, сигурно ће доћи до неочекиваног понашања, а без одговарајућих мера постоји ризик од:

Кратак увид у стварне ризике…

Наслови у вестима о нежељеној употреби великих језичких модела (LLM):

Ови инциденти показују зашто успостављање и одржавање безбедности GenAI система није ствар избора. То је нарочито важно када су укључена мала деца: није довољно ослонити се на одрицања од одговорности — поуздане заштитне мере неопходне су да би садржај остао примерен.

Наш приступ: вишеслојна класификација и кеширање инструкција

Као и код RAG система (генерисање потпомогнуто проналажењем) које смо направили за клијенте, користимо више компоненти вештачке интелигенције како бисмо смањили ризик од заобилажења безбедносних мера, уз очување високих перформанси.

Дијаграм који приказује наш приступ: вишеслојну класификацију и кеширање инструкција.

Поједностављен дијаграм архитектуре нашег система

Да бисмо обезбедили безбедност система, користимо класификаторе засноване на великим језичким моделима (LLM) и за улазе и за излазе:

  1. Класификација улаза (истовремено извршавање)

  • Користили смо Pydantic шеме уз структуриране излазе великих језичких модела (LLM) како бисмо означили упите корисника (нпр. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT итд.). То је обухватало и ознаке за препознавање заобилажења безбедносних мера или недозвољеног понашања.

  • Више класификатора за појединачне теме дало је знатно боље резултате од једног великог, универзалног класификатора.

  • Велики број примера са малим бројем уноса био је пресудан да би класификатори разликовали „I keep being killed by this character“ (односи се на игру) од „I am being hurt by my parent“ (указује на угрожавање детета).

  • Блиска сарадња с клијентом и његовим стручним тимовима за поверење и безбедност омогућила је да наши класификатори одражавају начин на који би они у пракси процењивали високоризичне поруке.

Дијаграм који приказује наш приступ: вишеслојну класификацију и кеширање инструкција.

  1. Генерисање одговора

  • Главни велики језички модел (LLM) генерише одговор ако је улаз оцењен као безбедан.

  • У супротном, порука се може занемарити (код заобилажења безбедносних мера) или проследити човеку (ако упит укаже на безбедносни проблем).

  1. Класификација излаза

  • Пре него што одговор напусти нашу апликацију, класификујемо одговор модела пре коначне испоруке.

  • Пошто неки одговори могу користити RAG технике и податке прикупљене с интернета, овај корак нас штити од тровања података.

  • Ако одговор садржи недозвољен садржај, систем интервенише и замењује га општом поруком. У пракси смо се ретко сусретали с тим, али овај додатни опрезни слој обезбеђује да понашање агента остане примерено.

Да бисмо задржали брзину и приступачну цену:

  • Чувамо често коришћене инструкције и делове дијалога, заједно с пажљиво одабраним примерима са малим бројем уноса.

  • Ово кеширање нам омогућава да класификаторе засноване на великим језичким моделима (LLM) примењујемо брзо и јефтино, без поновног стварања контекста при свакој употреби.

Дијаграм који приказује наш приступ: вишеслојну класификацију и кеширање инструкција.

Поглед у будућност: уставни класификатори

Недавна студија компаније Anthropic описала је уставне класификаторе — систем који користи додатне класификаторе обучене према „уставним“ правилима ради откривања злонамерних или небезбедних захтева. Навели су следеће резултате:

  • Велика отпорност на хиљаде сати тестирања које је спровела људска црвена команда.

  • Минимална стопа неоправданог одбијања и умерено додатно рачунарско оптерећење.

Видимо будућност у којој ови уставни приступи могу допунити или чак заменити традиционалне слојеве класификације, пружајући свеобухватнију заштиту од све напреднијих тактика заобилажења безбедносних мера.

Резиме: шта смо научили

  1. Паралелни, лагани филтери

Слојеви класификације спречавају да злонамерни упити уопште стигну до генеративног језгра и обезбеђују да лоши излази никада не буду испоручени.

  1. Корисничко искуство је важно

Када су упозорења забавна и заснована на свету игре, а одбијања разиграна, корисници лакше прихватају ограничења система.

  1. Не штедите на тестирању и надзору

Редовна црвена команда и често праћење понашања играча помажу да се рањивости уоче пре него што за њих сазна шира база играча. Та сазнања се затим могу вратити у инструкције класификатора с малим бројем уноса како би се спречила њихова будућа злоупотреба (то је тренутно ручни поступак, али се може аутоматизовати).

Израда безбедних и занимљивих GenAI система за будућност

Било да сте компанија за игре, банка или чак државни орган, ако намеравате да широко примените чет-бот за корисничку подршку, морате тежити И добром корисничком дизајну И поузданости.

Правимо решења за директну комуникацију с корисницима намењена организацијама и брендовима којима је важно следеће:

  1. Безбедност је најважнија — чет-ботови који корисницима пружају вредност, али их строго штите од штетног садржаја

  2. Репутација је заштићена — осмишљавамо више слојева заштите који чувају репутацију бренда чак и када корисници покушају да помере систем преко његових граница

  3. Прописи ограничавају ваше могућности — пратимо најновије смернице за усклађеност како бисте могли да проширујете решења без бриге да ће у вашој апликацији бити заобиђене безбедносне мере

Autor

Andrew Liubinas