Јавно достапните апликации со големи јазични модели (LLM) може да ги изложат брендовите на репутациски и финансиски ризици.
Користиме повеќеслојни филтри за класификација за да ја намалиме штетата од пробивање и друго несакано однесување на големите јазични модели (LLM).
Ова го применивме во продукциска апликација со голем обем, која обработува 40.000 пораки дневно, а бројот постојано расте.
Во текот на изминатата година соработувавме со водечки развивач на игри за да внедриме GenAI-четбот што обработува околу 40.000 пораки дневно од играчи меѓу кои има и деца. Од суштинско значење е да се постигне рамнотежа меѓу брзината, точноста, безбедноста и забавата:
Кога создавате четбот што ќе го претставува вашиот бренд, не е доволно само да биде безбеден — треба автентично да звучи како вас.
Кај компанија за игри, тоа значи безбедноста да се спои со забава и возбуда кај корисниците — особено кај помладата публика.
Големите јазични модели (LLM) врз кои се темелат современите GenAI-апликации се многу флексибилни, поради што добро се приспособуваат на многу проблеми, но истовремено немаат доволно ограничувања. Тоа значи дека честопати може да „скршнат од патот“ и да вратат најразновиден текст, од кој дел можеби е несоодветен.
Директното изложување голем јазичен модел (LLM) пред јавноста неизбежно ќе доведе до неочекувано однесување и, без соодветни заштитни мерки, носи ризик од:
„Пробивање“, при што корисниците намерно го манипулираат четботот за да создаде штетна или недозволена содржина (интересен факт: секој може да ја посети оваа веб-локација и преку забавна игра да истражи како се пробиваат големи јазични модели (LLM)…); или
Ненамерно прикажување невкусна, навредлива или опасна содржина. Во многу случаи, тоа може да ја загрози благосостојбата на корисникот или да му нанесе финансиска и репутациска штета на давателот на апликацијата.
Наслови од вестите за несакана употреба на големи јазични модели (LLM):
Овие инциденти покажуваат зошто воспоставувањето и одржувањето на безбедноста во GenAI-системите не е избор. Ова е особено важно кога се вклучени мали деца: не можете да се потпрете само на предупредувања — неопходни се цврсти заштитни механизми за содржината да остане соодветна.
Слично на системите RAG (создавање со проширено пребарување) што ги изградивме за клиенти, користиме повеќе компоненти со ВИ за да ги намалиме ризиците од пробивање, а притоа да одржиме високи перформанси.


Поедноставен архитектонски дијаграм на нашиот систем
За да ја обезбедиме безбедноста на системот, користиме класификатори со големи јазични модели (LLM) и за влезовите и за излезите:
Класификација на влезот (се извршува паралелно)
Користевме шеми Pydantic заедно со структурирани резултати од големи јазични модели (LLM) за означување на корисничките барања (на пр., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT итн.). Тоа вклучуваше и ознаки за препознавање обиди за пробивање или недозволено однесување.
Повеќе класификатори за одделни теми дадоа значително подобри резултати од еден огромен класификатор што „опфаќа сè“.
Големиот број примери за промпт со мал број примери беа клучни за класификаторите да прават разлика меѓу “I keep being killed by this character” (се однесува на играта) и “I am being hurt by my parent” (укажува на повредување дете).
Тесната соработка со клиентот и неговите специјализирани тимови за доверба и безбедност овозможи нашите класификатори да го одразуваат начинот на кој тие би ги процениле високоризичните пораки во реални услови.


Создавање одговор
Главниот голем јазичен модел (LLM) создава одговор ако влезот е оценет како безбеден.
Во спротивно, пораката може да се игнорира ако станува збор за пробивање или да се упати до човек ако барањето укажува на безбедносен проблем.
Класификација на излезот
Пред конечната испорака и пред одговорот да ја напушти нашата апликација, го класифицираме одговорот на моделот.
Бидејќи некои одговори може да користат техники RAG врз податоци преземени од интернет, овој чекор нè заштитува од труење на податоците.
Ако одговорот содржи недозволена содржина, системот интервенира и го заменува со општа порака. Во практика, ова ретко ни се случува, но претставува дополнителен претпазлив заштитен слој што гарантира дека однесувањето на агентот ќе остане соодветно.
За да ги задржиме брзината и пристапната цена:
Ги чуваме често користените промптови и делумните дијалози, заедно со внимателно избран збир примери за промпт со мал број примери.
Ова кеширање ни овозможува брзо и евтино да ги применуваме класификаторите со големи јазични модели (LLM), без секојпат одново да го градиме контекстот.


Неодамнешна студија на Anthropic ги опиша Уставните класификатори — систем што користи дополнителни класификатори обучени според „уставни“ правила за откривање злонамерни или небезбедни барања. Тие ги објавија следниве резултати:
Висока отпорност на илјадници часови човечко тестирање на отпорноста.
Минимална стапка на прекумерно одбивање и умерено дополнително пресметковно оптоварување.
Гледаме иднина во која овие уставни пристапи ќе ги надополнат или дури ќе ги заменат традиционалните слоеви за класификација, нудејќи посеопфатна одбрана од новите тактики за пробивање.
Паралелни, лесни филтри
Слоевите за класификација спречуваат злонамерните барања воопшто да стигнат до генеративното јадро и гарантираат дека неквалитетните резултати нема да бидат испорачани.
Корисничкото искуство е важно
Кога предупредувањата и забавните одбивања се засноваат на светот и приказната на играта, корисниците полесно ги прифаќаат ограничувањата на системот.
Не штедете на тестирање и следење
Редовното тестирање на отпорноста и честото следење на однесувањето на играчите помагаат да се откријат слабостите пред да станат познати на пошироката заедница на играчи. Потоа тие може да се вградат во промптовите со мал број примери за класификаторот, за во иднина да се спречи нивната злоупотреба (моментално ова е рачен процес, но може да се автоматизира).
Без разлика дали сте компанија за игри, банка или државна институција, ако сакате масовно да внедрите четбот за корисничка поддршка, мора да се стремите И кон добар кориснички дизајн И кон доверливост.
Создаваме решенија за корисници за организации и брендови кај кои:
Безбедноста е најважна — четботови што им нудат вредност на корисниците, но строго ги штитат од штетна содржина
Репутацијата е заштитена — осмислуваме повеќе слоеви заштита што ја чуваат репутацијата на брендот, дури и кога корисниците се обидуваат да го турнат системот над неговите граници
Прописите ви ги ограничуваат можностите — ги следиме најновите насоки за усогласеност за да можете да ги проширувате решенијата без грижа дека заштитата на вашата апликација ќе биде пробиена