Көпшілікке арналған LLM (үлкен тілдік модель) қолданбалары брендтерге бедел және қаржы тұрғысынан қауіп төндіруі мүмкін.
LLM (үлкен тілдік модель) қорғанысын айналып өту үлгілері мен басқа да күтпеген әрекеттерден келетін зиянды азайту үшін көпдеңгейлі жіктеу сүзгілерін қолданамыз.
Біз бұл тәсілді күніне 40 000-нан астам әрі саны өсіп келе жатқан хабарлама өңдейтін, жүктемесі жоғары өндірістік қолданбада іске асырдық.
Өткен жылы біз жетекші ойын әзірлеушісімен серіктесіп, арасында балалар да бар ойыншылардан күніне шамамен 40 000 хабарлама қабылдайтын генеративті ЖИ чатботын іске қостық. Жылдамдық, дәлдік, қауіпсіздік пен қызықтың тепе-теңдігін сақтау өте маңызды:
Брендіңізді танытатын чатбот қауіпсіз болып қана қоймай, дәл сіздің брендіңіздей шынайы сөйлеуі керек.
Ойын компаниясы үшін бұл қауіпсіздікті қызықпен және пайдаланушының құлшынысымен, әсіресе жас аудиторияға лайық етіп ұштастыру деген сөз.
Заманауи генеративті ЖИ қолданбаларының негізіндегі LLM (үлкен тілдік модель) өте икемді, сондықтан көптеген мәселені жақсы шеше алады, бірақ шектеулері де жеткіліксіз. Сондықтан олар жиі белгіленген шеңберден шығып, сан алуан, кейде орынсыз мәтін беруі мүмкін.
LLM (үлкен тілдік модель) көпшілікке тікелей ұсынылса, күтпеген әрекеттер сөзсіз туындайды. Тиісті қорғаныс шаралары болмаса, мынадай қауіптер бар:
Пайдаланушылар чатботты зиянды немесе тыйым салынған контент жасауға әдейі итермелейтін «қорғанысты айналып өту үлгілері» (қызықты дерек: бұл сайтқа кіріп, ойын арқылы LLM қорғанысын айналып өтуді кез келген адам зерттей алады…); немесе
Жағымсыз, қорлайтын не қауіпті контентті байқаусызда ұсыну. Көп жағдайда бұл пайдаланушының әл-ауқатына қауіп төндіруі немесе қолданба жеткізушісіне қаржылық не беделдік зиян келтіруі мүмкін.
LLM (үлкен тілдік модель) күтпеген қолданысы туралы жаңалықтар:
Бұл оқиғалар генеративті ЖИ жүйелерінде қауіпсіздікті орнату және оны сақтау міндетті екенін көрсетеді. Бұл әсіресе кішкентай балалар қатысқанда маңызды: ескертулерге ғана сенуге болмайды, контентті лайықты деңгейде ұстау үшін сенімді қорғаныс тетіктері қажет.
Клиенттерге арнап жасаған RAG (іздеу арқылы толықтырылған генерация) жүйелеріндегідей, жоғары өнімділікті сақтай отырып, қорғанысты айналып өту қаупін азайту үшін бірнеше ЖИ құрамдасын қолданамыз.


Жүйеміздің жеңілдетілген архитектуралық сызбасы
Жүйе қауіпсіздігін қамтамасыз ету үшін кіріс пен шығыста LLM (үлкен тілдік модель) классификаторларын қолданамыз:
Кірісті жіктеу (қатар орындалады)
Пайдаланушы сұрауларын белгілеу үшін Pydantic схемаларын LLM құрылымдалған нәтижелерімен бірге қолдандық (мысалы, SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT және т.б.). Бұған қорғанысты айналып өту немесе тыйым салынған әрекеттерді анықтайтын белгілер де кірді.
Жекелеген тақырыптарға арналған бірнеше классификатор бір ғана ауқымды, «бәрін қамтитын» классификатордан әлдеқайда тиімді болды.
Классификаторлардың “I keep being killed by this character” (ойын туралы) және “I am being hurt by my parent” (балаға зиян келтіру белгісі) деген сөйлемдерді ажыратуы үшін аз мысалмен үйретудің кең ауқымды мысалдары өте маңызды болды.
Клиентпен және оның сенім мен қауіпсіздік жөніндегі мамандарымен тығыз жұмыс істеу классификаторларымыздың нақты өмірдегі жоғары қауіпті хабарламаларды олардың өлшемдеріне сай бағалауына мүмкіндік берді.


Жауап жасау
Кіріс қауіпсіз деп танылса, негізгі LLM (үлкен тілдік модель) жауап жасайды.
Әйтпесе хабарламаны елемеуге (қорғанысты айналып өту әрекеті болса) немесе адам маманға жіберуге (сұрау қауіпсіздік мәселесін білдірсе) болады.
Шығысты жіктеу
Модель жауабын пайдаланушыға түпкілікті жеткізбей тұрып, қолданба ішінде жіктейміз.
Кей жауаптарда интернеттен жиналған деректерге негізделген RAG әдістері қолданылатындықтан, бұл қадам бізді деректерді улау шабуылынан қорғайды.
Жауапта тыйым салынған контент болса, жүйе араласып, оны жалпы сипаттағы хабарламамен алмастырады. Іс жүзінде мұндай жағдай сирек кездеседі, бірақ бұл агент әрекетінің лайықты болуын қамтамасыз ететін қосымша сақтық қабаты.
Жылдамдық пен қолжетімді бағаны сақтау үшін:
Жиі қолданылатын көмексөздер мен диалог үзінділерін, сондай-ақ аз мысалмен үйретуге арналған іріктелген мысалдар жинағын сақтаймыз.
Бұл кэштеу контексті әр жолы қайта құрмай-ақ, LLM (үлкен тілдік модель) классификаторларын жылдам әрі арзан қолдануға мүмкіндік береді.


Anthropic компаниясының жуырдағы зерттеуінде зиянды немесе қауіпті сұрауларды анықтау үшін «конституциялық» ережелер бойынша үйретілген қосымша классификаторларға сүйенетін Конституциялық классификаторлар жүйесі сипатталды. Олар мынадай нәтижелерді хабарлады:
Мыңдаған сағаттық адам қатысқан редтимингке жоғары төзімділік.
Орынды сұраулардан бас тарту деңгейі өте төмен және есептеу шығыны бірқалыпты.
Болашақта бұл конституциялық тәсілдер дәстүрлі жіктеу қабаттарын толықтырып, тіпті алмастырып, қорғанысты айналып өтудің өзгеріп отыратын әдістерінен анағұрлым кешенді қорғаныс ұсына алады деп есептейміз.
Қатар жұмыс істейтін жеңіл сүзгілер
Жіктеу қабаттары зиянды сұрауларды генеративті өзекке жеткізбейді және сапасыз нәтижелердің пайдаланушыға ұсынылуына жол бермейді.
Пайдаланушы тәжірибесі маңызды
Қызықты, ойын әлеміне сай ескертулер мен әзілге құрылған бас тартулар пайдаланушылардың жүйе шектеулерін қабылдауын жеңілдетеді.
Тестілеу мен мониторингтен үнемдемеңіз
Жүйелі редтиминг пен ойыншылар әрекетін жиі бақылау осалдықтарды олар қалың ойыншы қауымына белгілі болмай тұрып анықтауға көмектеседі. Кейін мұндай осалдықтар қайта пайдаланылмауы үшін оларды аз мысалмен үйретуге арналған классификатор көмексөздеріне қосуға болады (қазір бұл қолмен атқарылады, бірақ оны автоматтандыруға болады).
Ойын компаниясы, банк немесе мемлекеттік мекеме болсаңыз да, клиенттерге қызмет көрсететін чатботты кең ауқымда енгізгенде, пайдаланушыға ыңғайлы дизайн мен сенімділікті қатар көздеуіңіз керек.
Біз мына талаптар маңызды саналатын ұйымдар мен брендтерге клиенттерге арналған шешімдер жасаймыз:
Қауіпсіздік бәрінен маңызды — чатботтар пайдаланушыларға пайдасын тигізіп, оларды зиянды контенттен қатаң қорғауы керек
Бедел қорғалады — пайдаланушылар жүйені шегінен шығаруға тырысса да, бренд беделін сақтайтын бірнеше қорғаныс қабатын жобалаймыз
Реттеу талаптары мүмкіндіктеріңізді шектейді — қолданба қорғанысы айналып өтіледі деп алаңдамай, шешімдерді кеңейтуіңіз үшін сәйкестік жөніндегі соңғы нұсқауларды үнемі қадағалаймыз