Հանրությանը հասանելի LLM հավելվածները կարող են բրենդներին հեղինակության և ֆինանսական ռիսկերի ենթարկել։
Մենք կիրառում ենք դասակարգման բազմաշերտ զտիչներ՝ LLM-ի դեմ հաքերային հարձակման գործընթացներից և LLM-ի այլ անցանկալի վարքագծից բխող վնասը նվազեցնելու համար։
Այս մոտեցումը կիրառել ենք արտադրական մեծածավալ հավելվածում, որն օրական ստանում է 40,000 և գնալով ավելի շատ հաղորդագրություն։
Վերջին մեկ տարում առաջատար խաղ մշակող ընկերության հետ ներդրել ենք GenAI չաթբոտ, որն ամեն օր պատասխանում է խաղացողներից, այդ թվում՝ երեխաներից ստացվող մոտ 40,000 հաղորդագրության։ Արագության, ճշգրտության, անվտանգության և զվարճանքի հավասարակշռումն առանցքային է․
Ձեր բրենդը ներկայացնող չաթբոտ ստեղծելիս միայն անվտանգությունը բավարար չէ․ այն պետք է իսկապես ձեր բրենդի ձայնով խոսի։
Խաղային ընկերության դեպքում դա նշանակում է անվտանգությունը համադրել զվարճանքի և օգտատերերի ոգևորության հետ՝ հատկապես ավելի երիտասարդ լսարանի համար։
Ժամանակակից GenAI հավելվածների հիմքում ընկած LLM-ները շատ ճկուն են, ինչի շնորհիվ հարմար են բազմաթիվ խնդիրների համար, բայց նաև բավարար չափով սահմանափակված չեն։ Սա նշանակում է, որ դրանք հաճախ կարող են շեղվել նախատեսված ուղուց և վերադարձնել ամենատարբեր տեքստեր, որոնցից մի քանիսը կարող են անպատշաճ լինել։
LLM-ն անմիջապես հանրությանը հասանելի դարձնելն անխուսափելիորեն կհանգեցնի անսպասելի վարքագծի և առանց պատշաճ պաշտպանական միջոցների կարող է առաջացնել հետևյալ ռիսկերը․
«Հաքերային հարձակման գործընթացներ», որոնց միջոցով օգտատերերը միտումնավոր մանիպուլացնում են չաթբոտին՝ ստիպելով ստեղծել վնասակար կամ արգելված բովանդակություն (հետաքրքիր փաստ․ այս կայքում բոլորը կարող են խաղի միջոցով ուսումնասիրել LLM-ի դեմ հաքերային հարձակման գործընթացը…), կամ
Ոչ միտումնավոր ներկայացնել տհաճ, վիրավորական կամ վտանգավոր բովանդակություն։ Շատ դեպքերում սա կարող է վտանգել օգտատիրոջ բարեկեցությունը կամ ֆինանսական և հեղինակության վնաս պատճառել հավելվածի մատակարարին։
LLM-ի անցանկալի օգտագործման մասին լրատվական վերնագրեր․
Այս դեպքերը ցույց են տալիս, թե ինչու GenAI համակարգերում անվտանգության ապահովումն ու պահպանումը պարտադիր են։ Սա հատկապես կարևոր է փոքր երեխաների դեպքում․ միայն պատասխանատվության սահմանափակման ծանուցումներին ապավինել չի կարելի։ Բովանդակության պատշաճությունն ապահովելու համար անհրաժեշտ են հուսալի պաշտպանական սահմանափակումներ։
Ինչպես հաճախորդների համար ստեղծված RAG (որոնմամբ լրացված գեներացում) համակարգերում, այստեղ ևս օգտագործում ենք արհեստական բանականության մի քանի բաղադրիչ՝ հաքերային հարձակման գործընթացի ռիսկերը նվազեցնելու և բարձր արդյունավետությունը պահպանելու համար։


Մեր համակարգի ճարտարապետության պարզեցված գծապատկերը
Համակարգի անվտանգությունն ապահովելու համար LLM դասակարգիչներ ենք կիրառում թե՛ մուտքային տվյալների, թե՛ արդյունքների նկատմամբ․
Մուտքային տվյալների դասակարգում (զուգահեռ կատարմամբ)
Օգտատերերի հարցումները պիտակավորելու համար Pydantic սխեմաները կիրառեցինք LLM-ի կառուցվածքային արդյունքների հետ միասին (օր.՝ SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT և այլն)։ Դրանք ներառում էին նաև հաքերային հարձակման գործընթացը կամ արգելված վարքագիծը հայտնաբերող դրոշակներ։
Առանձին թեմաների համար մի քանի դասակարգիչ կիրառելը զգալիորեն ավելի արդյունավետ էր, քան մեկ համընդհանուր դասակարգիչը։
Մեծաթիվ մի քանի հարցում օրինակներն առանցքային էին, որպեսզի դասակարգիչները տարբերակեին “I keep being killed by this character” (խոսքը խաղի մասին է) և “I am being hurt by my parent” (երեխային վնաս հասցնելու նշան) արտահայտությունները։
Հաճախորդի և նրա վստահության ու անվտանգության մասնագիտացված թիմերի հետ սերտ համագործակցությամբ ապահովեցինք, որ մեր դասակարգիչներն արտացոլեն իրական կյանքում բարձր ռիսկային հաղորդագրությունների վերաբերյալ նրանց գնահատականները։


Պատասխանի գեներացում
Հիմնական LLM-ը պատասխան է գեներացնում, եթե մուտքային տվյալն անվտանգ է համարվում։
Հակառակ դեպքում հաղորդագրությունը կարող է անտեսվել հաքերային հարձակման գործընթացի դեպքում կամ փոխանցվել աշխատակցին, եթե հարցումը վկայում է անվտանգության խնդրի մասին։
Արդյունքի դասակարգում
Մինչև վերջնական առաքումը և մեր հավելվածից դուրս գալը դասակարգում ենք մոդելի պատասխանը։
Քանի որ որոշ պատասխաններ կարող են RAG տեխնիկաներ կիրառել համացանցից հավաքված տվյալների նկատմամբ, այս քայլը պաշտպանում է մեզ տվյալների թունավորումից։
Եթե պատասխանը պարունակում է արգելված բովանդակություն, համակարգը միջամտում և այն փոխարինում է ընդհանուր հաղորդագրությամբ։ Գործնականում սա հազվադեպ է պատահել, սակայն պահպանողական լրացուցիչ պաշտպանությունն օգնում է ապահովել ագենտի պատշաճ վարքագիծը։
Արագությունն ու մատչելիությունը պահպանելու համար՝
Պահպանում ենք հաճախ օգտագործվող հարցումներն ու երկխոսությունների հատվածները՝ մի քանի հարցում օրինակների ընտրված հավաքածուի հետ միասին։
Այս քեշավորումը թույլ է տալիս արագ և ցածր ծախսով կիրառել LLM դասակարգիչները՝ ամեն անգամ համատեքստը վերստեղծելու կարիք չունենալով։


Anthropic-ի վերջերս հրապարակած ուսումնասիրությունը նկարագրում է «Սահմանադրական դասակարգիչներ» համակարգը, որն ապավինում է «սահմանադրական» կանոններով ուսուցանված լրացուցիչ դասակարգիչների՝ վնասաբեր կամ վտանգավոր հարցումները հայտնաբերելու համար։ Նրանք հայտնել են հետևյալ արդյունքների մասին․
Բարձր կայունություն մարդկանց կողմից հազարավոր ժամեր տևած նախափորձարկման նկատմամբ։
Անտեղի մերժումների նվազագույն ցուցանիշներ և հաշվարկային ռեսուրսների չափավոր լրացուցիչ ծախս։
Ապագայում այս սահմանադրական մոտեցումները կարող են լրացնել կամ նույնիսկ փոխարինել դասակարգման ավանդական շերտերին՝ ավելի համապարփակ պաշտպանություն ապահովելով հաքերային հարձակման գործընթացի զարգացող մարտավարություններից։
Թեթև և զուգահեռ զտիչներ
Դասակարգման շերտերը թույլ չեն տալիս, որ վնասաբեր հարցումները հասնեն գեներացնող միջուկին, և ապահովում են, որ անորակ արդյունքները երբեք չառաքվեն։
Օգտատիրոջ փորձառությունը կարևոր է
Զվարճալի, խաղի պատմությունից բխող զգուշացումների և խաղային ոճով մերժումների շնորհիվ օգտատերերն ավելի հակված են ընդունելու համակարգի սահմանափակումները։
Մի՛ խնայեք փորձարկման և մշտադիտարկման հաշվին
Կանոնավոր նախափորձարկումը և խաղացողների վարքագծի հաճախակի մշտադիտարկումը կօգնեն խոցելիությունները հայտնաբերել նախքան դրանք հայտնի կդառնան խաղացողների լայն շրջանակին։ Այնուհետև դրանք կարելի է ներառել դասակարգիչների՝ մի քանի օրինակ պարունակող հարցումներում, որպեսզի հետագայում չկարողանան օգտագործվել (ներկայումս սա ձեռքով կատարվող գործընթաց է, սակայն այն հնարավոր է ավտոմատացնել)։
Անկախ նրանից՝ խաղային ընկերություն եք, բանկ, թե պետական գերատեսչություն, հաճախորդների սպասարկման չաթբոտը մեծ մասշտաբով ներդնելիս պետք է միաժամանակ առաջնահերթ համարեք և՛ օգտատիրոջ համար դիզայնը, և՛ վստահելիությունը։
Մենք կազմակերպությունների և բրենդների համար ստեղծում ենք հաճախորդներին ուղղված լուծումներ, որոնցում՝
Անվտանգությունն առաջնային է․ չաթբոտներն օգտակար են օգտատերերի համար, բայց նաև խստորեն պաշտպանում են նրանց վնասակար բովանդակությունից
Հեղինակությունը պաշտպանված է․ մենք նախագծում ենք պաշտպանության մի քանի շերտ, որոնք պահպանում են բրենդի հեղինակությունը, նույնիսկ երբ օգտատերերը փորձում են համակարգը դուրս բերել իր սահմաններից
Կարգավորումները սահմանափակում են ձեր ընտրությունը․ մենք հետևում ենք համապատասխանության նորագույն ուղեցույցներին, որպեսզի կարողանաք մասշտաբավորել լուծումները՝ առանց մտահոգվելու, որ ձեր հավելվածը կենթարկվի հաքերային հարձակման գործընթացի