Հիմնական նավիգացիա

Անվտանգ չաթ-ագենտներ բարձր ռիսկայնությամբ բիզնեսների համար

Ձեր բրենդը ներկայացնող չաթբոտ ստեղծելիս միայն անվտանգությունը բավարար չէ․ այն պետք է իսկապես ձեր բրենդի ձայնով խոսի։

Համառոտ ամփոփում

  • Հանրությանը հասանելի LLM հավելվածները կարող են բրենդներին հեղինակության և ֆինանսական ռիսկերի ենթարկել։

  • Մենք կիրառում ենք դասակարգման բազմաշերտ զտիչներ՝ LLM-ի դեմ հաքերային հարձակման գործընթացներից և LLM-ի այլ անցանկալի վարքագծից բխող վնասը նվազեցնելու համար։

  • Այս մոտեցումը կիրառել ենք արտադրական մեծածավալ հավելվածում, որն օրական ստանում է 40,000 և գնալով ավելի շատ հաղորդագրություն։

Ներածություն

Վերջին մեկ տարում առաջատար խաղ մշակող ընկերության հետ ներդրել ենք GenAI չաթբոտ, որն ամեն օր պատասխանում է խաղացողներից, այդ թվում՝ երեխաներից ստացվող մոտ 40,000 հաղորդագրության։ Արագության, ճշգրտության, անվտանգության և զվարճանքի հավասարակշռումն առանցքային է․

Ձեր բրենդը ներկայացնող չաթբոտ ստեղծելիս միայն անվտանգությունը բավարար չէ․ այն պետք է իսկապես ձեր բրենդի ձայնով խոսի։

Խաղային ընկերության դեպքում դա նշանակում է անվտանգությունը համադրել զվարճանքի և օգտատերերի ոգևորության հետ՝ հատկապես ավելի երիտասարդ լսարանի համար։

Ժամանակակից GenAI հավելվածների հիմքում ընկած LLM-ները շատ ճկուն են, ինչի շնորհիվ հարմար են բազմաթիվ խնդիրների համար, բայց նաև բավարար չափով սահմանափակված չեն։ Սա նշանակում է, որ դրանք հաճախ կարող են շեղվել նախատեսված ուղուց և վերադարձնել ամենատարբեր տեքստեր, որոնցից մի քանիսը կարող են անպատշաճ լինել։

LLM-ն անմիջապես հանրությանը հասանելի դարձնելն անխուսափելիորեն կհանգեցնի անսպասելի վարքագծի և առանց պատշաճ պաշտպանական միջոցների կարող է առաջացնել հետևյալ ռիսկերը․

Հայացք իրական աշխարհի ռիսկերին…

LLM-ի անցանկալի օգտագործման մասին լրատվական վերնագրեր․

Այս դեպքերը ցույց են տալիս, թե ինչու GenAI համակարգերում անվտանգության ապահովումն ու պահպանումը պարտադիր են։ Սա հատկապես կարևոր է փոքր երեխաների դեպքում․ միայն պատասխանատվության սահմանափակման ծանուցումներին ապավինել չի կարելի։ Բովանդակության պատշաճությունն ապահովելու համար անհրաժեշտ են հուսալի պաշտպանական սահմանափակումներ։

Մեր մոտեցումը․ բազմաշերտ դասակարգում և հարցումների քեշավորում

Ինչպես հաճախորդների համար ստեղծված RAG (որոնմամբ լրացված գեներացում) համակարգերում, այստեղ ևս օգտագործում ենք արհեստական բանականության մի քանի բաղադրիչ՝ հաքերային հարձակման գործընթացի ռիսկերը նվազեցնելու և բարձր արդյունավետությունը պահպանելու համար։

Մեր մոտեցումը ներկայացնող գծապատկեր․ բազմաշերտ դասակարգում և հարցումների քեշավորում։

Մեր համակարգի ճարտարապետության պարզեցված գծապատկերը

Համակարգի անվտանգությունն ապահովելու համար LLM դասակարգիչներ ենք կիրառում թե՛ մուտքային տվյալների, թե՛ արդյունքների նկատմամբ․

  1. Մուտքային տվյալների դասակարգում (զուգահեռ կատարմամբ)

  • Օգտատերերի հարցումները պիտակավորելու համար Pydantic սխեմաները կիրառեցինք LLM-ի կառուցվածքային արդյունքների հետ միասին (օր.՝ SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT և այլն)։ Դրանք ներառում էին նաև հաքերային հարձակման գործընթացը կամ արգելված վարքագիծը հայտնաբերող դրոշակներ։

  • Առանձին թեմաների համար մի քանի դասակարգիչ կիրառելը զգալիորեն ավելի արդյունավետ էր, քան մեկ համընդհանուր դասակարգիչը։

  • Մեծաթիվ մի քանի հարցում օրինակներն առանցքային էին, որպեսզի դասակարգիչները տարբերակեին “I keep being killed by this character” (խոսքը խաղի մասին է) և “I am being hurt by my parent” (երեխային վնաս հասցնելու նշան) արտահայտությունները։

  • Հաճախորդի և նրա վստահության ու անվտանգության մասնագիտացված թիմերի հետ սերտ համագործակցությամբ ապահովեցինք, որ մեր դասակարգիչներն արտացոլեն իրական կյանքում բարձր ռիսկային հաղորդագրությունների վերաբերյալ նրանց գնահատականները։

Մեր մոտեցումը ներկայացնող գծապատկեր․ բազմաշերտ դասակարգում և հարցումների քեշավորում։

  1. Պատասխանի գեներացում

  • Հիմնական LLM-ը պատասխան է գեներացնում, եթե մուտքային տվյալն անվտանգ է համարվում։

  • Հակառակ դեպքում հաղորդագրությունը կարող է անտեսվել հաքերային հարձակման գործընթացի դեպքում կամ փոխանցվել աշխատակցին, եթե հարցումը վկայում է անվտանգության խնդրի մասին։

  1. Արդյունքի դասակարգում

  • Մինչև վերջնական առաքումը և մեր հավելվածից դուրս գալը դասակարգում ենք մոդելի պատասխանը։

  • Քանի որ որոշ պատասխաններ կարող են RAG տեխնիկաներ կիրառել համացանցից հավաքված տվյալների նկատմամբ, այս քայլը պաշտպանում է մեզ տվյալների թունավորումից։

  • Եթե պատասխանը պարունակում է արգելված բովանդակություն, համակարգը միջամտում և այն փոխարինում է ընդհանուր հաղորդագրությամբ։ Գործնականում սա հազվադեպ է պատահել, սակայն պահպանողական լրացուցիչ պաշտպանությունն օգնում է ապահովել ագենտի պատշաճ վարքագիծը։

Արագությունն ու մատչելիությունը պահպանելու համար՝

  • Պահպանում ենք հաճախ օգտագործվող հարցումներն ու երկխոսությունների հատվածները՝ մի քանի հարցում օրինակների ընտրված հավաքածուի հետ միասին։

  • Այս քեշավորումը թույլ է տալիս արագ և ցածր ծախսով կիրառել LLM դասակարգիչները՝ ամեն անգամ համատեքստը վերստեղծելու կարիք չունենալով։

Մեր մոտեցումը ներկայացնող գծապատկեր․ բազմաշերտ դասակարգում և հարցումների քեշավորում։

Հայացք ապագային․ սահմանադրական դասակարգիչներ

Anthropic-ի վերջերս հրապարակած ուսումնասիրությունը նկարագրում է «Սահմանադրական դասակարգիչներ» համակարգը, որն ապավինում է «սահմանադրական» կանոններով ուսուցանված լրացուցիչ դասակարգիչների՝ վնասաբեր կամ վտանգավոր հարցումները հայտնաբերելու համար։ Նրանք հայտնել են հետևյալ արդյունքների մասին․

  • Բարձր կայունություն մարդկանց կողմից հազարավոր ժամեր տևած նախափորձարկման նկատմամբ։

  • Անտեղի մերժումների նվազագույն ցուցանիշներ և հաշվարկային ռեսուրսների չափավոր լրացուցիչ ծախս։

Ապագայում այս սահմանադրական մոտեցումները կարող են լրացնել կամ նույնիսկ փոխարինել դասակարգման ավանդական շերտերին՝ ավելի համապարփակ պաշտպանություն ապահովելով հաքերային հարձակման գործընթացի զարգացող մարտավարություններից։

Ամփոփում․ մեր քաղած դասերը

  1. Թեթև և զուգահեռ զտիչներ

Դասակարգման շերտերը թույլ չեն տալիս, որ վնասաբեր հարցումները հասնեն գեներացնող միջուկին, և ապահովում են, որ անորակ արդյունքները երբեք չառաքվեն։

  1. Օգտատիրոջ փորձառությունը կարևոր է

Զվարճալի, խաղի պատմությունից բխող զգուշացումների և խաղային ոճով մերժումների շնորհիվ օգտատերերն ավելի հակված են ընդունելու համակարգի սահմանափակումները։

  1. Մի՛ խնայեք փորձարկման և մշտադիտարկման հաշվին

Կանոնավոր նախափորձարկումը և խաղացողների վարքագծի հաճախակի մշտադիտարկումը կօգնեն խոցելիությունները հայտնաբերել նախքան դրանք հայտնի կդառնան խաղացողների լայն շրջանակին։ Այնուհետև դրանք կարելի է ներառել դասակարգիչների՝ մի քանի օրինակ պարունակող հարցումներում, որպեսզի հետագայում չկարողանան օգտագործվել (ներկայումս սա ձեռքով կատարվող գործընթաց է, սակայն այն հնարավոր է ավտոմատացնել)։

Ապագայի համար անվտանգ և գրավիչ GenAI համակարգերի ստեղծում

Անկախ նրանից՝ խաղային ընկերություն եք, բանկ, թե պետական գերատեսչություն, հաճախորդների սպասարկման չաթբոտը մեծ մասշտաբով ներդնելիս պետք է միաժամանակ առաջնահերթ համարեք և՛ օգտատիրոջ համար դիզայնը, և՛ վստահելիությունը։

Մենք կազմակերպությունների և բրենդների համար ստեղծում ենք հաճախորդներին ուղղված լուծումներ, որոնցում՝

  1. Անվտանգությունն առաջնային է․ չաթբոտներն օգտակար են օգտատերերի համար, բայց նաև խստորեն պաշտպանում են նրանց վնասակար բովանդակությունից

  2. Հեղինակությունը պաշտպանված է․ մենք նախագծում ենք պաշտպանության մի քանի շերտ, որոնք պահպանում են բրենդի հեղինակությունը, նույնիսկ երբ օգտատերերը փորձում են համակարգը դուրս բերել իր սահմաններից

  3. Կարգավորումները սահմանափակում են ձեր ընտրությունը․ մենք հետևում ենք համապատասխանության նորագույն ուղեցույցներին, որպեսզի կարողանաք մասշտաբավորել լուծումները՝ առանց մտահոգվելու, որ ձեր հավելվածը կենթարկվի հաքերային հարձակման գործընթացի

Հեղինակ

Andrew Liubinas