Հիմնական նավիգացիա

Ինչ նշանակություն ունեն OpenAI-ի gpt-oss-safeguard մոդելներն ԱԲ անվտանգության համար

OpenAI-ի gpt-oss-safeguard մոդելների վաղ գնահատումը ցույց է տալիս, թե հատուկ անվտանգության մոդելներն ինչպես կարող են ամրապնդել արտադրական ԱԲ համակարգերը։

Վերջին երկու տարում մենք ստեղծել ենք լուծումներ, որոնք անվտանգ կերպով ընդլայնվել են՝ սպասարկելով միլիոնավոր օգտատերերի։ Այս աշխատանքի առանցքային մասը մոդերացիայի արագ և ճշգրիտ համակարգերի նախագծումն էր։ Արդյունավետ մոդերացիան ընկերություններին թույլ է տալիս վստահորեն ներդնել առաջատար ԱԲ լուծումներ՝ վերջնական օգտատերերին պաշտպանելով վնասից և ապահովելով ապրանքանիշի անվտանգությունը՝ անցանկալի գեներացումները հայտնաբերելով նախքան դրանք խնդիր կդառնան։

Վերջերս OpenAI-ը թողարկեց իր GPT-OSS-Safeguard մոդելները՝ այս տարվա սկզբին ներկայացված 20B և 120B OSS մոդելների ճշգրտված տարբերակները։ Այս մոդելները կարող են անմիջապես եզրակացության պահին մեկնաբանել օգտատիրոջ քաղաքականությունը՝ առաջարկելով բովանդակության մոդերացիայի ճկուն և հզոր մոտեցում։ Այս մոդելները հետազոտական նախադիտման փուլում են, ուստի ժամանակի ընթացքում, անկասկած, կշարունակեն կատարելագործվել։

Թողարկումից առաջ մենք համագործակցեցինք OpenAI-ի հետ՝ իրական պայմաններում գնահատումներ անցկացնելով և նպաստելով մոդելի մշակմանը։ Այս հոդվածում ներկայացնում ենք այդ համագործակցությունից ստացած եզրահանգումները և ուսումնասիրում, թե այս առաջընթացն ինչ է նշանակում արտադրական ԱԲ համակարգերում մոդերացիայի ապագայի համար։

Ինչպե՞ս է այսօր աշխատում մոդերացիան արտադրական միջավայրում։

Այսօր մոդերացիայի լուծումները սովորաբար հավելվածը շրջապատող պաշտպանության շերտերի տեսք ունեն։ Մենք հաճախ ենք կիրառում այս կառուցվածքը մեծ ծանրաբեռնվածությամբ և հանրային հասանելիությամբ ներդրումներում։ Մանրամասներին կարող եք ծանոթանալ այս թեմայով մեր բլոգային գրառման մեջ՝ սեղմելով այստեղ։

  1. Զուգահեռ դասակարգեք մուտքային տվյալները (մի՛ ընդունեք վնասակար հարցումներ)․ Թեմատիկ նեղ ուղղվածությամբ փոքր դասակարգիչները միաժամանակ աշխատում և պիտակավորում են օգտատիրոջ յուրաքանչյուր հաղորդագրություն։ Մեր փորձը ցույց է տվել, որ նեղ ուղղվածությամբ դասակարգիչները չափելիորեն ավելի հուսալի են, քան մեկ համընդհանուր դասակարգիչը։ Հարցման մեջ խնամքով ընտրված մի քանի հարցման օրինակները կարող են օգնել տարբերակել “I keep getting killed by this boss” արտահայտությունը (խաղային համատեքստ, լիովին անվնաս) իրական աշխարհում վնասի ազդանշանից։

    • Անվտանգ → Գեներացնել սովորական եղանակով

    • Հաքերային հարձակման գործընթացներ → Անտեսել կամ շեղել՝ ապրանքանիշի ոճին համապատասխան մերժմամբ

    • Անվտանգության կամ բարեկեցության ռիսկեր → հարուստ համատեքստով փոխանցել մասնագետին

  2. Դասակարգեք ելքային տվյալները (մի՛ ուղարկեք վատ պատասխան)․ Յուրաքանչյուր հավանական պատասխան ուղարկելուց առաջ կրկին ստուգվում է։ Սա պաշտպանում է մոդելի շեղումից, RAG տվյալների թունավորումից և քաղաքականության նուրբ սահմանային դեպքերից, օրինակ՝ վնասակար բովանդակությունից, անձնական նույնականացնող տվյալների բացահայտումից կամ գաղտնի տեղեկության արտահոսքից։ Եթե պատասխանը նշվում է որպես խնդրահարույց, LLM-ի գեներացրած պատասխանի փոխարեն տրամադրում ենք անվտանգ, ապրանքանիշին համապատասխան հաղորդագրություն կամ այն փոխանցում մասնագետին՝ հետագայում զղջալու փոխարեն։

  3. Ապահովեք արագություն և մատչելիություն․ Հարցումները որպես բազմակի օգտագործման կառուցատարրեր կազմելը թույլ է տալիս պահոցավորել հարցումների հատվածները, դասակարգիչների մի քանի հարցման օրինակները և երկխոսությունների տարածված սկզբնամասերը։ Այս մոտեցումը թույլ է տալիս նվազեցնել ձեր պաշտպանական մեխանիզմների և՛ հապաղումը, և՛ ծախսը։

  4. Անվտանգությունը դիտարկեք որպես արտադրանքի մասՄերժումներն ու նախազգուշացումները գրվում են ապրանքանիշի ոճով (օրինակ՝ խաղերի համար՝ զվարճալի, ֆինանսների համար՝ պաշտոնական)։ Երբ օգտատիրոջ փորձառությունը հաշվի է առնում նրա նպատակը, պաշտպանական մեխանիզմների ընդունելիությունը բարձրանում է, իսկ հաքերային հարձակման գործընթացի փորձերը՝ նվազում։

  5. Վերահսկեք, նախափորձարկեք և ամբողջացրեք հետադարձ կապըՇարունակական նախափորձարկումն ու անվտանգության իրական ժամանակի վահանակներն օգնում են հայտնաբերել հետընթացը՝ նախքան այն կազդի օգտատերերի վրա։ Լրացուցիչ մի քանի հարցման օրինակների և/կամ երթուղավորման կանոնների միջոցով կարող ենք մոդելին սովորեցնել ցանկացած նոր հարձակման ձևաչափ՝ ժամանակի ընթացքում դժվարացնելով համակարգը կոտրելը՝ առանց հավելվածի արդյունավետությունը նվազեցնելու։

Այսօր մոդերացիայի լուծում ստեղծելու մարտահրավերները

Արդյունավետ պաշտպանական մեխանիզմների ստեղծումն ու պահպանումը բարդ է։

Գործնականում հստակ քաղաքականություն ստեղծելու համար անհրաժեշտ է բիզնեսի առանցքային շահակիցների և մշակողների մանրակրկիտ համագործակցությունը։ Քաղաքականությունը սահմանելուց հետո անհրաժեշտ է նախագծել և կարգավորել համակարգի կառուցվածքն ու վարքը։

gpt-oss-safeguard-ի նման դատողություն կատարող բաց անվտանգության մոդելների ի հայտ գալը կարող է լուծել այս գործընթացի որոշ դժվարություններ՝ բովանդակության մոդերացիայի համար տրամադրելով ավելի պատրաստի և բազմակողմանի հիմք։

Մասնագիտացված անվտանգության մոդելների ներուժը

Gpt-oss-safeguard-ը նպատակ ունի լուծել այսօրվա մոդերացիայի համակարգերի ստեղծման որոշ տարածված մարտահրավերներ։ Այս փոքր, մասնագիտացված մոդելները ճշգրտված են՝ եզրակացության պահին թիրախային քաղաքականության շուրջ դատողություն կատարելու և վնասակար կամ զգայուն բովանդակություն հայտնաբերելու համար, օրինակ՝ հաքերային հարձակման գործընթացներ, անձնական նույնականացնող տվյալների բացահայտում և քաղաքականության այլ խախտումներ։

Դասակարգման գործընթացում ներառելով դատողությունը՝ դրանք ապահովում են ավելի ճշգրիտ ու կայուն մոդերացիա, որը դժվար է շրջանցել։ Որպես GPT-OSS 20B-ի և 120B-ի մասնագիտացված անվտանգության տարբերակներ՝ դրանք ապահովում են առաջատար անվտանգության արդյունավետություն՝ անհատական քաղաքականությունների սահմանումների շնորհիվ պահանջելով նվազագույն նախնական կարգավորում։

Ինչ ենք փորձարկել

Մենք գնահատեցինք gpt-oss-safeguard 20B-ն և 120B-ն արտադրական պայմաններին մոտ մի քանի առաջադրանքներում՝ իրական ժամանակի ձայնային օգնական, խաղացողների աջակցության խաղային բոտ, նախաձեռնող զրույցի մոդերացիայի համակարգ և վնասակարության բազմալեզու ստուգում (իսպաներեն, ֆրանսերեն, իտալերեն, պորտուգալերեն, ռուսերեն և թուրքերեն)։

Ինչ բացահայտեցինք

  • Հապաղման նկատմամբ զգայուն ձայնային մոդերացիա․ Իրական ժամանակի ձայնային փորձարկումներում (պատկերացրեք կենդանի դասակարգում զրույցի ընթացքում, երբ պատասխանը պետք է վերլուծել և առաջնահերթություն սահմանել, ինչպես խաղային զրույցի մոդերացիայի դեպքում) gpt-oss-safeguard-20B-ն մոտ 80%-ով փակեց GPT-OSS-20B-ի և GPT-5-Mini-ի ճշգրտության տարբերությունը (0.71՝ 0.78-ի դիմաց՝ բարձրանալով 0.45-ից)՝ աշխատելով էապես նվազ հապաղմամբ։

  • Խաղացողների աջակցության փոխանցում․ Խաղացողների աջակցության առաջնահերթությունների որոշման ժամանակ gpt-oss-safeguard-20B-ն մոտ 90%-ով փակեց GPT-OSS-20b-ի և GPT-5-Mini-ի տարբերությունը (0.66՝ 0.67-ի դիմաց՝ բարձրանալով 0.57-ից)։ Այն նաև ապահովեց հավաքածուի լավագույն մակրոճշգրտությունը, անվնաս բովանդակության 88% հայտնաբերում և խոցելի օգտատերերի հայտնաբերման 87% ճշգրտություն։ Սա օգտակար է, երբ անհրաժեշտ են զգուշավոր, բարձր վստահությամբ փոխանցումներ՝ առանց մասնագետներին չափազանց շատ դեպքերով ծանրաբեռնելու։

  • Մեծ ծավալով զրույցների մոդերացիա՝ խիտ քաղաքականությամբ․ Մեր ամենաբարդ գնահատման ժամանակ, որը մոդերացիայի համակարգից պահանջում էր խիտ քաղաքականության փաստաթղթի համաձայն նախաձեռնողաբար նշել խաղային հաղորդագրությունները, gpt-oss-safeguard-ը հստակ գերազանցեց բազային OSS մոդելին՝ ապահովելով շուրջ 35% հարաբերական աճ և արդյունավետորեն մշակելով երկար քաղաքականություններ։ Սա հատկապես զգայուն կիրառման դեպք է, որը պահանջում է հայտնաբերման բարձր մակարդակ և ճշգրտություն։ Հայտնաբերման չափազանց ցածր մակարդակի դեպքում բազմաթիվ վնասակար հաղորդագրություններ աննկատ կմնան։ Իսկ ցածր ճշգրտության դեպքում բազմաթիվ անհամապատասխան հաղորդագրություններ կնշվեն մոդերատորների համար՝ նրանց ուշադրությունը շեղելով իսկապես բարդ դեպքերից։

  • Բազմալեզու արդյունավետություն․ Վեց լեզվով վնասակարության հավասարակշռված տվյալակազմում gpt-oss-safeguard-ի արդյունքները մոտ էին GPT-5-Mini-ին՝ ճշգրտությամբ սովորաբար զիջելով ընդամենը 3–5 տոկոսային կետով, իսկ իսպաներենում gpt-oss-safeguard-120B-ն փոքր-ինչ առաջ անցավ։ Թուրքերենի նման քիչ ռեսուրսներով լեզուներում նկատեցինք փոքր-ինչ ավելի մեծ տարբերություններ, սակայն ընդհանուր պատկերը հաստատուն բազմալեզու արդյունավետությունն էր, ընդ որում 20B-ից 120B անցնելիս հայտնաբերման մակարդակը հետևողականորեն աճում էր։

Մենք նաև նկատեցինք, որ gpt-oss-safeguard մոդելներն ուժեղ արդյունքներ են ցուցաբերում այն ոլորտներում, որտեղ LLM-ները սովորաբար ավելի թույլ են մոդերացիայի հարցում, օրինակ՝ անձնական նույնականացնող տվյալների դեպքում։ Լայնորեն կիրառվող մոդելները հաճախ կողմնակալ են ԱՄՆ-ին բնորոշ նման տվյալների հայտնաբերման ուղղությամբ և այլ տարածաշրջաններում ավելի թույլ են աշխատում։ Հետևաբար կարծում ենք, որ gpt-oss-safeguard-ը կօգնի պարզեցնել մոդերացիայի կարգավորումները՝ նվազեցնելով հատուկ գործիքներից կախվածությունը քաղաքականությունների այն փոքր խախտումները հայտնաբերելիս, որոնք ավելի լայն նշանակության LLM-ները չեն կարող մշակել։

Թիրախային ճշգրտման առավելությունները

Այսպիսով, մեր գնահատումները ցույց տվեցին, որ «մոդերացիայի հիմնարար մոդելները», ինչպիսիք են gpt-oss-safeguard-20B-ն և gpt-oss-safeguard-120B-ն, թույլ են տալիս արագ հասնել մեծ արդյունքների։ Սակայն երբ համակարգերից պահանջվում են անվտանգության և մասնագիտացման ամենաբարձր չափանիշները, ոլորտին հատուկ ճշգրտված մոդելները շարունակում են նշաձող սահմանել։

Թիրախային ճշգրտման առավելությունները պատկերող սքրինշոթ։

Խաղային մոդերացիայի կիրառման համար մենք վերահսկվող կարգավորմամբ ճշգրտեցինք Qwen3-0.6B դասակարգիչը՝ օգտագործելով մոդերատորների շուրջ 10 հազար պատմական գործողություններ և քաղաքականությունների կիրառման արդյունքներ։ Այս մոդելն այս առաջադրանքում զգալիորեն գերազանցում է մեր փորձարկած բոլոր բազային մոդելներին՝ ապահովելով 57% ճշգրտություն՝ 15%-ի փոխարեն (gpt-oss-safeguard-120B, գնահատված GPT-4.1-nano-ի արդյունքների հարաբերակցությամբ), այսինքն՝ +42 տոկոսային կետ կամ շուրջ 280% աճ։ Այս արդյունքները համապատասխանում են OpenAI-ի այն ուղեցույցին, ըստ որի՝ պիտակավորված օրինակներով ուսուցանված փոքր, մասնագիտացված դասակարգիչները հատուկ ոլորտներում կարող են գերազանցել պաշտպանական մոդելներին։

Եզրակացությունը հստակ է․ երբ քաղաքականությունները նրբերանգներով և բազմաթիվ սահմանային դեպքերով են, փոքր, տվյալ ոլորտի համար հարմարեցված մոդելը շարունակում է մնալ լավագույն չափանիշը։ Ճշգրտման ընթացքում ձեր քաղաքականությունն ու սահմանային դեպքերն ուղղակիորեն ներառվում են պարամետրերում՝ ապահովելով ավելի կայուն վարք արտադրական միջավայրի անկանխատեսելի պայմաններում՝ նվազագույն հապաղմամբ և ծախսով։

Վերահսկվող կարգավորումն այս խնդրի լուծման հնարավոր մոտեցումներից միայն մեկն է։ Մոդելի վարքն ավելի օպտիմալացնելու համար կարելի է նաև օգտվել ուսուցման այլ հզոր մեթոդներից, օրինակ՝ ամրապնդումով ուսուցումից կամ գործող քաղաքականության վրա հիմնված թորումից։

Ճշգրտման սահմանափակումը

Ճշգրտումը սովորաբար մեծ քանակությամբ տվյալներ է պահանջում։ Այս Qwen3-0.6B դասակարգիչը ճշգրտելու համար օգտագործված տվյալակազմը ձեռքով պիտակավորել էին մոդերատորները, ուստի այն ճշգրիտ և վստահելի սկզբնաղբյուր էր։

Շատ նախագծերի սկզբնական փուլում տվյալների այս առավելությունը կարող է բացակայել։ Ուստի մենք հակված ենք ճշգրտումը դիտարկել որպես օպտիմալացում, որը կարելի է կատարել լուծման մշակման ավելի ուշ փուլում։ Երբ լուծման կառուցվածքը կայունանա և որոշակի իրական օգտատերերի տվյալներ հավաքվեն, մշակողները կարող են թիրախային ճշգրտմամբ մոդերացիայի իրենց լուծումները հասցնել հաջորդ մակարդակի։

Ամփոփիչ մտքեր

Մոդերացիայի հիմնարար մոդելները, ինչպիսին է gpt-oss-safeguard-ը, նոր և հզոր կառուցատարրեր են։ Դրանք կարող են էապես պարզեցնել մոդերացիայի համակարգերի նախագծումը՝ միաժամանակ նվազեցնելով իրական ժամանակում աշխատող հավելվածների հապաղումը։ Համադրելով դրանք փոքր, հատուկ մշակված դասակարգիչների հետ՝ կարող եք ստեղծել ավելի անվտանգ ու արագ համակարգ՝ ավելի քիչ բաղադրիչներով, քան մեծ ընդհանուր նշանակության մոդելների հարցումների վրա հիմնված մոտեցման դեպքում։

Եթե այսօր ներդնում կամ արդիականացնում եք մոդերացիան, նախ դիտարկեք gpt-oss-safeguard-ի նման մոդելների կիրառումը, չափեք արդյունավետությունը, ապա տվյալներով բացահայտված բացերը լրացրեք հատուկ դասակարգիչներով՝ հարցումների վրա հիմնված կամ ճշգրտված։

Ցանկանո՞ւմ եք ավելին իմանալ։ Գրեք մեզ։

Հեղինակ

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke