OpenAI-ийн gpt-oss-safeguard загварууд AI аюулгүй байдалд ямар ач холбогдолтой вэ?

OpenAI-ийн gpt-oss-safeguard загварын анхны үнэлгээ нь тусгай аюулгүй байдлын загварууд үйлдвэрлэлийн AI системийг хаана бэхжүүлэхийг харууллаа.

Сүүлийн хоёр жилийн хугацаанд бид сая сая хэрэглэгчид хүртэл аюулгүй өргөжсөн шийдлүүдийг бүтээлээ. Энэ ажлын гол хэсэг нь хурдан, нарийвчлалтай модерацын системүүдийг зохион бүтээх явдал байв. Үр дүнтэй модерац нь хүсээгүй үүсгэлтийг асуудал болохоос нь өмнө илрүүлж, эцсийн хэрэглэгчдийг хор хөнөөлөөс хамгаалан, брэндийн аюулгүй байдлыг хангадаг. Ингэснээр компаниуд хамгийн сүүлийн үеийн AI шийдлүүдийг итгэлтэй нэвтрүүлэх боломжтой.

Саяхан OpenAI GPT-OSS-Safeguard загваруудаа гаргалаа. Эдгээр нь энэ оны эхээр танилцуулсан 20B болон 120B OSS загваруудын нарийн тохируулсан хувилбар юм. Эдгээр загвар хэрэглэгчийн бодлогыг дүгнэлт хийх үед шууд тайлбарлаж чаддаг тул агуулгын модерацад уян хатан, хүчирхэг арга санал болгоно. Эдгээр загвар одоогоор судалгааны урьдчилсан хувилбар тул цаашид улам сайжрах нь дамжиггүй.

Бид загварын хөгжүүлэлтэд мэдээлэл өгөх бодит орчны үнэлгээг хийж, энэхүү хувилбар гарахаас өмнө OpenAI-тай хамтран ажилласан. Энэ нийтлэлд бид уг хамтын ажиллагаанаас олж авсан ойлголтоо хуваалцаж, эдгээр дэвшил үйлдвэрлэлийн AI системийн модерацын ирээдүйд ямар ач холбогдолтойг авч үзнэ.

Өнөөдөр үйлдвэрлэлийн орчинд модерац хэрхэн ажилладаг вэ?

Өнөөдөр модерацын шийдлүүдийг ихэвчлэн аппликейшнийг хүрээлсэн хамгаалалтын давхаргуудаар бүрдүүлдэг. Бид олон нийтэд зориулсан, ачаалал ихтэй нэвтрүүлэлтүүддээ энэ загварыг өргөн ашигладаг. Дэлгэрэнгүй мэдээллийг энэ сэдвээр бичсэн манай блогоос эндээс уншина уу.

  1. Оролтыг зэрэг ангилах (муу өгөгдлийг бүү нэвтрүүл): Сэдэв тус бүрд зориулсан жижиг ангилагчид зэрэг ажиллаж, хэрэглэгчийн зурвас бүрийг шошголно. Нарийн чиглэлтэй ангилагчид бүхнийг хамарсан нэг ангилагчаас хэмжигдэхүйц илүү найдвартай байдгийг бид тогтоосон. Өгөгдөлд сайтар сонгосон цөөн оролдлого жишээ оруулснаар “I keep getting killed by this boss” (тоглоомын нөхцөл, бүрэн хоргүй) гэдгийг бодит амьдрал дахь хор хөнөөлийн дохионоос ялгахад тусална.

    • Аюулгүй → Ердийн байдлаар үүсгэх

    • Jailbreak → Үл тоомсорлох эсвэл брэндийн өнгө аяст нийцсэн татгалзалтаар зайлуулах

    • Аюулгүй байдал эсвэл сайн сайхан байдалд эрсдэлтэй → дэлгэрэнгүй нөхцөл мэдээллийн хамт хүнд шилжүүлэх

  2. Гаралтыг ангилах (муу хариултыг бүү хүргэ): Хүргэхийн өмнө боломжит хариулт бүрийг дахин шалгана. Энэ нь загварын хазайлт, RAG өгөгдлийн хордуулалт болон хортой агуулга, хувийн мэдээлэл (PII) ил болох, эмзэг мэдээлэл алдагдах зэрэг бодлогын нарийн захын тохиолдлоос хамгаална. Том хэлний загвар (LLM)-ын үүсгэсэн хариулт сэжигтэй гэж тэмдэглэгдсэн бол харамсах зүйл хүргэхийн оронд аюулгүй, брэндэд нийцсэн зурвасаар сольж эсвэл хүнд шилжүүлнэ.

  3. Хурдан бөгөөд боломжийн үнэтэй болгох: Өгөгдлүүдийг дахин ашиглах боломжтой бүрэлдэхүүн хэсгээр зохиовол өгөгдлийн хэсэг, ангилагчийн цөөн оролдлого жишээ болон харилцан ярианы түгээмэл эхлэлийг кэшлэх боломжтой. Энэ арга нь хамгаалалтын механизмын саатал, зардлыг хоёуланг нь бууруулна.

  4. Аюулгүй байдлыг бүтээгдэхүүний нэг хэсэг гэж үзэхТатгалзалт, анхааруулгыг бүтээгдэхүүний өнгө аяст нийцүүлэн бичнэ (жишээлбэл, тоглоомд хөгжилтэй, санхүүд албан ёсны). Хэрэглэгчийн туршлага тэдний зорилгыг хүндэтгэвэл хамгаалалтын механизмын хүлээн зөвшөөрөлт нэмэгдэж, jailbreak оролдлого буурна.

  5. Хянах, улаан багаараа шалгах, эргэх холбоог бүрдүүлэхТасралтгүй улаан багийн шалгалт болон аюулгүй байдлын шууд хяналтын самбар нь доголдлыг хэрэглэгчдэд хүрэхээс өмнө илрүүлэхэд тусална. Нэмэлт цөөн оролдлого жишээ болон/эсвэл чиглүүлэлтийн дүрэм өгснөөр аливаа шинэ халдлагын хэв маягийг загварт зааж болно. Ингэснээр аппликейшний гүйцэтгэлийг алдагдуулахгүйгээр системийг цаг хугацааны явцад эвдэхэд улам хэцүү болгоно.

Өнөөдөр модерацын шийдэл бүтээхэд тулгардаг сорилтууд

Үр дүнтэй хамгаалалтын механизм бүтээж, арчлах нь хэцүү.

Бодит амьдралд тодорхой бодлого боловсруулахын тулд бизнесийн гол оролцогч талууд болон хөгжүүлэгчид нягт хамтран ажиллах шаардлагатай. Бодлогоо тодорхойлсны дараа системийн бүтэц, ажиллагааг бүтээж, тохируулах ёстой.

gpt-oss-safeguard зэрэг нээлттэй аюулгүй байдлын сэтгэн бодох загварууд бий болсноор энэ үйл явцын зарим хүндрэл арилж, агуулгын модерацад ашиглахад илүү бэлэн, олон талт суурь бүрдэх боломжтой.

Тусгай аюулгүй байдлын загваруудын боломж

Gpt-oss-safeguard нь өнөөгийн модерацын системийг бүтээхэд түгээмэл тулгардаг зарим сорилтыг шийдэх зорилготой. Эдгээр жижиг, тусгай загварыг дүгнэлт хийх үед зорилтот бодлогын дагуу сэтгэн бодож, jailbreak, хувийн мэдээлэл (PII) ил болох болон бодлогын бусад зөрчил зэрэг хортой эсвэл эмзэг агуулгыг илрүүлэхээр нарийн тохируулсан.

Ангилах үйл явцдаа сэтгэн бодох чадварыг нэгтгэснээр тэд тойрч гарахад хэцүү, илүү нарийвчлалтай, найдвартай модерацыг бий болгоно. GPT-OSS 20B болон 120B-ийн тусгай аюулгүй байдлын хувилбаруудын хувьд тэд захиалгат бодлогын тодорхойлолтоор тохиргооны ажлыг хамгийн бага байлгахын зэрэгцээ аюулгүй байдлын тэргүүлэх гүйцэтгэлийг хангана.

Бидний туршсан зүйлс

Бид gpt-oss-safeguard 20B болон 120B-ийг үйлдвэрлэлийн орчинтой төстэй хэд хэдэн даалгаварт үнэлсэн: бодит цагийн дуут туслах, тоглоом доторх тоглогчийн тусламжийн бот, идэвхтэй чат модерацын систем, мөн олон хэлний хортой агуулгын шалгалт (испани, франц, итали, португал, орос, турк).

Бидний олж мэдсэн зүйлс

  • Сааталд мэдрэмтгий дуут модерац: Бодит цагийн дуут туршилтад (жишээлбэл, тоглоомын чат модерац шиг хариултыг шинжилж, ангилан шийдвэрлэх шаардлагатай харилцан яриан доторх шууд ангилал) gpt-oss-safeguard-20B нь GPT-OSS-20B ба GPT-5-Mini-ийн нарийвчлалын зөрүүний ойролцоогоор 80%-ийг нөхсөн (0.45-аас 0.71 болсон; GPT-5-Mini 0.78) бөгөөд саатал нь хавьгүй бага байв.

  • Тоглогчийн тусламжийг шат ахиулах: Тоглогчийн тусламжийн ангилан шийдвэрлэлтэд gpt-oss-safeguard-20B нь GPT-OSS-20b ба GPT-5-Mini-ийн зөрүүний ойролцоогоор 90%-ийг нөхсөн (0.57-оос 0.66 болсон; GPT-5-Mini 0.67). Мөн багцдаа хамгийн сайн макро нарийвчлал үзүүлж, хоргүй агуулгыг 88% бүрэн илрүүлэн, эмзэг хэрэглэгчийг 87%-ийн нарийвчлалтай таньсан. Энэ нь хүний шалгагчдыг хэт ачаалахгүйгээр болгоомжтой, өндөр итгэлтэй шат ахиулалт хийхэд тустай.

  • Олон бодлоготой чатыг өргөн хүрээнд зохицуулах: Тоглоом доторх зурвасуудыг дэлгэрэнгүй бодлогын баримт бичгийн дагуу идэвхтэй тэмдэглэх шаардлагатай хамгийн хүнд үнэлгээнд gpt-oss-safeguard нь OSS суурь үзүүлэлтээс илт давж, харьцангуйгаар ойролцоогоор 35% өссөн бөгөөд урт бодлогыг үр дүнтэй боловсруулсан. Энэ нь бүрэн илрүүлэлт, нарийвчлал хоёуланг өндөр түвшинд шаарддаг онцгой эмзэг хэрэглээ юм. Бүрэн илрүүлэлт хэт бага бол олон хортой зурвас илрэхгүй өнгөрнө. Харин нарийвчлал бага бол олон хамааралгүй зурвасыг хүний модераторуудад шилжүүлж, үнэхээр хүнд тохиолдлуудад хандуулах анхаарлыг нь сарниулна.

  • Олон хэлний гүйцэтгэл: Зургаан хэлний тэнцвэржүүлсэн хортой агуулгын өгөгдлийн багцад gpt-oss-safeguard нь GPT-5-Mini-тай ойролцоо ажиллаж, нарийвчлалын зөрүү ихэвчлэн 3–5 нэгжийн дотор байсан бөгөөд испани хэл дээр gpt-oss-safeguard-120B ялимгүй давсан. Турк зэрэг нөөц багатай хэлэнд зөрүү бага зэрэг их байсныг ажигласан ч ерөнхийдөө хэл дамнасан гүйцэтгэл сайн байж, 20B-ээс 120B руу ахихад бүрэн илрүүлэлт тогтмол нэмэгдсэн.

Мөн gpt-oss-safeguard загварууд Том хэлний загвар (LLM)-ууд модерацад уламжлалт ёсоор сул байдаг чиглэлд сайн ажилласныг ажигласан. Жишээлбэл, түгээмэл загварууд хувийн мэдээллийг (PII) АНУ-ын хэв маягаар таних хандлагатай тул бусад бүс нутгийн мэдээлэл дээр харьцангуй сул ажилладаг. Иймээс gpt-oss-safeguard нь өргөн хүрээний Том хэлний загвар (LLM)-уудын илрүүлж чаддаггүй бодлогын жижиг зөрчлийг таних зориулалтын хэрэгслээс хамаарах хамаарлыг бууруулж, модерацын тохиргоог хялбарчлахад тустай гэж бид үзэж байна.

Зорилтот нарийн тохируулгын үр нөлөө

Бидний үнэлгээгээр gpt-oss-safeguard-20B, gpt-oss-safeguard-120B зэрэг «суурь модерацын загварууд» богино хугацаанд ихээхэн үр дүнд хүргэж чадна. Гэхдээ системээс аюулгүй байдал, нарийвчлалын хамгийн өндөр стандарт шаардах үед тухайн салбарт зориулан нарийн тохируулсан загварууд жишиг хэвээр байна.

Зорилтот нарийн тохируулгын үр нөлөөг харуулсан дэлгэцийн зураг.

Тоглоом доторх модерацын хэрэглээнд бид модераторуудын өмнөх 10 мянга орчим үйлдэл болон бодлогын үр дүнд хяналттай нарийн тохиргоо хийж, Qwen3-0.6B ангилагчийг тохируулсан. Энэ загвар тухайн даалгаварт туршсан бүх суурь загвараас хол давж, 15%-тай харьцуулахад 57%-ийн нарийвчлалд хүрсэн (gpt-oss-safeguard-120B; GPT-4.1-nano-ийн гүйцэтгэлийн харьцаагаар тооцсон). Энэ нь +42 нэгж буюу ойролцоогоор 280%-ийн өсөлт юм. Эдгээр үр дүн нь шошголосон жишээгээр сургасан, зориулалтын жижиг ангилагчид тусгай салбарт хамгаалалтын загваруудаас илүү ажиллаж чадна гэсэн OpenAI-ийн зөвлөмжтэй нийцэж байна.

Гол дүгнэлт тодорхой: бодлого олон нарийн ялгаа, захын тохиолдолтой бол тухайн салбарт тохируулсан жижиг загвар хамгийн сайн жишиг хэвээр байна. Нарийн тохируулга нь таны бодлого, захын тохиолдлуудыг параметрт шууд шингээснээр үйлдвэрлэлийн эмх замбараагүй бодит орчинд илүү тогтвортой ажиллахын зэрэгцээ саатал, зардлыг маш бага байлгана.

Хяналттай нарийн тохиргоо бол үүнийг хэрэгжүүлэх боломжит хэд хэдэн аргын зөвхөн нэг нь. Загварын ажиллагааг цааш оновчлохын тулд бататгах сургалт эсвэл одоогийн бодлогод суурилсан нэрэлт зэрэг бусад хүчирхэг сургалтын аргыг ч ашиглаж болно.

Нарийн тохируулгын анхаарах зүйл

Нарийн тохируулгад их хэмжээний өгөгдөл шаардлагатай байдаг. Энэ Qwen3-0.6B ангилагчийг нарийн тохируулахад ашигласан өгөгдлийн багцыг хүний модераторууд гараар шошголосон тул цэвэр, найдвартай үнэний эх сурвалж болж байв.

Олон төсөл эхлэх үед ийм баялаг өгөгдлийн давуу тал байдаггүй. Тиймээс бид нарийн тохируулгыг шийдлийн хөгжүүлэлтийн мөчлөгийн хожуу үед хийж болох оновчлол гэж үздэг. Шийдлийн бүтэц тогтворжиж, бодит хэрэглэгчийн өгөгдөл цугларсны дараа хөгжүүлэгчид модерацын шийдлээ дараагийн түвшинд хүргэхийн тулд зорилтот нарийн тохируулгыг ашиглаж эхлэх боломжтой.

Эцсийн бодол

gpt-oss-safeguard зэрэг суурь модерацын загварууд бол хүчирхэг шинэ бүрэлдэхүүн хэсгүүд юм. Эдгээр нь бодит цагийн хэрэглээний саатлыг бууруулахын зэрэгцээ модерацын системийн загварыг мэдэгдэхүйц хялбарчлах боломжтой. Тэдгээрийг зориулалтын жижиг ангилагчтай хослуулснаар ерөнхий зориулалтын том загварт өгөгдөл ашигладаг аргаас цөөн бүрэлдэхүүн хэсэгтэй, илүү аюулгүй, хурдан систем бүтээж болно.

Хэрэв та өнөөдөр модерацын систем шинээр нэвтрүүлж эсвэл шинэчилж байгаа бол эхлээд gpt-oss-safeguard зэрэг загварыг ашиглан гүйцэтгэлийг хэмжээд, өгөгдлөөр дутагдал илэрсэн хэсэгт зориулалтын ангилагчийн зорилтот сайжруулалтыг (өгөгдөлд суурилсан эсвэл нарийн тохируулсан) нэвтрүүлээрэй.

Илүү ихийг мэдмээр байна уу? Бидэнд зурвас илгээнэ үү.

Зохиогч

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke