ძირითადი ნავიგაცია

რას ნიშნავს OpenAI-ის gpt-oss-safeguard მოდელები AI უსაფრთხოებისთვის

OpenAI-ის gpt-oss-safeguard მოდელების ადრეული შეფასება აჩვენებს, სად შეუძლიათ სპეციალიზებულ უსაფრთხოების მოდელებს საწარმოო AI სისტემების გაძლიერება.

ბოლო ორი წლის განმავლობაში შევქმენით გადაწყვეტილებები, რომლებიც უსაფრთხოდ გაფართოვდა მილიონობით მომხმარებლის მომსახურებამდე. ამ სამუშაოს მნიშვნელოვანი ნაწილი სწრაფი და ზუსტი მოდერაციის სისტემების შექმნა იყო. ეფექტიანი მოდერაცია კომპანიებს საშუალებას აძლევს, უახლესი AI გადაწყვეტილებები თავდაჯერებით დანერგონ, საბოლოო მომხმარებლები ზიანისგან დაიცვან და არასასურველი გენერირებული მასალა პრობლემად ქცევამდე გამოავლინონ, რითაც ბრენდის უსაფრთხოებას უზრუნველყოფენ.

ახლახან OpenAI-მა გამოუშვა GPT-OSS-Safeguard მოდელები: მიმდინარე წლის დასაწყისში წარმოდგენილი 20B და 120B OSS მოდელების დახვეწილი ვერსიები. ამ მოდელებს დასკვნის გამოტანისას მომხმარებლის პოლიტიკის უშუალოდ ინტერპრეტირება შეუძლიათ, რაც შიგთავსის მოდერაციის მოქნილ და მძლავრ მიდგომას გვთავაზობს. ეს მოდელები კვლევითი წინასწარი ვერსიის სახითაა ხელმისაწვდომი, ამიტომ დროთა განმავლობაში უდავოდ გაუმჯობესდება.

გამოშვებამდე OpenAI-სთან ვითანამშრომლეთ და მოდელის განვითარებისთვის რეალურ გარემოზე დაფუძნებული შეფასებები ჩავატარეთ. ამ სტატიაში გიზიარებთ თანამშრომლობისას მიღებულ მიგნებებს და განვიხილავთ, რას ნიშნავს ეს წინსვლა საწარმოო AI სისტემებში მოდერაციის მომავლისთვის.

როგორ მუშაობს მოდერაცია დღეს საწარმოო გარემოში?

დღეს მოდერაციის გადაწყვეტილებები, ჩვეულებრივ, აპლიკაციის გარშემო აგებული დაცვის შრეების სახეს იღებს. ამ მოდელს ხშირად ვიყენებთ დიდი დატვირთვის მქონე, საჯაროდ ხელმისაწვდომ სისტემებში. დეტალური ინფორმაციისთვის იხილეთ ჩვენი ბლოგი აქ.

  1. შეტანილი მონაცემები პარალელურად დაახარისხეთ (მავნე მოთხოვნები არ შეუშვათ): მცირე, კონკრეტულ თემებზე მორგებული კლასიფიკატორები ერთდროულად მუშაობს და მომხმარებლის თითოეულ შეტყობინებას მონიშნავს. ჩვენი დაკვირვებით, ვიწრო მიმართულებაზე ორიენტირებული კლასიფიკატორები გაზომვადად უფრო საიმედოა, ვიდრე ერთი უნივერსალური კლასიფიკატორი. მოთხოვნაში საგულდაგულოდ შერჩეული Few-shot სწავლების მაგალითები გვეხმარება განვასხვაოთ „I keep getting killed by this boss“ (თამაშის კონტექსტი, სრულიად უვნებელი) და რეალურ სამყაროში ზიანის მიმანიშნებელი სიგნალი.

    • უსაფრთხო → ჩვეულებრივ დააგენერირეთ

    • მწარმოებლის შეზღუდვების მოხსნის მცდელობები → უგულებელყავით ან ბრენდის სტილში შედგენილი უარით უპასუხეთ

    • უსაფრთხოების ან კეთილდღეობის რისკები → სრული კონტექსტით გადაეცით ადამიანს

  2. დაახარისხეთ შედეგები (ცუდი პასუხი არ გააგზავნოთ): მიწოდებამდე თითოეული სავარაუდო პასუხი ხელახლა მოწმდება. ეს გვიცავს მოდელის ქცევის გადახრისგან, RAG-ის მონაცემების მოწამვლისა და პოლიტიკის ისეთი რთული გამონაკლისებისგან, როგორიცაა მავნე შიგთავსი, პერსონალური საიდენტიფიკაციო ინფორმაციის (PII) გამჟღავნება ან კონფიდენციალური ინფორმაციის გაჟონვა. თუ პასუხი მოინიშნა, LLM-ის მიერ გენერირებულ პასუხს უსაფრთხო, ბრენდთან შესაბამისი შეტყობინებით ვცვლით ან ადამიანს გადავცემთ, ნაცვლად იმისა, რომ მოგვიანებით სანანებელი რამ გავაგზავნოთ.

  3. უზრუნველყავით სისწრაფე და ხელმისაწვდომი ფასი: მოთხოვნების მრავალჯერად საშენ კომპონენტებად აწყობა საშუალებას გაძლევთ, დააქეშოთ მოთხოვნის ფრაგმენტები, კლასიფიკატორის Few-shot სწავლების მაგალითები და დიალოგების გავრცელებული დასაწყისები. ეს მიდგომა თქვენი დამცავი მექანიზმების დაყოვნებასაც ამცირებს და ხარჯსაც.

  4. უსაფრთხოებას მოექეცით როგორც პროდუქტის ნაწილსუარები და გაფრთხილებები შესაბამისი სტილით იწერება (მაგალითად, თამაშებისთვის — ხალისიანად, ფინანსებისთვის — ოფიციალურად). როცა მომხმარებლის გამოცდილება მის განზრახვას ითვალისწინებს, დამცავი მექანიზმების მიმღებლობა იზრდება, ხოლო მწარმოებლის შეზღუდვების მოხსნის მცდელობები მცირდება.

  5. აწარმოეთ მონიტორინგი, შეტევითი ტესტირება (red teaming) და უკუკავშირის ციკლიუწყვეტი შეტევითი ტესტირება (red teaming) და უსაფრთხოების რეალურ დროში საინფორმაციო დაფები გვეხმარება, გაუარესება მომხმარებლებამდე მისვლამდე გამოვავლინოთ. დამატებითი Few-shot სწავლების მაგალითებისა და მარშრუტიზაციის წესების მიწოდებით მოდელს ნებისმიერი ახალი თავდასხმის ნიმუში შეგვიძლია ვასწავლოთ, რათა დროთა განმავლობაში სისტემის გატეხვა გართულდეს ისე, რომ აპლიკაციის წარმადობა არ დაზიანდეს.

დღეს მოდერაციის გადაწყვეტილების შექმნასთან დაკავშირებული გამოწვევები

ეფექტიანი დამცავი მექანიზმების შექმნა და შენარჩუნება რთულია.

პრაქტიკაში მკაფიო პოლიტიკის შესაქმნელად საჭიროა ბიზნესის მთავარ დაინტერესებულ მხარეებსა და დეველოპერებს შორის მჭიდრო თანამშრომლობა. პოლიტიკის განსაზღვრის შემდეგ კი საჭიროა სისტემის არქიტექტურისა და ქცევის შექმნა და გამართვა.

gpt-oss-safeguard-ის მსგავსი ღია უსაფრთხოების მსჯელობის მოდელების გამოჩენას შეუძლია ამ პროცესის ზოგიერთი სირთულე აღმოფხვრას და შიგთავსის მოდერაციისთვის უფრო მზა და მრავალმხრივი საფუძველი უზრუნველყოს.

სპეციალიზებული უსაფრთხოების მოდელების შესაძლებლობები

Gpt-oss-safeguard შექმნილია თანამედროვე მოდერაციის სისტემების აგებისას გავრცელებული ზოგიერთი გამოწვევის გადასაჭრელად. ეს მცირე, სპეციალიზებული მოდელები დახვეწილია, რათა დასკვნის გამოტანისას სამიზნე პოლიტიკაზე იმსჯელონ და აღმოაჩინონ მავნე ან მგრძნობიარე შიგთავსი, მათ შორის მწარმოებლის შეზღუდვების მოხსნის მცდელობები, PII-ის გამჟღავნება და პოლიტიკის სხვა დარღვევები.

კლასიფიკაციის პროცესში მსჯელობის ჩართვით ისინი უზრუნველყოფენ უფრო ზუსტ და მდგრად მოდერაციას, რომლის გვერდის ავლაც რთულია. როგორც GPT-OSS 20B-ისა და 120B-ის სპეციალიზებული უსაფრთხოების ვარიანტები, ისინი უსაფრთხოების უახლეს შედეგებს უზრუნველყოფენ, ხოლო მორგებული პოლიტიკის განსაზღვრების წყალობით გამართვისთვის მინიმალური ძალისხმევა სჭირდებათ.

რა გამოვცადეთ

gpt-oss-safeguard 20B და 120B საწარმოო გარემოსთან მიახლოებულ რამდენიმე ამოცანაზე შევაფასეთ: რეალურ დროში მომუშავე ხმოვან ასისტენტზე, თამაშში მოთამაშეთა მხარდაჭერის ბოტზე, პროაქტიულ ჩატის მოდერაციის სისტემასა და ტოქსიკურობის მრავალენოვან შემოწმებაზე (ესპანური, ფრანგული, იტალიური, პორტუგალიური, რუსული და თურქული).

რა აღმოვაჩინეთ

  • დაყოვნებისადმი მგრძნობიარე ხმოვანი მოდერაცია: რეალურ დროში ჩატარებულ ხმოვან ტესტებში — წარმოიდგინეთ საუბრის პროცესშივე კლასიფიკაცია, როცა პასუხი უნდა გაანალიზდეს და დახარისხდეს, როგორც თამაშის ჩატის მოდერაციისას — gpt-oss-safeguard-20B-მა GPT-OSS-20B-სა და GPT-5-Mini-ს შორის სიზუსტის სხვაობის დაახლოებით 80% აღმოფხვრა (0.71 და 0.78, საწყისი 0.45-დან), თანაც მნიშვნელოვნად ნაკლები დაყოვნებით მუშაობდა.

  • მოთამაშეთა მხარდაჭერის ესკალაცია: მოთამაშეთა მხარდაჭერის მოთხოვნების დახარისხებისას gpt-oss-safeguard-20B-მა GPT-OSS-20b-სა და GPT-5-Mini-ს შორის სხვაობის დაახლოებით 90% აღმოფხვრა (0.66 და 0.67, საწყისი 0.57-დან). მან ასევე აჩვენა ნაკრებში საუკეთესო მაკროსიზუსტე, უვნებელი შიგთავსის 88%-იანი სრულობა და მოწყვლადი მომხმარებლების გამოვლენის 87%-იანი სიზუსტე — ეს სასარგებლოა, როცა გჭირდებათ ფრთხილი, მაღალი ნდობის ესკალაციები ისე, რომ ადამიან შემფასებლებს ზედმეტი შეტყობინებები არ მიაწყდეს.

  • მრავალწესიანი ჩატის მოდერაცია მასშტაბურ გარემოში: ჩვენს ყველაზე რთულ შეფასებაში, სადაც მოდერაციის სისტემას წესებით დატვირთული დოკუმენტის მიხედვით თამაშის შეტყობინებების პროაქტიულად მონიშვნა მოეთხოვებოდა, gpt-oss-safeguard-მა აშკარად აჯობა OSS-ის საბაზისო მოდელს, დაახლოებით 35%-იანი ფარდობითი ზრდა აჩვენა და გრძელ პოლიტიკებსაც ეფექტიანად გაუმკლავდა. ეს განსაკუთრებით მგრძნობიარე გამოყენების სცენარია, რომელიც მაღალ სრულობასა და სიზუსტეს მოითხოვს. თუ სრულობა მეტისმეტად დაბალია, ბევრი მავნე შეტყობინება შეუმჩნეველი დარჩება. დაბალი სიზუსტე კი გამოიწვევს იმას, რომ ადამიან მოდერატორებს ბევრი შეუსაბამო შეტყობინება გადაეცემათ და მათი ყურადღება მართლაც რთულ შემთხვევებს მოაკლდება.

  • მრავალენოვანი მუშაობა: ექვს ენაზე დაბალანსებულ ტოქსიკურობის მონაცემთა ნაკრებზე gpt-oss-safeguard-ის შედეგები ახლოს იყო GPT-5-Mini-სთან — სიზუსტის სხვაობა, როგორც წესი, 3–5 პროცენტული პუნქტი იყო, ხოლო ესპანურში gpt-oss-safeguard-120B ოდნავ დაწინაურდა. შედარებით მცირე რესურსის მქონე ენებში, მაგალითად თურქულში, ოდნავ დიდი სხვაობა დავინახეთ, თუმცა საერთო სურათი სტაბილურ მრავალენოვან შედეგებს აჩვენებდა: 20B-დან 120B-ზე გადასვლისას სრულობა თანმიმდევრულად იზრდებოდა.

ასევე დავინახეთ, რომ gpt-oss-safeguard მოდელები ძლიერ შედეგებს აჩვენებს იმ სფეროებში, სადაც LLM-ები მოდერაციისას ტრადიციულად სუსტია, მაგალითად PII მონაცემებზე: ფართოდ გავრცელებული მოდელები ხშირად აშშ-ის ფორმატის PII მონაცემების ამოცნობისკენაა მიდრეკილი და სხვა რეგიონებში ნაკლებად ეფექტიანია. ამ შედეგებზე დაყრდნობით, მიგვაჩნია, რომ gpt-oss-safeguard გაამარტივებს მოდერაციის სისტემების გამართვას და შეამცირებს სპეციალურად შექმნილ ინსტრუმენტებზე დამოკიდებულებას პოლიტიკის იმ მცირე დარღვევების აღმოსაჩენად, რომლებსაც უფრო ზოგადი LLM-ები ვერ უმკლავდება.

მიზნობრივი დახვეწის ძალა

ჩვენმა შეფასებებმა აჩვენა, რომ „საბაზისო მოდერაციის მოდელები“, როგორიცაა gpt-oss-safeguard-20B და gpt-oss-safeguard-120B, სწრაფად მიგიყვანთ შორს. თუმცა, როცა სისტემებს უსაფრთხოებისა და სპეციფიკურობის უმაღლესი სტანდარტები მოეთხოვება, კონკრეტულ სფეროზე მორგებული დახვეწა კვლავ ეტალონად რჩება.

ეკრანის ანაბეჭდი, რომელიც მიზნობრივი დახვეწის ძალას ასახავს.

თამაშში მოდერაციის სცენარისთვის Qwen3-0.6B კლასიფიკატორი ზედამხედველობის ქვეშ დავხვეწეთ მოდერატორთა დაახლოებით 10 ათასი ისტორიული ქმედებისა და პოლიტიკის შედეგების გამოყენებით. ამ ამოცანაში ეს მოდელი მნიშვნელოვნად სჯობს ყველა ჩვენ მიერ გამოცდილი საბაზისო მოდელის შედეგს: მისი სიზუსტეა 57%, 15%-თან შედარებით (gpt-oss-safeguard-120B; შეფასება ეფუძნება GPT-4.1-nano-ს შედეგების თანაფარდობას), ანუ +42 პროცენტული პუნქტი და დაახლოებით 280%-იანი ზრდა. ეს შედეგები შეესაბამება OpenAI-ის მითითებას, რომ მონიშნულ მაგალითებზე გაწვრთნილ მცირე, სპეციალიზებულ კლასიფიკატორებს კონკრეტულ სფეროებში დამცავი მოდელების შედეგების გადაჭარბება შეუძლიათ.

დასკვნა ნათელია: როცა პოლიტიკა ნიუანსურია და ბევრი გამონაკლისი შემთხვევა აქვს, მცირე, კონკრეტულ სფეროზე მორგებული მოდელი კვლავ საუკეთესო სტანდარტია. დახვეწის პროცესში თქვენი პოლიტიკა და გამონაკლისი შემთხვევები უშუალოდ პარამეტრებში აისახება, რაც საწარმოო გარემოს უწესრიგო რეალობაში უფრო სტაბილურ ქცევას, მინიმალურ დაყოვნებასა და მცირე ხარჯს უზრუნველყოფს.

ზედამხედველობის ქვეშ დახვეწა ამისთვის შესაძლო რამდენიმე მიდგომიდან მხოლოდ ერთ-ერთია. მოდელის ქცევის შემდგომი ოპტიმიზაციისთვის შეიძლება სხვა მძლავრი სასწავლო მეთოდების გამოყენებაც, მათ შორის განმამტკიცებელი სწავლებისა და მიმდინარე პოლიტიკაზე დაფუძნებული დისტილაციის.

დახვეწის შეზღუდვა

დახვეწას, როგორც წესი, დიდი მოცულობის მონაცემები სჭირდება. Qwen3-0.6B კლასიფიკატორის დასახვეწად გამოყენებული მონაცემთა ნაკრები ადამიან მოდერატორთა მიერ ხელით იყო მონიშნული და, შესაბამისად, სანდო და სუფთა ჭეშმარიტების წყაროს წარმოადგენდა.

ბევრ პროექტს საწყის ეტაპზე ასეთი მდიდარი მონაცემების უპირატესობა არ აქვს. ამიტომ დახვეწას, ჩვეულებრივ, განვიხილავთ როგორც ოპტიმიზაციას, რომელიც გადაწყვეტილების განვითარების ციკლის მოგვიანებით ეტაპზე შეიძლება განხორციელდეს. როცა გადაწყვეტილების ფორმა დასტაბილურდება და რეალური მომხმარებლების გარკვეული მონაცემები შეგროვდება, დეველოპერებს შეუძლიათ მოდერაციის გადაწყვეტილებების შემდეგ დონეზე ასაყვანად მიზნობრივი დახვეწა გამოიყენონ.

დასკვნითი მოსაზრებები

gpt-oss-safeguard-ის მსგავსი საბაზისო მოდერაციის მოდელები მძლავრი ახალი საშენი კომპონენტებია. მათ შეუძლიათ მნიშვნელოვნად გაამარტივონ მოდერაციის სისტემების პროექტირება და ამავე დროს შეამცირონ დაყოვნება რეალურ დროში მომუშავე აპლიკაციებისთვის. მათი მცირე, სპეციალურად შექმნილ კლასიფიკატორებთან შეწყვილებით შეძლებთ ააგოთ უფრო უსაფრთხო და სწრაფი სისტემა, რომელსაც ნაკლები მოძრავი ნაწილი ექნება, ვიდრე დიდ ზოგად მოდელებზე და მოთხოვნებზე დაფუძნებულ მიდგომას.

თუ დღეს მოდერაციის სისტემას ქმნით ან აახლებთ, თავდაპირველად განიხილეთ gpt-oss-safeguard-ის მსგავსი მოდელები, გაზომეთ შედეგები და იქ, სადაც მონაცემები ხარვეზებს აჩვენებს, დაამატეთ მიზნობრივი გაუმჯობესებები სპეციალურად შექმნილი კლასიფიკატორებით — მოთხოვნებზე დაფუძნებული ან დახვეწილი.

გსურთ მეტის გაგება? მოგვწერეთ.

ავტორი

Douglas Adams, Romain Bourboulou, David Jasek და Atharva Tidke