Τι σημαίνουν τα μοντέλα gpt-oss-safeguard της OpenAI για την ασφάλεια της AI

Η πρώτη αξιολόγηση των μοντέλων gpt-oss-safeguard της OpenAI δείχνει πώς εξειδικευμένα μοντέλα ασφάλειας μπορούν να ενισχύσουν παραγωγικά συστήματα AI.

Τα τελευταία δύο χρόνια δημιουργήσαμε λύσεις που κλιμακώθηκαν με ασφάλεια για να εξυπηρετήσουν εκατομμύρια χρήστες. Βασικό μέρος αυτής της προσπάθειας ήταν ο σχεδιασμός γρήγορων και ακριβών συστημάτων εποπτείας. Η αποτελεσματική εποπτεία επιτρέπει στις εταιρείες να διαθέτουν με σιγουριά πρωτοποριακές λύσεις AI, προστατεύοντας τους τελικούς χρήστες από βλάβες και τη φήμη της επωνυμίας, καθώς εντοπίζει ανεπιθύμητο παραγόμενο περιεχόμενο προτού δημιουργήσει προβλήματα.

Πρόσφατα, η OpenAI κυκλοφόρησε τα μοντέλα GPT-OSS-Safeguard: προσαρμοσμένες εκδόσεις των μοντέλων OSS 20B και 120B που παρουσιάστηκαν νωρίτερα φέτος. Αυτά τα μοντέλα μπορούν να ερμηνεύουν την πολιτική ενός χρήστη απευθείας κατά την εξαγωγή συμπερασμάτων, προσφέροντας μια ευέλικτη και ισχυρή προσέγγιση στην εποπτεία περιεχομένου. Τα μοντέλα βρίσκονται σε ερευνητική προεπισκόπηση, επομένως αναμφίβολα θα συνεχίσουν να βελτιώνονται με την πάροδο του χρόνου.

Συνεργαστήκαμε με την OpenAI πριν από αυτή την κυκλοφορία, πραγματοποιώντας αξιολογήσεις σε πραγματικές συνθήκες που συνέβαλαν στην ανάπτυξη των μοντέλων. Σε αυτό το άρθρο μοιραζόμαστε τα συμπεράσματα από τη συνεργασία και εξετάζουμε τι σημαίνουν αυτές οι εξελίξεις για το μέλλον της εποπτείας σε παραγωγικά συστήματα AI.

Πώς λειτουργεί σήμερα η εποπτεία σε περιβάλλοντα παραγωγής;

Σήμερα, οι λύσεις εποπτείας διαμορφώνονται συνήθως ως επίπεδα προστασίας γύρω από την εφαρμογή. Χρησιμοποιούμε ευρέως αυτό το μοτίβο σε δημόσιες υλοποιήσεις μεγάλης κλίμακας. Για μια αναλυτικότερη παρουσίαση, διαβάστε το σχετικό ιστολόγιό μας εδώ.

  1. Ταξινομήστε παράλληλα τις εισόδους (μην αφήνετε να περνούν κακόβουλες προτροπές): Μικροί ταξινομητές για συγκεκριμένα θέματα λειτουργούν ταυτόχρονα και επισημαίνουν κάθε μήνυμα χρήστη. Έχουμε διαπιστώσει ότι οι ταξινομητές με στενή εστίαση είναι αποδεδειγμένα πιο αξιόπιστοι από έναν ενιαίο ταξινομητή γενικής χρήσης. Προσεκτικά επιλεγμένα παραδείγματα με λίγα παραδείγματα (few-shot) στην προτροπή μπορούν να βοηθήσουν το σύστημα να διακρίνει το «I keep getting killed by this boss» (πλαίσιο παιχνιδιού, εντελώς ακίνδυνο) από μια πραγματική ένδειξη κινδύνου.

    • Ασφαλές → Κανονική δημιουργία απάντησης

    • Επιθέσεις παράκαμψης δικλίδων ασφαλείας → Αγνόηση ή αποτροπή με άρνηση που ταιριάζει στην επωνυμία

    • Κίνδυνοι για την ασφάλεια ή την ευημερία → παραπομπή σε άνθρωπο με αναλυτικό πλαίσιο

  2. Ταξινομήστε τις εξόδους (μην παραδίδετε προβληματικές απαντήσεις): Κάθε υποψήφια απάντηση ελέγχεται ξανά πριν παραδοθεί. Έτσι παρέχεται προστασία από την απόκλιση του μοντέλου, τη δηλητηρίαση δεδομένων RAG και λεπτές οριακές περιπτώσεις πολιτικής, όπως επιβλαβές περιεχόμενο, έκθεση PII ή διαρροή ευαίσθητων πληροφοριών. Αν επισημανθεί, αντικαθιστούμε την απάντηση που δημιούργησε το LLM με ένα ασφαλές μήνυμα ευθυγραμμισμένο με την επωνυμία ή την παραπέμπουμε σε άνθρωπο, αντί να παραδώσουμε κάτι για το οποίο θα μετανιώσουμε.

  3. Εξασφαλίστε ταχύτητα και προσιτό κόστος: Η δημιουργία προτροπών ως επαναχρησιμοποιήσιμων δομικών στοιχείων σάς επιτρέπει να αποθηκεύετε προσωρινά τμήματα προτροπών, παραδείγματα ταξινομητών με λίγα παραδείγματα (few-shot) και συνήθη προθέματα διαλόγου. Αυτή η προσέγγιση μειώνει τόσο την καθυστέρηση όσο και το κόστος των μηχανισμών προστασίας σας.

  4. Αντιμετωπίστε την ασφάλεια ως μέρος του προϊόντοςΟι αρνήσεις και οι προειδοποιήσεις γράφονται στο ύφος της εφαρμογής (π.χ. παιχνιδιάρικο για παιχνίδια, επίσημο για χρηματοοικονομικές υπηρεσίες). Όταν η εμπειρία χρήστη σέβεται την πρόθεση του χρήστη, αυξάνεται η αποδοχή των μηχανισμών προστασίας και μειώνονται οι απόπειρες παράκαμψης των δικλίδων ασφαλείας

  5. Παρακολουθήστε, διενεργήστε αντιπαραθετικούς ελέγχους και αξιοποιήστε την ανατροφοδότησηΟ συνεχής αντιπαραθετικός έλεγχος ασφαλείας (red teaming) και οι ζωντανοί πίνακες ελέγχου ασφάλειας βοηθούν στον εντοπισμό υποτροπών προτού επηρεάσουν τους χρήστες. Μπορούμε να εκπαιδεύσουμε το μοντέλο σε κάθε νέο μοτίβο επίθεσης, παρέχοντας πρόσθετα παραδείγματα με λίγα παραδείγματα (few-shot) ή/και κανόνες δρομολόγησης, ώστε το σύστημα να γίνεται σταδιακά δυσκολότερο να παραβιαστεί χωρίς να υποβαθμίζεται η απόδοση της εφαρμογής.

Οι σημερινές προκλήσεις στη δημιουργία μιας λύσης εποπτείας

Η δημιουργία και η συντήρηση αποτελεσματικών μηχανισμών προστασίας είναι δύσκολη.

Στην πράξη, απαιτείται στενή συνεργασία μεταξύ των βασικών επιχειρηματικών ενδιαφερόμενων μερών και των προγραμματιστών για τη διαμόρφωση μιας σαφώς καθορισμένης πολιτικής. Αφού καθοριστεί η πολιτική, πρέπει να σχεδιαστούν και να ρυθμιστούν η αρχιτεκτονική και η συμπεριφορά του συστήματος.

Η εμφάνιση ανοικτών μοντέλων συλλογιστικής για την ασφάλεια, όπως το gpt-oss-safeguard, μπορεί να επιλύσει ορισμένα από τα προβλήματα αυτής της διαδικασίας, προσφέροντας μια πιο εύχρηστη και ευέλικτη βάση για την εποπτεία περιεχομένου.

Οι δυνατότητες των εξειδικευμένων μοντέλων ασφάλειας

Το Gpt-oss-safeguard στοχεύει να αντιμετωπίσει ορισμένες από τις συνήθεις προκλήσεις κατά τη δημιουργία σύγχρονων συστημάτων εποπτείας. Αυτά τα μικρά, εξειδικευμένα μοντέλα έχουν προσαρμοστεί ώστε να εφαρμόζουν συλλογιστική σε μια πολιτική-στόχο κατά την εξαγωγή συμπερασμάτων, αναζητώντας επιβλαβές ή ευαίσθητο περιεχόμενο, όπως επιθέσεις παράκαμψης δικλίδων ασφαλείας, έκθεση PII και άλλες παραβιάσεις πολιτικής.

Ενσωματώνοντας τη συλλογιστική στη διαδικασία ταξινόμησης, παρέχουν ακριβέστερη και ανθεκτικότερη εποπτεία, την οποία είναι δυσκολότερο να παρακάμψει κανείς. Ως εξειδικευμένες παραλλαγές ασφάλειας των GPT-OSS 20B και 120B, προσφέρουν κορυφαίες επιδόσεις ασφάλειας, ενώ απαιτούν ελάχιστη αρχική ρύθμιση χάρη στους προσαρμοσμένους ορισμούς πολιτικής.

Τι δοκιμάσαμε

Αξιολογήσαμε τα gpt-oss-safeguard 20B και 120B σε διάφορες εργασίες που προσομοιώνουν συνθήκες παραγωγής: έναν φωνητικό βοηθό πραγματικού χρόνου, ένα bot υποστήριξης παικτών εντός παιχνιδιού, ένα σύστημα προληπτικής εποπτείας συνομιλιών και έναν πολύγλωσσο έλεγχο τοξικότητας (ισπανικά, γαλλικά, ιταλικά, πορτογαλικά, ρωσικά και τουρκικά).

Τι διαπιστώσαμε

  • Φωνητική εποπτεία με αυστηρές απαιτήσεις καθυστέρησης: Στις δοκιμές φωνής πραγματικού χρόνου —δηλαδή ζωντανή ταξινόμηση μέσα σε μια συνομιλία, όπου μια απάντηση πρέπει να αναλυθεί και να διαβαθμιστεί, όπως στην εποπτεία συνομιλιών παιχνιδιού— το gpt-oss-safeguard-20B κάλυψε περίπου το 80% του χάσματος ακρίβειας μεταξύ GPT-OSS-20B και GPT-5-Mini (0,71 έναντι 0,78, από 0,45), με πολύ μικρότερη καθυστέρηση.

  • Παραπομπή υποστήριξης παικτών: Στη διαβάθμιση αιτημάτων υποστήριξης παικτών, το gpt-oss-safeguard-20B κάλυψε περίπου το 90% του χάσματος μεταξύ GPT-OSS-20b και GPT-5-Mini (0,66 έναντι 0,67, από 0,57). Πέτυχε επίσης την καλύτερη μακρο-ακρίβεια του συνόλου, ανάκληση 88% σε ακίνδυνο περιεχόμενο και ακρίβεια 87% στον εντοπισμό ευάλωτων χρηστών — χρήσιμο για συντηρητικές παραπομπές υψηλής αξιοπιστίας, χωρίς να κατακλύζονται οι άνθρωποι-αξιολογητές.

  • Εποπτεία συνομιλιών βάσει σύνθετων πολιτικών σε μεγάλη κλίμακα: Στην πιο απαιτητική αξιολόγησή μας, όπου ένα σύστημα εποπτείας πρέπει να επισημαίνει προληπτικά μηνύματα εντός παιχνιδιού βάσει ενός εκτενούς εγγράφου πολιτικής, το gpt-oss-safeguard ξεπέρασε σαφώς τη βασική έκδοση OSS, πετυχαίνοντας σχετική βελτίωση περίπου 35% και διαχειριζόμενο αποτελεσματικά μεγάλες πολιτικές. Πρόκειται για μια ιδιαίτερα ευαίσθητη περίπτωση χρήσης που απαιτεί υψηλή ανάκληση και ακρίβεια. Αν η ανάκληση είναι πολύ χαμηλή, πολλά επιβλαβή μηνύματα δεν θα εντοπιστούν. Η χαμηλή ακρίβεια θα οδηγούσε επίσης στην επισήμανση πολλών άσχετων μηνυμάτων προς τους ανθρώπους-επόπτες, αποσπώντας την προσοχή τους από τις πραγματικά δύσκολες περιπτώσεις.

  • Πολύγλωσση απόδοση: Σε ένα ισορροπημένο σύνολο δεδομένων τοξικότητας έξι γλωσσών, το gpt-oss-safeguard κινήθηκε κοντά στο GPT-5-Mini, συνήθως με διαφορά 3–5 ποσοστιαίων μονάδων στην ακρίβεια, ενώ το gpt-oss-safeguard-120B είχε μικρό προβάδισμα στα ισπανικά. Παρατηρήσαμε ελαφρώς μεγαλύτερες αποκλίσεις σε γλώσσες με λιγότερους διαθέσιμους πόρους, όπως τα τουρκικά. Ωστόσο, η συνολική εικόνα έδειξε σταθερή διαγλωσσική απόδοση και συνεπή βελτίωση της ανάκλησης κατά τη μετάβαση από το 20B στο 120B.

Παρατηρήσαμε επίσης ότι τα μοντέλα gpt-oss-safeguard αποδίδουν καλά σε τομείς όπου τα LLM είναι παραδοσιακά ασθενέστερα στην εποπτεία, όπως τα δεδομένα PII. Τα ευρέως χρησιμοποιούμενα μοντέλα τείνουν να εντοπίζουν ευκολότερα δεδομένα PII αμερικανικού τύπου και να αποδίδουν χειρότερα σε άλλες γεωγραφικές περιοχές. Με βάση αυτά, πιστεύουμε ότι το gpt-oss-safeguard θα συμβάλει στην απλοποίηση των διαμορφώσεων εποπτείας, μειώνοντας την εξάρτηση από ειδικά σχεδιασμένα εργαλεία για τον εντοπισμό μικρών παραβιάσεων πολιτικής που τα ευρύτερα LLM δεν μπορούν να διαχειριστούν.

Η δύναμη της στοχευμένης προσαρμογής

Οι αξιολογήσεις μας, λοιπόν, επιβεβαίωσαν ότι τα «θεμελιώδη μοντέλα εποπτείας», όπως τα gpt-oss-safeguard-20B και gpt-oss-safeguard-120B, μπορούν να σας πάνε γρήγορα και μακριά. Ωστόσο, οι προσαρμογές για συγκεκριμένους τομείς εξακολουθούν να αποτελούν το πρότυπο αναφοράς όταν τα συστήματα απαιτούν τα υψηλότερα επίπεδα ασφάλειας και εξειδίκευσης.

Στιγμιότυπο οθόνης που απεικονίζει τη δύναμη της στοχευμένης προσαρμογής.

Για την περίπτωση εποπτείας εντός παιχνιδιού, προσαρμόσαμε έναν ταξινομητή Qwen3-0.6B μέσω προσαρμογής με επίβλεψη, χρησιμοποιώντας περίπου 10 χιλ. ιστορικές ενέργειες επόπτευσης και αποτελέσματα εφαρμογής πολιτικών. Αυτό το μοντέλο υπερτερεί με μεγάλη διαφορά από κάθε βασικό μοντέλο που δοκιμάσαμε σε αυτή την εργασία, επιτυγχάνοντας ακρίβεια 57% έναντι 15% (gpt-oss-safeguard-120B, εκτίμηση βάσει της αναλογίας απόδοσης του GPT-4.1-nano), δηλαδή αύξηση κατά 42 ποσοστιαίες μονάδες ή περίπου 280%. Αυτά τα αποτελέσματα συνάδουν με την καθοδήγηση της OpenAI ότι μικρότεροι, εξειδικευμένοι ταξινομητές, εκπαιδευμένοι με επισημασμένα παραδείγματα, μπορούν να υπερτερούν των μοντέλων προστασίας σε εξειδικευμένους τομείς.

Το συμπέρασμα είναι σαφές: όταν οι πολιτικές έχουν πολλές αποχρώσεις και οριακές περιπτώσεις, ένα μικρό μοντέλο προσαρμοσμένο στον εκάστοτε τομέα παραμένει η βέλτιστη επιλογή. Η διαδικασία προσαρμογής ενσωματώνει την πολιτική και τις οριακές περιπτώσεις σας απευθείας στις παραμέτρους, εξασφαλίζοντας πιο σταθερή συμπεριφορά στις απρόβλεπτες συνθήκες της παραγωγής, με ελάχιστη καθυστέρηση και κόστος.

Η προσαρμογή με επίβλεψη είναι μόνο μία από τις πολλές πιθανές προσεγγίσεις. Μπορούν επίσης να αξιοποιηθούν άλλες ισχυρές τεχνικές εκπαίδευσης, όπως η ενισχυτική μάθηση ή η απόσταξη εντός πολιτικής, για την περαιτέρω βελτιστοποίηση της συμπεριφοράς του μοντέλου.

Η επιφύλαξη σχετικά με την προσαρμογή

Η προσαρμογή απαιτεί συνήθως μεγάλο όγκο δεδομένων. Το σύνολο δεδομένων που χρησιμοποιήθηκε για την προσαρμογή αυτού του ταξινομητή Qwen3-0.6B είχε επισημανθεί χειροκίνητα από ανθρώπους-επόπτες και, ως εκ τούτου, αποτελούσε μια καθαρή και αξιόπιστη πηγή αναφοράς.

Σε πολλά έργα, αυτό το πλεονέκτημα των πλούσιων δεδομένων ενδέχεται να μην υπάρχει εξαρχής. Γι’ αυτό θεωρούμε συνήθως την προσαρμογή ως βελτιστοποίηση που μπορεί να εφαρμοστεί αργότερα στον κύκλο ανάπτυξης μιας λύσης. Αφού σταθεροποιηθεί η μορφή της λύσης και συγκεντρωθούν πραγματικά δεδομένα χρηστών, οι προγραμματιστές μπορούν να αξιοποιήσουν τη στοχευμένη προσαρμογή για να αναβαθμίσουν περαιτέρω τις λύσεις εποπτείας τους.

Τελικές σκέψεις

Τα θεμελιώδη μοντέλα εποπτείας, όπως το gpt-oss-safeguard, αποτελούν ισχυρά νέα δομικά στοιχεία. Μπορούν να απλοποιήσουν ουσιαστικά τον σχεδιασμό συστημάτων εποπτείας, μειώνοντας παράλληλα την καθυστέρηση σε εφαρμογές πραγματικού χρόνου. Συνδυάζοντάς τα με μικρούς, ειδικά σχεδιασμένους ταξινομητές, μπορείτε να δημιουργήσετε ένα ασφαλέστερο και ταχύτερο σύστημα, με λιγότερα επιμέρους στοιχεία από μια προσέγγιση που βασίζεται σε προτροπές και μεγάλα μοντέλα γενικού σκοπού.

Αν δημιουργείτε ή αναβαθμίζετε σήμερα ένα σύστημα εποπτείας, εξετάστε το ενδεχόμενο να ξεκινήσετε με μοντέλα όπως το gpt-oss-safeguard, να μετρήσετε την απόδοση και να προσθέσετε στοχευμένες βελτιώσεις με ειδικά σχεδιασμένους ταξινομητές —βασισμένους σε προτροπές ή προσαρμοσμένους— όπου τα δεδομένα αποκαλύπτουν κενά.

Θέλετε να μάθετε περισσότερα; Στείλτε μας μήνυμα.

Συντάκτης

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke