Οι δημόσια προσβάσιμες εφαρμογές Μεγάλων Γλωσσικών Μοντέλων (LLM) μπορούν να εκθέσουν τις επωνυμίες σε κινδύνους για τη φήμη και τα οικονομικά τους.
Χρησιμοποιούμε πολυεπίπεδα φίλτρα ταξινόμησης για να περιορίσουμε τη βλάβη από επιθέσεις παράκαμψης δικλίδων ασφαλείας σε LLM και άλλες ακούσιες συμπεριφορές των LLM.
Εφαρμόσαμε αυτήν την προσέγγιση σε μια εφαρμογή παραγωγής μεγάλου όγκου, η οποία διαχειρίζεται 40.000 μηνύματα ημερησίως —και ο αριθμός αυξάνεται.
Τον τελευταίο χρόνο συνεργαστήκαμε με μια κορυφαία εταιρεία ανάπτυξης παιχνιδιών για να θέσουμε σε λειτουργία ένα chatbot GenAI, το οποίο διαχειρίζεται περίπου 40.000 μηνύματα την ημέρα από μια βάση παικτών που περιλαμβάνει και παιδιά. Η ισορροπία ανάμεσα στην ταχύτητα, την ακρίβεια, την ασφάλεια και τη διασκέδαση είναι απαραίτητη:
Όταν δημιουργείτε ένα chatbot που εκπροσωπεί την επωνυμία σας, δεν αρκεί να είναι ασφαλές· πρέπει να εκφράζει αυθεντικά τη δική σας ταυτότητα.
Για μια εταιρεία παιχνιδιών, αυτό σημαίνει συνδυασμό της ασφάλειας με τη διασκέδαση και τον ενθουσιασμό των χρηστών —ιδίως του νεότερου κοινού.
Τα LLM στα οποία βασίζονται οι σύγχρονες εφαρμογές GenAI είναι πολύ ευέλικτα —γι’ αυτό και γενικεύουν τόσο καλά σε πολλά προβλήματα— αλλά δεν υπόκεινται σε επαρκείς περιορισμούς. Αυτό σημαίνει ότι συχνά μπορούν να παρεκκλίνουν και να επιστρέψουν κείμενα πολύ διαφορετικού τύπου, ορισμένα από τα οποία ενδέχεται να είναι ακατάλληλα.
Η άμεση διάθεση ενός LLM στο κοινό θα οδηγήσει αναπόφευκτα σε απρόβλεπτη συμπεριφορά και, χωρίς κατάλληλα μέτρα περιορισμού, ενέχει τον κίνδυνο:
«Επιθέσεων παράκαμψης δικλίδων ασφαλείας», κατά τις οποίες οι χρήστες χειραγωγούν σκόπιμα το chatbot ώστε να παράγει επιβλαβές ή μη επιτρεπόμενο περιεχόμενο (μια διασκεδαστική λεπτομέρεια: σε αυτόν τον ιστότοπο οποιοσδήποτε μπορεί να εξερευνήσει την παράκαμψη δικλίδων ασφαλείας των LLM μέσα από ένα παιχνίδι…)· ή
Ακούσιας παροχής κακόγουστου, προσβλητικού ή επικίνδυνου περιεχομένου. Σε πολλές περιπτώσεις, αυτό μπορεί να θέσει σε κίνδυνο την ευημερία των χρηστών ή να προκαλέσει οικονομική ζημιά και βλάβη στη φήμη του παρόχου της εφαρμογής.
Τίτλοι ειδήσεων για ακούσιες χρήσεις LLM:
Αυτά τα περιστατικά υπογραμμίζουν γιατί η δημιουργία και η διατήρηση της ασφάλειας στα συστήματα GenAI δεν είναι προαιρετική. Αυτό ισχύει ιδιαίτερα όταν εμπλέκονται μικρά παιδιά: δεν αρκούν οι αποποιήσεις ευθύνης· απαιτούνται ισχυρές δικλίδες προστασίας ώστε το περιεχόμενο να παραμένει κατάλληλο.
Όπως και στα συστήματα RAG (παραγωγή επαυξημένη με ανάκτηση) που έχουμε δημιουργήσει για πελάτες, αξιοποιούμε πολλαπλά στοιχεία ΤΝ για να περιορίσουμε τους κινδύνους από επιθέσεις παράκαμψης δικλίδων ασφαλείας, διατηρώντας παράλληλα υψηλές επιδόσεις.


Απλουστευμένο διάγραμμα της αρχιτεκτονικής του συστήματός μας
Για την ασφάλεια του συστήματος, χρησιμοποιούμε ταξινομητές LLM τόσο στις εισόδους όσο και στις εξόδους:
Ταξινόμηση εισόδου (εκτελείται παράλληλα)
Χρησιμοποιήσαμε σχήματα Pydantic μαζί με δομημένα αποτελέσματα LLM για να επισημαίνουμε τα ερωτήματα των χρηστών (π.χ. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT κ.λπ.). Περιλαμβάνονταν επίσης ενδείξεις για τον εντοπισμό επιθέσεων παράκαμψης δικλίδων ασφαλείας ή μη επιτρεπόμενης συμπεριφοράς.
Η χρήση πολλαπλών ταξινομητών για επιμέρους θέματα απέδωσε σημαντικά καλύτερα από έναν τεράστιο ταξινομητή «για τα πάντα».
Η εκτεταμένη χρήση παραδειγμάτων με λίγα παραδείγματα (few-shot) ήταν καθοριστική, ώστε οι ταξινομητές να διακρίνουν το «I keep being killed by this character» (αναφορά στο παιχνίδι) από το «I am being hurt by my parent» (ένδειξη κακοποίησης παιδιού).
Η στενή συνεργασία με τον πελάτη και τις εξειδικευμένες ομάδες εμπιστοσύνης και ασφάλειάς του διασφάλισε ότι οι ταξινομητές μας αντανακλούσαν τον τρόπο με τον οποίο θα αξιολογούσαν μηνύματα υψηλού κινδύνου στην πράξη.


Παραγωγή απάντησης
Το κύριο LLM παράγει απάντηση εφόσον η είσοδος κριθεί ασφαλής.
Διαφορετικά, το μήνυμα μπορεί να αγνοηθεί —αν πρόκειται για επίθεση παράκαμψης δικλίδων ασφαλείας— ή να παραπεμφθεί σε άνθρωπο, αν το ερώτημα επισημαίνει ζήτημα ασφάλειας.
Ταξινόμηση εξόδου
Προτού η απάντηση φύγει από την εφαρμογή μας για την τελική παράδοση, ταξινομούμε την απόκριση του μοντέλου.
Επειδή ορισμένες απαντήσεις μπορεί να χρησιμοποιούν τεχνικές RAG με δεδομένα που έχουν συλλεχθεί από το διαδίκτυο, αυτό το βήμα μάς προστατεύει από τη δηλητηρίαση δεδομένων.
Αν η απάντηση περιέχει μη επιτρεπόμενο περιεχόμενο, το σύστημα παρεμβαίνει και την αντικαθιστά με ένα γενικό μήνυμα. Στην πράξη αυτό συμβαίνει σπάνια, αλλά λειτουργεί ως πρόσθετο προληπτικό επίπεδο που διασφαλίζει ότι η συμπεριφορά του πράκτορα παραμένει κατάλληλη.
Για να διατηρήσουμε την ταχύτητα και το προσιτό κόστος:
Αποθηκεύουμε συχνά χρησιμοποιούμενες προτροπές και τμήματα διαλόγων, μαζί με ένα επιμελημένο σύνολο παραδειγμάτων με λίγα παραδείγματα (few-shot).
Αυτή η προσωρινή αποθήκευση μάς επιτρέπει να εφαρμόζουμε τους ταξινομητές LLM γρήγορα και οικονομικά, χωρίς να χρειάζεται να αναδημιουργούμε κάθε φορά το πλαίσιο.


Πρόσφατη μελέτη της Anthropic περιέγραψε τους Συνταγματικούς Ταξινομητές —ένα σύστημα που βασίζεται σε πρόσθετους ταξινομητές, εκπαιδευμένους με «συνταγματικούς» κανόνες, για τον εντοπισμό κακόβουλων ή μη ασφαλών αιτημάτων. Ανέφεραν:
Υψηλή ανθεκτικότητα σε χιλιάδες ώρες ανθρώπινου αντιπαραθετικού ελέγχου ασφαλείας (red teaming).
Ελάχιστα ποσοστά υπερβολικής απόρριψης και μέτρια υπολογιστική επιβάρυνση.
Οραματιζόμαστε ένα μέλλον στο οποίο αυτές οι συνταγματικές προσεγγίσεις θα μπορούν να συμπληρώνουν ή ακόμη και να αντικαθιστούν τα παραδοσιακά επίπεδα ταξινόμησης, προσφέροντας πληρέστερη άμυνα απέναντι στις εξελισσόμενες τακτικές παράκαμψης δικλίδων ασφαλείας.
Παράλληλα, ελαφριά φίλτρα
Τα επίπεδα ταξινόμησης εμποδίζουν τα κακόβουλα ερωτήματα να φτάσουν στον πυρήνα παραγωγής και διασφαλίζουν ότι οι προβληματικές έξοδοι δεν παραδίδονται ποτέ.
Η εμπειρία χρήστη έχει σημασία
Όταν οι προειδοποιήσεις και οι παιχνιδιάρικες αρνήσεις είναι διασκεδαστικές και βασίζονται στον κόσμο του παιχνιδιού, οι χρήστες αποδέχονται ευκολότερα τους περιορισμούς του συστήματος.
Μην κάνετε εκπτώσεις στις δοκιμές και την παρακολούθηση
Ο τακτικός αντιπαραθετικός έλεγχος ασφαλείας (red teaming), μαζί με τη συχνή παρακολούθηση της συμπεριφοράς των παικτών, βοηθά στον εντοπισμό ευπαθειών πριν γίνουν γνωστές στην ευρύτερη κοινότητα των παικτών. Στη συνέχεια, αυτές μπορούν να ενσωματωθούν ξανά στις προτροπές των ταξινομητών με λίγα παραδείγματα (few-shot), ώστε να αποτρέπεται η μελλοντική αξιοποίησή τους. Προς το παρόν πρόκειται για μη αυτόματη διαδικασία, η οποία όμως θα μπορούσε να αυτοματοποιηθεί.
Είτε είστε εταιρεία παιχνιδιών, τράπεζα ή ακόμη και κρατική υπηρεσία, αν πρόκειται να εφαρμόσετε ένα chatbot εξυπηρέτησης πελατών σε μεγάλη κλίμακα, πρέπει να στοχεύετε ΚΑΙ στον σωστό σχεδιασμό της εμπειρίας χρήστη ΚΑΙ στην αξιοπιστία.
Δημιουργούμε λύσεις για πελάτες οργανισμών και επωνυμιών όπου:
Η ασφάλεια είναι ύψιστης σημασίας —chatbot που προσφέρουν αξία, προστατεύοντας αυστηρά τους χρήστες από επιβλαβές περιεχόμενο
Η φήμη προστατεύεται —σχεδιάζουμε πολλαπλά επίπεδα προστασίας που διαφυλάσσουν τη φήμη της επωνυμίας, ακόμη και αν οι χρήστες προσπαθήσουν να ωθήσουν το σύστημα πέρα από τα όριά του
Οι κανονισμοί περιορίζουν τις επιλογές σας —παρακολουθούμε τις πιο πρόσφατες οδηγίες συμμόρφωσης, ώστε να μπορείτε να επεκτείνετε τις λύσεις σας χωρίς να ανησυχείτε για επιθέσεις παράκαμψης των δικλίδων ασφαλείας της εφαρμογής σας