Προς φακέλους τεκμηρίωσης ασφάλειας για την εκπαίδευση κορυφαίων μοντέλων ΤΝ
Πιστεύουμε ότι εισερχόμαστε σε μια νέα εποχή, στην οποία θα πρέπει να απαιτείται δομημένη τεκμηρίωση ασφάλειας πριν συνεχιστεί οποιοσδήποτε κύκλος εκπαίδευσης κορυφαίων μοντέλων με ενισχυτική μάθηση. Ιδανικά, αυτή η τεκμηρίωση θα έπρεπε να πληροί τις απαιτήσεις ενός «φακέλου τεκμηρίωσης ασφάλειας»: μιας ολοκληρωμένης, δομημένης και βασισμένης σε στοιχεία επιχειρηματολογίας για τον κίνδυνο, όπως αυτή που χρησιμοποιείται σε άλλους κλάδους όπου η ασφάλεια είναι κρίσιμη. Οι φάκελοι τεκμηρίωσης ασφάλειας αποτελούν έναν φιλόδοξο στόχο προς τον οποίο εργαζόμαστε. Αναγνωρίζουμε, ωστόσο, πόσο δύσκολο είναι να έχουν για τα μοντέλα ΤΝ την ίδια αυστηρότητα που έχουν στην αεροπορία ή την πυρηνική ενέργεια, λόγω της πολυπλοκότητας που αναδύεται σε κάθε νέο επίπεδο δυνατοτήτων της ΤΝ. Εργαζόμαστε πάνω σε ένα πλαίσιο για την κωδικοποίηση αυτών των πρακτικών.
Παρακάτω παρουσιάζουμε ορισμένες αρχικές κατευθυντήριες γραμμές που θεωρούμε ότι θα πρέπει να περιλαμβάνονται σε τέτοιους φακέλους τεκμηρίωσης ασφάλειας για την εκπαίδευση κορυφαίων μοντέλων ΤΝ. Αυτές οι βέλτιστες πρακτικές αποτυπώνουν όσα έχουμε μάθει μέχρι σήμερα και αναμένουμε να εξελιχθούν καθώς συνεχίζουμε να βελτιώνουμε τις εσωτερικές διαδικασίες μας για προσεκτική ανάπτυξη. Τις δημοσιεύουμε τώρα για να παρουσιάσουμε με διαφάνεια την τρέχουσα προσέγγισή μας και να προσκαλέσουμε την κοινότητα να μας στείλει σχόλια. Σημειώνουμε ότι το παρόν έγγραφο εστιάζει στην εκπαίδευση κορυφαίων μοντέλων με ενισχυτική μάθηση· η εσωτερική και εξωτερική χρήση απαιτεί να εξετάζεται ένα πολύ ευρύτερο σύνολο ιδιοτήτων ευθυγράμμισης.
Οι φάκελοι τεκμηρίωσης ασφάλειας θα πρέπει να καλύπτουν τρεις πτυχές της τεχνικής υποδομής: εκπαίδευση ευθυγράμμισης, περιορισμό και παρακολούθηση. Αυτά τα μέτρα βοηθούν να διασφαλιστεί ότι το μοντέλο δεν επιχειρεί μη ευθυγραμμισμένες ενέργειες και ότι, ακόμη κι αν το έκανε, θα δυσκολευόταν να παρακάμψει τον περιορισμό και η παρακολούθηση θα το εντόπιζε πριν προκληθεί βλάβη.
Ευθυγράμμιση μοντέλων: Η πρώτη γραμμή άμυνας θα πρέπει να είναι η εκπαίδευση των μοντέλων ώστε να είναι ευθυγραμμισμένα, δηλαδή να ενεργούν αξιόπιστα με τον τρόπο που επιδιώκουμε. Αυτό θα μπορούσε να περιλαμβάνει:
Περιβάλλοντα εκπαίδευσης και βαθμολόγηση: Μειώστε τον κίνδυνο ανάπτυξης μη ευθυγραμμισμένης συμπεριφοράς, αποτρέποντας τη θετική ενίσχυση της εκμετάλλευσης του μηχανισμού ανταμοιβής κατά την εκπαίδευση. Αυτό θα μπορούσε να περιλαμβάνει:
Αυτοματοποιημένοι έλεγχοι συνόλων δεδομένων: Χρησιμοποιήστε πράκτορες για τον εντοπισμό και τη διόρθωση ελαττωματικών περιβαλλόντων ενισχυτικής μάθησης, στα οποία μη ευθυγραμμισμένες ακολουθίες ενεργειών θα μπορούσαν να λαμβάνουν υψηλή ανταμοιβή μέσω εκμετάλλευσης αδυναμιών αντί της επιθυμητής συμπεριφοράς. Έτσι περιορίζονται οι ευκαιρίες ενίσχυσης της μη ευθυγράμμισης κατά την εκπαίδευση.
Έλεγχοι συνόλων δεδομένων από ανθρώπους: Συμπληρώστε τον αυτοματοποιημένο αντιπαραθετικό έλεγχο ασφαλείας (red teaming) με ανθρώπινη επισκόπηση και ποιοτικούς ελέγχους των συνόλων δεδομένων, για να εντοπίζετε ελαττωματικές εργασίες που θα μπορούσαν ακούσια να ενισχύουν μη ευθυγραμμισμένη συμπεριφορά.
Ρύθμιση βαθμολογητών: Ρυθμίστε τους βαθμολογητές ώστε να επιβάλλουν ποινές στις απόπειρες του μοντέλου να εκμεταλλευτεί αδυναμίες ή να παρακάμψει τους κανόνες των περιβαλλόντων ενισχυτικής μάθησης κατά την εκπαίδευση.
Ανάλυση προηγούμενων κύκλων εκπαίδευσης: Εφαρμόστε ταξινομητές σε ίχνη εκτέλεσης προηγούμενων πειραμάτων, για να επιβεβαιώνετε ότι οι βαθμολογητές λειτουργούν όπως προβλέπεται.
Μέτρηση ευθυγράμμισης: Εκτελέστε αξιολογήσεις που παρακολουθούν τις τάσεις μη ευθυγράμμισης του μοντέλου, για να μετράτε την αποτελεσματικότητα της εκπαίδευσης ευθυγράμμισης. Αυτό θα μπορούσε να περιλαμβάνει:
Αξιολογήσεις ευθυγράμμισης εκτός ζωντανής λειτουργίας: Εκτελέστε αξιολογήσεις ευθυγράμμισης κατά τους κύκλους εκπαίδευσης κορυφαίων μοντέλων, για να ελέγχετε αν η εκπαίδευση λειτουργεί όπως προβλέπεται, και διερευνήστε κάθε ουσιαστική επιδείνωση.
Αναδρομικοί έλεγχοι: Ελέγξτε τις αξιολογήσεις ευθυγράμμισης με βάση προηγούμενα περιστατικά, για να επιβεβαιώσετε ότι εντοπίζουν μοντέλα που είχαν παρουσιάσει μη ευθυγράμμιση και δεν προσαρμόζονται υπερβολικά σε συγκεκριμένα περιστατικά.
Παρακολούθηση χειραγώγησης αξιολογήσεων: Παρακολουθήστε την επίγνωση αξιολόγησης ή τη στρατηγική αξιοποίηση του πλαισίου δοκιμής (όταν τα μοντέλα αναγνωρίζουν ότι δοκιμάζονται), που θα μπορούσαν να αλλάξουν τη συμπεριφορά τους. Για παράδειγμα, ενεργοποιήστε αντίστοιχους μηχανισμούς παρακολούθησης στις αξιολογήσεις ευθυγράμμισης, με συγκεκριμένα όρια διακοπής.
Δοκιμές αντοχής για το χειρότερο σενάριο: Προκαλέστε τη χειρότερη δυνατή προβληματική συμπεριφορά και ελέγξτε ότι τουλάχιστον μία αξιολόγηση θα την εντόπιζε.
Αποτροπή εκπαίδευσης με βάση την αλληλουχία σκέψεων: Μην επιτρέπετε στους αυτοματοποιημένους βαθμολογητές να βλέπουν την αλληλουχία σκέψεων κατά την ενισχυτική μάθηση, ώστε τα μοντέλα να μην εξελίσσονται με τρόπο που αποφεύγει τους μηχανισμούς παρακολούθησης της αλληλουχίας σκέψεων.
Περιορισμός: Εξασφαλίστε επαρκώς ισχυρή απομόνωση και ασφάλεια, ώστε να αποτρέπονται επιβλαβείς ενέργειες αν ένα μοντέλο πάψει να είναι ευθυγραμμισμένο. Αυτό θα μπορούσε να περιλαμβάνει:
Πολλαπλά επίπεδα ασφάλειας υποδομής: Επενδύστε σημαντικά στη θωράκιση τόσο του απομονωμένου περιβάλλοντος όπου εκτελείται το μοντέλο όσο και της ερευνητικής υποδομής που το φιλοξενεί, ώστε να υπάρχει πρόσθετο επίπεδο προστασίας σε περίπτωση διαφυγής από το απομονωμένο περιβάλλον.
Αντιπαραθετικός έλεγχος ασφαλείας (red teaming) του περιορισμού: Βελτιώστε την ασφάλεια του απομονωμένου περιβάλλοντος, της ερευνητικής υποδομής και της περιμέτρου, υποβάλλοντάς τα σε επαναλαμβανόμενες αντιπαραθετικές δοκιμές με αποθηκευμένες ενδιάμεσες εκδόσεις μοντέλων από κύκλους εκπαίδευσης κορυφαίων μοντέλων. Οι δοκιμές θα πρέπει να υπόκεινται σε ανάλυση ασφάλειας και να αποσκοπούν στον εντοπισμό και την κάλυψη τυχόν κενών. Υποβάλετε επίσης σε αντιπαραθετικές δοκιμές όλες τις υπηρεσίες με τις οποίες θα μπορούσε να αλληλεπιδράσει το μοντέλο κατά την εκπαίδευση (π.χ. την κρυφή μνήμη διαδικτύου).
Επικοινωνία μεταξύ δειγμάτων: Περιορίστε την επικοινωνία υψηλού εύρους ζώνης μεταξύ δειγμάτων σε εγκεκριμένες οδούς, όπως εργαλεία πολλαπλών πρακτόρων, και κλείστε τα πλευρικά κανάλια της υποδομής που έχουν υψηλό εύρος ζώνης και εντοπίζονται εύκολα από πράκτορες.
Αμετάβλητες καταγραφές: Αποθηκεύστε τις καταγραφές αλληλεπιδράσεων των πρακτόρων σε μορφή που δεν επιδέχεται τροποποίηση, για εύλογο χρονικό διάστημα (π.χ. σε λογαριασμούς αποθήκευσης μίας εγγραφής), για κάθε εκπαίδευση με ενισχυτική μάθηση, αξιολόγηση και εσωτερική χρήση. Έτσι διευκολύνεται η αξιόπιστη διερεύνηση περιστατικών και αποτρέπονται ακούσιες αλλαγές.
Παρακολούθηση: Διατηρήστε σύστημα παρακολούθησης σε πραγματικό χρόνο, ώστε, αν τα μοντέλα αρχίσουν να εκτελούν μη ευθυγραμμισμένες ενέργειες, να εντοπίζεται κάθε πιθανή μη ευθυγράμμιση και να αντιμετωπίζονται άμεσα τα ζητήματα προτεραιότητας πριν προκύψει σοβαρό περιστατικό. Αυτό θα μπορούσε να περιλαμβάνει:
Διασφάλιση δυνατότητας παρακολούθησης: Βεβαιωθείτε ότι τα μοντέλα παραμένουν παρακολουθήσιμα, με αξιολογήσεις της δυνατότητας παρακολούθησης και της αποφυγής των σχετικών μηχανισμών, βάσει σαφών ορίων, ώστε να εντοπίζεται έγκαιρα κάθε ανησυχητική συμπεριφορά.
Υψηλή ανάκληση σε γνωστά προβλήματα: Βεβαιωθείτε ότι το σύστημα παρακολούθησης έχει υψηλή ανάκληση σε προηγούμενα περιστατικά, μέσω αξιολόγησης με δεδομένα που έχουν κρατηθεί εκτός εκπαίδευσης.
Επικαιρότητα αξιολογήσεων μηχανισμών παρακολούθησης: Δημιουργήστε παραδείγματα αξιολόγησης που αντιπροσωπεύουν τους εντελώς νέους κινδύνους των νέων κύκλων εκπαίδευσης, ώστε οι μετρήσεις ανάκλησης και ακρίβειας των μηχανισμών παρακολούθησης να παραμένουν επίκαιρες.
Ταχεία απόκριση: Εφαρμόστε ειδοποιήσεις προτεραιότητας που οδηγούν σε ενέργειες εντός καθορισμένου χρόνου βάσει SLA, είτε καλώντας έναν υπεύθυνο επιφυλακής είτε θέτοντας αυτόματα σε παύση τον επηρεαζόμενο κύκλο εκπαίδευσης, πριν το μοντέλο προκαλέσει βλάβη. Για παράδειγμα, την ημέρα ειδοποιήστε τον υπεύθυνο ασφάλειας σε επιφυλακή και τον υπεύθυνο του κύκλου για τυχόν περιστατικά, ενώ τη νύχτα θέστε αυτόματα σε παύση τους κύκλους αν δεν επιβεβαιωθεί η λήψη των ειδοποιήσεων.
Παράλληλα με τις συστάσεις για τεχνικά μέτρα προστασίας, αναπτύσσουμε βέλτιστες λειτουργικές πρακτικές για τους φακέλους τεκμηρίωσης ασφάλειας των κύκλων εκπαίδευσης κορυφαίων μοντέλων ΤΝ. Αυτές θα μπορούσαν να περιλαμβάνουν:
Αντίλογος (εκ των προτέρων ανάλυση πιθανών αστοχιών): Μετά τη σύνταξη ενός φακέλου τεκμηρίωσης ασφάλειας, ένα μέλος άλλης ομάδας θα πρέπει να συντάσσει αντίλογο, εντοπίζοντας πιθανά κενά και παρουσιάζοντας μια εκτίμηση του κινδύνου ανάλογη με τα διαθέσιμα στοιχεία. Η ομάδα εκπαίδευσης θα πρέπει στη συνέχεια να απαντά στα ζητήματα αυτά, ώστε να ενισχύεται η τεκμηρίωση ασφάλειας.
Εγκρίσεις: Ο φάκελος τεκμηρίωσης ασφάλειας θα πρέπει να εξετάζεται από ανώτερα διοικητικά στελέχη, καθένα από τα οποία θα πρέπει να μπορεί να ασκήσει βέτο στον κύκλο εκπαίδευσης, ώστε να εξασφαλίζονται πολλαπλοί εσωτερικοί έλεγχοι (π.χ. επικεφαλής / αντιπρόεδρος έρευνας, επικεφαλής ασφάλειας και επικεφαλής επιστήμονας).
Λογοδοσία: Το ανώτερο στέλεχος που είναι υπεύθυνο για έναν κύκλο εκπαίδευσης (π.χ. επικεφαλής / αντιπρόεδρος έρευνας) θα πρέπει να λογοδοτεί για τον φάκελο τεκμηρίωσης ασφάλειας και την αντιμετώπιση τυχόν περιστατικών, μεταξύ άλλων στις αξιολογήσεις απόδοσής του. Έτσι, και οι ομάδες εκπαίδευσης θα έχουν κίνητρο να προωθούν την ασφάλεια και την ευθυγράμμιση.
Παύση: Αν εντοπιστούν ζητήματα που ακυρώνουν την τεκμηρίωση ασφάλειας (π.χ. ένα νέο πρόβλημα ασφάλειας), θα πρέπει να υπάρχουν εγχειρίδια διαδικασιών, τεχνικοί μηχανισμοί ελέγχου και συμφωνίες επιπέδου υπηρεσιών (SLA) για την παύση όλων των κύκλων εκπαίδευσης που καλύπτει ο φάκελος.
Εσωτερική διαφάνεια: Οι φάκελοι τεκμηρίωσης ασφάλειας θα πρέπει να είναι διαθέσιμοι στις εσωτερικές ομάδες εποπτείας (π.χ. στην Επιτροπή Ασφάλειας και Προστασίας).
Έλεγχοι: Οι ελεγκτές θα πρέπει να έχουν επαρκή πρόσβαση ώστε να επαληθεύουν την εγκυρότητα και τη βασιμότητα των ισχυρισμών της τεκμηρίωσης ασφάλειας και να επισημαίνουν τυχόν κενά.
Κλιμάκωση αναφορών: Θα πρέπει να υπάρχει σαφής διαδικασία κλιμάκωσης αναφορών για ζητήματα μη ευθυγράμμισης, με πίνακα καθορισμένων επιπέδων σοβαρότητας και υπεύθυνο επιφυλακής, ο οποίος θα μπορεί να ειδοποιεί διοικητικά στελέχη (π.χ. τον διευθύνοντα σύμβουλο) όταν ένας κύκλος εκπαίδευσης φτάσει σε συγκεκριμένο επίπεδο σοβαρότητας.
Τεχνικοί μηχανισμοί ελέγχου: Η έναρξη μη συμμορφούμενων κύκλων εκπαίδευσης θα πρέπει να είναι δύσκολη τόσο για τους ανθρώπους όσο και για τους πράκτορες. Λειτουργίες ασφάλειας όπως η παρακολούθηση και η αυτόματη παύση θα πρέπει, σε περίπτωση αστοχίας, να αποκλείουν τη συνέχιση της λειτουργίας. Για παράδειγμα, δεν θα πρέπει να είναι δυνατή η έναρξη κύκλων χωρίς ενεργή κατάλληλη παρακολούθηση ή η απενεργοποίηση του μηχανισμού παρακολούθησης μέσα από την εκπαίδευση με ενισχυτική μάθηση, την αξιολόγηση ή την εσωτερική χρήση.
Δυνατότητα επαναφοράς: Θα πρέπει να εντοπίζονται εύκολα όλες οι μετέπειτα χρήσεις ενός μη ευθυγραμμισμένου μοντέλου στη διαδικασία εκπαίδευσης (π.χ. παραγωγή δεδομένων ή βαθμολόγηση), ώστε να είναι δυνατή, αν χρειαστεί, η αναίρεση των επιπτώσεων των μη ευθυγραμμισμένων εξόδων του.
Πλήρης καταγραφή υπολειπόμενων κινδύνων: Οι φάκελοι τεκμηρίωσης ασφάλειας θα πρέπει να καταγράφουν όσο το δυνατόν πληρέστερα τους υπολειπόμενους κινδύνους που δεν καλύπτονται από τα μέτρα μετριασμού που ήδη εφαρμόζονται, ώστε οι αποφάσεις αποδοχής κινδύνου να λαμβάνονται με πλήρη ενημέρωση.
Αυτές είναι οι τρέχουσες συστάσεις μας και βρίσκονται ήδη σε διαδικασία εφαρμογής στην OpenAI. Αναμένουμε ότι οι πρακτικές μας θα συνεχίσουν να εξελίσσονται τις επόμενες εβδομάδες.
Αναπτύσσουμε επίσης βέλτιστες πρακτικές για τη διερεύνηση σοβαρών περιστατικών μη ευθυγράμμισης της ΤΝ. Τα εργαστήρια θα πρέπει να επιδιώκουν να αντλούν όσο το δυνατόν περισσότερα διδάγματα από κάθε περιστατικό, κατά το πρότυπο των πρακτικών διερεύνησης(ανοίγει σε νέο παράθυρο) σε άλλους κλάδους υψηλού διακυβεύματος, ώστε να αποτρέπουν παρόμοια περιστατικά στο μέλλον. Ενδεικτικές ενέργειες θα μπορούσαν να περιλαμβάνουν:
Εσωτερική διαφάνεια: Επειδή η ολοκλήρωση μιας διερεύνησης μπορεί να απαιτεί σημαντικό χρόνο, θα πρέπει να παρέχονται τακτικές εσωτερικές ενημερώσεις για την πορεία της (π.χ. καθημερινές ενημερώσεις για διερευνήσεις σε εξέλιξη). Θα πρέπει να υπάρχουν καθορισμένες διαδικασίες ώστε οι εργαζόμενοι να αποκτούν διευρυμένη πρόσβαση, μεταξύ άλλων σε ανεπεξέργαστες καταγραφές συνομιλιών και στη δειγματοληψία από μη ευθυγραμμισμένα μοντέλα, εφόσον αυτό είναι ασφαλές και σχετικό με την εργασία τους.
Βασικά αίτια μη ευθυγράμμισης: Οι ερευνητές θα πρέπει να εντοπίζουν τα βασικά αίτια στη δυναμική της εκπαίδευσης (π.χ. με στοχευμένα πειράματα αφαίρεσης συνιστωσών ή επαναδειγματοληψίας), ώστε να κατανοούν πώς προέκυψαν οι μη ευθυγραμμισμένες συμπεριφορές, να εμβαθύνουν στην επιστημονική κατανόηση της μη ευθυγράμμισης και να την προλαμβάνουν αποτελεσματικότερα στο μέλλον.
Ανασκόπηση περιστατικού: Θα πρέπει να γίνεται ανασκόπηση των λειτουργικών πρακτικών και της οργανωσιακής κουλτούρας, ώστε να κατανοούνται όλα τα αίτια που συνέβαλαν στο περιστατικό, όπως το γιατί προέκυψαν προβλήματα και γιατί δεν εντοπίστηκαν ή δεν αναφέρθηκαν σε ανώτερο επίπεδο πριν από το περιστατικό.
Ανίχνευση: Θα πρέπει να αναπτύσσουμε μεθόδους ελέγχου ευθυγράμμισης που μπορούν να εντοπίζουν την τάση πρόκλησης του περιστατικού, χωρίς να βελτιστοποιούνται επαναληπτικά με άμεση βάση πληροφορίες από αυτό (π.χ. καταγραφές συνομιλιών ή περιλήψεις του περιστατικού). Οι αξιολογήσεις που προκύπτουν από περιστατικά θα πρέπει να χρησιμοποιούνται ως «έλεγχοι παλινδρόμησης», ώστε να διασφαλίζεται ότι τα μελλοντικά μοντέλα δεν εμφανίζουν τάση μη ευθυγράμμισης σε πολύ παρόμοια περιστατικά.
Δημόσιες γνωστοποιήσεις: Τα αποτελέσματα της διερεύνησης, οι ανασκοπήσεις περιστατικών και οι λειτουργικές αλλαγές θα πρέπει να δημοσιοποιούνται μετά την ολοκλήρωση της διερεύνησης. Τα τρίτα μέρη που επηρεάζονται θα πρέπει να ενημερώνονται το συντομότερο δυνατόν.


