Επισκόπηση ασφάλειας: GPT‑6 Astra
Φόρτωση…
Σήμερα κυκλοφορούμε το GPT‑6 Astra, το ικανότερο μοντέλο που έχουμε διαθέσει ποτέ ευρέως. Το Astra είναι το πρώτο μοντέλο μας που φτάνει στο Κρίσιμο επίπεδο δυνατοτήτων κυβερνοασφάλειας βάσει του Πλαισίου Ετοιμότητας.
Τα σημαντικότερα στοιχεία για την ασφάλεια αυτής της κυκλοφορίας είναι τα εξής:
- Το GPT‑6 Astra αποτελεί σημαντικό άλμα στις δυνατότητες κυβερνοασφάλειας και πληροί το Κρίσιμο όριό μας. Αυτό σημαίνει ότι, με τα κατάλληλα εργαλεία και πρόσβαση, το GPT‑6 Astra μπορεί να εντοπίζει μέχρι πρότινος άγνωστα κενά ασφαλείας και να αναπτύσσει νέους τρόπους εκμετάλλευσής τους σε πολλά καλά προστατευμένα συστήματα, χωρίς ανθρώπινη καθοδήγηση σε κάθε βήμα. Ενισχύσαμε, συνεπώς, σημαντικά τα μέτρα προστασίας μας έναντι επιβλαβών κυβερνοενεργειών του μοντέλου, είτε οφείλονται σε κατάχρηση είτε σε εσφαλμένη ευθυγράμμιση. Λάβαμε επίσης μέτρα για την ασφάλεια της εσωτερικής ανάπτυξης και διάθεσης του Astra και παρόμοιων μοντέλων, όπως αυστηρότερη απομόνωση, κρυπτογράφηση σημείων ελέγχου, καθολική παρακολούθηση πλήρων διαδρομών όπου συμπεριλαμβάνονται οι αλληλουχίες σκέψεων (CoT) και υποχρεωτική διαδικασία αξιολόγησης ευθυγράμμισης πριν από την εσωτερική χρήση.
- Το GPT‑6 Astra είναι σημαντικά πιο ανθεκτικό από τους προκατόχους του. Χάρη στην ενσωμάτωση νέων τεχνικών εκπαίδευσης ασφάλειας για μεγαλύτερη ανθεκτικότητα, το GPT‑6 Astra αντιστέκεται σημαντικά καλύτερα στις επιθέσεις παράκαμψης δικλίδων ασφαλείας από το GPT‑5.6 Sol, ακόμη και σε διαδρομές μεγαλύτερης διάρκειας. Αυτό προκύπτει από δοκιμές εκτός σύνδεσης και από το αυστηρό μας πρόγραμμα εσωτερικών και εξωτερικών δοκιμών και αντιμετώπισης επιθέσεων παράκαμψης δικλίδων ασφαλείας. Για χρήστες που επισημαίνονται ως δυνητικά υψηλού κινδύνου, εκπαιδεύσαμε επιπλέον το μοντέλο ώστε να μπορεί να προσαρμόζει το όριο άρνησής του συντηρητικότερα και να καλύπτει ευρύτερο φάσμα κινδύνων διττής χρήσης. Χρησιμοποιούμε δοκιμές παλινδρόμησης για να διασφαλίζουμε ότι το Astra παραμένει ανθεκτικό στις επιθέσεις παράκαμψης δικλίδων ασφαλείας που εντοπίστηκαν σε προηγούμενες περιόδους δοκιμών. Διεξαγάγαμε επίσης νέους γύρους αυτοματοποιημένου αντιπαραθετικού ελέγχου ασφαλείας (red teaming) με τους πιο πρόσφατους εσωτερικούς μηχανισμούς επίθεσης, ώστε να επαληθεύσουμε τις βελτιώσεις μας.
- Το GPT‑6 Astra είναι καλύτερα ευθυγραμμισμένο από το GPT‑5.6 Sol. Το Astra αποτελεί σημαντικό βήμα προόδου στην ευθυγράμμιση μοντέλων και περιλαμβάνει βελτιώσεις που εκτείνονται από τη σύνθεση των δεδομένων προεκπαίδευσης έως τη βαθμολόγηση κατά την ενισχυτική μάθηση. Παρουσιάζουμε μια νέα σειρά αξιολογήσεων ευθυγράμμισης(ανοίγει σε νέο παράθυρο) και διαπιστώνουμε ότι το GPT‑6 Astra σέβεται καλύτερα τα όρια ασφάλειας και προστασίας και παραμένει εντός του εγκεκριμένου πεδίου δράσης του. Σε προσομοίωση με περισσότερες από 54.000 εσωτερικές εργασίες Codex(ανοίγει σε νέο παράθυρο), το Astra έλαβε επίσης περίπου τις μισές επισημάνσεις από το Sol για σοβαρότερες περιπτώσεις εσφαλμένα ευθυγραμμισμένης συμπεριφοράς.
- Εφαρμόζουμε ευρέως παρακολούθηση εσφαλμένης ευθυγράμμισης. Θεωρούμε την ευθυγράμμιση μοντέλων το βασικό μέσο αποτροπής δυνητικά εσφαλμένα ευθυγραμμισμένης συμπεριφοράς από τα μοντέλα μας. Ωστόσο, η παρακολούθηση προσφέρει ευρεία εικόνα της συμπεριφοράς κορυφαίων μοντέλων, αναδεικνύοντας ευκαιρίες για περαιτέρω βελτίωση της ευθυγράμμισης και της ασφάλειας. Επιπλέον, η παρακολούθηση λειτουργεί ως πρόσθετο επίπεδο προστασίας έναντι εσφαλμένα ευθυγραμμισμένης συμπεριφοράς που εντοπίζεται. Για αυτούς τους λόγους, προσθέσαμε παρακολούθηση εσφαλμένης ευθυγράμμισης σε κάθε διαδικασία εξαγωγής συμπερασμάτων που χρησιμοποιεί εργαλεία κατά την εξωτερική διάθεση του Astra, με σημαντικό υπολογιστικό κόστος. Το σύστημα αυτό είναι αντίστοιχο με την εσωτερική μας υποδομή.
- Η δυνατότητα παρακολούθησης του GPT‑6 Astra έχει μειωθεί σε σύγκριση με το GPT‑5.6 Sol. Διεξαγάγαμε εκτενείς έρευνες σχετικά με τη δυνατότητα παρακολούθησης(ανοίγει σε νέο παράθυρο) και τη δυνατότητα ελέγχου(ανοίγει σε νέο παράθυρο) του GPT‑6 Astra. Διαπιστώσαμε ότι το GPT‑6 Astra μπορεί να ελέγχει την αλληλουχία σκέψεών (CoT) του καλύτερα από το GPT‑5.6 Sol και είναι λιγότερο πιθανό να περιλάβει σε αυτήν ενοχοποιητικές πληροφορίες. Σε αντιπαραθετικές συνθήκες, όπου ωθούμε το μοντέλο να αποφεύγει τα συστήματα παρακολούθησής μας, διαπιστώνουμε ότι μπορεί να μην εντοπίζεται όταν επιδεικνύει σκόπιμη υποαπόδοση στις αξιολογήσεις και, ορισμένες φορές, να αποφεύγει τα εσωτερικά μας συστήματα παρακολούθησης όταν του ζητείται να εκτελέσει συγκεκριμένες εργασίες δολιοφθοράς(ανοίγει σε νέο παράθυρο). Δεν έχουμε εντοπίσει ενδείξεις στεγανογραφικής συλλογιστικής στην CoT, όπως απόκρυψη συλλογιστικής μέσα σε συνηθισμένο και φαινομενικά άσχετο κείμενο. Αυτό υποδηλώνει ότι ο κίνδυνος αποφυγής ενδέχεται να περιορίζεται κυρίως σε εργασίες με χαμηλότερες απαιτήσεις συλλογιστικής.
- Τα ευρήματα αυτά δείχνουν ότι τα μοντέλα της κατηγορίας Astra θα μπορούσαν, υπό αντιπαραθετικές συνθήκες, να αποφεύγουν τα συστήματα παρακολούθησης CoT. Προς το παρόν, τα ευρήματα αυτά βασίζονται κυρίως σε αντιπαραθετικές αξιολογήσεις, δηλαδή σε περιπτώσεις όπου δίνουμε στο μοντέλο την εντολή να αποφύγει την παρακολούθηση. Συνολικά, πάντως, οι αξιολογήσεις ευθυγράμμισης δείχνουν ότι το Astra είναι λιγότερο πιθανό από το GPT‑5.6 Sol να παραβιάσει περιορισμούς προστασίας και ασφάλειας.
- Ωστόσο, αντιμετωπίζουμε σοβαρά αυτή την τάση και συνεχίζουμε να διερευνούμε τα ευρήματα και τις επιπτώσεις τους στη δυνατότητα παρακολούθησης, καθώς τα μοντέλα μας αποκτούν περισσότερες δυνατότητες. Η OpenAI έχει εργαστεί για να διατηρήσει και να αξιοποιήσει την παρακολούθηση της αλληλουχίας σκέψεων (CoT), ενώ η διατήρηση της δυνατότητας παρακολούθησης CoT αποτελεί βασικό στόχο του ερευνητικού προγράμματος. Ωστόσο, αυτά τα αποτελέσματα υπογραμμίζουν επίσης τη σημασία της ανάπτυξης τεχνικών ελέγχου ευθυγράμμισης που δεν περιορίζονται στην εξέταση της αλληλουχίας σκέψεων του μοντέλου.
- Το GPT‑6 Astra λειτουργεί πιο υπεύθυνα κατά την περιήγηση και σε εργασιακά περιβάλλοντα: Το GPT‑6 Astra είναι σημαντικά πιο ανθεκτικό σε εγχύσεις προτροπών από το GPT‑5.6 Sol. Δοκιμάσαμε επίσης τη συμπεριφορά του μοντέλου σε ρεαλιστικά περιβάλλοντα περιήγησης και επαγγελματικής χρήσης υπολογιστή και διαπιστώσαμε ότι, σε σύγκριση με το GPT‑5.6 Sol, είναι σημαντικά λιγότερο πιθανό να προβεί σε εσφαλμένα ευθυγραμμισμένες και δυνητικά καταστροφικές ενέργειες, όπως μη εξουσιοδοτημένες συναλλαγές, απώλεια δεδομένων, υπέρμετρη πρόσβαση ή παράκαμψη ελέγχων. Ενεργεί επίσης με μεγαλύτερη ασφάλεια όταν χειρίζεται επιβλαβή αιτήματα σε περιβάλλοντα αυτόνομων πρακτόρων, όπως αιτήματα για βοήθεια στον σχεδιασμό βίαιης επίθεσης ή στη διάπραξη απάτης.
- Το GPT‑6 Astra είναι σημαντικά ασφαλέστερο σε σενάρια υψηλότερου κινδύνου. Το GPT‑6 Astra ανταποκρίνεται με μεγαλύτερη ασφάλεια από το GPT‑5.6 Sol σε απαιτητικά αιτήματα από συστήματα παραγωγής και από αντιπαραθετικό έλεγχο ασφαλείας (red teaming) που διεξάγεται από ανθρώπους. Το Astra επιτυγχάνει βελτίωση κατά Pareto, ανταποκρινόμενο με ασφάλεια σε μη ασφαλή αιτήματα και αποφεύγοντας τις περιττές αρνήσεις σε ακίνδυνα αιτήματα. Οι βελτιώσεις αυτές επεκτείνονται και σε σενάρια υψηλής σοβαρότητας, όπου ο κίνδυνος βλάβης προκύπτει από το ευρύτερο πλαίσιο και όχι από ένα ρητό αίτημα. Το Astra εφαρμόζει επίσης με μεγαλύτερη συνέπεια όρια ασφάλειας κατάλληλα για την ηλικία των χρηστών κάτω των 18 ετών.
Για περισσότερες πληροφορίες, ανατρέξτε στην πλήρη κάρτα συστήματος(ανοίγει σε νέο παράθυρο).
Συντάκτης
OpenAI


