Μετάβαση στο κύριο περιεχόμενο
OpenAI

18 Αυγούστου 2026

ΕταιρείαΔημοσίευση

Ανάπτυξη μοντέλων σε εποχή κρίσιμων δυνατοτήτων κυβερνοασφάλειας

Φόρτωση…

Τις τελευταίες εβδομάδες, δύο εξελίξεις ανέδειξαν τους αυξανόμενους κινδύνους που συνδέονται με ολοένα ικανότερα συστήματα ΤΝ: το περιστατικό OpenAI-Hugging Face και, ξεχωριστά, οι προκαταρκτικές ενδείξεις ότι ένα από τα προσεχή μοντέλα μας, το Astra, ενδέχεται να πληροί το όριο των κρίσιμων δυνατοτήτων κυβερνοασφάλειας βάσει του Πλαισίου Ετοιμότητας. Σε συνδυασμό με την ταχεία πρόοδο της εσωτερικής μας έρευνας, αυτές οι εξελίξεις έκαναν ακόμη πιο επιτακτική την ενίσχυση των δικλίδων ασφαλείας παρακολούθησης, εναρμονισμού και περιορισμού σε όλα τα στάδια της διαδικασίας εκπαίδευσης.

Καθώς τα μοντέλα γίνονται ικανότερα, αυξάνονται και οι κίνδυνοι που συνδέονται με την εσωτερική ανάπτυξη και τη δοκιμή τους. Τα πρότυπά μας για την παρακολούθηση, τον εναρμονισμό και την ασφάλεια πρέπει να προλαβαίνουν αυτούς τους κινδύνους. Θέλαμε να διαθέσουμε τον απαραίτητο χρόνο για να ανταποκριθούμε σε αυτά τα πρότυπα, γι’ αυτό επιβραδύναμε προσωρινά τον ρυθμό κλιμάκωσης. Στο πλαίσιο αυτό, διακόψαμε για δύο βδομάδες την εκπαίδευση ενισχυτικής μάθησης (RL) των πιο πρόσφατων μοντέλων μας που προορίζονται για διάθεση, ενώ παράλληλα ενισχύσαμε περαιτέρω και υποβάλαμε σε δοκιμές από ομάδες red team τα ερευνητικά περιβάλλοντά μας και διευρύναμε την κάλυψη των συστημάτων παρακολούθησης. Η μεγαλύτερη προγραμματισμένη εκτέλεση ενισχυτικής μάθησης σε κορυφαίο μοντέλο παραμένει σε αναστολή, ενώ πραγματοποιούμε εκπαίδευση και αξιολογήσεις μικρότερης κλίμακας για να εξετάσουμε τη συμπεριφορά του μοντέλου, να επικυρώσουμε τις δικλίδες ασφαλείας μας και να συγκεντρώσουμε περισσότερα στοιχεία εναρμονισμού προτού προχωρήσουμε.

Ο εναρμονισμός —η προσπάθεια ώστε τα συστήματα ΤΝ να συμπεριφέρονται όπως προβλέπεται και να ανταποκρίνονται στην ανθρώπινη εποπτεία— βρίσκεται εδώ και καιρό στον πυρήνα του ερευνητικού προγράμματός μας. Πλέον απαιτούμε ισχυρότερες ενδείξεις εναρμονισμένης συμπεριφοράς σε όλη τη διάρκεια της εκπαίδευσης, αξιοποιώντας την έρευνα και τις αξιολογήσεις που βρίσκονται ήδη σε εξέλιξη. Η διατήρηση του εναρμονισμού ολοένα και πιο ικανών συστημάτων αποτελεί πρόκληση που θα πρέπει να αντιμετωπίσει ολόκληρος ο κλάδος. Οι ενδείξεις από την πρόοδο των προσεχών μοντέλων καθιστούν σαφές ότι χρειαζόμαστε μια ευρύτερη προσέγγιση, η οποία θα αξιοποιεί και θα υπερβαίνει το ισχύον Πλαίσιο Ετοιμότητας.

Θεωρούμε σημαντικό να είμαστε διαφανείς ως προς το πώς αλλάζει η προσέγγισή μας. Παρακάτω περιγράφουμε τις αλλαγές που έχουμε ήδη κάνει στις ερευνητικές διαδικασίες και τις υποδομές μας, καθώς και τις εργασίες που βρίσκονται ακόμη σε εξέλιξη.

Ενίσχυση των δικλίδων ασφαλείας για ικανότερα μοντέλα

Η προσέγγισή μας για την ανάπτυξη ικανότερων μοντέλων βασίζεται σε τρεις αλληλοενισχυόμενες δικλίδες ασφαλείας:

  1. Παρακολούθηση, η οποία εντοπίζει ανησυχητικές συμπεριφορές και μας επιτρέπει να ανταποκρινόμαστε σε αυτές.
  2. Εναρμονισμός, ο οποίος μειώνει την πιθανότητα επιβλαβών ή μη εξουσιοδοτημένων ενεργειών.
  3. Μέτρα ασφάλειας, τα οποία περιορίζουν όσα μπορούν να προσπελάσουν ή να επηρεάσουν τα συστήματα ΤΝ.

Αναμένουμε ότι σύντομα τα μοντέλα θα διεκπεραιώνουν το μεγαλύτερο μέρος των εργασιών ασφάλειας, συμπεριλαμβανομένης της άμυνας απέναντι σε άλλα μοντέλα. Έτσι, και οι τρεις δικλίδες ασφαλείας θα μπορούν να κλιμακώνονται ανάλογα με τις δυνατότητες των μοντέλων, κάτι που θεωρούμε καίριας σημασίας.

Εφαρμόζουμε αυτές τις δικλίδες ασφαλείας τόσο στην έρευνα όσο και στη διάθεση, προσαρμόζοντάς τες στις δυνατότητες, στο περιβάλλον λειτουργίας και στο επίπεδο κινδύνου κάθε μοντέλου.

Θωράκιση των ερευνητικών μας περιβαλλόντων

Καθώς τα κορυφαία μοντέλα αποκτούν ισχυρότερες δυνατότητες κυβερνοασφάλειας, αναβαθμίζουμε τα πρότυπα ασφάλειας των περιβαλλόντων στα οποία τα εκπαιδεύουμε και τα αξιολογούμε. Η συμμόρφωση με αυτά τα πρότυπα απαίτησε σημαντικές εργασίες μηχανικής, ενώ προκάλεσε υψηλό κόστος και καθυστερήσεις στην έρευνα κορυφαίων μοντέλων. Αμέσως μετά το περιστατικό OpenAI-Hugging Face*, διακόψαμε την εξαγωγή συμπερασμάτων κορυφαίων μοντέλων σε ερευνητικά συμπλέγματα για κύκλους που μπορούσαν να εκτελέσουν κώδικα ή να χρησιμοποιήσουν εργαλεία με πρόσβαση στο διαδίκτυο. Αποκαταστήσαμε σχετικά γρήγορα μια πιο περιορισμένη και ασφαλή οδό εκτέλεσης κώδικα και, στη συνέχεια, εξετάσαμε κάθε φόρτο εργασίας ξεχωριστά για να κρίνουμε αν μπορούσε να συνεχιστεί με ασφάλεια. Ορισμένοι ερευνητικοί φόρτοι εργασίας συνεχίστηκαν υπό αυτούς τους νέους ελέγχους, ενώ άλλοι χρειάστηκαν πρόσθετες αλλαγές.

Τις εβδομάδες που ακολούθησαν, καθορίσαμε και αρχίσαμε να εφαρμόζουμε αυστηρότερες απαιτήσεις ασφάλειας για τους φόρτους εργασίας έρευνας κορυφαίων μοντέλων. Για παράδειγμα:

  • Απομόνωση φόρτων εργασίας: Πλέον απαιτούμε ισχυρότερη απομόνωση («sandbox») για φόρτους εργασίας που εκτελούν κώδικα παραγόμενο από μοντέλα ή άλλο μη αξιόπιστο κώδικα. Αυτό ισχύει επίσης για λογισμικό που θα μπορούσε να παραβιαστεί κατά την επεξεργασία των αποτελεσμάτων ενός μοντέλου.
  • Απομόνωση δικτύου: Έχουμε εφαρμόσει περισσότερους ελέγχους για απομόνωση από το διαδίκτυο των μη αξιόπιστων φόρτων εργασίας και εκείνων υψηλότερου κινδύνου. Σχεδιάσαμε αυτούς τους ελέγχους έτσι ώστε η μεμονωμένη παραβίαση ενός φόρτου εργασίας ή μιας υποστηρικτικής υπηρεσίας να μην αρκεί για να επιτρέψει μη εξουσιοδοτημένη πρόσβαση στο διαδίκτυο ή σε άλλα εσωτερικά δίκτυα.
  • Συνεχείς δοκιμές ασφάλειας: Αναδιαμορφώσαμε το περιβάλλον μας για να καταργήσουμε δυνητικά ευάλωτες κοινόχρηστες υπηρεσίες, να περιορίσουμε τα μόνιμα δικαιώματα πρόσβασης και να βελτιώσουμε τα όρια ασφάλειας και εμπιστοσύνης. Βελτιώνουμε επίσης τη δυνατότητά μας να συλλέγουμε και να παρακολουθούμε αρχεία καταγραφής ασφάλειας. Τέλος, επενδύουμε στην αυτοματοποίηση, χρησιμοποιώντας τα μοντέλα μας για να υποβάλλουμε συνεχώς αυτά τα όρια σε δοκιμές με προσομοιωμένες επιθέσεις.

Συνολικά, αυτοί οι έλεγχοι παρέχουν πολυεπίπεδη άμυνα και συμβάλλουν στην προστασία του ερευνητικού περιβάλλοντός μας από επιθέσεις. Σήμερα, απαιτούμε το αυστηρότερο επίπεδο δικλίδων ασφάλειας για φόρτους εργασίας που αφορούν το Astra ή μοντέλα κυβερνοασφάλειας, καθώς έχουμε διαπιστώσει ότι τα μοντέλα Astra ενδέχεται να διαθέτουν κρίσιμο επίπεδο δυνατοτήτων κυβερνοασφάλειας. Αυτές οι δικλίδες ασφαλείας ισχύουν και για όλους τους άλλους φόρτους εργασίας που σχετίζονται με την κυβερνοασφάλεια.

Παρότι ορισμένες εργασίες εκπαίδευσης και αξιολόγησης του Astra πληρούν αυτές τις απαιτήσεις, σημαντικός αριθμός φόρτων εργασίας παραμένει σε αναστολή μέχρι να μεταφερθούν πλήρως και να ενισχυθούν ώστε να ανταποκρίνονται στο νέο πρότυπο ασφάλειας. Δίνουμε προτεραιότητα στη μεταφορά των φόρτων εργασίας ασφάλειας και εναρμονισμού σε αυτά τα νέα περιβάλλοντα.

Επέκταση της παρακολούθησης της αλληλουχίας σκέψεων

Η παρακολούθηση αποτελεί εδώ και καιρό σημαντικό μέρος της διαδικασίας ανάπτυξης μοντέλων, όπως η παρακολούθηση εσωτερικών πρακτόρων προγραμματισμού και των συνεδριών μεγάλης διάρκειας. Οι προσπάθειες παρακολούθησης επικεντρώνονταν ιδιαίτερα στις εσωτερικές διαθέσεις κορυφαίων μοντέλων και στις εκτελέσεις εκπαίδευσης ενισχυτικής μάθησης κορυφαίων μοντέλων. Τις θεωρούσαμε φόρτους εργασίας υψηλότερου κινδύνου, επειδή μπορούν να συνδυάζουν προηγμένες δυνατότητες μοντέλων με πρόσβαση σε εργαλεία, ευαίσθητα συστήματα και εσωτερικά ή εξωτερικά δίκτυα. Δεν εφαρμόζονταν σε όλες τις εκτελέσεις εξαγωγής συμπερασμάτων και εκπαίδευσης που χρησιμοποιούσαν εργαλεία. Αναθεωρήσαμε και διευρύναμε την προσέγγισή μας με το νέο σύστημα παρακολούθησης.

Το νέο σύστημα παρακολούθησης λειτουργεί σε πολλαπλά στάδια. Ξεκινά με ταξινομητές ενεργοποιήσεων —ανιχνευτές που εξετάζουν την εσωτερική δραστηριότητα ενός μοντέλου— οι οποίοι εκτελούνται σε κάθε token του δείγματος και παραπέμπουν πιθανά ζητήματα σε ολοένα πιο εξελιγμένους αυτοματοποιημένους ερευνητές υψηλής υπολογιστικής ισχύος. Αυτά τα συστήματα εξετάζουν τις ενέργειες εργαλείων, τη διαθέσιμη συλλογιστική και ολόκληρη την αλληλουχία δραστηριοτήτων για μη εξουσιοδοτημένη πρόσβαση, κλοπή δεδομένων, καταστροφική συμπεριφορά και απόπειρες παράκαμψης των δικλίδων ασφαλείας. Στόχος μας είναι να εκδίδουμε ειδοποίηση εντός 30 λεπτών από τη στιγμή που το σύστημα παρακολούθησης εντοπίζει ανησυχητική δραστηριότητα. Αν το σύστημα παρακολούθησης εντοπίσει πιθανή παραβίαση ενός κρίσιμου ορίου ασφάλειας, δημιουργεί ειδοποίηση ύψιστης προτεραιότητας. Στην τρέχουσα υλοποίηση, ειδοποιούνται άμεσα οι ομάδες ασφαλούς λειτουργίας, προστασίας και έρευνας. Αν δεν μπορούν να διαπιστώσουν οριστικά εντός 30 λεπτών ότι η επισήμανση είναι ψευδώς θετική, οι ομάδες αυτές οφείλουν να διακόψουν τη δραστηριότητα.

Αυτή η παρακολούθηση είναι υποχρεωτική για κάθε εκπαίδευση και αξιολόγηση RL που περιλαμβάνει εργαλεία για μοντέλα με δυνατότητες επιπέδου Sol ή υψηλότερες. Όταν διαπιστώσαμε στις 7 Αυγούστου ότι το Astra ενδέχεται να διαθέτει κρίσιμες δυνατότητες κυβερνοασφάλειας, προσθέσαμε μια επιπλέον απαίτηση παρακολούθησης για κάθε εξαγωγή συμπερασμάτων του Astra με εργαλεία, όχι μόνο για την εκπαίδευση και τις αξιολογήσεις RL.

Αυτές οι δικλίδες ασφαλείας απαιτούν σημαντική υπολογιστική ισχύ. Σύμφωνα με τις τρέχουσες εκτιμήσεις μας, η επιβάρυνση της παρακολούθησης αντιστοιχεί περίπου στο 20% της υπολογιστικής ισχύος της εξαγωγής συμπερασμάτων που παρακολουθείται, αν και το κόστος διαφέρει σημαντικά μεταξύ των φόρτων εργασίας εκπαίδευσης και αξιολόγησης. Θα κοινοποιήσουμε περισσότερες λεπτομέρειες γι' αυτό το σύστημα σε προσεχή ανάρτηση στο ιστολόγιό μας.

Προώθηση της έρευνας εναρμονισμού

Η έρευνα εναρμονισμού βρίσκεται στον πυρήνα της αποστολής μας. Αποστολή μας είναι να διασφαλίσουμε ότι η τεχνητή γενική νοημοσύνη ωφελεί ολόκληρη την ανθρωπότητα. Καθώς τα μοντέλα αποκτούν προηγμένες δυνατότητες, όπως η εξαπόλυση κυβερνοεπιθέσεων, και λειτουργούν σε πιο σύνθετα περιβάλλοντα, μη εναρμονισμένες συμπεριφορές όπως η εκμετάλλευση κενών ανταμοιβής —η εύρεση τρόπων λήψης υψηλών ανταμοιβών κατά την εκπαίδευση χωρίς να επιτυγχάνεται πραγματικά το επιδιωκόμενο αποτέλεσμα—, η εξαπάτηση ή η μη εξουσιοδοτημένη πρόσβαση θα δημιουργούν ολοένα σοβαρότερους κινδύνους.

Στις εκτελέσεις RL των ικανότερων μοντέλων, εφαρμόζουμε πλέον τις βασικές τεχνικές εναρμονισμού σε περισσότερα στάδια της διαδικασίας εκπαίδευσης. Αυτό περιλαμβάνει τη βελτίωση των μοντέλων ανταμοιβής, ώστε να εντοπίζουν και να αποθαρρύνουν αποτελεσματικότερα τη μη ασφαλή συμπεριφορά σε διαφορετικές εργασίες και περιβάλλοντα, την εκπαίδευση των μοντέλων ώστε να είναι πιο ειλικρινή σχετικά με τις ενέργειες, τις δυνατότητες και τους περιορισμούς τους, καθώς επίσης τη μείωση συμπεριφορών που εκμεταλλεύονται αδυναμίες στις ανταμοιβές, στους αξιολογητές, στα εργαλεία ή στην εποπτεία. Αυξάνουμε επίσης την κάλυψη της εκπαίδευσης για συμπεριφορές που θα μπορούσαν να προκαλέσουν βλάβη όταν τα μοντέλα αλληλεπιδρούν με εξωτερικά συστήματα ή πόρους.

Συνεχίζουμε να επενδύουμε δυναμικά στην έρευνα εναρμονισμού, να διευρύνουμε την κάλυψη των αξιολογήσεων και να αξιοποιούμε όσα μαθαίνουμε για τη διαμόρφωση της εκπαίδευσης και των δικλίδων ασφαλείας. Σκοπεύουμε να κοινοποιήσουμε σύντομα πολύ περισσότερα για την έρευνά μας στον εναρμονισμό, όπως όσα μαθαίνουμε για τη συμπεριφορά των μοντέλων και τυχόν νέες προκλήσεις που εντοπίζουμε.

Επόμενα βήματα

Θα εξελίξουμε το Πλαίσιο Ετοιμότητας ώστε να ενοποιήσουμε αυτές τις δικλίδες ασφαλείας σε όλη την εκπαίδευση και τη διάθεση και να αποτυπώσουμε καλύτερα τις δυνατότητες των μελλοντικών μοντέλων και τα περιβάλλοντα στα οποία λειτουργούν. Η ανάπτυξη μεθόδων που μπορούν να κλιμακώνονται ανάλογα με αυτές τις δυνατότητες θα απαιτήσει συνεχή επένδυση στην ασφάλεια με τη συνδρομή μοντέλων, αποτελεσματικότερη παρακολούθηση και περαιτέρω πρόοδο στην έρευνα εναρμονισμού. Σκοπεύουμε να συνεργαστούμε με εξωτερικούς οργανισμούς και να κοινοποιούμε περισσότερα από όσα μαθαίνουμε καθώς εξελίσσεται η προσέγγισή μας.

Οι δυνατότητες των κορυφαίων μοντέλων αναπτύσσονται με ταχύτατους ρυθμούς. Η ικανότητά μας να τα κατανοούμε, να τα εναρμονίζουμε και να τα θωρακίζουμε πρέπει να παραμένει ένα βήμα μπροστά.


*Τις προσεχείς εβδομάδες θα δημοσιεύσουμε τεχνική έκθεση με όσα μάθαμε.

Συντάκτης

OpenAI