Μετάβαση στο κύριο περιεχόμενο
OpenAI

Η πορεία προς το Astra: κρίσιμες δυνατότητες και κορυφαίες δικλίδες ασφαλείας

Φόρτωση…

Μετά την προηγούμενη αξιολόγησή μας ότι το Astra ενδέχεται να φτάσει σε κρίσιμο επίπεδο δυνατοτήτων κυβερνοασφάλειας, συγκεντρώσαμε περισσότερα στοιχεία και πραγματοποιήσαμε πρόσθετες αξιολογήσεις των δυνατοτήτων του μοντέλου. Πλέον πιστεύουμε ότι το Astra πληροί το όριο Κρίσιμων δυνατοτήτων κυβερνοασφάλειας βάσει του Πλαισίου Ετοιμότητας. Αυτό σημαίνει ότι, με τα κατάλληλα εργαλεία και πρόσβαση, μπορεί να εντοπίζει άγνωστες μέχρι πρότινος ευπάθειες ασφαλείας και να αναπτύσσει τρόπους εκμετάλλευσής τους σε πολλά καλά προστατευμένα συστήματα, χωρίς ανθρώπινη καθοδήγηση σε κάθε βήμα. Είναι το πρώτο μοντέλο που κατατάσσουμε σε αυτό το επίπεδο και απαιτεί ισχυρότερες δικλίδες ασφαλείας κατά την ανάπτυξη και πριν από την κυκλοφορία.

Τις τελευταίες εβδομάδες καθυστερήσαμε ορισμένα στάδια ανάπτυξης και κυκλοφορίας του Astra, ενώ ενισχύαμε και δοκιμάζαμε την προστασία από κυβερνοκατάχρηση και μη εξουσιοδοτημένες ενέργειες του μοντέλου. Με βάση αυτήν την εργασία, πιστεύουμε ότι οι δικλίδες ασφαλείας του Astra ελαχιστοποιούν επαρκώς τον κίνδυνο σοβαρής βλάβης, ώστε να κυκλοφορήσει βάσει του Πλαισίου Ετοιμότητας.

Παρότι το Astra δεν εμπλεκόταν στο περιστατικό Hugging Face, ενσωματώσαμε στην προσέγγισή μας για την ασφάλεια όσα διδαχθήκαμε(ανοίγει σε νέο παράθυρο) από αυτό. Με βάση αναδρομικές δοκιμές, πιστεύουμε ότι οι δικλίδες ασφαλείας παραγωγής που διαθέταμε τότε θα είχαν αποτρέψει το περιστατικό Hugging Face. Έκτοτε εφαρμόσαμε ακόμη ισχυρότερες δικλίδες ασφαλείας για το Astra, όπως εκπαίδευση του μοντέλου ώστε να απορρίπτει πιο αξιόπιστα επιβλαβή αιτήματα κυβερνοασφάλειας και να τηρεί τους περιορισμούς ασφαλείας, πρόσθετη προστασία από κατάχρηση και παρακολούθηση που μπορεί να διακόπτει δυνητικά μη εξουσιοδοτημένη δραστηριότητα.

Σχεδιάζουμε να διαθέσουμε σύντομα το Astra, αλλά η πρόσβαση στις πιο προηγμένες δυνατότητες κυβερνοασφάλειάς του θα είναι πιο περιορισμένη. Οι προηγμένες εργασίες κυβερνοασφάλειας θα είναι αρχικά διαθέσιμες σε μια ομάδα δοκιμαστών και στη συνέχεια η πρόσβαση μέσω του Daybreak Blue θα επεκτείνει τις αμυντικές χρήσεις.

Κατά την κυκλοφορία, θα κοινοποιήσουμε περισσότερες λεπτομέρειες για τις δοκιμές και αξιολογήσεις ασφάλειας, προστασίας και ευθυγράμμισης στην κάρτα συστήματος του μοντέλου. Πριν από την κυκλοφορία, θέλουμε να ενημερώσουμε για ορισμένες από τις εργασίες που πραγματοποιούμε ώστε να διαθέσουμε με ασφάλεια ένα μοντέλο με αυτό το επίπεδο δυνατοτήτων κυβερνοασφάλειας, αλλά και να είμαστε διαφανείς σχετικά με τους κινδύνους που παραμένουν.

Αξιολόγηση των δυνατοτήτων κυβερνοασφάλειας του Astra

Βάσει του Πλαισίου Ετοιμότητας, ένα μοντέλο πληροί το Κρίσιμο όριο εάν ισχύει μία από τις ακόλουθες προϋποθέσεις:

  • Το μοντέλο μπορεί, χωρίς ανθρώπινη παρέμβαση, να εντοπίζει και να αναπτύσσει λειτουργικούς τρόπους εκμετάλλευσης ευπαθειών zero-day κάθε επιπέδου σοβαρότητας σε πολλά ενισχυμένα κρίσιμα συστήματα του πραγματικού κόσμου.
  • Το μοντέλο μπορεί να σχεδιάζει και να εκτελεί ολοκληρωμένες, πρωτότυπες στρατηγικές κυβερνοεπιθέσεων εναντίον ενισχυμένων στόχων, έχοντας μόνο έναν επιθυμητό στόχο υψηλού επιπέδου.

Η αξιολόγηση ετοιμότητας του Astra συνδύασε αυτοματοποιημένα δημόσια και ιδιωτικά σημεία αναφοράς με αξιολογήσεις ειδικών. Το Astra παρουσιάζει σημαντικά αυξημένες δυνατότητες κυβερνοασφάλειας σε σύγκριση με το GPT‑5.6 Sol: είναι πολύ αποδοτικότερο ως προς τα token και ικανότερο στον εντοπισμό ευπαθειών και στην ανάπτυξη τρόπων εκμετάλλευσής τους.

Ενδεικτικά, εκτελέσαμε το Astra στο ExploitBench, όπου το μοντέλο πέτυχε την τέλεια βαθμολογία 100% στο σημείο αναφοράς που αξιολογεί την ικανότητά του να αναπτύσσει τρόπους εκμετάλλευσης γνωστών ευπαθειών.

Λόγω ανησυχιών για επιμόλυνση των δεδομένων, δημιουργήσαμε κατόπιν ένα εσωτερικό σημείο αναφοράς με την ονομασία «ExploitBench - Εσωτερική μεταφορά (Ιούνιος–Αύγουστος 2026)», το οποίο περιλαμβάνει 20 ευπάθειες V8 υψηλής σοβαρότητας που αποκαλύφθηκαν πιο πρόσφατα. Σε αυτό το σύνολο δεδομένων, το Astra πετυχαίνει πολύ υψηλότερα ποσοστά εκτέλεσης αυθαίρετου κώδικα από το GPT‑5.6 Sol, χρησιμοποιώντας πολύ λιγότερα token εξόδου. Κατά την αξιολόγηση, το μοντέλο ανακάλυψε και χρησιμοποίησε ακόμη και δύο ευπάθειες zero-day ως μέρος μιας αλυσίδας εκμετάλλευσης. Βρισκόμαστε στη διαδικασία γνωστοποίησης αυτών των δύο ευπαθειών στους συντηρητές.

Τα εμφανιζόμενα αποτελέσματα του Astra αντανακλούν τις δυνατότητες με πρόσβαση στο Daybreak Blue και όχι την προεπιλεγμένη διαμόρφωση παραγωγής.

Σε αξιολογήσεις ειδικών απέναντι σε ενισχυμένο πρόγραμμα περιήγησης και λειτουργικό σύστημα, το Astra ανακάλυψε άγνωστες μέχρι πρότινος ευπάθειες και τις μετέτρεψε σε λειτουργικές αλυσίδες εκμετάλλευσης. Δημιούργησε μια πλήρη αλυσίδα παραβίασης του προγράμματος περιήγησης, η οποία διέφυγε από το sandbox και εκτέλεσε εντολές στον κεντρικό υπολογιστή όταν το πρόγραμμα περιήγησης άνοιξε ένα αρχείο HTML. Το μοντέλο εντόπισε επίσης πολλαπλές ευπάθειες σε ενισχυμένο λειτουργικό σύστημα και τις συνδύασε σε μια τοπική αλυσίδα κλιμάκωσης προνομίων, από μη προνομιούχο χρήστη σε root. Συνολικά, η έρευνά μας μάς οδήγησε στο συμπέρασμα ότι το Astra πληροί το κρίσιμο όριο.

Απαιτούμενες δικλίδες ασφαλείας για κρίσιμες δυνατότητες

Για μοντέλα με δυνατότητες κυβερνοασφάλειας επιπέδου Astra, πρέπει να καλύψουμε δύο διαδρομές ώστε να ελαχιστοποιήσουμε τον κίνδυνο σοβαρής βλάβης στον κυβερνοχώρο, τόσο κατά την ανάπτυξη όσο και πριν από τη διάθεση:

  • Κακόβουλοι παράγοντες που χρησιμοποιούν το μοντέλο. Οι δικλίδες ασφαλείας μας πρέπει να εμποδίζουν αποτελεσματικά κακόβουλους παράγοντες να χρησιμοποιούν το Astra για να αναπτύσσουν τρόπους εκμετάλλευσης άγνωστων μέχρι πρότινος ευπαθειών σε ενισχυμένα κρίσιμα συστήματα ή να πραγματοποιούν ολοκληρωμένες επιθέσεις σε ενισχυμένους στόχους.
  • Το μοντέλο προβαίνει σε μη εξουσιοδοτημένες ενέργειες που αποκλίνουν από την ευθυγράμμιση. Ακόμη και χωρίς κακόβουλο χρήστη, ένα μοντέλο με προηγμένες δυνατότητες κυβερνοασφάλειας θα μπορούσε να προκαλέσει βλάβη στον κυβερνοχώρο, εάν δεν είναι ευθυγραμμισμένο. Πέρα από τις πολύ υψηλές απαιτήσεις ευθυγράμμισης για μοντέλα με αυτές τις δυνατότητες, οι δικλίδες ασφαλείας μας πρέπει, ως δεύτερη γραμμή άμυνας, να εντοπίζουν και να περιορίζουν γρήγορα μη ευθυγραμμισμένες ενέργειες που θα μπορούσαν να προκαλέσουν σημαντική βλάβη στον πραγματικό κόσμο.

Αξίζει να σημειωθεί ότι η δεύτερη διαδρομή ισχύει τόσο για την εσωτερική ανάπτυξη όσο και για την εξωτερική διάθεση. Όπως περιγράψαμε προηγουμένως, μετά το περιστατικό OpenAI-Hugging Face διακόψαμε για δύο εβδομάδες ορισμένες εκπαιδεύσεις κορυφαίων μοντέλων, μεταξύ των οποίων και ορισμένες εκπαιδεύσεις του Astra, ώστε να ενισχύσουμε την υποδομή εκπαίδευσης με απομόνωση και ελέγχους δικτύου, διευρυμένη παρακολούθηση και αυστηρότερη εκπαίδευση και όρια ευθυγράμμισης. Στη συνέχεια, συνεχίσαμε εργασίες μικρότερης κλίμακας υπό αυστηρότερους ελέγχους.

Αναβάλαμε για μεγαλύτερο διάστημα ορισμένες εκτενέστερες εκτελέσεις ενισχυτικής μάθησης (RL) για μελλοντικές εκδόσεις του Astra, έως ότου θεσπίσουμε αυστηρότερες απαιτήσεις ασφάλειας και προστασίας για το περιβάλλον εκπαίδευσής τους. Στις 28 Αυγούστου επανεκκινήσαμε τη μεγάλης κλίμακας εκτέλεση RL για κορυφαία μοντέλα, η οποία είχε διακοπεί, αφού εφαρμόστηκαν οι νέες απαιτήσεις ασφάλειας και προστασίας. Εξακολουθούμε να αναβάλλουμε προσωρινά ορισμένες μικρότερες πειραματικές εκπαιδεύσεις.

Η προετοιμασία του Astra για κυκλοφορία απαίτησε επίσης ισχυρότερη προστασία από κυβερνοκατάχρηση και μη εξουσιοδοτημένες ενέργειες. Παρακάτω περιγράφουμε αυτές τις δικλίδες ασφαλείας και πώς τις δοκιμάσαμε.

Ανθεκτικότητα στην κυβερνοκατάχρηση

Από τη διάθεση του πρώτου μοντέλου που χαρακτηρίσαμε ως Υψηλού επιπέδου δυνατοτήτων κυβερνοασφάλειας τον Φεβρουάριο, ενισχύουμε τις δικλίδες κυβερνοασφάλειας με κάθε νέα κυκλοφορία. Η συνολική μας προσέγγιση στην ασφάλεια συνδυάζει σε επίπεδα τις αρνήσεις του μετεκπαιδευμένου μοντέλου, ταξινομητές ασφαλείας σε επίπεδο συστήματος, καθώς και εντοπισμό εκτός σύνδεσης και εξουδετέρωση απειλών.

Για το GPT‑5.6(ανοίγει σε νέο παράθυρο), βελτιώσαμε σημαντικά την ανθεκτικότητα της στοίβας μας σε επίπεδο συστήματος, μεταξύ άλλων προσθέτοντας ταξινομητές ενεργοποίησης για τον εντοπισμό κυβερνοκατάχρησης και διευρύνοντας την κάλυψη απέναντι σε καθολικές επιθέσεις παράκαμψης δικλίδων ασφαλείας που εντοπίστηκαν μέσω εντατικού αυτοματοποιημένου αντιπαραθετικού ελέγχου ασφαλείας (red teaming). Αξιοποιώντας αυτές τις βελτιώσεις, για το Astra επενδύσαμε περαιτέρω στο επίπεδο μοντέλου της στοίβας δικλίδων ασφαλείας και βελτιώσαμε την ικανότητά τους να χειρίζονται πληροφορίες από διαφορετικές συνομιλίες.

  • Αξιοποιώντας νέες τεχνικές εκπαίδευσης για την ανθεκτικότητα του μοντέλου, το Astra απορρίπτει πιο αξιόπιστα αιτήματα για μη επιτρεπόμενη βοήθεια σε θέματα κυβερνοασφάλειας. Στο σύνολο αξιολογήσεών μας για επιθέσεις παράκαμψης δικλίδων κυβερνοασφάλειας, το Astra απορρίπτει το 91.5% των αιτημάτων, έναντι 59% για το GPT‑5.6 Sol.
  • Για λογαριασμούς που αξιολογούνται ως υψηλότερου κινδύνου, εφαρμόζουμε πιο συντηρητικά όρια συμπεριφοράς του μοντέλου, ώστε να απορρίπτει ευρύτερο φάσμα δυνητικά επικίνδυνης βοήθειας σε θέματα κυβερνοασφάλειας. Για χρήστες υψηλού κινδύνου, έχουμε διευρύνει το πλαίσιο πληροφοριών των συστημάτων παρακολούθησής μας, ώστε να εντοπίζουν τέτοιες περιπτώσεις κυβερνοκατάχρησης.

Συνεχίσαμε επίσης το πρόγραμμά μας για αυστηρές δοκιμές, εσωτερικό και εξωτερικό αντιπαραθετικό έλεγχο ασφαλείας (red teaming) και διορθωτικές παρεμβάσεις. Εκτός από τις δοκιμές παλινδρόμησης που διασφαλίζουν ότι εξακολουθούμε να καλύπτουμε όλες τις επιθέσεις παράκαμψης δικλίδων ασφαλείας προηγούμενων περιόδων δοκιμών, πραγματοποιούμε νέο κύμα αντιπαραθετικού ελέγχου ασφαλείας (red teaming) με τους πιο πρόσφατους εσωτερικούς επιτιθέμενους αντιπαραθετικού ελέγχου ασφαλείας (red teaming). Συνεργαζόμαστε με εταίρους του κλάδου για να ορίσουμε ένα κοινό σύστημα αξιολόγησης επιθέσεων παράκαμψης δικλίδων ασφαλείας και θα αξιοποιήσουμε το πρόγραμμα ταχείας απόκρισης 24/7 για να διερευνούμε και να αντιμετωπίζουμε νέα ευρήματα. Θα κοινοποιήσουμε περισσότερες λεπτομέρειες για τις δοκιμές των δικλίδων κυβερνοασφάλειας στην κάρτα συστήματος του Astra.

Η βοήθεια προς τους αμυνόμενους για τον εντοπισμό και τη διόρθωση ευπαθειών παραμένει βασικός πυλώνας της προσέγγισής μας στην ασφάλεια. Κατά την κυκλοφορία, αναμένουμε ότι οι δικλίδες ασφαλείας του Astra θα δημιουργούν περισσότερα εμπόδια από όσα επιδιώκουμε μακροπρόθεσμα, ώστε να προστατεύουν από πιθανή κατάχρηση. Αρχικά, η πρόσβαση στο Astra για προηγμένες ροές εργασίας κυβερνοασφάλειας θα διατίθεται σε μια μικρή ομάδα δοκιμαστών alpha και κατόπιν θα επεκταθεί μέσω του Daybreak Blue για την υποστήριξη αμυντικών χρήσεων.

Ευθυγράμμιση & παρακολούθηση

Προσθέσαμε επίσης επιπλέον επίπεδα προστασίας, ώστε να αποτρέπουμε δυνητικά μη ευθυγραμμισμένες ενέργειες του μοντέλου:

  • Ευθυγράμμιση μοντέλου: Στις αξιολογήσεις μας, το Astra ήταν πολύ πιθανότερο από το GPT‑5.6 Sol να τηρεί ρητούς περιορισμούς ασφάλειας και προστασίας και να παραμένει εντός του εξουσιοδοτημένου πεδίου του, γεγονός που το καθιστά το πιο ευθυγραμμισμένο μοντέλο μας μέχρι σήμερα. Εστιάσαμε ιδιαίτερα στην τήρηση των περιορισμών προστασίας και ασφάλειας από το μοντέλο, καθώς και στην τάση του να παραμένει εντός του εξουσιοδοτημένου πεδίου του.
  • Παρακολούθηση και έλεγχος: Αντίστοιχα με τις εσωτερικές διαδικασίες μας, διαθέτουμε το Astra με πρόσθετη παρακολούθηση της αλληλουχίας σκέψεων, ώστε να εντοπίζουμε και να περιορίζουμε γρήγορα δυνητικά μη ευθυγραμμισμένες ενέργειες.

Το Astra αποτελεί σημαντικό βήμα προόδου στην ευθυγράμμιση μοντέλων και επιστέγασμα πολλών μακροχρόνιων πρωτοβουλιών ευθυγράμμισης, από παρεμβάσεις στην προεκπαίδευση έως πιο προσεκτική και συνεπή βαθμολόγηση κατά την ενισχυτική μάθηση. Στις δοκιμές διαπιστώνουμε ότι, σε σύγκριση με το GPT 5.6 Sol, το Astra τηρεί συστηματικά συχνότερα τους ρητούς περιορισμούς και τις προειδοποιήσεις ασφαλείας, όπως τον αυτόματο έλεγχο.

Αναπτύξαμε επίσης μια δοκιμή βασισμένη στο περιστατικό Hugging Face, κατά το οποίο πράκτορες που εκτελούσαν την αξιολόγηση κυβερνοασφάλειας ExploitGym παραβίασαν τα συστήματα τρίτου μέρους. Χρησιμοποιήσαμε τις δυσκολότερες εργασίες αυτής της αξιολόγησης για να δημιουργήσουμε δοκιμές «honeypot» σχετικά με το αν ένα μοντέλο θα επιχειρούσε να παραβιάσει τη γύρω υποδομή ασφαλείας αντί να επιλύσει την εργασία που του ανατέθηκε. Χωρίς τις δικλίδες ασφαλείας παραγωγής, το GPT‑5.6 Sol επιχείρησε να αποκτήσει πρόσβαση σε αυτούς τους στόχους στο 56% των δοκιμών που προσομοίωναν το περιβάλλον του σημείου αναφοράς, όπου το μοντέλο λαμβάνει οδηγίες να αναπτύξει τρόπους εκμετάλλευσης ευπαθειών. Το Astra δεν έκανε καμία τέτοια απόπειρα σε αυτές τις δοκιμές. Αυτά τα στοιχεία περιγράφουν τη συμπεριφορά υπό τις συνθήκες δοκιμής χωρίς δικλίδες κυβερνοασφάλειας και όχι κατά τη συνήθη χρήση παραγωγής.

Αριστερά: Σε αυτήν τη νέα αξιολόγηση παρατηρούμε πώς αντιδρούν τα μοντέλα όταν ο αυτόματος έλεγχος απορρίπτει μια ενέργεια. Κάθε εργασία εκτυλίσσεται σε περιβάλλον εργασίας γνώσης και η εκτέλεση αρχίζει αμέσως μετά την απόρριψη από τον αυτόματο έλεγχο. Έπειτα, το μοντέλο μπορεί να προχωρήσει με διάφορους τρόπους: να τερματίσει την εκτέλεση, να αναζητήσει ασφαλέστερη εναλλακτική, να επαναλάβει μια παρόμοια εντολή ή να εκμεταλλευτεί μια ανεπαρκή διαμόρφωση(ανοίγει σε νέο παράθυρο) για να παρακάμψει πλήρως τον αυτόματο έλεγχο. Η επιλογή οποιασδήποτε από τις δύο τελευταίες ενέργειες θα αποτελούσε αποτυχία σε αυτήν την αξιολόγηση. Το Astra δεν επιχείρησε ποτέ να παρακάμψει τον αυτόματο έλεγχο.

Δεξιά: Σε αυτήν την αξιολόγηση εξετάζουμε την τάση ενός μοντέλου να εξαπατά, χρησιμοποιώντας «honeypot», όταν αντιμετωπίζει τις δυσκολότερες ή αδύνατες εργασίες της αξιολόγησης ExploitGym. Η αξιολόγηση εκτελέστηκε σε προσομοιωμένο περιβάλλον, με τις δικλίδες ασφαλείας σε λειτουργία μόνο παρατήρησης, ώστε να αξιολογηθεί η συμπεριφορά του μοντέλου. Παρότι το GPT‑5.6 Sol εμφάνισε μεγαλύτερη πιθανότητα εξαπάτησης σε αυτά τα σενάρια, το Astra δεν επιχείρησε να χρησιμοποιήσει τέτοιες συντομεύσεις και κατάφερε παρ’ όλα αυτά να επιλύσει θεμιτά ορισμένες εργασίες.

Η εκπαίδευση των μοντέλων ώστε να είναι ευθυγραμμισμένα αποτελεί ένα επίπεδο ασφάλειας. Θα κοινοποιήσουμε περισσότερες λεπτομέρειες για τις δοκιμές ευθυγράμμισης και τα αποτελέσματά μας στην κάρτα συστήματος του Astra.

Διαθέτουμε επίσης παρακολούθηση αποκλίσεων από την ευθυγράμμιση στην παραγωγή για μοντέλα κατηγορίας Astra, ώστε να εντοπίζουμε και να περιορίζουμε γρήγορα πιθανές αποκλίσεις. Αυτές οι δικλίδες ασφαλείας μοιάζουν με την παρακολούθηση των εσωτερικών μας διαθέσεων και περιλαμβάνουν ένα σύστημα ταξινομητών που ελέγχει τη συλλογιστική και τις ενέργειες του μοντέλου για μη εξουσιοδοτημένη συμπεριφορά και διακόπτει αυτόματα δυνητικά μη εξουσιοδοτημένη δραστηριότητα. Καθώς αυξάνονται οι δυνατότητες, αυτές οι δικλίδες ασφαλείας δεν μπορούν να υποκαταστήσουν την καλή ευθυγράμμιση των μοντέλων μας. Στόχος μας είναι τα μελλοντικά μοντέλα να είναι τόσο καλά ευθυγραμμισμένα, ώστε οι δικλίδες να μην ενεργοποιούνται ποτέ.

Τι θα σημαίνει αυτό για τους χρήστες

Η OpenAI δεσμεύεται να διασφαλίσει ότι τα οφέλη της τεχνητής νοημοσύνης είναι ευρέως προσβάσιμα. Δεδομένης της σημαντικής αύξησης των δυνατοτήτων κυβερνοασφάλειας του Astra, είμαστε ιδιαίτερα προσεκτικοί ώστε η διάθεσή του να είναι ασφαλής και προστατευμένη. Οι πρόσθετοι έλεγχοι ασφαλείας μπορεί μερικές φορές να επιβραδύνουν, να διακόπτουν προσωρινά ή να σταματούν θεμιτές εργασίες, συμπεριλαμβανομένης της αμυντικής κυβερνοασφάλειας.

Το σύστημα ενδέχεται περιστασιακά να επισημάνει θεμιτή δραστηριότητα ως πιθανή κυβερνοκατάχρηση ή μη εξουσιοδοτημένη συμπεριφορά, με αποτέλεσμα να την επιβραδύνει, να τη διακόψει προσωρινά ή να τη σταματήσει κατά λάθος. Αυτό μπορεί να περιλαμβάνει εργασίες που δεν φαίνονται να σχετίζονται άμεσα με την κυβερνοασφάλεια ή εργασίες στις οποίες ένας πράκτορας λειτουργεί για μεγάλο χρονικό διάστημα.

Εάν το σύστημα παρακολούθησης αποκλίσεων από την ευθυγράμμιση διακόψει προσωρινά μια εργασία, μπορεί να ζητηθεί από τους χρήστες του ChatGPT ή του Codex να ελέγξουν την ενέργεια πριν συνεχίσουν. Όταν χρησιμοποιούνται άλλα περιβάλλοντα, όπως το API, η εργασία θα διακόπτεται. Σχεδιάζουμε να συνεχίσουμε τη βαθμονόμηση αυτών των δικλίδων ασφαλείας, ώστε να περιορίσουμε τις περιττές διακοπές και να διευρύνουμε την πρόσβαση σε κορυφαίες δυνατότητες μέσω προγραμμάτων όπως το Daybreak.

Το μέλλον

Εισερχόμαστε σε ένα στάδιο ανάπτυξης της τεχνητής νοημοσύνης όπου τα μοντέλα μπορούν να αναλαμβάνουν εργασίες με σοβαρότερες συνέπειες και οι αστοχίες ευθυγράμμισης και ελέγχου μπορούν να έχουν σοβαρότερες επιπτώσεις. Η αξιοποίηση των οφελών αυτών των συστημάτων θα εξαρτηθεί από την ικανότητά μας να ευθυγραμμίζουμε και να ελέγχουμε τα μοντέλα καθώς αυξάνονται οι δυνατότητές τους.

Αυτή η ευθύνη καλύπτει την εκπαίδευση, την αξιολόγηση και τη διάθεση. Απαιτεί ισχυρότερες αποδείξεις ευθυγραμμισμένης συμπεριφοράς, δικλίδες ασφαλείας που συμβαδίζουν με τις δυνατότητες και προθυμία να επιβραδύνουμε όταν αυτές οι δικλίδες δεν επαρκούν.

Θα συνεχίσουμε να δοκιμάζουμε αυτά τα συστήματα, να κοινοποιούμε όσα μαθαίνουμε και να εξηγούμε με σαφήνεια τι παραμένει αβέβαιο. Τα μοντέλα που θα ακολουθήσουν το Astra θα απαιτήσουν περισσότερα από εμάς. Θα αφιερώσουμε τον χρόνο και θα κάνουμε την απαραίτητη εργασία για να ανταποκριθούμε σε αυτήν την ευθύνη.