Μετάβαση στο κύριο περιεχόμενο
OpenAI

4 Αυγούστου 2026

Ασφαλεία συστημάτων

Αξιολογήσεις κυβερνοασφάλειας τρίτων μερών με μοντέλα OpenAI

Φόρτωση…

Οι ανεξάρτητες δοκιμές διαδραματίζουν σημαντικό ρόλο, βοηθώντας μας να επαληθεύουμε και να κατανοούμε καλύτερα τους κινδύνους πριν από τη διάθεση. Ορισμένες αξιολογήσεις κυβερνοασφάλειας χρησιμοποιούν σκόπιμα προσαρμοσμένες ρυθμίσεις, μεταξύ άλλων με μειωμένες δικλίδες ασφαλείας, ώστε να μετρούν τις εγγενείς δυνατότητες και όχι τη συνήθη συμπεριφορά των μοντέλων στις δημόσια διαθέσιμες υλοποιήσεις.

Σε πρόσφατες αξιολογήσεις, δύο εξωτερικοί συνεργάτες δοκιμών εντόπισαν περιστατικά στα οποία ο συνδυασμός των ρυθμίσεων και των ελέγχων δοκιμών με τις αυξανόμενες δυνατότητες των πρόσφατων μοντέλων επέτρεψε στη δραστηριότητα των μοντέλων να επεκταθεί πέρα από τα προβλεπόμενα όρια των δοκιμών. Τα περιστατικά αναδεικνύουν τη σημασία της συνεργασίας σε ολόκληρο τον κλάδο και με ανεξάρτητους αξιολογητές, ώστε τα πρότυπα για τα περιβάλλοντα και τις πρακτικές δοκιμών να εξελίσσονται καθώς αυξάνονται οι δυνατότητες των μοντέλων. Σημείωση συντάκτη: Αυτά τα περιστατικά είναι ξεχωριστά από το περιστατικό ασφαλείας του Hugging Face. Θα συνεχίσουμε να κοινοποιούμε ενημερώσεις για το περιστατικό του Hugging Face εδώ.

Τα νέα περιστατικά αφορούσαν μοντέλα της OpenAI που απέκτησαν πρόσβαση στο δημόσιο διαδίκτυο κατά τη διάρκεια αξιολογήσεων κυβερνοασφάλειας από τρίτα μέρη, υπό συγκεκριμένες συνθήκες και με ρυθμίσεις μειωμένων δικλίδων ασφαλείας που δεν αντανακλούσαν τη συνήθη διάθεση των μοντέλων. Τα περιστατικά ήταν τα εξής:

  1. Το UK AISI, το Ινστιτούτο Ασφάλειας της Τεχνητής Νοημοσύνης της κυβέρνησης του Ηνωμένου Βασιλείου, διεξήγαγε αξιολογήσεις σε κυβερνοπεδία με σκόπιμα ενεργοποιημένη πρόσβαση στο διαδίκτυο, ώστε οι πράκτορες να μπορούν να βρίσκουν μόνοι τους εργαλεία και να λειτουργούν υπό συνθήκες που προσομοίαζαν περισσότερο έναν πραγματικό επιτιθέμενο. Οι ταξινομητές κυβερνοασφάλειας είχαν επίσης απενεργοποιηθεί, ώστε να μετρηθούν οι εγγενείς δυνατότητες. Μπορείτε να διαβάσετε την ανάρτησή τους εδώ.(ανοίγει σε νέο παράθυρο)
  2. Η Irregular, ένας από τους εξωτερικούς συνεργάτες μας για δοκιμές κυβερνοασφάλειας, διεξήγαγε αξιολογήσεις τύπου Capture the Flag που προορίζονταν να είναι απομονωμένες από το διαδίκτυο. Ωστόσο, μια εσφαλμένη ρύθμιση του περιβάλλοντος δοκιμών επέτρεψε στα μοντέλα να αποκτήσουν πρόσβαση στο δημόσιο διαδίκτυο.

Παρακάτω συνοψίζουμε τι συνέβη, τις συνθήκες δοκιμών που επέτρεψαν τη δραστηριότητα, τα μέτρα που ελήφθησαν για τον περιορισμό της και τις ενέργειές μας ώστε τα ανεξάρτητα εργαστήρια να μπορούν να συνεχίσουν να αξιολογούν με αυστηρότητα και ασφάλεια ολοένα πιο ικανά μοντέλα.

Ενίσχυση των περιβαλλόντων αξιολόγησης μοντέλων από τρίτα μέρη

Αυτά τα περιστατικά παραπέμπουν στην ίδια ευρύτερη πρόκληση που περιγράψαμε στην πρόσφατη ανάρτησή μας για το περιστατικό του Hugging Face: καθώς εξελίσσονται οι δυνατότητες των μοντέλων, πρέπει να εξελίσσονται και τα συστήματα προστασίας και ασφάλειας γύρω από αυτά. Αυτό αφορά τόσο τα περιβάλλοντα που χρησιμοποιούνται για την ανάπτυξη μοντέλων όσο και εκείνα που χρησιμοποιούν τα εργαστήρια και οι ανεξάρτητοι συνεργάτες για την αξιολόγησή τους.

Τις επόμενες εβδομάδες θα επανεξετάσουμε τη δική μας προσέγγιση στις δοκιμές από τρίτα μέρη. Μεταξύ άλλων, θα εξετάσουμε πώς εντοπίζουμε αξιολογήσεις υψηλότερου κινδύνου, συμφωνούμε το πεδίο εφαρμογής, αξιολογούμε αιτήματα ενεργοποίησης πρόσβασης στο διαδίκτυο ή μείωσης των δικλίδων ασφαλείας, ορίζουμε απαιτήσεις για την απομόνωση, τη διαχείριση διαπιστευτηρίων, την παρακολούθηση και τις συνθήκες διακοπής και καθιερώνουμε σαφέστερες διαδικασίες γνωστοποίησης και κλιμάκωσης περιστατικών.

Δεσμευόμαστε να συνεργαστούμε σε ολόκληρο τον κλάδο για να ενισχύσουμε τις κοινές πρακτικές ασφαλούς διεξαγωγής αξιολογήσεων υψηλού κινδύνου. Στο πλαίσιο αυτό, τις επόμενες εβδομάδες θα συγκαλέσουμε ενδιαφερόμενα μέρη, όπως εθνικά ινστιτούτα τεχνητής νοημοσύνης, ανεξάρτητους αξιολογητές, άλλα εργαστήρια τεχνητής νοημοσύνης και άλλες ομάδες. Στόχος μας είναι να διατηρήσουμε την αξία της αυστηρής ανεξάρτητης αξιολόγησης, διασφαλίζοντας παράλληλα ότι οι πρακτικές δοκιμών συμβαδίζουν με τις αυξανόμενες δυνατότητες των μοντέλων.

UK AISI

Στις 3 Αυγούστου, το UK AISI μάς ενημέρωσε ότι, κατά τη διάρκεια μιας τακτικής αξιολόγησης κυβερνοασφάλειας που ξεκίνησε στις 25 Ιουλίου, μοντέλα της OpenAI και ενός άλλου εργαστηρίου υπερέβησαν σε ορισμένες περιπτώσεις το πεδίο των δοκιμών. Η αξιολόγηση πραγματοποιήθηκε σε ελεγχόμενα κυβερνοπεδία, σχεδιασμένα ώστε να προσομοιώνουν πραγματικά δίκτυα. Από τα 19 συμβάντα που εντοπίστηκαν, δύο αφορούσαν ένα μοντέλο της OpenAI, το GPT‑5.6 Sol. Οι υπόλοιπες περιπτώσεις αφορούσαν μοντέλα άλλου εργαστηρίου.

Για αυτή την αξιολόγηση, οι πράκτορες είχαν λάβει οδηγίες να ενεργήσουν ως ειδικοί κυβερνοασφάλειας σε μια άσκηση Capture the Flag: να παραβιάσουν τρία συνδεδεμένα προσομοιωμένα περιβάλλοντα και να ανακτήσουν μια τελική σημαία. Η προτροπή της εργασίας προσδιόριζε τα δίκτυα του πεδίου που εμπίπτουν στο αντικείμενο της άσκησης και κατονόμαζε αρκετά συστήματα ως εκτός πεδίου. Το UK AISI ενεργοποίησε επίσης την πρόσβαση στο δημόσιο διαδίκτυο, ώστε οι πράκτορες να μπορούν να κατεβάζουν εργαλεία και να λειτουργούν υπό συνθήκες που προσομοίαζαν περισσότερο έναν πραγματικό άνθρωπο-επιτιθέμενο. Απενεργοποίησε επίσης τους ταξινομητές κυβερνοασφάλειας του μοντέλου, ώστε να μετρήσει τις εγγενείς δυνατότητές του.

Το προβλεπόμενο όριο εξουσιοδότησης του UK AISI ήταν το προσομοιωμένο κυβερνοπεδίο: οι πράκτορες είχαν εξουσιοδότηση να επιτεθούν στα καθορισμένα προσομοιωμένα δίκτυα και να ανακτήσουν μια σημαία, όχι να αλληλεπιδράσουν με συστήματα εκτός των ορίων του δικτύου του πεδίου. Ωστόσο, οι πράκτορες δεν είχαν λάβει ρητές οδηγίες σχετικά με το πώς επιτρεπόταν ή δεν επιτρεπόταν να χρησιμοποιήσουν την ανοικτή πρόσβαση στο διαδίκτυο, κάτι που το UK AISI θεωρεί πιθανό παράγοντα που συνέβαλε στο περιστατικό.

Σε όλες αυτές τις εκτελέσεις, το UK AISI διαπίστωσε ότι το GPT‑5.6 Sol προέβη σε δύο μη εξουσιοδοτημένες ενέργειες, ενώ προσπαθούσε να βρει τρόπο εισόδου στο προσομοιωμένο πεδίο και να ανακτήσει τη σημαία:

  1. Το GPT‑5.6 Sol επαναχρησιμοποίησε ένα token του GitHub που ο πράκτορας άλλου εργαστηρίου είχε αφήσει δημόσια προσβάσιμο, για να ελέγξει αν κάποιο σύστημα εντός του πεδίου δοκιμών επικοινωνούσε περιοδικά με το GitHub ή άλλη υπηρεσία ενημερώσεων. Επιχείρησε επίσης να παρακάμψει διαδικασίες ανάκτησης λογαριασμού και όρια αιτημάτων και δημιούργησε λογαριασμούς σε εξωτερικούς παρόχους DNS και διοχέτευσης κίνησης.
  2. Το GPT‑5.6 Sol χρησιμοποίησε μια δημόσια υπηρεσία διοχέτευσης κίνησης, ώστε ένας διακομιστής DNS που εκτελούνταν τοπικά στο περιβάλλον αξιολόγησής του να είναι προσβάσιμος από το δημόσιο διαδίκτυο. Ο διακομιστής περιείχε ωφέλιμα φορτία που προορίζονταν για μια γνωστή ευπάθεια λογισμικού το οποίο εκτελούνταν στο πεδίο δοκιμών. Η διάταξη δεν λειτούργησε, δεν υπάρχουν στοιχεία ότι υποβλήθηκε ερώτημα από πραγματικό αναλυτή DNS και η υποδομή αφαιρέθηκε όταν ολοκληρώθηκε η αξιολόγηση.

Παρότι το μοντέλο προσπαθούσε να ολοκληρώσει την άσκηση στο κυβερνοπεδίο, το UK AISI έκρινε αυτές τις ενέργειες μη εξουσιοδοτημένες, επειδή αφορούσαν πραγματικούς εξωτερικούς λογαριασμούς και υπηρεσίες εκτός των ορίων του πεδίου και δεν ήταν απαραίτητες για την ολοκλήρωση της εργασίας. Ο διακομιστής DNS φιλοξενούσε επίσης στο δημόσιο διαδίκτυο ωφέλιμα φορτία εκμετάλλευσης, αν και η διάταξη δεν λειτούργησε και δεν υπάρχουν στοιχεία ότι υποβλήθηκε ερώτημα από πραγματικό αναλυτή DNS.

Το UK AISI εντόπισε τη δραστηριότητα στις 28 Ιουλίου, όταν η παρακολούθηση ασφαλείας ανίχνευσε ασυνήθιστες μεταφορές δεδομένων. Διέκοψε τις σχετικές αξιολογήσεις, απομόνωσε τα εμπλεκόμενα μηχανήματα και περιόρισε τη δραστηριότητα μέσα σε περίπου μία ώρα από τον εντοπισμό της.

Εκτιμούμε τη συνεργασία του UK AISI σε όλη αυτή τη διαδικασία, συμπεριλαμβανομένης της συμβολής του στον εντοπισμό και τη διερεύνηση της δραστηριότητας, καθώς και στην κοινοποίηση σχετικών λεπτομερειών. Προσβλέπουμε στη συνέχιση της συνεργασίας μας.

Irregular

Στις 29 Ιουλίου, η Irregular, ένας από τους εξωτερικούς συνεργάτες αξιολόγησης της OpenAI, μας ενημέρωσε για ένα περιστατικό που αφορούσε μοντέλα της OpenAI κατά τη διάρκεια αξιολογήσεων κυβερνοασφάλειας τύπου Capture the Flag (CTF). Τα μοντέλα είχαν λάβει οδηγίες να εντοπίσουν κρυμμένες πληροφορίες εκμεταλλευόμενα αδυναμίες μέσα σε ένα προσομοιωμένο περιβάλλον και είχαν ενημερωθεί ότι δεν διέθεταν πρόσβαση στο διαδίκτυο. Ωστόσο, μια εσφαλμένη ρύθμιση στο περιβάλλον δοκιμών επέτρεψε στα μοντέλα να αποκτήσουν πρόσβαση στο δημόσιο διαδίκτυο.

Σε μία δοκιμή, το όνομα του εικονικού στόχου της άσκησης CTF συνέπεσε κατά λάθος με ένα πραγματικό domain. Επειδή το περιβάλλον δοκιμών είχε συνδεθεί κατά λάθος στο διαδίκτυο, το μοντέλο εκμεταλλεύτηκε έναν πραγματικό ιστότοπο, θεωρώντας εσφαλμένα ότι αποτελούσε μέρος του προσομοιωμένου περιβάλλοντος. Δεν επρόκειτο για εξελιγμένη διαφυγή από το sandbox ούτε για ευπάθεια zero-day: η πρόσβαση στο διαδίκτυο οφειλόταν σε εσφαλμένη ρύθμιση και το μοντέλο φαίνεται ότι εκμεταλλεύτηκε μια βασική ευπάθεια ασφαλείας.

Σύμφωνα με την έρευνα της Irregular, το μοντέλο εντόπισε και χρησιμοποίησε επίσης διαπιστευτήρια για να χειριστεί τον ίδιο ιστότοπο. Η Irregular δεν έχει εντοπίσει επιπτώσεις πέρα από τα δεδομένα του ίδιου του επηρεαζόμενου ιστοτόπου, ενώ ο έλεγχός της συνεχίζεται. Έχει αναστείλει τις αξιολογήσεις και έχει ξεκινήσει διορθωτικές ενέργειες, ενώ ενημερώθηκαν τα επηρεαζόμενα τρίτα μέρη. Η Irregular μάς ενημέρωσε ότι κανένα από τα ζητήματα που εντοπίστηκαν σε σχέση με το περιστατικό δεν παραμένει ενεργό και πως προστέθηκαν οι κατάλληλες δικλίδες ασφαλείας στο περιβάλλον δοκιμών. Η Irregular έχει επίσης κοινοποιήσει πληροφορίες για συναφή περιστατικά που αφορούσαν άλλα εργαστήρια στο ίδιο περιβάλλον δοκιμών.

Εκτιμούμε τη συνεργασία της Irregular και θα συνεχίσουμε να συνεργαζόμαστε στενά μαζί της, υποστηρίζοντας την εξέτασή της. Η Irregular συντάσσει επίσης μια λευκή βίβλο, με σκοπό να κοινοποιήσει βέλτιστες πρακτικές για τον περιορισμό συμβάντων και την ασφαλή διεξαγωγή αξιολογήσεων κυβερνοασφάλειας. Προσβλέπουμε στη συμμετοχή μας στη λευκή βίβλο, ώστε τα ευρήματα να γίνουν διαθέσιμα στην κοινότητα, καθώς και στη συνέχιση της συνεργασίας μας. Θεωρούμε ότι αυτού του είδους η συνεργασία είναι απαραίτητη για την ασφαλή και ενδελεχή αξιολόγηση των σημερινών και μελλοντικών μοντέλων.

Συντάκτης

OpenAI