OpenAI και Hugging Face συνεργάζονται για περιστατικό ασφάλειας στην αξιολόγηση μοντέλου
Την περασμένη εβδομάδα, η Hugging Face γνωστοποίησε ένα νέο είδος περιστατικού ασφάλειας(ανοίγει σε νέο παράθυρο), αφού εντόπισε και περιόρισε έναν πράκτορα ΤΝ που παραβίασε την υποδομή της — κάτι που αναμένουμε να γίνεται πιο συνηθισμένο με τη διάδοση μοντέλων με ολοένα μεγαλύτερες κυβερνοδυνατότητες. Μετά τη διερεύνηση, γνωρίζουμε πλέον ότι το συγκεκριμένο περιστατικό προκλήθηκε από έναν συνδυασμό μοντέλων της OpenAI — συμπεριλαμβανομένου του GPT‑5.6 Sol και ενός ακόμη ικανότερου μοντέλου πριν από την κυκλοφορία, όλα με μειωμένες αρνήσεις σε κυβερνοζητήματα για σκοπούς αξιολόγησης — ενώ δοκιμάζονταν εσωτερικά σε ένα benchmark(ανοίγει σε νέο παράθυρο) κυβερνοδυνατοτήτων.
Θεωρούμε ότι πρόκειται για ένα πρωτοφανές κυβερνοπεριστατικό, που περιλαμβάνει υπερσύγχρονες κυβερνοδυνατότητες, και ανταποκρινόμαστε αναλόγως. Σε αυτό το στάδιο κοινοποιούμε προκαταρκτικά ευρήματα για να βοηθήσουμε τους αμυνόμενους να κατανοήσουν τι συνέβη και να προσαρμόσουν την αντίληψή τους για το τι μπορούν πλέον να κάνουν τα μοντέλα. Θα συνεχίσουμε να διεξάγουμε διεξοδική έρευνα μαζί με τη Hugging Face και θα κοινοποιήσουμε περισσότερες λεπτομέρειες για τα τρωτά σημεία, το περιστατικό και τα ευρήματα όταν ολοκληρωθεί η έρευνά μας.
Το περιστατικό αυτό συνέβη κατά τη διάρκεια εσωτερικής αξιολόγησης που ωθεί τα μοντέλα να επιδιώκουν προηγμένη εκμετάλλευση μέσω σύνθετων διαδρομών επίθεσης, με στόχο την ποσοτικοποίηση των κυβερνοδυνατοτήτων τους. Εκτιμούμε τις μέγιστες κυβερνοδυνατότητες εκτελώντας αυτή την αξιολόγηση χωρίς τους ταξινομητές παραγωγής που χρησιμοποιούνται για να εμποδίζουν τα μοντέλα να επιδιώκουν κυβερνοδραστηριότητα υψηλού κινδύνου. Τα benchmark μας εκτελούνται σε ένα ιδιαίτερα απομονωμένο περιβάλλον, με την πρόσβαση στο δίκτυο περιορισμένη στη δυνατότητα εγκατάστασης πακέτων μέσω εσωτερικά φιλοξενούμενου λογισμικού τρίτου μέρους που λειτουργεί ως διακομιστής μεσολάβησης και cache για μητρώα πακέτων.
Τα μοντέλα εντόπισαν και αλυσίδωσαν τρωτά σημεία στο ερευνητικό περιβάλλον της OpenAI και στην παραγωγική υποδομή της Hugging Face, ώστε να αποκτήσουν λύσεις δοκιμών απευθείας από τη βάση δεδομένων παραγωγής της Hugging Face. Όλα τα στοιχεία δείχνουν ότι τα μοντέλα ήταν υπερβολικά εστιασμένα στην εύρεση λύσης για το ExploitGym, φτάνοντας στα άκρα για να επιτύχουν έναν μάλλον στενό στόχο δοκιμών.
Ενώ λειτουργούσαν στο περιβάλλον δοκιμών μας τύπου sandbox, τα μοντέλα μας δαπάνησαν σημαντικό όγκο υπολογισμού συμπερασμού για να βρουν τρόπο να αποκτήσουν ανοικτή πρόσβαση στο Διαδίκτυο, προκειμένου να λύσουν το πρόβλημα της αξιολόγησης. Για να αποκτήσουν πρόσβαση, τα μοντέλα εντόπισαν και εκμεταλλεύτηκαν ένα zero-day τρωτό σημείο (το οποίο έχουμε πλέον γνωστοποιήσει υπεύθυνα στον προμηθευτή) στον διακομιστή μεσολάβησης cache του μητρώου πακέτων. Με αυτή την πρόσβαση, τα μοντέλα μας εκτέλεσαν μια σειρά ενεργειών κλιμάκωσης προνομίων και πλευρικής μετακίνησης στο ερευνητικό περιβάλλον δοκιμών μας, έως ότου έφτασαν σε έναν κόμβο με πρόσβαση στο Διαδίκτυο.
Αφού απέκτησαν πρόσβαση στο Διαδίκτυο, τα μοντέλα συμπέραναν ότι η Hugging Face ενδέχεται να φιλοξενούσε μοντέλα, σύνολα δεδομένων και λύσεις για το ExploitGym. Γνωρίζοντάς το αυτό, το μοντέλο αναζήτησε και βρήκε με επιτυχία τρόπους να αποκτήσει πρόσβαση σε μυστικές πληροφορίες που θα μπορούσε να χρησιμοποιήσει για να εξαπατήσει την αξιολόγηση. Σε ένα παράδειγμα, το μοντέλο συνέδεσε πολλαπλούς φορείς επίθεσης, μεταξύ άλλων χρησιμοποιώντας κλεμμένα διαπιστευτήρια και zero-day τρωτά σημεία, για να βρει μια διαδρομή απομακρυσμένης εκτέλεσης κώδικα στους διακομιστές της Hugging Face. Η ομάδα ασφάλειας της OpenAI ανακάλυψε εσωτερικά αυτή την ανώμαλη δραστηριότητα.
Η ομάδα ασφάλειας και οι πράκτορες της Hugging Face εντόπισαν και σταμάτησαν τη δραστηριότητα στην υποδομή της και είχαν ήδη ξεκινήσει τον περιορισμό και την εγκληματολογική ανασύνθεση με τα δικά τους μοντέλα ανοικτού κώδικα όταν συνδέθηκαν οι ομάδες μας. Συνεργαζόμαστε ενεργά μαζί τους για να συνεχίσουμε τη διερεύνηση του περιστατικού. Είμαστε ευγνώμονες για την ταχεία και στενή συνεργασία της Hugging Face στη διερεύνηση και την αποκατάσταση.
- Στο πλαίσιο της έρευνας, εφαρμόζουμε αυστηρούς ελέγχους στη διαμόρφωση της υποδομής, με κόστος στην ταχύτητα της έρευνας, όσο διορθώνονται τα τρωτά σημεία. Ενημερώνουμε τακτικά την Επιτροπή Ασφάλειας και Προστασίας μας για αυτούς τους ελέγχους και τον αντίκτυπό τους.
- Συνεργαζόμαστε με τη Hugging Face για την εγκληματολογική διερεύνηση του περιστατικού.
- Έχουμε γνωστοποιήσει υπεύθυνα το εντοπισμένο zero-day τρωτό σημείο στο εσωτερικά φιλοξενούμενο λογισμικό τρίτου μέρους και συνεργαζόμαστε μαζί τους για τη διόρθωσή του.
- Έχουμε εντάξει τη Hugging Face στο πρόγραμμα αξιόπιστης πρόσβασης και υποστηρίζουμε τις ομάδες της ώστε να αξιοποιήσουν γρήγορα τις δυνατότητες των μοντέλων μας για να βελτιώσουν την άμυνά τους.
- Βελτιώνουμε και προσθέτουμε ισχυρότερες προστασίες για μελλοντική εκπαίδευση και αξιολογήσεις. Αυτή την εβδομάδα, δημοσιεύσαμε ένα ιστολόγιο σχετικά με τη βελτίωση της ασφάλειας και της ευθυγράμμισης σε μια εποχή μοντέλων μεγάλου χρονικού ορίζοντα. Αυτές οι διασφαλίσεις ανάπτυξης σκοπίμως δεν ενεργοποιήθηκαν κατά την αξιολόγηση, επειδή στόχος της ήταν η δοκιμή κυβερνοτρωτών σημείων. Το περιστατικό αυτό αναδεικνύει την ανάγκη να ενισχύσουμε περαιτέρω την ευθυγράμμιση του μοντέλου μας, τις κυβερνοπροστασίες κατά την αξιολόγηση και την παρακολούθηση στις εσωτερικές δοκιμές.
Όπως κοινοποιήσαμε πρόσφατα, η ΤΝ επιταχύνει την ανακάλυψη και την εκμετάλλευση τρωτών σημείων. Το βασικό δίδαγμα από αυτό το περιστατικό είναι ότι η ασφάλεια και η προστασία των μοντέλων πρέπει να συμβαδίζουν με τις δυνατότητες που εξελίσσονται ραγδαία. Ενισχύουμε τις πρακτικές περιορισμού, παρακολούθησης, ελέγχου πρόσβασης και αξιολόγησης που χρησιμοποιούνται κατά την ανάπτυξη μοντέλων.
Η αξιολόγηση του UK AISI δείχνει ότι μοντέλα όπως το GPT‑5.6 Sol μπορούν όλο και περισσότερο να διατηρούν σύνθετες, πολυβηματικές κυβερνοεπιχειρήσεις σε μεγάλους χρονικούς ορίζοντες. Το περιστατικό αυτό δείχνει ότι αυτές οι θεωρητικές δυνατότητες πράγματι εφαρμόζονται σε πραγματικές συνθήκες.

Το περιστατικό καθιστά επίσης σαφές ότι προηγμένα μοντέλα μπορούν να ανακαλύπτουν και να εκμεταλλεύονται νέες διαδρομές επίθεσης σε πραγματικά συστήματα χωρίς πρόσβαση στον πηγαίο κώδικα. Αναδεικνύει ότι οι προηγμένες κυβερνοδυνατότητες πρέπει να αναπτύσσονται μαζί με ισχυρότερες διασφαλίσεις και αμυντικά εργαλεία.
Πιστεύουμε ότι τα μοντέλα με προηγμένες κυβερνοδυνατότητες πρέπει να βοηθούν τις ομάδες ασφάλειας να βρίσκουν αδυναμίες πριν από τους επιτιθέμενους, να κατανοούν πώς μπορούν να αλυσιδωθούν τα τρωτά σημεία και να τα αποκαθιστούν με ταχύτητα μηχανής. Χρησιμοποιούμε αυτές τις δυνατότητες για να συνεχίσουμε να ενισχύουμε τις προστασίες γύρω από τη διαμόρφωση υποδομής και τα περιβάλλοντα αξιολόγησης μοντέλων· θα κοινοποιούμε τα ευρήματα και τις βέλτιστες πρακτικές μας καθώς μαθαίνουμε. Ενθαρρύνουμε και άλλους αμυνόμενους να υποβάλουν αίτηση για αξιόπιστη πρόσβαση και να πειραματιστούν τώρα με αυτά τα μοντέλα, ώστε να μετατρέψουν αυτές τις δυνατότητες σε καλύτερη πρόληψη, ταχύτερο εντοπισμό και αποτελεσματικότερη απόκριση σε περιστατικά.
«Είμαστε ευγνώμονες για τη συνεργασία με την OpenAI σε αυτό και σε άλλα θέματα. Το περιστατικό αυτό, πιθανώς το πρώτο του είδους του, επιβεβαιώνει κάτι που πιστεύουμε εδώ και καιρό: η ασφάλεια της ΤΝ δεν θα λυθεί από μία μόνο εταιρεία που εργάζεται μυστικά. Θα λυθεί ανοικτά, συνεργατικά, με ευρεία πρόσβαση στην ΤΝ για κάθε αμυνόμενο, παντού.»


