Μετάβαση στο κύριο περιεχόμενο
OpenAI

30 Σεπτεμβρίου 2026

Ασφαλεία συστημάτων

Αναχαίτιση συντονισμένης εκστρατείας απόσταξης μοντέλων

Φόρτωση…

Πρόσφατα εντοπίσαμε και αναχαιτίσαμε μια συντονισμένη εκστρατεία με στόχο την εξαγωγή προστατευμένης συλλογιστικής από τα μοντέλα μας. Η πρώτη δραστηριότητα που παρατηρήσαμε σημειώθηκε την πρώτη εβδομάδα του Ιουλίου. Η δραστηριότητα αυτή συνάδει με την κακόβουλη απόσταξη: τη συστηματική και μη εξουσιοδοτημένη χρήση των αποτελεσμάτων ή της συλλογιστικής ενός μοντέλου για την εκπαίδευση, την αναπαραγωγή ή τη βελτίωση ενός άλλου μοντέλου. Η προστατευμένη συλλογιστική είναι η εσωτερική καταγραφή της επεξεργασίας μιας εργασίας από το μοντέλο. Η εξαγωγή της μπορεί να αποκαλύψει πληροφορίες που δεν περιλαμβάνονται στην τελική απάντηση και να βοηθήσει άλλους να αναπαράγουν τις δυνατότητες του μοντέλου.

Οι δράστες δεν έσπασαν την κρυπτογράφησή μας, δεν παραβίασαν κάποια βάση δεδομένων ούτε απέκτησαν άμεση πρόσβαση σε αποθηκευμένες συνομιλίες χρηστών. Αντίθετα, χειραγώγησαν τις αλληλεπιδράσεις με τα μοντέλα ώστε η προστατευμένη συλλογιστική να αναπαράγεται σε μορφές ορατές στον αιτούντα, συντονισμένα και σε μεγάλη κλίμακα, παραβιάζοντας τους όρους χρήσης μας. Η χειραγώγηση αυτή δεν αφορά ευπάθεια αποκλειστικά των μοντέλων της OpenAI. Έχουμε κοινοποιήσει σχετικές πληροφορίες σε συνεργάτες του κλάδου μέσω του Frontier Model Forum, για να ενισχύσουμε τη συλλογική άμυνα απέναντι στην κακόβουλη απόσταξη.

Πριν από τη δημοσίευση, διερευνήσαμε την έκταση και τον πιθανό αντίκτυπο, εφαρμόσαμε δικά μας μέτρα αντιμετώπισης, κοινοποιήσαμε πληροφορίες σε ερευνητές και συνεργάτες του κλάδου και λάβαμε τα σχόλιά τους, ώστε να διασφαλίσουμε ότι υπάρχουν μέτρα προστασίας από τέτοιες επιθέσεις. Οι πρόσθετες εργασίες αντιμετώπισης και διερεύνησης συνεχίζονται. Πιστεύουμε ότι η κοινοποίηση όσων μάθαμε σε αυτό το στάδιο θα βοηθήσει το ευρύτερο οικοσύστημα να ενισχύσει την άμυνά του.

Τι παρατηρήσαμε

Παρατηρήσαμε δράστες να επιχειρούν την εξαγωγή προστατευμένης συλλογιστικής με νέους τρόπους. Μεταξύ άλλων, αντέγραφαν κρυπτογραφημένη συλλογιστική από μια συνομιλία και ζητούσαν από ένα μοντέλο σε άλλη συνομιλία να αποκρυπτογραφήσει και να μεταγράψει το κρυφό περιεχόμενο της συλλογιστικής.

Ανεξάρτητοι ερευνητές ασφάλειας⁠(ανοίγει σε νέο παράθυρο) μάς επισήμαναν επίσης, μέσω υπεύθυνης γνωστοποίησης, σχετικές ευπάθειες που αφορούν την αλληλεπίδραση μεταξύ μοντέλων και τη συμπύκνωση συνομιλιών. Διερευνήσαμε τα ευρήματά τους και επιβεβαιώσαμε ότι οι οδοί επίθεσης που εντόπισαν ήταν υπαρκτές. Το έργο τους μας βοήθησε να κατανοήσουμε την ευρύτερη κατηγορία επιθέσεων και να επιταχύνουμε την εφαρμογή μέτρων αντιμετώπισης.

Η δραστηριότητα ξεκίνησε την 1η Ιουλίου, αρχικά σε μικρή κλίμακα, ώσπου στις 24 και 25 Ιουλίου παρατηρήσαμε απότομες αυξήσεις: 16.000 αιτήματα1 από περισσότερους από 4.000 χρήστες, με χρήση σχετικού μοτίβου εξαγωγής. Η περαιτέρω έρευνα εντόπισε δραστηριότητα με συναφή μοτίβα προτροπών σε μια ομάδα άνω των 15.000 χρηστών, την οποία διακόψαμε πλήρως έως τις 28 Ιουλίου.

Η δραστηριότητα εξελισσόταν με την πάροδο του χρόνου, επιβεβαιώνοντας ότι η κακόβουλη απόσταξη αποτελεί ευρύτερη πρόκληση ασφάλειας που απαιτεί πολυεπίπεδη, προσαρμοστική άμυνα.

Η εκτίμησή μας για την απόδοση ευθύνης

Δεν είναι σαφές αν όλοι οι δράστες που παρατηρήσαμε κατά το συγκεκριμένο διάστημα ενεργούσαν για λογαριασμό ενός και μόνο φορέα. Ωστόσο, αποδίδουμε έναν βασικό πυρήνα της δραστηριότητας σε άτομα που συνδέονται με τη Moonshot AI, την εταιρεία που ανέπτυξε το Kimi.

Γιατί έχει σημασία

Η κακόβουλη απόσταξη ενέχει κινδύνους για την ασφαλή χρήση των μοντέλων και την εθνική ασφάλεια. Η συλλογιστική που εξάγεται θα μπορούσε να χρησιμοποιηθεί για την εκπαίδευση ενός άλλου μοντέλου, χωρίς να διατηρούνται οι δικλίδες ασφαλείας που εφαρμόζονται στα αποτελέσματα του αρχικού μοντέλου τα οποία βλέπουν οι χρήστες. Σε μεγάλη κλίμακα, η απόσταξη μπορεί επίσης να επιταχύνει τη μεταφορά προηγμένων δυνατοτήτων, χωρίς να απαιτεί αντίστοιχη επένδυση στην ασφάλεια. Οι ανησυχίες αυτές εντείνονται καθώς τα μοντέλα αποκτούν δυνατότητες σε τομείς διττής χρήσης.

Αυτός ο κίνδυνος δεν αφορά μόνο την OpenAI. Όπως αναφέρθηκε παραπάνω, παρόμοιες τεχνικές ενδέχεται να επηρεάζουν και άλλα προηγμένα συστήματα AI. Πρόκειται, επομένως, για μια κοινή πρόκληση ασφάλειας που απαιτεί συντονισμό σε ολόκληρο τον κλάδο.

Πώς ανταποκριθήκαμε

Αντιμετωπίσαμε αυτή την πρόσφατη εκστρατεία απόσταξης συνδυάζοντας μέτρα επιβολής των κανόνων σε λογαριασμούς, τεχνικούς ελέγχους και συντονισμό με συνεργάτες. Αποκλείσαμε ή περιορίσαμε λογαριασμούς που χρησιμοποιούνταν για δόλιες ενέργειες, ενισχύσαμε τους ελέγχους κατά την εγγραφή και στην υποδομή και διευρύναμε την παρακολούθηση σχετικών δικτύων.

Ενισχύσαμε επίσης την προστασία της κρυφής συλλογιστικής μεταξύ χρηστών, χώρων εργασίας, οργανισμών και οικογενειών μοντέλων. Κλείσαμε μια οδό που επέτρεπε σε κάποιον ο οποίος ήδη κατείχε την κρυπτογραφημένη συλλογιστική άλλου χρήστη να την επανυποβάλει και να ανακτήσει το περιεχόμενό της. Προσθέσαμε επίσης ελέγχους για τον εντοπισμό και την αναστολή μετάδοσης αποτελεσμάτων ροής που ενδέχεται να αποκαλύπτουν συλλογιστική. Όταν σχετική δραστηριότητα μεταφέρθηκε σε υπηρεσίες τρίτων, συνεργαστήκαμε με τους παρόχους τους για να εντοπίσουμε τους εμπλεκόμενους λογαριασμούς και να διακόψουμε τη δράση τους.

Τέλος, κοινοποιήσαμε σχετικά ευρήματα μέσω του Frontier Model Forum και των κατάλληλων κρατικών διαύλων ανταλλαγής πληροφοριών, ώστε άλλοι φορείς ανάπτυξης κορυφαίων μοντέλων και συνεργάτες του δημόσιου τομέα να μπορούν να αναζητήσουν παρόμοια δραστηριότητα και να ενισχύσουν τη δική τους άμυνα. Συστήματα που υποστηρίζουν μεταφέρσιμα ή επανυποβαλλόμενα τεχνουργήματα συλλογιστικής ενδέχεται να αντιμετωπίζουν συναφείς κινδύνους.

Τα επόμενα βήματα

Αναμένουμε ότι οι απόπειρες κακόβουλης απόσταξης θα γίνονται πιο εξελιγμένες, καθώς τα κορυφαία μοντέλα βελτιώνονται και οι δράστες αναζητούν φθηνότερους τρόπους να μιμηθούν τις δυνατότητές τους. Η άμυνα απέναντι σε αυτή τη δραστηριότητα απαιτεί πολυεπίπεδους ελέγχους και συνεχή προσαρμογή.

Αυτή η προσπάθεια δεν έχει ολοκληρωθεί. Οι υλοποιήσεις που φιλοξενούνται από συνεργάτες χρειάζονται τα ίδια μέτρα προστασίας με τις δικές μας υπηρεσίες, ενώ οι επιθέσεις μέσω αποτελεσμάτων εργαλείων απαιτούν μέτρα προστασίας που εξετάζουν περισσότερα από το συνηθισμένο ορατό κείμενο. Συνεχίζουμε να βελτιώνουμε την άμυνα των εργαλείων, την κάλυψη των ταξινομητών και τις αρνήσεις των μοντέλων, καθώς και να επεκτείνουμε τους σχετικούς ελέγχους στους συνεργάτες μας στο cloud.

Η απόκρισή μας θα συνεχίσει να εστιάζει σε τρεις τομείς: ισχυρότερη τεχνική προστασία από την εξαγωγή, καλύτερος εντοπισμός συντονισμένων εκστρατειών και επιβολή μέτρων εναντίον τους, και εντατικότερη ανταλλαγή πληροφοριών για απειλές μεταξύ του κλάδου και των κρατικών φορέων.

Συντάκτης

OpenAI

Υποσημειώσεις

  1. 1

    Τα στοιχεία αυτά αφορούν απόπειρες εξαγωγής, όχι απαραίτητα επιτυχείς.