Koordinierte Kampagne zur Modelldestillation unterbinden
Wir haben kürzlich eine koordinierte Kampagne erkannt und unterbunden, die darauf abzielte, geschütztes Reasoning aus unseren Modellen zu extrahieren. Die ersten Aktivitäten beobachteten wir in der ersten Juliwoche. Diese Aktivitäten entsprechen dem Muster adversarieller Destillation: Dabei werden die Ergebnisse oder das Reasoning eines Modells systematisch und unbefugt genutzt, um ein anderes Modell zu trainieren, nachzubilden oder zu verbessern. Geschütztes Reasoning ist die interne Aufzeichnung eines Modells über die Bearbeitung einer Aufgabe. Seine Extraktion kann Informationen offenlegen, die in der endgültigen Antwort zurückgehalten werden, und anderen helfen, die Fähigkeiten des Modells nachzubilden.
Die Beteiligten haben weder unsere Verschlüsselung geknackt noch eine Datenbank kompromittiert oder direkten Zugriff auf gespeicherte Gespräche anderer Personen erlangt. Stattdessen manipulierten sie Interaktionen mit den Modellen so, dass geschütztes Reasoning in einer für die anfragende Person sichtbaren Form wiedergegeben werden konnte. Sie gingen dabei koordiniert und in großem Umfang vor und verstießen gegen unsere Nutzungsbedingungen. Die für diese Manipulation genutzte Schwachstelle betrifft nicht nur Modelle von OpenAI. Wir haben über das Frontier Model Forum Informationen dazu mit Partnerunternehmen der Branche geteilt, um die gemeinsame Abwehr adversarieller Destillation zu stärken.
Vor der Veröffentlichung haben wir den Umfang und die möglichen Auswirkungen untersucht und eigene Gegenmaßnahmen umgesetzt. Zudem haben wir Erkenntnisse mit Forschenden und Partnerunternehmen der Branche geteilt und deren Rückmeldungen eingeholt, um sicherzustellen, dass Schutzmaßnahmen gegen diese Art von Angriff bestehen. Weitere Untersuchungen und Arbeiten an Gegenmaßnahmen laufen noch. Wir sind überzeugt, dass die Veröffentlichung unserer bisherigen Erkenntnisse dem gesamten Ökosystem hilft, seine Abwehr zu stärken.
Wir beobachteten, wie Beteiligte mit neuartigen Methoden versuchten, geschütztes Reasoning zu extrahieren. Unter anderem kopierten sie verschlüsseltes Reasoning aus einem Gespräch und forderten ein Modell in einem anderen Gespräch auf, die verborgenen Reasoning-Inhalte zu entschlüsseln und zu transkribieren.
Auch unabhängige Sicherheitsforschende(wird in einem neuen Fenster geöffnet) wiesen uns im Rahmen einer verantwortungsvollen Offenlegung auf verwandte Schwachstellen hin, die modellübergreifend und bei der Kontextverdichtung von Gesprächen auftreten. Wir haben ihre Erkenntnisse untersucht und bestätigt, dass die identifizierten Angriffswege tatsächlich existierten. Ihre Arbeit half uns, die übergeordnete Angriffsklasse zu verstehen und Gegenmaßnahmen schneller umzusetzen.
Die Aktivitäten begannen am 1. Juli, zunächst in geringem Umfang. Am 24. und 25. Juli beobachteten wir dann starke Spitzen mit 16.000 Anfragen1 von über 4.000 Personen, die ein einschlägiges Extraktionsmuster nutzten. Weitere Untersuchungen ergaben Aktivitäten mit verwandten Prompt-Mustern innerhalb einer Gruppe von mehr als 15.000 Personen. Diese Aktivitäten hatten wir bis zum 28. Juli vollständig unterbunden.
Die Aktivitäten veränderten sich im Laufe der Zeit. Das verdeutlicht, dass adversarielle Destillation eine umfassendere Sicherheitsherausforderung darstellt, die mehrstufige, anpassungsfähige Abwehrmaßnahmen erfordert.
Es ist unklar, ob alle im betreffenden Zeitraum beobachteten Beteiligten einem einzigen Akteur zuzuordnen waren. Einen zentralen Teil der Aktivitäten ordnen wir jedoch Personen zu, die mit Moonshot AI in Verbindung stehen, dem Unternehmen, das Kimi entwickelt.
Adversarielle Destillation birgt Risiken für die Sicherheit von KI und die nationale Sicherheit. Extrahiertes Reasoning könnte zum Trainieren eines anderen Modells verwendet werden, ohne die Schutzmaßnahmen beizubehalten, die für die nutzerseitig sichtbaren Ergebnisse des ursprünglichen Modells gelten. In großem Maßstab kann Destillation auch den Transfer fortgeschrittener Fähigkeiten beschleunigen, ohne dass dafür dieselben Investitionen in Sicherheit erforderlich sind. Diese Bedenken nehmen zu, wenn Modelle Fähigkeiten in Bereichen mit zivilen und militärischen Anwendungsmöglichkeiten hinzugewinnen.
Dieses Risiko betrifft nicht nur OpenAI. Wie oben erwähnt, können ähnliche Techniken auch andere fortgeschrittene KI-Systeme betreffen. Es handelt sich daher um eine gemeinsame Sicherheitsherausforderung, die eine branchenweite Abstimmung erfordert.
Wir haben diese jüngste Destillationskampagne durch eine Kombination aus Maßnahmen gegen Konten, technischen Kontrollen und der Abstimmung mit Partnerunternehmen eingedämmt. Wir haben betrügerische Konten gesperrt oder eingeschränkt, Kontrollen bei der Registrierung und in der Infrastruktur verstärkt und die Überwachung zugehöriger Netzwerke ausgeweitet.
Außerdem haben wir den Schutz verborgenen Reasonings über Nutzerkonten, Arbeitsbereiche, Organisationen und Modellfamilien hinweg verstärkt. Wir haben einen Angriffsweg geschlossen, über den Personen, die bereits verschlüsseltes Reasoning aus dem Nutzerkonto einer anderen Person besaßen, dieses erneut einspielen und seine Inhalte wiederherstellen konnten. Zusätzlich haben wir Prüfungen eingeführt, die gestreamte Ausgaben erkennen und zurückhalten, wenn diese Reasoning offenlegen könnten. Als sich verwandte Aktivitäten auf Dienste Dritter verlagerten, arbeiteten wir mit diesen Anbietern zusammen, um die beteiligten Konten zu identifizieren und ihre Aktivitäten zu unterbinden.
Schließlich teilten wir relevante Erkenntnisse über das Frontier Model Forum und geeignete staatliche Kanäle zum Informationsaustausch. So konnten andere Unternehmen, die Frontier-Modelle entwickeln, und Partnerorganisationen im öffentlichen Sektor nach ähnlichen Aktivitäten suchen und ihre eigene Abwehr stärken. Systeme, die übertragbare oder erneut einspielbare Reasoning-Artefakte unterstützen, können ähnlichen Risiken ausgesetzt sein.
Wir erwarten, dass Versuche adversarieller Destillation ausgefeilter werden, während sich Frontier-Modelle verbessern und Akteure nach günstigeren Wegen suchen, deren Fähigkeiten nachzubilden. Die Abwehr dieser Aktivitäten erfordert mehrstufige Kontrollen und kontinuierliche Anpassungen.
Diese Arbeit ist noch nicht abgeschlossen. Von Partnerunternehmen gehostete Bereitstellungen benötigen denselben Schutz wie direkt von uns betriebene Dienste. Angriffe über Tool-Ausgaben erfordern Schutzmaßnahmen, die mehr als nur gewöhnlichen sichtbaren Text prüfen. Wir verbessern weiterhin die Schutzmaßnahmen für Tools, die Abdeckung durch Klassifikatoren und die Fähigkeit der Modelle, unzulässige Anfragen abzulehnen. Zudem weiten wir relevante Kontrollen auf unsere Cloud-Partnerunternehmen aus.
Unsere Maßnahmen werden sich weiterhin auf drei Bereiche konzentrieren: einen stärkeren technischen Schutz vor Extraktion, eine bessere Erkennung koordinierter Kampagnen und ein wirksameres Vorgehen dagegen sowie einen intensiveren Austausch von Bedrohungsinformationen zwischen Unternehmen und staatlichen Stellen.

