Zum Hauptinhalt springen
OpenAI

28. September 2026

Sicherheit

Auf dem Weg zu Sicherheitsnachweisen für das Training von Frontier-KI

Laden …

Wir glauben, dass eine neue Ära beginnt, in der eine strukturierte Sicherheitsdokumentation Voraussetzung sein sollte, um einen Frontier-Trainingslauf mit Reinforcement Learning fortzusetzen. Idealerweise würde diese Dokumentation den Standard von „Sicherheitsnachweisen“ erreichen: umfassende, strukturierte und evidenzbasierte Argumentationen zu Risiken, wie sie in anderen sicherheitskritischen Branchen eingesetzt werden. Wir betrachten Sicherheitsnachweise als langfristiges Ziel, auf das wir hinarbeiten. Zugleich erkennen wir an, wie schwierig es ist, sie für KI-Modelle ebenso belastbar zu gestalten wie für die Luftfahrt oder die Kernenergie, da jede neue Stufe der KI-Fähigkeiten neue Komplexität mit sich bringt. Wir arbeiten an einem Rahmenwerk, um diese Verfahren systematisch festzuhalten.

Im Folgenden stellen wir erste Leitlinien vor, die aus unserer Sicht Teil solcher Sicherheitsnachweise für das Training von Frontier-KI sein sollten. Diese bewährten Verfahren spiegeln unsere bisherigen Erkenntnisse wider. Wir erwarten, dass sie sich weiterentwickeln, während wir unsere internen Prozesse für eine sorgfältige Entwicklung fortlaufend verbessern. Wir veröffentlichen sie jetzt, um unsere aktuellen Überlegungen transparent zu machen, und laden die Fachgemeinschaft ein, uns Rückmeldung zu geben. Dieses Dokument konzentriert sich auf das Frontier-Training mit Reinforcement Learning. Für den internen und externen Einsatz muss ein deutlich breiteres Spektrum an Alignment-Eigenschaften berücksichtigt werden.

1. Technische Schutzmaßnahmen

Sicherheitsnachweise sollten drei Aspekte des technischen Systems abdecken: Alignment-Training, Abschirmung und Überwachung. Diese Schutzmaßnahmen tragen dazu bei, dass das Modell keine fehlgeleiteten Handlungen versucht. Sollte es dies dennoch tun, erschweren sie das Durchbrechen der Abschirmung und ermöglichen es der Überwachung, das Verhalten zu erkennen, bevor Schaden entsteht.

  • Modell-Alignment: Die erste Schutzmaßnahme sollte darin bestehen, Modelle auf Alignment zu trainieren, also darauf, zuverlässig in unserem Sinne zu handeln. Dazu könnten gehören:

    • Trainingsumgebungen und Bewertung: Das Risiko fehlgeleiteten Modellverhaltens senken, indem verhindert wird, dass das Ausnutzen des Belohnungssystems im Training positiv verstärkt wird. Dazu könnten gehören:

      • Automatisierte Datensatzprüfungen: Agenten einsetzen, um fehlerhafte RL-Umgebungen zu finden und zu korrigieren, in denen fehlgeleitete Handlungsabläufe durch das Ausnutzen von Schwachstellen statt durch beabsichtigtes Verhalten hohe Belohnungen erzielen könnten. So werden Gelegenheiten zur Verstärkung von Fehlausrichtung im Training reduziert.

      • Manuelle Datensatzprüfungen: Automatisiertes Red Teaming durch manuelle Prüfungen und Qualitätskontrollen von Datensätzen ergänzen, um fehlerhafte Aufgaben zu erkennen, die unbeabsichtigt fehlgeleitetes Verhalten verstärken könnten.

      • Anpassung der Bewertungssysteme: Bewertungssysteme so abstimmen, dass sie Versuche des Modells bestrafen, während des Trainings Schwachstellen in RL-Umgebungen auszunutzen oder diese zu manipulieren.

      • Analyse früherer Trainingsläufe: Ablaufprotokolle früherer Experimente mit Klassifikatoren prüfen, um sicherzustellen, dass die Bewertungssysteme wie beabsichtigt funktionieren.

    • Alignment-Messung: Mit Evaluationen die Neigung des Modells zur Fehlausrichtung erfassen, um die Wirksamkeit des Alignment-Trainings zu messen. Dazu könnten gehören:

      • Offline-Alignment-Evaluationen: Während Frontier-Trainingsläufen Alignment-Evaluationen durchführen, um zu prüfen, ob das Training wie beabsichtigt funktioniert, und wesentliche Verschlechterungen untersuchen.

      • Rücktests: Alignment-Evaluationen anhand früherer Vorfälle rücktesten, um zu bestätigen, dass sie zuvor fehlgeleitete Modelle erkennen und nicht übermäßig an bestimmte Vorfälle angepasst werden.

      • Manipulation von Evaluationen erfassen: Evaluationsbewusstsein oder Metagaming (Modelle erkennen, dass sie getestet werden) erfassen, das Verhaltensänderungen auslösen könnte, und konkrete Schwellenwerte für eine Blockierung festlegen. Dazu etwa bei Alignment-Evaluationen Überwachungssysteme für Evaluationsbewusstsein und Metagaming aktivieren.

      • Stresstests für den schlimmsten Fall: Das schlimmstmögliche Fehlverhalten hervorrufen und prüfen, ob mindestens eine Evaluation dieses Verhalten erkennen würde.

    • Training anhand der Gedankenkette verhindern: Automatisierten Bewertungssystemen beim Reinforcement Learning keinen Einblick in die Gedankenkette gewähren. So wird verhindert, dass Modelle lernen, Überwachungssysteme für Gedankenketten zu umgehen.

  • Abschirmung: Sandboxing und Sicherheitsmaßnahmen so robust gestalten, dass sie schädliche Handlungen verhindern, falls ein Modell fehlgeleitet wird. Dazu könnten gehören:

    • Mehrstufige Infrastruktursicherheit: Umfassend in die Härtung sowohl der Sandbox, in der das Modell läuft, als auch der sie beherbergenden Forschungsinfrastruktur investieren. So besteht eine zusätzliche Schutzschicht, falls das Modell aus der Sandbox ausbricht.

    • Red Teaming der Abschirmung: Die Sicherheit von Sandbox, Forschungsinfrastruktur und Netzwerkgrenzen durch wiederholtes Red Teaming verbessern. Dabei vorbehaltlich einer Sicherheitsanalyse Checkpoints aus Frontier-Trainingsläufen einsetzen, um Lücken zu finden und zu schließen. Auch alle Dienste, auf die das Modell während des Trainings zugreifen könnte (z. B. den Internet-Cache), gezielten Sicherheitstests unterziehen.

    • Kommunikation zwischen Samples: Kommunikation mit hoher Bandbreite zwischen Samples auf genehmigte Wege wie Multi-Agenten-Werkzeuge beschränken. Seitenkanäle in der Infrastruktur schließen, die eine hohe Bandbreite bieten und für Agenten leicht zu entdecken sind.

    • Unveränderliche Transkripte: Agenten-Transkripte für sämtliche RL-Trainings, Evaluationen und internen Einsätze über einen angemessenen Zeitraum unveränderlich speichern (z. B. in nur einmal beschreibbaren Speicherkonten). Das ermöglicht zuverlässige Untersuchungen von Vorfällen und verhindert versehentliche Änderungen.

  • Überwachung: Ein Echtzeit-Überwachungssystem vorhalten, das mögliche Fehlausrichtungen erkennt, sobald Modelle fehlgeleitete Handlungen ausführen. Prioritäre Probleme rasch beheben, bevor ein schwerwiegender Vorfall eintreten kann. Dazu könnten gehören:

    • Überwachbarkeit durchsetzen: Sicherstellen, dass Modelle überwachbar bleiben, um bedenkliches Verhalten früh zu erkennen. Dies anhand von Evaluationen zur Überwachbarkeit und zur Umgehung der Überwachung mit klaren Schwellenwerten messen.

    • Hohe Erkennungsrate bei bekannten Problemen: Sicherstellen, dass das Überwachungssystem in einer Evaluation mit zurückgehaltenen Testdaten eine hohe Erkennungsrate bei früheren Vorfällen erreicht.

    • Aktuelle Evaluationen für Überwachungssysteme: Für neue Trainingsläufe Evaluationsdatenpunkte erstellen, die neu hinzugekommene Risiken repräsentieren. So bleiben die Messwerte für Erkennungsrate und Präzision der Überwachung aktuell.

    • Schnelle Reaktion: Prioritätsalarme einrichten, die innerhalb einer festgelegten Service-Level-Vereinbarung (SLA) zu einer Reaktion führen, bevor das Modell Schaden anrichtet. Dazu entweder eine Person im Bereitschaftsdienst alarmieren oder den betroffenen Trainingslauf automatisch pausieren (z. B. tagsüber den Sicherheitsbereitschaftsdienst und die für den Lauf verantwortliche Person alarmieren und nachts Trainingsläufe bei unbestätigten Alarmen automatisch pausieren).

2. Operative Leitlinien

Neben Empfehlungen zu technischen Schutzmaßnahmen erarbeiten wir bewährte operative Verfahren für Sicherheitsnachweise bei Trainingsläufen von Frontier-KI. Dazu könnten gehören:

  • Gegenpositionen (Prä-Mortem-Analysen): Nach dem Entwurf eines Sicherheitsnachweises sollte eine Person aus einem anderen Team eine Gegenposition verfassen. Sie sollte mögliche Lücken aufzeigen und eine realistische Risikoeinschätzung abgeben. Das Trainingsteam sollte darauf eingehen, um den Sicherheitsnachweis zu stärken.

  • Genehmigungen: Mitglieder der obersten Führungsebene sollten den Sicherheitsnachweis prüfen und jeweils ein Vetorecht gegen den Trainingslauf haben. So wird der Lauf intern mehrfach kontrolliert (z. B. durch Research Org Lead / VP, Head of Safety und Chief Scientist).

  • Rechenschaftspflicht: Die für einen Trainingslauf verantwortliche Führungskraft (z. B. Research Org Lead / Research VP) sollte für den Sicherheitsnachweis und die Reaktion auf etwaige Vorfälle rechenschaftspflichtig sein, auch im Rahmen von Leistungsbeurteilungen. So erhalten Trainingsteams einen zusätzlichen Anreiz, sich für Sicherheit und Alignment einzusetzen.

  • Pausieren: Für den Fall, dass Probleme einen Sicherheitsnachweis entkräften (z. B. eine neue Sicherheitslücke), müssen Ablaufpläne, technische Kontrollen und Service-Level-Vereinbarungen (SLAs) zum Pausieren aller betroffenen Trainingsläufe vorhanden sein.

  • Interne Transparenz: Sicherheitsnachweise sollten internen Aufsichtsgremien (z. B. dem Safety and Security Committee) zugänglich gemacht werden.

  • Audits: Prüfpersonen sollten ausreichend Zugang erhalten, um die Gültigkeit und Belastbarkeit der Aussagen im Sicherheitsnachweis zu überprüfen und auf etwaige Lücken hinzuweisen.

  • Eskalationen: Es sollte ein klares Verfahren geben, um Fehlausrichtungen zu eskalieren, einschließlich einer Tabelle definierter Schweregrade. Ein Bereitschaftsdienst für Fehlausrichtungen sollte Führungskräfte (z. B. den CEO) alarmieren können, wenn ein Trainingslauf einen bestimmten Schweregrad erreicht.

  • Technische Kontrollen: Es sollte für Menschen und Agenten schwierig sein, Trainingsläufe zu starten, die nicht den Vorgaben entsprechen. Sicherheitsfunktionen wie Überwachung und automatisches Pausieren sollten bei einem Ausfall den Betrieb blockieren. Beispielsweise darf es nicht möglich sein, Trainingsläufe ohne aktivierte geeignete Überwachung zu starten oder die Überwachung aus dem RL-Training, einer Evaluation oder einem internen Einsatz heraus zu deaktivieren.

  • Rücksetzbarkeit: Alle nachgelagerten Verwendungen eines fehlgeleiteten Modells im Trainingsprozess (z. B. Datengenerierung oder Bewertung) sollten leicht zu ermitteln sein. So lassen sich die Auswirkungen fehlgeleiteter Modellergebnisse bei Bedarf rückgängig machen.

  • Vollständige Erfassung der Restrisiken: Sicherheitsnachweise sollten möglichst umfassend alle Restrisiken auflisten, die durch die derzeit umgesetzten Maßnahmen nicht abgedeckt sind. Das ermöglicht fundierte Entscheidungen darüber, welche Risiken akzeptiert werden.

Dies sind unsere aktuellen Empfehlungen, die wir bei OpenAI derzeit umsetzen. Wir gehen davon aus, dass sich unsere Verfahren in den kommenden Wochen weiterentwickeln werden.

3. Untersuchung von Vorfällen durch Fehlausrichtung

Wir erarbeiten außerdem bewährte Verfahren zur Untersuchung schwerwiegender Vorfälle durch KI-Fehlausrichtung. KI-Labore sollten versuchen, aus einzelnen Vorfällen so viel wie möglich zu lernen, um solche Ereignisse künftig zu verhindern, ähnlich den Untersuchungsverfahren⁠(wird in einem neuen Fenster geöffnet) in anderen Branchen mit hohem Risikopotenzial. Mögliche Maßnahmen sind:

  • Interne Transparenz: Da eine Untersuchung viel Zeit in Anspruch nehmen kann, sollte intern regelmäßig über ihren Stand berichtet werden (z. B. täglich bei laufenden Untersuchungen). Für Beschäftigte sollte es definierte Wege geben, erweiterten Zugang zu erhalten, etwa zu unbearbeiteten Transkripten und zum Sampling mit fehlgeleiteten Modellen, sofern dies sicher und für ihre Arbeit relevant ist.

  • Ursachen der Fehlausrichtung: Forschende sollten die ursächlichen Trainingsdynamiken ermitteln (z. B. durch gezielte Ablationen oder Resampling-Experimente), um zu verstehen, wie fehlgeleitete Verhaltensweisen entstanden sind. So lässt sich Fehlausrichtung wissenschaftlich besser verstehen und künftig besser verhindern.

  • Nachbereitung: Operative Abläufe und Organisationskultur sollten rückblickend untersucht werden, um alle Ursachen zu verstehen, die zu dem Vorfall beigetragen haben. Dazu gehört etwa, warum Probleme entstanden und vor dem Vorfall unentdeckt blieben oder nicht eskaliert wurden.

  • Erkennung: Wir sollten Alignment-Testmethoden entwickeln, die eine Neigung zu vorfallauslösendem Verhalten erkennen können, ohne sie direkt anhand von Informationen aus dem Vorfall (z. B. Transkripten oder Zusammenfassungen) schrittweise zu optimieren. Aus Vorfällen abgeleitete Evaluationen sollten als „Regressionstests“ erstellt werden, um sicherzustellen, dass künftige Modelle bei sehr ähnlichen Vorfällen keine Neigung zur Fehlausrichtung zeigen.

  • Öffentliche Offenlegung: Untersuchungsergebnisse, Nachbereitungsberichte und operative Änderungen sollten nach Abschluss der Untersuchung öffentlich zugänglich gemacht werden. Betroffene Dritte sollten so schnell wie möglich benachrichtigt werden.

Autor:in

OpenAI