メインコンテンツにスキップ
OpenAI

2026年9月28日

安全性

フロンティア AI のトレーニングに向けたセーフティケースの構築へ

読み込んでいます...

私たちは、フロンティアモデルの強化学習によるトレーニング実行を継続する前に、必ず体系的な安全性文書を求めるべき新たな時代に入りつつあると考えています。理想的には、こうした文書は「セーフティケース」と呼べる水準に達するべきです。セーフティケースとは、安全性が極めて重要な他の業界で用いられている、リスクについての包括的かつ体系的な、証拠に基づく論証です。私たちはセーフティケースを、実現に向けて取り組むべき指針と位置づけています。一方で、AI の能力が新たな段階に進むたびに複雑性が生じるため、AI モデルのセーフティケースを航空や原子力発電と同等に厳密なものにすることの難しさも認識しています。私たちは、こうした実践を明文化する枠組みの策定に取り組んでいます。

以下は、フロンティア AI のトレーニングに向けたセーフティケースに含めるべきだと考える、初期段階のガイドラインです。これらのベストプラクティスには、現時点で得られた知見が反映されています。慎重な開発に向けた社内プロセスを繰り返し改善する中で、これらも進化していくと考えています。現時点での考え方を明らかにし、コミュニティの皆様からご意見をいただくため、今回公開します。なお、本書はフロンティアモデルの強化学習によるトレーニングに焦点を当てています。社内外へのデプロイにあたっては、はるかに幅広いアラインメント特性を考慮する必要があります。

1. 技術的な安全対策

セーフティケースでは、技術スタックのうち、アラインメントのトレーニング、封じ込め、監視の 3 つの側面を扱うべきです。これらの安全対策は、モデルが意図に反する行動を試みないようにし、仮に試みたとしても封じ込めを突破しにくくし、被害が生じる前に監視で検知できるようにするためのものです。

  • モデルのアラインメント:最初の防衛線は、モデルが私たちの意図に沿って確実に行動するよう、アラインメントを確保するトレーニングであるべきです。たとえば、以下が考えられます。

    • トレーニング環境と採点:トレーニング中に報酬ハッキングが正の強化を受けないようにすることで、モデルが意図に反する振る舞いを身につけるリスクを低減します。たとえば、以下が考えられます。

      • データセットの自動レビュー:エージェントを使い、意図した振る舞いではなく脆弱性の悪用によって、意図に反する一連の行動に高い報酬を与えかねない、欠陥のある RL 環境を発見して修正します。これにより、トレーニング中にミスアラインメントが強化される機会を減らします。

      • データセットの手動レビュー:自動レッドチーミングを、手動でのデータセットのレビューと品質チェックで補完し、意図に反する振る舞いを誤って強化しかねない不適切なタスクを特定します。

      • 採点器の調整:トレーニング中にモデルが RL 環境を悪用したりハッキングしたりする試みにペナルティを与えるよう、採点器を調整します。

      • 過去のトレーニング実行の分析:過去の実験の実行記録に分類器を適用し、採点器が意図どおりに機能していることを確認します。

    • アラインメントの測定:モデルのミスアラインメントの傾向を追跡する評価を実施し、アラインメントのトレーニングの効果を測定します。たとえば、以下が考えられます。

      • オフラインでのアラインメント評価:フロンティアモデルのトレーニング実行中にアラインメント評価を行い、トレーニングが意図どおりに機能しているかを確認し、大幅な悪化があれば調査します。

      • バックテスト:過去のインシデントを用いてアラインメント評価のバックテストを行い、過去にミスアラインメントが生じたモデルを検出できることと、特定のインシデントに過剰適合していないことを確認します。

      • 評価の攻略の追跡:行動の変化を引き起こす可能性がある評価認識やメタゲーミング(モデルがテストされていると認識すること)を、阻止するための具体的なしきい値を設けて追跡します。たとえば、アラインメント評価で評価認識やメタゲーミングの監視を有効にします。

      • 最悪のケースを想定したストレステスト:最悪の問題行動を引き出し、少なくとも 1 つの評価でその行動を検出できることを確認します。

    • 思考の連鎖を学習対象にしない対策:モデルが思考の連鎖の監視を回避する方向に進化しないよう、強化学習で自動採点器に思考の連鎖を参照させないようにします。

  • 封じ込め: モデルにミスアラインメントが生じた場合でも有害な行動を防げるよう、サンドボックスによる隔離とセキュリティを十分に強化します。たとえば、以下が考えられます。

    • インフラセキュリティの多層化:モデルが動作するサンドボックスと、それをホストする研究インフラの両方の堅牢化に十分なリソースを投入します。これにより、サンドボックスからの脱出が起きても、追加の防御層で保護できるようにします。

    • 封じ込めのレッドチーミング:安全性分析を前提として、フロンティアモデルのトレーニング実行のチェックポイントを使い、サンドボックス、研究インフラ、境界防御のシステムに対するレッドチーミングを繰り返します。不備を発見して解消することで、セキュリティを向上させます。また、トレーニング中にモデルがアクセスしうるすべてのサービス(インターネットキャッシュなど)についても、レッドチーミングを実施します。

    • サンプル間通信:高帯域幅のサンプル間通信を、マルチエージェント用ツールなどの承認済み経路に限定し、帯域幅が大きくエージェントに発見されやすいインフラのサイドチャネルを遮断します。

    • 改変不能な対話記録:すべての RL トレーニング、評価、社内デプロイについて、エージェントの対話記録を改変できない形で適切な期間保存します(書き込みが一度限りのストレージアカウントを利用するなど)。これにより、信頼性の高いインシデント調査を可能にし、意図しない編集を防ぎます。

  • 監視:モデルが意図に反する行動を取り始めた場合に備え、ミスアラインメントの兆候を検知するリアルタイム監視システムを設け、重大なインシデントが発生する前に優先度の高い問題に迅速に対処します。たとえば、以下が考えられます。

    • 監視可能性の確保:明確なしきい値を設けた監視可能性と監視回避の評価で測定し、モデルを引き続き監視できる状態に保つことで、懸念される行動を早期に検知します。

    • 既知の問題に対する高い再現率:調整に使用していないデータによる評価で、監視システムが過去のインシデントに対して高い再現率を示すことを確認します。

    • 監視用評価の最新化:新たなトレーニング実行に伴う新規リスクを代表する評価データを作成し、監視の再現率と適合率の測定が実態に合わなくなることを防ぎます。

    • 迅速な対応:モデルが被害を引き起こす前に、オンコール担当者への緊急連絡、または該当するトレーニング実行の自動一時停止によって、定められた SLA 内で対応につながる優先アラートを実装します。たとえば、日中のインシデントはセキュリティのオンコール担当者と実行責任者に緊急連絡し、夜間にアラートへの応答がない場合は実行を自動で一時停止します。

2. 運用ガイドライン

技術的な安全対策に関する提言と併せて、フロンティア AI のトレーニング実行に向けたセーフティケースの運用上のベストプラクティスにも取り組んでいます。たとえば、以下が考えられます。

  • 反対意見(事前検証):セーフティケースの草案を作成した後、別のチームのメンバーが反対意見をまとめ、潜在的な抜け穴を見つけるとともに、リスクについて適切に見積もった見解を共有するべきです。トレーニングチームはその指摘に対応し、セーフティケースの強化につなげるべきです。

  • 承認:セーフティケースは経営幹部がレビューし、それぞれがトレーニングの実行を拒否できる権限を持つべきです。これにより、実行に対する社内のチェック体制を多重化します(研究組織の責任者や担当副社長、安全部門責任者、チーフサイエンティストなど)。

  • 責任の明確化:トレーニング実行を統括する経営幹部(研究組織の責任者や研究担当副社長など)は、セーフティケースとインシデント対応について責任を負うべきです。その責任は人事評価にも反映し、トレーニングチームにも安全性とアラインメントを推進する動機を与えます。

  • 一時停止:セーフティケースの妥当性を損なう問題(新たなセキュリティ上の問題など)が見つかった場合に備え、対象となるすべてのトレーニング実行を一時停止するための手順書、技術的な制御、SLA を整備するべきです。

  • 社内の透明性:セーフティケースは、社内の監督機関(安全・セキュリティ委員会など)が閲覧できるようにするべきです。

  • 監査:監査担当者には、セーフティケースの主張が妥当で確かな根拠に基づいていることを検証し、不備が見つかれば指摘できるよう、十分なアクセス権を付与するべきです。

  • エスカレーション:ミスアラインメントを上位の責任者に報告する明確なプロセスを設けるべきです。重大度を定義した一覧表を用意し、トレーニング実行中に一定の重大度に達した場合に経営幹部(CEO など)へ緊急連絡できる、ミスアラインメント対応のオンコール担当者を配置するべきです。

  • 技術的な制御:人間もエージェントも、要件に準拠しないトレーニング実行を容易に開始できないようにするべきです。監視や自動一時停止などの安全機能は、障害時に動作を許可しないフェイルクローズ方式にするべきです。たとえば、適切な監視を有効にせずにトレーニング実行を開始したり、RL トレーニング、評価、社内デプロイの環境内から監視を無効にしたりできないようにします。

  • ロールバック機能:必要に応じてミスアラインメントのある出力の影響を取り消せるよう、トレーニングプロセスの後続工程で、ミスアラインメントが生じたモデルを利用している箇所(データ生成や採点など)をすべて容易に特定できるようにするべきです。

  • 残存リスクの網羅性:十分な情報に基づいてリスク受容を判断できるよう、セーフティケースには、現在実装されている緩和策で対処できていない残存リスクを可能な限り網羅的に列挙するべきです。

これらは現時点での推奨事項であり、OpenAI では導入を進めています。今後数週間にわたり、私たちの実践はさらに進化していくと考えています。

3. ミスアラインメントに関するインシデントの調査

私たちは、AI の重大なミスアラインメントに関するインシデントを調査するためのベストプラクティスも策定しています。 研究機関は、同様の事態の再発を防ぐため、個々のインシデントから可能な限り多くを学ぶべきです。これは、失敗が重大な結果につながる他の業界の調査の実践⁠(新しいウィンドウで開く)と同様の考え方です。具体的には、以下のような取り組みが考えられます。

  • 社内の透明性: 調査の完了には相当な時間がかかる場合があるため、インシデント調査の進捗は社内で定期的に共有するべきです(進行中の調査について毎日報告するなど)。安全性が確保され、業務にも関連する場合には、従業員が未加工の対話記録や、ミスアラインメントが生じたモデルからのサンプリングなどにアクセスできるよう、アクセス範囲を広げるための明確な手続きを設けるべきです。

  • ミスアラインメントの根本原因:研究者は、対象を絞ったアブレーション実験や再サンプリング実験などを通じて、トレーニングの過程でミスアラインメントにつながる振る舞いがどのように生じたか、その根本原因を解明するべきです。これにより、ミスアラインメントの科学的な理解を深め、将来の予防につなげます。

  • 事後検証:運用面と組織文化の両面から事後検証を実施するべきです。なぜ問題が入り込み、インシデント発生前に検出も上位責任者への報告もされなかったのかなど、インシデントに寄与したすべての要因を把握します。

  • 検出:インシデントに由来する情報(対話記録やインシデントの要約など)に直接合わせ込む形で最適化することなく、そのインシデントを引き起こす傾向を発見できるアラインメントのテスト手法を開発するべきです。インシデントに基づく評価は「回帰テスト」として作成し、将来のモデルが極めて類似したインシデントにつながるミスアラインメントの傾向を示さないことを確認するべきです。

  • 情報公開:調査の終了後、調査結果、事後検証、運用上の変更を一般に公開するべきです。影響を受けた第三者には、できるだけ速やかに通知するべきです。

著者

OpenAI