組織的なモデル蒸留活動の阻止
OpenAI は先日、モデルから保護対象の推論を抽出することを目的とした組織的な活動を特定し、阻止しました。この活動が最初に確認されたのは 7 月の第 1 週です。この活動は、あるモデルの出力や推論を組織的かつ無断で利用し、別のモデルの学習、再現、改善に役立てる「敵対的蒸留」に該当します。保護対象の推論とは、モデルがタスクに取り組む際の内部記録です。これを抽出すると、最終回答には含まれない情報が明らかになり、第三者がモデルの能力を再現する手助けとなる可能性があります。
実行者らが OpenAI の暗号を破ったり、データベースに侵入したり、保存されたユーザーの会話に直接アクセスしたりしたわけではありません。その代わりに、モデルとのやり取りを操作し、保護対象の推論をリクエスト送信者に見える形で再現させていました。これは OpenAI の利用規約に違反する、組織的かつ大規模な行為でした。この操作が利用する脆弱性は、OpenAI のモデルに固有のものではありません。敵対的蒸留に対する業界全体の防御を強化するため、Frontier Model Forum を通じて業界のパートナーと情報を共有しました。
本記事の公開に先立ち、活動の範囲と潜在的な影響を調査し、独自の緩和策を導入しました。また、この種の攻撃に対する保護対策を確実に整えるため、研究者や業界のパートナーに情報を共有し、フィードバックを受けました。追加の緩和策の実施と調査は現在も続いています。現時点で得られた知見を共有することが、エコシステム全体の防御強化に役立つと考えています。
実行者らが新たな手法で保護対象の推論を抽出しようとする動きを確認しました。その一例が、ある会話から暗号化された推論をコピーし、別の会話でモデルに、隠された推論内容の復号と書き起こしを求める手法です。
また、独立したセキュリティ研究者ら(新しいウィンドウで開く)からも、責任ある開示を通じて、モデル間のやり取りや会話のコンパクションに関わる関連脆弱性の報告を受けました。その調査結果を検証したところ、研究者らが特定した攻撃経路が実際に存在することを確認しました。研究者らの取り組みは、この種の攻撃をより広く理解し、緩和策を迅速に進めるうえで役立ちました。
活動は 7 月 1 日に始まり、当初は小規模でしたが、7 月 24 日と 25 日に急増が確認されました。この間、4,000 人を超えるユーザーから、関連する抽出パターンを用いた 16,000 件のリクエスト1が送信されました。さらに調査を進めた結果、15,000 人を超えるユーザー群で関連するプロンプトパターンを用いた活動が見つかり、7 月 28 日までにそのすべてを阻止しました。
活動の手法は時間とともに変化していました。このことからも、敵対的蒸留は広範なセキュリティ上の課題であり、多層的で変化に適応できる防御が必要であることがわかります。
対象期間中に確認された実行者らが、すべて単一の主体に属していたかどうかは不明です。ただし、活動の中核をなす一群については、Kimi の開発元である Moonshot AI の関係者によるものと判断しています。
敵対的蒸留は、安全性と国家安全保障上のリスクをもたらします。抽出された推論は、元のモデルがユーザー向けの出力に適用している安全対策を引き継がないまま、別のモデルの学習に使われる可能性があります。また、大規模な蒸留によって、安全性に同等の投資をすることなく、高度な能力の移転が加速する可能性もあります。軍民両用の領域でモデルの能力が高まるにつれ、こうした懸念は一層深まります。
このリスクは OpenAI に固有のものではありません。前述のとおり、同様の手法は他の高度な AI システムにも影響する可能性があります。そのため、これは業界全体での連携が必要な、共通のセキュリティ課題です。
今回の蒸留活動に対しては、アカウントへの措置、技術的な制御、パートナーとの連携を組み合わせて対処しました。不正なアカウントを停止または制限し、新規登録とインフラの制御を強化するとともに、関連するネットワークの監視を拡充しました。
また、ユーザー、ワークスペース、組織、モデルファミリーをまたいで、非公開の推論に対する保護を強化しました。他のユーザーの暗号化された推論をすでに入手していた者が、それを再送信して内容を復元できる経路を閉鎖しました。さらに、推論を露出させるおそれのあるストリーミング出力を検知し、送信を保留するチェック機能を追加しました。関連する活動がサードパーティーのサービス経由に移った際には、そのサービス提供者と協力し、関与したアカウントを特定して活動を阻止しました。
最後に、Frontier Model Forum と適切な政府の情報共有経路を通じて、関連する調査結果を共有しました。これにより、他のフロンティアモデルの開発者や公共部門のパートナーが、同様の活動を探知し、自らの防御を強化できるようにしました。推論データの持ち出しや再利用に対応するシステムも、同様のリスクにさらされる可能性があります。
フロンティアモデルの性能が向上し、攻撃者がその能力をより低コストで模倣する方法を模索するにつれ、敵対的蒸留の試みはさらに高度化すると予想しています。こうした活動を防ぐには、多層的な制御と、変化に応じた継続的な対応が必要です。
この取り組みはまだ完了していません。パートナーがホストする環境にも、自社サービスと同じ保護が必要です。また、ツール出力を介した攻撃には、通常の可視テキストだけでなく、それ以外の内容も検査する保護対策が求められます。引き続き、ツールの防御、分類器の検知範囲、モデルの拒否動作を改善するとともに、関連する制御をクラウドパートナー全体に展開していきます。
今後も、抽出に対する技術的な保護の強化、組織的な活動の検知と対処の改善、業界と政府の間での脅威情報共有の深化という 3 つの領域に重点を置いて対応を進めます。

