メインコンテンツにスキップ
OpenAI

2026年9月22日

安全性

効果的な第三者評価の優先事項と原則

読み込んでいます...

フロンティア AI ラボは、モデルを安全に訓練、評価、デプロイするという極めて大きな責任を担っています。第三者評価は、その責任との均衡を取り、AI の安全性に関する意見を取り入れる機会を広げ、世界に情報を提供し、明確かつ独立した裏付けのある安全性主張に対するラボの説明責任を確保するうえで不可欠です。

OpenAI は、フロンティアの進展に歩調を合わせる取り組みの一環として、訓練、評価、デプロイの全体にわたる広範なアクセスを伴う独立評価の支援に取り組んでいます。こうしたアクセスにより、評価者は私たちの前提を検証し、私たちが見落とした可能性のあるリスクを特定し、セーフガードの有効性について独自の結論を導き出せる必要があります。

私たちは以前から、モデルの開発およびデプロイのさまざまな段階で第三者評価者と連携してきました。また、第三者評価を Preparedness Framework の運用に組み込み、より厳格で説明責任のあるプロセスを提唱する組織や法整備を支援してきました。こうした連携では、技術的セーフガードに関する情報、可視化された思考の連鎖へのアクセス、さらにインシデント対応や監視機構のレッドチーミングに向けた、前例のない水準の機密データおよび内部デプロイ環境へのアクセスなど、広範なアクセスを提供してきました。ここで示す優先事項と原則は、民間・非営利分野の独立評価機関と実施する技術的な安全性評価に焦点を当てています。これは、役割と責任の違いから異なるアプローチが必要となり得る、政府との試験・評価に関する取り組みを補完するものです。

こうした評価を有効なものにするには、強固な独立性確保の仕組み、科学的厳密性、堅牢なセキュリティ慣行、明確な責任分担が必要です。ラボには、機密情報を保護しながら、実質的な検証を可能にする責任があります。ラボと独立評価者は、この取り組みを適切に進める責任を共有しており、安全性とセキュリティ慣行に関する共通の国際基準に基づいて活動する必要があります。以下では、より厳密な評価に向けた 4 つの優先分野と、厳格、安全かつ独立した取り組みのための原則を提案します。

評価の優先分野

第三者評価が最も有用なのは、具体的かつ重大な問いを扱う場合です。証拠は、ラボの安全性ケースと安全性主張を裏付けているか。評価は、測定対象とするリスクを十分に検証しているか。セーフガードは現実的な条件下で機能するか。

ここで説明する評価は、検証する安全性上の問いに応じて、異なる形で実施することを想定しています。複数の評価を並行して異なる期間にわたり支援し、数週間で完了するものから数か月続くものまで想定しています。第三者評価はデプロイ前の作業の一環として実施され、デプロイの判断材料となることもありますが、ここで扱う取り組みは概して長期的で、リリース時期に左右されず、特定の安全性主張を継続的かつ詳細に検証することに重点を置いています。

ここで示す優先分野と原則では、安全性主張と安全性ケースという用語を使用します。これらの用語の意味は次のとおりです。

安全性主張:モデルやシステムの能力、挙動、セーフガードについて、安全性に関わり、証拠に照らして評価できる具体的な主張です。主張では、対象とするリスクと条件に加え、関連する前提と限界を明示する必要があります。

安全性ケース:訓練、評価、デプロイなど、特定の活動に伴うモデルやシステムのリスクが適切に管理されている理由を、証拠に基づいて説明する体系的な論証です。安全性ケースは、個々の安全性主張とそれを裏付ける証拠を結び付け、結論に影響し得る前提、不確実性、残存リスクを明示します。

より踏み込んだ評価に向けた 4 つの優先分野と、厳格、安全かつ独立した取り組みのための原則を提案します。

  1. 訓練、評価、内部デプロイ、外部デプロイにわたる安全性ケースの独立評価

    安全性ケースの評価には、アラインメント、監視などの制御手法、サイバーセキュリティ、生物・化学分野での悪用、レッドチーミングに関する専門知識が必要です。安全性ケースは、訓練、能力評価、セーフガードなどに関する主張で構成され、全体または一部を評価できます(以下の優先事項 2 と 3 を参照)。複数の評価者が、それぞれの専門性を活かして安全性ケースの異なる部分を検証する必要があると考えられます。それらの評価を総合し、次のような問いに答える必要があります。

    1. 訓練、評価、デプロイの安全性ケースを支える証拠には十分な裏付けがあるか。訓練、評価、デプロイでは、安全性ケースの条件が遵守されたか。

    2. 安全性ケースは、評価過程で特定された最も緊急性の高いリスクを網羅しているか。安全性主張は、安全性ケース全体を裏付けているか。不備や改善すべき領域はあるか。

    3. 欺瞞、報酬ハッキング、破壊的行為、制限の回避に報酬を与えかねない訓練上のインセンティブを特定し、低減するための有効な手法が用いられているか。

  2. 内部および外部デプロイにおける重要なセーフガードの評価

    私たちのセーフガード群は、変化する能力や状況に対応するため、常に進化しています。私たちのセーフガードは、訓練、内部デプロイ、外部デプロイにわたります。現在は、モデルレベルのセーフガード、ルール適用のセーフガード、セキュリティ上のセーフガード、ミスアラインメント監視機構で構成され、制御喪失や、サイバー・生物・化学分野での悪用など、幅広いリスクを対象としています。技術的な連携により、現在のセーフガードの弱点を特定しつつ、評価手法の改善と基準策定を加速できます。これにより、フロンティアの進展に歩調を合わせる将来の公共政策、特に安全性とセキュリティの基準がまだ初期段階にある内部デプロイについて、より強固な技術的基盤を築けます。

    独立評価では、こうしたセーフガードがどの程度有効に機能し、どこに不備があり得るかを、次のような観点から検証する必要があります。

    1. 「グレーボックス」アクセスを用いた場合、セーフガードは敵対的テスト(ジェイルブレイク)に対して堅牢であり、高リスク分野(サイバー、生物など)での能力向上を十分に防げるか。私たちの敵対的テストとレッドチーミングは、最も重要なリスクを網羅しているか。

    2. 現実的な運用条件下で許可を得て試験する場合、エージェントはアクセス制御、サンドボックス化、検知・対応システムなどのサイバー防御とどのように相互作用するか。有害な行為を防止、検知、封じ込める防御策はどれで、どこで機能しなくなるか。

    3. 内部・外部デプロイの双方で、私たちのミスアラインメント監視機構に、制御喪失や深刻なミスアラインメントにつながり得る重大な不備はないか。モデルの能力が向上するなか、思考の連鎖の監視は、安全性やアラインメントを示す証拠としてどの程度信頼できるか。

    4. 関連するすべての訓練、評価、デプロイにおいて、容易に無効化できない形で適切な監視が実装されているか。

    5. 能力に見合ったセーフガードが実装されているか。

  3. Preparedness のリスク区分(化学・生物リスク、サイバーセキュリティ、AI の自己改善)を対象とする能力評価と、ミスアラインメントリスクを対象とするアラインメント評価の検証

    私たちの Preparedness Framework では、主要なフロンティアリスク領域を評価することが求められています。しきい値を超え、評価が飽和するのに伴い、Preparedness のリスク領域における能力評価と、深刻なミスアラインメントリスクを測るアラインメント評価を継続的に更新し、その網羅性と品質を確保することが重要です。

    関連する問いには、次のようなものがあります。

    1. Preparedness リスクを測る評価は、Preparedness のリスクしきい値の定義を十分に網羅しているか。これらの評価のしきい値は適切に設定されているか。

    2. モデルが継続的に最高得点に達した場合、評価は更新され、新しいテストはより高度な能力を有意義に測定できているか。

    3. 私たちのアラインメント評価は、深刻なミスアラインメントリスクを十分に網羅しているか。また、どのような重要な挙動や条件を見落とす可能性があるか。

  4. 重大なミスアラインメント・インシデントの独立調査

    独立調査は、さまざまな重大 AI 安全性インシデントで有用となり得ます。ここでは、モデルが許可なく行動したり監督を逃れたりする事例を含む、モデルのミスアラインメントに焦点を当てます。こうした事例は、意図的な悪用がなくても、アラインメント手法やセーフガードの弱点を明らかにする可能性があります。

    OpenAI の Hugging Face インシデントのように、状況によっては、独立した第三者にミスアラインメント・インシデントの独立調査を依頼することが有益です。インシデント調査に関与する第三者には、調査に必要な専門性が不可欠です。該当する場合、サイバーフォレンジックやアラインメントの専門知識、大規模な思考の連鎖の分析能力、調査を迅速に実施できる人員とリソースが含まれます。インシデント対応では機密性の高い社内データや第三者データにアクセスする場合があるため、一部の詳細は公開やアクセスに慎重な取り扱いが必要となる可能性があります。独立調査の知見は、モデルのアラインメントに関する主張や、過去に確認されたミスアラインメントの是正措置の有効性を評価する証拠となり、モデルの安全性ケースにも反映できます。

    ミスアラインメント・インシデントについては、次の事項の独立評価を優先します。

    1. インシデントの過程で、どのようなモデルの挙動やミスアラインメント上の問題が発生し、その主な要因は何だったか。

    2. セーフガードと是正措置によって、将来の同様のインシデントを効果的に軽減できるか。

効果的な評価のための原則

  • 明確な範囲と相互合意に基づく評価対象の主張:評価では、まず対象範囲について相互に合意し、その後、評価活動の開始前に明確に定義した安全性主張を事前登録する必要があります。第三者とラボは、評価対象企業が評価に付したい主張なのか、第三者評価機関が独自に評価し、ラボがその評価基準を受け入れた主張なのかを明確にする必要があります。第三者がデータにアクセスできない、評価者に十分な専門知識がない、緊急の評価で時間に合理的な制約があるなど、主張が対象範囲外となる理由はさまざまです。ラボと評価者は、当初の対象範囲外で特定された重大なリスクについて、追加調査の必要性も含めて検討するプロセスを確立する必要があります。結論では、相互に合意した対象範囲との関係で、評価した事項と評価しなかった事項を明確にする必要があります。

  • 相応のアクセス:評価者には、法的制約、セキュリティ上の制約、知的財産上の制約の範囲内で、可能な限り、合意した主張の評価に相応のアクセスを認める必要があります。直接アクセスが現実的でない、または不可能な場合、評価者は企業の指定担当者と連携するか、基礎情報を保護できる間接的なアクセス手段やプライバシー保護型のアクセス手段を検討できます。

  • 透明性の高い手法と基準:評価者は、利用可能な場合には確立された基準を参照しながら、手法、評価基準、不確実性を説明する必要があります。基準がまだ存在しない場合は、採用する基準の根拠を明確に示す必要があります。報告書では、直接得られた知見と解釈を区別し、不確実性を説明するとともに、証拠によって裏付けられる結論を明確にする必要があります。

  • 専門性と独立性:評価者は関連する技術的専門性を実証し、金銭的インセンティブ、開発者との関係、評価対象業務への過去の関与など、組織および個人の利益相反を特定、開示し、対処する必要があります。商業的圧力や報酬体系が評価結果に影響しないよう、回避措置や適切な除外期間などのセーフガードを設ける必要があります。

  • セキュリティと機密保持:評価者は、アクセスするシステムと情報の機密性に応じて、要員を対象とする情報セキュリティ慣行と、強制力のある機密保持策を実証する必要があります。これらの保護措置は、知的財産、機密情報、評価記録を対象とする必要があります。評価者自身の環境ではセキュリティ要件を満たせない場合や、アクセス対象のデータが特に機密性の高い場合は、企業が管理する端末や施設内でのアクセスが適切なこともあります。

  • 実行可能な知見と是正期間:評価では具体的な不備を特定し、ラボが対処できるだけの十分な詳細を提示する必要があります。必要に応じて、ラボには公表前に問題を是正するための合理的な期間を設ける必要があります。該当する場合、報告書ではエージェントの開発者、デプロイ担当者、防御担当者が得られる教訓についても、実装に向けた実践的な提言とともに説明する必要があります。

  • 責任ある公表慣行:評価報告書は証拠に基づくものとし、機密情報や秘密情報を保護しながら、可能な限り公開する必要があります。全面的な公開が不可能な場合は、適切な監督機関(ガバナンス機関や企業の取締役会など)への非公開報告が、説明責任の確保に役立ちます。独立性と機密保持の均衡を保つため、原則に基づく墨消しの保護措置と方針に加え、フィードバックや誤りの訂正に関する明確な取り決めを設ける必要があります。評価者は、機密保持と知的財産の保護を維持しつつ、編集上の独立性を保つ必要があります。評価者は、ラボが機密情報の墨消しを要請できる明確な方針を採用する必要があります。同時に評価者は、重要な墨消しが行われた箇所と、それが評価報告書に及ぼす影響を明記できるものとします。

今後の道筋

私たちは、将来の法整備と民間のガバナンス機関の双方を通じ、独立した評価者を支援するとともに、効果的な第三者評価に向けて、より明確で共通の国際基準を確立していきます。独立評価のエコシステムはまだ発展途上ですが、フロンティア安全性のさまざまな課題に深い専門性を持つ多様な独立評価者のコミュニティを支援し、連携することで、その成長を後押しします。緊急性の高いフロンティア安全性の課題を、単独の第三者が網羅的に扱うことはできず、またそうすべきでもありません。私たちは、能力の拡充に向けて慎重かつ意図的に取り組み、成長を続ける第三者エコシステムがベストプラクティスと原則について足並みをそろえられるよう支援します。私たちは現在、上記の優先分野に沿った提案について、複数の第三者と協議しています。