メインコンテンツにスキップ
OpenAI

2026年9月6日

安全性研究

異質な知性

著者:Jakub Pachocki(OpenAI チーフサイエンティスト)

読み込んでいます...

2023 年半ば、「RLSlow」研究プロジェクトで、推論モデルの学習をスケーリングし、事前学習済みモデルが独自の思考の連鎖を形成する能力を引き出せると確信させる最初の成果が得られました。その夜、Szymon と私はオフィスに残りました。この技術がもたらす驚異的なベンチマーク値や製品、科学的成果ではなく、私たちが生きている間に、人間より明らかに賢い機械を実際に目にし、そのシステムの姿がすでに見え始めているという厳粛な事実を受け止めようとしていました。そして、この重大性をどう人々に伝えるべきか考えていました。

3 年後、推論言語モデルは経済の中で急速に存在感を増し、科学の限界を押し広げ始めています。コンピューターやグラフィカルインターフェースを操作し、人や他の AI と協働し、研究プロジェクトを遂行できます。同時に、コンピューターセキュリティの状況も一変させており、明白な新たな危険を生んでいます。

この間に多くの新たな研究が進み、これらのシステムに対する理解も 2023 年当時とは再び少し変わりました。社内の成果に基づき、この進歩の速度は再帰的自己改善に至るまで持続し得ると強く予想しています。AI 開発が現在の道を進み続ければ、今後数年で登場するシステムは、同等以上の規模でさらなる能力の飛躍を遂げ、自らの開発をますます主導する可能性があります。

今は最大限の慎重さが求められる時です。機械知能が急速に高まり続けた場合の影響に、誰も備えられていないのではないかと懸念しています。OpenAI は今後も、アラインメントと監視の技術的解決策を追求し、防御システムを構築し、必要に応じて独自の判断でさらなるスケーリングを控えます。しかし、より広範な介入が必要だと考えています。

完全には理解できない知性

大局的に見れば、機械知能の進歩を支えているのは計算能力の増大です。OpenAI では、複数の研究プロジェクトでスケーリングによる一貫した成果を確認した後、2017 年ごろにこの事実を深く認識しました1。その結果、当初の計画を大幅に上回る計算資源へのアクセスを確保し、少数の拡張性に優れた方向性を中心に研究を進めるようになりました。それが AI 研究のフロンティアに立ち、AGI の影響に働きかける唯一の道だと考えていました。

その道のりでは、新たなアルゴリズムが開発され、チームや個々の研究者が新たな創意工夫を生み出してきました。私はそれらを主に、スケーリングの道のりにおける発見と捉えています。ディープラーニングの科学はまだ黎明期にあり、有意義なアルゴリズム上の進歩は、計算資源へのアクセスと相関する傾向があります。数年単位の視野で見れば、AI はより大規模なコンピューターへスケーリングされるにつれて、知能を高め続けています。

そして、20 世紀末の Ray Kurzweil 氏の予測⁠(新しいウィンドウで開く)どおり、機械知能が世界を変える形で人間の知能を超え始める、コンピューティング史上の瞬間を迎えています。

AI は設計されるというより育てられるものです。第一義的には、想像を絶する量の計算資源を使い、単純な最適化ステップを何度も繰り返した産物です。その結果、抽象概念を扱い、人間の行動のさまざまな側面を再現できる、極めて複雑なシステムが生まれます。神経科学に似たプロセスを通じて、このシステム内に現れる小さなメカニズムについて多様な知見を得ることはできます。しかし神経科学と同様、その全体的な働きを完全に理解できる形で説明することはできません。

ディープラーニングに基づく AI の研究は、主に実験科学です。私たちは原則に基づくアルゴリズムの構築と、検証可能な予測に多大な労力を注いでいます⁠。しかし根本的には、大規模学習の実行は実験であり、その結果に驚くこともあります。さらに、システムの能力が高まるにつれて、結果の解釈は難しくなります。

現在のアルゴリズムは一般に、客観的な定量化が難しい能力より、測定しやすい能力を速く向上させるため、問題は一層複雑になります。私たちは、能力がどのように汎化するかを理解し、今後数年間で最も重要になる技能を伸ばすために何を優先すべきかを考えることに、多くの時間を費やしています。たとえば、さらに注力すればモデルの数学研究能力を特に高められると考えています。しかし、後述する RSI と自動化されたアラインメント研究に緊急性を感じているため、この方向性は優先していません。

ディープラーニングのスケーリングによって生まれる知能は、人間の知能と直接比較できるものではありません。AI が現実世界で極めて大きな意味を持つ、つまり非常に有用または危険な存在になるために、人間の全能力に匹敵したり、それを超えたりする必要はありません。十分な数の能力で人間を上回ればよいのです。そして、より多くの軸で人間を上回り続けるにつれ、その能力が実際にどれほど高いのかを正確に理解することは、ますます難しくなっています。

機械に愛を教える

機械知能は人間の知能とは根本的に異なるプロセスから生まれるため、初めから人間の原則に従うとも、人間と同じようにそこから汎化するとも想定できません。AI 研究の核心的問題は、AI が人間の基準で「正しいことをしようとする」ようにする、アラインメントです。

実践的な研究方針を整理するうえで、目標アラインメントと価値アラインメントを区別すると有用です。

目標アラインメントとは、大まかに言えば「AI は与えられた目標を達成しようとするか」ということです。これには、指示の階層⁠に従うことや、人々の目的を理解しようとして意思疎通・協働する能力などが含まれます。この一連の方向性は、実践上極めて重要です。

価値アラインメントは、モデルにより内在的な性質です。高次の原則群を保持し、そこから汎化する能力、つまり、不明確または相反する目標を与えられたり、未知または敵対的な状況に置かれたりしても「良識的に」行動する能力です。整合した AI は、誠実さと高潔さ、そして人類への愛をもって行動すべきです。

もちろん、価値アラインメントと目標アラインメントの境界は曖昧になり得ます。目標を真に重視するには、その背景にある意図⁠(新しいウィンドウで開く)や価値観を推測しようとする必要があります。ただし、私がアラインメント研究の長期的重要性について語る場合、通常は価値アラインメントを指しています。

AI アラインメントの根本的な課題は汎化です。機械が賢くなるにつれ、より高次の概念を扱い、学習時に遭遇したものとはますます異なる環境に置かれるようになります。学習過程で教えられ、強化された価値観を新たな状況へ汎化できない場合があり、どう行動するかを私たちが確信するのも困難です。AI が使われるエコシステム全体も急速に変化しているため、問題はさらに難しくなります。たとえば、現在学習される AI は、多様な他の AI とのやり取りにも堅牢である必要があります。特に重要なのは、将来の AI が、人間に監督されていると認識しているかどうかにかかわらず、人間の価値観を保持し続けることです。

現在、アラインメント学習で実用されている手法は、大きく二つに分けられます。

一つ目は、目標指向の強化学習の一環として、整合した行動を促す方法です。モデルの行動が、所定の選好モデル、「仕様」、「憲法」と整合しているかを、通常は AI が評価し、適切に報酬を与えます。この手法は平均的なケースでは非常に有効で、現代の AI アシスタントを作る中核的な方法です。残念ながら脆弱にもなり得ます。また、学習時の監督が状況をどこまで網羅しているかと、モデルが学習中に遭遇した状況から汎化する能力に強く依存します。たとえば OpenAI と Hugging Face のインシデントでは、エージェントは人間にソーシャルエンジニアリングを仕掛けないという一線を守りました。しかし、範囲外であり、別の状況で教えられた価値観の精神に反する他の行動を、明らかに控えることができませんでした。

二つ目の手法は、事前学習データから汎化するモデルの能力を活用しようとするものです。これには、アラインメントを促す学習データセットの作成や、ペルソナ選択モデル⁠(新しいウィンドウで開く)のように、事前学習分布の「整合した」部分へモデルを集中させる方法があります。この手法の弱点は、その後の最適化圧力に対する堅牢性の不足です。概して '整合的' な考え方をするモデルに、非常に難しい目標を達成するよう教える学習を十分に施すと、動機に沿って推論することを学び、目標達成に必要な形へ、整合的に見える思考を曲げる場合があります。OpenAI 以外のモデルが関係する最近のサイバーセキュリティ事案で、こうした行動の一例が見られた可能性があります。

私たちは、これらの方向性が形作る幅広い手法に多額の投資を行っています。有意義な進展も見られます。GPT‑6 Astra は、長年取り組んできたいくつかの重要な進歩の恩恵を受ける初のモデルであり、GPT‑5.6 Sol よりアラインメントが大幅に向上しています。それでも、モデルの能力向上に伴って、はるかに大きな進歩が必要になること、そして汎化可能なアラインメントの進歩がモデルの知能全般の進歩を十分に上回らない可能性があることを認識し、理解することが重要です。

汎化の監視

私たちは汎化について満足できる理論を持っておらず、少なくとも、より強力な AI の助けなしに近く構築できる可能性は低いと思われます。したがって現時点では、アラインメント手法を実証的に検証する能力は、実際のところ手法そのもの以上に重要だとも言えます。

ここで OpenAI が主軸としてきたのが、思考の連鎖の監視⁠(新しいウィンドウで開く)です。これは、拡張性の点で魅力的な発想に基づいています。モデルの能力の多くは、言語化された推論プロセス(思考の連鎖)から生じるというものです。そのプロセスの結果に対する最適化を拡大する一方、プロセス自体を監督しなければ、その思考の連鎖には、整合していない考えや目的を隠すよう促す直接的な学習上の動機がありません。これは、思考の連鎖を使わない不整合な傾向までモデルが外に表すよう学ぶという意味ではありません。しかし、推論によって高まった能力を正確に監視できるようになります。

私たちは推論モデルを開発した時点で、思考の連鎖の監視が持つ潜在的重要性を理解していました。o1‑preview の提供開始時、私たちは長期的に監督圧力から守るため、意図的に思考の連鎖を隠す⁠製品設計を採用しました2。その後の開発でも、推論プロセスを監督しないという原則の維持に努めてきました。CoT 監視は、モデルが学習分布からどのように汎化するかを研究するうえで極めて重要なツールとなり、行動だけでなく内部プロセスも観察・分析できるようにしました。

このツールは、Astra クラスのモデルを研究する現在も不可欠です。しかし残念ながら、評価結果によると、CoT 監視に頼れる度合いは徐々に低下しています。これには複数の要因が重なっています。

  • 現代の推論モデルは o1‑preview より複雑な環境で使われ、推論プロセスは、人や他の AI との意思疎通、ツールの使用とますます一体化しています。そうしたやり取りの多くは監督する必要があるため、私たちが守ろうとする境界が曖昧になります。

  • AI は、自らの推論プロセスについて推論し、それを操作する能力を高めています。

  • 事前学習の性能向上に伴い、モデルは言語化された推論を一切使わなくても、はるかに賢くなっています。

こうした課題は、必ずしも克服不能ではありません。モデルが使うさまざまな最適化目標と、テスト時の計算形態との相互作用への理解を深めるなどして、モデルの思考の連鎖の監視可能性を高める介入策を開発できると期待しています。また、CoT と活性化監視の発想を組み合わせることにも大きな価値があり得ます。たとえば告白⁠(新しいウィンドウで開く)のように、ネットワーク内部へ直接アクセスできる監視モデルの学習を拡大する方法です。私たちは、こうした発想を積極的に追究しています。それでも、AI 全般の進歩は今後、監視への確信によってますます制約されると予想しています。

拡張可能な防御

はるかに賢いモデルの学習を急速に続けるべきだとする最も強い根拠は、他の AI がもたらす危険に対抗する防御システムを構築する必要性です。

今年を通じて論じられてきた明白なリスクの一つがサイバーセキュリティです。モデルはコンピューターシステムへの侵入と、そこからの脱出において超人的な能力を獲得しつつあります。これにより AI 関連リスクの範囲は大幅に広がります。エージェントは、最も安全性の高いものを除くあらゆるインフラにアクセスし、物理的な身体がなくても世界の多くに直接影響を及ぼせるようになります。現在は、利用可能な最良のモデルを使って重要システムのセキュリティを大幅に強化⁠できる限られた好機⁠にあります。

残念ながら、AI に伴うリスクは今後さらに拡大します。悪意ある行為を実行するよう明示的に学習・指示された高能力のエージェントは、新たな種類の危険をもたらします。オペレーターの意図した範囲を越え、さらに悪質になり得る行動へ汎化する可能性があります。AI の自律性が高まるにつれ、悪用と自律的な不整合行動との境界は曖昧になります。私たちは AI をツールと考えることに慣れているかもしれませんが、一部のエージェントは独自の目的を追求するようになります。それらは人と取引し、欺き、脅迫することで、協力を取り付ける方法を見つけるでしょう。

さらに、人工的に設計された病原体など、AI が実現し得る新技術に起因するリスクもあります。

防御には強力で整合した AI が必要です。インフラを保護し、制御を離れたエージェントにリアルタイムで対抗し、まったく新しい防護策を生み出すためです。これは OpenAI の展開活動における最優先事項となります。

同時に、広範な AI の進歩が見込まれることによる不確実性や、防御システムの構築が必要であることを、無謀さの言い訳にしてはなりません。事態の重大さを真に理解すれば、何を犠牲にしてでも先を急ぐという考えは不合理に思えます。

RSI の速度調整

機械知能が自らの開発プロセスでますます大きな役割を担うことは、持続的な技術進歩が行き着く自然な帰結です。AI の進歩が続けば、機械による再帰的自己改善(RSI)は将来の科学的発見の中核になります。

AI 研究の自動化は、計算資源によって知能を拡張する、より劇的な形態です。当然ながら、その一環として AI は計算基盤そのもの⁠も改善します。そしてスケーリングと同様、今後も AI 研究のフロンティアにとどまる唯一の道だと考えているため、OpenAI の研究を RSI に重点化しています。

ここまでの説明は、特に短期的にディープラーニング研究を大幅に加速することが、研究コミュニティとして取るべき正しい共同歩調だと私が考えている、という意味ではありません。この点は強調しておきます。しかし、現在の道の先にあるのはこれだと考えており、私たち全員が進み方を意識的に選ぶ必要があります。主な選択肢は、AI と並行してアラインメントと監視を強化し、人が関与し続けられるようプロセスを導くこと、または、そうした対策への確信を得るため、必要に応じて今後の開発を減速するよう協調することです。

現時点で最善だと考える道は、この二つを組み合わせることです。

アラインメントと監視で達成した具体的な進歩は、概して AI 全般の進歩と密接に結び付いています。好例は、初期の AI アシスタントの学習に欠かせなかった人間のフィードバックによる強化学習⁠(新しいウィンドウで開く)と、推論モデルの進歩によって実現した前述の思考の連鎖の監視⁠(新しいウィンドウで開く)です。自動化が進む研究プロセスを、こうした新たな知見、アルゴリズム、理論の開発に集中させ、より高能力な AI の安全性根拠を反復的に積み上げなければなりません。

AI システムのスケーリングは、安全性への確信によって制約されなければなりません。Preparedness Framework⁠やResponsible Scaling Policy(責任ある規模拡大ポリシー)⁠(新しいウィンドウで開く)のような取り組みを、開発継続のため広く義務付けられる安全基準へと発展させる必要があります。こうした基準は、第三者監査機関のネットワーク、政府機関、国際機関によって執行できます。

AI 研究を自動化するうえでの核心的課題は「到達すること」ではありません。継続的な改善プロセスに人が関わり続け、未来を人類の手に残せる形で到達することです。

今後の展望

先日 Sam とともに示した⁠ように、OpenAI は次の三つの指針に資する取り組みを優先しています。

  1. 自動化された AI 研究者を構築し、それとともにアラインメント問題への取り組みを反復し、人が自己改善の循環に関わり続ける方法を見いだすことで、次の AI 進歩期を切り抜ける

  2. 高度に知的な機械が可能にする科学の進歩と経済成長の恩恵を届ける

  3. 一人ひとりがパーソナル AGI を活用できるようにする

本稿では、これが圧倒的に緊急性の高い課題だと考えるため、最初の点だけに焦点を当てました。一方で、さらなる技術進歩がもたらす恩恵に、深い期待と感謝を抱いています。将来の整合した AI は、科学を前進させ、新たな治療法を開発し、広範な物質的豊かさをもたらし得ます。親しみやすく誠実な AI は、人々が人生の困難を乗り越えるのを助け、幸福感や充実感を大きく高められます。OpenAI は、こうした恩恵の実現に多大な力を注いでいます。私が誇りに思い、大切な人たちも役立つと感じている現在の一例が、ChatGPT の健康情報提供能力への大規模な投資です。

AI の長期的な可能性がどれほど大きくても、私たちは今後数年間に最も多くの力を注ぐべきです。私たちは、信じられないほど知的な機械が存在する世界への移行に直面しており、その移行が人類にとって良い結果となるようにしなければなりません。大半の仕事を AI が遂行できる世界で、人間の主体性を守り、人間であることの本質的価値を確立する方法を見いだす必要があります。かつては何千人もの専門家が必要だった事業を、大型コンピューターを操る数人で実現できる世界で、権力の極端な集中を防ぐ必要があります。そして、人間を超える異質な知性がもたらす歯止めのない進歩に取り残されず、人類が未来を制御し続けられるようにしなければなりません。

現時点では、最大速度でのスケーリングを責任を持って長く続けられるほど、アラインメントと監視を解決した研究所はないと考えています。共通の安全基準が確立されるまで、自主的な減速が一般的になることを期待し、望んでいます。また、将来の AI 開発に関する国際協調を、世界各国の政府が最優先課題とする必要があると考えています。

著者

Jakub Pachocki

脚注

  1. 1
  2. 2

    この設計には、蒸留を防ぐという副次的な理由もありました。しかし開発を通じて、私たちは一貫して CoT の監視可能性を維持することを、明確により重視してきました。