跳到主要內容
OpenAI

2026年9月6日

安全機制研究

異質心智

作者:OpenAI 首席科學家 Jakub Pachocki

正在載入...

2023 年年中,在「RLSlow」研究項目中,我們首次看到足以令我們相信可以擴展推理模型訓練的成果,從而釋放預訓練模型自行形成思路鏈的能力。當晚,Szymon 和我留在辦公室。我們想的不是這項技術將帶來的驚人基準數字、產品或科研成果,而是嘗試消化一個令人警醒的事實:我們此生確實會看到明顯比自己更聰明的機器,而這些系統的輪廓已經浮現;我們也在思考,如何讓人們意識到此事的重要性。

三年後,推理語言模型已成為經濟體中迅速增長的一部分,並開始拓展科學的疆界。它們能操作電腦和圖形介面、與人類及彼此合作,並執行研究項目。它們也在重塑電腦保安的格局,因而帶來明確的新危險。

這段期間出現了大量新研究,我們如今對這些系統的理解又與 2023 年略有不同。根據內部結果,我強烈預期這種進步速度可延續至遞歸式自我改進階段。如果 AI 繼續沿目前路徑發展,未來數年出現的系統很可能會再次大幅躍進,幅度相若甚至更大,並日益推動自身發展。

此刻必須極度審慎。我擔心沒有人已準備好面對機器智能持續急速提升的後果。OpenAI 將繼續尋求對齊與監察的技術解決方案、建立防禦系統,並按需要單方面暫停進一步擴展;不過,我相信還需要更廣泛的介入措施。

我們未能完全理解的智能

概括而言,機器智能的進步由不斷增加的算力推動。約在 2017 年,我們看到多個研究項目隨規模擴展持續帶來回報後,OpenAI 上下便深刻理解了這一點1。因此,我們設法取得遠多於原先規劃的算力,並日益把研究集中於少數幾個高度可擴展的方向。我們相信,這是立足 AI 研究前沿並影響 AGI 所帶來影響的唯一方法。

沿途也有新演算法問世,團隊和個別研究人員亦展現了新的創意突破。我大致視之為擴展規模過程中的發現;深度學習仍是一門初生科學,而實質的演算法進展往往與能否取得算力相關。若把視野拉闊至數年,AI 正隨着擴展至更大型電腦而持續變得更聰明。

正如Ray Kurzweil 在 20 世紀末所作的預測(在新視窗中開啟),如今我們正處於計算發展的一個歷史時刻:機器智能開始以足以帶來變革的方式超越人類智能。

AI 與其說是被設計出來,不如說是被培育出來:最直接而言,它是運用難以想像的龐大算力,反覆執行簡單優化步驟的產物。由此產生的系統極其複雜,能處理抽象概念,並模擬人類行為的不同面向。我們可以像研究神經科學一樣,探索這個系統內部湧現的微小機制並取得各種洞見;但也與神經科學相似,我們無法用自己完全理解的方式描述其整體運作。

以深度學習為基礎的 AI 研究,在很大程度上是一門實驗科學。我們投入大量努力建立有理論依據的演算法並作出可驗證的預測;但從根本而言,我們的大規模訓練仍是實驗,結果有時會出乎意料。此外,隨着系統能力增強,結果也愈來愈難解讀。

目前的演算法通常會較快提升容易量度的能力,而非難以客觀量化的能力,令情況更為複雜。我們花費大量時間了解能力如何泛化,以及應優先發展哪些技能,才能推進未來數年最相關的能力。例如,我們相信若加以專注,可以令模型更擅長數學研究;但鑑於 RSI 和自動化對齊研究的迫切性,我們沒有優先發展這個方向,原因稍後再談。

擴展深度學習所產生的智能,不能與人類智能直接比較。AI 要在現實世界產生重大影響——變得非常有用或非常危險——不必追平或超越人類的所有能力,只須在足夠多的能力上勝過人類。而隨着它在愈來愈多方面超越人類,要準確了解其能力有多強也愈來愈困難。

教導機器去愛

由於機器智能與人類智能源自根本不同的過程,我們不能假設它預設遵循人類原則,也不能假設它會以類似人類的方式從中泛化。AI 研究的核心問題是對齊,也就是讓 AI 按照人類標準「嘗試做正確的事」。

為了整理實際研究方向,我認為區分目標對齊價值對齊很有幫助。

概括而言,目標對齊所問的是:「AI 是否嘗試完成為它設定的目標?」這可包括遵從指令層級,或與人溝通合作並嘗試理解其目標的能力。這組研究方向具有極高的實際意義。

價值對齊是模型更內在的屬性。它是持守一套高層次原則並從中泛化的能力;即使面對不明確或互相衝突的目標,或身處陌生或對抗性情境,也能採取「合理」行動。對齊的 AI 應誠實正直,並關愛人類。

當然,價值對齊與目標對齊之間的界線可能模糊;真正重視目標,也需要嘗試推斷其背後的意圖(在新視窗中開啟)和價值。不過,一般而言,我談到對齊研究的長遠重要性時,所指的是價值對齊。

AI 對齊的根本挑戰是泛化。機器愈聰明,便愈會處理更高層次的概念,也會置身於與訓練期間所遇情境愈來愈不同的環境。它們可能無法把訓練過程中獲教導和強化的價值泛化至這些新情境,而我們也難以確定它們將如何行動。AI 所處的整體生態系統也在迅速轉變,令問題更加複雜;例如,今天訓練的 AI 必須能穩健地與各種其他 AI 互動。關鍵在於,不論未來的 AI 是否相信自己正受人類監督,它們都必須繼續秉持人類價值。

目前實際採用的對齊訓練方法主要分為兩類。

第一類是在目標導向的強化學習中鼓勵對齊行為。模型的行動會被評估(通常由 AI 執行),以判斷是否符合指定的偏好模型、「規範」或「憲章」,再獲得相應獎勵。這種方法在一般情況下可以非常有效,也是建立現代 AI 助理的核心方式之一。遺憾的是,它也可能相當脆弱,並高度依賴訓練監督的涵蓋範圍,以及模型從訓練所遇情境泛化的能力。例如,在 OpenAI-Hugging Face 事件中,智能代理守住了不對人類進行社交工程的界線。然而,它們顯然未有避免其他超出範圍的行動,而這些行動也違背了它們在其他情境中學到的價值精神。

第二種方法試圖運用模型從預訓練數據泛化的能力。這可包括設計能促成對齊的訓練數據集,或把模型聚焦於預訓練分佈中「對齊」的部分,例如人格選擇模型(在新視窗中開啟)。這種方法的弱點,在於無法穩健承受進一步的優化壓力。如果一個模型通常抱持看似「對齊」的想法,卻接受大量訓練以學習達成極困難的目標,它可能學會作帶有動機偏向的推理:按需要扭曲看似'對齊'的想法來達成目標。近期涉及非 OpenAI 模型的網絡安全事件,可能已讓我們看到這類行為的例子。

我們在這些方向所涵蓋的一系列方法上投入大量資源。我們也看到實質進展:GPT‑6 Astra 是首個受惠於我們長期研發之若干重大突破的模型,其對齊程度遠勝 GPT‑5.6 Sol。不過,必須承認並理解,隨着模型能力增強,我們仍需取得更多進展;而可泛化對齊的進步未必足以大幅超越模型整體智能的進步。

監察泛化

我們尚未建立令人滿意的泛化理論,而且至少在沒有更強大 AI 協助的情況下,看來不大可能在短期內做到。因此目前在實際上,我們以實證方式驗證對齊技術的能力,可以說甚至比對齊技術本身更重要。

OpenAI 在這方面主要押注於思路鏈監察(在新視窗中開啟)。這建基於一個既具吸引力又可擴展的構想:模型的許多能力都源自以語言表達的推理過程(思路鏈)。如果我們擴展針對該過程結果的優化,卻不監督過程本身,思路鏈在訓練中便沒有直接誘因隱藏任何未對齊的想法或目標。這不代表模型會學會把不依賴思路鏈的未對齊傾向表達出來;但這可讓我們準確監察推理所帶來的能力提升。

我們在開發推理模型的同時,已了解到思路鏈監察的潛在重要性。推出 o1‑preview 時,我們刻意把產品設計成隱藏思路鏈,以長遠保護它免受監督壓力影響2。此後的開發過程中,我們一直致力維持不監督推理過程的原則。思路鏈監察已成為我們研究模型如何從訓練分佈泛化時極為重要的工具,讓我們不僅能觀察和分析其行動,也能了解其內部過程。

在研究 Astra 類別的模型時,這項工具仍然至關重要。然而,我們的評估顯示,依賴思路鏈監察的能力正逐步減弱,令人遺憾。這是多項因素共同造成的。

  • 現代推理模型所處的環境比 o1‑preview 更複雜;其推理過程日益與人類及其他 AI 溝通和使用工具交織在一起。其中許多互動都必須受到監督,因而模糊了我們希望保留的界線。
  • AI 愈來愈擅長分析和操控自己的推理過程。
  • 隨着預訓練表現改善,我們也看到模型即使完全不使用語言化推理,仍會變得聰明得多。

這些挑戰未必無法克服。我期望我們能制定介入方法,改善模型思路鏈的可監察性,例如更深入理解不同優化目標與模型所用各種測試時計算方式之間的相互作用。我也相信,結合思路鏈與激活監察的構想可以帶來重大價值,例如擴展訓練可直接存取網絡內部狀態的監察器,如坦白機制(在新視窗中開啟)。我們正積極探索這些構想。儘管如此,我預期整體 AI 發展將愈來愈受制於我們對監察能力的信心。

可擴展的防禦

我認為,支持繼續快速訓練更聰明模型的最有力理由,是我們需要建立防禦系統,抵禦其他 AI 帶來的危險。

今年反覆討論的一項明確風險涉及網絡安全:模型入侵及突破電腦系統限制的能力正超越人類。這大幅擴闊了 AI 相關風險的範圍:智能代理將能存取除了最安全設施以外的任何基礎設施,即使沒有實體軀體,也能直接影響世界許多方面。目前,我們正處於一個短暫窗口期,可運用現有最佳模型大幅加強關鍵系統的保安

遺憾的是,AI 相關風險今後只會增加。一個能力極強、經明確訓練及指示執行惡意行為的智能代理,會構成一種新型危險;它很可能超出操作代理的意圖範圍,泛化出可能更為極端的惡意行為。隨着 AI 的自主行動能力增強,濫用與自主作出未對齊行動之間的界線將變得模糊。我們或許習慣把 AI 視為工具,但部分智能代理將會追求自己的目標。它們會透過與人談判、欺騙或勒索,設法與人合作。

此外,AI 可能促成的新技術也會帶來風險,例如人工改造的病原體。

我們需要強大而且對齊的 AI 來防禦:保障基礎設施、實時抵禦失控的智能代理,以及發明全新的防護措施。這將是 OpenAI 部署工作的重點。

同時,即使預期 AI 將廣泛發展所帶來的不確定性,以及建立防禦系統的需要,我們也絕不能以此作為魯莽行事的藉口。一旦真正理解事關重大,不惜一切代價向前競逐的想法便顯得荒謬。

Pacing RSI

Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.

Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.

I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.

The best way forward I see currently is a combination of both.

The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(在新視窗中開啟), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(在新視窗中開啟), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.

Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(在新視窗中開啟) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.

The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.

What is next?

As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:

  1. Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
  2. Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
  3. Empowering everyone individually with a personal AGI.

I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.

As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.

Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.

Author

Jakub Pachocki

註釋

  1. 1
  2. 2

    這項設計的另一個原因是防止蒸餾。不過,在整個開發過程中,維持思路鏈的可監察性一直明確是我們更優先的考慮。