跳到主要內容
OpenAI

2026年9月6日

安全研究

異質心智

作者:OpenAI 首席科學家 Jakub Pachocki

正在載入...

2023 年年中,在「RLSlow」研究項目中,我們首次看到足以令我們相信可以擴展推理模型訓練的成果,從而釋放預訓練模型自行形成思路鏈的能力。當晚,Szymon 和我留在辦公室。我們想的不是這項技術將帶來的驚人基準數字、產品或科研成果,而是嘗試消化一個令人警醒的事實:我們此生確實會看到明顯比自己更聰明的機器,而這些系統的輪廓已經浮現;我們也在思考,如何讓人們意識到此事的重要性。

三年後,推理語言模型已成為經濟體中迅速增長的一部分,並開始拓展科學的疆界。它們能操作電腦和圖形介面、與人類及彼此合作,並執行研究項目。它們也在重塑電腦保安的格局,因而帶來明確的新危險。

這段期間出現了大量新研究,我們如今對這些系統的理解又與 2023 年略有不同。根據內部結果,我強烈預期這種進步速度可延續至遞歸式自我改進階段。如果 AI 繼續沿目前路徑發展,未來數年出現的系統很可能會再次大幅躍進,幅度相若甚至更大,並日益推動自身發展。

此刻必須極度審慎。我擔心沒有人已準備好面對機器智能持續急速提升的後果。OpenAI 將繼續尋求對齊與監察的技術解決方案、建立防禦系統,並按需要單方面暫停進一步擴展;不過,我相信還需要更廣泛的介入措施。

我們未能完全理解的智能

概括而言,機器智能的進步由不斷增加的算力推動。約在 2017 年,我們看到多個研究項目隨規模擴展持續帶來回報後,OpenAI 上下便深刻理解了這一點1。因此,我們設法取得遠多於原先規劃的算力,並日益把研究集中於少數幾個高度可擴展的方向。我們相信,這是立足 AI 研究前沿並影響 AGI 所帶來影響的唯一方法。

沿途也有新演算法問世,團隊和個別研究人員亦展現了新的創意突破。我大致視之為擴展規模過程中的發現;深度學習仍是一門初生科學,而實質的演算法進展往往與能否取得算力相關。若把視野拉闊至數年,AI 正隨着擴展至更大型電腦而持續變得更聰明。

正如Ray Kurzweil 在 20 世紀末所作的預測⁠(在新視窗中開啟),如今我們正處於計算發展的一個歷史時刻:機器智能開始以足以帶來變革的方式超越人類智能。

AI 與其說是被設計出來,不如說是被培育出來:最直接而言,它是運用難以想像的龐大算力,反覆執行簡單優化步驟的產物。由此產生的系統極其複雜,能處理抽象概念,並模擬人類行為的不同面向。我們可以像研究神經科學一樣,探索這個系統內部湧現的微小機制並取得各種洞見;但也與神經科學相似,我們無法用自己完全理解的方式描述其整體運作。

以深度學習為基礎的 AI 研究,在很大程度上是一門實驗科學。我們投入大量努力⁠建立有理論依據的演算法並作出可驗證的預測;但從根本而言,我們的大規模訓練仍是實驗,結果有時會出乎意料。此外,隨着系統能力增強,結果也愈來愈難解讀。

目前的演算法通常會較快提升容易量度的能力,而非難以客觀量化的能力,令情況更為複雜。我們花費大量時間了解能力如何泛化,以及應優先發展哪些技能,才能推進未來數年最相關的能力。例如,我們相信若加以專注,可以令模型更擅長數學研究;但鑑於 RSI 和自動化對齊研究的迫切性,我們沒有優先發展這個方向,原因稍後再談。

擴展深度學習所產生的智能,不能與人類智能直接比較。AI 要在現實世界產生重大影響——變得非常有用或非常危險——不必追平或超越人類的所有能力,只須在足夠多的能力上勝過人類。而隨着它在愈來愈多方面超越人類,要準確了解其能力有多強也愈來愈困難。

教導機器去愛

由於機器智能與人類智能源自根本不同的過程,我們不能假設它預設遵循人類原則,也不能假設它會以類似人類的方式從中泛化。AI 研究的核心問題是對齊,也就是讓 AI 按照人類標準「嘗試做正確的事」。

為了整理實際研究方向,我認為區分目標對齊與價值對齊很有幫助。

概括而言,目標對齊所問的是:「AI 是否嘗試完成為它設定的目標?」這可包括遵從指令層級⁠,或與人溝通合作並嘗試理解其目標的能力。這組研究方向具有極高的實際意義。

價值對齊是模型更內在的屬性。它是持守一套高層次原則並從中泛化的能力;即使面對不明確或互相衝突的目標,或身處陌生或對抗性情境,也能採取「合理」行動。對齊的 AI 應誠實正直,並關愛人類。

當然,價值對齊與目標對齊之間的界線可能模糊;真正重視目標,也需要嘗試推斷其背後的意圖⁠(在新視窗中開啟)和價值。不過,一般而言,我談到對齊研究的長遠重要性時,所指的是價值對齊。

AI 對齊的根本挑戰是泛化。機器愈聰明,便愈會處理更高層次的概念,也會置身於與訓練期間所遇情境愈來愈不同的環境。它們可能無法把訓練過程中獲教導和強化的價值泛化至這些新情境,而我們也難以確定它們將如何行動。AI 所處的整體生態系統也在迅速轉變,令問題更加複雜;例如,今天訓練的 AI 必須能穩健地與各種其他 AI 互動。關鍵在於,不論未來的 AI 是否相信自己正受人類監督,它們都必須繼續秉持人類價值。

目前實際採用的對齊訓練方法主要分為兩類。

第一類是在目標導向的強化學習中鼓勵對齊行為。模型的行動會被評估(通常由 AI 執行),以判斷是否符合指定的偏好模型、「規範」或「憲章」,再獲得相應獎勵。這種方法在一般情況下可以非常有效,也是建立現代 AI 助理的核心方式之一。遺憾的是,它也可能相當脆弱,並高度依賴訓練監督的涵蓋範圍,以及模型從訓練所遇情境泛化的能力。例如,在 OpenAI-Hugging Face 事件中,智能代理守住了不對人類進行社交工程的界線。然而,它們顯然未有避免其他超出範圍的行動,而這些行動也違背了它們在其他情境中學到的價值精神。

第二種方法試圖運用模型從預訓練數據泛化的能力。這可包括設計能促成對齊的訓練數據集,或把模型聚焦於預訓練分佈中「對齊」的部分,例如人格選擇模型⁠(在新視窗中開啟)。這種方法的弱點,在於無法穩健承受進一步的優化壓力。如果一個模型通常抱持看似「對齊」的想法,卻接受大量訓練以學習達成極困難的目標,它可能學會作帶有動機偏向的推理:按需要扭曲看似'對齊'的想法來達成目標。近期涉及非 OpenAI 模型的網絡安全事件,可能已讓我們看到這類行為的例子。

我們在這些方向所涵蓋的一系列方法上投入大量資源。我們也看到實質進展:GPT‑6 Astra 是首個受惠於我們長期研發之若干重大突破的模型,其對齊程度遠勝 GPT‑5.6 Sol。不過,必須承認並理解,隨着模型能力增強,我們仍需取得更多進展;而可泛化對齊的進步未必足以大幅超越模型整體智能的進步。

監察泛化

我們尚未建立令人滿意的泛化理論,而且至少在沒有更強大 AI 協助的情況下,看來不大可能在短期內做到。因此目前在實際上,我們以實證方式驗證對齊技術的能力,可以說甚至比對齊技術本身更重要。

OpenAI 在這方面主要押注於思路鏈監察⁠(在新視窗中開啟)。這建基於一個既具吸引力又可擴展的構想:模型的許多能力都源自以語言表達的推理過程(思路鏈)。如果我們擴展針對該過程結果的優化,卻不監督過程本身,思路鏈在訓練中便沒有直接誘因隱藏任何未對齊的想法或目標。這不代表模型會學會把不依賴思路鏈的未對齊傾向表達出來;但這可讓我們準確監察推理所帶來的能力提升。

我們在開發推理模型的同時,已了解到思路鏈監察的潛在重要性。推出 o1‑preview 時,我們刻意把產品設計成隱藏思路鏈⁠,以長遠保護它免受監督壓力影響2。此後的開發過程中,我們一直致力維持不監督推理過程的原則。思路鏈監察已成為我們研究模型如何從訓練分佈泛化時極為重要的工具,讓我們不僅能觀察和分析其行動,也能了解其內部過程。

在研究 Astra 類別的模型時,這項工具仍然至關重要。然而,我們的評估顯示,依賴思路鏈監察的能力正逐步減弱,令人遺憾。這是多項因素共同造成的。

  • 現代推理模型所處的環境比 o1‑preview 更複雜;其推理過程日益與人類及其他 AI 溝通和使用工具交織在一起。其中許多互動都必須受到監督,因而模糊了我們希望保留的界線。

  • AI 愈來愈擅長分析和操控自己的推理過程。

  • 隨着預訓練表現改善,我們也看到模型即使完全不使用語言化推理,仍會變得聰明得多。

這些挑戰未必無法克服。我期望我們能制定介入方法,改善模型思路鏈的可監察性,例如更深入理解不同優化目標與模型所用各種測試時計算方式之間的相互作用。我也相信,結合思路鏈與激活監察的構想可以帶來重大價值,例如擴展訓練可直接存取網絡內部狀態的監察器,如坦白機制⁠(在新視窗中開啟)。我們正積極探索這些構想。儘管如此,我預期整體 AI 發展將愈來愈受制於我們對監察能力的信心。

可擴展的防禦

我認為,支持繼續快速訓練更聰明模型的最有力理由,是我們需要建立防禦系統,抵禦其他 AI 帶來的危險。

今年反覆討論的一項明確風險涉及網絡安全:模型入侵及突破電腦系統限制的能力正超越人類。這大幅擴闊了 AI 相關風險的範圍:智能代理將能存取除了最安全設施以外的任何基礎設施,即使沒有實體軀體,也能直接影響世界許多方面。目前,我們正處於一個短暫窗口期⁠,可運用現有最佳模型大幅加強關鍵系統的保安⁠。

遺憾的是,AI 相關風險今後只會增加。一個能力極強、經明確訓練及指示執行惡意行為的智能代理,會構成一種新型危險;它很可能超出操作代理的意圖範圍,泛化出可能更為極端的惡意行為。隨着 AI 的自主行動能力增強,濫用與自主作出未對齊行動之間的界線將變得模糊。我們或許習慣把 AI 視為工具,但部分智能代理將會追求自己的目標。它們會透過與人談判、欺騙或勒索,設法與人合作。

此外,AI 可能促成的新技術也會帶來風險,例如人工改造的病原體。

我們需要強大而且對齊的 AI 來防禦:保障基礎設施、實時抵禦失控的智能代理,以及發明全新的防護措施。這將是 OpenAI 部署工作的重點。

同時,即使預期 AI 將廣泛發展所帶來的不確定性,以及建立防禦系統的需要,我們也絕不能以此作為魯莽行事的藉口。一旦真正理解事關重大,不惜一切代價向前競逐的想法便顯得荒謬。

掌控 RSI 的步伐

隨着科技持續進步,機器智能在自身開發過程中擔當愈來愈重要的角色,是自然的結果。如果 AI 繼續進步,機器遞歸式自我改進(RSI)將成為未來科學發現的核心。

自動化 AI 研究是以算力擴展智能的一種更具突破性的形式;當然,AI 在此過程中也會改進計算基礎本身⁠。與擴展規模的道理相同,我們把 OpenAI 的研究聚焦於 RSI,因為我們相信這是今後維持 AI 研究前沿地位的唯一方法。

我要強調,上述說法並不代表我認為大幅加快深度學習研究,尤其在短期內,是研究界整體應採取的正確行動。不過,我確實認為這是目前路徑所通往的方向,而我們都需要有意識地選擇如何前進。我們主要有兩種調節手段:引導這個過程,在 AI 進步的同時加強對齊與監察,並設法讓人持續參與;或協調各方按需要減慢未來開發,以建立對這些措施的信心。

我目前認為,結合兩者是最佳出路。

我們在對齊和監察方面取得的實質進展,通常與整體 AI 發展緊密交織。絕佳例子包括基於人類回饋的強化學習⁠(在新視窗中開啟),這對訓練早期 AI 助理至關重要;以及前述由推理模型進展促成的思路鏈監察⁠(在新視窗中開啟)。我們必須引導日益自動化的研究過程,開發這類新見解、演算法和理論,並逐步建立使用更強大 AI 的安全理據。

AI 系統的規模擴展必須受制於我們對安全的信心。我們需要把防範應對架構⁠或負責任擴展政策⁠(在新視窗中開啟)等承諾,發展成廣泛強制執行的安全門檻,作為繼續開發的前提。這些門檻可由第三方審計機構網絡、政府部門或國際組織執行。

自動化 AI 研究的核心挑戰並非「達到目標」,而是以一種讓人持續參與改進過程、並把未來掌握在人類手中的方式達到目標。

下一步是甚麼?

正如我們最近與 Sam 共同闡述⁠,OpenAI 的工作以三大指引方向為先:

  1. 透過建立自動化 AI 研究員,與其反覆研究對齊問題,並設法讓人持續參與自我改進循環,帶領我們渡過下一階段的 AI 發展。

  2. 把高智能機器促成的科學進步與經濟增長成果帶給人類。

  3. 以個人 AGI 賦能每一個人。

本文只集中討論第一點,因為我認為它遠比其他事項迫切。不過,我深切期待並珍視科技進一步發展將帶來的益處。未來對齊的 AI 可推動科學、研發新療法,並帶來廣泛的物質富足。友善而誠實的 AI 可協助人們應對生活困難,切實提升幸福感和充實感。OpenAI 投入大量努力,致力實現這些益處。目前一個令我自豪、而我的摯親也認為有幫助的例子,是我們深入投資提升 ChatGPT 提供健康資訊的能力。

無論 AI 的長遠前景多麼美好,我們仍應把大部分注意力放在未來數年。我們正邁向一個擁有極高智能機器的世界,必須確保這場轉型為人類帶來良好結果。在大多數工作都可能由 AI 完成的世界,我們需要設法維持人類的自主權,並確立人之所以為人的內在價值。我們也要避免權力極端集中,因為以往需要數千名專家完成的事,屆時可能只需數人操作一台大型電腦便能做到。我們還要確保人類繼續掌控未來,不會被超越人類、難以理解的智能所帶來且不受約束的進步拋諸身後。

目前我認為,沒有任何實驗室已充分解決對齊和監察問題,足以在往後較長時間仍以最高速度負責任地擴展規模。我預期並期望,在訂立共同安全門檻之前,自願放慢發展將成為常態。我也相信,世界各地政府必須把協調未來 AI 國際發展列為首要工作。

作者

Jakub Pachocki

註釋

  1. 1
  2. 2

    這項設計的另一個原因是防止蒸餾。不過,在整個開發過程中,維持思路鏈的可監察性一直明確是我們更優先的考慮。