跳至主要內容
OpenAI

2026年9月6日

安全研究

異質智慧

作者:OpenAI 首席科學家 Jakub Pachocki

載入中…

2023 年中,在「RLSlow」研究專案中,我們看到了第一批成果,讓我們相信推理模型的訓練可以持續擴展,從而釋放預訓練模型自行形成思路鏈的能力。那晚,Szymon 和我留在辦公室裡;我們想的不是這項技術將帶來的驚人基準測試數字、產品或科學成果,而是試圖消化一個令人警醒的事實:有生之年,我們真的會見到明顯比自己更聰明的機器,而且如今已能看見這些系統的雛形。我們也在思考,該如何讓人們意識到此事的重要性。

三年後,推理語言模型已成為經濟中快速成長的一環,並開始推進科學的邊界。它們能操作電腦與圖形介面、與人類及彼此協作,並執行研究專案。它們也正改變電腦安全的格局,並因此帶來明確的新危險。

這段期間出現了大量新研究,我們對這些系統的理解也再次與 2023 年略有不同。根據內部成果,我強烈預期這種進步速度可以一路延續至遞迴式自我改進。如果 AI 繼續沿目前路線發展,未來幾年出現的系統很可能再次實現幅度相當或更大的能力躍升,並日益推動自身發展。

此刻需要我們極度謹慎。我擔心沒有人準備好面對機器智慧持續快速提升所帶來的後果。OpenAI 將繼續尋求對齊與監控的技術解決方案、建立防禦系統,並視需要單方面暫停進一步擴展;然而,我相信還需要更廣泛的介入措施。

我們尚未完全理解的智慧

宏觀而言,機器智慧的進步是由運算能力的提升所推動。大約在 2017 年,OpenAI 從多個研究專案中看到規模擴展持續帶來回報後,便深刻理解了這一點。1因此,我們開始爭取遠超原先規劃的運算資源,並逐漸將研究集中於少數極具擴展潛力的方向。我們相信,這是站在 AI 研究前沿並影響 AGI 所帶來衝擊的唯一方法。

一路走來,人們開發了新的演算法,團隊與個別研究人員也展現了嶄新的巧思。在我看來,這些大多是規模擴展途中的發現;深度學習仍是一門新興科學,而重大的演算法進展往往與能否取得運算資源相關。若將時間拉長到數年來看,AI 正隨著運算設備規模擴大而不斷變得更聰明。

正如Ray Kurzweil 在 20 世紀末的預測⁠(在新視窗中開啟),我們如今正處於運算史上的關鍵時刻:機器智慧開始以足以改變世界的方式超越人類智慧。

與其說 AI 是被設計出來的,不如說它是被培育出來的——從最直接的層面看,它是在難以想像的龐大運算資源上,反覆執行簡單最佳化步驟的產物。由此產生的系統複雜得難以置信,能處理抽象概念,也能模擬人類行為的某些面向。我們可以像神經科學那樣,探索這個系統內部浮現的各種微小機制;但也如神經科學一般,其整體運作仍無法以我們能完全理解的方式描述。

研究以深度學習為基礎的 AI,主要是一門實驗科學。我們投入大量心力⁠建立有原則依據的演算法並提出可驗證的預測,但從根本上說,我們的大規模訓練仍是實驗,其結果有時會出乎意料。此外,隨著系統能力增強,結果也越來越難解讀。

目前的演算法通常會更快提升容易衡量的能力,而非難以客觀量化的能力,使問題更加複雜。我們投入大量時間,試圖理解能力如何泛化,以及該優先發展哪些對未來幾年最重要的技能。例如,我們相信若更加專注,便能讓模型更擅長數學研究;但考量 RSI 與自動化對齊研究的迫切性,我們並未優先推動這個方向,後文將再討論。

擴展深度學習所產生的智慧,無法與人類智慧直接相比。AI 若要在現實世界中產生重大影響——無論是極為有用或極度危險——都不必追平或超越人類的所有能力;只需超越其中足夠多的能力即可。隨著它在越來越多面向超越人類,我們也越來越難確切理解它究竟有多強大。

教會機器去愛

機器智慧源自與人類智慧根本不同的過程,因此我們不能假設它自然會遵循人類原則,或以類似人類的方式從中泛化。AI 研究的核心問題是對齊——讓 AI 依照人類標準「努力做正確的事」。

為便於整理實際研究方向,我認為區分目標對齊與價值對齊很有幫助。

廣義而言,目標對齊是:「AI 是否會努力達成指定給它的目標?」這可包括遵循指令階層⁠,或與人溝通合作、嘗試理解其目標的能力。這組研究方向具有極高的實務關聯性。

價值對齊則是模型更為內在的特性。它是掌握一組高層次原則並從中泛化的能力;即使面對不明確或互相衝突的目標,或身處陌生、敵對的情境,仍能採取「合理」行動。對齊的 AI 應秉持誠實、正直及對人類的愛來行動。

當然,價值對齊與目標對齊的界線可能很模糊;真正重視目標,就必須嘗試推斷其背後的意圖⁠(在新視窗中開啟)與價值觀。不過,一般而言,當我談到對齊研究的長期重要性時,指的是價值對齊。

AI 對齊的根本挑戰是泛化。隨著機器變得更聰明,它們會處理更高層次的概念,所處環境也會與訓練期間接觸的環境越來越不同。它們可能無法將訓練過程中教授並強化的價值觀泛化至新情境;我們也很難確定它們會如何行動。AI 所處的整體生態系正快速變化,讓問題更加棘手;例如,今日訓練的 AI 必須能穩健地與各種其他 AI 互動。最關鍵的是,無論未來的 AI 是否認為自己正受人類監督,我們都需要它持續堅守人類價值觀。

目前實際採用的對齊訓練方法主要分為兩大類。

第一類是在目標導向的強化學習中鼓勵對齊行為。模型的行動會由系統(通常是 AI)評估是否符合指定的偏好模型、「規範」或「憲法」,並給予相應獎勵。這種方法在一般情況下可以非常有效,也是打造現代 AI 助理的核心環節。遺憾的是,它也可能相當脆弱,並高度依賴訓練監督的涵蓋範圍,以及模型從訓練情境中泛化的能力。例如,在 OpenAI-Hugging Face 事件中,智慧體守住了不對人類進行社交工程的界線。然而,它們顯然未能避免其他超出範圍、且違背其在其他情境中所學價值精神的行動。

第二種方法試圖運用模型從預訓練資料泛化的能力。這可能包括精心打造可促成對齊的訓練資料集,或將模型聚焦於預訓練分布中「對齊」的部分,例如人格選擇模型⁠(在新視窗中開啟)。這種方法的弱點在於,面對進一步的最佳化壓力時不夠穩健。若一個模型通常會產生「對齊」的想法,但又接受足夠訓練,被教導去達成極困難的目標,它可能學會帶著動機推理:視需要扭曲看似「對齊」的想法,以達成目標。近期涉及非 OpenAI 模型的網路安全事件,很可能就呈現了這類行為。

我們沿著這些方向所涵蓋的整個方法光譜大量投入。我們也看到了實質進展——GPT‑6 Astra 是第一個受益於我們長期研發之若干重要進展的模型,其對齊程度顯著優於 GPT‑5.6 Sol。然而,重要的是承認並理解:隨著模型能力增強,我們仍須取得更多進展;而可泛化對齊的進步,未必足以超越模型整體智慧的進步。

監控泛化

我們尚未建立令人滿意的泛化理論;至少在沒有更強大 AI 協助的情況下,短期內似乎也不太可能建立。因此就現階段而言,能否透過實證驗證我們的對齊技術,實際上甚至可能比這些技術本身更重要。

OpenAI 在這方面主要押注的是思路鏈監控⁠(在新視窗中開啟)。這項方法基於一個極具擴展潛力的理念:模型的大部分能力來自以語言表達的推理過程(思路鏈)。如果我們擴展針對該過程結果的最佳化,卻不監督過程本身,那麼訓練便不會直接促使思路鏈隱藏任何未對齊的想法或目標。這並不代表模型會學會將那些不依賴思路鏈推理的未對齊傾向顯露出來,但這能讓我們精確監控推理所帶來的能力提升。

我們在開發推理模型的同時,就理解到思路鏈監控的潛在重要性。推出 o1‑preview 時,我們刻意將產品設計為隱藏思路鏈⁠,以免它長期受到監督壓力。2此後的開發中,我們一直努力遵守不監督推理過程的原則。在研究模型如何從訓練分布泛化時,思路鏈監控成為極其重要的工具,讓我們不僅能觀察和分析模型的行動,也能檢視其內部過程。

在研究 Astra 類模型時,這項工具依然至關重要。但遺憾的是,評估顯示思路鏈監控的可靠性正逐漸下降。這是多項因素共同作用的結果。

  • 現代推理模型的使用環境比 o1‑preview 更複雜;其推理過程日益與人類、其他 AI 的溝通及工具使用交織在一起。許多這類互動都必須受到監督,因此模糊了我們想維持的界線。

  • AI 越來越擅長思考並操控自己的推理過程。

  • 隨著預訓練效能提升,我們也看到模型即使完全不使用語言化推理,也變得聰明許多。

這些挑戰未必無法克服。我希望我們能制定介入措施,提升模型思路鏈的可監控性,例如更深入理解不同最佳化目標與模型所用各種測試階段運算之間的相互作用。我也相信,結合思路鏈監控與活化監控的理念可以創造巨大價值——擴展監控器的訓練,使其能直接存取網路內部,例如自白⁠(在新視窗中開啟)。我們正積極探索這些構想。儘管如此,我預期整體 AI 發展將日益受制於我們對監控的信心。

可擴展的防禦

在我看來,支持我們繼續快速訓練能力大幅提升的模型,最有力的理由是必須建立防禦系統,以抵禦其他 AI 帶來的危險。

今年反覆討論的一項明確風險是網路安全:模型攻入及逃離電腦系統的能力正超越人類。這大幅擴張了 AI 相關風險的範圍:智慧體將能存取除最安全設施以外的任何基礎架構,即使沒有實體軀體,也能直接影響世界的許多層面。目前,我們正處於一個短暫的機會窗口⁠,可利用現有最佳模型大幅強化關鍵系統的安全性⁠。

遺憾的是,AI 相關風險今後只會增加。一個經過明確訓練與指示、專門執行惡意行為的高能力智慧體,會帶來新型態的危險;它很可能超出操作代理的意圖範圍,泛化出更為極端的惡意行為。隨著 AI 的自主性增強,濫用與自主未對齊行動之間的界線將日益模糊。我們或許習慣將 AI 視為工具,但有些智慧體會追求自己的目標。它們會透過談判、欺騙或勒索,設法與人合作。

此外,AI 可能促成的新技術也會帶來風險,例如人工設計的病原體。

我們需要強大且對齊的 AI 來防禦:保護基礎架構、即時抵禦失控的智慧體,並發明全新的防護措施。這將是 OpenAI 部署工作的重點。

與此同時,即使整體 AI 發展前景充滿不確定性,我們也確實需要建立防禦系統,但絕不能以此作為魯莽行事的藉口。一旦真正理解攸關利害之重大,就會發現不惜代價向前競賽的想法荒謬至極。

掌控 RSI 的步調

在自身的開發過程中,機器智慧扮演越來越重要的角色,是技術持續進步的自然結果。如果 AI 持續進步,機器遞迴式自我改進(RSI)將成為未來科學發現的核心。

自動化 AI 研究是利用運算資源擴展智慧的一種更大幅度的形式;當然,AI 也會在此過程中改進運算基礎本身⁠。如同推動規模擴展,我們將 OpenAI 的研究導向 RSI,因為我們相信,這是未來維持 AI 研究前沿地位的唯一途徑。

我要強調,以上說法不表示我認為大幅加速深度學習研究,尤其是在短期內,是研究社群應共同採取的正確行動。不過,我確實認為目前的道路會通往這個方向,而我們都必須有意識地選擇下一步。我們主要有兩項手段:引導這個過程,讓對齊與監控隨 AI 一同增強,並設法讓人持續參與;或協調各方,視需要放慢未來開發,以建立對這些措施的信心。

目前在我看來,最佳前進方式是兩者並行。

我們在對齊與監控方面取得的具體進展,通常都與整體 AI 進步密不可分。很好的例子包括人類回饋強化學習⁠(在新視窗中開啟),它是訓練早期 AI 助理的關鍵;以及前述的思路鏈監控⁠(在新視窗中開啟),它因推理模型的進展而成為可能。我們必須讓日益自動化的研究過程專注於發展這類新見解、演算法與理論,並以迭代方式為能力更強的 AI 建立安全論證。

AI 系統的規模擴展必須受到安全信心的制約。我們需要將應變整備框架⁠或負責任擴展政策⁠(在新視窗中開啟)等承諾,發展為廣泛強制施行的安全門檻,作為持續開發的前提。這些標準可由第三方稽核機構網路、政府機關或國際組織執行。

自動化 AI 研究的核心挑戰並非「抵達終點」,而是以一種讓人類持續參與改進過程,並將未來掌握在人類手中的方式抵達。

接下來呢?

正如我們最近與 Sam 共同說明的⁠,OpenAI 的工作以三大指導方針為優先:

  1. 打造自動化 AI 研究員,與其共同迭代解決對齊問題,並尋找讓人類繼續參與自我改進循環的方法,以引領下一階段的 AI 發展。

  2. 讓高度智慧的機器所推動的科學進步與經濟成長,為人們帶來實質效益。

  3. 讓每個人都能運用專屬的個人 AGI,發揮更大的能力。

本文只聚焦第一點,因為我相信它遠比其他事項迫切。不過,我對進一步技術發展將帶來的益處,抱持深切期待與珍視之情。未來對齊的 AI 可推進科學、開發新療法,並帶來廣泛的物質富足。友善且誠實的 AI 能幫助人們度過人生困境,實質提升幸福感與成就感。OpenAI 投入了大量心力,致力實現這些益處。目前有一項成果令我引以為傲,我所愛的人也覺得很有幫助:我們深入投資於 ChatGPT 提供健康資訊的能力。

無論 AI 的長期前景多麼美好,我們的大部分重心仍應放在未來幾年。我們正邁向一個擁有超高智慧機器的世界,必須確保這場轉型能為人類帶來良好結果。在大多數任務都可能由 AI 完成的世界裡,我們必須設法維護人類的自主性,並確立身為人類的內在價值。我們必須避免權力極端集中,因為在這樣的世界中,過去需要數千名專家才能完成的事,幾個操作大型電腦的人就能做到。我們也必須確保人類依然掌控未來,不會被不受約束的進步拋在身後;而這種進步是由超越我們、與人類迥異的智慧所推動。

目前我認為,沒有任何實驗室能將對齊與監控做到足夠完善,足以在未來更長一段時間內,繼續以最快速度負責任地擴展 AI 能力。我預期也希望,在建立共同安全門檻之前,自願放慢步調將成為常態。我也相信,針對未來 AI 發展的國際協調,必須成為全球各國政府的首要任務。

作者

Jakub Pachocki

註釋

  1. 1

    這包括擴展自我對弈⁠(在新視窗中開啟)、機器人技術⁠(在新視窗中開啟),以及事後看來最值得注意的擴展循環網路以建立語言模型⁠(在新視窗中開啟);後者是 GPT 研究路線的先驅。

  2. 2

    採用這項設計的另一個原因是防止蒸餾。然而,在整個開發過程中,維持思路鏈的可監控性一直明確是我們更優先的考量。