2023 年中,在「RLSlow」研究專案中,我們看到了第一批成果,讓我們相信推理模型的訓練可以持續擴展,從而釋放預訓練模型自行形成思路鏈的能力。那晚,Szymon 和我留在辦公室裡;我們想的不是這項技術將帶來的驚人基準測試數字、產品或科學成果,而是試圖消化一個令人警醒的事實:有生之年,我們真的會見到明顯比自己更聰明的機器,而且如今已能看見這些系統的雛形。我們也在思考,該如何讓人們意識到此事的重要性。
三年後,推理語言模型已成為經濟中快速成長的一環,並開始推進科學的邊界。它們能操作電腦與圖形介面、與人類及彼此協作,並執行研究專案。它們也正改變電腦安全的格局,並因此帶來明確的新危險。
這段期間出現了大量新研究,我們對這些系統的理解也再次與 2023 年略有不同。根據內部成果,我強烈預期這種進步速度可以一路延續至遞迴式自我改進。如果 AI 繼續沿目前路線發展,未來幾年出現的系統很可能再次實現幅度相當或更大的能力躍升,並日益推動自身發展。
此刻需要我們極度謹慎。我擔心沒有人準備好面對機器智慧持續快速提升所帶來的後果。OpenAI 將繼續尋求對齊與監控的技術解決方案、建立防禦系統,並視需要單方面暫停進一步擴展;然而,我相信還需要更廣泛的介入措施。
宏觀而言,機器智慧的進步是由運算能力的提升所推動。大約在 2017 年,OpenAI 從多個研究專案中看到規模擴展持續帶來回報後,便深刻理解了這一點。1因此,我們開始爭取遠超原先規劃的運算資源,並逐漸將研究集中於少數極具擴展潛力的方向。我們相信,這是站在 AI 研究前沿並影響 AGI 所帶來衝擊的唯一方法。
一路走來,人們開發了新的演算法,團隊與個別研究人員也展現了嶄新的巧思。在我看來,這些大多是規模擴展途中的發現;深度學習仍是一門新興科學,而重大的演算法進展往往與能否取得運算資源相關。若將時間拉長到數年來看,AI 正隨著運算設備規模擴大而不斷變得更聰明。
正如Ray Kurzweil 在 20 世紀末的預測(在新視窗中開啟),我們如今正處於運算史上的關鍵時刻:機器智慧開始以足以改變世界的方式超越人類智慧。
與其說 AI 是被設計出來的,不如說它是被培育出來的——從最直接的層面看,它是在難以想像的龐大運算資源上,反覆執行簡單最佳化步驟的產物。由此產生的系統複雜得難以置信,能處理抽象概念,也能模擬人類行為的某些面向。我們可以像神經科學那樣,探索這個系統內部浮現的各種微小機制;但也如神經科學一般,其整體運作仍無法以我們能完全理解的方式描述。
研究以深度學習為基礎的 AI,主要是一門實驗科學。我們投入大量心力建立有原則依據的演算法並提出可驗證的預測,但從根本上說,我們的大規模訓練仍是實驗,其結果有時會出乎意料。此外,隨著系統能力增強,結果也越來越難解讀。
目前的演算法通常會更快提升容易衡量的能力,而非難以客觀量化的能力,使問題更加複雜。我們投入大量時間,試圖理解能力如何泛化,以及該優先發展哪些對未來幾年最重要的技能。例如,我們相信若更加專注,便能讓模型更擅長數學研究;但考量 RSI 與自動化對齊研究的迫切性,我們並未優先推動這個方向,後文將再討論。
擴展深度學習所產生的智慧,無法與人類智慧直接相比。AI 若要在現實世界中產生重大影響——無論是極為有用或極度危險——都不必追平或超越人類的所有能力;只需超越其中足夠多的能力即可。隨著它在越來越多面向超越人類,我們也越來越難確切理解它究竟有多強大。
機器智慧源自與人類智慧根本不同的過程,因此我們不能假設它自然會遵循人類原則,或以類似人類的方式從中泛化。AI 研究的核心問題是對齊——讓 AI 依照人類標準「努力做正確的事」。
為便於整理實際研究方向,我認為區分目標對齊與價值對齊很有幫助。
廣義而言,目標對齊是:「AI 是否會努力達成指定給它的目標?」這可包括遵循指令階層,或與人溝通合作、嘗試理解其目標的能力。這組研究方向具有極高的實務關聯性。
價值對齊則是模型更為內在的特性。它是掌握一組高層次原則並從中泛化的能力;即使面對不明確或互相衝突的目標,或身處陌生、敵對的情境,仍能採取「合理」行動。對齊的 AI 應秉持誠實、正直及對人類的愛來行動。
當然,價值對齊與目標對齊的界線可能很模糊;真正重視目標,就必須嘗試推斷其背後的意圖(在新視窗中開啟)與價值觀。不過,一般而言,當我談到對齊研究的長期重要性時,指的是價值對齊。
AI 對齊的根本挑戰是泛化。隨著機器變得更聰明,它們會處理更高層次的概念,所處環境也會與訓練期間接觸的環境越來越不同。它們可能無法將訓練過程中教授並強化的價值觀泛化至新情境;我們也很難確定它們會如何行動。AI 所處的整體生態系正快速變化,讓問題更加棘手;例如,今日訓練的 AI 必須能穩健地與各種其他 AI 互動。最關鍵的是,無論未來的 AI 是否認為自己正受人類監督,我們都需要它持續堅守人類價值觀。
目前實際採用的對齊訓練方法主要分為兩大類。
第一類是在目標導向的強化學習中鼓勵對齊行為。模型的行動會由系統(通常是 AI)評估是否符合指定的偏好模型、「規範」或「憲法」,並給予相應獎勵。這種方法在一般情況下可以非常有效,也是打造現代 AI 助理的核心環節。遺憾的是,它也可能相當脆弱,並高度依賴訓練監督的涵蓋範圍,以及模型從訓練情境中泛化的能力。例如,在 OpenAI-Hugging Face 事件中,智慧體守住了不對人類進行社交工程的界線。然而,它們顯然未能避免其他超出範圍、且違背其在其他情境中所學價值精神的行動。
第二種方法試圖運用模型從預訓練資料泛化的能力。這可能包括精心打造可促成對齊的訓練資料集,或將模型聚焦於預訓練分布中「對齊」的部分,例如人格選擇模型(在新視窗中開啟)。這種方法的弱點在於,面對進一步的最佳化壓力時不夠穩健。若一個模型通常會產生「對齊」的想法,但又接受足夠訓練,被教導去達成極困難的目標,它可能學會帶著動機推理:視需要扭曲看似「對齊」的想法,以達成目標。近期涉及非 OpenAI 模型的網路安全事件,很可能就呈現了這類行為。
我們沿著這些方向所涵蓋的整個方法光譜大量投入。我們也看到了實質進展——GPT‑6 Astra 是第一個受益於我們長期研發之若干重要進展的模型,其對齊程度顯著優於 GPT‑5.6 Sol。然而,重要的是承認並理解:隨著模型能力增強,我們仍須取得更多進展;而可泛化對齊的進步,未必足以超越模型整體智慧的進步。
我們尚未建立令人滿意的泛化理論;至少在沒有更強大 AI 協助的情況下,短期內似乎也不太可能建立。因此就現階段而言,能否透過實證驗證我們的對齊技術,實際上甚至可能比這些技術本身更重要。
OpenAI 在這方面主要押注的是思路鏈監控(在新視窗中開啟)。這項方法基於一個極具擴展潛力的理念:模型的大部分能力來自以語言表達的推理過程(思路鏈)。如果我們擴展針對該過程結果的最佳化,卻不監督過程本身,那麼訓練便不會直接促使思路鏈隱藏任何未對齊的想法或目標。這並不代表模型會學會將那些不依賴思路鏈推理的未對齊傾向顯露出來,但這能讓我們精確監控推理所帶來的能力提升。
我們在開發推理模型的同時,就理解到思路鏈監控的潛在重要性。推出 o1‑preview 時,我們刻意將產品設計為隱藏思路鏈,以免它長期受到監督壓力。2此後的開發中,我們一直努力遵守不監督推理過程的原則。在研究模型如何從訓練分布泛化時,思路鏈監控成為極其重要的工具,讓我們不僅能觀察和分析模型的行動,也能檢視其內部過程。
在研究 Astra 類模型時,這項工具依然至關重要。但遺憾的是,評估顯示思路鏈監控的可靠性正逐漸下降。這是多項因素共同作用的結果。
- 現代推理模型的使用環境比 o1‑preview 更複雜;其推理過程日益與人類、其他 AI 的溝通及工具使用交織在一起。許多這類互動都必須受到監督,因此模糊了我們想維持的界線。
- AI 越來越擅長思考並操控自己的推理過程。
- 隨著預訓練效能提升,我們也看到模型即使完全不使用語言化推理,也變得聰明許多。
這些挑戰未必無法克服。我希望我們能制定介入措施,提升模型思路鏈的可監控性,例如更深入理解不同最佳化目標與模型所用各種測試階段運算之間的相互作用。我也相信,結合思路鏈監控與活化監控的理念可以創造巨大價值——擴展監控器的訓練,使其能直接存取網路內部,例如自白(在新視窗中開啟)。我們正積極探索這些構想。儘管如此,我預期整體 AI 發展將日益受制於我們對監控的信心。
在我看來,支持我們繼續快速訓練能力大幅提升的模型,最有力的理由是必須建立防禦系統,以抵禦其他 AI 帶來的危險。
今年反覆討論的一項明確風險是網路安全:模型攻入及逃離電腦系統的能力正超越人類。這大幅擴張了 AI 相關風險的範圍:智慧體將能存取除最安全設施以外的任何基礎架構,即使沒有實體軀體,也能直接影響世界的許多層面。目前,我們正處於一個短暫的機會窗口,可利用現有最佳模型大幅強化關鍵系統的安全性。
遺憾的是,AI 相關風險今後只會增加。一個經過明確訓練與指示、專門執行惡意行為的高能力智慧體,會帶來新型態的危險;它很可能超出操作代理的意圖範圍,泛化出更為極端的惡意行為。隨著 AI 的自主性增強,濫用與自主未對齊行動之間的界線將日益模糊。我們或許習慣將 AI 視為工具,但有些智慧體會追求自己的目標。它們會透過談判、欺騙或勒索,設法與人合作。
此外,AI 可能促成的新技術也會帶來風險,例如人工設計的病原體。
我們需要強大且對齊的 AI 來防禦:保護基礎架構、即時抵禦失控的智慧體,並發明全新的防護措施。這將是 OpenAI 部署工作的重點。
與此同時,即使整體 AI 發展前景充滿不確定性,我們也確實需要建立防禦系統,但絕不能以此作為魯莽行事的藉口。一旦真正理解攸關利害之重大,就會發現不惜代價向前競賽的想法荒謬至極。
Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.
Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.
I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.
The best way forward I see currently is a combination of both.
The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(在新視窗中開啟), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(在新視窗中開啟), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.
Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(在新視窗中開啟) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.
The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.
As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:
- Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
- Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
- Empowering everyone individually with a personal AGI.
I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.
As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.
Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.
Author
註釋
- 1
這包括擴展自我對弈(在新視窗中開啟)、機器人技術(在新視窗中開啟),以及事後看來最值得注意的擴展循環網路以建立語言模型(在新視窗中開啟);後者是 GPT 研究路線的先驅。
- 2


