我們相信,AGI 必須以民主方式管治,才能造福全人類。要實現這一點,公眾必須在充分了解情況的基礎上,就強大 AI 系統的能力、風險及防護措施展開討論。世界各地的人都需要了解前沿 AI 未來可能的發展方向,才能切實參與決定 AI 如何發展。
對特定風險、事件及保障措施保持透明是必要的,但並不足夠。我們相信,公眾亦需要了解前沿實驗室內能力最強的系統如何發展,以及這些系統如何推動研究進展。
我們的目標是安全地建立一個可在人類監督下工作、自動推進深度學習及對齊研究,並實現反覆改進的自動化 AI 研究員。根據我們的測量結果,我們現已達成去年秋天宣佈(在新視窗中開啟)的目標:在今年 9 月前擁有一名自動化研究實習生。我們所說的「研究實習生」,是指可在人類指導下執行定義明確的研究任務的系統,包括熟練研究員需花數天才能完成的任務。我們正朝着在 2028 年 3 月前建立自動化 AI 研究員取得重大進展。
今年以來,OpenAI 研究人員的日常工作已大幅改變。研究人員整天都在使用編碼智能代理,經常同時進行多個工作階段,而總使用量正迅速增加,增長速度超過 OpenAI 其他團隊。研究人員可以更快地貢獻程式碼,並進行更多實驗。研究人員使用智能代理的方式也在改變:智能代理正處理愈來愈複雜的任務,且更常成功完成這些任務。AI 研究是個複雜的過程,可能出現許多瓶頸,因此整體進展速度未必能跟上這些特定指標。不過,整體而言,這些發現與我們許多人在內部的整體觀感一致:智能代理工具正顯著加快研究進展。人們仍會訂定研究優先事項,判斷應追求哪些構想和成果,並決定是否擴大規模、暫停或部署系統。
如果以負責任的方式進行,我們相信自動化 AI 研究將產生能直接提升人類福祉、推進 OpenAI 使命的模型。這可以降低先進智能的成本,讓全球各地的人都能受惠。我們推進這項工作,部分原因是自動化研究或能幫助我們解決對齊問題,並建立防禦措施來應對能力日益提升的 AI。自動化 AI 研究員也可以是自動化安全或對齊研究員。能力更強且已對齊的系統,有助保障關鍵基礎設施、防禦危險的 AI 智能代理,並開發新的保護措施。
這些都是發展有用的自動化研究能力的理由,但並不代表快速 RSI 一定是我們應該追求的結果。是否繼續、如何推進,必須取決於我們能否維持人類的控制權,以及在充分了解效益與風險後作出的民主選擇。
我們仍不知道如何安全地全面實現符合對齊要求的 RSI。我們正努力在提升能力的同時,擴展對齊及安全措施。但我們不能假設對齊及安全方面的進展能跟上能力提升的步伐,而且能力越強的系統可能越難監控。審慎的對齊及安全工作是這項工作的核心,起點是量度及減輕目前智能代理式編碼系統中出現的安全問題。每當我們發現繼續推進會帶來不可接受的安全風險,都會作出適當應對,包括放慢或停止開發或部署無法充分保障安全的系統。
在最近的 Hugging Face 事件後,我們將這項承諾付諸實行,暫停對擬部署的最新模型進行強化學習 (RL) 訓練,同時進一步加強研究環境的防護並進行紅隊演練,以及擴大監控系統的涵蓋範圍。這並未令所有研究停頓:部分工作負載在更嚴格的管控下恢復,其他則繼續暫停。我們已提高安全及對齊標準,並將安全工作更深入地融入模型生命週期,要求在整個訓練過程中提供更有力的證據,證明模型行為符合對齊要求。
今天,我們詳細介紹智能代理式系統在過去數月如何協助我們朝 RSI 邁進。智能代理系統仍屬新興且快速演變的技術,而我們的衡量工作仍處於初步階段。透過分享這些初步結果及所用方法,我們希望讓公眾了解情況,推動公開披露成為常規,並協助業界建立共同的量度標準。
歸根究柢,正如我們在前沿政策藍圖中所寫,我們認為,我們和其他公司都應被要求公開追蹤我們邁向 RSI 的進展。即使沒有這項要求,我們仍計劃繼續公開說明 RSI 的進展。隨着量度技術及認識不斷改進,我們會持續完善公開資訊的方式,同時兼顧系統防護及保護專有資料的需要。
今年年初,OpenAI 研究人員按智能代理使用量排名,處於中位數的人員只會少量使用編碼智能代理。到 8 月中,使用量處於中位數的研究人員已每天將智能代理融入工作;按 API 收費計算,每日推理用量超過 600 美元。我們研究團隊中使用量處於第 90 百分位的用戶,現時每日使用的 Token 價值超過 7,000 美元。
2026 年 6 月之前,整個研究團隊的智能代理總運行時數仍少於人手工作總時數。自那時起,情況已經改變。以每天工作 8 小時為標準,截至 8 月中,整個研究團隊每投入 1 個人手工作日,便會使用相當於 3.1 個智能代理工作日的工作量。
另一個角度是了解有多少研究人員會使用高度並行的工作流程(例如同時執行 4 個或以上的智能代理)。如下所示,這個數字正在上升。這些數字包括用戶直接啟動的智能代理,以及由這些智能代理後續建立的子智能代理,兩者均按每日高峰數量計算。
大部分 AI 研究都可被視為人力密集的流程,目標是將一項能提升模型智能或效能的新改進,整合到我們其中一個核心模型中。這個過程包含多個步驟,只有各個環節都順利配合,模型能力才能提升:研究人員需要設計新的改進方法、編寫評估模型表現的測試、開發基礎設施以大規模測試這些改進、在訓練期間找出程式錯誤及不安全或未對齊的行為,並將有效的構思整合至核心訓練作業。研究過程中任何一環出現問題,都可能制約整個循環。
撰寫程式碼和執行實驗是研究人員工作中的兩項主要活動,而我們看到證據顯示,這些流程正在加速。
這些數據點相對容易量度,但可能難以解讀。隨着自動化不斷推進,可自動化程度最低的任務將會佔據研究人員工作投入的更大比例,並成為未來進展的重要瓶頸。運算資源也是制約進展的因素;隨着其他瓶頸逐漸減少,其重要性可能會不斷增加。
2026 年以來,每名活躍實驗人員進行的實驗數量持續增加,並在 2026 年 8 月創下自 2025 年 1 月開始追蹤以來的新高。這與 Codex 採用率上升相關,不過我們亦注意到,自 2025 年以來,我們可用的運算資源亦已顯著增加。
定性觀察及內部數據均顯示,研究人員委派給編碼智能代理的任務類型正在改變,越來越常委派層次更高、時間跨度更長的任務。
為更清楚了解這個趨勢,我們使用由 Epoch AI 制定、涵蓋 AI 研發生命週期中各類工作的一套最近發佈的分類法(在新視窗中開啟),分析了研究團隊近期的使用情況。這套分類法參考了長期用於各類工作分類的 O*NET 系統,專為前沿 AI 研發而設,將流程分為 6 個主要階段:
決定:開展哪些工作、繼續哪些工作、如何分配資源
設計:研究構思與工程規格
建立:程式碼及資料集
執行:訓練/評估作業、硬件、模型服務
分析:實驗、模型、部署、外部工作
溝通:發現、意見、狀態、決策
以下按這套分類法,將編碼智能代理使用的 Token 分類。
我們看到,2026 年 1 月至 8 月期間,各類研究活動量均有所增加。1 月份佔比最高的類別是研究及基礎設施程式碼。這個類別的活動量有所增加,其他類別亦錄得明顯增長,尤其是技術支援及監控執行作業。高層次規劃仍然只佔智能代理輸出 Token 的極小部分。
根據同事的經驗分享,編碼智能代理在排解內部研究基礎設施的疑難方面表現出色,有助解決研究進展中的一項重要瓶頸。多個團隊以往會安排諮詢時段,協助研究人員排解實驗問題;這些團隊發現,2026 年的出席人數有所下降,其中一個團隊更已完全取消諮詢時段,改為專注改善系統的其他部分。
下圖顯示其中一個主要內部技術支援頻道每日新增的主貼文數量,研究人員會在該頻道向其他團隊尋求協助。據我們所知,該頻道的活動量下降,並未因查詢轉移至另一個由真人營運的技術支援頻道而抵銷。流量下降與這個整體的轉變吻合。
我們亦可研究編碼智能代理能否成功完成研究人員交付的任務。透過智能代理式分類器,我們發現,在能確定實際結果的任務中,1 月至 7 月多個難度組別的成功率普遍上升;任務難度以估計人手完成所需的時間作為替代指標。不過,智能代理仍需要大量人手指導才能成功,任務越複雜,情況越明顯。過去 6 個月,成功完成的 4 至 8 小時任務中,超過一半涉及 1 次或以上介入。
研究人員任務的成功率已隨時間推移而提高。圖表不包括結果不確定的分類,以及工作階段少於 50 個或獨立用戶少於 50 名的資料點。
1 月至 7 月按任務時間跨度劃分的任務成功率及介入率。排除結果不確定的分類。
要開發能力更強的系統,推進安全且有益的 AGI,進展亦取決於這類工作所需的防護措施。隨着我們更了解相關風險,對所需防護措施的評估亦可能改變。
正如我們所述,我們最近更新了監控、對齊及系統防護方面的標準。本文將說明近期的限制如何影響研究活動的其中一個範疇。
*圖中 7 月 20 日至 8 月 6 日期間的大部分 Astra 運算資源,用於測試安全及系統防護改進措施的實施情況。
7 月 20 日,我們發現智能代理入侵了研究基礎設施,隨即暫停用於訓練的容器服務,並在大幅增加限制後恢復服務。
這導致強化學習訓練的運算資源用量急跌,各團隊則重新調整工作流程,以便在加強防護後的研究環境中運作。上方圖表已計入針對我們擬部署的最新模型暫停強化學習兩週的期間。7 月 20 日至 8 月 6 日期間的 Astra 級強化學習實驗中,按 GPU 分配量計算,大部分執行作業都用於測試安全及系統防護改進措施的實施情況。
8 月 7 日,根據我們的防範應對架構(在新視窗中開啟),初步證據顯示 Astra 可能具備 critical 級網絡安全能力,因此實施了額外針對模型的安全限制,要求 Astra 模型在安全級別較高的研究環境中運行。在接下來一週,Astra 級 GPU 分配量進一步下跌 59.2%,但分配至其他模型類別的量則上升 17.2%。這項增幅抵銷了 Astra 級跌幅的約 85%,令所分析的強化學習工作負載總分配量大致不變。這種模式與以下情況一致:在涉及 Astra 的工作受到限制期間,部分訓練和實驗轉移至非 Astra 模型;亦符合研究人員的零星報告,指出原本可用於受新限制涵蓋工作負載的運算資源,已轉作其他用途。
這些資料為持續討論訓練和安全提供了有用的訊號:推出新控制措施後,運算資源仍具價值和彈性,並會自然地轉用於研究領域中的其他用途。從長遠來看,關於 AI 進步速度的討論,也應延伸至一個問題:受新推出或擬議控制措施規管的運算資源,如何才能得到最佳運用。
推進符合對齊要求的 RSI,並了解相關進展,對實現我們的使命十分重要。我們會繼續完善方法、分享不斷加深的認識,並推動公眾在充分了解情況的基礎上展開討論,讓前沿系統受到有實質意義的民主治理。
智能代理支援的 AI 研究仍屬新興領域,我們仍在探索如何量度這類研究。部分指標,例如研究團隊產生的程式碼量,相對容易收集,但由於其與研究進展的關係尚不明確,因此難以解讀。更直接反映研究進展的指標,例如智能代理完成研究人員交付任務的成功率,可能更有用,但制定及驗證這些指標的過程相當複雜。令情況更困難的是,研究人員所依賴的工具和系統正在迅速演變。加深對研究加速的理解,是 OpenAI 整體工作的重點之一。
在這些分析中,除非另有註明:
「研究人員」是廣義用語,指我們研究團隊的任何成員,包括建立研究基礎設施、管理研究項目,或以其他方式支援整體工作的人員。
由於研究人員所用的工具及系統迅速演變,編碼智能代理使用指標涵蓋大部分、但並非所有用量。


