我們相信,AGI 必須採取民主治理,才能造福全人類。唯有透過充分知情的公共討論,深入探討高能力 AI 系統的能力、風險與安全防護措施,才能實現這一目標。世界各地的人們都需要瞭解前沿 AI 未來可能的發展走向,才能真正參與並影響其發展方向。
針對特定風險、事件與安全防護措施保持透明,雖有必要,卻仍不足以達成目標。我們相信,大眾也需要瞭解能力最強的系統在前沿實驗室內部如何發展,以及這些系統如何推動研究進展。
我們的目標是安全打造一套能在人工監督下工作的自動化 AI 研究員,進一步推動深度學習與對齊研究,讓系統能持續改進。根據我們的評估,目前已達成去年秋季宣布(在新視窗中開啟)的目標:在今年 9 月前打造出自動化研究實習生。我們所說的「研究實習生」,是指能在人類指導下執行明確定義的研究任務,包括需要熟練研究人員花費數天才能完成的任務。目前,我們正朝 2028 年 3 月前打造出自動化 AI 研究員的目標取得顯著進展。
今年以來,OpenAI 研究人員的日常工作已大幅改變。研究人員整天都在使用程式碼編寫智慧體,且通常同時開啟多個工作階段,整體使用量正快速成長,增幅超過 OpenAI 其他團隊。研究人員產出程式碼的速度更快,進行的實驗也更多。研究人員運用智慧體的方式也在改變:智慧體開始處理日益複雜的任務,成功率也愈來愈高。AI 研究是一項複雜的過程,可能面臨許多瓶頸,因此整體進展速度不太可能與這些特定指標同步成長。不過整體而言,這些結果與許多內部人員的普遍感受一致:智慧體工具確實大幅加快了研究進展。研究重點仍由人類決定,人類也負責判斷哪些構想與成果值得繼續投入,並決定要擴大規模、暫停推進,還是部署系統。
我們相信,只要以負責任的方式推動,自動化 AI 研究將能打造出直接提升人類福祉、推進 OpenAI 使命的模型。這類研究可降低先進智慧的成本,讓世界各地的人們都能受益。我們投入這項工作的部分原因,是自動化研究可能有助於解決對齊問題,並協助我們建立防禦機制,因應能力日益強大的 AI。自動化 AI 研究員也可以成為自動化安全或對齊研究員。能力更強且與人類目標一致的系統,可協助保護關鍵基礎設施、防禦危險的 AI 智慧體,並開發新的防護措施。
這些都是發展實用自動化研究能力的理由,但不代表我們就一定應該追求快速的 RSI。是否推進以及如何推進,必須取決於我們能否維持人類的控制權,並根據充分知情的民主決策權衡其中的利益與風險。
我們目前仍不知道如何安全地實現完成對齊的完整 RSI。我們正隨著系統能力提升,同步擴大對齊與安全措施。然而,我們不能假設對齊與安全方面的進展一定能跟上系統能力的發展,而且能力越強的系統可能越難監控。審慎推動對齊與安全工作是這項計畫的核心,而第一步就是衡量並降低目前在智慧體式程式碼編寫系統中觀察到的安全問題。只要發現繼續推進會帶來無法接受的安全風險,我們就會採取適當行動;如果無法為某個系統提供充分的安全防護,也可能放慢或停止該系統的開發或部署。
最近發生 Hugging Face 事件後,我們將這項承諾付諸行動,暫停對預計部署的最新模型進行強化學習訓練,同時進一步加強研究環境的資安防護、進行紅隊測試,並擴大監控系統的涵蓋範圍。研究並未全面停擺,部分工作負載在更嚴格的控管下恢復執行,其餘則繼續暫停。我們已提高安全與對齊標準,並將安全工作更全面地納入模型生命週期,要求在整個訓練過程中提供更有力的證據,證明模型行為符合對齊要求。
今天,我們將詳細說明近幾個月來,智慧體系統如何協助我們朝 RSI 取得進展。智慧體系統仍是新興技術,且正快速演變,因此我們的衡量工作目前仍處於初步階段。透過分享這些早期結果及背後採用的方法,我們希望讓大眾掌握相關資訊、鼓勵業界建立公開揭露的慣例,並協助整個領域逐步形成共同的衡量標準。
最後,正如我們在前沿政策藍圖中所述,我們認為,包括 OpenAI 在內的所有公司都應公開追蹤自身朝 RSI 邁進的進展,並將此列為強制要求。即使沒有這項強制要求,我們仍計畫持續公開說明 RSI 的進展。隨著衡量技術與相關理解不斷提升,我們也會持續調整資訊透明的做法,同時兼顧安全與專有資訊的保護需求。
今年年初,在 OpenAI 研究人員中,按智慧體使用量排名居中的研究人員僅少數使用程式碼編寫智慧體。到了 8 月中旬,使用量居中的研究人員已每天將智慧體用於工作,按 API 定價換算,每日推論用量超過 600 美元。研究組織中使用量位於第 90 百分位的使用者,目前每天使用價值超過 7,000 美元的 Token。
在 2026 年 6 月之前,整個研究組織的智慧體總執行時間仍低於總人力工時。此後,情況已經改變。若按標準 8 小時工作日計算,截至 8 月中旬,整個研究團隊每投入一個人類工作日,就會使用相當於 3.1 個智慧體工作日的工作量。
另一種觀察方式,是瞭解有多少研究人員採用高度並行的工作流程,例如同時執行 4 個以上的智慧體。如下圖所示,採用這類工作流程的人數正在增加。這些數據所呈現的每日峰值,同時計入使用者直接啟動的智慧體,以及這些智慧體後續建立的子智慧體。
AI 研究有很大一部分可視為勞力密集的過程,目標是將能提升模型智慧或效能的新方法,整合至我們其中一款核心模型。這個過程涉及許多步驟,唯有各個環節都順利銜接,模型能力才能提升:研究人員必須設計新的改進方法、編寫評估來衡量模型效能、建置可大規模測試這些改進的基礎架構、在訓練期間找出程式錯誤以及不安全或未對齊的行為,最後將成效最佳的構想納入核心訓練作業。研究過程中任何環節一旦出現問題,都可能拖慢整個循環。
編寫程式碼與進行實驗是研究人員工作中的兩項主要活動,而我們已看到跡象顯示,這兩項流程都在加速。
這些數據點相對容易衡量,但不容易解讀。隨著自動化進展,最難自動化的任務將占用研究人員更多心力,並成為未來進展的重要瓶頸。運算資源也是制約進展的關鍵因素,而且隨著其他瓶頸逐漸減少,日後可能會變得更加重要。
2026 年以來,每位活躍實驗人員進行的實驗數持續增加,其中 2026 年 8 月更創下自 2025 年 1 月開始追蹤以來的新高。這與 Codex 採用率提高呈現相關,不過值得注意的是,自 2025 年以來,我們可用的運算資源也大幅增加。
無論是質性觀察或內部數據,都顯示研究人員交由程式碼編寫智慧體處理的任務類型正在改變。隨著時間推移,層級更高、時間跨度更長的任務也愈來愈常交由智慧體處理。
為了更清楚了解這項趨勢,我們採用 Epoch AI 制定的近期分類架構(在新視窗中開啟),分析研究團隊最近的使用情況。這套架構將 AI 研發生命週期中的各類工作加以分類。這套分類架構參考長期用於劃分各類工作的 O*NET 系統,並針對前沿 AI 研發量身設計,將整個流程分為六個主要階段:
決定:要投入哪些工作、要延續哪些事項、要將資源分配到哪裡
設計:研究構想與工程規格
建置:程式碼與資料集
執行:訓練/評估執行作業、硬體、服務
分析:實驗、模型、部署、外部工作
溝通:研究發現、回饋、狀態、決策
以下,我們依據此分類法對程式碼編寫智慧體 Token 進行分類。
我們看到,在 2026 年 1 月至 8 月期間,所有類別的研究活動皆有所增加。1 月份,占比最高的類別是研究與基礎架構程式碼。這類任務有所增加,但其他類別也出現顯著成長,尤其是技術協助與實驗執行監控。高階規劃仍只佔智慧體輸出 Token 的極小一部分。
根據同事分享的實際經驗,程式碼編寫智慧體特別擅長排除內部研究基礎架構的問題,有助於消除阻礙研究進展的一大瓶頸。多個過去會安排諮詢時段、協助研究人員排除實驗問題的團隊表示,2026 年參與人數持續下降。其中一個團隊已完全停止舉辦諮詢,改為專注改善系統的其他部分。
下圖呈現其中一個主要內部頻道每天的主貼文數量;研究人員會在這個頻道向其他團隊尋求技術支援。據我們所知,該頻道減少的詢問量並未轉移到其他由人員提供支援的技術頻道。頻道流量的下降與這項整體轉變一致。
我們也可以研究程式碼編寫智慧體是否成功完成研究人員要求的任務。我們使用智慧體分類器分析能夠確認實際結果的任務,發現 1 月至 7 月期間,多個難度區間的成功率普遍上升;這裡以人類完成任務所需的估計時間作為難度的替代指標。不過,智慧體若要成功完成任務,仍需要人類投入大量引導,尤其任務複雜度越高,越是如此。過去 6 個月,在成功完成的 4 至 8 小時任務中,超過半數曾有至少一次人工介入。
研究人員交辦任務的成功率隨時間逐步提升。圖表不包含結果分類不確定的資料,以及工作階段少於 50 個或不重複使用者少於 50 人的資料點。
1 月至 7 月的任務成功率與介入率,依任務時間長度分組呈現。排除結果歸類為「不確定」的任務。
能否持續朝能力更強、安全且有益的 AGI 系統邁進,也取決於是否具備這類工作所需的安全防護措施。隨著我們進一步瞭解相關風險,對所需安全防護措施的評估也可能有所調整。
如先前所述,我們近期已更新監控、對齊與資安標準。在此,我們說明近期的限制對研究活動其中一個面向所造成的影響。
*本圖所示 7 月 20 日至 8 月 6 日期間的大部分 Astra 運算資源,主要用於測試安全與資安改進措施的實作成效。
7 月 20 日,在發現智慧體已入侵我們的研究基礎架構後,我們暫時關閉了訓練所使用的容器服務,之後才恢復運作,並加上大幅強化的限制措施。
這導致強化學習訓練運算量驟降,因為各團隊必須重新調整工作流程,才能在強化安全防護的研究環境中運作。上圖涵蓋我們針對預定部署的最新模型,暫停進行兩週強化學習訓練的期間。7 月 20 日至 8 月 6 日進行的 Astra 級強化學習實驗中,若按 GPU 資源配置量計算,多數實驗都是為了測試安全與資安改進措施的實作成效。
8 月 7 日,初步證據顯示 Astra 可能具備關鍵級網路安全能力,達到我們在應變整備框架(在新視窗中開啟)中訂定的門檻,因此我們針對 Astra 增設安全限制,規定只能在安全層級更高的研究環境中運行。接下來一週,Astra 級模型的 GPU 資源配置量進一步下降 59.2%,其他級別模型的配置量則增加 17.2%。這部分增幅抵銷了 Astra 級模型約 85% 的降幅,因此納入分析的強化學習工作負載整體資源配置量大致維持不變。這一趨勢顯示,Astra 相關工作受限期間,部分訓練與實驗可能轉移至非 Astra 模型。這也與研究人員的非正式說法一致:受新限制影響而無法投入原定工作負載的運算資源,後來被轉作其他用途。
這些資料為訓練與安全方面的持續討論提供了重要參考:新的管控措施上路後,運算資源仍具有價值,也能彈性調度,自然會轉投入整體研究體系中的其他用途。從長期來看,討論 AI 發展速度時,也應進一步探討如何妥善運用受到新增或擬議管控措施影響的運算資源。
推動符合對齊要求的 RSI 並掌握進展,對我們履行使命至關重要。我們將持續精進衡量方法、分享不斷深化的理解,並推動建立在充分資訊基礎上的公共討論,以及對前沿系統具實質意義的民主治理。
由智慧體驅動的 AI 研究仍處於早期階段,我們也仍在探索該如何衡量這類研究。有些指標相對容易蒐集,例如研究團隊的程式碼產出量,但由於這些指標與研究進展之間的關係尚不明確,因此不容易解讀。更直接反映研究進展的指標,例如智慧體成功完成研究人員交辦任務的頻率,可能更具參考價值,但開發與驗證這類指標十分複雜。更具挑戰的是,研究人員仰賴的工具與系統也在快速演變。深入瞭解研究加速的情況,是 OpenAI 整體高度重視的工作領域。
在這些分析中,除非另有說明:
「研究人員」是廣義用語,泛指研究部門的所有成員,包括負責建置研究基礎架構、管理研究專案,或透過其他方式支援整體研究工作的人員。
程式碼編寫智慧體的使用指標涵蓋了大多數使用情況,但鑑於研究人員所仰賴的工具與系統快速演進,仍無法涵蓋全部。


