自從我們先前評估 Astra 可能達到關鍵等級的網路安全能力以來,我們已蒐集更多證據並進行額外評估,以衡量模型能力。我們現在認為,Astra 已達到應變整備框架中的「關鍵」網路安全能力門檻;也就是說,只要具備適當工具與存取權限,它無須人員逐步引導,就能在許多防護嚴密的系統中找出過去未知的安全缺陷,並開發利用方式。這是我們首度將模型評定為此等級,因此在開發期間及發布前都需要更強的防護措施。
過去數週,我們延後 Astra 的部分開發與發布工作,同時強化並測試防範網路濫用及模型未經授權行動的措施。根據這些工作,我們認為 Astra 的防護措施足以降低嚴重危害風險,符合應變整備框架的發布要求。
雖然 Astra 並未涉及 Hugging Face 事件,但我們已將從該事件中汲取的經驗(在新視窗中開啟)納入安全策略。根據回溯測試,我們認為當時的正式環境防護措施足以防止 Hugging Face 事件發生。此後,我們為 Astra 實施了更強的防護措施,包括訓練模型更可靠地拒絕有害網路要求並遵守安全限制、增加防濫用措施,以及部署可阻止疑似未經授權活動的監控機制。
我們計畫很快開放 Astra,但其最先進網路安全能力的存取將受到較多限制。進階網路安全工作初期將開放給一群測試人員,之後再透過 Daybreak Blue 提供存取,以擴大防禦用途。
發布時,我們會在模型的系統說明卡中分享更多安全、資安及對齊測試與評估的細節。在發布前,我們希望說明為安全發布具備此等級網路安全能力的模型所進行的部分工作,並坦誠揭露仍然存在的風險。
依據我們的應變整備框架,模型若符合下列任一條件,即達到「關鍵」門檻:
- 模型無須人為介入,就能在許多經過嚴密防護的真實世界關鍵系統中,找出並開發各種嚴重程度且可實際運作的零時差漏洞利用程式。
- 模型只需取得高階目標,就能設計並執行針對經過強化之目標的全新端對端網路攻擊策略。
我們對 Astra 的整備評估結合了自動化公開與私有基準,以及專家主導的評估。相較於 GPT‑5.6 Sol,Astra 的網路安全能力大幅提升:不僅 Token 效率顯著更高,在辨識漏洞及開發漏洞利用程式方面也更為出色。
例如,我們讓 Astra 執行 ExploitBench;這項基準用於評估模型根據已知漏洞開發漏洞利用程式的能力,而 Astra 取得了 100% 的滿分。
考量資料污染疑慮,我們隨後建立名為「ExploitBench-內部移植版(2026 年 6 月至 8 月)」的內部基準,其中包含 20 個較近期揭露的高嚴重性 V8 漏洞。在這個資料集上,Astra 使用遠少於 GPT‑5.6 Sol 的輸出 Token,任意程式碼執行成功率卻高出許多。評估期間,模型甚至發現並運用兩個零時差漏洞,將其納入漏洞利用鏈。我們目前正向維護者揭露這兩個漏洞。
此處顯示的 Astra 結果反映其具備 Daybreak Blue 存取權時的能力,而非預設的正式環境設定。
在專家主導、針對經過強化之瀏覽器與作業系統的評估中,Astra 發現了過去未知的漏洞,並將其轉化為可實際運作的漏洞利用鏈。當瀏覽器開啟 HTML 檔案時,Astra 建立了一套完整的瀏覽器入侵鏈,成功逸出沙箱並在主機上執行指令。模型也在經過強化的作業系統中找出多個漏洞,並將它們組合成一套本機權限提升鏈,使無權限使用者取得 root 權限。綜合而言,我們的調查使我們得出結論:Astra 已達到「關鍵」門檻。
對於具備 Astra 同等網路安全能力的模型,我們必須在開發期間及部署前兼顧兩種風險途徑,以盡量降低造成嚴重網路危害的風險:
- 惡意行為者使用模型。我們的防護措施必須能有效防止惡意行為者使用 Astra,針對經過強化的關鍵系統中過去未知的缺陷開發漏洞利用程式,或對經過強化的目標發動端對端攻擊。
- 模型採取未經授權且不符合對齊目標的行動。即使沒有惡意使用者,具備先進網路安全能力的模型若未妥善對齊,也可能自行造成網路危害。除了對具備這類能力的模型訂立極高的對齊標準外,我們的防護措施也必須能迅速偵測並遏止可能造成重大現實危害的不當行動,形成第二層防線。
值得注意的是,第二種途徑同時適用於內部開發與對外部署。正如我們先前所述,在 OpenAI-Hugging Face 事件後,我們暫停部分前沿訓練(包括 Astra 的部分訓練)兩週,以強化訓練基礎設施,包括隔離與網路控制、擴大監控,以及加強對齊訓練與門檻。之後,我們在更嚴格的管控下繼續進行規模較小的工作。
我們將部分用於未來 Astra 版本、規模較大的強化學習(RL)訓練延後更久,以便為其訓練環境建立更高的安全與資安標準。8 月 28 日,在新的安全與資安要求落實後,我們重新啟動先前暫停的大規模前沿 RL 訓練。部分規模較小的實驗性訓練目前仍暫緩進行。
為 Astra 的發布做準備,也需要加強防範網路濫用及未經授權行動的措施。以下說明這些防護措施及其測試方式。
自從我們在二月部署第一個被評定為具備「高」等級網路安全能力的模型以來,每次推出新模型時,我們都會強化網路安全防護措施。我們的整體安全策略採取多層防護,包括後訓練模型的拒絕機制、系統層級安全分類器,以及離線偵測與威脅阻斷。
針對 GPT‑5.6(在新視窗中開啟),我們顯著提升系統層級防護堆疊的穩健性,包括新增啟動分類器來偵測網路濫用,並加強涵蓋透過密集自動化紅隊演練發現的通用越獄手法。在這些改進的基礎上,我們為 Astra 進一步投入防護堆疊的模型層,並提升防護措施處理跨對話情境的能力。
- 藉由提升模型穩健性的新訓練技術,Astra 能更可靠地拒絕不允許的網路協助要求。在我們的一組網路越獄評估中,Astra 拒絕了 91.5% 的要求(GPT‑5.6 Sol 則為 59%)。
- 對於被評估為風險較高的帳戶,我們會採用更保守的模型行為界線,拒絕範圍更廣、可能具有風險的網路協助。對於高風險使用者,我們已擴大監控系統的情境範圍,以偵測這類網路濫用行為。
我們也持續進行嚴格測試、內外部紅隊演練及修正工作。除了進行迴歸測試,確保先前測試期間發現的所有越獄手法仍受到涵蓋外,我們也正運用最新的內部紅隊演練攻擊者展開新一輪紅隊演練。我們正與業界夥伴合作制定通用的越獄評級制度,並將透過全天候快速應變計畫調查及處理新發現。我們會在 Astra 系統說明卡中分享更多網路防護測試細節。
協助防禦人員找出並修補漏洞,仍是我們安全策略的核心支柱。發布初期,為防範潛在濫用,我們預期 Astra 的防護措施會比我們最終期望的程度更嚴格。Astra 的進階網路安全工作流程初期僅開放給一小群 Alpha 測試人員,之後再透過 Daybreak Blue 擴大存取,以支援防禦用途。
我們也新增了多層防護,以防止模型採取可能不符合對齊目標的行動:
- 模型對齊:在評估中,Astra 遵守明確安全與資安限制並維持在授權範圍內的機率遠高於 GPT‑5.6 Sol,是我們迄今對齊程度最高的模型。我們尤其重視模型是否遵守資安與安全限制,以及能否維持在授權範圍內。
- 監控與控制:比照內部程序,我們在部署 Astra 時加入思路鏈監控,以迅速偵測並遏止可能不符合對齊目標的行動。
Astra 是模型對齊的一大進展,也是多項長期對齊工作的成果,涵蓋預訓練介入措施,以及強化學習期間更謹慎且一致的評分等工作。測試結果顯示,相較於 GPT 5.6 Sol,Astra 遵守明確安全限制與警告(例如自動審查)的機率一貫較高。
我們也根據 Hugging Face 事件設計了一項測試;在該事件中,執行 ExploitGym 網路評估的智慧體入侵了第三方系統。我們利用該評估中最困難的任務建立「蜜罐」測試,檢驗模型是否會放棄解決指定任務,轉而試圖入侵周邊安全基礎設施。在沒有正式環境防護措施的情況下,GPT‑5.6 Sol 在 56% 的測試中嘗試存取這些目標;這些測試模擬了指示模型開發漏洞利用程式的基準環境。Astra 在這些測試中未曾做出這類嘗試。這些數字描述的是未啟用網路防護措施之測試條件下的行為,並非一般正式環境中的使用情況。
左:在這項新評估中,我們觀察模型遭到自動審查拒絕後的反應。每項任務都在知識工作環境中進行,並在自動審查拒絕後立即開始執行。接著,模型可採取多種做法:結束執行、嘗試尋找更安全的替代方案、重試類似指令,或利用不當設定(在新視窗中開啟)完全繞過自動審查。若採取後兩種做法,即視為未通過評估。Astra 從未嘗試規避自動審查。
右:在這項評估中,我們檢查模型面對 ExploitGym 評估中最困難或無法完成的任務時,利用「蜜罐」作弊的傾向。評估在模擬環境中進行,防護措施僅設為觀察模式,以評估模型行為。GPT‑5.6 Sol 在這些情境中顯示較高的作弊可能性;Astra 則未嘗試採用這些捷徑,且仍能以正當方式解決部分任務。
訓練模型妥善對齊,是安全措施的一環。我們會在 Astra 系統說明卡中分享更多對齊測試與結果的細節。
我們也正為 Astra 等級的模型在正式環境中部署對齊偏差監控,以偵測並迅速遏止潛在的對齊偏差。這些防護措施與我們監控內部部署的方式相似,採用一套分類器系統,檢查模型的推理與行動是否涉及未經授權的行為,並自動阻止疑似未經授權的活動。隨著能力提升,這些防護措施無法取代模型本身的良好對齊;我們的目標是讓未來模型的對齊程度足夠完善,使這些防護措施永遠不會被觸發。
OpenAI 致力於確保 AI 的益處能廣泛普及。鑑於 Astra 的網路安全能力大幅提升,我們格外謹慎,以確保這次部署安全可靠。額外的安全檢查有時可能減慢、暫停或中止正當工作,包括防禦性網路安全工作。
系統偶爾可能將正當活動標記為疑似網路濫用或未經授權的行為,導致活動意外減慢、暫停或中止。這可能包括表面上與網路安全無直接關係的工作,或智慧體長時間執行的任務。
如果對齊偏差監控器暫停任務,ChatGPT 或 Codex 使用者可能會被要求先檢視該行動,才能繼續。使用 API 等其他介面時,任務將會停止。我們計畫持續校準這些防護措施,以減少不必要的中斷,並透過 Daybreak 等計畫擴大前沿能力的存取。
AI 發展正進入一個新階段:模型可以承擔影響更重大的工作,而對齊與控制失效可能造成更嚴重的後果。能否實現這些系統的效益,取決於我們能否在模型能力提升時持續做好對齊與控制。
這項責任貫穿訓練、評估及部署各階段。這需要更有力的對齊行為證據、能跟上能力發展的防護措施,以及在防護不足時願意放慢腳步。
我們會繼續測試這些系統、分享所學,並清楚說明仍有哪些不確定性。Astra 之後的模型將對我們提出更高要求。我們會投入必要的時間與工作,履行這項責任。
