因應關鍵級網路安全能力的新前沿
隨著模型能力日益提升,既能強化網路防禦,也可能讓攻擊以前所未有的速度與規模發生,網路安全正迅速改變。
過去幾天,我們針對即將推出的模型 Astra 進行最新內部評估,結果顯示 Astra 在智慧體式程式碼編寫與網路安全方面取得重大進展。結合這些結果與專家評估,我們昨晚判定,依據應變整備框架(在新視窗中開啟),目前無法排除 Astra 已具備關鍵級網路安全能力的可能性。
我們公開此事,是因為我們認為有必要向大眾以及安全性與資安社群坦誠說明這項潛在的能力變化。
我們於 2023 年 12 月首次發布應變整備框架,當時模型距離達到這種程度的生物、化學、網路安全及 AI 自我改進能力還很遠。我們制定這套框架,是為了掌握模型能力的進展,並據此規劃當相關能力出現時,公司應採取哪些行動。包括 GPT‑5.6‑Sol 在內,先前模型都曾接受前沿網路安全能力評估,結果達到「高」門檻,尚未達到「關鍵」門檻。
依據應變整備框架,模型若能在無人介入的情況下,針對許多強化防護的現實世界關鍵系統,找出並開發涵蓋所有嚴重程度、可實際運作的零時差漏洞利用程式;或僅憑概略的預期目標,就能針對強化防護的目標,設計並執行全新的端到端網路攻擊策略,即是達到「關鍵」網路安全門檻。
在我們持續為 Astra 進行基準測試與評估之際,初步評估顯示 Astra 的表現已達到目前無法排除「關鍵」能力等級的程度。Astra 是即將推出的模型,也未參與針對 Hugging Face 的漏洞利用行動。
因此,我們已擴大防護措施與安全管控的穩健性測試,確保這些措施適合部署具備上述能力的模型。我們也在內部採取下列措施,確保 Astra 的後續開發同時符合安全要求。
- 我們正針對能力較高的模型及相關活動實施更嚴格的安全管控,包括隔離測試環境、限制網路與工具存取、加強模型權重保護與加密、提升監控與偵測能力,以及採用沙箱環境執行。
- 對於涉及 Astra、但尚未符合這些強化安全管控要求的內部活動,我們已暫停進行。
- Astra 的所有智慧體應用,包括訓練與評估,目前都設有全面監控,用來偵測高風險行動與未對齊情形。監控系統會評估模型的思路鏈,並啟動安全應變程序,審查並中止高風險活動。
- 我們將與相關政府機關及特定 AI 安全性組織合作,測試 Astra 的能力。
- 我們將向第三方測試合作夥伴提供建議的安全管控措施,協助他們安全執行風險較高的評估與工作負載。
這套框架已協助我們因應其他能力轉變。2025 年 6 月,當我們的模型依據應變整備框架逐漸接近生物領域的「高」能力門檻時,我們曾說明正在採取的措施,包括強化防護措施、擴大測試、與外部專家合作,以及部署額外的安全管控。這次我們也採取相同原則。
我們相信,具備進階網路能力的模型應協助防禦者搶在攻擊者之前找出並修補弱點。我們致力與各國政府、安全研究機構及公民社會攜手合作,確保 Astra 等模型及後續模型的前沿能力以負責任的方式廣泛部署,造福全人類。


