跳到主要內容
OpenAI

2026年8月7日

系統防護

應對關鍵網絡安全能力的新前沿

正在載入...

模型能力日益提升,既能強化網絡防禦,也可令攻擊達至前所未有的速度和規模,網絡安全格局正迅速轉變。

我們過去數天對即將推出的模型之一 Astra 進行最新內部評估,結果顯示其智能代理式編碼和網絡安全能力均有顯著進展。這些結果,加上專家評估,令我們昨晚得出結論:根據我們的防範應對架構(在新視窗中開啟),現階段不能排除其具備關鍵級網絡安全能力的可能性。

我們公開這項資訊,是因為我們認為有必要就這項潛在的能力轉變,向公眾以及安全和網絡安全社群保持透明。

我們早於 2023 年 12 月首次發佈防範應對架構,當時模型在生物、化學、網絡安全及 AI 自我改進方面的能力,尚遠未接近這個水平。我們制定此架構,旨在指引我們識別能力進展,並規劃公司在這些能力出現時應採取的行動。過往的模型(包括 GPT‑5.6‑Sol)均曾接受前沿網絡安全能力評估,結果被評為達到高(而非關鍵)能力門檻。

衡量關鍵網絡安全能力 

根據我們的防範應對架構,如果模型能在無人介入下,在現實環境中多個經安全強化的關鍵系統找出並開發涵蓋各種嚴重程度且可實際運作的零日漏洞利用程式;或在僅獲提供高層次預期目標的情況下,構思並執行全新的端到端網絡攻擊策略,便達到關鍵網絡安全門檻。 

我們仍在對這個模型進行基準測試和評估,但初步結果顯示其表現足夠強勁,現階段不能排除已達關鍵能力級別。Astra 是即將推出的模型,並未參與針對 Hugging Face 的漏洞利用活動。 

我們正採取的措施

因此,我們已擴大對防護措施和安全控制的穩健性測試,確保這些措施足以支援部署相關能力。我們亦已在內部採取以下措施,確保這個模型的後續開發安全穩妥: 

  • 我們正為能力較高的模型及相關活動實施更嚴格的安全控制,包括隔離測試環境、限制網絡和工具存取權限、加強模型權重保護和加密、加強監察及偵測能力,以及採用沙盒執行環境。
  • 我們正暫停尚未符合這些強化安全控制要求的 Astra 內部活動。
  • 我們已為 Astra 的所有智能代理式應用實施全面監察,包括訓練和評估,以偵測高風險行動及偏離對齊要求的情況。監察系統會評估模型的思路鏈,並觸發安全應變,以審查及中止高風險活動。
  • 我們將與相關政府機構及選定的 AI 安全組織合作,測試這個模型的能力。
  • 我們將向第三方測試合作夥伴提供建議的安全控制措施,讓他們能安全進行風險較高的評估及工作負載。 

這套架構已指引我們應對其他能力轉變。2025 年 6 月,當我們的模型根據防範應對架構接近生物領域的高能力門檻時,我們曾概述所採取的措施,包括加強防護、擴大測試、與外部專家合作,以及部署額外安全控制。我們目前正採用相同原則。

我們認為,具備先進網絡安全能力的模型應協助防禦人員搶在攻擊者之前識別和應對漏洞。我們致力與各國政府、安全研究機構及公民社會攜手合作,確保 Astra 等模型及後續模型的前沿能力得到負責任且廣泛的部署,造福全人類。

作者

OpenAI