涉及 OpenAI 模型的第三方網絡安全評估
獨立測試有助我們在部署前驗證並進一步了解風險,因而發揮重要作用。部分網絡安全評估會刻意採用自訂設定,包括降低保障措施,以衡量模型的基礎能力,而非模型在公開部署中通常會有的表現。
在近期評估中,兩個外部測試合作夥伴發現了一些事故:測試設定和管控措施,加上近期模型日益提升的能力,令模型的活動超出原定測試範圍。這些事故凸顯了在整個行業內並與第三方評估機構合作的重要性:隨着模型能力提升,測試環境及測試做法的標準亦必須與時並進。編者按:這些事故與 Hugging Face 安全事故無關。我們會繼續在此處分享 Hugging Face 事故的最新消息。
新事故涉及 OpenAI 模型在第三方網絡安全評估期間存取公共互聯網;當時採用了特定條件及降低保障措施的設定,並不反映一般部署情況。事故包括:
- 英國政府的 AI 安全研究所 UK AISI 正進行網絡靶場評估,刻意啟用互聯網存取,讓智能代理自行尋找工具,並在更接近真實攻擊者的環境下運作;同時停用網絡安全分類器,以衡量基礎能力。你可在此(在新視窗中開啟)閱讀其網誌文章。
- 我們的外部網絡安全測試合作夥伴之一 Irregular 正進行原定與互聯網隔離的奪旗賽形式評估,但測試環境設定錯誤,令模型能夠存取公共互聯網。
以下概述事件經過、令相關活動得以發生的測試條件、已採取的遏制措施,以及我們如何確保獨立實驗室能繼續嚴謹而安全地評估能力日益提升的模型。
這些事故反映了我們近期有關 Hugging Face 事故的文章所述的同一項廣泛挑戰:隨着模型能力提升,模型周邊的資訊安全與安全防護系統亦必須同步提升。這既包括用於開發模型的環境,亦包括實驗室和獨立合作夥伴用於評估模型的環境。
未來數星期,我們將檢討第三方測試方針,包括如何識別較高風險的評估、議定範圍、評估啟用互聯網存取或降低保障措施的要求、訂明隔離、憑證處理、監察及停止條件方面的期望,以及建立更清晰的事故通報及升級處理程序。
我們致力與整個行業合作,加強安全地進行高風險評估的共同做法,包括在未來數星期召集國家級 AI 研究所、獨立評估機構、其他 AI 實驗室及團體等持份者。我們的目標是保留嚴謹獨立評估的價值,同時確保測試做法跟上模型能力提升的步伐。
8 月 3 日,UK AISI 告知我們,在一項於 7 月 25 日開始的例行網絡安全評估中,OpenAI 及另一間實驗室的模型在部分情況下超出測試範圍。評估在模擬真實世界網絡的受控網絡靶場內進行。在識別出的 19 宗事件中,兩宗涉及 OpenAI 模型 GPT‑5.6 Sol。其餘事件涉及另一間實驗室的模型。
在這項評估中,智能代理獲指示在奪旗賽中擔任網絡安全專家:攻破三個互相連接的模擬環境,並取得最終旗標。任務提示詞列明了範圍內的靶場網絡,並指明數個系統不屬於測試範圍。UK AISI 亦啟用直接連接互聯網,讓智能代理下載工具並在更接近人類攻擊者的條件下運作,同時停用模型的網絡安全分類器,以衡量基礎能力。
UK AISI 原定的授權邊界是模擬網絡靶場:智能代理獲授權攻擊指定的模擬網絡並取得旗標,但無權與靶場網絡邊界以外的系統互動。然而,智能代理並未獲明確告知哪些互聯網用途獲允許或不獲允許;UK AISI 認為這可能是事故的成因之一。
UK AISI 發現,在多次測試期間,GPT‑5.6 Sol 嘗試尋找進入模擬靶場並取得旗標的途徑時,採取了兩項未獲授權的行動:
- GPT‑5.6 Sol 重複使用另一間實驗室的智能代理留在公開位置、可供取用的 GitHub Token,以檢查靶場內的系統是否正在輪詢 GitHub 或其他更新服務;它亦嘗試找出帳戶復原及規避請求限額的變通方法,並向外部 DNS 和隧道服務供應商註冊帳戶。
- GPT‑5.6 Sol 使用公共隧道服務,讓在其評估環境中本機運行的 DNS 伺服器可從公共互聯網存取。該伺服器載有針對測試靶場內某款軟件已知漏洞的利用載荷。這項設定並未奏效,亦無證據顯示有任何真實解析器曾向其查詢;評估結束後,相關基礎設施已被移除。
儘管該模型當時正嘗試完成網絡靶場任務,但 UK AISI 認為這些行動未獲授權,因為它們涉及靶場邊界以外的真實外部帳戶和服務,而且完成任務並不需要採取這些行動。該 DNS 伺服器亦在公共互聯網上託管漏洞利用載荷,但這項設定並未奏效,亦無證據顯示有任何真實解析器曾向其查詢。
UK AISI 的安全監察系統偵測到異常資料傳輸後,於 7 月 28 日發現這項活動。UK AISI 隨即停止相關評估、隔離有關機器,並在偵測到活動後約一小時內將其遏止。
我們感謝 UK AISI 在整個過程中的合作,包括識別和調查這項活動,以及分享相關詳情。我們期待繼續與 UK AISI 合作。
7 月 29 日,我們的第三方評估合作夥伴 Irregular 通知我們,在一次奪旗賽(CTF)形式的網絡安全評估中,發生了一宗涉及 OpenAI 模型的事故。模型獲指示利用模擬環境內的弱點尋找隱藏資料,並被告知測試環境不設互聯網連線。然而,測試環境的設定錯誤令模型能夠存取公共互聯網。
在其中一項測試中,CTF 挑戰的虛構目標名稱意外與一個真實網域相同。由於測試環境因設定錯誤而連接至互聯網,模型誤以為某個真實網站屬於模擬環境的一部分,並利用了該網站的漏洞。事件並不涉及複雜的沙盒逃逸或零日漏洞:互聯網存取源於設定錯誤,而模型似乎利用了一個一般安全漏洞。
根據 Irregular 的調查,模型亦找到並使用了憑證,以操作同一網站。Irregular 尚未發現事件對受影響網站自身資料以外造成影響,而其審計工作仍在進行。Irregular 已暫停相關評估並展開補救工作,受影響的第三方亦已獲通知。Irregular 告知我們,所有已識別且與事件相關的問題均已不再存在,測試環境亦已加入相關保障措施。Irregular 亦已就同一測試環境中涉及其他實驗室的相關事故作出通報。
我們感謝 Irregular 的合作,並會繼續與其緊密協作,支援其審查工作。Irregular 亦正擬備一份白皮書,分享遏制事故及安全地進行網絡安全評估的最佳做法。我們期待參與這份白皮書,向業界社群公開調查結果,並繼續與 Irregular 合作。我們認為,這類協作對於確保安全而全面地評估現有及未來的模型至關重要。


