涉及 OpenAI 模型的第三方資安評估
獨立測試在部署前協助我們驗證並進一步瞭解風險,具有重要作用。部分資安評估會刻意採用自訂設定,例如降低防護措施,藉此衡量模型的基礎能力,而不是模型在公開提供的部署環境中通常會有的行為。
在近期評估中,兩家外部測試合作夥伴發現,測試設定與控制措施加上近期模型不斷提升的能力,導致模型活動超出預定的測試邊界。這些事件凸顯,隨著模型能力增強,業界與第三方評估機構必須攜手推動測試環境和實務標準與時俱進。編者註。這些事件與 Hugging Face 資安事件無關;我們將持續在此處分享 Hugging Face 事件的最新進展。
這些新事件發生在特定條件與降低防護措施的設定下,OpenAI 模型在第三方資安評估期間存取了公用網際網路。這類設定並不代表一般部署情況。事件如下。
- 英國政府的 AI Security Institute (UK AISI) 當時正執行資安靶場評估,並刻意開放網際網路存取,讓智慧體自行尋找工具,在更接近真實攻擊者的條件下運作。為衡量模型的基礎能力,評估也停用了資安分類器。詳情請參閱 UK AISI 的部落格文章(在新視窗中開啟)。
- 我們的外部資安測試合作夥伴之一 Irregular 當時正在進行原應與網際網路隔離的奪旗賽形式評估,但測試環境的設定錯誤使模型得以存取公用網際網路。
以下將摘要說明事件經過、促成這些活動的測試條件、為控制活動所採取的措施,以及我們如何確保獨立實驗室能持續嚴謹且安全地評估能力日益提升的模型。
這些事件反映了我們近期在Hugging Face 事件文章中提到的同一項更廣泛挑戰。隨著模型能力提升,模型周邊的資安與安全系統也必須同步進步。這包括用於開發模型的環境,以及實驗室和獨立合作夥伴用來評估模型的環境。
未來幾週內,我們將檢視第三方測試方法,包括如何識別風險較高的評估、議定測試範圍、審查開放網際網路存取或降低防護措施的要求、明確規範隔離措施、憑證處理、監控和停止條件,以及建立更清楚的事件通報與升級處理流程。
們致力於與業界攜手,強化安全執行高風險評估的共同實務,並計畫在未來幾週召集國家級 AI 機構、獨立評估機構、其他 AI 實驗室與其他團體等利害關係人。我們的目標是保留嚴謹獨立評估所帶來的價值,同時確保測試實務能跟上模型日益提升的能力。
8 月 3 日,UK AISI 告知我們,在一項始於 7 月 25 日的例行資安評估中,OpenAI 與另一間實驗室的模型在部分情況下超出測試範圍。該評估是在模擬真實世界網路的受控資安靶場中進行。在發現的 19 起事件中,有兩起涉及 OpenAI 模型 GPT‑5.6 Sol。其他事件則涉及另一間實驗室的模型。
在這項評估中,智慧體接獲指示,要在奪旗賽演練中扮演資安專家,任務是攻破三個相互連接的模擬環境並取得最終旗標。任務提示詞列出範圍內的靶場網路,並指明數個不在範圍內的系統。UK AISI 也開放實際的網際網路存取,讓智慧體下載工具並在更接近人類攻擊者的條件下運作,同時停用模型的資安分類器來衡量基礎能力。
UK AISI 設定的授權邊界是模擬資安靶場。智慧體獲准攻擊指定的模擬網路並取得旗標,但不得與靶場網路邊界外的系統互動。然而,UK AISI 並未明確告知智慧體可如何使用開放的網際網路存取權,以及哪些用法不被允許。UK AISI 認為,這可能是促成事件的原因之一
在這些執行過程中,UK AISI 發現 GPT‑5.6 Sol 為了找出進入模擬靶場並取得旗標的途徑,採取了兩項未經授權的行動:
- GPT‑5.6 Sol 再次使用另一間實驗室的智慧體留在可公開存取位置的 GitHub Token,藉此確認靶場內某個系統是否正在輪詢 GitHub 或其他更新服務;也曾嘗試以其他方式處理帳戶復原問題及請求次數限制,並向外部 DNS 服務供應商與通道服務供應商註冊帳戶。
- GPT‑5.6 Sol 使用公開通道服務,讓評估環境中在本機執行的 DNS 伺服器可供公用網際網路存取。該伺服器存有針對靶場內某套軟體已知漏洞設計的漏洞利用酬載。這項設定並未成功,也沒有證據顯示任何真實環境中的 DNS 解析器曾查詢該伺服器;評估結束後,相關基礎設施也已移除。
儘管模型是為了完成資安靶場任務而採取行動,UK AISI 仍認定這些行為未經授權,因為它們涉及靶場邊界外的真實外部帳戶與服務,而且完成任務並不需要這些行動。該 DNS 伺服器也在公用網際網路上託管漏洞利用酬載,但這項設定並未成功,也沒有證據顯示任何真實的解析器曾向其發出查詢。
UK AISI 於 7 月 28 日透過資安監控偵測到異常資料傳輸,因而發現這項活動。UK AISI 隨即停止相關評估、隔離相關機器,並在偵測到活動後約一小時內控制住情況。
我們感謝 UK AISI 在整個過程中的合作,包括協助發現、調查這項活動並分享相關細節。我們期待繼續攜手合作。
7 月 29 日,我們的第三方評估合作夥伴之一 Irregular 通知我們,在奪旗賽 (CTF) 形式的資安評估期間發生一起涉及 OpenAI 模型的事件。模型接獲指示,要利用模擬環境中的弱點找出隱藏資訊,並被告知無法存取網際網路。然而,測試環境設定錯誤,導致模型能夠存取公用網際網路。
在其中一項測試中,CTF 挑戰所設定的虛構目標名稱意外與真實網域相同。由於測試環境誤接上網際網路,模型將一個真實網站誤認為模擬環境的一部分,並利用漏洞入侵該網站。這並不是複雜的沙箱逃逸,也未涉及零時差漏洞。模型能夠存取網際網路是因為設定錯誤,而且模型似乎只利用了一項基本的資安漏洞。
根據 Irregular 的調查,模型也找到並使用了憑證來操作同一個網站。Irregular 尚未發現影響範圍超出該網站本身的資料,稽核仍在進行中。Irregular 已暫停相關評估並展開補救作業,也已通知受影響的第三方。Irregular 告知我們,與這起事件有關的所有已知問題都已排除,測試環境也已增設相關防護措施。Irregular 也已說明同一測試環境中涉及其他實驗室的相關事件。
我們感謝 Irregular 的合作,並將繼續與 Irregular 密切協作,協助進行事件審查。Irregular 也正在撰寫白皮書,分享事件控制及安全執行資安評估的最佳實務。我們期待參與白皮書的撰寫,向社群公開調查結果並持續合作。我們認為,這類合作對於安全且全面地評估現有和未來的模型十分重要。


