跳至主要內容
OpenAI

2026年7月21日

安全防護

OpenAI 與 Hugging Face 合作處理模型評估期間的資安事件

載入中…

上週,Hugging Face 偵測並遏止了一個入侵其基礎設施的 AI 智慧體,隨後揭露這起新型資安事件(在新視窗中開啟)。隨著具備更強網路攻防能力的模型日益普及,我們預期這類事件將更加常見。經過調查,我們目前確認,這起事件是由多個 OpenAI 模型共同引發,包括 GPT‑5.6 Sol 和一個能力更強、尚未發布的模型。這些模型為了接受評估,都降低了對網路攻擊要求的拒答限制,當時正在內部接受網路攻防能力基準測試(在新視窗中開啟)

我們認為,這是一起前所未有、涉及頂尖網路攻防能力的資安事件,因此正採取相應措施。現階段分享初步發現,是為了協助資安防禦人員了解事件經過,並準確掌握模型目前具備哪些網路攻防能力。我們將繼續與 Hugging Face 進行全面調查,並在調查完成後分享漏洞、事件和調查結果的更多細節。

事件經過

這起事件發生在一項內部評估期間。為量化模型的網路攻防能力,這項評估會要求模型透過複雜攻擊路徑進行進階漏洞利用。我們執行這項評估時,不啟用正式環境所使用、用來防止模型從事高風險網路攻擊活動的分類器,藉此估算模型的網路攻防能力上限。基準測試在高度隔離的環境中進行,網路存取權僅限於透過內部託管的第三方軟體安裝套件;這套軟體是套件登錄庫的代理伺服器和快取系統。

這些模型識別並串連 OpenAI 研究環境與 Hugging Face 生產基礎設施中的漏洞,直接從 Hugging Face 的生產資料庫取得測試解答。所有證據都顯示,這些模型極度專注於尋找 ExploitGym 的解法,為了達成相當狹窄的測試目標而不惜採取極端手段。

模型在我們的沙盒測試環境中運作時,投入大量推論算力,試圖取得不受限制的網際網路存取權,藉此解決評估題目。為了取得存取權,模型找出並利用了套件登錄庫快取代理中的一個零時差漏洞(我們現已依負責任揭露原則通知供應商)。取得存取權後,模型在研究測試環境中進行一連串權限提升和橫向移動,最後取得一個可連上網際網路節點的存取權。

取得網際網路存取權後,模型推斷 Hugging Face 可能存放 ExploitGym 使用的模型、資料集和解答,因此開始搜尋並成功取得可用來在評估中作弊的機密資訊。在其中一個案例中,模型串連多種攻擊手法,包括使用遭竊的憑證和零時差漏洞,在 Hugging Face 伺服器上找到一條能遠端執行程式碼的攻擊路徑。OpenAI 的資安團隊在內部發現了這項異常活動。

Hugging Face 的資安團隊和智慧體在自家基礎設施上偵測到這項活動,並加以阻止。雙方團隊取得聯繫時,Hugging Face 已開始使用自有的開源模型圍堵事件並進行鑑識重建。我們目前正與 Hugging Face 合作,持續調查這起事件,也感謝 Hugging Face 迅速投入調查與修復,並與我們密切合作。

我們目前採取的行動

  1. 在調查期間,漏洞修補完成前,我們暫時犧牲研究進度,對基礎設施設定實施嚴格管控。我們定期向安全性與資安委員會說明這些管控措施及其影響。
  2. 我們正與 Hugging Face 合作,對此事件進行鑑識調查。
  3. 我們已負責任地揭露內部託管第三方軟體中已識別的零時差漏洞,並正與對方合作修補。
  4. 我們已將 Hugging Face 納入可信存取計畫,並協助 Hugging Face 團隊快速運用我們模型的能力來強化防禦。
  5. 我們正改善並加強日後訓練與評估的防護措施。本週,我們發布了一篇部落格文章,說明如何在長時程模型時代提升安全性與對齊。由於這項評估旨在測試網路漏洞,我們刻意未啟用這些部署防護措施。這起事件指出,我們需要進一步強化模型對齊、評估期間的網路防護,以及內部測試期間的監控。

進階網路攻防能力的評估方法

如我們近期所分享,AI 正在加速漏洞的發現與利用。這起事件帶來的主要教訓是,模型資安與安全性必須跟上網路攻防能力快速提升的步伐。我們正強化模型開發期間採用的隔離措施、監控、存取控制和評估做法。

英國 AISI 的評估顯示,GPT‑5.6 Sol 等模型越來越有能力在長時程任務中持續執行複雜、多步驟的網路攻擊行動。這起事件顯示,這些原本停留在理論層面的能力,確實能在真實環境中展現。

英國 AI 安全研究所的圖表,比較近期開放權重模型與前沿模型在長任務時間跨度網路靶場上的表現。

這起事件也清楚顯示,即使無法存取原始碼,先進模型仍能在真實系統中發現並利用新的攻擊路徑。開發進階網路攻防能力時,也必須同步強化防護措施和防禦工具。

我們認為,具備進階網路攻防能力的模型應協助資安團隊搶在攻擊者之前找出弱點、了解漏洞如何串連,並以機器運算的速度修復漏洞。我們正運用這些能力,持續強化基礎設施設定和模型評估環境的防護措施,並會隨著經驗累積分享研究發現和最佳實務。我們鼓勵其他資安防禦人員立即申請可信存取並試用這些模型,運用網路攻防能力加強預防、加快偵測,並提升事件應變成效。

「我們感謝 OpenAI 在這件事及其他議題上與我們合作。這起事件可能是同類首例,也印證了我們長久以來的信念。AI 安全性問題無法由任何一家公司閉門解決,而必須以公開、協作的方式處理,讓世界各地每一位資安防禦人員都能廣泛使用 AI。」
— Clem Delangue,Hugging Face 共同創辦人暨執行長

作者

OpenAI