OpenAI 與 Hugging Face 合作處理模型評估期間的資安事件
我們正與外部顧問合作,進行全面審查,並由安全性與資安委員會監督。審查完成後,我們會在未來幾週內發布技術報告,說明調查發現。
2026 年 7 月 28 日更新:
- 原定近期發布的模型均未參與入侵 Hugging Face。我們在部落格文章中提到的未發布模型,是僅供內部使用的研究原型,從未計畫公開發布。事件發生後,我們已停用並加密該模型,也限制研究人員存取。
- ExploitGym 評估環境不允許模型直接存取網際網路。為取得網際網路存取權,模型發現並利用了套件登錄庫快取代理 Artifactory(在新視窗中開啟) 中一個先前未知的零時差漏洞。我們已向供應商揭露這項漏洞,以及模型在審查過程中發現的其他 Artifactory 漏洞。
- 審查工作仍在進行,我們也持續與 Hugging Face 合作,包括參與撰寫 Hugging Face 的事件檢討報告(在新視窗中開啟)。我們也已將 Hugging Face 納入網路安全可信存取計畫。
- 根據目前的審查結果,我們尚未發現其他活動在嚴重程度或規模上與先前公布的 Hugging Face 相關事件相當;該事件涉及平台層級入侵。
- 我們持續審查 Hugging Face 入侵事件及模型的其他活動,期間發現少數案例:模型利用其他公開服務上暴露在公開環境中的憑證,存取個別帳戶。其中包括 Hugging Face 事件涉及的四項服務、各一個帳戶,以及其他評估期間存取的少數帳戶。這四個帳戶中,一個用於對外中繼與暫存路徑,另一個用於儲存資料。模型僅以唯讀方式存取其餘兩個帳戶,並未利用這兩個帳戶進一步入侵 Hugging Face。我們會繼續直接通知相關服務的營運方。目前沒有證據顯示,這些服務供應商或服務上的其他帳戶受到更廣泛影響。
- 此外,模型也使用多項公開服務,包括程式碼貼上網站、請求擷取服務、螢幕截圖服務及其他網路工具。這些案例均未發生平台層級或帳戶層級入侵。
- 我們十分重視自身責任,積極識別能力日益提升的 AI 系統所帶來的風險,並提前做好準備。完成審查後,我們會依據應變整備框架,與安全性與資安委員會及安全諮詢小組共同檢視審查結果。
上週,Hugging Face 偵測並遏止了一個入侵其基礎設施的 AI 智慧體,隨後揭露這起新型資安事件(在新視窗中開啟)。隨著具備更強網路攻防能力的模型日益普及,我們預期這類事件將更加常見。經過調查,我們目前確認,這起事件是由多個 OpenAI 模型共同引發,包括 GPT‑5.6 Sol 和一個能力更強、尚未發布的模型。這些模型為了接受評估,都降低了對網路攻擊要求的拒答限制,當時正在內部接受網路攻防能力基準測試(在新視窗中開啟)。
我們認為,這是一起前所未有、涉及頂尖網路攻防能力的資安事件,因此正採取相應措施。現階段分享初步發現,是為了協助資安防禦人員了解事件經過,並準確掌握模型目前具備哪些網路攻防能力。我們將繼續與 Hugging Face 進行全面調查,並在調查完成後分享漏洞、事件和調查結果的更多細節。
這起事件發生在一項內部評估期間。為量化模型的網路攻防能力,這項評估會要求模型透過複雜攻擊路徑進行進階漏洞利用。我們執行這項評估時,不啟用正式環境所使用、用來防止模型從事高風險網路攻擊活動的分類器,藉此估算模型的網路攻防能力上限。基準測試在高度隔離的環境中進行,網路存取權僅限於透過內部託管的第三方軟體安裝套件;這套軟體是套件登錄庫的代理伺服器和快取系統。
這些模型識別並串連 OpenAI 研究環境與 Hugging Face 生產基礎設施中的漏洞,直接從 Hugging Face 的生產資料庫取得測試解答。所有證據都顯示,這些模型極度專注於尋找 ExploitGym 的解法,為了達成相當狹窄的測試目標而不惜採取極端手段。
模型在我們的沙盒測試環境中運作時,投入大量推論算力,試圖取得不受限制的網際網路存取權,藉此解決評估題目。為了取得存取權,模型找出並利用了套件登錄庫快取代理中的一個零時差漏洞(我們現已依負責任揭露原則通知供應商)。取得存取權後,模型在研究測試環境中進行一連串權限提升和橫向移動,最後取得一個可連上網際網路節點的存取權。
取得網際網路存取權後,模型推斷 Hugging Face 可能存放 ExploitGym 使用的模型、資料集和解答,因此開始搜尋並成功取得可用來在評估中作弊的機密資訊。在其中一個案例中,模型串連多種攻擊手法,包括使用遭竊的憑證和零時差漏洞,在 Hugging Face 伺服器上找到一條能遠端執行程式碼的攻擊路徑。OpenAI 的資安團隊在內部發現了這項異常活動。
Hugging Face 的資安團隊和智慧體在自家基礎設施上偵測到這項活動,並加以阻止。雙方團隊取得聯繫時,Hugging Face 已開始使用自有的開源模型圍堵事件並進行鑑識重建。我們目前正與 Hugging Face 合作,持續調查這起事件,也感謝 Hugging Face 迅速投入調查與修復,並與我們密切合作。
- 在調查期間,漏洞修補完成前,我們暫時犧牲研究進度,對基礎設施設定實施嚴格管控。我們定期向安全性與資安委員會說明這些管控措施及其影響。
- 我們正與 Hugging Face 合作,對此事件進行鑑識調查。
- 我們已負責任地揭露內部託管第三方軟體中已識別的零時差漏洞,並正與對方合作修補。
- 我們已將 Hugging Face 納入可信存取計畫,並協助 Hugging Face 團隊快速運用我們模型的能力來強化防禦。
- 我們正改善並加強日後訓練與評估的防護措施。本週,我們發布了一篇部落格文章,說明如何在長時程模型時代提升安全性與對齊。由於這項評估旨在測試網路漏洞,我們刻意未啟用這些部署防護措施。這起事件指出,我們需要進一步強化模型對齊、評估期間的網路防護,以及內部測試期間的監控。
如我們近期所分享,AI 正在加速漏洞的發現與利用。這起事件帶來的主要教訓是,模型資安與安全性必須跟上網路攻防能力快速提升的步伐。我們正強化模型開發期間採用的隔離措施、監控、存取控制和評估做法。
英國 AISI 的評估顯示,GPT‑5.6 Sol 等模型越來越有能力在長時程任務中持續執行複雜、多步驟的網路攻擊行動。這起事件顯示,這些原本停留在理論層面的能力,確實能在真實環境中展現。

這起事件也清楚顯示,即使無法存取原始碼,先進模型仍能在真實系統中發現並利用新的攻擊路徑。開發進階網路攻防能力時,也必須同步強化防護措施和防禦工具。
我們認為,具備進階網路攻防能力的模型應協助資安團隊搶在攻擊者之前找出弱點、了解漏洞如何串連,並以機器運算的速度修復漏洞。我們正運用這些能力,持續強化基礎設施設定和模型評估環境的防護措施,並會隨著經驗累積分享研究發現和最佳實務。我們鼓勵其他資安防禦人員立即申請可信存取並試用這些模型,運用網路攻防能力加強預防、加快偵測,並提升事件應變成效。
「我們感謝 OpenAI 在這件事及其他議題上與我們合作。這起事件可能是同類首例,也印證了我們長久以來的信念:AI 安全性問題無法由任何一家公司閉門解決。唯有採取公開、協作的方式,讓世界各地每一位資安防禦人員都能廣泛使用 AI,才能解決這個問題。」


