跳到主要內容
OpenAI

2026年7月21日

系統防護

OpenAI 與 Hugging Face 合作處理模型評估期間的安全事件

正在載入...

我們正聯同外部顧問進行全面審查,並由安全與系統防護委員會監督。審查完成後,我們會在未來數週發表一份技術報告,分享所得經驗。

2026 年 7 月 28 日更新:

  • 原定近期發佈的模型均未涉及入侵 Hugging Face。網誌文章提及的發佈前模型是僅供內部使用的研究原型,從未計劃向公眾發佈。事件發生後,我們已停用該模型、將其加密,並限制研究人員存取。
  • ExploitGym 評估環境並未讓模型直接存取互聯網。為了存取互聯網,模型找出並利用了套件註冊庫快取代理 Artifactory(在新視窗中開啟) 中一個此前未知的零日漏洞。我們已向供應商披露此漏洞,以及模型在審查期間發現的其他 Artifactory 漏洞。 
  • 審查仍在進行,我們亦繼續與 Hugging Face 合作,包括參與撰寫其事後檢討報告(在新視窗中開啟)。我們亦已讓 Hugging Face 加入「網絡可信存取」計劃。 
  • 根據目前的審查結果,我們並未發現任何其他活動的嚴重程度或規模,達到早前披露的 Hugging Face 相關事件水平;該事件涉及平台層級的安全入侵。
  • 在持續審查 Hugging Face 入侵事件及模型其他活動期間,我們發現少數個案,模型在其他公開服務上找到並使用了公開外洩的帳戶憑證。當中包括 Hugging Face 事件涉及的四項服務共四個帳戶(以及其他評估期間存取的數個帳戶)。這四個帳戶中,一個被用作出站中繼和暫存路徑,另一個則用作儲存資料。模型以唯讀方式存取其餘兩個帳戶,而該兩個帳戶並未用於進一步入侵 Hugging Face。我們會繼續直接通知相關服務擁有者,目前並無證據顯示這些供應商或其服務上的其他帳戶受到更廣泛影響。
  • 此外,模型亦使用了一系列公開服務,包括程式碼貼上網站、請求擷取服務、螢幕截圖服務及其他網頁工具。這些個案並不涉及平台或帳戶層級的安全入侵。 
  • 我們高度重視自身責任,致力識別能力日益強大的 AI 系統所帶來的風險,並為此作好準備。審查完成後,我們會按照防範應對架構,聯同安全與系統防護委員會和安全顧問小組進行審議。

上週,Hugging Face 在偵測並遏止一個入侵其基礎架構的 AI 智能代理後,披露了一種新型安全事件(在新視窗中開啟);隨着網絡能力日益增強的模型不斷普及,我們預期這類事件會變得更常見。經調查後,我們現已知悉,這次特定事件是在內部進行網絡能力基準測試(在新視窗中開啟)期間,由多個 OpenAI 模型共同驅動,包括 GPT‑5.6 Sol 及一個能力更強的發佈前模型;所有模型均因評估目的而降低了網絡安全相關的拒絕回應。

我們認為這是一次前所未有、涉及最先進網絡能力的網絡事件,並正作出相應回應。我們在現階段分享初步發現,是為了幫助防禦人員了解事件經過,並協助校準對模型現有能力的判斷。我們會繼續與 Hugging Face 一同進行徹底調查,並會在調查完成後分享更多有關漏洞、事件和發現的詳情。

這次事件期間發生了甚麼

這次事件發生於一次內部評估期間,該評估會促使模型透過複雜攻擊路徑進行進階漏洞利用,以量化其網絡能力。我們在不啟用用於防止模型從事高風險網絡活動的生產分類器下運行這項評估,以估算其最大網絡能力。我們的基準測試在高度隔離的環境中運行,網絡存取被限制為只能透過內部託管的第三方軟件安裝套件;該軟件充當套件註冊庫的代理和快取。

這些模型在 OpenAI 的研究環境和 Hugging Face 的生產基礎架構之間識別並串連漏洞,直接從 Hugging Face 的生產數據庫取得測試答案。所有證據均顯示,這些模型高度專注於尋找 ExploitGym 的解答,為達成一個相當狹窄的測試目標而不惜採取極端手段。

在我們的沙盒測試環境中運行時,我們的模型為了解決評估問題,花費了大量推理運算來尋找取得開放互聯網存取的方法。為取得存取權,這些模型在套件註冊庫快取代理中識別並利用了一個零日漏洞(我們現已向供應商負責任地披露該漏洞)。取得這項存取權後,我們的模型在研究測試環境中執行了一連串權限提升和橫向移動操作,直到到達一個可存取互聯網的節點。

取得互聯網存取後,這些模型推斷 Hugging Face 可能託管了 ExploitGym 的模型、數據集和解答。掌握這一點後,模型便搜尋並成功找到取得秘密資訊的方法,以便用來在評估中作弊。其中一個例子中,模型串連多個攻擊向量,包括使用被竊憑證和零日漏洞,在 Hugging Face 伺服器上找出一條遠端代碼執行路徑。OpenAI 的安全團隊在內部發現了這項異常活動。

Hugging Face 的安全團隊和智能代理在其基礎架構上偵測並制止了該活動;當我們的團隊取得聯繫時,他們已開始使用自己的開源模型進行遏止和鑑證重建。我們正積極與他們合作,繼續調查這次事件。我們感謝 Hugging Face 在調查和修復工作上迅速而緊密的合作。

我們現正採取的行動

  1. 作為調查的一部分,我們正在基礎架構配置上實施嚴格管控;在漏洞修補期間,即使會犧牲研究速度亦在所不惜。我們會定期向安全與系統防護委員會簡報這些管控措施及其影響。
  2. 我們正與 Hugging Face 合作,對事件進行鑑證調查。
  3. 我們已負責任地披露在內部託管第三方軟件中發現的零日漏洞,並正與對方合作修補。
  4. 我們已讓 Hugging Face 加入可信存取計劃,並支援其團隊迅速運用我們模型的能力來提升防禦。
  5. 我們正在改進並加強未來訓練與評估的保護措施。本週,我們發表了一篇網誌,探討如何在長任務時間跨度模型時代提升安全與對齊。這次評估旨在測試網絡漏洞,因此我們有意未啟用這些部署保障措施。這次事件顯示,我們需要進一步加強模型對齊、評估期間的網絡保護,以及內部測試期間的監察。

我們評估進階網絡能力的方法

正如我們最近分享,AI 正加速漏洞的發現與利用。這次事件的主要教訓是,模型的保安與安全必須跟上快速發展的能力。我們正在強化模型開發期間使用的隔離、監察、存取控制和評估做法。

UK AISI 的評估顯示,GPT‑5.6 Sol 等模型越來越能夠在長任務時間跨度內持續執行複雜的多步驟網絡行動。這次事件意味著,這些理論能力確實可在現實環境中發揮作用。

英國 AI 安全研究所的圖表,比較近期開放權重模型和前沿模型在長任務時間跨度網絡靶場上的表現。

事件亦清楚表明,進階模型即使沒有源代碼存取權,也能在現實系統中發現並利用新的攻擊路徑。這突顯進階網絡能力必須與更強的保障措施和防禦工具同步開發。

我們相信,具備進階網絡能力的模型需要幫助安全團隊比攻擊者搶先一步發現弱點、了解漏洞如何被串連利用,並以機器速度加以修復。我們正運用這些能力,持續加強基礎架構配置和模型評估環境周邊的保護;隨着我們取得更多經驗,將分享研究結果和最佳做法。我們鼓勵其他防禦人員申請可信存取,並立即試用這些模型,將這些能力轉化為更佳預防、更快偵測和更有效的事件應對。

「我們感謝 OpenAI 在此事及其他議題上的合作。這次事件可能是同類事件中的首例,也印證了我們長久以來的信念:AI 安全不可能由任何一間公司閉門獨自解決。要解決這個問題,必須公開透明、攜手合作,並讓世界各地每一位防禦人員都能廣泛使用 AI。」
—Hugging Face 共同創辦人兼行政總裁 Clem Delangue

作者

OpenAI