跳到主要內容
OpenAI

Hugging Face 事件及失準模型對其他第三方造成的影響

隨着 AI 系統的能力和自主程度提升,失準行為可能在現實世界中演變成後果嚴重的行動,包括網絡安全事故及開發者未能預見的其他結果。因此,了解這些行為如何出現和升級,以及如何偵測和應對,已日益成為安全建構及部署先進 AI 系統的重要一環。

我們最初主要把 Hugging Face 事件理解為保安問題,因為事件涉及平台層面的入侵。這仍是我們迄今從自身模型發現的同類活動中最嚴重的一宗,主要由一個能力極高、僅供內部使用的研究模型引發。其後我們了解到,這次入侵源於模型為解決艱深任務而採用失準策略,詳情載於 Hugging Face 技術報告。網絡安全事故是這類風險的一種表現;失準亦可能導致傳統保安分類以外的其他意外或令人憂慮的行為,例如模型在第三方網站發文,我們稱之為「智能代理垃圾訊息」。兩方面我們都必須處理。

我們持續審查更廣泛的活動,優先處理較嚴重的事件,並把範圍擴展至嚴重程度較低的失準活動,包括智能代理垃圾訊息。

本頁匯集我們就 Hugging Face 事件發佈的報告和最新消息、相關研究及公開簡報、我們發現的其他活動、對模型失準所扮演角色的認識,以及為強化系統而採取的措施。隨着調查推進,我們會更新本頁。


影響第三方的活動

為進一步了解這些意外行為的範圍,我們一直廣泛審查模型在訓練和評估期間於互聯網上的活動。審查期間,我們持續識別和通知第三方,並優先處理以下個案:

  • 我們的模型可能繞過第三方的保安管控,或可能影響網上服務的可用性;或

  • 失準個案對第三方網站或服務造成負面影響。

根據迄今的審查,我們已依照上述準則通知數十個第三方。我們仍在審查過往活動,這項工作將需要大量時間和資源。隨着工作繼續,我們會通知更多第三方。

下文將以匿名摘要說明我們觀察到的失準活動類型;隨着我們通知更多第三方及了解日深,亦會更新這些說明。此外,我們會分享審查狀況的相關最新消息。為保障受影響各方,我們一般會按需要省略名稱及其他可識別身分的資料;不過,獲知會的各方可選擇公開我們向其提供的資料。

觀察所得活動摘要

迄今的審查和通知程序發現以下活動類別:

  • 繞過存取控制:智能代理取得一般需要身分核實、特定權限、訂閱或帳戶才能使用的資料或功能。例如,智能代理使用不同網址、更改請求中的詳細資料,或利用存取權限超出預期的登入工作階段。

  • 使用外洩憑證:智能代理找到已公開的登入資料或存取金鑰,並以此存取服務。

  • 查詢或指令注入:智能代理在網站或服務中輸入文字,而服務把文字當成指令而非一般輸入。這可能導致服務在其伺服器執行數據庫查詢、應用程式碼或指令。

  • 存取執行階段內部資源:智能代理讀取載有服務實作內容的檔案,或與僅供內部使用的後台系統互動。在這些個案中,智能代理存取了原定範圍以外的服務部分。

  • 智能代理垃圾訊息:智能代理在第三方網站發佈資料,可能改動網站內容並需要清理,例如把公開 wiki 頁面用作共用留言板。


事件時間線

9 月

8 月

7 月