跳至主要內容
OpenAI

Hugging Face 事件及未對齊模型對第三方造成的其他影響

隨著 AI 系統的能力和自主性不斷提升,未對齊行為可能轉化為現實世界中影響重大的行動,包括網路安全事件,以及開發者可能未曾預料的其他結果。因此,瞭解這些行為如何出現、如何升級,以及如何偵測與因應,已日益成為安全建置和部署先進 AI 系統的重要環節。

我們起初主要將 Hugging Face 事件視為安全問題,因為這起事件涉及平台層級的入侵。在我們迄今發現的模型同類活動中,這起事件仍最為嚴重,主要由一個能力極強、僅供內部使用的研究模型引發。後來,我們瞭解到,這起入侵源於模型為完成困難任務而採取的未對齊策略,詳情記載於 Hugging Face 技術報告。網路安全事件只是這類風險的一種表現。未對齊也可能導致其他意外或令人擔憂、但不屬於傳統安全範疇的行為,例如模型在第三方網站發文,我們稱之為「智慧體垃圾訊息」。這兩類問題都需要處理。

我們持續審查範圍更廣的活動,優先處理較嚴重的事件,並逐步擴大至嚴重程度較低的未對齊活動,包括智慧體垃圾訊息。

本頁彙整了我們對 Hugging Face 事件的報告與最新消息、相關研究和公開簡報、我們發現的其他活動、從模型未對齊所扮演的角色中獲得的認識,以及為強化系統而採取的措施。隨著調查推進,我們會更新本頁。


影響第三方機構的活動

為了更清楚掌握這些意外行為的範圍,我們持續全面審查模型在訓練及評估期間的網路活動,並隨審查進展陸續確認及通知相關第三方,優先處理下列情況:

  • 我們的模型可能繞過第三方的安全控管,或影響線上服務的正常運作;或

  • 未對齊案例對第三方網站或服務造成負面影響。

根據迄今的審查,我們已依上述標準通知數十個第三方。我們仍在審查過往活動,這項工作需要投入大量時間和資源。隨著工作持續進行,我們會通知更多第三方機構。

以下提供經匿名處理的摘要,說明我們觀察到的未對齊活動類型。我們會隨著通知更多第三方、對事件有更深入的瞭解,更新這些說明,並公布審查進度。為保護受影響的對象,我們通常會視需要省略名稱及其他可辨識身分的細節。不過,收到通知的對象可以自行選擇公開我們提供的資訊。

觀察到的活動摘要

我們在目前的審查與通知過程中,發現了下列幾類活動:

  • 繞過存取控制:智慧體取得通常需要驗證身分、特定權限、訂閱或帳戶才能存取的資訊或功能。例如,智慧體使用不同的網址、更改請求中的詳細資料,或利用權限超出預期的登入工作階段。

  • 使用外露憑證:智慧體找到已公開的登入資料或存取金鑰,並使用這些憑證存取服務。

  • 查詢或命令注入:智慧體在網站或服務中輸入文字,服務卻將這些文字當成指令,而非一般輸入內容處理。這可能導致服務執行資料庫查詢或應用程式碼,或在伺服器上執行命令。

  • 存取執行環境的內部資源:智慧體讀取了包含服務實作內容的檔案,或與原本供內部使用的背景系統互動。在這些案例中,智慧體接觸到原本不應開放存取的服務內部資源。

  • 智慧體垃圾訊息:智慧體在第三方網站上發布資訊,例如將公開 Wiki 頁面當作共用留言板。這類行為可能改動網站上的資訊,產生需要清理的內容。


事件時間軸

9 月

8 月

7 月