跳至主要內容
OpenAI

2026年9月30日

安全防護

阻斷一場協同進行的模型蒸餾行動

載入中…

我們最近發現並阻斷了一場協同進行的行動,目的是從我們的模型中擷取受保護的推理內容。最早觀察到的活動發生於 7 月第一週。這項活動符合對抗性蒸餾的特徵:未經授權,有系統地利用一個模型的輸出或推理,協助訓練、重製或改進另一個模型。受保護的推理內容是模型處理任務時的內部紀錄;擷取這些內容,可能洩露最終答案中未提供的資訊,並協助他人複製模型的能力。

這些操作者並未破解我們的加密機制、入侵資料庫,或直接取得已儲存的使用者對話。他們採取的做法是操縱與模型的互動,讓受保護的推理內容以請求者可見的形式重現。這種協同、大規模的操作違反了我們的服務條款。這種操縱手法所利用的漏洞並非 OpenAI 模型獨有。我們已透過前沿模型論壇與業界合作夥伴分享相關資訊,以加強共同防禦對抗性蒸餾的能力。

發布本文前,我們已調查其範圍與潛在影響、部署自身的緩解措施,並與研究人員及業界合作夥伴分享資訊、聽取意見,以確保針對這類攻擊的防護措施已就緒。進一步的緩解與調查工作仍在持續進行。我們相信,現在分享已掌握的資訊,有助於整個生態系強化防禦。

我們觀察到的情況

我們觀察到操作者嘗試以新手法擷取受保護的推理內容,包括從一段對話中複製已加密的推理內容,再要求另一段對話中的模型將隱藏的推理內容解密並轉錄出來。

獨立資安研究人員⁠(在新視窗中開啟)也透過負責任的揭露方式,向我們通報了相關的跨模型與對話壓縮漏洞。我們調查了他們的研究結果,並確認他們指出的攻擊途徑確實存在。他們的研究幫助我們更全面地理解這類攻擊,並加快緩解措施的部署。

這項活動始於 7 月 1 日,初期規模不大,直到 7 月 24 日和 25 日,我們觀察到活動量大幅攀升:超過 4,000 名使用者以相關擷取模式發出了 16,000 次請求1。進一步調查發現,一個涵蓋超過 15,000 名使用者的群集中,也有使用相關提示詞模式的活動。我們已於 7 月 28 日前全面阻斷這些活動。

這些活動的手法隨時間演變,進一步表明對抗性蒸餾是一項更廣泛的安全挑戰,需要多層次且能靈活調整的防禦措施。

我們對行動來源的評估

我們在相關期間觀察到的所有操作者,是否都隸屬於同一個行動主體,目前尚不清楚。不過,我們判定,其中一組核心活動是由與 Kimi 開發商 Moonshot AI 有關聯的人士所為。

為何這件事很重要

對抗性蒸餾會帶來安全與國家安全風險。擷取出的推理內容可能被用來訓練另一個模型,卻未保留原模型對提供給使用者的輸出所設置的安全防護措施。大規模蒸餾也能加速先進能力的轉移,卻無須在安全方面投入同等資源。隨著模型在軍民兩用領域的能力增強,這些疑慮也會加劇。

這項風險並非 OpenAI 獨有。如前所述,類似手法也可能影響其他先進 AI 系統,因此這是一項需要全產業協調應對的共同安全挑戰。

我們如何應對

我們結合帳號處置、技術管控及合作夥伴協調,抑制了近期這場蒸餾行動。我們封禁或限制了詐欺帳號,強化註冊與基礎設施管控,並擴大對相關帳號網路的監控。

我們也強化了跨使用者、工作區、組織及模型系列的隱藏推理防護。我們封堵了一條途徑,避免已持有其他使用者加密推理內容的人,透過重放來還原其內容;同時新增檢查機制,偵測並暫緩傳送可能洩露推理內容的串流輸出。當相關活動轉而透過第三方服務進行時,我們便與這些服務供應商合作,找出並阻斷涉事帳號的活動。

最後,我們透過前沿模型論壇及適當的政府資訊共享管道,分享相關發現,讓其他前沿模型開發者及公部門合作夥伴能夠查找類似活動,並加強自身防禦。支援可攜式或可重放推理產物的系統,可能面臨相關風險。

接下來的工作

我們預期,隨著前沿模型持續進步,而行動者尋求以更低成本模仿其能力,對抗性蒸餾的嘗試將變得更加複雜。防範這類活動需要多層次管控,並持續調整應對方式。

這項工作尚未完成。由合作夥伴託管的部署需要與第一方服務相同的防護;而要防範工具輸出攻擊,檢查範圍則不能只限於一般可見文字。我們正持續改善工具防禦、分類器涵蓋範圍及模型拒絕機制,並將相關管控措施推廣至各雲端合作夥伴。

我們的應對工作將持續聚焦三個面向:強化防範擷取的技術防護、改善對協同行動的偵測與處置,以及深化產業與政府之間的威脅資訊共享。

作者

OpenAI

註腳

  1. 1

    這些數字代表擷取嘗試,不一定表示擷取成功。