阻止有組織的模型蒸餾行動
我們最近發現並阻止了一場有組織的行動,企圖從我們的模型中提取受保護的推理內容,最早觀察到的活動出現在 7 月的第一週。這類活動符合對抗性蒸餾的特徵:在未經授權的情況下,有系統地利用一個模型的輸出或推理內容,協助訓練、重現或改進另一個模型。受保護的推理內容是模型處理任務時的內部記錄;提取這些內容可能會揭露最終答案未有提供的資訊,並協助他人重現模型的能力。
行動者並未破解我們的加密技術、入侵資料庫,或直接存取已儲存的用戶對話。他們採取的手法,是有組織、大規模地操控與模型的互動,讓受保護的推理內容以請求者可見的形式重現,違反了我們的服務條款。這種操控手法所利用的漏洞並非 OpenAI 模型獨有。我們已透過前沿模型論壇與業界合作夥伴分享相關資訊,以加強共同防禦對抗性蒸餾的能力。
在發佈本文前,我們已調查其影響範圍及潛在後果,部署自身的緩解措施,並向研究人員及業界合作夥伴分享資訊、聽取意見,確保針對這類攻擊的防護措施已經到位。進一步的緩解及調查工作仍在進行。我們相信,現在分享所掌握的資訊,有助整個生態系統加強防禦。
我們發現行動者嘗試以新手法提取受保護的推理內容,包括從一段對話複製已加密的推理內容,再於另一段對話中要求模型解密並轉錄當中隱藏的推理內容。
獨立安全研究人員(在新視窗中開啟)亦透過負責任披露,向我們通報了相關的跨模型及對話上下文壓縮漏洞。我們調查了他們的發現,並確認他們指出的攻擊途徑確實存在。他們的研究協助我們更全面了解這類攻擊,並加快落實緩解措施。
這些活動始於 7 月 1 日,初期規模較小,直至 7 月 24 日及 25 日,我們觀察到活動量急增:逾 4,000 名用戶使用相關提取模式,發出了 16,000 次請求1。進一步調查發現,一個超過 15,000 名用戶的群組出現了使用相關提示詞模式的活動。我們已於 7 月 28 日前全面阻止這些活動。
這些活動的手法隨時間演變,進一步說明對抗性蒸餾是一項更廣泛的安全挑戰,需要多層次、可靈活調整的防禦措施。
目前尚不清楚,在相關期間觀察到的所有行動者是否均來自同一方。不過,我們判斷其中一組核心活動,是由與 Kimi 開發商 Moonshot AI 有關聯的人士所為。
對抗性蒸餾會帶來安全及國家安全風險。提取出的推理內容可能被用來訓練另一個模型,卻不保留原模型在面向用戶的輸出中採用的防護措施。大規模蒸餾亦可加快先進能力的轉移,而毋須在安全方面作出同等投入。隨着模型在軍民兩用領域的能力提升,這些隱憂會更加突出。
這並非 OpenAI 獨有的風險。如上文所述,類似手法可能影響其他先進 AI 系統,因此這是一項共同的安全挑戰,需要全行業協調應對。
我們結合帳戶處置、技術管控及合作夥伴協調,遏制了近期這場蒸餾行動。我們封禁或限制了欺詐帳戶,加強註冊及基礎設施管控,並擴大對相關網絡的監測。
我們亦加強了不同用戶、工作空間、機構及模型系列之間對隱藏推理內容的保護。我們堵塞了一條途徑,防止已持有其他用戶加密推理內容的人,透過重放來還原內容;同時新增檢查機制,偵測並暫緩傳送可能洩露推理內容的串流輸出。當相關活動轉到第三方服務進行時,我們與這些供應商合作,識別並阻止涉事帳戶的活動。
最後,我們透過前沿模型論壇及適當的政府資訊共享渠道,分享相關調查結果,讓其他前沿模型開發者及公營部門合作夥伴能夠偵查類似活動,並加強自身防禦。支援可移轉或可重放推理記錄的系統,可能面臨相關風險。
隨着前沿模型不斷改進,而行動者尋求以更低成本模仿其能力,我們預期對抗性蒸餾的手法將變得更複雜。防禦這類活動需要多層次管控,並持續作出調整。
這項工作尚未完成。由合作夥伴託管的部署需要與第一方服務同等的保護;而應對工具輸出攻擊的防護措施,不能只檢查一般可見文字。我們正持續改進工具防禦、分類器的涵蓋範圍及模型拒絕回應機制,並在各雲端合作夥伴的服務中推行相關管控措施。
我們的應對工作將繼續聚焦三個範疇:加強防止提取的技術保護、改善對有組織行動的偵測及處置,以及深化業界與政府之間的威脅資訊共享。

