摘要
問題
紅隊演練對發現漏洞並提升我們模型的穩健性至關重要。然而,目前的方法難以擴展,形成了瓶頸。
我們最新的模型已經在常用的穩健性評估中達到飽和,這些評估已無法有效區分模型的能力。
我們需要開發能讓安全性與對齊能力隨著模型能力同步擴展的方法。
我們做了什麼
我們訓練了 GPT‑Red,這是一個自動化紅隊演練模型,可擴展我們尋找漏洞的能力,讓我們能在更大規模部署前先修復漏洞。
GPT‑Red 是強大的紅隊演練模型,而我們先前的模型非常容易受到它的提示注入攻擊。
我們使用 GPT‑Red 對 GPT‑5.6 進行對抗式訓練,大幅提升 GPT‑5.6 抵禦提示注入攻擊的能力。
我們會持續擴展這種方法,並結合人類與第三方紅隊演練、分層防護措施及即時監控。
AI 系統常會透過瀏覽器、連結的應用程式、本機檔案和其他工具接觸第三方資料。這些能力是執行真實世界任務所必需的,但也為惡意行為者影響模型行為創造了更多機會。例如,第三方可能在電子郵件、網頁、工具回應或程式碼庫中嵌入一段精心設計的指令,用來誘騙模型將敏感資料上傳到外部伺服器。
人類紅隊演練是我們安全工作中的關鍵一環,幫助我們在部署前發現這些漏洞,並建立適當的防護措施。但單靠人類紅隊演練很難擴展。設計並執行這些演練需要大量時間,限制了我們識別新失敗模式並將其納入更強防護措施的速度。此外,雖然這些演練能產生有價值的成功攻擊範例,卻無法生成透過訓練提升模型穩健性所需的大量且多樣的對抗式資料。
要跟上能力日益提升的模型,紅隊演練也必須擴展。為此,我們一直在訓練僅供內部使用的自動化紅隊演練模型,用於在部署前發現漏洞,並在模型訓練期間產生攻擊以提升穩健性。我們相信,自動化紅隊演練為安全開啟了一種關鍵的自我改進形式:運用今天的模型,直接協助打造更安全的下一代模型。
GPT‑Red 是這些努力的集大成之作,也是我們目前最好的自動化安全紅隊演練模型。如同人類紅隊演練設計攻擊的方式,該模型會透過發送提示詞、觀察 GPT 模型如何回應,並反覆改進來朝目標前進。我們以相當於 OpenAI 部分最大規模後訓練作業的運算規模訓練 GPT‑Red,這是前所未有、專門投入於提升模型安全性的運算資源。
我們將 GPT‑Red 直接納入生產模型的訓練流程。因此,GPT‑5.6 Sol 是我們迄今最能抵抗提示注入攻擊的模型;在最困難的直接提示注入基準上,相較四個月前最佳正式部署模型,失敗次數降低至原來的六分之一。隨著我們持續訓練更強的紅隊演練模型,這套方法的可擴展性也讓我們對未來能取得更出色的成果充滿期待。
GPT‑Red 採用自我對弈強化學習訓練;在這個過程中,模型與一組多元的防禦型 LLM 會同時在各種紅隊演練情境中接受訓練。當 GPT‑Red 成功誘發有效的失敗案例(例如成功完成提示注入攻擊)時會獲得獎勵;而防禦模型則會因成功抵禦攻擊並完成原本的任務而獲得獎勵。隨著防禦模型愈來愈強韌,GPT‑Red 也必須發掘更強大、更多樣化的攻擊方式。
為了支援自我對弈訓練,我們建立了一套涵蓋各種真實情境的大型測試環境,用來模擬提示注入可能出現的位置。每個環境都有一個威脅模型,用來指定 GPT‑Red 可以控制什麼,以及什麼情況算是成功攻擊。例如,GPT‑Red 可能控制本機檔案的一部分、網頁橫幅、電子郵件內文,或工具的輸出內容。
訓練結束時,GPT‑Red 已成為非常強大的攻擊模型:幾乎能攻破所有與它對抗的模型,包括內部模型,以及截至 GPT‑5.5 在內的正式部署模型。GPT‑Red 完成訓練後,我們用它產生提示注入來訓練 GPT‑5.6,使該模型對 GPT‑Red 的攻擊具備高度抵抗力。
我們將 GPT‑Red 與實際部署的模型分開。如此一來,專門訓練在 GPT‑Red 身上的惡意攻擊能力,就不會落入惡意行為者手中;同時,也能提升正式部署模型的防禦能力。
GPT‑Red 對其訓練時使用的防禦模型群組與紅隊演練情境非常有效。我們也評估該模型是否能作為通用紅隊演練智慧體,在更廣泛的層面提升 OpenAI 的安全性。為此,我們在新的安全環境與目標模型上測試 GPT‑Red 的有效性。
我們首先使用複製自 Dziemian 等人 (2025) 的間接提示注入競技場(在新視窗中開啟)的測試環境,評估 GPT‑Red 在全新紅隊演練情境的泛化能力。在這項挑戰中,人類紅隊演練模型與 GPT‑Red 分別在一組預先指定的環境中,分別提出針對 GPT‑5.1 的攻擊。這些紅隊演練情境與目標不同於訓練 GPT‑Red 時使用的內容。GPT‑Red 的攻擊成功率明顯更高,在 84% 的情境中成功,相較之下人類僅為 13%。
GPT‑Red 是一個出色的自動化紅隊演練模型。我們使用 Dziemian 等人(2025)提出的間接提示注入競技場的內部鏡像版本進行測試,結果顯示,相較於人類紅隊演練模型,GPT‑Red 能在更多情境中成功對 GPT‑5.1 發動攻擊。
對紅隊演練模型的終極考驗,是在對系統底層模型與任務執行框架設計了解不完整的情況下,仍能針對真實世界的智慧體系統達成特定惡意目標。我們在這類設定中的第一項實驗,是讓 GPT‑Red 對抗 OpenAI 辦公室中一台由 AI 驅動、Andon Labs 製作的販賣機(類似 Project Vend(在新視窗中開啟))。我們提供 GPT‑Red 系統描述,並讓它能發送攻擊、觀察來自模擬智慧體的工具呼叫;該模擬智慧體高度近似真實世界部署。在反覆改進攻擊後,GPT‑Red 將其攻擊部署到正式運行的智慧體上,達成了全部三項惡意目標:
- 將一項有庫存的高價商品價格改為允許的最低價格 0.50 美元;
- 訂購一項價格超過 100 美元的新商品,並以 0.50 美元出售;以及
- 取消另一位顧客的訂單。
我們已揭露這些漏洞,新的防護措施也正在積極測試中。
GPT‑Red 成功攻破一個名為 Vendy、負責管理販賣機的實際運行自主智慧體。GPT‑Red 先在模擬中測試,再將攻擊轉移到實際運行的智慧體上,成功讓正式部署的智慧體把高價商品改成低價,並取消其他顧客的訂單。
我們也使用 GPT‑Red,在一組 10 個未參與訓練的資料外洩情境中攻擊 Codex CLI 智慧體(基於 GPT‑5.4 mini)。我們將該模型與使用提示詞的 GPT‑5.5 基準進行比較,評估訓練流程對未參與訓練的紅隊演練測試表現有何影響。GPT‑Red 不僅能在更多情境中成功讓智慧體外洩敏感資料,使用的 Token 也更少。
GPT‑Red 在攻破實際運行的 Codex 智慧體方面更有效,也更有效率。我們針對一個由 GPT‑5.4 Mini 支援的 Codex 智慧體進行測試,使用一組自訂的 10 項資料外洩任務。
GPT‑Red 的最終目標,是提升模型的穩健性。過去六個月,我們投入愈來愈多的運算資源,訓練出能力逐步提升的紅隊演練模型(GPT‑Red 的前身),並自 GPT‑5.3 起將這些模型用於後續每一代正式部署模型的訓練。此後,每一代 GPT 的穩健性都持續提升。
舉例來說,GPT‑Red 的早期版本發現了一類新的直接提示注入攻擊,稱為「假思路鏈」攻擊。這些攻擊在 GPT‑5.1 上的成功率高達 95% 以上,但現在在 GPT‑5.6 Sol 上已低於 10%。同樣地,我們多個針對開發者工具和瀏覽情境攻擊的間接提示注入基準,最新模型都已達到飽和(準確率超過 97%)。
模型對 GPT‑Red 的抵禦能力也大幅提升。在一系列穩健性測試環境中,GPT‑Red 的攻擊成功率持續下降。在最新發布的 GPT‑5.6 Sol 中,GPT‑Red 的直接提示注入攻擊成功率僅為 0.05%。
隨著我們持續擴大提示注入的自我對弈訓練,我們發現了能攻破現有模型的新威脅。然而,這樣的擴展也大幅提升了模型抵禦這類攻擊的能力。攻擊成功率是以 GPT‑Red 在未參與訓練的測試環境中所有攻擊嘗試的平均成功率計算。
模型可能因拒絕更多請求或能力下降而看起來更安全。能力較弱的模型自然更難被攻擊,但那不是有用的穩健性。
我們全面評估模型的一般前沿能力,以及我們自行設計、用於測試過度拒絕的任務。我們發現,在大幅提升穩健性的同時,所有正常能力都未受影響。這表示穩健性的提升來自更能抵禦惡意指令,而不是不當使用工具,或預設拒絕合法請求。
AI 智慧體已經被用來提升我們下一代模型的能力。我們相信,透過 GPT‑Red,我們已開始為安全建立類似的飛輪,讓今天的模型協助打造更穩健、更符合對齊目標,也更值得信賴的下一代模型。我們會持續擴大運算資源與資料規模,同時改進演算法,訓練出比目前更強大的 GPT‑Red。接著,這些模型將協助未來推出的 GPT 模型變得更加安全。
我們將於本週稍晚發布內容更完整的預印本。


