摘要
問題
紅隊演練對於發現漏洞和提升模型穩健性至關重要。然而,現有方法難以擴展,形成瓶頸。
常用的穩健性評估在我們最新模型的測試下已經達到飽和。
我們需要開發可讓安全與對齊隨模型能力同步擴展的方法。
我們做了甚麼
我們訓練了 GPT‑Red,這是一個自動化紅隊演練模型,可擴展我們發現漏洞的能力,讓我們在更廣泛部署前修復漏洞。
GPT‑Red 是強大的紅隊演練者,而我們先前的模型很容易受到其提示注入攻擊影響。
我們使用 GPT‑Red 對 GPT‑5.6 進行對抗式訓練,大幅提升 GPT‑5.6 抵禦提示注入攻擊的能力。
我們會繼續擴展這種方法,並結合人類和第三方紅隊演練、分層防護措施,以及實時監控。
AI 系統經常透過瀏覽器、連接應用程式、本機檔案及其他工具接觸第三方數據。這些功能對執行現實世界任務是必要的,但同時亦為惡意行為者提供更多機會影響模型行為。例如,第三方可能在電郵、網頁、工具回應或程式碼庫中嵌入一條精心設計的指令,旨在誘騙模型把敏感資料上傳到外部伺服器。
人類紅隊演練是我們安全工作的重要一環,有助我們在部署前發現這些漏洞,並設置適當防護措施。但單靠人類紅隊演練很難擴展。設計和執行這些演練非常耗時,限制了我們識別新失敗模式並將其納入更強防護措施的速度。此外,這些演練雖能產生有價值的成功攻擊範例,卻無法生成足夠數量和多樣性的對抗性數據,以透過訓練提升模型穩健性。
要跟上能力日益提升的模型,紅隊演練也必須擴展。為此,我們一直在訓練僅限內部使用的自動化紅隊演練模型,用於在部署前發現漏洞,並在模型訓練期間生成攻擊以提升穩健性。我們相信,自動化紅隊演練為安全開啟了一種關鍵的自我改進形式:直接利用今天的模型,幫助未來模型變得更安全。
GPT‑Red 是這些努力的集大成之作,也是我們目前最佳的自動化安全紅隊演練模型。與人類紅隊演練人員設計攻擊的方式相似,該模型會透過發送提示詞、觀察 GPT 模型的回應,並反覆迭代來朝目標推進。我們以 OpenAI 部分最大型後訓練工作的運算規模來訓練 GPT‑Red,這是前所未有、純粹為提升安全而投入的運算資源。
我們把 GPT‑Red 直接納入生產模型的訓練流程。因此,GPT‑5.6 Sol 成為我們迄今最能抵禦提示注入的模型;在最困難的直接提示注入基準上,相較四個月前最佳正式部署模型,防禦失敗的次數大幅減少了六倍。隨着我們繼續訓練更強的紅隊演練者,這種方法的可擴展性讓我們期待未來取得更強成果。
GPT‑Red 以自我對弈強化學習訓練,讓模型與一組多元的防守方 LLM 同時在廣泛的紅隊演練情境中受訓。GPT‑Red 會因誘發有效失敗(例如成功的提示注入)而獲得獎勵;防守方模型則會因抵禦攻擊並完成原本任務而獲得獎勵。當防守方變得更穩健,GPT‑Red 便被迫找出更強、更多樣的攻擊。
為支援自我對弈訓練,我們建立了一套龐大而貼近現實的情境,涵蓋提示注入可能被植入的位置。每個環境都有一個威脅模型,說明 GPT‑Red 可控制甚麼,以及甚麼算是成功攻擊。例如,GPT‑Red 可能控制本機檔案的一部分、網頁橫額、電郵內文,或某個工具的輸出。
訓練完成後,GPT‑Red 成為非常強大的攻擊者:它幾乎能攻破所有與其對抗的模型,包括內部模型和生產模型,最高涵蓋 GPT‑5.5。GPT‑Red 完成訓練後,我們用它為 GPT‑5.6 的訓練生成提示注入,使該模型能高度抵禦 GPT‑Red 的攻擊。
我們將 GPT‑Red 與部署的模型分開。這樣可避免我們專門訓練到 GPT‑Red 中的惡意能力落入對抗者手中,同時也能提升正式部署模型的防禦能力。
GPT‑Red 對其訓練所涵蓋的防守方模型群體和紅隊演練情境非常有效。我們亦評估該模型能否作為通用紅隊演練智能代理,在 OpenAI 更廣泛地促進安全。為此,我們在全新的安全環境和目標模型上測試 GPT‑Red 的成效。
我們首先使用 Dziemian 等人(2025)的間接提示注入競技場(在新視窗中開啟)複製版本,評估 GPT‑Red 泛化至全新紅隊演練情境的能力。在這項挑戰中,人類紅隊演練人員和 GPT‑Red 各自針對一組預先指定的環境,獨立提出對 GPT‑5.1 的攻擊。這些紅隊演練情境和目標與用來訓練 GPT‑Red 的不同。GPT‑Red 達到顯著更高的攻擊成功率,在 84% 的情境中成功,相比之下人類為 13%。
GPT‑Red 作為自動化紅隊演練者表現出色。GPT‑Red 使用內部鏡像,在 Dziemian 等人(2025)的間接提示注入競技場中,相比人類紅隊演練人員,能在多得多的情境下生成針對 GPT‑5.1 的成功攻擊。
對紅隊演練者的終極考驗,是在對系統底層模型和任務執行框架設計了解不完整的情況下,仍能針對現實世界的智能代理式系統達成指定惡意目標。我們在此設定下的第一個實驗,是讓 GPT‑Red 對抗 OpenAI 辦公室內一部由 Andon Labs 製作、AI 驅動的自動售賣機(類似 Project Vend(在新視窗中開啟))。我們向 GPT‑Red 提供系統描述,並讓它能夠發送攻擊,以及觀察與真實部署高度相似的模擬智能代理所作出的工具呼叫。在反覆迭代攻擊後,GPT‑Red 對生產智能代理發動攻擊,達成其全部三項惡意目標:
- 把一件有現貨的昂貴商品價格改為允許的最低價 0.50 美元;
- 訂購一件 100 美元以上的新商品,並以 0.50 美元出售;以及
- 取消另一名顧客的訂單。
我們已披露這些漏洞,新的防護措施正積極測試中。
GPT‑Red 能攻破名為 Vendy、負責管理自動售賣機的實時自主智能代理。GPT‑Red 先在模擬中測試,再把攻擊轉移到實時智能代理,成功令生產智能代理把昂貴商品改為低價,並取消其他顧客的訂單。
我們亦使用 GPT‑Red,在一套 10 個保留測試的資料外洩情境中,攻擊一個 Codex CLI 智能代理(基於 GPT‑5.4 mini)。我們將該模型與使用提示詞的 GPT‑5.5 基準比較,以研究我們的訓練程序對保留測試紅隊演練表現的影響。GPT‑Red 不但更有效,能在更多情境中成功令智能代理外洩敏感資料,而且 Token 效率也更高。
GPT‑Red 在攻破實時 Codex 智能代理方面更有效率、成效更佳。我們在一套自訂的 10 項資料外洩任務中,測試由 GPT‑5.4 Mini 支援的 Codex 智能代理。
GPT‑Red 的最終目標,是提升我們模型的穩健性。過去六個月,我們投入越來越多運算資源,訓練出逐步變強的紅隊演練模型(GPT‑Red 的前身),並自 GPT‑5.3 起把這些模型用於每一代後續生產模型的訓練。此後,每一代 GPT 的穩健性都持續提升。
舉例來說,GPT‑Red 的早期版本發現了一類新的直接提示注入攻擊,稱為「偽思路鏈」攻擊。這些攻擊在 GPT‑5.1 上的成功率曾高達 95% 以上,但現在在 GPT‑5.6 Sol 上已低於 10%。同樣,我們多個針對開發者工具和瀏覽中攻擊的間接提示注入基準,在最新模型的測試下也已達到飽和(準確率超過 97%)。
模型對 GPT‑Red 的抵禦能力也大幅提升。在一系列廣泛的穩健性環境中,GPT‑Red 的攻擊成功率持續下降。在最新發佈的 GPT‑5.6 Sol中,GPT‑Red 的直接提示注入攻擊成功率僅為 0.05%。
隨着我們持續擴大提示注入的自我對弈訓練規模,我們發現了能攻破現有模型的新威脅。然而,這樣的擴展也大幅提升了模型抵禦這類攻擊的能力。攻擊成功率按 GPT‑Red 在保留測試環境中所有嘗試的平均成功率計算。
模型可以透過拒絕更多請求或降低能力,顯得更安全。做得更少的模型自然較難被攻擊,但這並非有用的穩健性。
我們全面評估一般前沿能力,以及我們設計的針對性過度拒絕任務。我們發現,在穩健性顯著提升的同時,所有正常能力都不受影響。這顯示穩健性的提升來自更能抵禦惡意指令,而不是不當使用工具,或預設拒絕合法請求。
AI 智能代理已被用來提升我們下一代模型的能力。我們相信透過 GPT‑Red,已經成功啟動了類似的「安全飛輪」效應:也就是利用今天的模型,讓明天的模型更穩健、更對齊,也更值得信任。我們會繼續擴展運算和數據規模,並改進演算法,以訓練出比現有模型更強的未來版 GPT‑Red。而這些模型也將反過來,讓未來發佈的 GPT 版本更安全。
我們將於本週稍後發佈包含更多細節的預印本。


