我們今天發布 gpt-oss-safeguard 研究預覽版。這款開放權重推理模型專為安全分類任務打造,提供 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 兩種規模。這兩款模型是我們的 gpt-oss 開放模型微調版本,同樣採用寬鬆的 Apache 2.0 授權,任何人都能自由使用、修改與部署。即日起,這兩款模型皆可從 Hugging Face(在新視窗中開啟) 下載。
gpt-oss-safeguard 模型會在推論時運用推理能力,直接解讀開發者提供的政策,並依照開發者的需求分類使用者訊息、補全內容與完整對話。採用哪項政策一律由開發者決定,因此回應會更切合開發者的使用情境。模型會產生思路鏈,開發者可加以檢視,了解模型如何做出判定。此外,政策是在推論時提供,而非透過訓練寫入模型,因此開發者能輕鬆反覆修訂政策,提升模型效能。這套方法最初由我們開發供內部使用。相較於傳統方法先以大量標註範例訓練分類器,再由分類器間接推斷決策邊界,這套方法靈活得多。
gpt-oss-safeguard 讓開發者能劃定最符合自身使用情境的政策界線。例如,電玩討論論壇可能想制定政策,對討論遊戲作弊的貼文進行分類;產品評論網站則可能想運用自己的政策,篩選疑似造假的評論。
模型會同時接收兩項輸入:一項政策,以及要依該政策分類的內容。模型接著會輸出內容所屬類別的結論及推理過程。開發者可自行決定是否要在安全流程中採用這類結論,以及採用方式。我們發現,這種以推理為基礎的方法在以下情況下表現特別出色:
- 潛在危害逐漸顯現或演變,政策需要迅速調整。
- 該領域涉及許多細微差異,小型分類器難以處理。
- 開發者沒有足夠的樣本來訓練平台上每種風險的高品質分類器。
- 延遲不如產生高品質且可解釋的標籤重要。
我們發布 gpt-oss-safeguard 預覽版,希望蒐集研究與安全社群的回饋,持續改進模型效能。過去數月,我們與 ROOST(在新視窗中開啟) 合作籌備這次開放權重版本,確認開發者的關鍵需求、測試模型,並編寫開發者文件。配合此次發布,ROOST 也將在今天成立模型社群(在新視窗中開啟),探索如何運用開放 AI 模型保護線上空間。我們也隨此次發布推出一份簡短的技術報告,詳述這款預覽版模型的安全效能。
在安全方面,我們相信縱深防禦。我們訓練模型做出安全回應,也實施額外的多層保護措施,根據政策偵測並處理可能不安全的輸入與輸出。安全分類器可在特定風險領域區分安全與不安全內容,長久以來一直是保護我們自家及其他大型語言模型的主要防線。
傳統安全分類器(例如透過我們的 Moderation API(在新視窗中開啟) 提供的分類器)是根據預先定義的安全政策,手動整理數千個安全與不安全內容範例而開發出來。分類器會從這些訓練資料中學會區分安全與不安全的輸出。採用這種傳統方法時,分類器實際上完全不會接觸到安全政策。分類器會找出標為不安全的內容有哪些相似之處,以及安全與不安全內容之間有哪些差異,藉此嘗試推斷當初用來標註範例的政策。
傳統分類器效能高,延遲低,營運成本也低。但是,收集足夠數量的訓練樣本可能既耗時又昂貴,而且更新或改變政策也需要重新訓練分類器。
gpt-oss-safeguard 的不同之處在於,推理能力讓開發者可以套用任何政策,包括自行編寫或取自其他來源的政策;推理也有助於模型將能力泛化至新編寫的政策。除了安全政策,gpt-oss-safeguard 也能按照特定產品與平台重視的其他面向標註內容。
我們的主要推理模型如今會直接學習安全政策,運用推理能力判斷哪些內容安全。這種方法稱為 審議式對齊,大幅改進了早期的安全訓練方法。即使模型能力不斷提升,我們的推理模型在多個面向仍比不具推理能力的前代模型更安全。然而,推理不僅有助於訓練模型,也為縱深防禦開創了新的可能。以推理為基礎的方法更靈活,也較不受先前訓練細節所限;在某些情況下,這類優勢遠超過額外運算成本與延遲帶來的負擔。
gpt-oss-safeguard 是我們內部所開發方法的開放權重實作版本;我們將內部採用這套方法的工具稱為 Safety Reasoner。我們一開始針對政策標註任務進行強化微調,並在模型做出與人類專家一致的正確判斷時給予獎勵。模型因此學會推理政策如何導出判斷。如今,Safety Reasoner 讓我們能在生產環境中動態更新安全政策,所需時間遠比重新訓練分類器短。這使 Safety Reasoner 成為迭代部署的關鍵工具。將新模型部署至生產環境時,我們通常會先採用較嚴格的政策,並視需要投入較多運算資源,讓 Safety Reasoner 能審慎套用相關政策。接著,隨著我們更加了解生產環境中的風險,再調整政策。近期幾次發布中,用於安全推理的運算量最高占總運算量的 16%。
Safety Reasoner 已成為我們安全防護架構的核心元件。在圖像生成和 Sora 2 中,Safety Reasoner 會逐步動態評估輸出,即時辨識並阻擋不安全的生成結果。在生物學與自殘等領域,我們會採用類似 Moderation API 所使用的模型,作為小型、快速且召回率高的分類器,判斷內容是否屬於關注的領域,再交由 Safety Reasoner 審查。Safety Reasoner 會依照詳細分類法對模型輸出進行分類,判斷最佳回應方式,是 GPT‑5 和 ChatGPT 智慧體等系統多層安全防護機制的一環。如今,gpt-oss-safeguard 模型讓所有人都能採用相同方法。
我們使用內部與外部評估集,評估了 gpt-oss-safeguard 模型。
在內部評估中,我們在推論時同時向 gpt-oss-safeguard 提供多項政策。針對每項測試輸入,我們會評估 gpt-oss-safeguard 是否依照所有指定政策正確分類文字。這項任務相當具挑戰性:模型必須與所有指定政策對應的黃金標準標籤完全相符,才會計為正確。
我們的 gpt-oss-safeguard 模型與內部 Safety Reasoner,在多政策準確率方面的表現優於 gpt-5-thinking 和 gpt-oss 開放模型。考量到 gpt-oss-safeguard 模型規模較小,表現卻優於 gpt-5-thinking,尤其令人驚訝。
我們也使用兩個資料集進一步評估這些模型:一是隨2022 年研究論文(在新視窗中開啟)發布的內容審核資料集(在新視窗中開啟),二是 ToxicChat(在新視窗中開啟)。ToxicChat 是以使用者向開放原始碼對話機器人提出的查詢為基礎所建立的公開基準。
我們採用內部安全政策,在 2022 年內容審核評估集上進行評估(其中一項政策經過調整,反映後續變更)。gpt-oss-safeguard 的表現略優於所有其他受測模型,包括內部 Safety Reasoner 和 gpt-5-thinking。不過,Safety Reasoner 與 gpt-oss-safeguard 之間的差異在統計上並不顯著。
評估 ToxicChat 時,我們使用一段根據部分內部政策改編、由人工撰寫的簡短提示詞。內部 Safety Reasoner 的表現再次優於 gpt-5-thinking,而 gpt-5-thinking 與 Safety Reasoner 的表現也都略優於 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b。我們預期 gpt-oss-safeguard 的規模相對較小,因此對這類任務而言仍是較理想的選擇。
gpt-oss-safeguard 有兩項特定限制。首先,我們觀察到,以數萬個高品質標註樣本訓練的分類器,在內容分類方面仍可能優於直接根據政策推理的 gpt-oss-safeguard。若要在更複雜的風險上達到更高效能,花時間訓練專用分類器可能是較理想的做法。
其次,gpt-oss-safeguard 相當耗時且耗費運算資源,因此難以大規模套用至平台的所有內容。在內部,我們運用 Safety Reasoner,以幾種方式因應這項問題:(1) 使用規模較小、速度較快的分類器,判斷要評估哪些內容;(2) 在某些情況下,以非同步方式使用 Safety Reasoner,提供低延遲的使用者體驗,同時保留在偵測到不安全內容時介入的能力。
gpt-oss-safeguard 是 OpenAI 與社群共同打造的首套開放安全模型。在早期測試階段,我們與 SafetyKit、ROOST、Tomoro 和 Discord 的信任與安全專家共同改良 gpt-oss-safeguard。Vinay Rao,ROOST 技術長表示:「gpt-oss-safeguard 是第一款採用『自行提供政策與傷害定義』設計的開放原始碼推理模型。組織理應能自由研究、修改及使用關鍵安全技術,並且有能力創新。在我們的測試中,gpt-oss-safeguard 能熟練理解不同政策、說明推理過程,並在套用政策時掌握細微差異。我們相信,這些能力將有助於開發者與安全團隊。」
我們將繼續與社群共同改良開放安全工具,包括透過 ROOST 模型社群(RMC)推動相關工作。RMC 匯集安全實務工作者與研究人員,分享將開放原始碼 AI 模型導入安全工作流程的最佳做法,包括評估結果與模型回饋。如要深入了解這項合作關係與參與方式,請前往 RMC GitHub 儲存庫(在新視窗中開啟)。
若要開始使用這些模型進行開發,請從 Hugging Face(在新視窗中開啟) 下載模型。

