跳至主要內容
OpenAI

2026年9月3日

安全

安全概覽:GPT‑6 Astra

載入中…

今天,我們推出 GPT‑6 Astra,這是我們歷來廣泛部署的模型中能力最強的一款。Astra 是我們首個依據應變整備框架達到網路安全能力「關鍵」等級的模型。

關於本次發布的安全性,最重要的幾點如下:

  1. GPT‑6 Astra 的網路能力大幅提升,並達到我們的「關鍵」門檻。這表示,只要具備適當的工具與存取權限,GPT‑6 Astra 無須人員逐步引導,就能在許多防護嚴密的系統中找出過去未知的安全漏洞,並開發新的利用方式。因此,我們大幅強化防護措施,以防模型因遭到濫用或未對齊而採取有害的網路行動。我們也採取措施,確保 Astra 及類似模型的內部開發與部署安全,包括更嚴格的隔離、檢查點加密、全面監控包含思路鏈(CoT)在內的完整軌跡,以及在內部使用前執行具阻擋效力的對齊評估程序。
  2. GPT‑6 Astra 的穩健性顯著優於先前的模型。GPT‑6 Astra 採用新的穩健性安全訓練技術,在抵禦越獄方面顯著優於 GPT‑5.6 Sol,長軌跡情境亦然。這項結論來自離線測試,以及我們嚴謹的內外部越獄測試與修正計畫。對於被標示為可能具有高風險的使用者,我們還訓練模型調整拒絕界線的能力,使其更加保守,並涵蓋更廣泛的雙重用途風險。我們透過迴歸測試,確保 Astra 能抵禦先前測試期間發現的越獄手法,並使用最新的內部紅隊攻擊模型進行新一輪自動化紅隊演練,以驗證改進成效。
  3. GPT‑6 Astra 的對齊程度優於 GPT‑5.6 Sol。Astra 在模型對齊方面有重大進展,相關改進涵蓋預訓練資料的組成,以及強化學習期間的評分方式。我們公布了一套新的對齊評估(在新視窗中開啟);結果顯示,GPT‑6 Astra 更能遵守安全與資安界線,並將行動維持在獲授權的範圍內。在一項使用超過 54,000 項內部 Codex 任務(在新視窗中開啟)的模擬中,Astra 因較嚴重未對齊行為而收到的標記數也約為 Sol 的一半。
  4. 我們正廣泛部署未對齊監控。我們認為,模型對齊是防止模型出現潛在未對齊行為的主要手段。然而,監控能讓我們全面掌握前沿模型的行為,從中找出進一步改善對齊與安全性的機會。此外,監控也能針對偵測到的未對齊行為,提供額外一層防護。基於這些原因,我們也為 Astra 對外部署所涉及的所有工具型推論加入未對齊監控,儘管這會帶來高昂的運算成本。這套系統與我們的內部配置相似。
  5. GPT‑6 Astra 的可監控性低於 GPT‑5.6 Sol。我們已深入研究 GPT‑6 Astra 的可監控性(在新視窗中開啟)可控制性(在新視窗中開啟)。我們發現,GPT‑6 Astra 比 GPT‑5.6 Sol 更能控制自身的思路鏈,也較少在思路鏈中留下會暴露不當行為的資訊。在對抗性情境中(也就是我們促使模型規避監控時),我們發現模型在評估中刻意表現不佳(sandbagging)時,能不被偵測;當模型受要求執行特定破壞任務(在新視窗中開啟)時,有時也能避開我們的內部監控。我們尚未發現隱寫式思路鏈推理的證據(例如將隱藏推理藏於看似普通且無關的文字中),顯示規避風險可能大致侷限於推理需求較低的任務。
    • 這些發現顯示,在對抗性條件下,Astra 類模型可能規避我們的思路鏈監控。目前,這些發現主要來自對抗性評估(也就是我們指示模型規避監控時);整體而言,我們的對齊評估顯示,Astra 違反資安與安全限制的可能性低於 GPT‑5.6 Sol。
    • 然而,我們嚴肅看待這項趨勢;隨著模型能力提升,我們會繼續研究這些發現及其對可監控性的影響。OpenAI 一直致力於保留並運用思路鏈監控,而維持思路鏈的可監控性是這項研究計畫的核心目標。不過,這些結果也突顯出開發其他對齊稽核技術的重要性,而不能只檢視模型的思路鏈。
  6. GPT‑6 Astra 能以更負責任的方式處理瀏覽與工作場所情境:GPT‑6 Astra 抵禦提示注入的能力顯著優於 GPT‑5.6 Sol。我們也在逼真的瀏覽與專業電腦環境中測試模型行為,結果發現,相較於 GPT‑5.6 Sol,該模型採取未對齊且可能具破壞性行動的可能性顯著降低,例如未經授權的交易、資料遺失、過度存取或規避控制措施。在智慧體式情境中處理有害要求時,它的行動也更安全,例如協助規劃暴力攻擊或實施詐欺的要求。
  7. GPT‑6 Astra 在較高風險的情境中顯著更安全。面對取自實際產品環境及對抗性人類紅隊演練的高難度要求時,GPT‑6 Astra 的回應比 GPT‑5.6 Sol 更安全。Astra 在安全處理不安全要求、同時避免不必要地拒絕無害要求方面,實現了帕累托改進。這些改進也涵蓋高嚴重性情境;在這類情境中,傷害風險源自更廣泛的脈絡,而非明確提出的要求。對於未滿 18 歲的使用者,Astra 也能更一致地套用符合其年齡的安全界線。

如需更多資訊,請參閱完整系統說明卡(在新視窗中開啟)