正在載入...
今天,我們推出 GPT‑6 Astra,這是我們歷來廣泛部署的模型中能力最強的一款。Astra 是我們首個根據防範應對架構達到「關鍵」級網絡安全能力的模型。
關於這次推出在安全方面最重要的資訊如下:
- GPT‑6 Astra 的網絡安全能力大幅提升,並已達到我們的「關鍵」門檻。這表示,只要具備適當的工具和存取權限,GPT‑6 Astra 即使沒有人逐步引導,也能在多個受到嚴密保護的系統中找出過往未知的安全漏洞,並開發新的利用方法。因此,我們大幅加強防護,避免模型因遭濫用或未有妥善對齊而作出有害的網絡行動。我們亦採取措施,保障 Astra 及同類模型的內部開發與部署安全,包括更嚴格的隔離、檢查點加密、全面監察包括思路鏈(CoT)在內的完整執行軌跡,以及供內部使用前進行阻斷式對齊評估程序。
- GPT‑6 Astra 的穩健程度遠高於前代模型。GPT‑6 Astra 採用了新的穩健安全訓練技術,抵禦越獄攻擊的能力遠勝 GPT‑5.6 Sol,長時間執行軌跡亦然。這項結論來自離線測試,以及我們嚴格的內外部越獄測試與修正計劃。對於被標記為可能屬高風險的使用者,我們亦訓練模型調整其拒絕界線,使之更審慎,並涵蓋更廣泛的雙重用途風險。我們運用迴歸測試,確保 Astra 能抵禦過往測試階段發現的越獄攻擊,並以最新的內部紅隊攻擊人員展開新一輪自動化紅隊演練,以驗證相關改進。
- GPT‑6 Astra 的對齊程度優於 GPT‑5.6 Sol。Astra 在模型對齊方面大幅進步,改進範圍涵蓋預訓練數據的組成,以至強化學習期間的評分方式。我們公佈了一套全新的對齊評估(在新視窗中開啟),結果顯示 GPT‑6 Astra 更能遵守安全與保安界線,並維持在獲授權的範圍內。在一項使用逾 54,000 項內部 Codex 任務(在新視窗中開啟)的模擬中,Astra 因較嚴重未對齊行為而被標記的次數亦約為 Sol 的一半。
- 我們正廣泛部署未對齊行為監察機制。我們視模型對齊為防止模型出現潛在未對齊行為的首要手段。然而,監察可讓我們全面掌握前沿模型的行為,從中找出進一步改善對齊與安全的機會。此外,監察亦構成額外一層防護,以應對偵測到的未對齊行為。基於這些原因,我們亦為 Astra 對外部署中所有使用工具的推理流程加入未對齊行為監察,儘管這會產生龐大的運算成本。這套系統與我們的內部配置相若。
- GPT‑6 Astra 的可監察性較 GPT‑5.6 Sol 低。我們深入研究了 GPT‑6 Astra 的可監察性(在新視窗中開啟)和可控制性(在新視窗中開啟)。我們發現,GPT‑6 Astra 比 GPT‑5.6 Sol 更能控制自身的 CoT,亦較少在 CoT 中加入可能暴露問題的資訊。在對抗情境中(即我們促使模型規避監察),模型可在評估中策略性壓低表現而不被察覺;在接獲執行某些破壞任務(在新視窗中開啟)的要求時,有時亦能避過我們的內部監察。我們未發現以隱寫方式進行 CoT 推理的證據(例如把隱藏推理藏於看似普通且不相關的文字中),顯示規避風險可能大致局限於較低階的推理任務。
- 這些發現顯示,Astra 級別模型在對抗條件下可能規避我們的 CoT 監察機制。現階段,這些發現主要來自對抗評估(即我們指示模型規避監察);而整體對齊評估顯示,Astra 違反安全與保安限制的可能性低於 GPT‑5.6 Sol。
- 然而,我們嚴正看待這項趨勢;隨着模型能力提升,我們將繼續研究這些發現及其對可監察性的影響。OpenAI 一直致力保留並運用思維鏈監察,而維持 CoT 的可監察性是這項研究計劃的核心目標。然而,這些結果亦突顯出,除了檢視模型的思路鏈外,開發其他對齊審核技術同樣重要。
- GPT‑6 Astra 能以更負責任的方式應對瀏覽及工作環境:GPT‑6 Astra 抵禦提示注入的能力遠勝 GPT‑5.6 Sol。我們亦在貼近現實的瀏覽及專業電腦環境中測試模型行為,結果發現,與 GPT‑5.6 Sol 相比,此模型作出未對齊及可能具破壞性行動的機會大幅降低,例如未經授權的交易、數據遺失、過度存取或規避控制措施。在智能代理式環境中處理有害要求時,例如協助策劃暴力襲擊或進行詐騙,它亦會採取更安全的做法。
- GPT‑6 Astra 在較高風險的情境中安全得多。面對來自實際應用及人類對抗性紅隊演練的棘手指令時,GPT‑6 Astra 的回應比 GPT‑5.6 Sol 更安全。Astra 在安全處理不安全要求及避免不必要地拒絕無害要求兩方面,均達到帕累托改進。這些改善亦涵蓋高嚴重程度的情境,即潛在危害風險是源自整體上下文,而非出自單一明確的指令。對於未滿 18 歲的使用者,Astra 亦能更一致地採用切合其年齡的安全界線。
詳情請參閱完整系統說明卡(在新視窗中開啟)。


