跳到主要內容
OpenAI

2026年8月18日

公司發佈

在具關鍵網絡能力的時代調整模型開發步伐

正在載入...

過去數週,兩項發展凸顯了能力日益強大的人工智能系統所帶來、不斷增加的風險:OpenAI-Hugging Face 事件;此外,初步證據顯示,我們即將推出的其中一款模型 Astra,可能已達到 關鍵網絡安全能力的門檻,符合我們 防範應對架構的相關界定。這些發展,加上內部研究進展迅速,令我們更迫切需要在整個訓練流程的各個階段,加強監察、對齊及遏制方面的防護措施。

隨着模型能力增強,在內部開發和測試模型的相關風險亦會上升。我們的監察、對齊及系統防護標準必須走在這些風險之前。我們希望投放所需時間以達到這些標準,因此暫時放慢了擴展規模的步伐。其中包括暫停為期兩週、針對擬部署最新模型的強化學習(RL)訓練,以便進一步加固研究環境並進行紅隊測試,同時擴大監察系統的涵蓋範圍。我們原定進行的最大規模前沿強化學習訓練仍然暫停;在繼續之前,我們正進行較小規模的訓練和評估,以評估模型行為、驗證防護措施,並取得更多對齊證據。

對齊是指讓人工智能系統按預期運作並接受人類監督的工作,長久以來一直是我們研究計劃的核心。在現有研究和評估的基礎上,我們現要求在整個訓練過程中提供更有力的行為對齊證據。讓能力日益強大的系統保持對齊,是整個領域都必須應對的挑戰。即將推出的模型所展現的進展訊號清楚表明,我們需要採取更廣泛的方法,在現有防範應對架構的基礎上進一步拓展。

我們認為,公開透明地交代做法如何改變十分重要。下文將說明我們已對研究流程和基礎設施作出的改變,以及仍在進行的工作。

加強能力更強模型的防護措施

我們開發能力更強模型的方法建基於三項相輔相成的防護措施:

  1. 監察:偵測令人憂慮的行為,讓我們能夠作出應對。
  2. 對齊:降低作出有害或未經授權行動的可能性。
  3. 系統防護措施:限制人工智能系統可存取或影響的範圍。

我們預計,模型很快便會承擔大部分系統防護工作,包括防禦其他模型。這將讓三項防護措施都能隨模型能力擴展,而我們認為這一點至關重要。

我們在研究和部署階段全面採用這些防護措施,並因應每個模型的能力、運作環境及風險水平作出調整。

保障研究環境

隨着前沿模型具備更強的網絡安全能力,我們正提高其訓練和評估環境的系統防護標準。為達到這些標準,我們需要進行大量工程工作,亦令前沿研究付出高昂成本並出現延誤。OpenAI-Hugging Face 事件*發生後,我們立即暫停研究叢集中的前沿模型推論,涉及可執行程式碼或使用能連接互聯網工具的工作均告暫停。我們相當迅速地恢復了一條限制較多但更安全的程式碼執行途徑,隨後逐一審視各項工作負載,以確定能否安全恢復。部分研究工作負載已在這些新管控措施下恢復,另一些則需要進一步調整。

在隨後數週,我們制定並開始實施更嚴格的前沿研究工作負載防護要求。例如:

  • 工作負載隔離:現時,凡工作負載會執行模型產生或其他不受信任的程式碼,我們均要求採用更嚴格的隔離措施(「沙盒」)。這亦適用於處理模型輸出時可能受入侵的軟件。
  • 網絡隔離:我們已實施更多管控措施,將風險較高和不受信任的工作負載與互聯網隔離。這些管控措施經過專門設計,即使單一工作負載或支援服務受入侵,亦不會單憑這一點便可未經授權存取互聯網或其他內部網絡。
  • 持續系統防護測試:我們已重新配置環境,移除可能存在漏洞的共用服務、減少常設權限,並改善系統防護及信任邊界。我們亦正提升收集及監察系統防護記錄的能力。最後,我們正投資於利用自身模型推動自動化,透過模擬攻擊持續測試這些邊界。

這些管控措施共同構成縱深防禦,有助保障研究環境免受攻擊。目前,涉及 Astra 或網絡模型的工作負載必須採用最嚴格的系統防護措施,因為我們已確定 Astra 模型可能具備關鍵級別的網絡能力。這些防護措施亦適用於所有其他網絡相關工作負載。

雖然部分 Astra 訓練和評估已符合這些要求,但大量工作負載仍然暫停,直至完成全面遷移和強化,達到新的系統防護標準。我們會優先把安全和對齊工作負載遷移至這些新環境。

擴展思路鏈監察

監察長久以來一直是模型開發流程的重要一環,包括監察內部編碼智能代理長時間執行的工作階段。我們的監察工作尤其集中於前沿模型的內部部署及前沿強化學習訓練,因為這些工作負載可結合先進模型能力,以及對工具、敏感系統和內外網絡的存取權限,所以被視為風險最高。這些監察措施並未套用於所有使用工具的推論和訓練工作。我們已透過新的監察配置修訂並擴展相關做法。

這套新的監察配置分為多個階段:首先由啟動分類器(檢查模型內部活動的偵測器)檢查每個抽樣 Token,再把潛在問題逐級交由更精密、運算量更高的自動調查系統處理。這些系統會檢查工具操作、可取得的推理內容及完整活動序列,以識別未經授權的存取、資料盜竊、破壞行為及規避防護措施的企圖。我們的目標是在監察系統發現可疑活動後 30 分鐘內發出警報。如監察系統識別到可能違反關鍵系統防護邊界的情況,便會發出最高優先級警報。在目前的實施方式下,安全、系統防護及研究團隊都會收到緊急通知。如這些團隊未能在 30 分鐘內明確判定標記屬於誤報,便須暫停相關活動。

所有涉及工具、能力達 Sol 或以上模型的強化學習訓練和評估,均必須接受這項監察。我們在 8 月 7 日確定 Astra 可能具備關鍵網絡能力後,新增了一項監察要求,涵蓋所有使用工具的 Astra 推論,而不僅是強化學習訓練和評估。

這些防護措施需要投入可觀的運算資源。目前估計,監察開銷約相當於受監察推論運算量的 20%,但不同訓練和評估工作負載的成本差異甚大。我們將於即將發表的網誌文章中分享這套系統的更多詳情。

推進對齊研究

對齊研究是我們使命的核心。我們的使命是確保通用人工智能造福全人類。隨着模型獲得網絡攻擊能力等先進能力,並在更複雜的環境中運作,獎勵取巧(未有真正達到預期成果,卻在訓練中設法取得高獎勵)、欺騙或未經授權存取等未對齊行為,將帶來愈來愈嚴重的風險。

對於能力最強模型的強化學習訓練,我們現正把核心對齊技術應用到訓練流程的更多階段。這包括改良獎勵模型,以更有效偵測並遏止不同任務和環境中的不安全行為;訓練模型更如實地交代其行動、能力及限制;以及減少利用獎勵、評分器、工具或監督機制弱點的行為。對於模型與外部系統或資源互動時可能造成傷害的行為,我們亦正擴大訓練涵蓋範圍。

我們會繼續大力投資對齊研究、擴大評估涵蓋範圍,並運用所得成果指導訓練和防護措施。我們計劃在不久將來分享更多對齊研究成果,包括對模型行為的認識,以及所發現的任何新挑戰。

未來方向

我們將完善防範應對架構,把這些防護措施貫通訓練和部署階段,並更準確反映未來模型的能力及其運作環境。要開發可隨這些能力擴展的方法,必須持續投資由模型輔助的系統防護、更有效的監察,以及不斷推進對齊研究。隨着我們的方法持續發展,我們計劃邀請外部機構參與,並分享更多研究所得。

前沿模型的能力正迅速提升。我們理解、對齊和保障這些模型的能力必須走在前面。


*我們將於未來數週發表技術報告,闡述所得經驗。

作者

OpenAI