過去幾週的兩項進展,凸顯了能力日益強大的 AI 系統所帶來的風險:一是 OpenAI-Hugging Face 事件;二是初步證據顯示,我們即將推出的模型之一 Astra,可能已達到 關鍵級別網路安全能力的門檻,符合我們 應變整備框架中的定義。這些進展,加上內部研究的迅速推進,使我們更迫切需要在訓練流程的各個階段強化監控、對齊與圍堵防護措施。
隨著模型能力增強,在內部開發及測試這些模型的相關風險也隨之上升。我們的監控、對齊與安全標準必須走在這些風險之前。為了投入必要時間以達到這些標準,我們暫時放緩了擴展速度。其中包括暫停對預定部署的最新模型進行強化學習(RL)訓練兩週;在此期間,我們進一步強化研究環境、進行紅隊測試,並擴大監控系統的涵蓋範圍。我們原訂規模最大的前沿強化學習訓練仍處於暫停狀態;在繼續之前,我們正透過較小規模的訓練與評估,檢視模型行為、驗證防護措施,並取得更多對齊證據。
對齊,也就是讓 AI 系統依照預期行事並接受人類監督的工作,長期以來一直是我們研究計畫的核心。在既有研究與評估的基礎上,我們現在要求在整個訓練過程中提供更有力的行為對齊證據。如何讓能力日益強大的系統持續保持對齊,是整個領域都必須因應的挑戰。即將推出的模型所展現的進展訊號清楚表明,我們需要採取更全面的方法,不僅延續現行的應變整備框架,更要超越其範疇。
我們認為,公開說明做法如何改變至關重要。以下將說明我們已對研究流程與基礎設施做出的調整,以及仍在進行中的工作。
我們開發高能力模型的方法以三項相輔相成的防護措施為基礎:
- 監控:偵測令人擔憂的行為,讓我們能夠採取因應措施。
- 對齊:降低有害或未經授權行動發生的可能性。
- 安全措施:限制 AI 系統可以存取或影響的範圍。
我們預期模型很快就會承擔大部分安全工作,包括防禦其他模型。如此一來,三項防護措施都能隨模型能力擴展;我們認為這點至關重要。
我們將這些防護措施用於研究與部署的各個環節,並依每個模型的能力、運作環境及風險程度加以調整。
隨著前沿模型具備更強的網路安全能力,我們正提高其訓練與評估環境的安全標準。為達到這些標準,我們投入了大量工程資源,也為前沿研究付出高昂成本並承受進度延誤。OpenAI-Hugging Face 事件*發生後,我們立即暫停了研究叢集中可執行程式碼或使用能存取網際網路工具的前沿模型推論工作。我們很快恢復了功能較受限但更安全的程式碼執行途徑,之後再逐一檢視各項工作負載,判斷能否安全恢復。部分研究工作負載已在這些新管控措施下恢復,其他則仍需進一步調整。
在隨後幾週內,我們制定了更嚴格的前沿研究工作負載安全要求,並已開始實施。例如:
- 工作負載隔離:對於執行模型產生或其他不受信任程式碼的工作負載,我們現在要求採取更嚴格的隔離措施(「沙箱」)。這項要求也適用於處理模型輸出時可能遭入侵的軟體。
- 網路隔離:我們已實施更多管控措施,將較高風險及不受信任的工作負載與網際網路隔離。這些管控措施經過特別設計,即使單一工作負載或支援服務遭到入侵,僅憑該事件本身也無法未經授權存取網際網路或其他內部網路。
- 持續安全測試:我們已重新設定環境,移除可能有漏洞的共用服務、減少常駐權限,並改善安全與信任邊界。我們也在提升收集及監控安全記錄的能力。最後,我們正投入自動化技術,運用自家模型透過模擬攻擊持續測試這些邊界。
這些管控措施共同形成縱深防禦,有助於保護我們的研究環境免受攻擊。目前,涉及 Astra 或網路模型的工作負載必須採用最嚴格的安全防護,因為我們已判定 Astra 模型可能具備關鍵級別的網路能力。這些防護措施也適用於所有其他網路相關工作負載。
部分 Astra 訓練與評估已符合這些要求,但仍有大量工作負載維持暫停,直到完成遷移及強化並達到新的安全標準為止。我們會優先將安全與對齊工作負載遷移至這些新環境。
監控長期以來一直是模型開發流程的重要一環,包括監控內部程式設計智慧體與長時間執行的工作階段。我們的監控工作尤其著重於內部部署的前沿模型與前沿強化學習訓練,因為這些工作負載可能同時具備先進模型能力,並能存取工具、敏感系統及內外部網路,因此被視為風險最高。這些監控並未套用至所有使用工具的推論與訓練作業。我們已透過新的監控架構修訂並擴大這套做法。
這套新監控架構採多階段設計:首先由啟用狀態分類器(檢查模型內部活動的偵測器)檢查每個抽樣的 Token,再將潛在問題逐級交由更精密、使用更多運算資源的自動調查系統處理。這些系統會檢查工具操作、可取得的推理內容及完整活動序列,以偵測未經授權的存取、資料竊取、破壞性行為,以及規避防護措施的企圖。我們的目標是在監控系統發現可疑活動後 30 分鐘內發出警示。如果監控系統發現可能違反關鍵安全邊界的情況,就會發出最高優先級警示。在目前的實作中,安全、防護及研究團隊都會收到呼叫通知。如果這些團隊無法在 30 分鐘內明確判定該標記為誤判,就必須暫停相關活動。
凡涉及 Sol 能力或更高等級模型、且會使用工具的強化學習訓練與評估,都必須採用這項監控措施。8 月 7 日判定 Astra 可能具備關鍵級別的網路能力後,我們新增了一項監控要求,適用於所有使用工具的 Astra 推論,而不只限於強化學習訓練與評估。
這些防護措施需要可觀的運算資源。目前估計,監控額外耗用的資源約為受監控推論運算量的 20%,但不同訓練與評估工作負載之間的成本差異很大。我們將在即將發布的部落格文章中進一步介紹這套系統。
對齊研究是我們使命的核心。我們的使命是確保通用人工智慧造福全人類。隨著模型具備發動網路攻擊等先進能力,並在更複雜的環境中運作,獎勵取巧(在未真正達成預期成果的情況下,設法在訓練中取得高獎勵)、欺騙或未經授權存取等未對齊行為,將帶來日益嚴重的風險。
針對能力最強模型的強化學習訓練,我們現在會在訓練流程的更多階段套用核心對齊技術。這包括改善獎勵模型,使其能在各類任務與環境中更有效地偵測並遏止不安全行為;訓練模型更誠實地說明自身的行動、能力與限制;以及減少利用獎勵、評分器、工具或監督機制弱點的行為。我們也在擴大相關行為的訓練涵蓋範圍,以因應模型與外部系統或資源互動時可能造成的危害。
我們將持續積極投入對齊研究、擴大評估範圍,並運用研究成果改進訓練與防護措施。我們計畫在近期分享更多對齊研究成果,包括對模型行為的最新發現,以及所發現的任何新型挑戰。
我們將持續發展應變整備框架,把這些防護措施整合至訓練與部署的各個環節,並更準確地反映未來模型的能力及其運作環境。若要發展能隨這些能力一同擴展的方法,就必須持續投資模型輔助安全技術、提高監控效能,並不斷推進對齊研究。隨著這套做法持續發展,我們計畫邀請外部組織參與,並分享更多研究心得。
前沿模型的能力正快速提升。我們理解、對齊並保護這些模型的能力,必須走在其發展之前。
*我們將在未來幾週內發布技術報告,說明從中獲得的經驗與發現。

