邁向前沿 AI 訓練的安全論證
我們相信,我們正踏入一個新時代:任何前沿強化學習訓練作業在繼續進行前,都應備有結構化的安全文件。理想情況下,這類文件應達到「安全論證」的標準,即其他對安全要求極高的行業所採用、全面而有系統且以證據為本的風險論證。我們視安全論證為努力實現的長遠目標,同時亦明白,要讓 AI 模型的安全論證達到航空或核能領域的嚴謹程度並不容易,因為 AI 能力每提升一個層次,都會湧現新的複雜性。我們正制定一套框架,將這些實務轉化為明確規範。
以下是一些初步指引,我們認為應將其納入前沿 AI 訓練的安全論證。這些最佳實務反映了我們目前累積的經驗。我們會持續完善內部流程,審慎推進開發,並預期這些實務亦會隨之演進。我們現在分享這些實務,是為了公開目前的想法,並邀請社群提出意見。請注意,本文件聚焦於前沿強化學習訓練;內部及外部部署則需要考慮範圍廣泛得多的對齊特性。
安全論證應涵蓋技術架構的三個層面:對齊訓練、隔離及監察。這些防護措施有助確保模型不會試圖採取偏離對齊目標的行動;即使模型嘗試這樣做,也難以突破隔離,而且監察系統能在造成危害前偵測到相關行為。
模型對齊:第一道防線應是訓練模型,使其達到對齊,也就是可靠地按照我們的意圖行事。這可包括:
訓練環境及評分:避免在訓練期間正向強化鑽獎勵機制漏洞的行為,從而降低模型形成對齊偏差行為的風險。這可包括:
自動化數據集審查:利用智能代理找出並修復有缺陷的強化學習環境;這些環境可能讓偏離對齊目標的行動軌跡藉着利用漏洞、而非預期行為獲得高獎勵。這有助減少訓練過程強化對齊偏差的機會。
人工數據集審查:在自動化紅隊演練以外,輔以人工審查及數據集質素檢查,找出可能無意間強化對齊偏差行為的缺陷任務。
評分器調校:調校評分器,懲罰模型在訓練期間嘗試利用或攻破強化學習環境漏洞的行為。
過往訓練作業分析:使用分類器分析過往實驗的執行軌跡,確保評分器按預期運作。
對齊成效量度:進行評估,追蹤模型的對齊偏差傾向,以量度對齊訓練的成效。這可包括:
離線對齊評估:在前沿模型訓練作業期間進行對齊評估,以判斷訓練是否達到預期效果,並調查任何明顯退步。
回溯測試:利用過往事故對對齊評估進行回溯測試,確認評估能偵測出曾出現對齊偏差的模型,且沒有對特定事故過度擬合。
追蹤評估投機行為:追蹤可能導致行為改變的評估意識或測試情境投機行為(模型意識到自己正在接受測試),例如在對齊評估中啟用評估意識及測試情境投機行為監察器,並設定明確的攔截門檻。
最壞情況壓力測試:誘發最壞情況下的不當行為,並確認至少有一項評估能偵測到這種行為。
避免以思路鏈作訓練依據:在強化學習中,不要讓自動評分器看到思路鏈,以防模型逐漸學會規避思路鏈監察器。
隔離: 沙盒及保安措施應足夠強健,確保即使模型出現對齊偏差,也能阻止有害行動。這可包括:
多層基礎設施保安:投入大量資源,加固模型運行所在的沙盒,以及承載沙盒的研究基礎設施,確保在發生沙盒逃逸時仍有額外一層防護。
隔離機制紅隊演練:在安全分析的約束下,使用前沿訓練作業的模型檢查點,對沙盒、研究基礎設施及邊界保安系統反覆進行紅隊演練,找出並堵塞漏洞,以改善這些系統。亦應對模型在訓練期間可能接觸到的所有服務(例如互聯網快取)進行紅隊演練。
跨樣本通訊:將高頻寬的跨樣本通訊限制在獲批准的途徑內,例如多智能代理工具,並封堵基礎設施中頻寬高且容易被智能代理發現的側通道。
不可竄改的互動紀錄:就所有強化學習訓練、評估及內部部署,以不可竄改的方式保存智能代理互動紀錄一段合理時間(例如存於只能寫入一次的儲存帳戶),以支援可靠的事故調查,並防止意外修改。
監察:設立即時監察系統,在模型開始採取偏離對齊目標的行動時,偵測任何潛在對齊偏差,並在嚴重事故發生前迅速處理優先事項。這可包括:
確保可監察性:透過設有明確門檻的可監察性及規避監察評估,確保模型一直能被有效監察,以及早偵測令人關注的行為。
對已知問題維持高召回率:使用預留測試資料進行評估,確保監察系統對過往事故有高召回率。
持續更新監察器評估:為新的訓練作業建立能反映全新風險的評估數據點,避免監察器的召回率及精確率指標過時。
快速應變:設立優先警報機制,透過緊急通知當值人員或自動暫停受影響的訓練作業,確保在服務水平協議(SLA)訂明的時限內、模型造成危害之前採取行動(例如日間發生事故時緊急通知保安當值人員及訓練作業負責人;夜間若警報未獲確認,則自動暫停訓練作業)。
除了提出技術防護措施的建議,我們亦一直在制定最佳運作實務,用於前沿 AI 訓練作業的安全論證。這些實務可包括:
異議意見(事前失敗分析):安全論證草擬完成後,應由另一團隊的成員撰寫異議意見,找出論證中可能存在的漏洞,並提出經審慎衡量的風險看法。訓練團隊隨後應作出回應,以完善安全論證。
審批:安全論證應由多名高層主管審閱,每人均應有權否決該次訓練作業,以確保有多重內部把關機制(例如由研究部門主管/副總裁、安全主管及首席科學家審閱)。
問責:負責訓練作業的高層主管(例如研究部門主管/研究副總裁)應對安全論證及任何事故應變工作負責,並將其納入績效評核等機制,讓訓練團隊亦有動力推動安全及對齊工作。
暫停機制:若發現會令安全論證失效的問題(例如新的保安漏洞),應確保已有操作手冊、技術控制措施及服務水平協議(SLA),以暫停論證涵蓋的所有訓練作業。
內部透明度:應向內部監督組織(例如安全及系統防護委員會)提供安全論證。
審核:應給予審核人員足夠的存取權限,讓他們核實安全論證中的主張是否有效、可靠,並在發現不足時提出。
升級通報:應設立清晰流程,以升級通報對齊偏差問題,並備有明確界定對齊偏差嚴重程度的分級表,以及專責對齊偏差的當值人員。當訓練作業的問題達到特定嚴重程度時,當值人員可緊急通知管理層(例如行政總裁)。
技術控制措施:應讓人員及智能代理難以啟動不合規的訓練作業。監察及自動暫停等安全功能應採用故障時封鎖操作的設計(例如,未啟用適當監察時,應無法啟動訓練作業;亦應無法從強化學習訓練、評估或內部部署環境中停用監察器)。
回復能力:應能輕易識別出現對齊偏差的模型在訓練流程中的所有下游用途(例如產生數據或評分),以便在有需要時消除偏離對齊目標的輸出所造成的影響。
剩餘風險的完整性:安全論證應盡可能全面列出目前已實施的緩解措施未能涵蓋的剩餘風險,以便在充分知情的情況下決定是否接受風險。
以上是我們目前的建議,OpenAI 正逐步落實。我們預期,這些實務會在未來數星期持續演進。
我們亦一直在制定調查嚴重 AI 對齊偏差事故的最佳實務。實驗室應盡可能從個別事故中汲取經驗(類似其他高風險行業的調查實務(在新視窗中開啟)),以防止同類事故再次發生。相關行動可包括:
內部透明度: 由於調查可能需時甚久,事故調查應定期向內部匯報進展(例如就進行中的調查每日提供最新情況)。應為員工設立明確途徑,讓他們在安全且與工作相關的情況下,取得更多存取權限,包括查閱原始互動紀錄,以及從出現對齊偏差的模型取樣。
對齊偏差的根源:研究人員應深入分析訓練過程中的動態變化,找出根本原因(例如透過針對性的消融實驗或重新取樣實驗),了解偏離對齊目標的行為如何產生,從而加深對對齊偏差的科學理解,並更有效地預防。
事後檢討:應從運作及文化層面進行事後檢討,了解所有促成事故的原因,例如問題為何出現,以及為何在事故發生前未被偵測或升級通報。
偵測:我們應開發能發現導致事故傾向的對齊測試方法,而非直接利用事故衍生的資訊(例如互動紀錄或事故摘要)反覆調校測試方法。應根據事故設計評估,作為「回歸測試」,確保未來模型在高度相似的事故情境中不會呈現對齊偏差傾向。
公開披露:調查結束後,應向公眾公開調查結果、事後檢討及運作上的改動。應盡快通知受影響的第三方。


