邁向前沿 AI 訓練的安全論證
我們認為,我們正邁入一個新時代:在繼續任何前沿強化學習訓練作業之前,都應要求備妥結構化的安全文件。理想上,這類文件應達到「安全論證」的水準,也就是其他安全關鍵產業採用的全面、結構化且以證據為基礎的風險論證。我們將安全論證視為努力邁向的理想目標,同時也明白,AI 能力每提升一個層級,都會湧現新的複雜性,因此要讓 AI 模型的安全論證達到航空或核能領域同等的嚴謹程度,仍面臨挑戰。我們正在制定一套框架,將這些實務納入明確規範。
以下是一些初步指引,我們認為它們應納入前沿 AI 訓練的安全論證。這些最佳實務反映了我們目前累積的經驗;隨著我們持續改善內部流程,以審慎推進開發,這些實務也將繼續演進。我們現在分享這些實務,是為了公開目前的思考方向,並邀請社群提供回饋。請注意,本文件聚焦於前沿強化學習訓練;內部與外部部署則需要考量更廣泛的對齊特性。
安全論證應涵蓋技術架構的三個面向:對齊訓練、隔離防護與監控。這些防護措施有助於確保模型不會嘗試採取未對齊行動;即使嘗試了,也難以突破隔離防護,且監控系統能在造成傷害前偵測到這些行為。
模型對齊:第一道防線應是將模型訓練為對齊的模型,也就是讓模型可靠地依照我們的預期行事。這可包括:
訓練環境與評分:避免在訓練過程中正向強化獎勵取巧行為,以降低模型發展出未對齊行為的風險。這可包括:
自動化資料集審查:運用智慧體找出並修復有缺陷的強化學習環境。這些缺陷可能讓未對齊的行動軌跡透過利用漏洞,而非預期行為,獲得高額獎勵;修復後可減少訓練過程中未對齊行為受到強化的機會。
人工資料集審查:在自動化紅隊演練之外,輔以資料集的人工審查與品質檢查,找出可能無意間強化未對齊行為的缺陷任務。
評分器調校:調校評分器,對模型在訓練期間試圖利用或鑽強化學習環境漏洞的行為施加懲罰。
先前訓練作業分析:以分類器分析先前實驗的執行軌跡,確認評分器按預期運作。
對齊衡量:執行可追蹤模型未對齊傾向的評估,以衡量對齊訓練的成效。這可包括:
離線對齊評估:在前沿模型訓練作業期間執行對齊評估,檢視訓練是否達到預期效果,並調查任何明顯退步。
回溯測試:以過往事件對對齊評估進行回溯測試,確認評估能偵測到先前未對齊的模型,且未過度擬合特定事件。
追蹤評估投機行為:追蹤可能引發行為改變的評估意識或後設博弈行為(模型察覺自己正在接受測試),例如在對齊評估中啟用評估意識與後設博弈監控,並設定明確的阻擋門檻。
最壞情況壓力測試:誘發最壞情況下的不當行為,並確認至少有一項評估能偵測到這種行為。
避免以思路鏈作為訓練依據:在強化學習過程中,不要讓自動評分器看到思路鏈,以免模型逐漸學會規避思路鏈監控。
隔離防護: 確保沙箱隔離與資安措施足夠強健,讓模型即使變得未對齊,也無法採取有害行動。這可包括:
多層基礎設施安全防護:大力投入資源,強化模型執行所在的沙箱,以及承載沙箱的研究基礎設施,確保沙箱逃逸發生時仍有額外一層保護。
隔離防護紅隊演練:在安全分析的前提下,使用前沿模型訓練作業的檢查點,對這些系統反覆進行紅隊演練,找出並補足任何缺口,藉此改善沙箱、研究基礎設施及周界安全。也應對模型在訓練期間可能接觸的所有服務(例如網際網路快取)進行紅隊測試。
跨樣本通訊:將高頻寬的跨樣本通訊限制在核准的管道內,例如多智慧體工具,並關閉基礎設施中頻寬高且容易被智慧體發現的旁通道。
不可變更的互動紀錄:對所有強化學習訓練、評估及內部部署,以不可變更的方式保存智慧體互動紀錄一段合理時間(例如存於僅能寫入一次的儲存帳戶),以支援可靠的事件調查,並避免意外編輯。
監控:建立即時監控系統,在模型開始採取未對齊行動時,偵測任何潛在的未對齊情形,並在嚴重事件發生前迅速處理優先問題。這可包括:
確保可監控性:透過設有明確門檻的可監控性與監控規避評估,確認模型持續可受監控,以及早發現值得關切的行為。
已知問題的高召回率:確保監控系統在使用保留資料的評估中,對過往事件具有高召回率。
持續更新監控評估:為新的訓練作業建立能代表全新風險的評估資料點,避免監控召回率與精確率的衡量結果過時。
快速應變:實施優先警報機制,透過緊急通知值班人員或自動暫停受影響的訓練作業,確保在規定的服務水準協議(SLA)時限內、模型造成傷害之前採取行動(例如白天發生事件時,緊急通知資安值班人員與訓練作業負責人;夜間警報未獲確認時,則自動暫停訓練作業)。
除了技術防護措施的建議,我們也一直在制定前沿 AI 訓練作業安全論證的最佳作業實務。這些實務可包括:
異議意見(事前檢討):安全論證草擬完成後,應由另一團隊的成員撰寫異議意見,找出安全論證中可能的漏洞,並提出與證據相稱的風險判斷。訓練團隊隨後應予以回應,讓安全論證更為健全。
核准:安全論證應由高階主管審查,且每位主管都應有權否決該次訓練作業,以確保訓練作業受到多重內部把關(例如由研究部門主管/副總裁、安全主管及首席科學家審查)。
問責:負責訓練作業的高階主管(例如研究部門主管/研究副總裁)應對安全論證及任何事件應變負責,並將此納入績效考核等機制,讓訓練團隊也有動力推動安全與對齊工作。
暫停:若發現會使安全論證失效的問題(例如新的資安問題),應確保已有作業手冊、技術控制措施及服務水準協議(SLA),以暫停所有涵蓋範圍內的訓練作業。
內部透明度:應向內部監督組織(例如安全性委員會)提供安全論證。
稽核:應給予稽核人員充分的存取權限,以驗證安全論證中的主張是否有效且合理,並在發現缺漏時提出。
升級通報:應建立明確的未對齊問題升級通報流程,訂定未對齊嚴重程度分級表,並安排未對齊問題值班人員,在訓練作業達到特定嚴重程度時,能緊急通知高階主管(例如執行長)。
技術控制措施:應讓人類與智慧體難以啟動不合規的訓練作業。監控與自動暫停等安全功能應採取故障即阻斷的設計(例如,未啟用適當監控時,應無法啟動訓練作業;也不應能從強化學習訓練、評估或內部部署環境中停用監控系統)。
回復能力:應能輕易找出未對齊模型在訓練流程中的所有下游用途(例如資料生成或評分),以便在必要時消除未對齊輸出的影響。
剩餘風險的完整性:安全論證應盡可能完整列出目前已實施的緩解措施未涵蓋的所有剩餘風險,以便在充分知情的情況下決定是否接受風險。
以上是我們目前的建議,OpenAI 正逐步落實這些做法。我們預期這些實務在未來幾週仍會持續演進。
我們也一直在制定調查嚴重 AI 未對齊事件的最佳實務。實驗室應盡可能從個別事件中汲取經驗(如同其他高風險產業的調查實務(在新視窗中開啟)),以防止類似事件再次發生。可採取的措施包括:
內部透明度: 由於調查可能需要相當長的時間才能完成,應定期在內部報告事件調查進度(例如每天更新進行中調查的進展)。只要安全且與工作相關,員工就應有明確管道取得更多存取權限,包括查看原始互動紀錄,以及對未對齊模型進行取樣。
未對齊的根本原因:研究人員應針對訓練動態進行根本原因分析(例如透過針對性的消融實驗或重新取樣實驗),了解未對齊行為如何產生,從而深化對未對齊現象的科學理解,並在未來更有效地預防。
事後檢討:應從作業與文化層面進行事後檢討,了解所有促成事件的原因,例如問題為何產生,以及為何在事件發生前未被發現或升級通報。
偵測:我們應開發能發現模型具有引發該類事件傾向的對齊測試方法,而非直接依據事件衍生的資訊(例如互動紀錄或事件摘要)反覆調整、追求更高的測試表現。應根據事件建立評估,作為「迴歸測試」,以確保未來的模型不會在非常相似的事件中展現未對齊傾向。
公開揭露:調查結束後,應向大眾公開調查結果、事後檢討及作業上的變更。應儘速通知受影響的第三方。


