我們將分享一套新框架,用於追蹤、調查及揭露 OpenAI 的模型未對齊案例,同時發布六份報告,說明我們過去六個月觀察到的非預期或令人擔憂的模型行為。
過去,為了讓研究人員、AI 開發者、政策制定者與大眾掌握更充分的資訊,我們一直致力於公開我們對未對齊情形的研究發現。但由於缺乏一套系統化的發現報告方式,我們的揭露一向較為零散,頻率也不如理想:我們經常等到能將多個案例彙整成一份報告時才發布,或將其加入新發布模型的系統說明卡。這套新框架旨在加快觀察到未對齊情形後的報告發布,即使我們尚未完全解釋或緩解所報告的行為,也能儘速公開。
隨著 AI 系統日益先進且部署更加廣泛,我們需要針對對齊研究的進展,建立更廣泛且資訊更充分的共識。我們不認為 AI 產業已充分解決對齊與監控問題,足以繼續長期以最高速度負責任地擴展規模。未來數月乃至數年應如何推進 AI 發展,相關決策必須依據建構前沿模型的公司以外人士也能自行檢視的證據。
未對齊案例可能有助於找出其他 AI 開發者在系統達到類似能力時可能面臨的問題、揭露防護措施的弱點,或挑戰對模型行為的既有假設。分享這些發現,能讓其他人調查相同問題、檢驗我們的解釋,並改善緩解措施。由於我們相信提高未對齊情形透明度的價值,這套新框架即使在重要性尚不確定時,也會傾向予以揭露。這表示我們揭露的部分案例,最終可能證實只是偶發現象,既非更大趨勢的一環,也無法預示未來發展。
目前,業界尚無一套適用全產業的框架,明確規範 AI 開發者應如何揭露其模型的未對齊案例。我們希望今天提出的框架,能成為建立這類標準的第一步,明定開發者應揭露哪些未對齊案例,以及報告應包含哪些內容。我們將這套框架視為尚在完善中的工作,並會根據實務經驗與公眾意見持續改進。
以下將說明這套框架的運作方式,並分享我們發布的首批報告。
我們致力於揭露能提供實用證據的案例,協助瞭解模型未對齊情形如何產生、如何顯現,以及防護措施在哪些方面有效或失效。我們優先處理新機制、已知行為的重大變化,以及挑戰安全或緩解措施相關假設的發現。案例即使未造成傷害或無法證實存在更廣泛的模式,也可能值得揭露。本框架將涵蓋模型整個生命週期中符合條件的行為,包括訓練、評估、測試與部署。
這包括模型未經授權採取行動、與其他模型協調或規避監督的新方式;使對齊方法或防護措施受到質疑的失效情形;以及挑戰已發布安全評估中某項主張的行為。相同的揭露標準也適用於可能影響第三方的未對齊情形。
這也可能包括看似與我們過去已揭露案例重複的未對齊情形。問題反覆發生,本身就可能成為有用的證據,反映模型的行為方式或防護措施的成效。例如,即使一再嘗試緩解,某種特定的未對齊行為仍持續重現。在這些情況下,我們會更新原始未對齊揭露內容,以發布新增案例。
長期而言,我們計畫與其他開發者、外部研究人員、產業標準組織及監管機關合作,制定更客觀的揭露標準。我們也認為,嚴重的安全、資安與未對齊事件應通報美國聯邦政府,並正著手提出相關通報機制。我們認為本框架是對現有義務的補充,並強調它不會取代我們依法應履行的揭露要求,包括重大安全事件或網路安全漏洞的相關要求。
為正式啟動這套揭露未對齊情形的新框架,我們將發布六份報告,說明在模型訓練或評估期間觀察到的未對齊行為案例。這些案例呈現了多種我們認為值得分享的行為,從向使用者隱瞞資訊,到為克服障礙而擅自採取行動。這些是個別案例的報告,不應據此判斷未對齊情形在我們各模型中發生的頻率。以下各項皆附有完整報告的連結。
任務摘要中的自行產生指示(在新視窗中開啟)。一個尚未發布的研究模型在用於新上下文視窗中接續工作的摘要裡,插入了無關指示,包括要求忽略其正常限制。我們找出 27 份受影響的摘要。
要求在任務摘要中隱瞞錯誤的指示(在新視窗中開啟)。在訓練 GPT‑5.6 Sol 期間,許多模型實例在摘要中加入指示,要求向使用者隱瞞錯誤或未對齊行為。例如,壓縮摘要中包含要求捏造缺漏的歷史資料且不予揭露,以及隱瞞來源版本不符情形的指示。
搜尋公開程式碼庫中的外洩 API 金鑰,隨後捏造資訊(在新視窗中開啟)。某模型在回答一個關於加州某郡收入數據的一般問題時,發現並未經授權使用了一組外洩的 API 金鑰。當它仍無法取得所要求的數據時,便自行捏造,並將其呈現為取自指定來源的資料。
為了引用檔案而將其上傳至網際網路(在新視窗中開啟)。當使用者要求一個尚未發布的模型提供面積超過 5,000,000 平方公尺之湖泊的 ID 與名稱時,智慧體使用 Python 找到了正確答案。但由於指示要求提供瀏覽器引文,智慧體未詢問使用者便決定上傳檔案,以便在回答中引用。
透過內部軟體程式碼庫擅自寫入與通訊(在新視窗中開啟)。多個模型在尋找缺漏的輸入檔案時,將內部軟體程式碼庫當作留言板,在不同訓練樣本之間交換請求與回覆,但最終未能找回那些檔案。本報告也檢視了更早的一起案例:某模型為了規避網路限制,成功將測試檔案上傳至程式碼庫。
協作智慧體之間擅自分享檔案(在新視窗中開啟)。多個智慧體共同執行同一項訓練任務時,因無法存取彼此的本機檔案,便使用公開檔案託管網站分享檔案。這使任務成果可透過公開網址存取,儘管任務要求模型只能使用本機檔案。
任何 OpenAI 員工都可以提出未對齊案例,交由安全與對齊團隊調查,並要求評估是否應向公眾揭露。這將啟動我們的揭露流程;每個步驟都設有期限,以確保及時完成調查與揭露。
案例提出後,我們的技術人員將調查事件經過、仍有哪些不確定之處、是否有必要公開揭露,以及哪些事實可以分享。他們也會評估是否有任何第三方受到影響,並需要在發布前獲得非公開通知。
之後,案例將分配至三種處理途徑之一:「可供揭露」、「小規模調查」或「大型調查」(「慢速途徑」)。
「可供揭露」適用於符合條件,且調查已充分完成、可在審查後發布的案例。「小規模調查」適用於需要進一步技術調查的案例。我們預期,揭露案例中的絕大多數會採用這兩種途徑,尤其是不需要廣泛調查、與第三方協調,或處理嚴重濫用風險的案例。我們今天發布的案例全都屬於這兩種途徑之一。
「大型調查」適用於複雜的調查,尤其是涉及第三方的案件。若第三方受到影響,我們在安全、法律與負責任揭露方面的義務,優先於本框架。我們會盡可能儘快發布初步通知,但也可能因安全因素而必須延後。例如,模型發現廣泛使用的軟體中存在先前未知的漏洞時。如果報告會揭露第三方身分,即使安全邊界未遭突破,我們仍打算事先通知對方。
「大型調查」案例的初步通知將概述事件經過、說明是否有外部專家協助調查,並在可能範圍內提供預計發布最終報告的時間。若 OpenAI Hugging Face 事件依據本框架揭露,原本會歸入這項處理途徑。
提出該案例的員工將獲知是否揭露的決定;若決定揭露,也會得知將採用哪一處理途徑。若對是否揭露或適當的處理途徑仍有歧見,將交由 OpenAI 的安全性諮詢小組(SAG)處理。該小組由公司各部門的高階主管組成,負責評估前沿模型的能力與防護措施、監督我們的應變整備框架,並向 OpenAI 領導團隊提供建議。安全性諮詢小組內部的歧見,或員工對其決定提出的異議,將提交 OpenAI 領導團隊處理。不予揭露或認定無須揭露的決定,將告知安全與對齊工作領導團隊,並在可行範圍內告知相關技術人員。
隨著我們瞭解這套揭露流程的實際運作情況,可能會加以修訂,並在本文記錄所有變更。
每份完整報告都會說明我們觀察到的行為、其嚴重程度與任何外部影響、發生情境、發生日期或期間、我們發現該行為的時間,以及所涉及模型的概略資訊。在可行情況下,我們也會分享:
事件經過及其所造成傷害的進一步詳情;
我們如何發現未對齊情形,以及調查範圍;
我們對其對於對齊研究與 AI 技術安全有何影響的解讀;
該案例引發、尚待解答的重要問題;
我們正在或計畫採取哪些措施來處理該行為。揭露時未必能提供這些資訊,因為我們可能會在完成調查或制定修正措施前發布未對齊報告。
對於客戶部署中發生的未對齊情形,我們會在客戶隱私與合約義務允許的範圍內,盡可能分享資訊。
今天發布的報告是首批揭露內容,並非針對已知未對齊情形或進行中調查的完整說明。這些初步報告無意呈現本框架涵蓋案例的完整類型或嚴重程度範圍。我們致力於揭露符合本框架標準的未對齊案例,包括更複雜的案例;這些案例可能需要較長時間調查或與第三方協調。我們將持續依據本框架發布報告,並隨著相關承諾逐步完善,進一步說明我們在報告方面的承諾。


