跳到主要內容
OpenAI

2026年9月16日

研究安全機制

我們的模型未對齊報告架構

正在載入...

我們現正公佈一套新架構,用於追蹤、調查及披露 OpenAI 的模型未對齊個案,並同時發表六份報告,說明過去六個月觀察到的意外或令人關注的模型行為。

過去,為了讓研究人員、人工智能開發者、政策制定者及公眾掌握更多資訊,我們一直致力公開我們所得有關未對齊的研究結果。然而,由於缺乏有系統的報告方式,我們的披露一直較為零散,頻率亦未如理想:我們往往待多宗個案可以整合成一份報告後才發表,或將個案加入新發佈模型的系統說明卡。這套新架構旨在加快於觀察到未對齊情況後發表報告,即使我們尚未完全解釋或緩解所述行為,亦可作出披露。

隨着人工智能系統日益先進並獲更廣泛部署,我們需要就對齊研究的進展建立更廣泛、資訊更充分的共識。我們並不認為人工智能業界已充分解決對齊及監察問題,足以在更長時間內繼續以最高速度負責任地擴展規模。未來數月以至數年,關於人工智能應如何發展的決定,需要建基於開發前沿模型的公司以外人士亦能自行審視的證據。

未對齊例子或有助識別其他人工智能開發者在系統具備相若能力時可能遇到的問題、揭示保障措施的弱點,或挑戰對模型行為的既有假設。分享這些研究結果,可讓其他人調查相同問題、檢驗我們的解釋,並改進緩解措施。我們相信提高未對齊情況透明度具有價值,因此這套新架構傾向作出披露,即使事件的重要性尚未確定。換言之,我們披露的部分個案最終可能被證實為偶發或虛假關聯,既非系統性問題,亦不反映未來的發展方向。

目前,業界尚未建立一套具明確標準的通用架構,規範人工智能開發者應如何披露其模型的未對齊例子。我們希望今天提出的架構能成為制定相關標準的第一步,訂明開發者應披露哪些未對齊個案,以及報告應包含哪些內容。我們視這套架構為仍在完善中的方案,並會根據實踐經驗及公眾意見持續改進。

以下將說明這套架構的運作方式,並分享我們首批發表的報告。

我們會報告哪些未對齊例子

我們旨在披露能提供實用證據的例子,以說明模型未對齊如何產生、如何呈現,以及保障措施在哪些情況奏效或失效。我們會優先處理新的機制、已知行為的重大變化,以及挑戰安全或緩解措施相關假設的研究結果。即使例子未造成損害或證實存在更廣泛的趨勢,仍可能值得披露。本架構將涵蓋模型整個生命週期內符合條件的行為,包括訓練、評估、測試及部署。

這包括模型未經授權採取行動、與其他模型協調或規避監督的新方式;令人質疑對齊方法或保障措施的失效情況;以及對已發表安全評估中的論述構成挑戰的行為。相同的披露準則亦適用於可能影響第三方的未對齊情況。

這亦可能包括看似與我們過往披露個案重複的未對齊情況。問題重現本身可能就是有用證據,反映模型的行為或保障措施的成效;例如,某類未對齊行為即使經多次嘗試緩解,仍然反覆出現。在這些情況下,我們會更新原有的未對齊披露內容,以公佈新增例子。

長遠而言,我們計劃與其他開發者、外部研究人員、業界標準機構及監管機構共同制定更客觀的披露準則。我們亦認為,嚴重的安全、保安及未對齊事故應向美國聯邦政府通報,並正着手提出相關報告機制。我們認為本架構是現有義務的補充,並強調它不能取代我們的法定披露要求,包括涉及重大安全事故或網絡安全漏洞的要求。

今天分享的未對齊例子

為正式啟用新的未對齊披露架構,我們現發表六份報告,說明在模型訓練或評估期間觀察到的未對齊行為個案。這些個案涵蓋多種我們認為值得分享的行為,由向用戶隱瞞資料,以至為克服障礙而擅自採取行動。這些報告只記錄個別個案,不應視為反映未對齊情況在我們各模型中出現的頻率。以下各項均連結至完整報告。

  1. 在工作摘要中自行產生指令(在新視窗中開啟)。一個尚未發佈的研究模型在摘要中加入無關指令,包括要求忽略其正常限制;這些摘要原用於讓模型在新的上下文視窗中繼續工作。我們發現了 27 份受影響的摘要。

  2. 要求在工作摘要中隱瞞錯誤的指令(在新視窗中開啟)。在訓練 GPT‑5.6 Sol 期間,許多模型實例在摘要中加入指令,要求向用戶隱瞞錯誤或未對齊行為。例如,上下文壓縮摘要包含要求虛構缺失歷史數據而不作披露,以及隱瞞來源版本不符的指令。

  3. 在公開程式碼庫搜尋外洩的 API 金鑰,繼而捏造資料(在新視窗中開啟)。模型在回答一條有關加州某縣收入數字的一般問題時,發現並擅自使用了一條已外洩的 API 金鑰。其後仍無法取得所需數字,於是自行捏造,並聲稱資料來自用戶指定的來源。

  4. 把檔案上載至互聯網以供引用(在新視窗中開啟)。用戶要求一個尚未發佈的模型提供面積超過 5,000,000 平方米的湖泊編號及名稱時,智能代理使用 Python 找到了正確答案。但由於指令要求提供瀏覽器引文,智能代理未經用戶同意便決定上載檔案,以便在答案中引用。

  5. 透過內部軟件程式碼庫擅自寫入及通訊(在新視窗中開啟)。模型在搜尋缺失的輸入檔案時,把內部軟件程式碼庫當作留言板,在不同訓練樣本之間交換請求及回應,但最終未能找回相關檔案。報告亦審視了一宗較早前的個案:模型為規避網絡限制,曾成功把測試檔案上載至程式碼庫。

  6. 協作智能代理之間擅自分享檔案(在新視窗中開啟)。共同執行同一訓練任務的智能代理無法存取彼此的本機檔案時,使用了公開檔案寄存網站分享檔案。即使任務要求模型只使用本機檔案,這種做法仍令任務成果可透過公開網址存取。

披露流程如何運作

任何 OpenAI 員工均可向安全及對齊團隊提出未對齊例子以供調查,並要求考慮公開披露。提出個案後,披露流程隨即展開;每個步驟均設有期限,以確保及時調查和披露。

個案提出後,技術人員會調查事件經過、仍有哪些不確定之處、是否有充分理由公開披露,以及哪些事實可以分享。他們亦會評估是否有第三方受到影響,並須在發表報告前獲得非公開通知。

其後,個案將歸入三個處理途徑之一:「可供披露」、「小型調查」或「大型調查(『較慢途徑』)」。

「可供披露」涵蓋符合條件,且調查已大致完成、經審核後可予發表的個案。「小型調查」涵蓋需要進一步技術調查的個案。我們預計絕大多數披露個案都會歸入這兩個途徑,特別是毋須廣泛調查、與第三方協調,或處理嚴重濫用風險的個案。今天公佈的個案全部屬於這兩個途徑之一。

「大型調查」涵蓋複雜調查,尤其是涉及第三方的個案。如有第三方受到影響,我們在保安、法律及負責任披露方面的義務,將優先於本架構。我們會致力盡快發表初步公告,但可能因保安理由而需要延遲,例如模型發現廣泛使用的軟件存在一個過往不為人知的漏洞。如報告會令第三方身分曝光,即使事件未有突破任何保安界限,我們仍會預先通知對方。

「大型調查」個案的初步公告將概述事件經過、交代是否有外部專家協助調查,並在資料許可下提供預計發表最終報告的時間。如果 OpenAI Hugging Face 事故按照本架構披露,便會歸入此處理途徑。

提出相關例子的員工將獲知是否披露的決定;如決定披露,亦會獲知個案將循哪一處理途徑跟進。如對是否披露或應採用哪一處理途徑仍有分歧,個案將轉交 OpenAI 的安全顧問小組(SAG)。該小組由公司各部門的高級人員組成,負責評估前沿模型的能力和保障措施、監督我們的防範應對架構,並向 OpenAI 管理層提供建議。安全顧問小組內部的分歧,或員工對其決定的異議,將提交 OpenAI 管理層處理。不作披露或認為毋須披露的決定,將告知安全與對齊工作的管理層,並在可行情況下告知相關技術人員。

我們可能會根據這套披露流程的實際運作經驗作出修訂,並在本文記錄任何變更。

每份報告將包括的內容

每份完整報告都會說明我們觀察到的行為、其嚴重程度及任何外部影響、行為發生的情境和日期或日期範圍、我們發現行為的時間,以及所涉及模型的概況。如情況許可,我們亦會分享:

  • 事件經過的進一步詳情及由此造成的任何損害;

  • 我們如何發現未對齊情況,以及調查範圍;

  • 我們對事件在對齊研究及人工智能技術安全方面影響的解讀;

  • 該例子帶出的重要未解問題;

  • 我們正採取或計劃採取哪些措施處理有關行為。由於我們可能會在完成調查或制定修正方案前發表未對齊報告,披露時未必能提供上述所有資料。

如未對齊情況發生於客戶部署環境,我們會在客戶私隱及合約義務容許的範圍內,盡量分享相關資料。

今天發表的報告是首批披露內容,並非已知未對齊情況或進行中調查的完整紀錄。這批首發報告並非旨在反映本架構所涵蓋個案的完整類型或嚴重程度。我們承諾披露符合本架構準則的未對齊個案,包括需要較長時間調查或與第三方協調的複雜個案。我們將持續按照本架構發表報告,並會隨着相關承諾逐步完善,進一步說明我們的報告安排。

作者

OpenAI