跳至主要內容
OpenAI

2026年9月22日

安全

有效第三方評估的優先事項與原則

載入中…

前沿 AI 實驗室肩負安全訓練、評估及部署模型的重大責任。第三方評估是平衡這項責任的關鍵環節,能擴大各界參與 AI 安全討論的機會、讓全球掌握資訊,並督促實驗室對明確且有獨立依據支持的安全主張負責。

為了跟上前沿發展,OpenAI 致力於支持獨立評估,讓評估機構能深入存取訓練、評估與部署的各個環節。這類存取權應能讓評估機構質疑我們的假設、找出我們可能遺漏的風險,並自行判斷防護措施的成效。

長期以來,我們一直在模型開發與部署流程的不同階段和第三方評估機構合作。我們也將第三方評估納入應變整備框架的實務,並支持相關組織與立法,推動更嚴謹且可問責的流程。在這些合作中,我們提供了深入的存取方式,包括技術防護措施的資訊、可見思路鏈的存取權,以及前所未有的機密資料與內部部署存取權,以進行事件應變及監控器紅隊演練。此處分享的優先事項與原則,著重於我們和民間及非營利部門的獨立評估組織就技術安全評估展開的合作。這些工作是我們與政府合作進行測試和評估的補充;由於角色與責任不同,政府合作可能需要採取不同方式。

要讓這些評估發揮成效,必須具備完善的獨立性機制、科學嚴謹性、健全的安全實務,以及明確的責任分工。實驗室有責任在保護敏感資訊的同時,促成實質有效的審查。實驗室與獨立評估機構共同承擔妥善執行這項工作的責任,並應遵循共同的安全與資安實務國際標準。以下提出四個應深入評估的優先領域,以及嚴謹、安全且獨立地執行工作的原則。

評估的優先領域

第三方評估在處理具體且影響重大的問題時最有價值:證據是否支持實驗室的安全論證與安全主張?評估是否充分測試了其原本要衡量的風險?防護措施在實際條件下是否有效?

此處所述的評估,應依所檢視的安全問題採取不同形式。我們預計同時支持多項評估,且各自歷時不同;部分可能持續數週,另一些則可能長達數月。第三方評估也可以納入部署前工作,並可能影響部署決策;不過,此處所述的工作通常歷時較長且不受特定發布時程影響,重點是長期深入檢視特定安全主張。

在說明優先領域與原則時,我們會提及安全主張和安全論證。這些術語的含義如下:

安全主張:針對模型或系統的能力、行為或防護措施所提出的具體主張;該主張與其安全性相關,並可根據證據加以評估。主張應指出其處理的風險與條件,以及相關假設和限制。

安全論證:以證據支持的結構化論證,用以說明模型或系統的風險為何在訓練、評估或部署等特定活動中已獲妥善管理。安全論證會將個別安全主張與支持證據連結起來,並明確說明可能影響其結論的假設、不確定性及剩餘風險。

我們提出四個應深入評估的優先領域,以及嚴謹、安全且獨立地執行工作的原則。

  1. 針對訓練、評估、內部部署與外部部署各階段的安全論證進行獨立評估。

    評估安全論證需要具備對齊、控制方法(例如監控)、網路安全、生物與化學濫用,以及紅隊演練方面的專業知識。安全論證包含訓練、能力評估與防護措施等方面的主張,可整體或分項評估(請參閱下方優先事項 2 和 3)。可能需要由多個評估機構運用各自的專業知識,分別檢視安全論證的不同部分。綜合而言,這些評估應回答下列問題:

    1. 訓練、評估與部署的安全論證是否有充分證據支持?在訓練、評估與部署期間,是否遵循了安全論證所定的條件?

    2. 我們的安全論證是否涵蓋評估過程中發現的最迫切風險?各項安全主張是否足以支持整體安全論證?是否存在任何缺口或有待改進之處?

    3. 是否採用有效方法,識別並減少訓練中可能獎勵欺騙、鑽獎勵機制漏洞、破壞性行動或規避限制的誘因?

  2. 評估內部與外部部署中的關鍵防護措施

    我們的整體防護架構會持續演進,以因應不斷變化的能力與環境。我們的防護措施涵蓋訓練、內部部署與外部部署。目前包括模型層級防護、政策執行防護措施、安全防護及失準監控器,涵蓋各類風險,例如失控,以及網路、生物與化學領域的濫用風險。技術合作可找出現有防護措施的弱點,同時改善評估方法並加快標準制定,為未來因應前沿發展的公共政策奠定更堅實的技術基礎;這對安全與資安標準仍在萌芽階段的內部部署尤其重要。

    獨立評估應檢視這些防護措施的實際成效及可能的不足之處,例如:

    1. 採用「灰箱」存取時,防護措施能否抵禦對抗性測試(越獄),並充分防止網路、生物等高風險領域的能力提升?我們的對抗性測試與紅隊演練是否涵蓋最重要的風險?

    2. 在符合實際運作條件的授權測試中,智慧體如何與存取控制、沙箱,以及偵測與回應系統等網路防禦機制互動?哪些防禦措施能預防、偵測或遏制有害行動?又會在哪些情況下失效?

    3. 對內部與外部部署而言,我們的失準監控器是否存在可能導致失控或嚴重失準的關鍵缺口?隨著模型能力提升,思路鏈監控作為安全或對齊證據來源的可靠性如何?

    4. 所有相關訓練、評估與部署是否都已實施適當且不易遭停用的監控?

    5. 實施的防護措施是否與能力相稱?

  3. 評估涵蓋應變整備風險類別(化學與生物風險、網路安全、AI 自我改進)的能力評估,以及針對失準風險的對齊評估

    我們的應變整備框架要求透過評估檢視關鍵的前沿風險領域。當模型超越門檻且現有評估趨於飽和時,持續更新相關評估並確保其涵蓋範圍與品質十分重要;這包括評估應變整備風險領域能力的評估,以及旨在衡量嚴重失準風險的對齊評估。

    相關問題包括:

    1. 評估應變整備風險的測試,是否充分涵蓋應變整備風險門檻的定義?這些評估的門檻是否設定正確?

    2. 當模型持續取得最高分時,評估是否會隨之更新?新測試是否能有效衡量更進階的能力?

    3. 我們的對齊評估是否充分涵蓋嚴重失準風險?又可能遺漏哪些重要行為或條件?

  4. 獨立調查重大失準事件

    對各類重大 AI 安全事件而言,獨立調查都可能發揮重要價值。此處著重於模型失準,包括模型未經授權採取行動或規避監督;即使沒有蓄意濫用,這些行為仍可能揭示對齊方法與防護措施的弱點。

    在特定情況下,例如 OpenAI Hugging Face 事件,引入獨立第三方進行失準事件調查可能有所助益。參與事件調查的第三方必須具備調查所需的專業能力,視情況包括網路鑑識專業、對齊專業、大規模思路鏈分析能力,以及能及時展開調查的人員與資源。事件應變可能涉及敏感的內部資料與第三方資料,因此部分細節可能不宜公開或開放存取。獨立調查的發現也能為模型的安全論證提供參考,提供證據以評估其對齊主張,以及針對先前觀察到的失準問題所採取補救措施的成效。

    針對失準事件,我們優先進行下列獨立評估:

    1. 事件期間發生了哪些模型行為或失準問題?主要促成因素為何?

    2. 防護措施與補救措施能否有效降低未來發生類似事件的風險?

有效評估的原則

  • 範圍明確且經共同同意的評估主張:評估應從共同商定的範圍著手,接著明確界定安全主張,並在評估活動開始前預先登錄。第三方與實驗室應釐清:這些主張是受評公司希望提出接受評估的主張,還是第三方評估機構希望獨立評估、且實驗室同意據此受評的主張。部分主張可能不在範圍內,原因很多,包括第三方無法取得資料、評估機構缺乏足夠專業知識,或評估情況緊急而有合理的時間限制。實驗室與評估機構應建立程序,以考量在原始範圍之外發現的重大風險,包括判斷是否有必要進一步調查。結論應針對共同商定的範圍,清楚交代哪些事項已評估、哪些尚未評估。

  • 相稱的存取權:在法律、安全與智慧財產權限制允許的情況下,應盡可能讓評估機構取得與評估商定主張相稱的存取權。若直接存取並不實際或無法實現,評估機構可與公司指定代表合作,或探索間接或隱私保護存取機制,以保護底層資訊。

  • 透明的方法與標準:評估機構應說明其方法、評估準則與不確定性,並在有既定標準可循時加以採用。若標準尚未建立,則應清楚說明所用準則的正當依據。報告應區分直接發現與詮釋、說明不確定性,並清楚指出證據支持哪些結論。

  • 專業能力與獨立性:評估機構應證明具備相關技術專業能力,並識別、揭露及處理組織與個人的利益衝突,包括財務誘因、與開發者的關係,以及先前參與受評工作的情況。防護機制應確保商業壓力與報酬安排不會影響評估結果,並可納入迴避制度或適當的迴避期間。

  • 安全與機密性:評估機構應展現資訊安全實務,並對人員實施可強制執行的保密措施,其程度應與所存取系統及資訊的敏感性相稱。這些保護措施應涵蓋智慧財產、敏感資訊與評估紀錄。若評估機構無法在自有環境中符合安全要求,或所存取的資料格外敏感,則適合改用公司管理的裝置或在公司場所內存取。

  • 可採取行動的發現與補救時間:評估應指出具體缺口,並提供足夠細節,讓實驗室能夠處理。在適當情況下,實驗室應能在報告發布前獲得合理時間補救問題。報告亦應視相關性說明智慧體開發者、部署者與防禦者可汲取的經驗,並提出可落實的建議。

  • 負責任的發布實務:評估報告應以證據為基礎,在保護敏感與機密資訊的同時,盡可能公開分享。若無法全面公開揭露,可向適當的監督機構(例如治理機構或公司董事會)提交機密報告,以強化問責。應制定有原則的刪節保護措施與政策,並明確規範回饋及更正不準確內容的方式,以維持獨立性與機密性之間的平衡。評估機構應維持編輯獨立性,同時確保機密性與智慧財產權持續受到保護。評估機構應採用明確的刪節政策,讓實驗室得以要求刪除敏感資訊;評估機構則可註明何處進行了實質刪節,以及這對評估報告造成的影響。

未來之路

我們致力於支持獨立評估機構,並透過未來的法律與民間治理機構,建立更明確且由各方共享的國際標準,以促成有效的第三方評估。獨立評估生態系仍在發展,我們將支持具備深厚專業能力、能處理各類前沿安全問題的多元獨立評估社群並與之合作,協助生態系成長。任何單一第三方都無法、也不應全面涵蓋迫切的前沿安全問題。我們將審慎且有計畫地擴充自身能力,並促成持續成長的第三方生態系就最佳實務與原則達成共識。我們正與多個第三方討論符合上述優先領域的提案。