跳到主要內容
OpenAI

2026年9月22日

安全機制

有效第三方評估的優先領域與原則

正在載入...

前沿人工智能實驗室在安全訓練、評估和部署模型方面肩負重大責任。第三方評估是履行和平衡這項責任的重要一環,既可增加各方參與人工智能安全討論的機會,讓全球掌握最新資訊,也能確保實驗室須就清晰且有獨立證據支持的安全主張承擔責任。

為了推動前沿發展與安全同步,OpenAI 致力支持獨立評估,並在訓練、評估和部署各環節提供深入的存取權限。這些權限應讓評估者能夠質疑我們的假設、識別我們可能遺漏的風險,並自行判斷保障措施是否有效。

長久以來,我們一直在模型開發和部署流程的不同階段與第三方評估者合作。我們亦已把第三方評估納入防範應對架構的實務,並支持提倡更嚴謹且問責清晰之流程的機構和法例。在這些合作中,我們提供了深入的存取方式,包括技術保障措施的相關資料、可查看思路鏈的權限,以及前所未有的機密數據和內部部署存取權限,以供事故應變和監察系統的紅隊演練使用。本文所載的優先領域和原則,主要針對我們與私營及非牟利界別的獨立評估機構就技術安全評估進行的合作。這些工作與我們和政府在測試及評估方面的合作互相補足;由於各方的角色和責任不同,所需方法亦可能有別。

要使這些評估行之有效,必須具備健全的獨立機制、科學嚴謹性、穩健的保安措施和清晰的責任分工。實驗室有責任在保障敏感資料的同時,促成有實質意義的審查。實驗室和獨立評估者共同肩負妥善處理這項工作的責任,並應按照共同採用的國際安全及保安實務標準運作。下文提出四個需要深入評估的優先領域,以及確保工作嚴謹、安全和獨立的原則。

評估的優先領域

第三方評估若能處理具體而影響重大的問題,最能發揮作用:證據是否支持實驗室的安全論證和安全主張?評估是否充分測試其擬衡量的風險?保障措施在實際情況下是否有效?

本文所述的評估應因應所審視的安全問題採取不同形式。我們預期會同時支持多項歷時不一的評估,部分為期數週,其他則長達數月。第三方評估亦可納入部署前的工作並為部署決策提供參考,但本文所述工作一般較為長期,且不依附於特定發布時點,重點是持續深入審視個別安全主張。

在各項優先領域和原則中,我們會提及安全主張和安全論證。這些詞語的涵義如下:

安全主張:對模型或系統的能力、行為或保障措施作出的具體陳述,且與其安全性相關,並可按證據加以評估。主張應列明其所針對的風險和條件,以及相關假設和限制。

安全論證:一套有證據支持的結構化論證,說明為何模型或系統的風險在特定活動中已獲充分管理,例如訓練、評估或部署。安全論證把個別安全主張與支持這些主張的證據連繫起來,並明確交代可能影響其結論的假設、不確定性和剩餘風險。

我們提出四個需要深入評估的優先領域,以及確保工作嚴謹、安全和獨立的原則。

  1. 對涵蓋訓練、評估、內部部署及外部部署的安全論證進行獨立評估。

    評估安全論證需要具備對齊、監察等控制方法、網絡安全、生物及化學濫用,以及紅隊演練方面的專業知識。安全論證由多項主張組成,包括訓練、能力評估和保障措施;這些主張可整體或分項評估(見下文優先領域 2 和 3)。可能需要多名評估者運用各自的專業知識,審視安全論證的不同部分。這些評估合起來應能回答以下問題:

    1. 訓練、評估和部署的安全論證是否有充分證據支持?訓練、評估和部署期間是否遵守安全論證所訂條件?

    2. 我們的安全論證是否涵蓋評估過程中識別到的最迫切風險?各項安全主張是否支持整體安全論證?是否有任何缺口或可改善之處?

    3. 有否採用有效方法,識別並減少訓練中可能獎勵欺騙、獎勵取巧、破壞行動或規避限制的誘因?

  2. 評估內部及外部部署中的關鍵保障措施

    我們的保障措施組合不斷演進,以配合持續變化的能力和環境。我們的保障措施涵蓋訓練、內部部署和外部部署。目前包括模型層面的保障措施、執行保障、保安保障和失準監察系統,涵蓋多種風險,例如失控,以及網絡、生物和化學方面的濫用風險。技術合作既可識別現有保障措施的弱點,也可改進評估方法和加快標準制定,為日後透過公共政策推動前沿發展與安全同步奠定更堅實的技術基礎;這對安全及保安標準仍在起步階段的內部部署尤其重要。

    獨立評估應審視這些保障措施的成效及其不足之處,例如:

    1. 在提供「灰盒」存取權限的情況下,保障措施能否抵禦對抗性測試(越獄),並充分防止模型在高風險領域(例如網絡、生物)帶來能力提升?我們的對抗性測試和紅隊演練是否涵蓋最重要的風險?

    2. 在模擬實際運作環境的獲授權測試中,智能代理如何與存取控制、沙盒,以及偵測和應變系統等網絡防禦措施互動?哪些防禦措施能預防、偵測或遏制有害行動?它們又會在哪些情況下失效?

    3. 在內部和外部部署中,我們的失準監察系統是否存在可能導致失控或嚴重失準的關鍵缺口?隨着模型能力提升,以思路鏈監察作為安全或對齊證據來源的可靠程度如何?

    4. 所有相關的訓練、評估和部署是否均已實施適當且不易停用的監察措施?

    5. 所實施的保障措施是否與模型能力相稱?

  3. 評估涵蓋防範應對風險類別(化學及生物風險、網絡安全、人工智能自我改進)的能力評估,以及針對失準風險的對齊評估

    我們的防範應對架構規定,評估須審視主要前沿風險領域。當模型超越門檻而評估亦趨於飽和時,必須持續更新相關評估,並確保其涵蓋範圍和質素。這包括評估防範應對風險領域能力的評估,以及旨在衡量嚴重失準風險的對齊評估。

    相關問題包括:

    1. 評估防範應對風險的測試,是否充分涵蓋防範應對風險門檻的定義?這些評估的門檻是否設定得當?

    2. 當模型持續取得最高分時,評估有否更新?新測試又能否有效衡量更先進的能力?

    3. 我們的對齊評估是否充分涵蓋嚴重失準風險?又可能遺漏哪些重要行為或情況?

  4. 獨立調查重大失準事故

    獨立調查對各類重大人工智能安全事故均可發揮重要作用。本文聚焦於模型失準,包括模型未經授權行事或逃避監督;即使不存在蓄意濫用,這些情況亦可揭示對齊方法和保障措施的弱點。

    在特定情況下,如 OpenAI Hugging Face 事故,引入獨立第三方進行獨立的失準事故調查可能會帶來裨益。參與事故調查的第三方必須具備所需專業能力,包括在適用情況下具備網絡鑑證和對齊方面的專業知識、大規模思路鏈分析能力,以及能夠及時完成調查的人手和資源。事故應變可能涉及存取敏感內部數據和第三方數據,因此部分詳情可能不宜公開或限制存取。獨立調查的結果亦可為模型的安全論證提供參考,透過證據評估有關模型對齊狀況,以及針對過往失準情況所採取修正措施成效的主張。

    就失準事故而言,我們優先對以下方面進行獨立評估:

    1. 事故期間出現了哪些模型行為或失準問題?主要成因是甚麼?

    2. 保障及修正措施能否有效降低日後發生類似事故的風險?

有效評估的原則

  • 範圍清晰並經共同協定的評估主張:評估應先確立雙方同意的範圍,然後明確界定安全主張,並在評估工作開始前預先登記。第三方和實驗室應釐清,這些主張是受評公司希望提出評估的主張,還是第三方評估者擬獨立評估、而實驗室同意以此接受評估的主張。部分主張可能不在範圍內,原因有很多,包括第三方無法取得數據、評估者專業知識不足,或評估情況緊急而受合理時限所限。實驗室和評估者應制定程序,考慮在原定範圍以外發現的重大風險,包括是否有必要進一步調查。結論應按照共同協定的範圍,清楚說明哪些事項已評估、哪些未有評估。

  • 相稱的存取權限:在法律、保安和知識產權限制容許的情況下,評估者應盡可能獲得與評估議定主張相稱的存取權限。如直接存取並不切實可行或無法實行,評估者可與公司指定代表合作,或採用間接或保障私隱的存取機制,以保護相關資料。

  • 透明的方法和標準:評估者應說明所用方法、評估準則和不確定性,並在有既定標準時加以採用。如尚未有相關標準,評估者應清楚說明所用準則的理據。報告應區分直接發現與詮釋、說明不確定性,並清楚交代證據支持哪些結論。

  • 專業能力與獨立性:評估者應證明具備相關技術專業知識,並識別、披露和處理機構及個人的利益衝突,包括財務誘因、與開發者的關係,以及先前曾參與受評工作的情況。保障措施的設計應確保商業壓力和報酬安排不會影響評估結果,措施可包括避席或適當的迴避期。

  • 保安與保密:評估者應證明具備資訊保安措施,並對其人員實施可執行的保密保障,而保障程度須與所存取系統及資料的敏感程度相稱。這些保障應涵蓋知識產權、敏感資料和評估紀錄。如評估者無法在自身環境中符合保安要求,或所存取的數據尤其敏感,則適宜使用由公司管理的裝置或在公司處所內存取。

  • 可付諸行動的發現及修正時間:評估應識別具體缺口,並提供足夠詳情,讓實驗室作出修正。在適當情況下,實驗室應可在報告發布前獲得合理時間修正問題。如適用,報告亦應說明智能代理開發者、部署者和防禦人員可汲取的經驗,並提供實際的執行建議。

  • 負責任的發布方式:評估報告應以證據為依據,在保障敏感和機密資料的同時盡可能公開分享。如無法向公眾全面披露,向適當的監督機構(例如管治機構或公司董事會)提交機密報告,有助確保問責。應制定符合原則的刪節保障及政策,並清楚訂明對意見回饋和更正錯誤的期望,以維持獨立性與保密之間的平衡。評估者應維持編輯獨立,同時確保保密和知識產權保障得以維持。評估者應採用清晰的刪節政策,容許實驗室要求刪去敏感資料;評估者則可註明哪些內容曾作實質刪節,以及對評估報告有何影響。

未來路向

我們致力支持獨立評估者,並透過未來的法律和私營管治機構,就有效的第三方評估建立更清晰且獲共同採用的國際標準。獨立評估生態系統仍在發展,我們將支持具備深厚專業知識、涵蓋不同前沿安全問題的多元獨立評估者群體,並與其合作,推動生態系統成長。任何單一第三方都無法、也不應全面涵蓋所有迫切的前沿安全問題。我們將審慎而有目標地提升自身能力,並協助日益壯大的第三方生態系統就最佳實務和原則達成共識。我們正與多個第三方商討符合上述優先領域的建議。