AI 能力已揭開新篇章,AI 政策也必須隨之翻開新一頁。任何企業、行業或政府都無法獨力應對這項挑戰。我們必須把握當下,以實質行動為先,而非追求政策上的完美。
以下是我們的行動:
推動制定強制性的全國 AI 安全要求。我們希望與國會合作,制定按能力而定的強制性全國 AI 安全規管制度。
推動各州持續採取行動。在國會採取行動前,我們將繼續支持有助強化整體 AI 安全生態系統的州級法例。今天,我們宣佈支持 4 項加州法案:為獨立安全評估建立整體基礎設施的 SB 813、制定 AI 審計機構標準的 AB 1405、保障年輕人的 SB 1119,以及防範由 AI 助長的生物威脅的 AB 1864。
推動業界主導的標準。我們將與其他前沿實驗室合作,推動前沿 AI 標準;無論政府是否支持,我們都會立即展開自願行動。
建立全球標準。我們將倡議採取相容的國際方法,衡量能力、管理風險、維持人類控制,並決定何時及如何放慢或停止開發,即使這意味着要放慢模型能力的進展。
我們的首席科學家 Jakub Pachocki 最近撰文指出,機器智能迅速崛起,包括遞歸式自我改進的潛力,意味我們必須「極度審慎」。OpenAI 將繼續尋求對齊及監察方面的技術方案、建立防禦系統,並在必要時放慢開發。然而,單靠個別實驗室內部的技術工作並不足夠。我們亦需要共同標準,包括決定何時應放慢或停止開發的標準。
此事影響極其深遠。先進 AI 可加快開發新藥物、鞏固關鍵基礎設施、拓展經濟機遇,並協助解決經歷數代人努力仍未能攻克的科學難題。但令模型更實用的能力亦伴隨風險,而這些能力不會只局限於少數前沿實驗室。世界各地開發的模型,包括開放模型,將日益接近現今的前沿水平,並廣泛供人使用。
Astra 的能力、AI 推動研究加速的初步證據,以及 Jakub 的文章,都指向同一個方向:AI 正迅速發展,政策亦需要與時並進。
Greg Brockman 曾提出「防禦人員的機會之窗」(在新視窗中開啟),即在強大攻擊能力普及之前,前沿 AI 可協助防禦人員鞏固關鍵系統的一段有限時期。政策制定者也面臨類似的時限,必須趕在負責治理的機構跟不上 AI 能力發展之前,建立能長期發揮作用的防護措施,而可用的時間正逐漸縮短。
隨着能力增強,AI 的進展速度必須日益取決於我們對安全的信心。安全並非進步的障礙,而是讓進步走得更遠,並惠及更多人的基礎。
我們已加強模型開發生命週期各階段的監察、對齊及安全保障,包括對前沿研究工作負載採取更嚴格的隔離措施、擴大對模型在使用工具進行訓練及評估期間所展現行為的監察,以及更清晰界定何時須上報疑慮。對於 Astra,我們亦全面監察完整軌跡(包括思路鏈),並規定必須通過對齊評估,才可進行更廣泛的內部部署。
這些保障措施必須持續走在能力發展之前。若繼續推進會帶來不可接受的安全風險,我們便會放慢或停止開發或部署無法得到充分安全保障的系統;這是我們過去採取過的做法,亦是我們的應變整備框架(在新視窗中開啟)所規定。
完全自主的遞歸式自我改進,是指 AI 系統自主推動新一代 AI 的發展,讓後續每一代的能力都更強。目前尚未出現這種情況。在能夠安全進行之前,我們不應追求完全自主的遞歸式自我改進。
不過,AI 已開始加快用於開發及對齊下一代模型的部分研究工作。我們最新的研究顯示,AI 智能代理能完成一些原本需要熟練研究人員花數天才能完成的工作。這並非遞歸式自我改進,卻反映出未來的發展方向。
這種加速也能夠而且必須用於提升安全。我們的目標是安全地建立由人類監督的自動化 AI 研究員,同時推進深度學習及對齊研究,運用每一代 AI 協助下一代變得更安全、對齊程度更高且更易控制,而非只追求更強能力。
各國政府應制定衡量相關進展的共同方法,維持實質的人類控制,並就何時及如何放慢或停止開發訂立共同安全門檻。如果必須放慢能力增長才能達到某些安全門檻,我們便應以安全為先。技術越強大,配套保障措施也必須越嚴格。
AI 可加速 AI 發展;面對這種可能性,單靠自願承諾並不足夠。美國需要制定按能力而定的強制性全國 AI 規管制度,並可隨技術發展而調整。
我們的前沿 AI 民主治理藍圖勾勒出建立持久聯邦框架的路徑:共同測試及獨立評估要求、更強的網絡安全保障、明確的事故通報規則、更完善的國家應變準備,以及追蹤遞歸式自我改進進展的共同衡量標準。
國會正逐步形成數項嚴謹的前沿安全提案。我們將繼續以建設性方式參與討論,並預期會支持能實質提高安全門檻的法例。事關重大,我們不能因追求完美而錯失可行的良策。國會應在休會前採取行動。
一套全國框架既要強而有力,也要審慎界定適用範圍。前沿安全要求應適用於少數資源充足、開發最強大系統的實驗室,而非初創企業、小型開發者或遠未觸及前沿的研究人員。義務應與能力及風險相稱。
前沿安全政策也不應淪為換名包裝的開放權重政策。開放模型可以是解決方案的一部分,尤其是在網絡安全領域,以及基於主權、安全或資料駐留需要而較適合在本地部署的情況。大多數模型競爭的並非前沿能力,而是成本、控制權及延遲。正如我們簽署《開放權重與美國 AI 領導地位》聯署信(在新視窗中開啟)時所重申,美國同時需要開放及封閉模型。聯邦框架應針對前沿能力及風險,同時避免削弱競爭、讓現有企業的優勢固化,或迫使創新移往海外。
一套嚴謹的公共框架應減少而非加劇權力集中。目前,前沿實驗室大多自行制定管理前沿風險的規則。具民主問責的標準、獨立驗證及實質透明度,將取代零散的私人治理制度。
這對維持美國的領導地位至關重要。美國無法單憑能力在 AI 時代勝出。如果大眾、機構及政府對這項技術缺乏足夠信任,因而不願採用,即使技術領先亦無甚意義。強而有力的保障措施並不代表要在創新方面讓步。這些措施是推動廣泛採用 AI,以及維持美國長遠領導地位所需基礎設施的一部分。
我們迫切需要制定全國性的 AI 標準,任何身處前沿領域的人都明白此事刻不容緩。在國會採取行動前,各州應繼續推進相關工作,填補監管真空並提高標準。
OpenAI 一直支持加州 SB 53、紐約州《RAISE 法案》及伊利諾伊州 SB 315,也支持馬薩諸塞州正在審議的前沿安全法例加入獨立審計要求。我們鼓勵各州就這些共同保障措施逐步形成共識。如此一來,各州可建立事實上的全國基準,最終由國會將之編纂成法;我們稱這種做法為 逆向聯邦主義。但協調一致不代表相關要求只能一成不變。
今天,我們正式宣佈支持另外 4 項已獲加州議會通過、即將送交州長 Newsom 的法案。這些法案各自涵蓋 AI 安全生態系統中相輔相成的範疇。
SB 813(在新視窗中開啟) 將設立程序,指定有能力評估 AI 風險的合資格獨立機構。正如我們在 (在新視窗中開啟)前沿安全藍圖(在新視窗中開啟)中所述,我們傾向由聯邦層面監管獨立技術評估,讓政策制定者可就評估機構的資格、安全措施及存取高度敏感資料制定一致標準。不過,在聯邦政府尚未採取行動之際,加州可協助為一套安全、能力充足且能改善安全成效的全國獨立評估架構制定基本規則。
AB 1405(在新視窗中開啟) 將為 AI 審計機構訂立註冊、獨立性、透明度及問責要求。
SB 1119(在新視窗中開啟) 將要求實施年齡核實、風險評估、獨立審計、家長控制,以及保護使用陪伴型聊天機械人的兒童及青少年免受有害內容影響的措施。我們最近表示支持這項法案。該法案以 OpenAI 透過旗下產品、 全球政策原則及支持 (在新視窗中開啟)《家長及兒童安全 AI 法案》(在新視窗中開啟)所推動的青少年安全措施為基礎,並延續 ChatGPT 青少年版的內置保護措施,包括在敏感領域採用更嚴格的預設設定、安靜時段、學習時段及休息提醒。
AB 1864(在新視窗中開啟) 將要求基因合成服務供應商及桌上型合成設備製造商遵守聯邦篩查標準,加強防範由 AI 助長的生物威脅所需的關鍵實體保障。
過去我們並未支持其中部分法案,但鑑於近期觀察到能力大幅提升,經重新考慮後,我們現已轉為支持。
這些法案不能取代聯邦規管。這些法案是認真務實的做法,既可立即保障大眾、展示可行的保障措施應如何落實,亦有助推動聯邦政府採取行動。
單靠法律無法確保先進 AI 的安全。開發能力最強系統的實驗室內,亦需要落實具體做法。當務之急是從監察着手。
未對齊並不需要意識或惡意;當模型以違反人類意圖或既定界線的方式追求目標,便會出現未對齊。隨着模型的自主程度提高、使用更強大的工具並長時間運作,應要求開發者監察這些未對齊行為,並證明已有有效的保障措施。
監察必須與清晰的披露要求掛鈎。正如我們在加州所倡議,若公司的模型在開發或評估期間,未經授權繞過另一機構的安全控制措施,並實質存取、更改或摧毀該機構受保護的系統或機密資料,便應要求公司迅速以書面通知受影響方。我們亦支持就其他嚴重 AI 事故設立聯邦通報要求,並正着手界定應涵蓋哪些事故,以及相關要求應包括甚麼。
正如我們上週所分享,OpenAI 正制定一套框架,用以通報造成重大後果的未對齊事故,並有系統地監察前沿模型的活動,包括內部使用。這項工作最初由公司主導,但我們希望能為更廣泛的聯邦政策及通報要求提供參考。
我們希望與其他實驗室合作,制定由業界主導的標準。任何此類標準都應作為強制性聯邦保障措施及民主監督的補充,而非取而代之。不過,AI 能力已進入另一個發展階段,我們應考慮所有可行方案,包括能否先在政府架構以外,以自願方式建立相關機制,作為即時行動。
任何此類標準最終亦必須延伸至國界以外。模型、研究及技術專業知識在全球流動,而最強大系統一旦失效,其後果可能遠超開發所在國。若美國要在國際上發揮領導作用,便需要在國內建立可信的標準,而我們愈來愈相信,相容的國際標準將是必要的。
AI 政策的機會之窗目前仍然敞開,我們決心把握這個機會。
這意味着我們要以迫切感和謙遜態度投入其中,並願意調整。這意味着要支持能實質提高安全門檻的嚴謹提案,即使並非完全按照我們的構想制定。這也意味着要隨技術演進而加強框架。
第一步不可能完美。但目前更大的風險,是等待太久才踏出這一步。


