為 AI 下一階段建立標準
我們的使命是確保通用人工智能造福全人類。正如 Sam Altman 最近所闡述,以及 Jakub Pachocki 所指出,我們以三大目標為重點,推進實現這項使命的工作:
引領 AI 進步的下一階段:建立自動化 AI 研究員,與其反覆探索對齊問題,並設法讓人類繼續參與自我改進的循環。
讓人們共享高智能機器所促成的科學進步和經濟增長成果。
以個人 AGI 賦能每一個人。
AI 正在加快我們自身的研究和工程工作,而 AI 輔助研究已推動數學領域取得進展,包括納維–斯托克斯千禧年難題。這些進展為另外兩項目標帶來重大希望,有望促成重要的醫學發現、人人可及的醫療服務,並在各地為小型企業和個人創業者創造更多經濟機遇。
許多企業和國家都在推進 AI,而整個領域的進展亦會改變所有人面對的機遇與挑戰。除了帶來其他裨益,能力強大且已對齊的 AI 亦將是我們度過這場轉型的重要一環——加強防禦、推進對齊研究,並協助人們了解和引導 AI 發展的下一階段。
要安全度過這場轉型,對齊研究必須跟上這些能力的發展,確保我們及其他機構建立的系統繼續符合人類價值觀,並受人類控制。隨着 AI 系統的能力和自主程度日益提升,包括承擔更多 AI 研發工作,這一點亦愈趨重要。要確保 AI 持續安全發展並造福社會,既需要推進對齊研究,也需要共同標準,以指引各地實驗室和國家的開發工作。
自動化 AI 研究可以由人類進行不同程度的監督。隨着 AI 系統承擔更多開發新一代 AI 的工作,即使人類仍有參與,這些系統也可日益推動遞歸式自我改進(RSI)流程。隨着這個流程進一步自動化,AI 的進步速度可能會迅速加快。
我們相信,自動化 AI 研究將帶來能直接改善人們生活的模型。它可降低先進智能的成本,讓全球各地的人受惠。自動化研究也可協助我們大幅改善對齊,並建立抵禦能力日益強大之 AI 的防禦措施——自動化 AI 研究員同樣可以成為自動化 AI 安全研究員。能力更強且已對齊的系統,可協助保障關鍵基礎設施、防禦危險的 AI 智能代理,並開發新的保護措施。
目前尚未出現完全自主的 RSI;除非並直至能夠安全地實行,否則我們不應加以推動。是否及如何推進,必須取決於我們能否維持人類控制,以及社會就其裨益和風險作出的知情民主選擇(在新視窗中開啟)。若未有適當審慎處理,RSI 可能令人類實際上失去對 AI 發展的控制,無法監督自己已不再理解的研究流程。此後,AI 可能變得更危險、更偏離對齊,整體而言對人類構成威脅。我們披露的 Hugging Face 事件雖非 RSI 的直接結果,卻預示了在缺乏穩健保障和對齊措施下,這類風險可能變得嚴重得多。
就前沿 AI 開發制定安全與保安實務的國際標準,對調控前沿發展步伐的重要性,可能不亞於對齊研究本身。標準可為高質素證據建立共同定義,並就技術保障措施應達到的嚴謹程度訂立一致基準。簡而言之,這些標準有助我們回答:「怎樣才算妥善緩解災難性 AI 風險?」
人工智能標準與創新中心(CAISI)等現有民主機構、州法律及聯邦 AI 框架均可提供協助,新形式的公私營合作夥伴關係(在新視窗中開啟)亦然。然而,AI 的開發和部署正在多個國家進行,全球各地亦正採用這項技術;其影響很可能遲早會以某種方式遍及所有人。
因此,我們需要透過國際合作制定標準,以應對以下幾項主要挑戰:
標準分化——各國的評估、匯報要求及事件定義可能互相衝突,令我們更難比較證據、了解新興能力,以及應對跨境風險。
集體行動——各國各自行事,可能產生任何國家都不希望見到的結果。RSI 能夠加快 AI 研究本身,速度甚至可能超出我們集體理解進展、評估風險及維持有意義人類監督的能力。
能力不均——前沿開發活動及相關專業知識在全球分布並不平均。這會加劇上述兩項問題。
這些挑戰同時適用於開放模型和封閉模型。
必須說明,任何推動自動化 AI 研究或其他先進能力的 AI 實驗室,都必須按照自我負責的基本原則及現行法律,為安全開展相關工作承擔責任。我們倡議制定標準,是為了避免權力集中,並取得更理想的實際成果。標準可讓更多實驗室以外的持份者參與決定這項技術的發展方向,並提供一套清晰可見且值得依循的原則,不受任何特定實驗室具體做法所左右。各方若能合作應對上述挑戰,亦很可能取得更理想的成果。
因此,我們認為美國應牽頭與世界各國合作,為前沿 AI(包括 RSI)制定全球技術標準。
我們預期這個構想將隨時間大幅演變,但其中兩方面不可或缺。
其中一種做法,是善用正在形成的 AI 安全研究所網絡——例如已在澳洲、加拿大、德國、法國、肯尼亞、日本、韓國、新加坡、印度及英國成立的機構——透過 CAISI 和各國產業組織推動標準制定,並特別聚焦於:(1) 以能力基準衡量的前沿 AI 模型及開發者;以及 (2) 自動化 AI 研究(包括 RSI)的效益與風險管理。美國可在 CAISI 於 2024 年成立國際先進 AI 測量、評估與科學網絡(在新視窗中開啟)的基礎上繼續發展,匯聚公共機構,就 AI 測量、評估及科學展開合作。
這項工作制定的標準,將為能力測量與評估、風險評估,以及保障措施是否充分提供共同技術基礎。這些技術標準並非牌照、強制推出前審查或 AI 模型的批准要求。各國政府將自行決定是否以及如何把這些標準納入本國法律制度。
這項工作亦應諮詢開放模型和封閉模型開發者、獨立技術專家及學術界,以支持具競爭力的 AI 生態系統。共同標準應以透明方式制定,並確保不會偏袒特定企業、國家或商業模式,包括避免令新加入者或開放權重模型開發者更難參與競爭。
正如我們所建議(在新視窗中開啟),這種做法可借鑑航空和金融穩定等領域的經驗。在這些領域,各國既制定了共同技術標準和可信的合作渠道,也毋須放棄國家權力。這項工作亦應與現有及新成立的標準組織緊密合作,例如 ISO(在新視窗中開啟)、前沿模型論壇(在新視窗中開啟)、智能代理式 AI 基金會(在新視窗中開啟)及開放安全 AI 聯盟(在新視窗中開啟);同時也應與着重落實標準的機構合作,例如正在制定實務規範、把國際標準與現實 AI 評估連結起來的 Appia 基金會。
在管理 AI 研究自主程度不斷提升及遞歸式自我改進方面,國際 AI 標準尤其重要。具體而言,這些標準可涵蓋:
除了這些標準,我們認為世界各地的關鍵基礎設施營運者和政府亦有必要建立安全通訊渠道,以便在迅速演變的前沿 AI 安全領域,分享國家安全憂慮、新出現的漏洞與威脅,以及最佳實務。美國與中國就這些領域展開對話,將是正面的一步,而即將舉行的會談正值合適時機。
調控 AI 發展步伐,並非要維持某個預定速度。在技術層面,關鍵是確保對齊研究及其成果的部署領先於能力發展。在社會層面,關鍵是運用標準、制度和協作,擴大產業網絡、社會關係及市場力量的效用,創造正和成果。最近呼籲就網絡防禦採取集體行動,正是後者的一個例子。
美國具備理想條件發揮領導作用,因為其 AI 產業處於技術前沿,而且在金融、貿易、國防、科技及資訊系統等關鍵領域的全球網絡中,仍佔據有利位置。現在能否發揮領導作用,將決定美國是塑造全球 AI 框架,還是坐視一個支離破碎、發展不均且衝突頻仍的體系在周邊成形。這也將決定先進 AI 能否鞏固美國及其盟友現有的網絡;未能發揮領導作用,則可能削弱這些網絡。
地緣政治競爭不僅關乎誰在技術上領先,也會圍繞 AI 的採用和普及展開。後者將愈來愈取決於誰能推動務實合作,並制定合理的通行規則——世界各地的企業和社會若要把未來寄託於這項技術,便會需要這些規則。
強而有力的國家治理,加上務實的國際合作,可為加強保障、持續創新,以及讓更多人共享 AI 的裨益開闢道路。


