為 AI 下一階段建立標準
我們的使命是確保通用人工智慧造福全人類。正如 Sam Altman 近期所述,以及 Jakub Pachocki 所提出,我們以三大目標為優先,推進實現這項使命的工作:
打造自動化 AI 研究員,與其反覆探索對齊問題,並尋找讓人類持續參與自我改進循環的方法,以引領下一階段的 AI 進展。
讓人們共享高度智慧機器所促成的科學進步與經濟成長成果。
以個人 AGI 賦能每一個人。
AI 正在加速我們的研究與工程工作;AI 輔助研究也推動了數學領域的進展,其中包括納維–斯托克斯千禧年難題。這些進展也讓另外兩項目標展現巨大潛力,有望促成重要的醫學發現、人人可及的醫療照護,並在世界各地為小型企業與個人創業家創造更多經濟機會。
許多企業與國家都在推進 AI,而整個領域的進展也改變了每個人面臨的機會與挑戰。除了其他效益外,能力強大且經過對齊的 AI,也將是我們度過這段轉型期的重要助力:它能強化防禦、推進對齊研究,並協助人們理解及引導 AI 發展的下一階段。
要安全度過這段轉型期,對齊研究就必須跟上這些能力的發展,確保我們與其他人所建立的系統持續符合人類價值觀,並受人類控制。隨著 AI 系統能力與自主性提升,包括承擔更多 AI 研發工作,這一點將日益重要。要讓 AI 持續安全發展並帶來益處,不僅需要推進對齊研究,也需要共同標準來引導各實驗室與各國的開發工作。
自動化 AI 研究可以採用不同程度的人類監督。隨著 AI 系統承擔更多下一代 AI 的開發工作,即使人類仍持續參與,這些系統也能日益推動遞迴式自我改進(RSI)流程。隨著這項流程更加自動化,AI 的進展速度可能迅速加快。
我們相信,自動化 AI 研究將催生能直接改善人們生活的模型。它能降低先進智慧的成本,讓世界各地的人都能受益。自動化研究也能協助我們大幅改善對齊,並建立防禦機制來因應能力日益強大的 AI——自動化 AI 研究員也可以成為自動化 AI 安全研究員。能力更強且經過對齊的系統,可以協助保護關鍵基礎設施、防範危險的 AI 智慧體,並開發新的保護措施。
完全自主的 RSI 目前尚未發生;除非且直到能夠安全實現,否則我們不應追求這項技術。是否推進以及如何推進,必須取決於我們維持人類控制的能力,以及社會針對其效益與風險所作的知情民主選擇(在新視窗中開啟)。如果缺乏適當的審慎態度,RSI 可能導致人類實際上失去對 AI 發展的控制,也無法監督自己已不再理解的研究流程。此後,AI 可能變得更加危險、更不符合對齊要求,整體而言也會對人類構成威脅。雖然我們揭露的 Hugging Face 事件並非 RSI 的直接結果,但它預示了在缺乏健全保障與對齊措施時,這類風險可能變得何等嚴重。
針對前沿 AI 開發的安全與資安實務制定國際標準,對掌握前沿發展步調的重要性,可能不亞於對齊研究本身。標準可以建立對高品質證據的共同定義,並就技術保障措施的嚴謹程度訂定一致基準。簡言之,標準可協助我們回答:「妥善降低災難性 AI 風險,應該是什麼樣子?」
現有的民主制度與機構,例如人工智慧標準與創新中心(CAISI)、州法律及聯邦 AI 架構,都能為此提供協助,新型態的公私協力關係(在新視窗中開啟)亦然。然而,AI 的開發與部署正同時在多個國家進行,其採用遍及全球,而相關影響很可能遲早會以某種形式波及每一個人。
因此,我們需要透過國際合作制定標準,以解決幾項關鍵挑戰:
碎片化——各國的評估、通報要求與事件定義可能彼此衝突,使證據更難比較、新興能力更難理解,也更難因應跨境風險。
集體行動——各國各自為政,可能導致沒有任何國家希望見到的結果。RSI 能夠加速 AI 研究本身,其速度可能超出我們集體理解進展、評估風險及維持實質人類監督的能力。
能力不均——前沿開發活動及相關專業知識在全球的分布並不均衡。這會加劇上述兩項問題。
這些挑戰同時適用於開放模型與封閉模型。
必須明確指出,任何從事自動化 AI 研究或其他先進能力開發的 AI 實驗室,都必須遵循自我負責的基本原則與現行法律,為安全推進相關工作承擔責任。我們倡議制定標準,是為了避免權力集中,並在實務上創造更好的成果。標準能讓實驗室以外更多的利害關係人參與決定這項技術應如何發展,也能提供一套清楚可見、無論特定實驗室採取何種做法都可依循的原則。若各方攜手處理上述挑戰,我們也更有可能取得更好的成果。
因此,我們認為美國應帶頭推動與世界各國合作,為前沿 AI(包括 RSI)制定全球技術標準。
儘管我們預期這項構想將隨時間大幅演進,但其中兩個面向不可或缺。
其中一種做法,是善用逐漸成形的 AI 安全研究所網絡,例如澳洲、加拿大、德國、法國、肯亞、日本、韓國、新加坡、印度及英國已成立的機構,透過 CAISI 與各國產業組織促進標準制定,並特別聚焦於:(1) 依能力基準衡量的前沿 AI 模型與開發者;以及 (2) 自動化 AI 研究(包括 RSI)的效益與風險管理。美國可以延續 CAISI 於 2024 年成立先進 AI 衡量、評估與科學國際網絡(在新視窗中開啟)的成果,匯集公共機構,共同推進 AI 衡量、評估與科學研究。
透過這項工作制定的標準,將為能力衡量與評估、風險評估及保障措施是否充分,提供共同的技術基礎。這些技術標準不會成為 AI 模型的許可證、強制上市前審查或核准要求。各國政府將自行決定是否將這些標準納入本國法律體系,以及如何納入。
這項工作也應諮詢開放模型與封閉模型開發者、獨立技術專家及學術界,以支持具競爭力的 AI 生態系。共同標準的制定過程應公開透明,且設計上不得偏袒特定企業、國家或商業模式,包括不得提高新進業者或開放權重開發者的競爭門檻。
正如我們先前所建議(在新視窗中開啟),這種做法可以借鑑航空與金融穩定等領域;在這些領域,各國既制定了共同技術標準與可信賴的合作管道,也未放棄本國權限。這項工作也應與既有及新興的標準組織密切合作,例如 ISO(在新視窗中開啟)、前沿模型論壇(在新視窗中開啟)、智慧體式 AI 基金會(在新視窗中開啟)與開放安全 AI 聯盟(在新視窗中開啟);同時也應與著重落實的組織合作,例如正在制定實務規範、銜接國際標準與現實 AI 評估的 Appia 基金會。
在管理 AI 研究日益提高的自主性與遞迴式自我改進方面,國際 AI 標準尤其重要。具體而言,這些標準可涵蓋:
除了這些標準外,我們認為全球關鍵基礎設施營運商與各國政府也必須建立安全的通訊管道,在快速發展的前沿 AI 安全領域中,共享國家安全疑慮、新興弱點與威脅,以及最佳實務。美國與中國若能就這些領域展開對話,將是正面的一步,而即將舉行的會談時機也相當適切。
掌握 AI 發展步調,並不代表維持預先設定的速度。在技術層面,這表示確保對齊研究及其部署進度領先於能力發展。在社會層面,這表示運用標準、制度與協作,強化產業網絡、社會關係及市場力量,創造正和成果。近期呼籲共同採取網路防禦行動,便是後者的例子。
美國具備領導優勢,因為其 AI 產業位居技術前沿,並且在金融、貿易、國防、科技與資訊系統等關鍵領域的全球網絡中,仍占有優越地位。現在能否發揮領導作用,將決定美國是塑造全球 AI 架構,還是眼看一個分裂、失衡且衝突不斷的體系在周遭成形。這也將決定先進 AI 能否鞏固美國及其盟友現有的網絡;若未能領導,這些網絡可能遭到削弱。
地緣政治競爭不僅取決於誰在技術上領先,也將圍繞 AI 的採用與普及展開。後者將日益取決於誰能推動務實合作,並制定合理的共同規則,讓各地企業與社會願意把未來託付給這項技術。
穩健的國家治理若能透過務實的國際合作相互連結,便可望帶來更完善的保障、持續的創新,以及更廣泛共享的 AI 效益。


