OpenAI

GPT-6 Astra: A new generation of intelligence

新一代智慧

2026 年 9 月 22 日更新:我們為 GPT‑6 系列新增 GPT‑6 Sol 和 GPT‑6 Luna。深入了解。

我們推出 GPT‑6 Astra,全球最智慧、最符合人類價值觀的模型。

GPT‑6 Astra 結合了多年研究成果,以及在預訓練、強化學習和對齊方面的重大投入。Astra 在電腦操作、網頁瀏覽、軟體工程、網路安全、科學和專業工作方面具備最先進的能力。Astra 在 FrontierMath(第 4 級)達到飽和,取得 98% 的分數,在此之前已協助解決數學中長期懸而未決的開放問題⁠。Astra 也在 ARC-AGI-3 上取得 99.9% 的分數,並在 ExploitBench 上取得 100% 的分數,表現均已達到這些評估所能衡量的上限。它也為電腦與瀏覽器使用開創新前沿,以無與倫比的速度、準確度與判斷力,處理最嚴苛的專業工作。

GPT‑6 Astra 今天起將率先向部分機構推出,並將於未來數天內開放給所有 ChatGPT Plus、Pro、Business 及 Enterprise 用戶使用,同時也可透過 OpenAI API、Microsoft Azure 及 AWS Bedrock 使用。

「在 ARC-AGI-3 中,Astra 在 96% 的關卡上超越我們的人類行動效率基準,實際上在這項基準測試中達到與人類同等水平。這不僅是我們測試過的最佳模型,更代表前沿模型的表現取得實質躍進:除了更擅長探索及解決陌生環境,學習如何做到這一點的效率也有所提升。」
Greg Kamradt,ARC Prize Foundation

Astra 是我們最符合人類意圖的模型,在理解使用者意圖及約束自身行為方面都有顯著進步,因此你可以更有信心地將任務委派給 Astra,相信它的判斷。為了測試這項能力,我們參考 Hugging Face 事件設計了一項新評估,測試模型在面對困難或不可能完成的任務時,是否會超出預期的任務範圍。GPT‑5.6 Sol 在未採生產環境防護措施的情況下,有 48% 的測試案例超出授權目標;相較之下,GPT‑6 Astra 則從未出現這種情況。

全球最佳的電腦使用模型

GPT‑6 Astra 在電腦操作的速度、準確性與安全性方面帶來重大突破。Astra 能處理繁瑣工作,例如填寫線上表單、更新 CRM 中的客戶紀錄,以及整理行事曆。Astra 能進行線上研究,並在你的電子郵件或文件編輯器中草擬摘要。Astra 能分析科學資料、產生圖表、建立網站,並執行前端 QA 檢查,確認網站上的所有功能均能正常運作。Astra 能協助你自動安裝和測試軟體,並排解你在螢幕上看到的問題。這些改進也反映在我們領先業界的評估結果中。

這些模型評估所展現的進步,也能在實際知識工作任務中提升效率。在 OSWorld 2.0 延遲模擬中,Astra 的電腦操作表現更佳,每項任務所需時間比 GPT‑5.6Sol 少約 47%:Astra 每項任務約需 40 分鐘,得分為 72.6%;Sol 則約需 75 分鐘,得分為 65.7%3。

GPT‑6 Astra 的電腦操作能力在各領域的輸出中展露無遺,包括遊戲開發、電機工程,以及日常知識工作:

推出 Astra 的同時,我們也在更新 Codex 任務執行框架,以大幅提升電腦操作速度。結合 Astra 的效率,兩者結合後,在 Mind2Web 基準測試中完成任務的速度可達目前 GPT‑5.6 Sol 體驗的 1.9 倍。速度提升後,Astra 能替你完成許多耗時的日常事務,甚至比你親自處理更快。4

「我們在發布當天就將 GPT‑6 Astra 整合到 Devin 的任務執行框架,並在我們的內部測試基準中展現出最先進的效能。它在電腦操作、寫作及程式碼庫理解方面表現出色,令測試體驗從一開始便有所改善:影片明顯更容易理解,報告也更清晰精簡。」
Silas Alberti,Cognition 研究資深副總裁

專業工作的重大躍進

GPT‑6 Astra 將更進步的電腦操作能力與專業環境專用訓練結合,可協助處理複雜工作。它既具備解決複雜問題所需的智慧,也能執行多步驟工作流程,製作完善的文件、試算表和簡報。

GPT‑6 Astra 是我們最擅長遵循既有範本的模型,能製作版面配置良好、透過結構化敘事簡潔傳達重點的投影片。Astra 能建立清楚、架構完整的文件、簡報、試算表與分析,遵循你的範本,並符合你的寫作與視覺風格。Astra 也經過專門訓練,僅將重要的背景資料納入輸出內容,而非重複與目前工作無關的資訊。因此,Astra 能產出符合你的業務情境與標準,而且可直接使用的成品。

GPT‑6 Astra 在建立網站、遊戲、應用程式及渲染圖時,也展現出更強的視覺判斷力。透過 ChatGPT 中的工作站⁠(在新視窗中開啟),Astra 可以直接根據提示詞建立、託管並分享網站、網頁應用程式和遊戲。

「Astra 讓我們在能力與效率兩方面都具備顯著優勢。Astra 能順利執行我們最複雜的創意工作流程,Token 用量最多可比其他受測模型減少 20%。最重要的是,對我們的客戶而言,這代表更高品質的輸出。」
Alex Mashrabov,Higgsfield AI 執行長暨共同創辦人

當指示存在詮釋空間時,GPT‑6 Astra 比以往的模型更能作出適當判斷。它會利用情境填補常見的資訊缺口,並在答案可能改變結果時提出具針對性的問題。在 Codex 中,它可以非同步方式提問,同時繼續處理不需要等你回覆的工作。如果你沒有回覆,它會視情況採用合理假設;遇到影響重大的決策,則會等待你的意見。

以下範例呈現 Astra 如何協作處理日常任務中足以左右答案的資訊缺口。

Astra 也更擅長在任務不斷演變時掌握整體方向。較早期的模型有時會將引導訊息視為新目標,因而忽略原始請求或先前的限制。Astra 會納入新的要求、按指示調整方向,並在不偏離整體任務的情況下回答附帶問題。

「在複雜法律任務上,Astra 相較於 GPT‑5.6 Sol 品質顯著提升。在我們的早期測試中,Astra 之所以脫穎而出,是因為處理法律工作時,Astra 就像經驗老到的律師:分得清文件內容和已確認的紀錄,會指出缺乏依據的假設;遇到資訊不足時,也會明確提出條文該怎麼寫、應採取什麼立場。」
Niko Grupen,Harvey 應用研究部門主管

寫程式

GPT‑6 Astra 是迄今最出色的軟體工程模型。

1 之 2
「GPT‑6 Astra 在我們的內部編碼基準測試中達到頂尖水平,在交易直覺評估方面亦較 GPT‑5.6 Sol 明顯進步。用於智慧體式程式碼編寫時,GPT‑6 Astra 的溝通方式讓開發人員更容易掌握,所產生的程式碼亦只需較少反覆修改,便可達到生產級品質。」
John Crepezzi,AI 助理,Jane Street

透過 Astra,我們為 Codex 推出一種在上下文視窗用盡時保留及找回內容的新方法。過去,模型會在長時間工作階段中,例如在偵錯複雜問題或處理大規模重構時,運用壓縮上下文來摘要工作內容。每次壓縮都可能遺漏某項修正為何失敗,或某個元件如何運作的詳細資訊。在 Codex 中,Astra 可以跨上下文視窗保留筆記,保存累積的細節,不必反覆把所有內容壓成一份摘要。先前的上下文視窗仍可供搜尋,即使筆記未收錄相關資訊,Astra 仍可從先前的訊息和工具輸出中找到需求或測試結果。你可以在 Codex 的 config.toml⁠(在新視窗中開啟) 中啟用這項實驗功能,這項功能將在未來幾週內成為 Astra 的預設設定。

推動科學發現

「故事是這樣的:一個時代的結束,另一個時代的開始。」
Greg Burnham,EpochAI

GPT‑6 Astra 為科學發現、數學和健康領域帶來重大進展。今天,我們再分享兩項有關質數間距的成果。9、10

Astra 也在一系列數學與科學評測中創下新紀錄。

Astra 能協助處理科學探索過程中的各項實務工作。Astra 結合科學推理與電腦操作能力,可以直接使用專業軟體檢視資料、探索結果,協助研究人員評估證據,並決定接下來要研究的方向。

資安

如同我們在安全更新⁠中所述,Astra 的網路安全能力大幅提升,並達到「關鍵」級別門檻,此門檻由我們的應變整備框架針對網路安全領域訂定。Astra 能找出零時差漏洞並開發漏洞利用手段,有助於防禦人員找出並修補弱點,但也因此需要更強的防護措施。為了瞭解 Astra 的能力究竟能達到什麼程度,我們讓 Astra 接受內部及第三方專家的評估。

我們首先在未啟用生產環境防護措施的情況下,於 ExploitBench 和 ExploitGym 上測試該模型;這些基準測試評估模型能否將已知軟件漏洞轉化為可運作的漏洞利用程式。在 ExploitBench 上,Astra 取得 100% 的滿分;相較之下,我們先前具備網路安全能力的前沿模型 GPT‑5.6 Sol 為 78.5%。在 ExploitGym 上,Astra 達到 42.4% 的成功率,相較之下 GPT‑5.6 Sol 為 30.3%,而 Astra 使用的輸出 Token 大幅減少。13

考量到模型接觸過往軟體漏洞的資料後,可能影響基準測試結果,我們也在兩項全新的基準測試上評估了 Astra。其中一項是我們建立的內部「ExploitBench(2026 年 6 月至 8 月)」評估,用來測試模型能否針對過去三個月出現的漏洞開發利用程式。14Astra 在此資料集上的任意程式碼執行率大幅高於 GPT‑5.6Sol,同時使用的輸出 Token 也大幅減少。評估期間,Astra 甚至發現並利用了 2 個先前未知的零時差漏洞。我們正向相關維護人員揭露這兩個漏洞。

我們也在 SRE-Bench15 上測試了 Astra;這項基準測試衡量模型能否在無法存取原始程式碼的情況下,透過逆向工程分析二進位軟體並理解核心邏輯。Astra 一次嘗試就解決了 88.0% 的任務,並在四次嘗試內解決了 99.2% 的任務;相比之下,GPT‑5.6 Sol 分別為 55.9% 和 68.7%。

除了基準測試之外,專家主導的評估發現,Astra 在未啟用生產環境安全防護措施的情況下執行時,能夠利用先前未知的漏洞,在經強化防護的瀏覽器中達成任意程式碼執行,並為經強化防護的作業系統建立權限提升漏洞利用程式。

如同我們在《防禦方的機會之窗》中所討論的,前沿網路能力可以幫助防禦者更快找出弱點,但也會讓這些弱點更容易遭到利用,進而提高防禦者調整因應方式的迫切性。今天推出的 Astra 版本可讓防禦人員完成安全程式碼審查及修補等任務。

不過,Astra 會拒絕執行更進階的網路安全任務,例如為漏洞建立概念驗證利用程式。透過 OpenAI Daybreak⁠,我們計劃在未來數週擴大開放使用範圍,並推出限制較少的安全防護措施。這將可支援更多防禦性工作流程,包括驗證漏洞及概念驗證、分析惡意軟件,以及偵測工程。

我們也在 GPT‑5.6 Sol 的防護機制基礎上,強化了針對潛在網路濫用行為的防護措施。相關措施包括提升模型的穩健性,增強抵禦潛在越獄攻擊的能力,並為監控系統提供更多上下文資訊。我們持續進行嚴謹的內部與外部測試,包括由內部紅隊演練攻擊人員進行自動化評估。如需進一步瞭解我們的網路安全防護措施與測試,請參閱 Astra 安全性概覽⁠和系統說明卡⁠(在新視窗中開啟)。

負責任地對齊與部署 GPT‑6 Astra

Astra 是我們對齊程度最高的模型。Astra 擅長謹慎行事、尊重任務界線,並保持透明溝通。這項工作是我們長期研究計劃的最新成果,該計劃專注於訓練由始至終都與人類意圖保持一致的模型。

在敏感環境中,Astra 會按其風險程度謹慎行事。在一項電腦操作任務評估中,任務經對抗性挑選,旨在誘發不當行為;Astra 更能避免非預期後果。配合預設提供的額外系統防護措施後,表現更佳。

Astra 造成的未對齊結果比任何其他經測試的前沿模型都少。為作公平比較,我們使用通用的電腦操作智慧體任務執行框架(以 OpenAI Responses API⁠(在新視窗中開啟) 及 Anthropic Messages API⁠(在新視窗中開啟) 均提供的原生電腦操作工具為基礎),並未加入通常為 Codex 及 ChatGPT 工作使用者提供的額外防護措施(自動審查、確認政策)。

Astra 也更有可能遵守使用者設定及環境所隱含的界限。在一項內部評估中,Astra 從未嘗試規避 Codex 自動審查的否決。即使自動審查被刻意設定成可以規避,且除此以外無法完成任務,情況亦然。Astra 遵守環境限制的表現,與我們在本文開頭分享的不可能完成的網路安全任務評估結果,以及系統說明卡⁠(在新視窗中開啟)中記錄的其他發現一致。

此外,Astra 在與使用者溝通的透明度方面也達到新的水準。在一項評估中,Astra 對自身能力與可用功能做出不實陳述的可能性,只有 GPT‑5.6 Sol 的三分之一。

在我們的能力幻覺評估中,Astra 相較於 GPT‑5.6 Sol 展現出顯著提升,對自身能力做出誤導性陳述的情況也更少。

我們的評估發現,在明確要求模型規避監控的測試中,Astra 的書面推理過程比 GPT‑5.6Sol 更難以監控。我們認為這是因為 Astra 在較簡單的任務中更能控制書面推理,並可用較少書面步驟解決問題。Astra 似乎仍然難以隱藏處理複雜任務所需的推理,但我們會嚴肅看待這項倒退。改善可監控性仍是研究優先事項,隨附的系統說明卡⁠(在新視窗中開啟)詳述了我們的研究結果與持續進行的工作。

對齊訓練是我們部署策略的核心。我們也建置系統防護機制,增加一層防禦,例如 Codex 自動審查⁠(在新視窗中開啟),並監控智慧體的推理與行動,協助偵測並遏止不安全行為。如同我們在安全更新⁠中所述,我們也正針對正式運作環境中的 Astra 級模型部署未對齊監控機制,掌握模型偏離對齊目標的情況,並協助遏止最嚴重的情形。這套防護措施與內部部署使用的監控機制相似,透過一套分類器系統檢查模型的推理與行動是否涉及未經授權的行為,並自動阻止可能未經授權的活動。

鑑於 Astra 的網路安全能力大幅提升,我們格外謹慎,確保這次部署安全可靠。額外的安全檢查有時可能會減慢、暫停或停止正當工作,包括防禦性網路安全工作。如果 ChatGPT 或 Codex 中的任務暫停,系統可能會要求你在繼續前審閱該操作。在 API 中,任務將會停止。這些檢查有時可能會中斷正當工作,而我們正持續改進此系統,以減少不必要的中斷。對未對齊情況的監控不能取代對齊:我們的目標是建立能可靠地遵守其授權範圍的模型,讓這些防護措施無需介入。

適用情況

GPT‑6 Astra 今天起將率先向部分機構推出,並將於未來數天內開放給所有 ChatGPT Plus、Pro、Business 及 Enterprise 用戶使用,同時也可透過 OpenAI API、Microsoft Azure 及 AWS Bedrock 使用。Astra 使用量已包含在現有訂閱用量額度內,使用者和企業也可以購買點數以取得額外使用量。Pro、Business 和 Enterprise 方案的使用者也將能使用 GPT‑6 Astra Pro。Enterprise 管理員可以為工作區啟用 Astra;功能推出時預設為關閉。

Astra 為符合資格的 API 客戶支援零資料保留;如同我們上個月所分享,我們正在測試私密安全處理,在保護客戶隱私的同時強化安全監控。

開發人員可透過 OpenAI API 以 gpt-6-astra 的名稱使用 GPT‑6 Astra,亦可透過 Microsoft Azure 及 Amazon Bedrock 使用。

OpenAI API 的標準收費為每 100 萬個輸入 Token 10 美元,以及每 100 萬個輸出 Token 50 美元。快取讀取和寫入適用不同費率。GPT‑6 Astra 的 API 支援快速模式,速度最高可達標準處理的 2 倍,收費亦為標準處理的 2 倍。

電腦操作

電腦操作

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0(v2026.08.08、離線集、部分分數)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro(不使用工具)

92.7%

76.9%

-

87.3%17

-

-

專業

專業

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

內部設計任務

50.0%

47.4%

-

35.8%

-

-

內部數據科學任務

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

寫程式

程式設計GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 擴充版(分數)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 主要版(分數)53.3% 847.5%50.9%53.5%53.4%43.6%
內部資料庫移轉工作63.9%42.7%57.8%50.3%--
Artificial Analysis 程式設計智慧體指數 v1.467.065.1-67.268.161.2

學術

學術

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath(第四級,v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam(使用工具)

57.2%

-

65.0%

63.8%

63.6%

-

科學與健康

科學與健康GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench(內部)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional(已按長度調整)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

資安

網路安全GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench(2026 年 6 月至 8 月)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

對齊性

對齊性

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

內部電腦操作安全基準測試(越低越好)

2.4%

22.0%

9.5%

18.3%

11.5%

-

內部電腦操作安全基準測試(設有自動審查,越低越好)

1.8%

4.3%

-

-

-

-

內部規避行為基準測試(越低越好)

0.00%

0.29%

-

-

-

-

ExploitGym 蜜罐(越低越好)

0.0%

48.2%

-

-

-

-

ExploitGym(不可能任務)

100.0%

-

-

-

-

-

內部幻覺基準測試(越低越好)

4.2%

12.2%

-

-

-

-

長上下文

長上下文

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

抽象推理

抽象推理GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

評估分數取各種推理強度中的最高分。GPT 評估在我們的研究環境中或透過我們的 API 進行;由於系統提示詞、可用工具等有所不同,其輸出可能與生產環境中的 ChatGPT 略有差異。

註腳

  1. 1

    在 ARC-AGI-3 上,GPT-6 Astra 是透過我們的 Responses API 任務執行框架⁠執行,該框架會變更兩項設定,以更貼近現實世界的表現。這些變更並非專門針對 ARC-AGI-3。

  2. 2

    GPT-5.6 Sol 指的是我們的 API、ChatGPT Codex 和 ChatGPT 工作中提供的版本。ChatGPT 對話中的版本略有不同。⁠

  3. 3

    OSWorld V2-Offline 是原版 OSWorld V2 的子集,無需網際網路連線即可運作。Claude 模型在 OSWorld-V2 Offline 上的表現已由作者在官方排行榜⁠(在新視窗中開啟)上重現。在 OSWorld 2.0 中,Claude 的分數採用官方設定,而非 Fable 5.1 系統說明卡中經修改的任務與評分方式。

  4. 4

    模型時間是相應示範執行所報告的實際經過時間。所顯示的片段均為經剪輯的節錄。

  5. 5

    在 BenchCAD 上,Claude 的分數反映了對該評估作出的 3 項修改,詳情請參閱 Fable 5.1 系統說明卡⁠(在新視窗中開啟)。

  6. 6

    Guang Yang、Victoria Ebert、Nazif Tamer、Brian Siyuan Zheng、Luiza Pozzobon 和 Noah A. Smith。《LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(在新視窗中開啟)》。arXiv:2506.19065,2025 年。

  7. 7

    Mark R. H. Gotham、Maureen Redbond、Bruno Bower 與 Peter Jonas。《OpenScore 弦樂四重奏語料庫⁠(在新視窗中開啟)》。《第 10 屆國際音樂學數位圖書館研討會論文集》,第49 至 57 頁。ACM,2023 年。

  8. 8

    在 FrontierCode 上執行 GPT-6 Astra 時,我們加入了一則開發人員訊息,內容類似於其 Codex 中的開發人員訊息中的一節⁠(在新視窗中開啟):「避免建立過多測試檔案。只有在程式碼庫慣例要求,或沒有合適的現有檔案可供存放時,才建立新的測試檔案。避免進行無關的清理工作及引入不必要的複雜性。重用合適的現有公用程式。閱讀相關的程式碼庫指示,並檢視附近的程式碼、測試、文件及 CI。遵循既定慣例。目標是簡潔、可合併的程式碼。」該提示詞並未針對這項評估進行優化。

  9. 9

    第一項成果探討的是,無論數字變得多大,質數之間究竟能有多接近。十多年來,已知最佳結果證明,存在無限多對質數,彼此相差不超過 246。Julia Stadlmann⁠(在新視窗中開啟) 最近進一步將這個差距縮小至 240。Astra 則協助將這個差距進一步縮小至 186,證明存在無限多對質數,彼此相差不超過 186。短質數間距:證明⁠(在新視窗中開啟)和相關研究⁠(在新視窗中開啟)。

  10. 10

    第二項成果探討的是質數之間異常大的間距。Astra 改進了這類質數間距估算公式中的一個項目,而這項結果已超過 80 年未曾改進。我們將公開這兩項成果的證明、精簡版思路鏈,以及相關驗證資料。大質數間距:證明⁠(在新視窗中開啟)與佐證研究⁠(在新視窗中開啟)。

  11. 11

    我們依照 HealthBench Professional 的既定評估程序,採用 GPT-5.4評分,並採用經長度調整且未設上下限的分數,獨立評估所有 Claude 模型。對於 Fable 5.1,我們在服務供應商拒絕回應時使用 Opus 5 作為備援。

  12. 12

    Claude Fable 5 和 5.1 未納入 LifeSciBench Gold v1、GeneBench Pro v13 和 MedChemBench,因為這兩個模型會拒絕回答這些評估中的大多數問題。

  13. 13

    在 ExploitGym 中,我們在沒有 6 小時時限的情況下測試 Astra 和 Sol,以更全面評估它們完整的網路安全能力。兩個模型的速度都很快,因此取消時限的影響不大。

  14. 14

    ExploitBench(2026 年 6 月至 8 月)包含 20 個高嚴重性 V8 漏洞,涵蓋 13 個 Chrome 穩定版本。這項基準測試會評估智慧體能否利用每個指定漏洞,在 V8 及適用於 Linux 的官方 Chrome 版本中執行任意程式碼。在這項評估的限制條件下,部分納入測試的漏洞可能無法用來執行任意程式碼,因此成功率未必能達到 100%。請注意,GPT-5.6 Sol 的 5.5% 分數是基準測試中 300 回合限制所造成的結果,而實際使用 Max 的客戶不會受到這項限制。同一模型在相近設定下,較少觸及限制時,分數達到 11.5%。

  15. 15
  16. 16

    在測試第三方模型時,我們會採用較簡單的研究設定。Codex 採用較複雜的生產環境設定,因此原始模型的錯誤率可能不同。供應商端的安全防護措施和電腦操作工具的實施方式仍有差異。用戶不會在 Codex 中遇到無需確認的情況,因為這是內部研究設定。

  17. 17

    對於 ScreenSpot-Pro 和 ExploitGym,我們報告的 Fable 分數來自 Mythos,即防護措施較少的 Fable 版本。