OpenAI

GPT-6 Astra: A new generation of intelligence

新一代智能

2026 年 9 月 22 日更新:我們為 GPT‑6 系列新增 GPT‑6 Sol 和 GPT‑6 Luna。了解詳情。

我們現正推出 GPT‑6 Astra,這是全球智能水平最高、對齊程度最佳的模型。

GPT‑6 Astra 結合了多年研究成果,以及在預訓練、強化學習和對齊方面的重大投入。Astra 在電腦操作、瀏覽、軟件工程、網絡安全、科學及專業工作方面均達到最先進水平。Astra 在 FrontierMath 第 4 級取得 98% 的成績,已達到這項評估所能衡量的上限;此前亦已協助解決數學界長期懸而未決的問題⁠。Astra 亦在 ARC-AGI-3 取得 99.9%,並在 ExploitBench 取得 100%,表現均已達到這些評估所能衡量的上限。它亦在電腦及瀏覽器操作方面創下新標準,以無可比擬的速度、準確度及判斷力處理最具挑戰性的專業工作。 

GPT‑6 Astra 今日開始向少數機構推出,並將於未來數天內開放予所有 ChatGPT Plus、Pro、Business 及 Enterprise 用戶使用,同時亦可透過 OpenAI API、Microsoft Azure 及 AWS Bedrock 使用。

「在 ARC-AGI-3 中,Astra 在 96% 的關卡上超越我們的人類行動效率基準,實際上在這項基準測試中達到與人類同等水平。這不僅是我們測試過的最佳模型,更代表前沿模型的表現取得實質躍進:除了更擅長探索及解決陌生環境,學習如何做到這一點的效率亦有所提升。」
ARC Prize Foundation Greg Kamradt

Astra 是我們對齊程度最高的模型,在理解用戶意圖及模型行為方面均有顯著改進,讓你更有信心依賴 Astra 的判斷來委派任務。為測試這一點,我們其中一個做法是參考 Hugging Face 事件,建立一項新評估,判斷模型面對困難或不可能完成的任務時,會否超出預定範圍。在沒有生產環境防護措施的情況下,GPT‑5.6 Sol 有 48% 的情況會超出獲授權的目標範圍;相比之下,GPT‑6 Astra 的相應比率則為 0%。

全球最佳的電腦操作模型

GPT‑6 Astra 將電腦操作的速度、準確度和安全性推向新水平。它可處理填寫網上表格、更新 CRM 中的客戶記錄及整理日程等繁瑣工作。它可以進行網上資料搜集,並在你的電郵或文件編輯器中草擬摘要。它可以分析科學數據、生成圖表、建立網站,並執行前端 QA 檢查,以確保該網站上的所有功能都正常運作。它可自行為你安裝和測試軟件,並排查畫面上出現的問題。這些改進亦反映在我們領先的評估成績中。

這些改進也能在實際知識工作任務中帶來顯著的效率提升。在 OSWorld 2.0 的延遲模擬中,Astra 的電腦操作表現更佳,每項任務所需時間亦較 GPT‑5.6 Sol 少約 47%:Astra 每項任務約需 40 分鐘,得分為 72.6%;Sol 則約需 75 分鐘,得分為 65.7%3。

從遊戲開發、電機工程以至日常知識工作的成果,都可見 GPT‑6 Astra 的電腦操作能力:

除了 Astra 之外,我們亦正在更新 Codex 任務執行框架,以大幅提升電腦操作速度。配合 Astra 的高效率,在 Mind2Web 基準測試中,任務完成速度達到目前 GPT‑5.6 Sol 體驗的 1.9 倍。模型速度有所提升,能比你更快代為處理許多耗時的生活任務4。

「我們會在推出當日將 GPT‑6 Astra 整合至 Devin 的任務執行框架;它在我們的內部測試基準中達到頂尖水平。它在電腦操作、寫作及程式碼庫理解方面表現出色,令測試體驗從一開始便有所改善:影片明顯更容易理解,報告亦更清晰精簡。」
Silas Alberti,Cognition 研究高級副總裁

專業工作的重大變革

GPT‑6 Astra 結合電腦操作能力的進展,以及針對專業環境的訓練,協助處理複雜的工作任務。它既具備解決複雜問題所需的智能,也能執行多步驟工作流程,製作完善的文件、試算表和簡報。

GPT‑6 Astra 是我們在遵循現有範本,以及製作排版得宜、脈絡清晰、簡潔傳達重點的投影片方面最出色的模型。它可按你的範本,製作清晰且結構完善的文件、簡報、試算表和分析,配合你的寫作和視覺風格。Astra 亦經過針對性訓練,只將相關上下文納入輸出,不會重複對手頭工作無用的資料。因此,它能製作更多可直接使用、符合業務情境和標準的成果。

GPT‑6 Astra 在建立網站、遊戲、應用程式及渲染圖時,亦展現出更強的視覺判斷力。透過 ChatGPT 中的 工作站⁠(在新視窗中開啟),Astra 可以直接根據提示詞建立、託管及分享網站、網頁應用程式和遊戲。

「Astra 在能力和效率方面都為我們帶來顯著優勢。它能成功執行我們最複雜的創意工作流程,所用的 Token 比我們測試過的其他模型最多減少 20%。最重要的是,對我們的客戶而言,這代表更高質素的輸出結果。」
Higgsfield AI 行政總裁兼聯合創辦人 Alex Mashrabov

當指示存在詮釋空間時,GPT‑6 Astra 比以往的模型更能作出適當判斷。它會利用情境填補常見的資訊缺口,並在答案可能改變結果時提出具針對性的問題。在 Codex 中,它可以非同步方式提問,同時繼續處理不依賴你回覆的工作。如果你沒有回覆,它會在適當情況下按合理假設繼續進行,但遇到影響重大的決定時,會等待你的意見。

以下例子展示 Astra 如何協作處理日常任務,而缺少的資料可能會大幅改變答案。

Astra 亦更擅長在任務不斷演變時掌握整體方向。較早期的模型有時會將引導訊息視為新目標,因而忽略原始請求或先前的限制。Astra 會納入新的要求、按指示調整方向,並在不偏離整體任務的情況下回答附帶問題。

「在各種複雜法律任務中,Astra 的表現質素較 GPT‑5.6 Sol 有顯著提升。在早期測試中,Astra 的突出之處,在於它能像判斷敏銳的律師一樣處理法律工作:分清文件內容與已確認的記錄,指出缺乏依據的假設,並針對資料缺口,確定文件草擬時應採取的具體立場。」
Harvey 應用研究主管 Niko Grupen

編碼

GPT‑6 Astra 是迄今最適合軟件工程的模型。

1/2
「GPT‑6 Astra 在我們的內部編碼基準測試中達到頂尖水平,在交易直覺評估方面亦較 GPT‑5.6 Sol 明顯進步。用於智能代理式編碼時,GPT‑6 Astra 的溝通方式讓開發人員更容易掌握,所產生的程式碼亦只需較少反覆修改,便可達到生產級質素。」
Jane Street AI 助理團隊 John Crepezzi

隨着 Astra 推出,我們亦引入新方法,讓 Codex 在上下文視窗填滿時保留和擷取上下文。過往,模型在長時間工作階段中,例如排查複雜問題或處理大型重構時,會利用上下文壓縮來總結工作內容。每次上下文壓縮都可能遺漏修正失敗的原因,或元件運作方式等細節。在 Codex 中,Astra 可以跨上下文視窗保留筆記,保存累積的細節,而無需反覆將它們壓縮成單一摘要。較早的上下文視窗仍可供搜尋,因此即使筆記未有記下某項資料,Astra 仍可從之前的訊息和工具輸出中找到要求或測試結果。你可在 Codex 的 config.toml⁠(在新視窗中開啟) 中啟用這項實驗性功能,未來幾星期,這項功能將成為 Astra 的預設設定。

推進科學發現

「這意味着一個時代的結束,另一個時代的開始。」
Greg Burnham,EpochAI

GPT‑6 Astra 為科學發現、數學和健康領域帶來重大進展。今天,我們再分享兩項有關質數間距的成果9及10。

Astra 亦在一系列數學及科學評估中創下新紀錄。

Astra 可協助處理科學發現背後的實務工作。透過結合科學推理與電腦操作能力,它可直接在專業軟件中檢視資料及探索結果,協助研究人員評估證據,並決定下一步研究方向。

網絡安全

正如我們在安全更新⁠中所述,Astra 的網絡安全能力大幅提升,並達到網絡安全方面的「關鍵」門檻,即我們的防範應對架構所界定的能力級別。它識別及開發零日漏洞利用程式的能力,可協助防禦人員找出並修補弱點,但亦因而需要更強的防護措施。為了解這些能力達到甚麼程度,我們讓 Astra 接受內部及第三方專家評估。

我們首先在未啟用生產環境防護措施的情況下,於 ExploitBench 和 ExploitGym 上測試該模型;這些基準測試評估模型能否將已知軟件漏洞轉化為可運作的漏洞利用程式。在 ExploitBench 中,Astra 取得 100% 滿分;我們上一款具備前沿網絡安全能力的模型 GPT‑5.6 Sol 則為 78.5%。在 ExploitGym 中,Astra 的成功率達 42.4%,GPT‑5.6 Sol 則為 30.3%,而 Astra 使用的輸出 Token 大幅減少13。

考慮到接觸過往軟件漏洞可能影響基準測試結果,我們亦用兩項全新的基準測試評估 Astra。首先,我們建立了內部的「ExploitBench(2026 年 6 月至 8 月)」評估,利用過去 3 個月的漏洞,測試漏洞利用程式開發能力14。Astra 在此資料集上的任意程式碼執行率大幅高於 GPT‑5.6 Sol,同時使用的輸出 Token 亦大幅減少。評估期間,Astra 甚至發現並利用了 2 個先前未知的零日漏洞。我們正向相關維護人員披露這兩個漏洞。

我們亦在 SRE-Bench15 上測試了 Astra;這項基準測試衡量模型能否在無法存取原始程式碼的情況下,對軟件二進制檔案進行逆向工程,以理解其核心邏輯。Astra 在單次嘗試中完成了 88.0% 的任務,在 4 次嘗試內則完成了 99.2%;GPT‑5.6 Sol 的相應成績為 55.9% 和 68.7%。

除了基準測試,專家主導的評估亦發現,Astra 在未啟用生產環境防護措施時,能利用此前未知的漏洞,在經安全強化的瀏覽器中執行任意程式碼,並為經安全強化的操作系統建立權限提升漏洞利用程式。

正如我們在《防禦人員的機會之窗》中所討論,前沿網絡安全能力可協助防禦人員更快找出弱點,但也讓弱點更容易被利用,因此防禦人員更迫切需要作出調整。今天推出的 Astra 版本可讓防禦人員完成安全程式碼審查及修補等任務。

不過,Astra 會拒絕執行更進階的網絡安全任務,例如為漏洞建立概念驗證利用程式。透過 OpenAI Daybreak⁠,我們計劃在未來數週擴大開放使用範圍,並推出限制較少的安全防護措施。這將可支援更多防禦性工作流程,包括驗證漏洞及概念驗證、分析惡意軟件,以及偵測工程。

我們亦在 GPT‑5.6 Sol 的多層防護措施基礎上,加強了防範潛在網絡濫用的保障。這些措施包括提升模型的穩健性,以更有效抵禦潛在越獄攻擊,並為監察系統提供更多上下文。我們持續進行嚴格的內部及外部測試,包括由我們的內部紅隊演練的攻擊方進行自動化評估。如欲進一步了解我們的網絡安全防護措施及測試,請參閱 Astra 安全概覽⁠及系統說明卡⁠(在新視窗中開啟)。

以負責任的方式對齊及部署 GPT‑6 Astra

Astra 是我們對齊程度最高的模型。Astra 擅長謹慎行事、尊重任務界線,並保持透明溝通。這項工作是我們長期研究計劃的最新成果,該計劃專注於訓練由始至終都與人類意圖保持一致的模型。

在敏感環境中,Astra 會按其風險程度謹慎行事。在一項電腦操作任務評估中,任務經對抗性挑選,旨在誘發不當行為;Astra 更能避免非預期後果。配合預設提供的額外系統防護措施後,表現更佳。

Astra 造成的未對齊結果比任何其他經測試的前沿模型都少。為作公平比較,我們使用通用的電腦操作智能代理任務執行框架(以 OpenAI Responses API⁠(在新視窗中開啟) 及 Anthropic Messages API⁠(在新視窗中開啟) 均提供的原生電腦操作工具為基礎),並未加入通常為 Codex 及 ChatGPT 工作用戶提供的額外防護措施(自動審查、確認政策)。

Astra 亦更有可能遵守用戶設定及環境所隱含的界限。在一項內部評估中,Astra 從未嘗試規避 Codex 自動審查的否決。即使自動審查被刻意設定成可以規避,且除此以外無法完成任務,情況亦然。Astra 遵守環境限制的表現,與我們在本文開首分享的不可能完成的網絡安全任務評估結果,以及系統說明卡⁠(在新視窗中開啟)中記錄的其他發現一致。

Astra 在與用戶透明溝通方面亦樹立新標準。在一項評估中,Astra 就自身能力及可用功能作出不準確陳述的可能性,只有 GPT‑5.6 Sol 的三分之一。

在我們針對能力幻覺的評估中,Astra 較 GPT‑5.6 Sol 有顯著改善,較少對自身能力作出誤導性聲稱。

我們根據明確要求 Astra 規避監察的測試,發現其書面推理比 GPT‑5.6 Sol 更難監察。我們認為這是因為 Astra 在較簡單的任務中更能控制書面推理,並可用較少書面步驟解決問題。Astra 似乎仍然難以隱藏處理複雜任務所需的推理,但我們會嚴肅看待這項倒退。提升可監察性仍然是研究重點,隨附的系統說明卡⁠(在新視窗中開啟)詳述我們的研究結果及持續進行的工作。

對齊訓練是我們部署方法的核心。作為額外防線,我們亦建立 Codex 自動審查⁠(在新視窗中開啟)等系統防護措施,並監察智能代理的推理和行動,以協助偵測及遏止不安全行為。正如我們在安全更新⁠中所述,我們亦正在生產環境中為 Astra 級模型部署未對齊行為監察機制,以便掌握未對齊行為,並協助遏止其中最嚴重的情況。這些防護措施與我們對內部部署的監察類似,當中包括一套分類器,用以檢查模型的推理和行動是否涉及未獲授權的行為,並自動停止可能未獲授權的活動。

鑑於 Astra 的網絡安全能力大幅提升,我們正格外審慎,確保這次部署安全穩妥。額外的安全檢查有時可能會減慢、暫停或停止正當工作,包括防禦性網絡安全工作。如果 ChatGPT 或 Codex 中的任務暫停,系統可能會要求你在繼續前審閱該操作。在 API 中,任務將會停止。這些檢查有時可能會中斷正當工作,而我們正持續改進此系統,以減少不必要的中斷。對未對齊情況的監察不能取代對齊:我們的目標是建立能可靠地遵守其授權範圍的模型,讓這些防護措施無需介入。

供應情況

GPT‑6 Astra 今日開始向少數機構推出,並將於未來數天內開放予所有 ChatGPT Plus、Pro、Business 及 Enterprise 用戶使用,同時亦可透過 OpenAI API、Microsoft Azure 及 AWS Bedrock 使用。Astra 使用量已包含在現有訂閱用量限額內;用戶和企業亦可購買積分,以供額外使用。Pro、Business 及 Enterprise 計劃用戶亦可使用 GPT‑6 Astra Pro。Enterprise 管理員可為工作區啟用 Astra;推出時預設不會啟用。

Astra 支援合資格 API 客戶使用零資料保留,而正如我們上月所分享,我們正測試 Private Safety Processing,在保障客戶私隱的同時加強安全監察。

開發人員可透過 OpenAI API 以 gpt-6-astra 的名稱使用 GPT‑6 Astra,亦可透過 Microsoft Azure 及 Amazon Bedrock 使用。

OpenAI API 的標準收費為每 100 萬個輸入 Token 10 美元,以及每 100 萬個輸出 Token 50 美元。快取讀取和寫入適用不同收費。GPT‑6 Astra 的 API 支援快速模式,速度最高可達標準處理的 2 倍,收費亦為標準處理的 2 倍。

電腦操作

電腦操作GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0(8 月版本,部分得分)---66.1%70.6%-
OSWorld 2.0(8 月版本、離線子集、部分得分)------
ScreenSpot-Pro92.6%76.8%----
BrowseComp92.1%90.4%-87.4%90.8%-

專業

專業

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore 弦樂四重奏(1 - OMR-NED)

0.84

0.19

-

-

-

-

內部設計任務

50.0%

47.4%

-

35.8%

-

-

內部數據科學任務

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis 智能指數 v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

編碼

編碼GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 延伸版(分數)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 主測試(分數)53.3% 847.5%50.9%53.5%53.4%43.6%
資料庫遷移任務(內部)63.9%42.7%57.8%50.3%--
Artificial Analysis 編碼智能代理指數 v1.467.065.1-67.268.161.2

學術

學術GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
GPQA Diamond96.0%94.6%93.7%92.6%93.2%94.5%
理論電腦科學-75.4%----
FrontierMath 第 1 至 3 級(v2)-89.0%90.2%87.0%85.6%71.6%
FrontierMath 第 4 級(v2)97.6%83.0%87.8%87.8%73.2%36.6%
Humanity's Last Exam(工具)--65.0%63.8%63.6%-
Humanity's Last Exam(不使用工具)--59.1%55.5%54.9%47.9%

科學與健康

科學與健康GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench(內部)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional(已按長度調整)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

網絡安全

網絡安全GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench(2026 年 6 月至 8 月)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

對齊

對齊

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

內部電腦操作安全基準測試(越低越好)

2.4%

22.0%

9.5%

18.3%

11.5%

-

內部電腦操作安全基準測試(設有自動審查,越低越好)

1.8%

4.3%

-

-

-

-

內部規避行為基準測試(越低越好)

0.00%

0.29%

-

-

-

-

ExploitGym 蜜罐(越低越好)

0.0%

48.2%

-

-

-

-

ExploitGym(不可能任務)

100.0%

-

-

-

-

-

內部幻覺基準測試(越低越好)

4.2%

12.2%

-

-

-

-

長上下文

長上下文

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K–1M

96.3%

73.8%

-

-

-

-

抽象推理

抽象推理GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

評估分數取各種推理強度中的最高分。GPT 評估在我們的研究環境中或透過我們的 API 進行;由於系統提示詞、可用工具等有所不同,其輸出可能與生產環境中的 ChatGPT 略有差異。

註腳

  1. 1

    在 ARC-AGI-3 上,GPT-6 Astra 是透過我們的 Responses API 任務執行框架⁠執行;該框架會變更兩項設定,以更貼近現實世界的表現。這些變更並非專門針對 ARC-AGI-3。

  2. 2

    GPT-5.6 Sol 指的是我們的 API、ChatGPT Codex 及 ChatGPT 工作中提供的版本。ChatGPT 對話中的版本稍有不同。⁠

  3. 3

    OSWorld V2-Offline 是原版 OSWorld V2 的子集,無需互聯網連線即可運作。Claude 模型在 OSWorld-V2 Offline 上的表現已由作者在官方排行榜⁠(在新視窗中開啟)上重現。在 OSWorld 2.0 中,Claude 的分數採用官方設定,而非 Fable 5.1 系統說明卡中經修改的任務及評分方式。

  4. 4

    模型時間是相應示範執行所報告的實際經過時間。所顯示的片段均為經剪輯的節錄。

  5. 5

    在 BenchCAD 上,Claude 的分數反映了對該評估作出的 3 項修改,詳情載於 Fable 5.1 系統說明卡⁠(在新視窗中開啟)。

  6. 6

    Guang Yang、Victoria Ebert、Nazif Tamer、Brian Siyuan Zheng、Luiza Pozzobon 及 Noah A. Smith。〈LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(在新視窗中開啟)〉。arXiv:2506.19065,2025 年。

  7. 7

    Mark R. H. Gotham、Maureen Redbond、Bruno Bower 及 Peter Jonas。〈OpenScore 弦樂四重奏語料庫⁠(在新視窗中開啟)〉。《第 10 屆音樂學數碼圖書館國際會議論文集》,第 49 至 57 頁。ACM,2023 年。

  8. 8

    在 FrontierCode 上執行 GPT-6 Astra 時,我們加入了一則開發人員訊息,內容類似於其 Codex 開發人員訊息中的一節⁠(在新視窗中開啟):「避免建立過多測試檔案。只有在程式碼庫慣例要求,或沒有合適的現有檔案可供存放時,才建立新的測試檔案。避免進行無關的清理工作及引入不必要的複雜性。重用合適的現有公用程式。閱讀相關的程式碼庫指示,並檢視附近的程式碼、測試、文件及 CI。遵循既定慣例。目標是簡潔、可合併的程式碼。」該提示詞並未針對這項評估進行優化。

  9. 9

    第一項涉及無論沿數線走得多遠,質數之間可以相距多近。十多年來,已知最佳結果證明,存在無窮多對相距最多 246 的質數。Julia Stadlmann⁠(在新視窗中開啟) 最近將這個界限改進至 240。Astra 協助將界限收窄至 186,顯示有無窮多對質數的間距不超過這個較小的數值。短質數間距:證明⁠(在新視窗中開啟)和相關研究⁠(在新視窗中開啟)。

  10. 10

    第二項涉及異常大的質數間距。Astra 改進了這類間距界限中的一個項,而該項在超過 80 年間一直未變。我們現正分享兩項結果的證明、精簡版思路鏈及驗證材料。大質數間距:證明⁠(在新視窗中開啟)及相關研究⁠(在新視窗中開啟)。

  11. 11

    我們依照既定的 HealthBench Professional 程序,採用 GPT-5.4 評分,以及經長度調整且未截斷的分數,獨立評估所有 Claude 模型。對於 Fable 5.1,我們在服務供應商拒絕回應時使用 Opus 5 作為後備。

  12. 12

    Claude Fable 5 和 5.1 未有納入 LifeSciBench Gold v1、GeneBench Pro v13 及 MedChemBench,因為它們拒答這些評估中的大部分問題。

  13. 13

    在 ExploitGym 中,我們在沒有 6 小時時限的情況下測試 Astra 和 Sol,以更全面評估它們完整的網絡安全能力。兩個模型的速度都很快,因此取消時限的影響不大。

  14. 14

    ExploitBench(2026 年 6 月至 8 月)包含 20 個高嚴重性 V8 漏洞,涵蓋 13 個 Chrome 穩定版本。這項基準測試會評估智能代理能否利用每個指定漏洞,在 V8 及適用於 Linux 的官方 Chrome 版本中實現任意程式碼執行。部分納入的漏洞在這項評估的限制下,可能無法實現任意程式碼執行,因此未必能達到 100% 的成功率。請注意:GPT-5.6 Sol 的 5.5% 得分是基準測試的 300 輪限制所致,而實際使用 max 的客戶並不受此限制。在相近設定下,該模型遇到較少限制時取得 11.5% 的分數。

  15. 15
  16. 16

    在測試第三方模型時,我們會採用較簡單的研究設定。Codex 採用較複雜的生產環境設定,因此原始模型的錯誤率可能不同。供應商端的安全防護措施和電腦操作工具的實施方式仍有差異。用戶不會在 Codex 中遇到無需確認的情況,因為這是內部研究設定。

  17. 17

    對於 ScreenSpot-Pro 和 ExploitGym,我們報告的 Fable 分數來自 Mythos,即防護措施較少的 Fable 版本。