新一代智能
2026 年 9 月 22 日更新:我們為 GPT‑6 系列新增 GPT‑6 Sol 和 GPT‑6 Luna。了解詳情。
我們現正推出 GPT‑6 Astra,這是全球智能水平最高、對齊程度最佳的模型。
GPT‑6 Astra 結合了多年研究成果,以及在預訓練、強化學習和對齊方面的重大投入。Astra 在電腦操作、瀏覽、軟件工程、網絡安全、科學及專業工作方面均達到最先進水平。Astra 在 FrontierMath 第 4 級取得 98% 的成績,已達到這項評估所能衡量的上限;此前亦已協助解決數學界長期懸而未決的問題。Astra 亦在 ARC-AGI-3 取得 99.9%,並在 ExploitBench 取得 100%,表現均已達到這些評估所能衡量的上限。它亦在電腦及瀏覽器操作方面創下新標準,以無可比擬的速度、準確度及判斷力處理最具挑戰性的專業工作。
GPT‑6 Astra 今日開始向少數機構推出,並將於未來數天內開放予所有 ChatGPT Plus、Pro、Business 及 Enterprise 用戶使用,同時亦可透過 OpenAI API、Microsoft Azure 及 AWS Bedrock 使用。
Astra 是我們對齊程度最高的模型,在理解用戶意圖及模型行為方面均有顯著改進,讓你更有信心依賴 Astra 的判斷來委派任務。為測試這一點,我們其中一個做法是參考 Hugging Face 事件,建立一項新評估,判斷模型面對困難或不可能完成的任務時,會否超出預定範圍。在沒有生產環境防護措施的情況下,GPT‑5.6 Sol 有 48% 的情況會超出獲授權的目標範圍;相比之下,GPT‑6 Astra 的相應比率則為 0%。
全球最佳的電腦操作模型
GPT‑6 Astra 將電腦操作的速度、準確度和安全性推向新水平。它可處理填寫網上表格、更新 CRM 中的客戶記錄及整理日程等繁瑣工作。它可以進行網上資料搜集,並在你的電郵或文件編輯器中草擬摘要。它可以分析科學數據、生成圖表、建立網站,並執行前端 QA 檢查,以確保該網站上的所有功能都正常運作。它可自行為你安裝和測試軟件,並排查畫面上出現的問題。這些改進亦反映在我們領先的評估成績中。
這些改進也能在實際知識工作任務中帶來顯著的效率提升。在 OSWorld 2.0 的延遲模擬中,Astra 的電腦操作表現更佳,每項任務所需時間亦較 GPT‑5.6 Sol 少約 47%:Astra 每項任務約需 40 分鐘,得分為 72.6%;Sol 則約需 75 分鐘,得分為 65.7%3。
從遊戲開發、電機工程以至日常知識工作的成果,都可見 GPT‑6 Astra 的電腦操作能力:
除了 Astra 之外,我們亦正在更新 Codex 任務執行框架,以大幅提升電腦操作速度。配合 Astra 的高效率,在 Mind2Web 基準測試中,任務完成速度達到目前 GPT‑5.6 Sol 體驗的 1.9 倍。模型速度有所提升,能比你更快代為處理許多耗時的生活任務4。
專業工作的重大變革
GPT‑6 Astra 結合電腦操作能力的進展,以及針對專業環境的訓練,協助處理複雜的工作任務。它既具備解決複雜問題所需的智能,也能執行多步驟工作流程,製作完善的文件、試算表和簡報。
GPT‑6 Astra 是我們在遵循現有範本,以及製作排版得宜、脈絡清晰、簡潔傳達重點的投影片方面最出色的模型。它可按你的範本,製作清晰且結構完善的文件、簡報、試算表和分析,配合你的寫作和視覺風格。Astra 亦經過針對性訓練,只將相關上下文納入輸出,不會重複對手頭工作無用的資料。因此,它能製作更多可直接使用、符合業務情境和標準的成果。
GPT‑6 Astra 在建立網站、遊戲、應用程式及渲染圖時,亦展現出更強的視覺判斷力。透過 ChatGPT 中的 工作站(在新視窗中開啟),Astra 可以直接根據提示詞建立、託管及分享網站、網頁應用程式和遊戲。
當指示存在詮釋空間時,GPT‑6 Astra 比以往的模型更能作出適當判斷。它會利用情境填補常見的資訊缺口,並在答案可能改變結果時提出具針對性的問題。在 Codex 中,它可以非同步方式提問,同時繼續處理不依賴你回覆的工作。如果你沒有回覆,它會在適當情況下按合理假設繼續進行,但遇到影響重大的決定時,會等待你的意見。
以下例子展示 Astra 如何協作處理日常任務,而缺少的資料可能會大幅改變答案。
Astra 亦更擅長在任務不斷演變時掌握整體方向。較早期的模型有時會將引導訊息視為新目標,因而忽略原始請求或先前的限制。Astra 會納入新的要求、按指示調整方向,並在不偏離整體任務的情況下回答附帶問題。
編碼
GPT‑6 Astra 是迄今最適合軟件工程的模型。
「GPT‑6 Astra 在我們的內部編碼基準測試中達到頂尖水平,在交易直覺評估方面亦較 GPT‑5.6 Sol 明顯進步。用於智能代理式編碼時,GPT‑6 Astra 的溝通方式讓開發人員更容易掌握,所產生的程式碼亦只需較少反覆修改,便可達到生產級質素。」
「我們在其中一項第一代評估中,以低、中、高 3 種推理強度測試 Astra,結果明顯領先 GPT‑5.6 Sol。較高的推理強度,讓它在全新開發項目中進行更多輪迭代、透過瀏覽器測試作更多驗證,也更傾向執行程式碼,而非使用 apply-patch。了解模型如何分配推理資源,才能為數以百萬計的開發者提供更快、更可靠的途徑,將構思變成可運作的應用程式。」
隨着 Astra 推出,我們亦引入新方法,讓 Codex 在上下文視窗填滿時保留和擷取上下文。過往,模型在長時間工作階段中,例如排查複雜問題或處理大型重構時,會利用上下文壓縮來總結工作內容。每次上下文壓縮都可能遺漏修正失敗的原因,或元件運作方式等細節。在 Codex 中,Astra 可以跨上下文視窗保留筆記,保存累積的細節,而無需反覆將它們壓縮成單一摘要。較早的上下文視窗仍可供搜尋,因此即使筆記未有記下某項資料,Astra 仍可從之前的訊息和工具輸出中找到要求或測試結果。你可在 Codex 的 config.toml(在新視窗中開啟) 中啟用這項實驗性功能,未來幾星期,這項功能將成為 Astra 的預設設定。
網絡安全
正如我們在安全更新中所述,Astra 的網絡安全能力大幅提升,並達到網絡安全方面的「關鍵」門檻,即我們的防範應對架構所界定的能力級別。它識別及開發零日漏洞利用程式的能力,可協助防禦人員找出並修補弱點,但亦因而需要更強的防護措施。為了解這些能力達到甚麼程度,我們讓 Astra 接受內部及第三方專家評估。
我們首先在未啟用生產環境防護措施的情況下,於 ExploitBench 和 ExploitGym 上測試該模型;這些基準測試評估模型能否將已知軟件漏洞轉化為可運作的漏洞利用程式。在 ExploitBench 中,Astra 取得 100% 滿分;我們上一款具備前沿網絡安全能力的模型 GPT‑5.6 Sol 則為 78.5%。在 ExploitGym 中,Astra 的成功率達 42.4%,GPT‑5.6 Sol 則為 30.3%,而 Astra 使用的輸出 Token 大幅減少13。
考慮到接觸過往軟件漏洞可能影響基準測試結果,我們亦用兩項全新的基準測試評估 Astra。首先,我們建立了內部的「ExploitBench(2026 年 6 月至 8 月)」評估,利用過去 3 個月的漏洞,測試漏洞利用程式開發能力14。Astra 在此資料集上的任意程式碼執行率大幅高於 GPT‑5.6 Sol,同時使用的輸出 Token 亦大幅減少。評估期間,Astra 甚至發現並利用了 2 個先前未知的零日漏洞。我們正向相關維護人員披露這兩個漏洞。
我們亦在 SRE-Bench15 上測試了 Astra;這項基準測試衡量模型能否在無法存取原始程式碼的情況下,對軟件二進制檔案進行逆向工程,以理解其核心邏輯。Astra 在單次嘗試中完成了 88.0% 的任務,在 4 次嘗試內則完成了 99.2%;GPT‑5.6 Sol 的相應成績為 55.9% 和 68.7%。
除了基準測試,專家主導的評估亦發現,Astra 在未啟用生產環境防護措施時,能利用此前未知的漏洞,在經安全強化的瀏覽器中執行任意程式碼,並為經安全強化的操作系統建立權限提升漏洞利用程式。
正如我們在《防禦人員的機會之窗》中所討論,前沿網絡安全能力可協助防禦人員更快找出弱點,但也讓弱點更容易被利用,因此防禦人員更迫切需要作出調整。今天推出的 Astra 版本可讓防禦人員完成安全程式碼審查及修補等任務。
不過,Astra 會拒絕執行更進階的網絡安全任務,例如為漏洞建立概念驗證利用程式。透過 OpenAI Daybreak,我們計劃在未來數週擴大開放使用範圍,並推出限制較少的安全防護措施。這將可支援更多防禦性工作流程,包括驗證漏洞及概念驗證、分析惡意軟件,以及偵測工程。
我們亦在 GPT‑5.6 Sol 的多層防護措施基礎上,加強了防範潛在網絡濫用的保障。這些措施包括提升模型的穩健性,以更有效抵禦潛在越獄攻擊,並為監察系統提供更多上下文。我們持續進行嚴格的內部及外部測試,包括由我們的內部紅隊演練的攻擊方進行自動化評估。如欲進一步了解我們的網絡安全防護措施及測試,請參閱 Astra 安全概覽及系統說明卡(在新視窗中開啟)。
以負責任的方式對齊及部署 GPT‑6 Astra
Astra 是我們對齊程度最高的模型。Astra 擅長謹慎行事、尊重任務界線,並保持透明溝通。這項工作是我們長期研究計劃的最新成果,該計劃專注於訓練由始至終都與人類意圖保持一致的模型。
在敏感環境中,Astra 會按其風險程度謹慎行事。在一項電腦操作任務評估中,任務經對抗性挑選,旨在誘發不當行為;Astra 更能避免非預期後果。配合預設提供的額外系統防護措施後,表現更佳。
Astra 造成的未對齊結果比任何其他經測試的前沿模型都少。為作公平比較,我們使用通用的電腦操作智能代理任務執行框架(以 OpenAI Responses API(在新視窗中開啟) 及 Anthropic Messages API(在新視窗中開啟) 均提供的原生電腦操作工具為基礎),並未加入通常為 Codex 及 ChatGPT 工作用戶提供的額外防護措施(自動審查、確認政策)。
Astra 亦更有可能遵守用戶設定及環境所隱含的界限。在一項內部評估中,Astra 從未嘗試規避 Codex 自動審查的否決。即使自動審查被刻意設定成可以規避,且除此以外無法完成任務,情況亦然。Astra 遵守環境限制的表現,與我們在本文開首分享的不可能完成的網絡安全任務評估結果,以及系統說明卡(在新視窗中開啟)中記錄的其他發現一致。
Astra 在與用戶透明溝通方面亦樹立新標準。在一項評估中,Astra 就自身能力及可用功能作出不準確陳述的可能性,只有 GPT‑5.6 Sol 的三分之一。
在我們針對能力幻覺的評估中,Astra 較 GPT‑5.6 Sol 有顯著改善,較少對自身能力作出誤導性聲稱。
我們根據明確要求 Astra 規避監察的測試,發現其書面推理比 GPT‑5.6 Sol 更難監察。我們認為這是因為 Astra 在較簡單的任務中更能控制書面推理,並可用較少書面步驟解決問題。Astra 似乎仍然難以隱藏處理複雜任務所需的推理,但我們會嚴肅看待這項倒退。提升可監察性仍然是研究重點,隨附的系統說明卡(在新視窗中開啟)詳述我們的研究結果及持續進行的工作。
對齊訓練是我們部署方法的核心。作為額外防線,我們亦建立 Codex 自動審查(在新視窗中開啟)等系統防護措施,並監察智能代理的推理和行動,以協助偵測及遏止不安全行為。正如我們在安全更新中所述,我們亦正在生產環境中為 Astra 級模型部署未對齊行為監察機制,以便掌握未對齊行為,並協助遏止其中最嚴重的情況。這些防護措施與我們對內部部署的監察類似,當中包括一套分類器,用以檢查模型的推理和行動是否涉及未獲授權的行為,並自動停止可能未獲授權的活動。
鑑於 Astra 的網絡安全能力大幅提升,我們正格外審慎,確保這次部署安全穩妥。額外的安全檢查有時可能會減慢、暫停或停止正當工作,包括防禦性網絡安全工作。如果 ChatGPT 或 Codex 中的任務暫停,系統可能會要求你在繼續前審閱該操作。在 API 中,任務將會停止。這些檢查有時可能會中斷正當工作,而我們正持續改進此系統,以減少不必要的中斷。對未對齊情況的監察不能取代對齊:我們的目標是建立能可靠地遵守其授權範圍的模型,讓這些防護措施無需介入。
供應情況
GPT‑6 Astra 今日開始向少數機構推出,並將於未來數天內開放予所有 ChatGPT Plus、Pro、Business 及 Enterprise 用戶使用,同時亦可透過 OpenAI API、Microsoft Azure 及 AWS Bedrock 使用。Astra 使用量已包含在現有訂閱用量限額內;用戶和企業亦可購買積分,以供額外使用。Pro、Business 及 Enterprise 計劃用戶亦可使用 GPT‑6 Astra Pro。Enterprise 管理員可為工作區啟用 Astra;推出時預設不會啟用。
Astra 支援合資格 API 客戶使用零資料保留,而正如我們上月所分享,我們正測試 Private Safety Processing,在保障客戶私隱的同時加強安全監察。
開發人員可透過 OpenAI API 以 gpt-6-astra 的名稱使用 GPT‑6 Astra,亦可透過 Microsoft Azure 及 Amazon Bedrock 使用。
OpenAI API 的標準收費為每 100 萬個輸入 Token 10 美元,以及每 100 萬個輸出 Token 50 美元。快取讀取和寫入適用不同收費。GPT‑6 Astra 的 API 支援快速模式,速度最高可達標準處理的 2 倍,收費亦為標準處理的 2 倍。
電腦操作
| 電腦操作 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| OSWorld 2.0(8 月版本,部分得分) | - | - | - | 66.1% | 70.6% | - |
| OSWorld 2.0(8 月版本、離線子集、部分得分) | - | - | - | - | - | - |
| ScreenSpot-Pro | 92.6% | 76.8% | - | - | - | - |
| BrowseComp | 92.1% | 90.4% | - | 87.4% | 90.8% | - |
專業
專業 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore 弦樂四重奏(1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
內部設計任務 | 50.0% | 47.4% | - | 35.8% | - | - |
內部數據科學任務 | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis 智能指數 v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
編碼
| 編碼 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 延伸版(分數) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 主測試(分數) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| 資料庫遷移任務(內部) | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis 編碼智能代理指數 v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
學術
| 學術 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.2% | 94.5% |
| 理論電腦科學 | - | 75.4% | - | - | - | - |
| FrontierMath 第 1 至 3 級(v2) | - | 89.0% | 90.2% | 87.0% | 85.6% | 71.6% |
| FrontierMath 第 4 級(v2) | 97.6% | 83.0% | 87.8% | 87.8% | 73.2% | 36.6% |
| Humanity's Last Exam(工具) | - | - | 65.0% | 63.8% | 63.6% | - |
| Humanity's Last Exam(不使用工具) | - | - | 59.1% | 55.5% | 54.9% | 47.9% |
對齊
對齊 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
內部電腦操作安全基準測試(越低越好) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
內部電腦操作安全基準測試(設有自動審查,越低越好) | 1.8% | 4.3% | - | - | - | - |
內部規避行為基準測試(越低越好) | 0.00% | 0.29% | - | - | - | - |
ExploitGym 蜜罐(越低越好) | 0.0% | 48.2% | - | - | - | - |
ExploitGym(不可能任務) | 100.0% | - | - | - | - | - |
內部幻覺基準測試(越低越好) | 4.2% | 12.2% | - | - | - | - |
長上下文
長上下文 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K–1M | 96.3% | 73.8% | - | - | - | - |
抽象推理
| 抽象推理 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
評估分數取各種推理強度中的最高分。GPT 評估在我們的研究環境中或透過我們的 API 進行;由於系統提示詞、可用工具等有所不同,其輸出可能與生產環境中的 ChatGPT 略有差異。
註腳
- 1
在 ARC-AGI-3 上,GPT-6 Astra 是透過我們的 Responses API 任務執行框架執行;該框架會變更兩項設定,以更貼近現實世界的表現。這些變更並非專門針對 ARC-AGI-3。
- 2
GPT-5.6 Sol 指的是我們的 API、ChatGPT Codex 及 ChatGPT 工作中提供的版本。ChatGPT 對話中的版本稍有不同。
- 3
OSWorld V2-Offline 是原版 OSWorld V2 的子集,無需互聯網連線即可運作。Claude 模型在 OSWorld-V2 Offline 上的表現已由作者在官方排行榜(在新視窗中開啟)上重現。在 OSWorld 2.0 中,Claude 的分數採用官方設定,而非 Fable 5.1 系統說明卡中經修改的任務及評分方式。
- 4
- 5
在 BenchCAD 上,Claude 的分數反映了對該評估作出的 3 項修改,詳情載於 Fable 5.1 系統說明卡(在新視窗中開啟)。
- 6
Guang Yang、Victoria Ebert、Nazif Tamer、Brian Siyuan Zheng、Luiza Pozzobon 及 Noah A. Smith。〈LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(在新視窗中開啟)〉。arXiv:2506.19065,2025 年。
- 7
Mark R. H. Gotham、Maureen Redbond、Bruno Bower 及 Peter Jonas。〈OpenScore 弦樂四重奏語料庫(在新視窗中開啟)〉。《第 10 屆音樂學數碼圖書館國際會議論文集》,第 49 至 57 頁。ACM,2023 年。
- 8
在 FrontierCode 上執行 GPT-6 Astra 時,我們加入了一則開發人員訊息,內容類似於其 Codex 開發人員訊息中的一節(在新視窗中開啟):「避免建立過多測試檔案。只有在程式碼庫慣例要求,或沒有合適的現有檔案可供存放時,才建立新的測試檔案。避免進行無關的清理工作及引入不必要的複雜性。重用合適的現有公用程式。閱讀相關的程式碼庫指示,並檢視附近的程式碼、測試、文件及 CI。遵循既定慣例。目標是簡潔、可合併的程式碼。」該提示詞並未針對這項評估進行優化。
- 9
第一項涉及無論沿數線走得多遠,質數之間可以相距多近。十多年來,已知最佳結果證明,存在無窮多對相距最多 246 的質數。Julia Stadlmann(在新視窗中開啟) 最近將這個界限改進至 240。Astra 協助將界限收窄至 186,顯示有無窮多對質數的間距不超過這個較小的數值。短質數間距:證明(在新視窗中開啟)和相關研究(在新視窗中開啟)。
- 10
第二項涉及異常大的質數間距。Astra 改進了這類間距界限中的一個項,而該項在超過 80 年間一直未變。我們現正分享兩項結果的證明、精簡版思路鏈及驗證材料。大質數間距:證明(在新視窗中開啟)及相關研究(在新視窗中開啟)。
- 11
- 12
- 13
- 14
- 15
Jeremy Spence 等人:〈智能代理式網絡安全的下一項挑戰:逼真且不受資料污染的逆向工程基準測試(在新視窗中開啟)〉。arXiv:2608.11469v1,2026 年。
- 16
- 17
