This post introduced GPT-5.5.
我們推出 GPT‑5.5,這是目前最聰明、也最直覺好用的模型,並為在電腦上完成工作的方式帶來新的進展。
GPT‑5.5 能更快理解你的意圖,也能自行承擔更多工作。它擅長撰寫與偵錯程式碼、進行線上研究、分析資料、建立文件與試算表、操作軟體,並能在不同工具間切換,直到任務完成。你不需要逐步細管整個流程,只要把雜亂無章、包含多個部分的任務交給 GPT‑5.5,模型就能自行規劃、運用工具、檢查結果,即使遇到不明確的狀況,也能持續推進,直到完成任務。
上述進展在智慧體程式設計、電腦操作、知識型工作,以及早期科學研究等領域特別明顯,而這些領域都仰賴跨脈絡推理與長時間持續執行的能力。GPT‑5.5 在提升智慧表現的同時,也維持速度:一般而言,規模更大、能力更強的模型在實際服務時會較慢,但 GPT‑5.5 在真實環境中的每個 Token 延遲與 GPT‑5.4 持平,同時展現明顯更高的智慧水準。它在完成相同的 Codex 任務時,使用的 token 也顯著更少,因此效率更高,能力也更強。
我們推出 GPT‑5.5,採用迄今最完整且最嚴密的一套防護機制,在降低濫用風險的同時,仍保留對正當用途的使用權。在發布前,我們已依完整的安全與應變整備框架全面評估此模型,並與內部與外部紅隊測試人員合作,針對進階資安與生物相關能力進行重點測試,同時蒐集近 200 家受信任早期存取合作夥伴的實際使用回饋。
即日起,GPT‑5.5 逐步向 ChatGPT 與 Codex 的 Plus、Pro、Business 與 Enterprise 使用者推出;而 GPT‑5.5 Pro 則正逐步向 ChatGPT 的 Pro、Business 與 Enterprise 使用者推出。API 部署需要不同的防護機制,我們正與合作夥伴與客戶密切合作,針對大規模服務所需的安全與資安要求進行規劃。我們很快也會將 GPT‑5.5 與 GPT‑5.5 Pro 導入 API。
GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro | |
Terminal-Bench 2.0 | 82.7% | 75.1% | - | - | 69.4% | 68.5% |
專家-SWE(內部) | 73.1% | 68.5% | - | - | - | - |
GDPval(勝出或平局) | 84.9% | 83.0% | 82.3% | 82.0% | 80.3% | 67.3% |
OSWorld-Verified | 78.7% | 75.0% | - | - | 78.0% | - |
Toolathlon | 55.6% | 54.6% | - | - | - | 48.8% |
BrowseComp | 84.4% | 82.7% | 90.1% | 89.3% | 79.3% | 85.9% |
FrontierMath(第 1 至 3 級) | 51.7% | 47.6% | 52.4% | 50.0% | 43.8% | 36.9% |
FrontierMath(第 4 級) | 35.4% | 27.1% | 39.6% | 38.0% | 22.9% | 16.7% |
CyberGym | 81.8% | 79.0% | - | - | 73.1% | - |
OpenAI 積極打造自主型 AI 的全球基礎設施,讓世界各地的個人與企業都能用 AI 完成工作。過去一年,AI 已大幅加速軟體工程的進展。隨著 GPT‑5.5 導入 Codex 與 ChatGPT,這波轉變也開始延伸到科學研究,以及人們在電腦上進行的各類工作。
在這些領域中,GPT‑5.5 不只更聰明,處理問題的方式也更有效率,時常能用更少的 Token 和更少的重試次數,產出更高品質的結果。在 Artificial Analysis 的 Coding Agent Index 上,GPT‑5.5 以同級前沿程式模型一半的成本,達到業界領先成績。
Artificial Analysis Intelligence Index(在新視窗中開啟) 是由外部單位執行的 10 項評測加權平均而成:AA-LCR、AA-Omniscience、CritPt、GDPval-AA、GPQA Diamond、Humanity’s Last Exam、IFBench、SciCode、Terminal-Bench Hard、τ²-Bench Telecom。
GPT‑5.5 是我們迄今最強的自主程式碼編寫模型。在 Terminal-Bench 2.0 這項測試複雜命令列工作流程的基準(涵蓋規劃、反覆調整與工具協作),其準確率達到 82.7%,為目前最佳表現。在 SWE-Bench Pro(評估真實世界 GitHub 問題解決能力),其得分為 58.6%,並在單次執行中完成比先前模型更多的更多端到端任務。在 Expert-SWE(針對長時程程式設計任務的內部前沿評測,預估人類完成時間中位數為 20 小時)中,GPT‑5.5 的表現同樣優於 GPT‑5.4。
在這三項評估中,GPT‑5.5 的表現皆優於 GPT‑5.4,而使用的 Token 更少。
模型在程式設計方面的優勢,在 Codex 中展現得尤其明顯,能承擔從實作、重構,到偵錯、測試與驗證等各類工程工作。初步測試顯示,GPT‑5.5 更擅長處理真實工程工作所需的關鍵能力,包括在大型系統中維持脈絡、在資訊不明確的情況下推理問題、運用工具檢驗假設,以及將變更完整延伸至相關程式碼。
算繪軌跡採用 NASA/JPL Horizons 提供的獵戶座飛船、月球與太陽向量資料,並套用顯示比例縮放,讓畫面更易閱讀。
提示詞:[attached image] Implement this as a new app using webgl and vite using real data from the artemis II mission. Make sure to test the app thoroughly until it is fully functional and looks like the app in the picture. Pay close attention to the rendering of the planets and fly paths. I want to be able to interact with the 3D rendering. Ensure it has realistic orbital mechanics.
除了基準測試之外,早期測試人員指出,GPT‑5.5 更能掌握系統整體結構:為何發生錯誤、修正應落在哪裡,以及哪些程式碼會受到影響。

「這是我用過第一個在概念理解上非常清楚的程式設計模型。」
Every 創辦人暨執行長 Dan Shipper 形容 GPT‑5.5 是「我用過的第一個在概念理解上非常清楚的程式設計模型」。
在推出一款應用程式後,他花了好幾天進行除錯,處理上線後出現的問題,最後才請一位頂尖工程師重寫部分系統。為測試 GPT‑5.5,他實際上將時間倒回:模型能否查看出現問題的狀態,產生與工程師最終決定相同類型的重寫計劃?GPT‑5.4 做不到。GPT‑5.5 可以。

「這種體驗真的讓人覺得像是在和更高智慧合作,甚至會有一股敬意油然而生。」
MagicPath 執行長 Pietro Schirano 表示,當 GPT‑5.5 將一個包含數百項前端與重構變更的分支,合併到同樣已大幅變動的主分支時,他也觀察到類似的躍進,並在約 20 分鐘內一次完成整體整合。
參與測試的資深工程師表示,GPT‑5.5 在推理與自主性方面明顯優於 GPT‑5.4 和 Claude Opus 4.7,能在沒有明確提示的情況下,預先發現問題,預測測試與審查需求。有一個案例中,工程師請模型重新設計協作式 Markdown 編輯器中的留言系統架構,回來時已看到一組包含 12 個 diff、幾乎完成的變更堆疊。其他測試者也表示,實作修正需求出乎意料地少,而且相較於 GPT‑5.4,他們對 GPT‑5.5 的規劃更有信心。
一位曾優先體驗該模型的 NVIDIA 工程師形容:「如果無法使用 GPT‑5.5,感覺就像失去一隻手臂。」
「GPT-5.5 明顯比 GPT-5.4 更聰明,也更有持續力,程式碼編寫表現更強,工具使用也更可靠。它能長時間持續專注於任務,不會過早中斷,這對使用者交給 Cursor 的複雜且長時間任務特別重要。」
讓 GPT‑5.5 在程式設計上表現出色的優勢,也讓它在電腦上的日常工作中同樣具備強大能力。模型更能理解你的意圖,因而可更自然地完成整個知識工作流程:從搜尋資訊、判斷重點、使用工具、檢查結果,到將原始資料整理成可用成果。
在 Codex 中,GPT‑5.5 在生成文件、試算表與簡報方面的表現優於 GPT‑5.4。早期測試者表示,在作業研究、試算表建模,以及將雜亂的業務資料整理成可執行計劃等工作上,GPT‑5.5 的表現優於過去的模型。結合 Codex 的電腦操作能力後,GPT‑5.5 更接近與你一同操作電腦:能看見畫面內容、點選、輸入、操作介面,並精準地在各種工具之間切換。
OpenAI 團隊已在實際工作流程中運用這些能力。目前公司內超過 85% 的員工每週都會使用 Codex,涵蓋軟體工程、財務、傳播、行銷、資料科學與產品管理等職能。在 Comms 團隊中,成員使用 Codex 中的 GPT‑5.5 分析六個月的演講申請資料、建立評分與風險框架,並驗證自動化 Slack 智慧體,使低風險申請可自動處理,而高風險申請則交由人工審查。在財務部門,團隊使用 Codex 審查 24,771 份 K-1 稅務表單,共 71,637 頁,並採用排除個人資料的流程,讓這項工作較前一年提前兩週完成。在市場進入團隊中,有員工將每週業務報告的產生流程自動化,每週節省 5 到 10 小時。
在 ChatGPT 中,GPT‑5.5 Thinking 能更快協助處理困難問題,並以更精準且精簡的回應,幫助你更有效率地推進複雜工作。它擅長處理程式設計、研究、資訊整合與分析,以及大量文件相關任務,特別是在搭配外掛程式使用時,能進一步發揮整合工具與資料的優勢。
在 GPT‑5.5 Pro 中,早期測試者觀察到 ChatGPT 能承擔的工作難度與品質都有明顯提升,而延遲降低也讓它更適合用於高要求任務。測試者認為,與 GPT‑5.4 Pro 相比,GPT‑5.5 Pro 的回應更完整、結構更清楚,且在準確性、相關性與實用性上都有顯著提升,尤其在商務、法律、教育與資料科學領域表現突出。
GPT‑5.5 在多項反映此類工作的基準測試中,達到業界領先成績。在 GDPval 基準測試(衡量橫跨 44 種職業、具經濟價值的現實世界知識工作),GPT‑5.5 得分為 84.9%。在 OSWorld-Verified(評估模型是否能自行操作真實電腦環境),得分達到 78.7%。而在 Tau2-bench Telecom(測試複雜客戶服務工作流程),無需提示詞調整即可達到 98.0%。
GPT‑5.5 在較結構化的知識工作上同樣表現出色:在 FinanceAgent 達到 60.0%,在內部投資銀行建模任務達到 88.5%,以及在 OfficeQA Pro 達到 54.1%;在這項評測中,模型需整合檔案、工具與脈絡,不能僅憑記憶作答。
Tau2-bench Telecom 是在未經提示詞調校的情況下執行的(並以 GPT‑4.1 作為使用者模型)。GPT‑5.5 更能掌握任務意圖,且相較於前代模型,Token 使用效率更高。
「GPT-5.5 提供執行密集型工作所需的持續效能。模型建置並運行於 NVIDIA GB200 NVL72 系統上,讓團隊能從自然語言提示直接交付端到端功能,將偵錯時間從數天縮短到數小時,並在複雜的程式碼庫中,將原本需數週的實驗加速到一夜之間就能看到進展。這不只是寫程式更快,而是全新的工作方式,讓人能以截然不同的速度完成工作。」
GPT‑5.5 在科學與技術研究工作流程方面也有所提升,這類流程不只是回答困難問題而已。研究人員需要探索想法、收集證據、驗證假設、解讀結果,並決定下一步的方向。相較於其他模型,GPT‑5.5 更能在這個反覆循環的過程中持續推進。
值得注意的是,GPT‑5.5 在 GeneBench(在新視窗中開啟) 相較於 GPT‑5.4 有明顯提升;這項新評測聚焦於遺傳學與定量生物學中的多階段科學資料分析。這些問題要求模型在監督指引有限的情況下,針對可能含有歧義或錯誤的資料進行推理,處理如隱藏的混雜因子或 QC 失敗等真實障礙,並正確實作與解讀現代統計方法。這些任務對科學專家而言,往往相當於需耗時數日的專案,因此模型的表現格外引人注目。
同樣地,在 BixBench 這項以真實生物資訊學與資料分析為核心設計的基準測試中,GPT‑5.5 在已公布分數的模型中表現領先。模型的科學能力如今已強大到足以作為真正的共同研究員,實質加速生物醫學研究前沿的進展。
在另一個例子中,搭配自訂測試框架的 GPT‑5.5 內部版本協助發現了關於拉姆齊數的一項新證明(在新視窗中開啟)。拉姆齊數是組合數學中的核心研究主題之一。組合數學研究離散物件如何彼此組合,例如圖表、網路、集合與各種模式。拉姆齊數大致探討的是:一個網路需要大到什麼程度,才會必然出現某種形式的秩序。這個領域的成果相當罕見,而且通常在技術上難度極高。在此案例中,GPT‑5.5 找出了一個關於非對角拉姆齊數的長期未解漸近性質之證明,之後並在 Lean 中獲得驗證。這項成果是一個具體範例,顯示 GPT‑5.5 的貢獻不只是程式碼或解釋,還包括在核心研究領域中提出具啟發性且實用的數學論證。
早期測試者使用 ChatGPT 中的 GPT‑5.5 Pro 時,它的定位不只是一次型回答工具,更像是一位研究夥伴:能反覆多輪批改手稿、對技術論點進行壓力測試、提出分析建議,並結合程式碼、筆記和 PDF 內容進行協作。整體而言,GPT‑5.5 更能協助研究人員從提出問題,一路推進到實驗與最終產出。
Derya Unutmaz 是 The Jackson Laboratory for Genomic Medicine 的免疫學教授兼研究人員。他使用 GPT‑5.5 Pro 分析一份包含 62 個樣本、近 28,000 個基因的基因表現資料集,產出一份詳細的研究報告。該報告不僅整理研究結果,也提出關鍵問題與洞見。他表示,這些工作原本需要團隊花上數個月才能完成。
Bartosz Naskręcki 是波蘭波茲南亞當密茨凱維奇大學的數學助理教授。他在 Codex 中使用 GPT‑5.5,只用一則提示詞,就在 11 分鐘內建立一個代數幾何應用程式,將二次曲面的交集視覺化,並把所得曲線轉換為 Weierstrass 模型。
他後來進一步擴充這個應用程式,加入更穩定的奇點視覺化功能,以及可在後續工作中重複使用的精確係數。對他來說,更大的轉變在於,Codex 現在可以協助實作自訂的數學視覺化與電腦代數工作流程,而這類工作過去需要專門工具才能完成。整體而言,這些案例顯示 GPT‑5.5 能將專家意圖轉化為可實際運作的研究工具與分析。

圖片來源:Bartosz Naskręcki(在新視窗中開啟)
提示詞: # Algebraic geometry surface intersection
Make an app which draws two quadratic surfaces and colors in red the intersection curve.Use computational Riemann-Roch theorem to convert this into Weierstrass curve.
## Main window
Two tinted surfaces with a slightly transparent shading, high quality rendering intersect along a red colored algebraic curve
Rotation with mouses in both directions, full pinch mechanism for zoom, haptic press to show the little menu with sliders for changing the coefficients of each surface; detection via Z-buffor level
## Side right window
Short Weierstrass equation (over Q or quadratic field extension) computed on the go via effective Riemann-Roch theorem formulas
## Ambient mode where all the controls are hidden and the user can admire the beauty of the shapes
## Specs
App is running in the browser, light-weight implementation with full stack newest libraries, portable, deployable
## Docs
Git repo, journal, plan (Markdown files)
「在我們的測試框架中導入 OpenAI 全新的 GPT-5.5 模型,讓模型能分析大量生化資料集並預測人體用藥結果,再看到它在最具挑戰性的藥物研發評估中帶來明顯的準確率提升,整個過程令人振奮。如果 OpenAI 維持這樣的進展速度,藥物發現的基礎很可能在今年底前出現改變。」
要在維持 GPT‑5.4 延遲的情況下提供 GPT‑5.5,需要重新思考推論方式,將其視為整合式系統,而不是各自獨立的最佳化手段。GPT‑5.5 專為 NVIDIA GB200 與 GB300 NVL72 系統共同設計、訓練並部署。Codex 和 GPT‑5.5 在我們達成效能目標的過程中發揮了關鍵作用。Codex 協助團隊更快將想法轉為可進行基準測試的實作,勾勒方法方向、串接實驗,並判斷哪些最佳化項目值得投入更多資源。GPT‑5.5 則協助在整個技術堆疊中找出並落實關鍵改進。簡單來說,這個模型也在改善支撐它本身的基礎架構。
其中一項關鍵改進,是負載平衡與分割策略的調整。在 GPT‑5.5 之前,我們會將加速器上的請求拆分為固定數量的區塊,以平衡各運算核心的工作負載,讓大型與小型請求都能在同一張 GPU 上執行。然而,這種預先設定的固定區塊數量,無法適用於所有流量型態。為了更有效運用 GPU,Codex 分析了數週的正式環境流量模式,並撰寫自訂的啟發式演算法,以最佳方式分配與平衡工作負載。這項改進帶來顯著成效,使 Token 生成速度提升超過 20%。
要讓世界為能高效發現並修補安全漏洞的模型做好準備,需要整個生態系共同投入與協作;同時也必須推動模型的普及存取與漸進式部署,迎接網路防禦的新時代。
前沿模型在資安領域的能力持續提升。相關能力將逐步普及。我們認為,最好的方向是讓資安能力真正用於加速網路防禦,並強化整體生態系。
GPT‑5.5 是邁向能解決資安等全球重大挑戰的 AI 發展過程中,一個循序但關鍵的進展。在 12 月推出 GPT‑5.2 時,我們已主動部署必要的網路安全防護措施,降低模型遭濫用於資安攻擊的風險;隨著 GPT‑5.5 推出,我們進一步導入更嚴格的潛在資安風險分類器,初期可能讓部分使用者感到不便,我們也會持續調整與改善。
多年來,隨著模型能力逐步提升,我們已在應變整備框架(在新視窗中開啟)中將資安列為重要類別,並持續反覆開發與校準各項緩解措施,讓具備實質資安能力的模型能以負責任的方式發布。
- 我們已為這一等級的資安能力部署業界領先的防護措施。去年,我們隨 GPT‑5.2(在新視窗中開啟) 首次推出專為資安設計的防護機制,並在後續部署中持續測試、精進與擴展。針對 GPT‑5.5,我們進一步加強對高風險活動與敏感資安請求的控管,並新增機制來防範重複濫用。廣泛存取得以實現,來自我們在模型安全、經驗證使用,以及對違規用途監控上的投入。過去數月,我們與外部專家合作,持續強化這些防護機制的穩健性,並反覆測試與改進。在 GPT‑5.5 中,我們讓開發者更容易保護程式碼安全,同時對最可能被惡意利用的資安工作流程施加更嚴格的控管。
- 我們正擴大存取,加速各層面的網路防禦。我們透過網路安全可信存取計劃提供針對資安用途限制較少的模型,並從 Codex 開始導入;在推出時,符合特定信任訊號(在新視窗中開啟)的已驗證使用者,可在較少限制下使用 GPT‑5.5 的進階資安能力。負責保護關鍵基礎設施的組織可申請使用 GPT‑5.4‑Cyber 等資安用途限制較少的模型,但必須符合嚴格的安全要求,才能用於保護內部系統。這讓更多經驗證的防禦者能以更少阻礙,取得更強大的工具進行正當的安全工作,並讓重要的防禦能力更加普及。使用者可前往 chatgpt.com/cyber(在新視窗中開啟) 申請可信存取,在進行經驗證的防禦工作時,減少不必要的拒絕情況。
- 我們正與政府夥伴合作,協助保護大眾所仰賴的關鍵基礎設施。我們正共同探索先進 AI 如何支援負責關鍵系統的可信任官員執行防禦工作,涵蓋從保護重要納稅資料的數位系統,到地方社區的電網與供水系統。
我們依據應變整備框架(在新視窗中開啟),將 GPT‑5.5 的生物/化學與資安能力列為「高」等級。雖然 GPT‑5.5 尚未達到網路安全的「關鍵」能力等級,但評估與測試顯示,其網路安全能力較 GPT‑5.4 有明顯提升。
此外,GPT‑5.5 在發布前已通過完整的安全與治理流程,包括應變整備評估、特定領域測試、針對進階生物與資安能力的專項評估,以及與外部專家進行的嚴格測試。更多細節請參閱 GPT‑5.5 系統說明卡。
這項工作反映了我們更廣泛的 AI 韌性策略,隨著模型能力持續提升,這樣的策略也越來越重要。我們希望讓強大的 AI 能應用於守護系統、機構與大眾。可行的做法包括:可信存取、能隨能力提升而擴展的防護機制,以及具備偵測並回應嚴重濫用的營運能力。
即日起,GPT‑5.5 正陸續在 ChatGPT、Codex 和 API 中推出,並開放給在 Microsoft Foundry 上開發的開發者使用。
在 ChatGPT 中,GPT‑5.5 Thinking 開放給 Plus、Pro、Business 和 Enterprise 使用者。GPT‑5.5 Pro 專為處理更高難度問題與需要更高準確度的工作而設計,提供給 Pro、Business 和 Enterprise 使用者。
在 Codex 中,GPT‑5.5 已開放給 Plus、Pro、Business、Enterprise、Edu 和 Go 方案使用,並支援 400K 上下文視窗。GPT‑5.5 也提供快速模式,Token 生成速度提升 1.5 倍,成本為 2.5 倍。
對於 API 開發人員,gpt-5.5 即將在 Responses API 和 Chat Completions API 中提供,定價為每 100 萬輸入 Token 5 美元、每 100 萬輸出 Token 30 美元,並支援 100 萬 Token 的上下文視窗。Batch 和 Flex 定價為標準 API 費率的一半,而優先處理則為標準費率的 2.5 倍。我們也將在 API 中推出 gpt-5.5-pro,以提供更高準確度;定價為每 100 萬輸入 Token 30 美元、每 100 萬輸出 Token 180 美元。請參閱定價頁面了解完整詳情。
雖然 GPT‑5.5 的定價高於 GPT‑5.4,但在智慧程度與 token 使用效率上都有明顯提升。在 Codex 中,我們仔細調整使用體驗,讓 GPT‑5.5 對大多數使用者而言,能以比 GPT‑5.4 更少的 token 提供更好的結果,同時維持各訂閱方案充裕的使用額度。
寫程式
評估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
SWE-Bench Pro(公開)* | 58.6% | 57.7% | - | - | 64.3% | 54.2% |
Terminal-Bench 2.0 | 82.7% | 75.1% | - | - | 69.4% | 68.5% |
Expert-SWE(內部) | 73.1% | 68.5% | - | - | - | - |
*實驗室注意到此評估有記憶化跡象(在新視窗中開啟)
專業
評估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
GDPval(勝出或平局) | 84.9% | 83.0% | 82.3% | 82.0% | 80.3% | 67.3% |
FinanceAgent v1.1 | 60.0% | 56.0% | - | 61.5% | 64.4% | 59.7% |
投資銀行建模任務(內部) | 88.5% | 87.3% | 88.6% | 83.6% | - | - |
OfficeQA Pro | 54.1% | 53.2% | - | - | 43.6% | 18.1% |
電腦操作與視覺
評估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
OSWorld-Verified | 78.7% | 75.0% | - | - | 78.0% | - |
MMMU Pro(無工具) | 81.2% | 81.2% | - | - | - | 80.5% |
MMMU Pro(使用工具) | 83.2% | 82.1% | - | - | - | - |
工具使用
評估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
BrowseComp | 84.4% | 82.7% | 90.1% | 89.3% | 79.3% | 85.9% |
MCP Atlas** | 75.3% | 70.6% | - | - | 79.1% | 78.2% |
Toolathlon | 55.6% | 54.6% | - | - | - | 48.8% |
Tau2-bench Telecom*** | 98.0% | 92.8% | - | - | - | - |
** MCP Atlas:2026 年 4 月最新更新後,由 Scale AI 提供的結果。*** Tau2-bench telecom:在使用原始提示詞(未進行提示詞調整)時,5.5 與 5.4 的測試結果。未納入其他實驗室在調整提示詞後所進行評估的結果。
學術
評估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
GeneBench | 25.0% | 19.0% | 33.2% | 25.6% | - | - |
FrontierMath(第 1 至 3 級) | 51.7% | 47.6% | 52.4% | 50.0% | 43.8% | 36.9% |
FrontierMath(第 4 級) | 35.4% | 27.1% | 39.6% | 38.0% | 22.9% | 16.7% |
BixBench | 80.5% | 74.0% | - | - | - | - |
GPQA Diamond | 93.6% | 92.8% | - | 94.4% | 94.2% | 94.3% |
Humanity's Last Exam(不使用工具) | 41.4% | 39.8% | 43.1% | 42.7% | 46.9% | 44.4% |
Humanity's Last Exam(使用工具) | 52.2% | 52.1% | 57.2% | 58.7% | 54.7% | 51.4% |
資安
評估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
Capture-the-Flag 挑戰任務(內部)**** | 88.1% | 83.7% | - | - | - | - |
CyberGym | 81.8% | 79.0% | - | - | 73.1% | - |
**** 系統說明卡中最困難的 CTF 挑戰延伸版本,並加入更多高難度題目。
長篇上下文
評估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
Graphwalks BFS 256k f1 | 73.7% | 62.5% | - | - | 76.9% | - |
Graphwalks BFS 1M f1 | 45.4% | 9.4% | - | - | 41.2% (Opus 4.6) | - |
Graphwalks parents 256k f1 | 90.1% | 82.8% | - | - | 93.6% | - |
Graphwalks parents 1mil f1 | 58.5% | 44.4% | - | - | 72.0% (Opus 4.6) | - |
OpenAI MRCR v2 8-needle 4K-8K | 98.1% | 97.3% | - | - | - | - |
OpenAI MRCR v2 8-needle 8K-16K | 93.0% | 91.4% | - | - | - | - |
OpenAI MRCR v2 8-needle 16K-32K | 96.5% | 97.2% | - | - | - | - |
OpenAI MRCR v2 8-needle 32K-64K | 90.0% | 90.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 64K-128K | 83.1% | 86.0% | - | - | - | - |
OpenAI MRCR v2 8-needle 128K-256K | 87.5% | 79.3% | - | - | 59.2% | - |
OpenAI MRCR v2 8-needle 256K-512K | 81.5% | 57.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 74.0% | 36.6% | - | - | 32.2% | - |
抽象推理
評估 | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
ARC-AGI-1 (Verified) | 95.0% | 93.7% | - | 94.5% | 93.5% | 98.0% |
ARC-AGI-2 (Verified) | 85.0% | 73.3% | - | 83.3% | 75.8% | 77.1% |








