跳至主要內容
OpenAI

2025年11月13日

產品

為開發者推出 GPT‑5.1

載入中…

今天,我們在 API 平台推出 GPT‑5.1。這是 GPT‑5 系列的新模型,兼顧智慧與速度,適用於各種智慧體及程式設計任務。GPT‑5.1 會依據任務複雜度,動態調整投入思考的時間,因此在較簡單的日常任務上速度顯著提升,也更節省 Token。此模型還提供「無推理」模式,可更快回應不需要深入思考的任務,同時保有 GPT‑5.1 的前沿智慧。

為進一步提升 GPT‑5.1 的效率,我們推出最長可保留 24 小時的延長提示詞快取,讓後續問題能以更低成本獲得更快回應。相較於 GPT‑5,我們的 優先處理(在新視窗中開啟)客戶也會感受到 GPT‑5.1 的效能明顯更快。

在程式設計方面,我們與 Cursor、Cognition、Augment Code、Factory 和 Warp 等新創公司密切合作,改善 GPT‑5.1 的程式設計風格、可引導性及程式碼品質。整體而言,使用 GPT‑5.1 進行程式設計更直覺,而且它在完成任務時提供的使用者導向進度更新也更清楚。

最後,我們隨 GPT‑5.1 推出兩項新工具:可更可靠地編輯程式碼的 apply_patch 工具,以及讓模型執行 shell 指令的 shell 工具。

GPT‑5.1 是 GPT‑5 系列的下一步進展;我們會持續投入開發更智慧、更強大的模型,協助開發者建立可靠的智慧體工作流程。

因應不同任務進行高效推理

自適應推理

為提升 GPT‑5.1 的速度,我們徹底改造了訓練其思考能力的方式。處理直接明確的任務時,GPT‑5.1 會使用較少 Token 進行思考,讓產品體驗更即時,也降低 Token 費用。面對需要更多思考的困難任務時,GPT‑5.1 會持續探索各種方案並檢查成果,以最大限度提升可靠性。

Balyasny Asset Management(在新視窗中開啟) 表示,GPT‑5.1「在我們完整的動態評估套件中勝過 GPT‑4.1 和 GPT‑5,執行速度更是 GPT‑5 的 2 至 3 倍。」他們也表示,在大量使用工具的推理任務中,GPT‑5.1「在品質相當或更佳的情況下,使用的 Token 數始終約為主要競爭對手的一半。」同樣地,AI 保險 BPO 公司 Pace(在新視窗中開啟) 也測試了此模型,並表示其智慧體「在 GPT‑5.1 上的執行速度快 50%,且在各項評估中的準確率超越 GPT‑5 和其他領先模型。」

GPT‑5.1 會比 GPT‑5 更靈活地調整思考時間。在具代表性的 ChatGPT 任務分布中,即使採用高推理強度,GPT‑5.1 處理較簡單任務時也快得多。

例如,當被要求「提供可列出全域安裝套件的 npm 指令」時,GPT‑5.1 只需 2 秒即可回答,而非 10 秒。

GPT-5(中)使用約 250 個 Token(約 10 秒)

show an npm command to list globally installed packages

npm list -g --depth=0

GPT-5.1(中)使用約 50 個 Token(約 2 秒)

show an npm command to list globally installed packages

You can list globally installed npm packages with:

  • Just package names: npm ls -g --depth=0
  • Including their install paths: npm ls -g

The first one is usually what you want.

全新「無推理」模式

開發者現在可將 reasoning_effort 設為 'none',在不使用推理的情況下運用 GPT‑5.1。這會讓模型在重視延遲的使用情境中,像非推理模型一樣運作,同時具備 GPT‑5.1 的高度智慧,以及高效工具呼叫這項額外優勢。相較於使用 'minimal' 推理的 GPT‑5,無推理的 GPT‑5.1 更擅長平行工具呼叫(這本身也能提升端對端任務完成速度)、程式設計任務、遵循指示及使用搜尋工具,並支援在我們的 API 平台中進行網頁搜尋(在新視窗中開啟)Sierra(在新視窗中開啟) 分享,在實際情境評估中,採用「無推理」模式的 GPT‑5.1「在低延遲工具呼叫效能方面,比使用最低推理的 GPT‑5 提升 20%」。

reasoning_effort 新增 'none' 值後,開發者能更靈活地控制速度、成本與智慧之間的平衡,以配合自身使用情境。GPT‑5.1 的預設值為 'none',非常適合重視延遲的工作負載。對於較複雜的任務,我們建議開發者選擇 'low' 或 'medium';若智慧與可靠性比速度更重要,則選擇 'high'。

延長提示詞快取

延長快取可讓提示詞在快取中保持有效最長 24 小時,而非目前支援的數分鐘,進而提升推理效率。保留時間延長後,更多後續要求可利用快取的上下文,從而降低延遲與成本,並讓多輪對話、程式設計工作階段或知識擷取工作流程等長時間互動更順暢。

提示詞快取價格維持不變:快取輸入 Token 比未快取 Token 便宜 90%,且寫入或儲存快取均不另行收費。若要在 GPT‑5.1 使用延長快取,請在 Responses API 或 Chat Completions API 中加入參數 “prompt_cache_retention='24h'”。詳情請參閱提示詞快取文件(在新視窗中開啟)

程式設計

GPT‑5.1 以 GPT‑5 的程式設計能力為基礎,提供更容易引導的程式設計風格、更少的過度思考、更優異的程式碼品質、工具呼叫序列中更符合使用者需求的更新訊息(前言),以及功能更完善的前端設計,尤其在低推理強度下更為明顯。

在快速修改程式碼等較簡單的程式設計任務中,GPT‑5.1 更快的速度讓來回反覆調整更容易。GPT‑5.1 處理簡單任務時速度更快,卻不會犧牲困難任務的效能。在 SWE-bench Verified 中,GPT‑5.1 的作業時間甚至比 GPT‑5 更長,成績達 76.3%。

In SWE-bench Verified⁠, a model is given a code repository and issue description, and must generate a patch to solve the issue. Labels indicate reasoning effort. Accuracy is averaged across all 500 problems. All models used a harness with JSON-based apply_patch tool.

我們已收到數家程式設計公司對 GPT‑5.1 的早期意見。以下是他們的使用感想:

  • Augment Code(在新視窗中開啟) 認為 GPT‑5.1「行動更審慎且減少浪費,推理更有效率,也更專注於任務」;他們還觀察到「變更更準確、提取要求更順暢,且多檔案專案的迭代速度更快」。
  • Cline(在新視窗中開啟) 分享,在他們的評估中,「GPT‑5.1 在差異編輯基準測試中提升 7%,達到目前最佳水準,展現出處理複雜程式設計任務時的卓越可靠性。」
  • CodeRabbit(在新視窗中開啟) 稱 GPT‑5.1 是其「PR 審查的首選模型」。
  • Cognition(在新視窗中開啟) 表示,GPT‑5.1「明顯更能理解你的要求,並與你協作完成任務」。
  • Factory(在新視窗中開啟) 表示:「GPT‑5.1 的回應明顯更即時,並會依任務調整推理深度,減少過度思考,改善整體開發者體驗。」
  • Warp(在新視窗中開啟) 將 GPT‑5.1 設為新使用者的預設模型,並表示它「延續 GPT‑5 系列帶來的出色智慧提升,同時回應能力大幅改善」。
「GPT 5.1 不只是另一個 LLM,而是真正具備智慧體能力,也是我測試過自主運作最自然的模型。它能模仿你的寫作與程式設計風格,輕鬆遵循複雜指示,並擅長前端任務,順暢融入現有程式碼庫。透過 Responses API,你能真正釋放它的全部潛力;我們也很期待在 IDE 中提供這款模型。」
—Denis Shiryaev,JetBrains AI 開發工具生態系統負責人

GPT‑5.1 的新工具

我們隨 GPT‑5.1 推出兩項新工具,協助開發者在 Responses API 中充分發揮模型效能:自由格式的 apply_patch 工具無須 JSON 跳脫處理,即可更可靠地編輯程式碼;shell 工具則可讓模型撰寫要在本機執行的指令。

Apply_patch 工具

自由格式的 apply_patch 工具可讓 GPT‑5.1 使用結構化差異,在程式碼庫中建立、更新及刪除檔案。模型不再只是建議修改,而會輸出由應用程式套用並回報結果的修補操作,從而支援反覆執行的多步驟程式碼編輯工作流程。

若要在 Responses API 中使用 apply_patch 工具,請透過 "tools": [{“type”: “apply_patch”}] 將其加入 tools 陣列,並在輸入中加入檔案內容,或為模型提供可與檔案系統互動的工具。模型會產生 apply_patch_call 項目,以建立、更新或刪除檔案;這些項目包含要在檔案系統中套用的差異。如需如何整合 apply_patch 工具的詳細資訊,請參閱我們的開發者文件(在新視窗中開啟)

Shell 工具

shell 工具可讓模型透過受控的命令列介面與本機電腦互動。模型提出 shell 指令,再由開發者的整合功能執行指令並傳回輸出。這會形成簡單的規劃—執行迴圈,讓模型檢查系統、執行公用程式並收集資料,直到能完成任務為止。

若要在 Responses API 中使用 shell 工具,開發者可透過 "tools": [{“type”: “shell”}] 將其加入 tools 陣列。API 會產生包含待執行 shell 指令的 "shell_call" 項目。開發者在本機環境中執行指令,並在下一個 API 要求中,透過 "shell_call_output" 項目傳回執行結果。如需進一步瞭解,請參閱我們的開發者文件(在新視窗中開啟)

價格與供應情況

所有 API 付費方案的開發者皆可使用 GPT‑5.1 和 gpt-5.1-chat-latest。價格與速率限制(在新視窗中開啟)均與 GPT‑5 相同。我們也在 API 中推出 gpt-5.1-codexgpt-5.1-codex-mini。雖然 GPT‑5.1 擅長大多數程式設計任務,但 gpt-5.1-codex 模型針對 Codex 或類似 Codex 的任務執行框架中,長時間執行的智慧體式程式碼編寫任務進行了最佳化。

開發者可參考 GPT‑5.1 開發者文件(在新視窗中開啟)模型提示指南(在新視窗中開啟),開始進行建置。我們目前沒有計畫淘汰 API 中的 GPT‑5;若日後決定淘汰,我們會提前通知開發者。

下一步

我們致力於透過反覆迭代,部署最強大、最可靠的模型,以處理實際的智慧體及程式設計工作。這些模型能有效思考、快速迭代並處理複雜任務,同時讓開發者保持流暢的工作節奏。GPT‑5.1 具備自適應推理、更強大的程式設計效能、更清楚的使用者導向更新,以及 apply_patchshell 等新工具,旨在協助你更順暢地建置應用。我們也會繼續大力投入這個領域;未來幾週和幾個月,將推出能力更強的智慧體及程式設計模型。

附錄:模型評估

評估

GPT‑5.1(高)

GPT‑5(高)

SWE-bench Verified
(全部 500 道題目)

76.3%

72.8%

GPQA Diamond
(不使用工具)

88.1%

85.7%

AIME 2025
(不使用工具)

94.0%

94.6%

FrontierMath
(使用 Python 工具)

26.7%

26.3%

MMMU

85.4%

84.2%

Tau2-bench Airline

67.0%

62.6%

Tau2-bench Telecom*

95.6%

96.7%

Tau2-bench Retail

77.9%

81.1%

BrowseComp 長上下文 128k

90.0%

90.0%

* 在 Tau2-bench Telecom 中,我們為 GPT‑5.1 提供了一段簡短且通用實用的提示詞,以改善其表現。

作者

OpenAI