為開發者推出 GPT‑5.1
今天,我們在 API 平台推出 GPT‑5.1。這是 GPT‑5 系列的新模型,兼顧智慧與速度,適用於各種智慧體及程式設計任務。GPT‑5.1 會依據任務複雜度,動態調整投入思考的時間,因此在較簡單的日常任務上速度顯著提升,也更節省 Token。此模型還提供「無推理」模式,可更快回應不需要深入思考的任務,同時保有 GPT‑5.1 的前沿智慧。
為進一步提升 GPT‑5.1 的效率,我們推出最長可保留 24 小時的延長提示詞快取,讓後續問題能以更低成本獲得更快回應。相較於 GPT‑5,我們的 優先處理(在新視窗中開啟)客戶也會感受到 GPT‑5.1 的效能明顯更快。
在程式設計方面,我們與 Cursor、Cognition、Augment Code、Factory 和 Warp 等新創公司密切合作,改善 GPT‑5.1 的程式設計風格、可引導性及程式碼品質。整體而言,使用 GPT‑5.1 進行程式設計更直覺,而且它在完成任務時提供的使用者導向進度更新也更清楚。
最後,我們隨 GPT‑5.1 推出兩項新工具:可更可靠地編輯程式碼的 apply_patch 工具,以及讓模型執行 shell 指令的 shell 工具。
GPT‑5.1 是 GPT‑5 系列的下一步進展;我們會持續投入開發更智慧、更強大的模型,協助開發者建立可靠的智慧體工作流程。
為提升 GPT‑5.1 的速度,我們徹底改造了訓練其思考能力的方式。處理直接明確的任務時,GPT‑5.1 會使用較少 Token 進行思考,讓產品體驗更即時,也降低 Token 費用。面對需要更多思考的困難任務時,GPT‑5.1 會持續探索各種方案並檢查成果,以最大限度提升可靠性。
Balyasny Asset Management(在新視窗中開啟) 表示,GPT‑5.1「在我們完整的動態評估套件中勝過 GPT‑4.1 和 GPT‑5,執行速度更是 GPT‑5 的 2 至 3 倍。」他們也表示,在大量使用工具的推理任務中,GPT‑5.1「在品質相當或更佳的情況下,使用的 Token 數始終約為主要競爭對手的一半。」同樣地,AI 保險 BPO 公司 Pace(在新視窗中開啟) 也測試了此模型,並表示其智慧體「在 GPT‑5.1 上的執行速度快 50%,且在各項評估中的準確率超越 GPT‑5 和其他領先模型。」
GPT‑5.1 會比 GPT‑5 更靈活地調整思考時間。在具代表性的 ChatGPT 任務分布中,即使採用高推理強度,GPT‑5.1 處理較簡單任務時也快得多。
例如,當被要求「提供可列出全域安裝套件的 npm 指令」時,GPT‑5.1 只需 2 秒即可回答,而非 10 秒。
GPT-5(中)使用約 250 個 Token(約 10 秒)
GPT-5.1(中)使用約 50 個 Token(約 2 秒)
開發者現在可將 reasoning_effort 設為 'none',在不使用推理的情況下運用 GPT‑5.1。這會讓模型在重視延遲的使用情境中,像非推理模型一樣運作,同時具備 GPT‑5.1 的高度智慧,以及高效工具呼叫這項額外優勢。相較於使用 'minimal' 推理的 GPT‑5,無推理的 GPT‑5.1 更擅長平行工具呼叫(這本身也能提升端對端任務完成速度)、程式設計任務、遵循指示及使用搜尋工具,並支援在我們的 API 平台中進行網頁搜尋(在新視窗中開啟)。Sierra(在新視窗中開啟) 分享,在實際情境評估中,採用「無推理」模式的 GPT‑5.1「在低延遲工具呼叫效能方面,比使用最低推理的 GPT‑5 提升 20%」。
reasoning_effort 新增 'none' 值後,開發者能更靈活地控制速度、成本與智慧之間的平衡,以配合自身使用情境。GPT‑5.1 的預設值為 'none',非常適合重視延遲的工作負載。對於較複雜的任務,我們建議開發者選擇 'low' 或 'medium';若智慧與可靠性比速度更重要,則選擇 'high'。
延長快取可讓提示詞在快取中保持有效最長 24 小時,而非目前支援的數分鐘,進而提升推理效率。保留時間延長後,更多後續要求可利用快取的上下文,從而降低延遲與成本,並讓多輪對話、程式設計工作階段或知識擷取工作流程等長時間互動更順暢。
提示詞快取價格維持不變:快取輸入 Token 比未快取 Token 便宜 90%,且寫入或儲存快取均不另行收費。若要在 GPT‑5.1 使用延長快取,請在 Responses API 或 Chat Completions API 中加入參數 “prompt_cache_retention='24h'”。詳情請參閱提示詞快取文件(在新視窗中開啟)。
GPT‑5.1 以 GPT‑5 的程式設計能力為基礎,提供更容易引導的程式設計風格、更少的過度思考、更優異的程式碼品質、工具呼叫序列中更符合使用者需求的更新訊息(前言),以及功能更完善的前端設計,尤其在低推理強度下更為明顯。
在快速修改程式碼等較簡單的程式設計任務中,GPT‑5.1 更快的速度讓來回反覆調整更容易。GPT‑5.1 處理簡單任務時速度更快,卻不會犧牲困難任務的效能。在 SWE-bench Verified 中,GPT‑5.1 的作業時間甚至比 GPT‑5 更長,成績達 76.3%。
In SWE-bench Verified, a model is given a code repository and issue description, and must generate a patch to solve the issue. Labels indicate reasoning effort. Accuracy is averaged across all 500 problems. All models used a harness with JSON-based apply_patch tool.
我們已收到數家程式設計公司對 GPT‑5.1 的早期意見。以下是他們的使用感想:
- Augment Code(在新視窗中開啟) 認為 GPT‑5.1「行動更審慎且減少浪費,推理更有效率,也更專注於任務」;他們還觀察到「變更更準確、提取要求更順暢,且多檔案專案的迭代速度更快」。
- Cline(在新視窗中開啟) 分享,在他們的評估中,「GPT‑5.1 在差異編輯基準測試中提升 7%,達到目前最佳水準,展現出處理複雜程式設計任務時的卓越可靠性。」
- CodeRabbit(在新視窗中開啟) 稱 GPT‑5.1 是其「PR 審查的首選模型」。
- Cognition(在新視窗中開啟) 表示,GPT‑5.1「明顯更能理解你的要求,並與你協作完成任務」。
- Factory(在新視窗中開啟) 表示:「GPT‑5.1 的回應明顯更即時,並會依任務調整推理深度,減少過度思考,改善整體開發者體驗。」
- Warp(在新視窗中開啟) 將 GPT‑5.1 設為新使用者的預設模型,並表示它「延續 GPT‑5 系列帶來的出色智慧提升,同時回應能力大幅改善」。
「GPT 5.1 不只是另一個 LLM,而是真正具備智慧體能力,也是我測試過自主運作最自然的模型。它能模仿你的寫作與程式設計風格,輕鬆遵循複雜指示,並擅長前端任務,順暢融入現有程式碼庫。透過 Responses API,你能真正釋放它的全部潛力;我們也很期待在 IDE 中提供這款模型。」
我們隨 GPT‑5.1 推出兩項新工具,協助開發者在 Responses API 中充分發揮模型效能:自由格式的 apply_patch 工具無須 JSON 跳脫處理,即可更可靠地編輯程式碼;shell 工具則可讓模型撰寫要在本機執行的指令。
自由格式的 apply_patch 工具可讓 GPT‑5.1 使用結構化差異,在程式碼庫中建立、更新及刪除檔案。模型不再只是建議修改,而會輸出由應用程式套用並回報結果的修補操作,從而支援反覆執行的多步驟程式碼編輯工作流程。
若要在 Responses API 中使用 apply_patch 工具,請透過 "tools": [{“type”: “apply_patch”}] 將其加入 tools 陣列,並在輸入中加入檔案內容,或為模型提供可與檔案系統互動的工具。模型會產生 apply_patch_call 項目,以建立、更新或刪除檔案;這些項目包含要在檔案系統中套用的差異。如需如何整合 apply_patch 工具的詳細資訊,請參閱我們的開發者文件(在新視窗中開啟)。
shell 工具可讓模型透過受控的命令列介面與本機電腦互動。模型提出 shell 指令,再由開發者的整合功能執行指令並傳回輸出。這會形成簡單的規劃—執行迴圈,讓模型檢查系統、執行公用程式並收集資料,直到能完成任務為止。
若要在 Responses API 中使用 shell 工具,開發者可透過 "tools": [{“type”: “shell”}] 將其加入 tools 陣列。API 會產生包含待執行 shell 指令的 "shell_call" 項目。開發者在本機環境中執行指令,並在下一個 API 要求中,透過 "shell_call_output" 項目傳回執行結果。如需進一步瞭解,請參閱我們的開發者文件(在新視窗中開啟)。
所有 API 付費方案的開發者皆可使用 GPT‑5.1 和 gpt-5.1-chat-latest。價格與速率限制(在新視窗中開啟)均與 GPT‑5 相同。我們也在 API 中推出 gpt-5.1-codex 和 gpt-5.1-codex-mini。雖然 GPT‑5.1 擅長大多數程式設計任務,但 gpt-5.1-codex 模型針對 Codex 或類似 Codex 的任務執行框架中,長時間執行的智慧體式程式碼編寫任務進行了最佳化。
開發者可參考 GPT‑5.1 開發者文件(在新視窗中開啟)和模型提示指南(在新視窗中開啟),開始進行建置。我們目前沒有計畫淘汰 API 中的 GPT‑5;若日後決定淘汰,我們會提前通知開發者。
我們致力於透過反覆迭代,部署最強大、最可靠的模型,以處理實際的智慧體及程式設計工作。這些模型能有效思考、快速迭代並處理複雜任務,同時讓開發者保持流暢的工作節奏。GPT‑5.1 具備自適應推理、更強大的程式設計效能、更清楚的使用者導向更新,以及 apply_patch 和 shell 等新工具,旨在協助你更順暢地建置應用。我們也會繼續大力投入這個領域;未來幾週和幾個月,將推出能力更強的智慧體及程式設計模型。
評估 | GPT‑5.1(高) | GPT‑5(高) |
SWE-bench Verified | 76.3% | 72.8% |
GPQA Diamond | 88.1% | 85.7% |
AIME 2025 | 94.0% | 94.6% |
FrontierMath | 26.7% | 26.3% |
MMMU | 85.4% | 84.2% |
Tau2-bench Airline | 67.0% | 62.6% |
Tau2-bench Telecom* | 95.6% | 96.7% |
Tau2-bench Retail | 77.9% | 81.1% |
BrowseComp 長上下文 128k | 90.0% | 90.0% |
* 在 Tau2-bench Telecom 中,我們為 GPT‑5.1 提供了一段簡短且通用實用的提示詞,以改善其表現。


