我們設計 GPT‑5.6 模型系列時,旨在針對用戶使用模型處理的各類任務,平衡能力與成本。我們的旗艦模型 GPT‑5.6 Sol 採用 max 推理強度,在 Artificial Analysis Coding Agent Index 上的表現勝過 Claude Fable 5,成本卻不到其一半。Terra 在智能基準測試中的表現與 GPT‑5.5 相若,價格僅為其一半;Luna 則是我們速度最快、價格最低的模型,成本比 Sol 低 80%。為實現這些效率,我們的研究及技術團隊在技術堆疊的每個主要層面都進行了重大優化。這些改進涵蓋模型、推理(我們如何運行模型以產生輸出),以及 Codex 與 ChatGPT Work 均採用的智能代理任務執行框架。
過去四年,我們把模型擴展至服務 10 億名活躍用戶及超過 200 萬家企業;在把智能的益處普及至所有人的過程中,效率一直是核心。我們的使命是確保通用人工智能造福全人類。多年來,我們一直致力發掘整個技術堆疊的優化空間,務求在成本與智能之間取得不同平衡時,都能提供效能最佳的模型。我們透過 GPT‑5.6 令每個 Token 所提供的智能效益達至歷來最高;該模型經過訓練,能夠以每個 Token 完成更多工作。訓練期間,我們同時針對任務成功率及效率作出優化,讓模型以更直接的途徑完成任務。
本文將焦點擴展至模型以外,分享我們如何透過技術堆疊另外兩個主要部分的進展提升效率,包括:1)推理,即優化負載平衡、推測解碼、快取及運算內核等流程,以相同硬件產生更多輸出;以及 2)智能代理任務執行框架,即更妥善管理上下文膨脹、工具使用及重複工作。我們亦會分享 GPT‑5.6 Sol 如何自主實現當中數項效益。單項改進看似有限,但這些成果會相互累積,讓我們在智能與效率方面均達到前沿水平。
在運算資源受限、模型需求增長快於容量的環境中,所有系統設計都必須以效率為核心。這點對執行已訓練模型以產生回應的推理技術堆疊尤其重要。我們的首要目標是以相同硬件處理更多 Token,同時維持用戶期望的智能、延遲、可用性及可靠性水平。
要實現這個目標,必須優化整個系統。單看模型本身,其運作可以非常高效,但若請求分配不當、硬件閒置,或數據移動拖慢運算,提供服務的成本仍可能很高。各層面的改進會相互累積,效益來自路由(請求傳送至何處)、調度(何時傳送請求)、運算內核(在 GPU 上執行的軟件)、快取(儲存並重用工作),以及模型實現方式(GPU 程式碼的執行次序)等方面的優化。Codex 中的 GPT‑5.6 Sol 在所有這些優化工作中都發揮了關鍵作用。
負載平衡就是一個重要例子。在全球層面,我們會根據地理位置、可用容量及加速器類型,也就是運行模型的 GPU 或專用晶片類型,把請求路由至合適位置。在叢集內,我們會根據負載、上下文長度、快取可用情況及其他請求屬性,在不同模型實例之間分配工作。在每個實例內,工作還必須有效分配至各個加速器、模型的子網絡及運算核心。Codex 中的 GPT‑5.6 Sol 協助我們分析正式服務環境流量、找出以往被忽略的失衡來源、測試新的路由策略,並持續調整這些啟發式規則。單是這些負載平衡改進,已大幅降低提供模型服務的成本。
我們亦使用 GPT‑5.6 Sol 優化模型的前向傳播,即把輸入轉化為下一個 Token 預測的運算。即使個別運算速度很快,過多的記憶體數據移動、同步操作及低效的數據排列方式,仍可能令 GPU 閒置。為避免這種情況,GPT‑5.6 Sol 找出可預先計算、省略或並行處理的工作。透過 Codex,GPT‑5.6 Sol 自主重寫並優化正式服務環境中的運算內核,也就是執行模型數學運算的核心程式碼。這得以實現,部分原因是我們已訓練 GPT‑5.6,讓它能有效使用 Triton(在新視窗中開啟) 及 Gluon(在新視窗中開啟) 編寫和改進運算內核。兩者均為 OpenAI 維護的開源 GPU 程式語言。這些工作配合 GPT‑5.6 Sol 在運算內核方面的廣泛改進,使端到端服務成本降低 20%。我們亦大力投資驗證工具,例如開源的 FpSan(在新視窗中開啟)(Floating-Point Sanitizer,浮點數檢查工具),以協助驗證 GPT‑5.6 Sol 所編寫運算內核的正確性。
推測解碼是另一種提升速度及效率的方法。這項技術讓較小的草稿模型(又稱「推測模型」)與主要模型同時運行,產生數個候選 Token,供主要模型並行驗證。這些候選 Token 獲接納時,系統只需完成一次主要模型運算,便可產生多個輸出 Token,從而減少成本高昂的循序運算。GPT‑5.6 Sol 針對自身草稿模型的架構設計並進行數百項實驗,測試規模、結構及功能方面的變更,藉此改進該模型。此外,GPT‑5.6 Sol 啟動並監察草稿模型的訓練流程,並在硬件故障及訓練不穩定等問題出現時自主介入。相關改進令 Token 產生效率提升超過 15%。
處理未快取的輸入 Token 時,模型會透過一次運算密集型處理建立鍵值(KV)快取;產生輸出時,則會反覆讀取並擴充該快取。批次處理、分片及 KV 管理等最佳的模型服務配置,很大程度上取決於工作負載,包括提示詞及輸出長度、批次大小、快取命中率、查詢特徵等。然而,以往的配置空間過於龐大,無法進行系統化調整,工程師只能依賴粗略的啟發式規則。利用 Codex 中的 GPT‑5.6 Sol,我們得以分析正式服務環境工作負載、產生並評估候選配置,以及針對各種情境深入優化引擎及模型的配置方式。這使針對特定工作負載的更高層次優化變得切實可行,能以相同硬件完成更多有用的推理工作。
推理優化是一個持續的反饋循環。我們會量度正式服務環境的表現、找出最需要改進的環節、實施變更,並驗證這些變更改善的是整個系統,而非單一評測基準。GPT‑5.6 Sol 與 Codex 加快了這個循環的每個環節。因此,我們的團隊可以探索更多構想、更快回應不斷變化的工作負載,並建立延遲更低、容量更大、用戶成本更低的推理技術堆疊。
ChatGPT Work 與 Codex 透過一連串模型請求及工具調用完成複雜任務。在由用戶提出請求到產生最終回應的單一輪次中,Codex 可能會檢查原始碼、搜尋部署記錄、閱讀事故報告、編輯檔案及執行測試。每個步驟都可能需要發出一次請求。
準備上下文、傳輸數據、執行推理、調用工具及啟動程序,全都需要時間及運算資源。若一項任務需要 30 次模型請求,每次請求多花一秒,累積延誤便相當可觀。要提升整體效能,必須減少整個系統的重複工作,而非只加快模型速度。
一個用戶輪次可包含多輪模型請求及工具操作。重複區域內的任何成本都可能產生多次。
這些倍增效應亦成為我們設計智能代理任務執行框架的重要考量。這個以 Rust 編寫的協調層連接我們的模型、工具及用戶環境。接下來,我們會說明如何透過避免上下文膨脹、按需要載入工具及重用工作,提升每次請求的效率。
隨着智能代理獲准使用更多工具、技能、外掛程式及對話記錄,上下文視窗很容易擴大。這會增加成本、分散模型注意力,並引發不必要的推理。任務執行框架可透過延遲探索減少這項開銷,令整合功能、自訂 MCP 工具、技能及外掛程式只在需要時才向模型顯示。任務執行框架亦可防止個別工具及 MCP 整合功能意外佔用上下文視窗。除非模型要求採用其他上限,工具輸出預設以 10,000 個 Token 為上限。
如前所述,智能代理循環可在單一輪次內,多次向 GPU 傳送相同的指示、對話記錄、工具定義及先前結果。處理這些重複輸入的成本高昂,因此提示詞快取會重用與先前已處理提示詞前綴相關的運算結果。為保留該前綴,任務執行框架會將模型可見的所有記錄視為只可附加:新訊息、工具結果及環境更新一律加在末端,而不會插入較早的上下文。工具亦會按固定順序呈現,而審批政策等執行階段設定則在執行期間套用,不會嵌入工具定義。這項設計有助 Codex 及 ChatGPT Work 維持整體較高的提示詞快取命中率。
增量傳輸會改變經網絡傳送的內容;提示詞快取則會改變模型可避免重新計算的內容。圖中寬度僅屬概念示意,亦未顯示額外的壓縮層。
GPT‑5.6 帶來的效率提升,源自多年來在研究、推理及智能代理任務執行框架等技術堆疊各層面累積的改進。GPT‑5.6 在實現多項改進方面發揮了重要作用,也讓我們相信,優化速度將進一步加快。在繼續改進技術堆疊基礎的同時,我們亦會大幅提升運算內核等領域的效率。我們期待把這些持續進行的底層改進,轉化為更普及、更具成本效益的智能,惠及用戶及客戶。
特別感謝技術團隊成員 Matthew Ferrari、Philippe Tillet、Ahmed Ibrahim、Joe Gershenson 及 Steve Coffey 對本文的貢獻。


