我們設計 GPT‑5.6 模型系列,是為了在使用者運用模型處理的各類任務中兼顧能力與成本。旗艦模型 GPT‑5.6 Sol 採用最高推理強度時,在 Artificial Analysis Coding Agent Index 上的表現優於 Claude Fable 5,成本卻不到 Claude Fable 5 的一半。Terra 在智慧基準測試上的表現與 GPT‑5.5 相當,價格僅為 GPT‑5.5 的一半;Luna 則是速度最快、價格最實惠的模型,成本比 Sol 低 80%。為實現這些效率提升,我們的研究與技術團隊對技術堆疊的每個主要層級都進行了大幅最佳化。相關改進涵蓋模型、推論(執行模型並產生輸出的方式),以及 Codex 和 ChatGPT Work 皆採用的智慧體任務執行框架。
過去四年,我們將模型規模擴展至服務 10 億名活躍使用者和超過 200 萬家企業。在此過程中,效率始終是讓所有人共享智慧效益的關鍵。我們的使命是確保通用人工智慧造福全人類。這些年來,我們持續拓展整個技術堆疊的最佳化空間,力求在成本與智慧的各種取捨點上,都提供效能最出色的模型。GPT‑5.6 的每 Token 智慧效率是我們迄今最高的。GPT‑5.6 經過訓練,能夠讓每個 Token 完成更多工作。在訓練期間,我們同時以成功完成任務和提升效率為目標,引導模型採取更直接的路徑完成任務。
本文不只探討模型,也將分享我們如何透過技術堆疊另外兩個主要部分的進展提升效率。第一是推論,我們會最佳化負載平衡、推測式解碼、快取和核心程式等程序,讓相同硬體產生更多輸出。第二是智慧體任務執行框架,重點包括更妥善地管理上下文膨脹、工具使用與重複作業。我們也會說明 GPT‑5.6 Sol 如何自主促成其中多項效益。單項改進看似有限,但各項成果會彼此累積,讓我們同時實現前沿智慧與前沿效率。
在運算資源受限、模型需求增長快於容量擴充的環境中,效率是每項系統設計的核心。對負責執行已訓練模型並產生回應的推論技術堆疊而言,更是如此。我們的首要目標,是用相同硬體處理更多 Token,同時讓智慧表現、回應延遲、可用性與可靠性符合使用者期待。
要達成上述目標,必須從整體系統著手進行最佳化。即使模型本身效率很高,如果請求分配不當、硬體閒置,或資料搬移拖慢運算,服務成本仍可能居高不下。各層改進會相互累積,包括路由(請求送往何處)、排程(何時傳送請求)、核心程式(在 GPU 上執行的軟體)、快取(儲存並重複使用既有運算),以及模型實作(GPU 程式碼的執行順序)等方面的最佳化。Codex 中的 GPT‑5.6 Sol 對這些改進都發揮了關鍵作用。
第一個重要例子是負載平衡。在全球層級,我們會根據地理位置、可用容量和加速器類型(執行模型的 GPU 或專用晶片類型)等因素來路由請求。在叢集內,我們會根據負載、上下文長度、快取可用性及其他請求特性,將工作分配給不同的模型執行個體。接著,在每個執行個體內,還必須有效地將工作分配至各個加速器、模型子網路與運算核心。Codex 中的 GPT‑5.6 Sol 協助我們分析正式環境流量、找出先前忽略的失衡來源、測試新的路由策略,並持續調整這些啟發式方法。光是這些負載平衡改進,就大幅降低了提供模型服務的成本。
我們也使用 GPT‑5.6 Sol 最佳化模型的前向傳遞,也就是將輸入轉換為下一個 Token 預測結果的運算。即使個別運算速度很快,過多的記憶體資料搬移、同步操作和低效率的資料配置,仍可能讓 GPU 處於閒置狀態。為避免這種情況,GPT‑5.6 Sol 找出可以預先計算、不必執行或平行處理的工作。透過 Codex,GPT‑5.6 Sol 自主改寫並最佳化正式環境使用的核心程式。這些底層程式碼負責執行構成模型的數學運算。這套做法之所以奏效,部分原因是經過訓練後,GPT‑5.6 能有效使用 Triton(在新視窗中開啟) 和 Gluon(在新視窗中開啟) 編寫及改進核心程式。這兩種開放原始碼 GPU 程式語言皆由 OpenAI 維護。相關成果結合 GPT‑5.6 Sol 帶來的其他核心程式改進,使端到端服務成本降低了 20%。我們也投入大量資源開發驗證工具,例如開放原始碼工具 FpSan(在新視窗中開啟)(浮點數檢查工具),協助驗證 GPT‑5.6 Sol 所編寫核心程式的正確性。
推測式解碼是提升速度與效率的另一項手段。這項技術會讓較小的草稿模型(或稱「推測器」)與主要模型同時執行,由草稿模型提出數個 Token,再由主要模型平行驗證。候選 Token 通過驗證時,系統只需執行一次主要模型,就能產生多個輸出 Token,進而減少成本高昂的循序運算。GPT‑5.6 Sol 針對自身草稿模型的架構設計並執行數百項實驗,測試規模、結構與特徵的變更,藉此改進該模型。此外,GPT‑5.6 Sol 還啟動並監控推測器的訓練程序,在發生硬體故障或訓練不穩定等問題時自主介入。相關改進使 Token 生成效率提升超過 15%。
處理未快取的輸入 Token 時,模型會透過一次需要大量運算的傳遞建立鍵值 (KV) 快取;產生輸出時,則會反覆讀取並擴充這份快取。批次處理、分片和 KV 管理等最佳服務設定,高度取決於工作負載,包括提示詞與輸出長度、批次大小、快取命中率和查詢特性等。然而,過去的設定空間太過龐大,無法進行系統化調校,工程師只能依賴概略的啟發式規則。運用搭載 GPT‑5.6 Sol 的 Codex,我們得以分析正式環境的工作負載、產生並評估候選設定,再根據各種情境進一步最佳化引擎與模型的設定。如此一來,便能實際針對不同工作負載進行更精細的最佳化,使用相同硬體完成更多有用的推論。
推論最佳化是一套持續循環的回饋機制。我們會衡量正式環境的運作情況、找出最大的差距、實作變更,再確認改進的是整個系統,而不只是單一基準測試的成績。GPT‑5.6 Sol 和 Codex 加快了每個環節,讓團隊可以探索更多想法、更快因應工作負載變化,並打造延遲更低、容量更大、使用成本也更低的推論技術堆疊。
ChatGPT Work 和 Codex 透過一系列模型請求與工具呼叫完成複雜任務。從使用者提出請求到收到最終回應的一次互動中,Codex 可能會檢查原始碼、搜尋部署記錄、閱讀事件報告、編輯檔案並執行測試。每個步驟都可能需要發出一次請求。
準備上下文、傳輸資料、執行推論、呼叫工具和啟動程序,全都需要時間與運算資源。如果一項任務需要 30 次模型請求,每次多花一秒,累積起來就相當可觀。要提升整體效能,必須減少整個系統中的重複作業,而不能只讓模型變快。
一次使用者互動可能包含多輪模型請求與工具呼叫。重複區段中的每項成本都可能反覆累加。
這些累加效應也成為我們設計智慧體任務執行框架時的重要考量。這套以 Rust 建構的協調層負責連接模型、工具與使用者環境。接下來,我們將說明如何避免上下文膨脹、妥善載入工具並重複使用既有成果,讓每次請求更有效率。
隨著智慧體可使用的工具、技能、外掛程式和對話記錄增加,上下文視窗也很容易隨之膨脹。這不僅會增加成本,還可能分散模型注意力,引發不必要的推理。任務執行框架可透過延後探索降低相關負擔,讓整合功能、自訂 MCP 工具、技能和外掛程式只在需要時才提供給模型。任務執行框架也能避免個別工具或 MCP 整合功能意外耗用上下文視窗。除非模型另行指定,否則工具輸出預設最多為 10,000 個 Token。
如前所述,在單次使用者互動中,智慧體迴圈可能會將相同的指令、對話記錄、工具定義及先前結果多次傳送至 GPU。處理這些重複輸入的成本很高,因此提示詞快取會重複使用模型先前處理提示詞前綴時產生的運算結果。為保留完全一致的前綴,任務執行框架將所有模型可見的記錄設為只能在末尾附加內容。新訊息、工具結果與環境更新都會加在末尾,不會插入較早的上下文。工具也會依固定順序呈現;核准政策等執行階段設定則在執行時套用,不會嵌入工具定義。這項設計讓 Codex 和 ChatGPT Work 的整體提示詞快取命中率維持在高水準。
增量傳輸改變跨網路傳送的內容;提示詞快取則改變模型可以略過哪些重複運算。圖中各區塊的寬度僅供概念示意,且未顯示額外的壓縮層。
GPT‑5.6 帶來的效率提升,是我們多年來在研究、推論和智慧體任務執行框架等各層技術持續累積改進的成果。GPT‑5.6 協助實現許多改進,讓我們相信最佳化的速度還會繼續加快。除了強化技術堆疊的基礎架構,我們也會在核心程式最佳化等領域取得更大進展。我們期待把持續累積的底層改進帶給使用者與客戶,讓更多人能以更低成本取得智慧能力。
特別感謝技術團隊成員 Matthew Ferrari、Philippe Tillet、Ahmed Ibrahim、Joe Gershenson 和 Steve Coffey 對本文的貢獻。


