跳至主要內容
OpenAI

2026年8月13日

應用 AI

GPT‑5.6 開發者指南

來自新創公司正式環境的技術經驗

載入中…

GPT‑5.6 為價格效能樹立全新標準

GPT‑5.6 模型系列大幅降低了前沿級智慧體效能的成本,同時也進一步拓展技術能力的前沿。

本指南將介紹新創公司如何透過更聰明的模型選擇,以及有助於維持推理連貫性、多智慧體協調和程式化工具呼叫的新 API 控制項,以極低的成本更快建構能力更強的智慧體。

更完善的開箱即用體驗

自 GPT‑5 起,每一代模型都致力於以更少的 Token 處理時間跨度更長的任務。GPT‑5.6 延續了這項趨勢:智慧體效能更強、成本更低,且底層任務執行框架幾乎不必調整。

整體成本效益的提升,再加上模型以較低推理強度也能提高準確度,進一步放大了效益。例如,在 Agents’ Last Exam 中,任務執行框架維持不變時,採用「低」推理強度的 GPT‑5.6 Sol,表現勝過採用「高」推理強度的 GPT‑5.5。我們在正式環境測試中也看到類似成果:新創公司將推理強度從原先的預設值調低後,多種工作流程的成本都顯著下降。

我們將 GPT‑5.6 直接放入任務執行框架,而低推理強度帶來了最佳結果。它能判斷所需資料確實不存在,不會追查錯誤線索,還能用更少的 Token 得出正確答案。
— Izzy Miller,Hex(在新視窗中開啟) AI 研究負責人

模型選擇

過去,對於長時間跨度的使用案例,升級至可用最高推理強度的旗艦模型通常是最佳選擇。這主要是因為在處理較長上下文和工具呼叫方面,這類模型的能力遠勝於成本最佳化模型。但 5.6 系列改變了這一點:增加推論階段的運算資源後,Luna 和 Terra 往往能以低得多的成本,達到接近 GPT‑5.4 和 5.5 的表現。

1 之 3
Luna 以十八分之一的成本,保有 GPT‑5.5 擷取準確度的 98%。這樣的價格讓我們得以將智慧體的高品質文件理解能力實際應用於更多工作流程。
— Serhii Shchoholiev,Hypha(在新視窗中開啟) 智慧體工程負責人

以 BrowseComp 任務為例:這項搜尋型基準測試用於評估模型搜尋冷門事實的能力。三個月前,GPT‑5.5(極高)在這項基準測試中獲得 84.36%,總成本為 33.27 美元。GPT‑5.6 Luna(極高)推出時便提供幾乎相同的表現,以 1.33 美元的成本獲得 84.04%。此後,我們進一步調降了價格。進一步瞭解我們最近的降價措施。

5.6 系列中的較小型模型,非常適合大量工作負載、對延遲敏感的互動,以及智慧體工作流程中的重複步驟。例如,假設你經營一家法律科技新創公司,需要在智慧體分析之前解析手寫備忘錄;現在不必在整個使用案例中都採用前沿模型,而可改用 Terra 或 Luna 擷取資料,大幅節省成本。

持續改進 Responses API,打造更高效的智慧體

除了提升 GPT‑5.6 的開箱即用效能,我們也為 Responses API 推出新的基礎功能,以進一步提高效益。我們透過三項相輔相成的架構調整,對 GPT‑5.6 進行端對端訓練,讓智慧體能更有效率地運作:

  1. 重複使用已完成的工作:讓模型能在多輪互動之間保留推理(在新視窗中開啟),並使用原生壓縮(在新視窗中開啟)來精簡長時間進行的對話,使模型能在時間跨度更長的任務中維持工作連貫性,而不致混淆或必須重建先前的上下文。
  2. 在適當情況下平行拆解:使用原生多智慧體協調(在新視窗中開啟),可協調多個智慧體在平行工作流程中作業,更快完成複雜任務。
  3. 將可確定執行的工作移至程式碼:使用程式化工具呼叫(在新視窗中開啟),在模型的上下文視窗外篩選、彙整並協調工具輸出,將模型 Token 留給需要判斷的工作,同時降低成本、延遲和上下文劣化。

搭配使用這些功能,效果可能非常顯著。例如,在 ARC-AGI-3 中,GPT‑5.6 Sol 採用標準任務執行框架時獲得 13.3%。但在啟用保留推理和壓縮後,分數躍升至 38.3%,同時使用的輸出 Token 約減少至六分之一。模型完全沒有變更,效能卻提升至近三倍。你可以在此進一步瞭解我們的 ARC-AGI-3 任務執行框架研究

程式化工具呼叫

智慧體工作流程通常包含兩類工作:

  1. 需要判斷的任務
  2. 主要涉及移動、篩選和合併資料的工作

當智慧體擷取 100 份申報文件、依日期篩選並找出相關交易時,模型不必在上下文視窗中逐一推理每個中間結果。程式化工具呼叫可讓 GPT‑5.6 編寫 JavaScript 來協調工具、平行執行彼此獨立的呼叫,並在上下文視窗外處理輸出。如此一來,模型就能專注於真正需要智慧的工作:做出判斷。

金融研究最困難的部分,在於可靠地擷取申報文件、協調工具,以及分析各項數據。在我們的評估中,使用程式化工具呼叫的 GPT‑5.6 達到評分標準要求的品質,同時減少了 21% 的輸入 Token。這正是只能討論金融研究的智慧體,與真正能執行研究的智慧體之間的差別。
— Alex Wang,Rogo(在新視窗中開啟) 應用 AI 團隊

多智慧體

對於複雜且可平行處理的任務,將行動和推理分配至多個智慧體工作流程,不僅能更快完成任務,也能提升整體智慧。在這類架構中,主要智慧體負責協調子智慧體,並將任務委派給它們。各個子智慧體會平行執行目標,最後將輸出交回主要智慧體進行最終整合。團隊可在 Responses API 中啟用多智慧體(在新視窗中開啟),開始直接運用原生多智慧體功能。ChatGPT 的 Ultra 能力設定也是以這種方式運作。

1 之 2
Qualia 運用智慧體團隊處理開放式研究問題,而 GPT‑5.6 Sol 正合所需。它比 GPT‑5.5 明顯進步,完成速度也勝過我們測試的幾乎所有其他模型,很快就成為我們首選的 OpenAI 模型。
— E Chi,Quadrillion(在新視窗中開啟) 創辦人

儘管 GPT‑5.6 很能掌握適當的子智慧體數量和建立時機,多智慧體行為仍具有高度可引導性。指示模型何時呼叫子智慧體,可提高僅在額外 Token 支出能改善表現時才建立智慧體的機率。

提示詞快取

整個模型系列的提示詞快取存留時間已延長至至少 30 分鐘,現在也能在模型的上下文視窗中明確設定快取中斷點。這讓新創公司得以大幅提高快取命中率。

我們在共用的 29,000 Token 提示詞中加入快取中斷點和工作區專屬快取鍵,使未快取的輸入減少了 28%。30 分鐘的快取時效也帶來重大突破:智慧體能在多次執行之間重複使用相同的上下文,不必每次都從頭開始。
— Lorenzo Gentile,Ploy(在新視窗中開啟) AI 工程師

除了設定快取中斷點,持續使用適當的 prompt_cache_key(在新視窗中開啟),也能提高請求送達先前曾處理相同前綴之推論引擎的機率,進而降低延遲。

結論

這些案例最引人注目的共同點,是建構智慧體的成本效益已產生巨大變化。

過去每個步驟都需要前沿模型的使用案例,如今只要採用較小型模型、調整推理強度並選擇高效架構,就能以極低的成本取得相當甚至更好的成果。

我們迫不及待想看到大家打造的成果!

  • 2026 年
  • API 平台

關於作者

本指南由 Samarth Madduru(在新視窗中開啟)Prashant Mital(在新視窗中開啟)Dave Leo(在新視窗中開啟)Julien Reiman(在新視窗中開啟) 共同撰寫,內容取材自他們與採用 GPT‑5.6 開發產品的新創公司密切合作,協助這些公司從早期測試走向正式上線的實務經驗。