GPT‑5.6 開發者指南
來自新創公司正式環境的技術經驗
GPT‑5.6 模型系列大幅降低了前沿級智慧體效能的成本,同時也進一步拓展技術能力的前沿。
本指南將介紹新創公司如何透過更聰明的模型選擇,以及有助於維持推理連貫性、多智慧體協調和程式化工具呼叫的新 API 控制項,以極低的成本更快建構能力更強的智慧體。
自 GPT‑5 起,每一代模型都致力於以更少的 Token 處理時間跨度更長的任務。GPT‑5.6 延續了這項趨勢:智慧體效能更強、成本更低,且底層任務執行框架幾乎不必調整。
整體成本效益的提升,再加上模型以較低推理強度也能提高準確度,進一步放大了效益。例如,在 Agents’ Last Exam 中,任務執行框架維持不變時,採用「低」推理強度的 GPT‑5.6 Sol,表現勝過採用「高」推理強度的 GPT‑5.5。我們在正式環境測試中也看到類似成果:新創公司將推理強度從原先的預設值調低後,多種工作流程的成本都顯著下降。
過去,對於長時間跨度的使用案例,升級至可用最高推理強度的旗艦模型通常是最佳選擇。這主要是因為在處理較長上下文和工具呼叫方面,這類模型的能力遠勝於成本最佳化模型。但 5.6 系列改變了這一點:增加推論階段的運算資源後,Luna 和 Terra 往往能以低得多的成本,達到接近 GPT‑5.4 和 5.5 的表現。
以 BrowseComp 任務為例:這項搜尋型基準測試用於評估模型搜尋冷門事實的能力。三個月前,GPT‑5.5(極高)在這項基準測試中獲得 84.36%,總成本為 33.27 美元。GPT‑5.6 Luna(極高)推出時便提供幾乎相同的表現,以 1.33 美元的成本獲得 84.04%。此後,我們進一步調降了價格。進一步瞭解我們最近的降價措施。
5.6 系列中的較小型模型,非常適合大量工作負載、對延遲敏感的互動,以及智慧體工作流程中的重複步驟。例如,假設你經營一家法律科技新創公司,需要在智慧體分析之前解析手寫備忘錄;現在不必在整個使用案例中都採用前沿模型,而可改用 Terra 或 Luna 擷取資料,大幅節省成本。
除了提升 GPT‑5.6 的開箱即用效能,我們也為 Responses API 推出新的基礎功能,以進一步提高效益。我們透過三項相輔相成的架構調整,對 GPT‑5.6 進行端對端訓練,讓智慧體能更有效率地運作:
- 重複使用已完成的工作:讓模型能在多輪互動之間保留推理(在新視窗中開啟),並使用原生壓縮(在新視窗中開啟)來精簡長時間進行的對話,使模型能在時間跨度更長的任務中維持工作連貫性,而不致混淆或必須重建先前的上下文。
- 在適當情況下平行拆解:使用原生多智慧體協調(在新視窗中開啟),可協調多個智慧體在平行工作流程中作業,更快完成複雜任務。
- 將可確定執行的工作移至程式碼:使用程式化工具呼叫(在新視窗中開啟),在模型的上下文視窗外篩選、彙整並協調工具輸出,將模型 Token 留給需要判斷的工作,同時降低成本、延遲和上下文劣化。
搭配使用這些功能,效果可能非常顯著。例如,在 ARC-AGI-3 中,GPT‑5.6 Sol 採用標準任務執行框架時獲得 13.3%。但在啟用保留推理和壓縮後,分數躍升至 38.3%,同時使用的輸出 Token 約減少至六分之一。模型完全沒有變更,效能卻提升至近三倍。你可以在此進一步瞭解我們的 ARC-AGI-3 任務執行框架研究。
智慧體工作流程通常包含兩類工作:
- 需要判斷的任務
- 主要涉及移動、篩選和合併資料的工作
當智慧體擷取 100 份申報文件、依日期篩選並找出相關交易時,模型不必在上下文視窗中逐一推理每個中間結果。程式化工具呼叫可讓 GPT‑5.6 編寫 JavaScript 來協調工具、平行執行彼此獨立的呼叫,並在上下文視窗外處理輸出。如此一來,模型就能專注於真正需要智慧的工作:做出判斷。
對於複雜且可平行處理的任務,將行動和推理分配至多個智慧體工作流程,不僅能更快完成任務,也能提升整體智慧。在這類架構中,主要智慧體負責協調子智慧體,並將任務委派給它們。各個子智慧體會平行執行目標,最後將輸出交回主要智慧體進行最終整合。團隊可在 Responses API 中啟用多智慧體(在新視窗中開啟),開始直接運用原生多智慧體功能。ChatGPT 的 Ultra 能力設定也是以這種方式運作。
“Qualia 運用智慧體團隊處理開放式研究問題,而 GPT‑5.6 Sol 正合所需。它比 GPT‑5.5 明顯進步,完成速度也勝過我們測試的幾乎所有其他模型,很快就成為我們首選的 OpenAI 模型。”
“GPT‑5.6 是我們見過 OpenAI 最出色的協調模型。我們一次交給它六份規格,要求它同時撰寫、建構並逐一說明;它不但掌握了所有內容,品質也始終穩定。”
儘管 GPT‑5.6 很能掌握適當的子智慧體數量和建立時機,多智慧體行為仍具有高度可引導性。指示模型何時呼叫子智慧體,可提高僅在額外 Token 支出能改善表現時才建立智慧體的機率。
整個模型系列的提示詞快取存留時間已延長至至少 30 分鐘,現在也能在模型的上下文視窗中明確設定快取中斷點。這讓新創公司得以大幅提高快取命中率。
除了設定快取中斷點,持續使用適當的 prompt_cache_key(在新視窗中開啟),也能提高請求送達先前曾處理相同前綴之推論引擎的機率,進而降低延遲。
這些案例最引人注目的共同點,是建構智慧體的成本效益已產生巨大變化。
過去每個步驟都需要前沿模型的使用案例,如今只要採用較小型模型、調整推理強度並選擇高效架構,就能以極低的成本取得相當甚至更好的成果。
我們迫不及待想看到大家打造的成果!
- 2026 年
- API 平台
關於作者
本指南由 Samarth Madduru(在新視窗中開啟)、Prashant Mital(在新視窗中開啟)、Dave Leo(在新視窗中開啟) 和 Julien Reiman(在新視窗中開啟) 共同撰寫,內容取材自他們與採用 GPT‑5.6 開發產品的新創公司密切合作,協助這些公司從早期測試走向正式上線的實務經驗。


