GPT‑5.6 開發人員指南
初創公司在生產環境中的技術經驗
GPT‑5.6 模型系列令前沿級智能代理效能大幅地變得更相宜,同時進一步拓展技術能力的疆界。
本指南將介紹初創公司如何透過更明智的模型選擇,以及支援推理延續、多智能代理編排和程式化工具調用的新 API 控制功能,只需原來一小部分成本便可建立速度更快、能力更強的智能代理。
自 GPT‑5 起,每一代模型都力求以更少 Token 處理時程更長的任務。GPT‑5.6 延續這個趨勢:智能代理效能更強、成本更低,而底層任務執行框架幾乎毋須改動。
在較低推理強度下,準確度亦有所提升,進一步放大整體成本效益。例如,在任務執行框架保持不變的情況下,GPT‑5.6 Sol 以「低」推理強度在 Agents’ Last Exam 的表現,勝過 GPT‑5.5 以「高」推理強度取得的成績。我們在生產環境測試中也看到類似成果:初創公司把推理強度調低,不再沿用先前的預設值後,多種工作流程的成本均顯著改善。
過往,對於時程較長的使用情境,升級至採用最高推理強度的旗艦模型一直是最佳選擇。主要原因是這些模型處理較長上下文及工具調用的能力,遠勝以成本效益為重點的模型。5.6 系列改變了這種情況:配合更多測試時計算資源,Luna 和 Terra 的表現往往可媲美 GPT‑5.4 和 5.5,成本卻大幅降低。
以 BrowseComp 的任務為例:這項以搜尋為基礎的評測基準評估模型搜尋冷門事實的能力。三個月前,GPT‑5.5(極高)在這項評測基準中取得 84.36%,總成本為 33.27 美元。GPT‑5.6 Luna(極高)推出時的表現大致相同,得分為 84.04%,成本僅 1.33 美元。此後,我們進一步調低了價格。進一步了解我們最新的減價措施。
5.6 系列中較小型的模型,非常適合高用量工作負載、對延遲敏感的互動,以及智能代理工作流程中的重複步驟。例如,假如你經營一家法律科技初創公司,需要在智能代理分析前解析手寫備忘錄,現在可使用 Terra 或 Luna 擷取資料,而毋須在整個使用情境中都採用前沿模型,從而大幅節省成本。
除了提升 GPT‑5.6 的開箱即用效能外,我們亦在 Responses API 推出新的基礎構件,進一步提高效益。我們採用三項相輔相成的架構措施,對 GPT‑5.6 進行端到端訓練,讓智能代理運作得更有效率:
- 重用已完成的工作:讓推理可跨模型輪次保留(在新視窗中開啟),並使用原生上下文壓縮(在新視窗中開啟)來精簡長時間對話,使模型處理執行時間較長的任務時仍能保持工作連貫,不會混淆或需要重建先前的上下文。
- 需要平行拆分工作:使用原生多智能代理編排(在新視窗中開啟),可協調多個智能代理處理平行工作流程,更快完成複雜任務。
- 把確定性工作移至程式碼:使用程式化工具調用(在新視窗中開啟),在模型的上下文視窗以外篩選、匯總及編排工具輸出,保留模型 Token 作判斷之用,並降低成本、延遲和上下文劣化。
結合使用這些功能,成效可以非常顯著。例如,GPT‑5.6 Sol 使用標準任務執行框架時,在 ARC-AGI-3 取得 13.3%。然而,啟用保留推理及上下文壓縮後,得分躍升至 38.3%,輸出 Token 用量約為原來的六分之一。模型毋須改動,效能卻提升至接近三倍。你可在此進一步了解我們的 ARC-AGI-3 任務執行框架研究。
智能代理工作流程通常涉及兩類工作:
- 需要判斷的任務
- 主要涉及移動、篩選及合併數據的工作
當智能代理擷取 100 份申報文件、按日期篩選並識別相關交易時,模型毋須在上下文視窗中逐一推理每項中間結果。程式化工具調用讓 GPT‑5.6 編寫 JavaScript 來編排工具、平行執行互不相依的調用,並在上下文視窗以外處理輸出。模型因而可專注處理真正需要智能的工作:作出判斷。
面對複雜而可平行處理的任務,把操作和推理分配至多個智能代理工作流程,既可加快完成任務,亦能提升智能水平。在這類設定中,主要智能代理負責編排子智能代理並向它們分派任務。各子智能代理會平行完成目標,最後把輸出交回主要智能代理作最終整合。團隊可在 Responses API 中啟用多智能代理(在新視窗中開啟),直接運用這項原生功能。ChatGPT 的 Ultra 能力設定亦採用相同方式運作。
“Qualia 運用多個智能代理團隊處理開放式研究問題,而 GPT‑5.6 Sol 正好切合所需。它較 GPT‑5.5 有顯著進步,完成速度比我們測試的幾乎所有其他模型都快,並迅速成為我們首選的 OpenAI 模型。”
“GPT‑5.6 是我們見過 OpenAI 最出色的編排模型。我們一次將六份規格交給模型,要求它同時撰寫、開發並逐一講解;它能掌握所有內容,品質絲毫不受影響。”
雖然 GPT‑5.6 能準確判斷合適的子智能代理數量及啟動時機,但多智能代理行為仍可靈活引導。指示模型何時調用子智能代理,可提高只在額外 Token 用量能改善效能時才啟動智能代理的機會。
整個模型系列的提示詞快取的最短有效期已延長至 30 分鐘,現在亦可在模型的上下文視窗內以確定方式設定快取中斷點。這讓初創公司能顯著提高快取命中率。
除了設定快取中斷點外,繼續使用合適的 prompt_cache_key(在新視窗中開啟),可提高請求送達曾處理相同前綴之推論引擎的機會,從而降低延遲。
這些例子最突出的共同點,是開發智能代理的成本效益已出現重大變化。
過往每個步驟都需要前沿模型的使用情境,現在只要採用較小型模型、調整推理強度,並作出高效的架構選擇,就能以少得多的成本取得相若甚至更佳的成果。
我們很期待看到大家會開發出甚麼成果!
- 2026
- API 平台
關於作者
本指南由 Samarth Madduru(在新視窗中開啟)、Prashant Mital(在新視窗中開啟)、Dave Leo(在新視窗中開啟) 及 Julien Reiman(在新視窗中開啟) 編寫,內容建基於他們由早期測試至投入生產期間,與使用 GPT-5.6 開發產品的初創公司緊密合作所得的經驗。


