GPT‑6 Sol 和 Luna 隆重登場
以更多方式將前沿智能融入你的日常工作。
本月較早時,我們推出了全球最智能、對齊程度最高的模型 GPT‑6 Astra。要求最高且最重要的項目仍需要 Astra 的完整實力,但實際工作各有不同規模、節奏和預算。
因此,我們推出 GPT‑6 Sol 和 GPT‑6 Luna,進一步擴展 GPT‑6 系列。GPT‑6 Astra 開創了新一代智能,而這些模型透過進一步提升成本效益,讓更多人受惠於這種智能。我們採用與 GPT‑6 Astra 相近的方法訓練 GPT‑6 Sol 和 Luna,將支持 Astra 在專業工作、事實準確度、編碼、電腦操作和對齊方面取得頂尖表現的技術進展,應用於速度更快、價格更相宜的模型。
GPT‑6 模型在成本與智能的不同組合上均處於領先地位,各級模型都具備卓越能力,並由能高效大規模提供這些能力的基礎設施支援。快取和推理方面的改進,讓我們能以更低成本提供這些模型。我們將節省的成本直接回饋用戶和客戶:與各自 GPT‑5.6 版本的推廣價格相比,Sol 和 Luna 的 API 價格降低 50%。這些改進共同推動先進 AI 更廣泛地用於日常任務及大規模應用。
模型 | 輸入 | 輸出 | 減價幅度 |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 價格低 50% |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 價格低 50% |
價格以每 100 萬個 Token 計算。
GPT‑6 Astra 仍是我們各方面表現最佳的模型。如果你追求最佳成果和毫不妥協的體驗,請選擇 Astra。
GPT‑6 Sol 和 Luna 在最有助完成複雜工作的各項能力上,為你熟悉並正在使用的模型帶來智能及成本效益的提升。
GPT‑6 Sol 能處理艱鉅的工作任務,並以較高用量上限和較低成本提供更多反覆改進空間;與價格相若的競爭模型相比,其智能更高、成果更佳。
在測試跨應用程式業務工作流程的 AutomationBench 中,推理強度設為 xhigh 的 GPT‑6 Sol,表現勝過設為 max 的 Claude Opus 5,而每項任務的成本僅為 Opus 5 的 9%。在推理強度設為 high 時,GPT‑6 Luna 的得分較上一代提高 5.4 個百分點,而每項任務的成本降低 58%。
在 AutomationBench 1.0.6(在新視窗中開啟) 中,AI 智能代理會接受端到端工作流程測試,使用橫跨銷售、市場推廣、營運、支援、財務及人力資源的 47 種工具。Claude Fable 5.1 的數據點低估了實際成本,因為當中並未計及約 40% 任務使用 Opus 5 後備模型的成本。
GPT‑6 Sol 亦以低得多的成本超越 Claude Fable 5.1,甚至勝過推理強度設為 low 的 GPT‑6 Astra。
模型(及推理強度) | 得分 | 每項任務成本 |
|---|---|---|
GPT‑6 Sol(極高) | 33.2% | $0.27 |
GPT‑6 Astra(低) | 30.3% | GPT‑6 Sol 的 3.9 倍 |
Claude Opus 5(max) | 26.9% | GPT‑6 Sol 的 11.1 倍 |
Claude Fable 5.1(以 Opus 5 作為後備模型;推理強度:max) | 31.4% | GPT‑6 Sol 的 >8.9 倍 (未公佈後備模型成本) |
在評估智能代理處理複雜專業工作流程能力的 Agents’ Last Exam 中,推理強度設為 max 的 GPT‑6 Sol 得分為 56.4%,高於 Claude Opus 5 在該評估中的最高得分,而每項任務的成本比後者低 60%。
在 Agents’ Last Exam V1(在新視窗中開啟) 中,AI 智能代理會接受需長時間完成且具經濟價值的任務評估,範圍橫跨 55 個子行業,涵蓋大部分以電腦執行的主要專業工作領域。
回答是否有用,取決於事實是否準確;我們正持續提升回答在事實方面的可靠性。我們的內部事實準確度評估以經過去識別化處理的真實對話為基礎,當中用戶曾指出模型的錯誤。在這項評估中,GPT‑6 Sol 的錯誤數量約為上一代的一半,以低得多的成本達到接近 Astra 的可靠性。GPT‑6 Luna 亦有顯著進步;在較高的推理強度下,其表現媲美 GPT‑5.6 Sol,而成本約為後者的百分之一。
我們在這項評估中,使用經過去識別化處理的 ChatGPT 對話來評估事實準確度;當中用戶曾指出先前模型的事實錯誤。這些容易誘發錯誤的對話並不代表一般使用情況,一般使用時的事實錯誤較少。評分時未控制回答長度,但我們針對不同詳盡程度進行的測試顯示,得分幾乎不受回答長度影響。
今年,編碼智能代理已開始處理複雜程度、範圍和所需時間均前所未有的任務。在 OpenAI,我們的內部用量呈指數級增長。按 API 價格換算,研究人員每日 Token 用量的價值中位數已超過 600 美元,而用量位於第 90 百分位的研究人員,每日用量的價值則超過 7,000 美元(加速研究:OpenAI 內部觀察)。隨着編碼智能代理承擔耗時更長、要求更高的任務,持續使用的成本亦變得更重要。GPT‑6 Sol 和 Luna 兼具強勁的編碼表現與較低的 API 價格,讓開發人員有更多空間反覆改進,也讓團隊更有信心交由 Codex 處理更具挑戰性的工作。
FrontierCode 評估編碼智能代理能否產生可直接合併至實際程式碼庫的變更。在這項評估中,GPT‑6 Sol 較 GPT‑5.6 Sol 大幅進步,並能以低得多的成本,達到與推理強度設為 xhigh 的 Claude Fable 5.1 相若的表現。
在 FrontierCode 1.1 Main(在新視窗中開啟) 中,AI 智能代理編寫的程式碼不僅按正確性評分,亦會按「可合併程度」評分,例如測試質素、範圍控制、程式碼風格,以及是否遵循程式碼庫標準。
DeepSWE v1.1 測試模型在實際程式碼庫中執行複雜軟件工程任務的表現。推理強度設為 max 的 GPT‑6 Sol 得分為 68.8%,與 Claude Fable 5 在該評估中以 xhigh 設定取得的最高得分 69.9% 相差僅 1.1 個百分點,而每項任務的成本約低 80%。
推理強度設為 max 的 GPT‑6 Luna 得分為 66.6%,與設為 medium 的 Claude Opus 5 和 Fable 5 表現相若。在這些比較中,Luna 每項任務的成本比 Opus 5 低 93%,比 Fable 5 低 96%。
在 DeepSWE 1.1(在新視窗中開啟) 中,AI 智能代理會解決原創而需長時間完成的軟件工程任務。
GPT‑6 Astra 仍是全球電腦操作表現最佳的模型,而 GPT‑6 Sol 和 Luna 的表現則比上一代更具成本效益。在 OSWorld 2.0 離線測試 中,推理強度設為 xhigh 的 GPT‑6 Sol,與設為 medium 的 Claude Opus 5 得分相若,分別為 60.5% 和 60.3%,而每項任務的成本約低 80%。推理強度設為 max 的 GPT‑6 Luna,能以十分之一的成本,超越設為 medium 的 GPT‑5.6 Sol。
在 OSWorld 2.0(在新視窗中開啟) 中,AI 智能代理會嘗試執行需長時間完成的電腦操作工作流程,範圍涵蓋日常及專業任務。我們報告的是 v2026.08.08 版本離線資料集的部分獎勵分數。
我們亦將 GPT‑6 Astra 改良後的溝通風格帶到 Sol 和 Luna;我們認為這種改進在技術和編碼對話中尤其明顯。你可以期待內容更清晰、少用術語和怪異措辭、減少價值不高的細節,整體回答亦會略為精簡,但不失實質內容。
雖然風格屬主觀判斷,但我們較喜歡 GPT‑6 Sol 在這裏的回覆。GPT‑6 Sol 不會那麼快下結論,較少重複提問者可能已清楚的細節(例如網站有 4 個頁面),亦較少使用含糊措辭(例如「bento feel」和「reshaping… around that system」)。模型也更清楚、坦誠地交代檢查過和未檢查的內容,並避免提供不必要的實作細節,例如圖像工具的提示詞。
除了降低 Token 價格,我們亦協助使用 GPT‑6 開發應用程式的開發人員,進一步節省重用上下文的成本。我們已改良 GPT‑6 的提示詞快取,預設提供更高的快取命中率,讓智能代理重用更多上下文、更快回應,並在讀取已快取的輸入 Token 時享有 90% 的費用減免。
開發人員現在亦有更多方法量度及優化快取表現:
監察及診斷。提示詞快取資訊主頁(在新視窗中開啟)會顯示已快取的輸入量,以及有關數值隨時間的變化。診斷工具(在新視窗中開啟)有助說明哪些內容原本可以使用快取、未能使用的原因,以及需要修正的地方。
調整推理強度及工具可用性,不會令快取失效。處理較困難的任務時,可提高推理強度(在新視窗中開啟);處理較簡單的後續任務時,則可降低推理強度。你亦可因應智能代理的需要,啟用或停用工具(在新視窗中開啟)。現在,調整這兩項設定都會保留先前的上下文,讓模型能重用快取。
優化要快取的前綴。開發人員可透過明確設定斷點,選擇要快取的提示詞前綴在何處結束。這讓開發人員更靈活地控制快取重用,並有助提升效能。
GitHub 表示,在過去數月,這些改進令數十億次向 OpenAI 模型發出的請求中,需要重新處理的提示詞 Token 比例降低超過 50%,有助 Copilot 更快回應。
GPT‑6 Sol 和 Luna 建基於 Astra 引入的對齊工作;Astra 是我們迄今對齊程度最高的模型。在對齊評估中,Sol 和 Luna 均較其 GPT‑5.6 對應型號有所改善,包括減少對自身編碼工作作出誤導性陳述。
以下評估刻意測試具挑戰性的情況,並非量度一般使用時的失敗率。完整結果請參閱系統說明卡(在新視窗中開啟)。
由今天起,所有 Plus、Pro、Business、Enterprise 和 Edu 用戶均可在「ChatGPT 工作」及 Codex 使用 GPT‑6 Sol 和 GPT‑6 Luna。免費版和 Go 用戶可在桌面應用程式使用 GPT‑6 Luna。這些模型目前尚未在「對話」模式中提供。在 OpenAI API 中,兩者分別以 gpt-6-sol 和 gpt-6-luna 提供。
為向所有用戶提供穩定服務,我們計劃在今天內逐步於 ChatGPT 推出這些模型。如果你在「ChatGPT 工作」或 Codex 看不到新模型,請稍後再試。
我們在研究環境中或透過 API 評估 GPT;由於系統提示詞、可用工具等有所不同,所得輸出可能與正式版 ChatGPT 略有差異。競爭模型的評估結果取自公開報告。如未有 Claude Fable 5.1 的分數,則採用已公佈的 Claude Fable 5 分數。


