跳到主要內容
OpenAI

GPT‑6 Sol 和 Luna 隆重登場

以更多方式將前沿智能融入你的日常工作。

正在載入...

本月較早時,我們推出了全球最智能、對齊程度最高的模型 GPT‑6 Astra。要求最高且最重要的項目仍需要 Astra 的完整實力,但實際工作各有不同規模、節奏和預算。

因此,我們推出 GPT‑6 Sol 和 GPT‑6 Luna,進一步擴展 GPT‑6 系列。GPT‑6 Astra 開創了新一代智能,而這些模型透過進一步提升成本效益,讓更多人受惠於這種智能。我們採用與 GPT‑6 Astra 相近的方法訓練 GPT‑6 Sol 和 Luna,將支持 Astra 在專業工作、事實準確度、編碼、電腦操作和對齊方面取得頂尖表現的技術進展,應用於速度更快、價格更相宜的模型。

GPT‑6 模型在成本與智能的不同組合上均處於領先地位,各級模型都具備卓越能力,並由能高效大規模提供這些能力的基礎設施支援。快取和推理方面的改進,讓我們能以更低成本提供這些模型。我們將節省的成本直接回饋用戶和客戶:與各自 GPT‑5.6 版本的推廣價格相比,Sol 和 Luna 的 API 價格降低 50%。這些改進共同推動先進 AI 更廣泛地用於日常任務及大規模應用。

GPT‑6 API 收費方式

模型

輸入

輸出

減價幅度

GPT‑6 Sol
對比 GPT‑5.6 Sol

$4 → $2

$20 → $10

價格低 50%

GPT‑6 Luna
對比 GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

價格低 50%

價格以每 100 萬個 Token 計算。

GPT‑6 Astra 仍是我們各方面表現最佳的模型。如果你追求最佳成果和毫不妥協的體驗,請選擇 Astra。

整個模型系列全面升級

GPT‑6 Sol 和 Luna 在最有助完成複雜工作的各項能力上,為你熟悉並正在使用的模型帶來智能及成本效益的提升。

專業工作

GPT‑6 Sol 能處理艱鉅的工作任務,並以較高用量上限和較低成本提供更多反覆改進空間;與價格相若的競爭模型相比,其智能更高、成果更佳。

在測試跨應用程式業務工作流程的 AutomationBench 中,推理強度設為 xhigh 的 GPT‑6 Sol,表現勝過設為 max 的 Claude Opus 5,而每項任務的成本僅為 Opus 5 的 9%。在推理強度設為 high 時,GPT‑6 Luna 的得分較上一代提高 5.4 個百分點,而每項任務的成本降低 58%。

在 AutomationBench 1.0.6⁠(在新視窗中開啟) 中,AI 智能代理會接受端到端工作流程測試,使用橫跨銷售、市場推廣、營運、支援、財務及人力資源的 47 種工具。Claude Fable 5.1 的數據點低估了實際成本,因為當中並未計及約 40% 任務使用 Opus 5 後備模型的成本。

GPT‑6 Sol 亦以低得多的成本超越 Claude Fable 5.1,甚至勝過推理強度設為 low 的 GPT‑6 Astra。

模型(及推理強度)

得分

每項任務成本

GPT‑6 Sol(極高)

33.2%

$0.27

GPT‑6 Astra(低)

30.3%

GPT‑6 Sol 的 3.9 倍

Claude Opus 5(max)

26.9%

GPT‑6 Sol 的 11.1 倍

Claude Fable 5.1(以 Opus 5 作為後備模型;推理強度:max)

31.4%

GPT‑6 Sol 的 >8.9 倍

(未公佈後備模型成本)

在評估智能代理處理複雜專業工作流程能力的 Agents’ Last Exam 中,推理強度設為 max 的 GPT‑6 Sol 得分為 56.4%,高於 Claude Opus 5 在該評估中的最高得分,而每項任務的成本比後者低 60%。

在 Agents’ Last Exam V1⁠(在新視窗中開啟) 中,AI 智能代理會接受需長時間完成且具經濟價值的任務評估,範圍橫跨 55 個子行業,涵蓋大部分以電腦執行的主要專業工作領域。

事實準確度

回答是否有用,取決於事實是否準確;我們正持續提升回答在事實方面的可靠性。我們的內部事實準確度評估以經過去識別化處理的真實對話為基礎,當中用戶曾指出模型的錯誤。在這項評估中,GPT‑6 Sol 的錯誤數量約為上一代的一半,以低得多的成本達到接近 Astra 的可靠性。GPT‑6 Luna 亦有顯著進步;在較高的推理強度下,其表現媲美 GPT‑5.6 Sol,而成本約為後者的百分之一。

我們在這項評估中,使用經過去識別化處理的 ChatGPT 對話來評估事實準確度;當中用戶曾指出先前模型的事實錯誤。這些容易誘發錯誤的對話並不代表一般使用情況,一般使用時的事實錯誤較少。評分時未控制回答長度,但我們針對不同詳盡程度進行的測試顯示,得分幾乎不受回答長度影響。

編碼

今年,編碼智能代理已開始處理複雜程度、範圍和所需時間均前所未有的任務。在 OpenAI,我們的內部用量呈指數級增長。按 API 價格換算,研究人員每日 Token 用量的價值中位數已超過 600 美元,而用量位於第 90 百分位的研究人員,每日用量的價值則超過 7,000 美元(加速研究:OpenAI 內部觀察⁠)。隨着編碼智能代理承擔耗時更長、要求更高的任務,持續使用的成本亦變得更重要。GPT‑6 Sol 和 Luna 兼具強勁的編碼表現與較低的 API 價格,讓開發人員有更多空間反覆改進,也讓團隊更有信心交由 Codex 處理更具挑戰性的工作。

FrontierCode 評估編碼智能代理能否產生可直接合併至實際程式碼庫的變更。在這項評估中,GPT‑6 Sol 較 GPT‑5.6 Sol 大幅進步,並能以低得多的成本,達到與推理強度設為 xhigh 的 Claude Fable 5.1 相若的表現。

在 FrontierCode 1.1 Main⁠(在新視窗中開啟) 中,AI 智能代理編寫的程式碼不僅按正確性評分,亦會按「可合併程度」評分,例如測試質素、範圍控制、程式碼風格,以及是否遵循程式碼庫標準。

DeepSWE v1.1 測試模型在實際程式碼庫中執行複雜軟件工程任務的表現。推理強度設為 max 的 GPT‑6 Sol 得分為 68.8%,與 Claude Fable 5 在該評估中以 xhigh 設定取得的最高得分 69.9% 相差僅 1.1 個百分點,而每項任務的成本約低 80%。

推理強度設為 max 的 GPT‑6 Luna 得分為 66.6%,與設為 medium 的 Claude Opus 5 和 Fable 5 表現相若。在這些比較中,Luna 每項任務的成本比 Opus 5 低 93%,比 Fable 5 低 96%。

在 DeepSWE 1.1⁠(在新視窗中開啟) 中,AI 智能代理會解決原創而需長時間完成的軟件工程任務。

電腦操作

GPT‑6 Astra 仍是全球電腦操作表現最佳的模型,而 GPT‑6 Sol 和 Luna 的表現則比上一代更具成本效益。在 OSWorld 2.0 離線測試 中,推理強度設為 xhigh 的 GPT‑6 Sol,與設為 medium 的 Claude Opus 5 得分相若,分別為 60.5% 和 60.3%,而每項任務的成本約低 80%。推理強度設為 max 的 GPT‑6 Luna,能以十分之一的成本,超越設為 medium 的 GPT‑5.6 Sol。

在 OSWorld 2.0⁠(在新視窗中開啟) 中,AI 智能代理會嘗試執行需長時間完成的電腦操作工作流程,範圍涵蓋日常及專業任務。我們報告的是 v2026.08.08 版本離線資料集的部分獎勵分數。

協作風格

我們亦將 GPT‑6 Astra 改良後的溝通風格帶到 Sol 和 Luna;我們認為這種改進在技術和編碼對話中尤其明顯。你可以期待內容更清晰、少用術語和怪異措辭、減少價值不高的細節,整體回答亦會略為精簡,但不失實質內容。

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

雖然風格屬主觀判斷,但我們較喜歡 GPT‑6 Sol 在這裏的回覆。GPT‑6 Sol 不會那麼快下結論,較少重複提問者可能已清楚的細節(例如網站有 4 個頁面),亦較少使用含糊措辭(例如「bento feel」和「reshaping… around that system」)。模型也更清楚、坦誠地交代檢查過和未檢查的內容,並避免提供不必要的實作細節,例如圖像工具的提示詞。

改善智能代理及長對話的快取功能

除了降低 Token 價格,我們亦協助使用 GPT‑6 開發應用程式的開發人員,進一步節省重用上下文的成本。我們已改良 GPT‑6 的提示詞快取,預設提供更高的快取命中率,讓智能代理重用更多上下文、更快回應,並在讀取已快取的輸入 Token 時享有 90% 的費用減免。

開發人員現在亦有更多方法量度及優化快取表現:

GitHub 表示,在過去數月,這些改進令數十億次向 OpenAI 模型發出的請求中,需要重新處理的提示詞 Token 比例降低超過 50%,有助 Copilot 更快回應。

持續改善對齊

GPT‑6 Sol 和 Luna 建基於 Astra 引入的對齊工作;Astra 是我們迄今對齊程度最高的模型。在對齊評估中,Sol 和 Luna 均較其 GPT‑5.6 對應型號有所改善,包括減少對自身編碼工作作出誤導性陳述。

以下評估刻意測試具挑戰性的情況,並非量度一般使用時的失敗率。完整結果請參閱系統說明卡⁠(在新視窗中開啟)。

可用情況

由今天起,所有 Plus、Pro、Business、Enterprise 和 Edu 用戶均可在「ChatGPT 工作」及 Codex 使用 GPT‑6 Sol 和 GPT‑6 Luna。免費版和 Go 用戶可在桌面應用程式使用 GPT‑6 Luna。這些模型目前尚未在「對話」模式中提供。在 OpenAI API 中,兩者分別以 gpt-6-sol 和 gpt-6-luna 提供。

為向所有用戶提供穩定服務,我們計劃在今天內逐步於 ChatGPT 推出這些模型。如果你在「ChatGPT 工作」或 Codex 看不到新模型,請稍後再試。


我們在研究環境中或透過 API 評估 GPT;由於系統提示詞、可用工具等有所不同,所得輸出可能與正式版 ChatGPT 略有差異。競爭模型的評估結果取自公開報告。如未有 Claude Fable 5.1 的分數,則採用已公佈的 Claude Fable 5 分數。

作者

OpenAI