隆重推出 GPT‑6 Sol 和 Luna
以更多方式將前沿智慧融入你的日常工作。
本月稍早,我們推出了全球最智慧、最符合人類意圖的模型 GPT‑6 Astra。雖然最艱鉅、最重要的專案仍需要 Astra 的完整深度,但實際工作有不同的規模、節奏與預算。
因此,我們以 GPT‑6 Sol 和 GPT‑6 Luna 擴展 GPT‑6 產品陣容。GPT‑6 Astra 開啟了新一代智慧,而這些模型則進一步突破成本效益的前沿,讓更多人受惠於這種智慧。我們採用與 GPT‑6 Astra 類似的方法訓練 GPT‑6 Sol 和 Luna,將 Astra 在專業工作、事實準確性、程式碼編寫、電腦操作及對齊方面的頂尖進展,帶到速度更快、價格更實惠的模型。
GPT‑6 模型在成本與智慧的權衡曲線上全面領先,兼具各層級的卓越能力,以及能高效率、大規模提供這些能力的基礎架構。快取和推論方面的改進,讓我們能以更低成本提供這些模型;我們也將節省的成本直接回饋給使用者和客戶:與 GPT‑5.6 的促銷價格相比,Sol 和 Luna 的 API 價格降低 50%。這些改進相輔相成,讓進階 AI 更適合大規模應用於日常任務和各類應用程式。
模型 | 輸入 | 輸出 | 降價幅度 |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 便宜 50% |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 便宜 50% |
價格以每百萬個 Token 計。
GPT‑6 Astra 依然是我們各方面表現最佳的模型。若想獲得最佳成果和毫不妥協的體驗,請選擇 Astra。
GPT‑6 Sol 和 Luna 提升了你熟悉且常用模型的智慧與成本效益,涵蓋完成複雜工作時最實用的各項能力。
GPT‑6 Sol 能處理艱鉅的工作任務,並以更高的用量限制和更低的成本,提供更多反覆調整的空間;相較於價格相近的競爭模型,它更智慧,成果也更好。
在測試跨應用程式商務工作流程的 AutomationBench 中,採用極高推理強度的 GPT‑6 Sol 表現優於採用 Max 推理強度的 Claude Opus 5,而每項任務的成本僅為 Opus 5 的 9%。採用高推理強度時,GPT‑6 Luna 比上一代提高 5.4 個百分點,每項任務的成本則降低 58%。
在 AutomationBench 1.0.6(在新視窗中開啟) 中,AI 智慧體使用橫跨銷售、行銷、營運、支援、財務與人力資源的 47 種工具,接受端對端工作流程測試。Claude Fable 5.1 的資料點低估了實際成本,因為其中未計入約 40% 任務所使用的 Opus 5 備援成本。
GPT‑6 Sol 的表現也超越 Claude Fable 5.1,成本卻低得多,甚至勝過採用低推理強度的 GPT‑6 Astra。
模型(及推理強度) | 分數 | 每項任務成本 |
|---|---|---|
GPT‑6 Sol(極高) | 33.2% | $0.27 |
GPT‑6 Astra(低) | 30.3% | GPT‑6 Sol 的 3.9 倍 |
Claude Opus 5 (Max) | 26.9% | GPT‑6 Sol 的 11.1 倍 |
Claude Fable 5.1(備援:Opus 5,Max) | 31.4% | GPT‑6 Sol 的 >8.9 倍 (未公布備援成本) |
在以複雜專業工作流程評估智慧體的 Agents’ Last Exam 中,採用 Max 推理強度的 GPT‑6 Sol 得分為 56.4%,高於 Claude Opus 5 在這項評估中的最高分,而每項任務的成本低 60%。
在 Agents’ Last Exam V1(在新視窗中開啟) 中,AI 智慧體會接受需長期執行且具有經濟價值的任務評估,涵蓋 55 個次產業,包含大多數需要使用電腦完成的主要專業工作領域。
回答是否實用取決於事實是否正確,而我們正持續提升事實可靠性。在我們的內部事實準確性評估中,資料來自使用者曾標記模型錯誤、且已去識別化的真實對話。GPT‑6 Sol 的錯誤數約為上一代的一半,以低得多的成本接近 Astra 等級的可靠性。GPT‑6 Luna 也大幅進步;採用較高推理強度時,其表現可媲美 GPT‑5.6 Sol,成本卻僅約為後者的百分之一。
我們在這裡使用已去識別化的 ChatGPT 對話評估事實準確性;這些對話中的使用者曾標記先前模型的事實錯誤。這類容易誘發錯誤的對話並不代表一般使用情況,因為一般情況下的事實錯誤較少。分數未針對回答長度進行控制;不過,我們針對詳略程度的掃描測試顯示,結果幾乎不受回答長度影響。
今年,程式設計智慧體開始處理複雜度、範圍和持續時間都前所未見的任務。在 OpenAI,我們的內部使用量呈指數成長。若將研究人員每日的 Token 用量按 API 價格換算,金額中位數已超過 600 美元,第 90 百分位數則超過 7,000 美元(加速研究:OpenAI 內部觀察)。隨著程式碼編寫智慧體承擔更耗時、更艱鉅的任務,持續使用的成本也愈發重要。GPT‑6 Sol 和 Luna 結合強大的程式碼編寫效能與更低的 API 價格,讓開發人員有更多反覆調整的空間,也讓團隊能更有信心地交付更具挑戰性的任務給 Codex。
在評估程式碼編寫智慧體能否產生可直接合併至真實程式碼庫之變更的 FrontierCode 中,GPT‑6 Sol 相較 GPT‑5.6 Sol 大幅進步,並能以低得多的成本媲美採用超高推理強度的 Claude Fable 5.1。
在 FrontierCode 1.1 Main(在新視窗中開啟) 中,AI 智慧體撰寫的程式碼不只會依正確性評分,也會評估「可合併性」,例如測試品質、範圍控管、程式碼風格,以及是否遵循程式碼庫標準。
在測試真實程式碼庫中複雜軟體工程任務的 DeepSWE v1.1 中,採用 Max 推理強度的 GPT‑6 Sol 得分為 68.8%,與 Claude Fable 5 在這項評估中的最高分僅差 1.1 個百分點;後者採用極高推理強度時得分為 69.9%,但 GPT‑6 Sol 每項任務的成本約低 80%。
採用 Max 推理強度的 GPT‑6 Luna 得分為 66.6%,與採用中推理強度的 Claude Opus 5 和 Fable 5 相當。在這些比較中,Luna 每項任務的成本比 Opus 5 低 93%,比 Fable 5 低 96%。
在 DeepSWE 1.1(在新視窗中開啟) 中,AI 智慧體會解決原創且需長期執行的軟體工程任務。
GPT‑6 Astra 仍是全球電腦操作能力最佳的模型,但 GPT‑6 Sol 和 Luna 的成本效益均優於上一代。在 OSWorld 2.0 離線評估中,採用極高推理強度的 GPT‑6 Sol 得分與採用中推理強度的 Claude Opus 5 相近,分別為 60.5% 和 60.3%,而每項任務的成本約低 80%。採用 Max 推理強度的 GPT‑6 Luna 能超越採用中推理強度的 GPT‑5.6 Sol,而成本僅為後者的十分之一。
在 OSWorld 2.0(在新視窗中開啟) 中,AI 智慧體會嘗試完成涵蓋日常與專業任務、需長期執行的電腦操作工作流程。我們報告的是 v2026.08.08 版本離線資料集的部分獎勵分數。
我們也將 GPT‑6 Astra 改良後的溝通風格帶到 Sol 和 Luna,尤其在技術和程式碼編寫對話中,差異應會格外明顯。整體而言,回答會更清楚、少用術語和突兀措辭、減少價值不高的細節,篇幅也會略為縮短,但不會犧牲實質內容。
雖然風格帶有主觀性,但我們較偏好 GPT‑6 Sol 在此處的回覆。它不會太快下結論,也較少重述提問者可能已經知道的細節(例如網站有四個頁面),較少使用模糊措辭(例如「便當盒風格」、「依該系統重新塑造……」),更坦白交代檢查過與未檢查的內容,也不會不必要地分享實作細節,例如提供給影像工具的提示詞。
除了降低 Token 價格,我們也協助採用 GPT‑6 的開發人員,進一步節省應用程式重複使用情境資訊的成本。我們改善了 GPT‑6 的提示詞快取,預設即可提供更高的快取命中率,協助智慧體重複使用更多情境資訊、加快回應速度,並讓讀取已快取輸入 Token 的費用降低 90%。
開發人員現在也有更多方式衡量及最佳化快取效能:
監控與診斷。提示詞快取資訊主頁(在新視窗中開啟)會顯示有多少輸入已快取,以及這項數據隨時間的變化。診斷工具(在新視窗中開啟)可協助說明錯失快取機會的原因及修正方式。
調整推理強度和工具可用性,而不破壞快取。遇到較困難的任務時,可提高推理強度(在新視窗中開啟);處理較簡單的後續問題時則可降低強度。您也能隨智慧體需求變化,啟用或停用工具(在新視窗中開啟)。這兩項控制功能現在都會保留先前的情境資訊,以供快取重複使用。
最佳化要快取的前綴。明確的中斷點可讓開發人員選擇已快取提示詞前綴的結束位置。如此一來,開發人員就能更靈活地控制快取重複使用,並可提升效能。
GitHub 表示,過去數月來,在數十億次傳送至 OpenAI 模型的要求中,這些改進讓需要重新處理的提示詞 Token 比例降低逾 50%,協助 Copilot 加快回應速度。
GPT‑6 Sol 和 Luna 延續 Astra 所引進的對齊工作;Astra 是我們迄今最符合人類意圖的模型。在我們的對齊評估中,Sol 和 Luna 均優於各自的 GPT‑5.6 版本,包括更少對其程式碼編寫工作提出誤導性陳述。
以下評估刻意測試具挑戰性的情境,並不衡量一般使用情況下的失敗率。完整結果請參閱系統說明卡(在新視窗中開啟)。
即日起,所有 Plus、Pro、Business、Enterprise 和 Edu 使用者均可在 ChatGPT 工作和 Codex 中使用 GPT‑6 Sol 與 GPT‑6 Luna。免費版和 Go 使用者可在桌面版應用程式中使用 GPT‑6 Luna。這些模型尚未在「對話」中推出。在 OpenAI API 中,這兩款模型分別為 gpt-6-sol 和 gpt-6-luna。
為了讓所有人的服務維持穩定,我們計畫在今天逐步於 ChatGPT 中推出這些模型。如果你在 ChatGPT 工作或 Codex 中看不到新模型,請稍後再試。
GPT 的評估是在我們的研究環境或透過 API 進行。由於系統提示詞、可用工具等方面存在差異,其輸出可能與正式環境中的 ChatGPT 略有不同。競爭模型的評估資料取自公開報告。若無 Claude Fable 5.1 的分數,則採用 Claude Fable 5 的分數。


