跳至主要内容
OpenAI

隆重推出 GPT‑6 Sol 和 Luna

以更多方式将前沿智能融入你的日常工作

正在加载…

本月早些时候,我们推出了全球迄今最智能、对齐程度最高的模型 GPT‑6 Astra。要求更高的重要项目仍需充分发挥 Astra 的强大能力,但不同工作有着不同的规模、节奏和预算。

因此,我们推出 GPT‑6 Sol 和 GPT‑6 Luna。GPT‑6 Astra 开启了新一代智能,而这些模型进一步拓展成本效益的前沿,让更多人受益于这种智能。我们采用与 GPT‑6 Astra 相似的方法训练 GPT‑6 Sol 和 Luna,将 Astra 在专业工作、事实准确性、编程、计算机操作和对齐方面实现顶尖性能的技术突破,带到速度更快、价格更实惠的模型中。

GPT‑6 系列模型在成本与智能水平的各个区间均处于领先地位,不仅每一档都具备卓越能力,还依托基础设施实现高效的大规模交付。缓存和推理方面的改进降低了这些模型的服务成本,我们也将节省的成本直接回馈给用户和客户:与 GPT‑5.6 的推广价相比,Sol 和 Luna 的 API 价格降低了 50%。这些改进共同推动先进 AI 更切实地应用于更多日常任务,并实现规模化部署。

GPT‑6 API 定价

模型

输入

输出

降价幅度

GPT‑6 Sol
对比 GPT‑5.6 Sol

$4 → $2

$20 → $10

成本低 50%

GPT‑6 Luna
对比 GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

成本低 50%

价格按每 100 万个 Token 计算。

GPT‑6 Astra 仍是我们迄今综合表现最佳的模型。如果你追求最佳结果和毫不妥协的体验,请选择它。

整个模型系列全面升级

GPT‑6 Sol 和 Luna 为你熟悉并已在使用的模型带来智能升级和更高的成本效益,尤其提升了完成复杂工作所需的关键能力。

专业工作

GPT‑6 Sol 能够承担高难度工作任务,同时凭借更高的使用限额和更低的成本,为你留出更多迭代空间;与定价相近的竞品模型相比,它更智能,结果也更出色。

在测试跨应用业务工作流的 AutomationBench 上,采用 xhigh 推理强度的 GPT‑6 Sol 表现优于采用 max 推理强度的 Claude Opus 5,而每项任务的成本仅为 Opus 5 的 9%。在 high 推理强度下,GPT‑6 Luna 比上一代模型提高 5.4 个百分点,而每项任务的成本降低 58%。

在 AutomationBench 1.0.6⁠(在新窗口中打开) 中,会使用涵盖销售、营销、运营、支持、财务和人力资源领域的 47 种工具,测试 AI 智能体执行端到端工作流的能力。Claude Fable 5.1 的数据点低估了其实际成本,因为其中未计入约 40% 的任务回退至 Opus 5 所产生的成本。

GPT‑6 Sol 还以低得多的成本超越 Claude Fable 5.1,甚至优于 low 推理强度的 GPT‑6 Astra。

模型(及推理强度)

得分

每项任务成本

GPT‑6 Sol (xhigh)

33.2%

$0.27

GPT‑6 Astra (low)

30.3%

GPT‑6 Sol 的 3.9 倍

Claude Opus 5 (max)

26.9%

GPT‑6 Sol 的 11.1 倍

Claude Fable 5.1(回退至 Opus 5,max)

31.4%

GPT‑6 Sol 的 >8.9 倍

(未报告回退成本)

在评估智能体处理复杂专业工作流能力的 Agents’ Last Exam 中,采用 max 推理强度的 GPT‑6 Sol 得分为 56.4%,高于 Claude Opus 5 在该评估中的最高分,而每项任务的成本低 60%。

在 Agents’ Last Exam V1⁠(在新窗口中打开) 中,会评估 AI 智能体处理横跨 55 个细分行业、周期较长且具有经济价值的任务的能力,涵盖通过计算机完成的专业工作中的大多数主要领域。

事实准确性

回答是否有用取决于事实是否准确,而我们正在持续提升事实可靠性。在我们的内部事实准确性评估中,GPT‑6 Sol 的错误数量约为上一代模型的一半,以低得多的成本接近 Astra 的可靠性水平。该评估基于经过去标识化处理的真实对话,其中用户曾标记我们模型所犯的错误。GPT‑6 Luna 也有显著提升;在较高推理强度下,它能以约百分之一的成本达到 GPT‑5.6 Sol 的水平。

我们在经过去标识化处理的 ChatGPT 对话中评估事实准确性;这些对话中的用户曾标记先前模型所犯的事实错误。这些容易诱发错误的对话并不代表典型使用情况,因为在一般使用中,事实错误更为少见。评分未按回答长度进行控制;不过,我们对不同详略程度的测试表明,回答长度几乎不会影响结果。

编程

今年,编程智能体开始处理复杂程度更高、范围更广、耗时更长的任务。在 OpenAI,我们的内部使用量呈指数级增长。按 API 价格计算,研究人员每日 Token 用量成本的中位数已超过 600 美元,第 90 百分位研究人员则超过 7,000 美元(加速研究:OpenAI 内部视角⁠)。随着编程智能体承担耗时更长、要求更高的任务,持续使用的成本愈发重要。GPT‑6 Sol 和 Luna 兼具强大的编程性能与更低的 API 价格,让开发者拥有更多迭代空间,也让团队更有信心交给 Codex 更具挑战性的任务。

在评估编程智能体能否生成可直接合并到真实代码库中的更改的 FrontierCode 上,GPT‑6 Sol 相比 GPT‑5.6 Sol 有显著提升,并能以低得多的成本达到采用 xhigh 推理强度的 Claude Fable 5.1 的水平。

在 FrontierCode 1.1 Main⁠(在新窗口中打开) 中,AI 智能体编写的代码不仅要按正确性评分,还要评估“可合并性”,例如测试质量、范围控制、代码风格以及是否遵循代码库标准。

在 DeepSWE v1.1 上,该基准测试模型处理真实代码库中复杂软件工程任务的表现。采用 max 推理强度的 GPT‑6 Sol 得分为 68.8%,与 Claude Fable 5 在该评估中的最高分仅相差 1.1 个百分点 — 后者在 xhigh 推理强度下得分为 69.9% — 而 GPT‑6 Sol 每项任务的成本约低 80%。

采用 max 推理强度的 GPT‑6 Luna 得分为 66.6%,与采用 medium 推理强度的 Claude Opus 5 和 Fable 5 相当。在这些比较中,Luna 每项任务的成本比 Opus 5 低 93%,比 Fable 5 低 96%。

在 DeepSWE 1.1⁠(在新窗口中打开) 中,AI 智能体解决原创的长周期软件工程任务。

计算机操作

尽管 GPT‑6 Astra 仍是迄今全球计算机操作能力最强的模型,但 GPT‑6 Sol 和 Luna 的成本效益均优于各自的上一代模型。在 OSWorld 2.0 离线集上,采用 xhigh 推理强度的 GPT‑6 Sol 得分与采用 medium 推理强度的 Claude Opus 5 相近 — 分别为 60.5% 和 60.3% — 而每项任务的成本约低 80%。采用 max 推理强度的 GPT‑6 Luna 能以十分之一的成本超越采用 medium 推理强度的 GPT‑5.6 Sol。

在 OSWorld 2.0⁠(在新窗口中打开) 中,AI 智能体尝试执行涵盖日常和专业任务的长周期计算机操作工作流。我们报告的是 v2026.08.08 版本离线集的部分奖励得分。

协作风格

我们还将 GPT‑6 Astra 改进后的沟通风格引入 Sol 和 Luna;我们认为,这种变化在技术和编程对话中会尤为明显。你会看到表达更清晰、术语更少、措辞更自然、低价值细节更少,回答整体也会略短,同时不失实质内容。

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

尽管风格带有主观性,但在这里我们更偏好 GPT‑6 Sol 的回复。它不会过快下结论,也不会花太多篇幅重复提问者可能已经清楚的细节(例如网站有四个页面);它较少使用含糊的措辞(例如“便当盒风格”“围绕该系统重塑……”),会更坦率地说明自己检查过和未检查过的内容,也不会无谓地分享图像工具提示词等实现细节。

改进智能体和长对话的缓存机制

除了降低 Token 价格,我们还帮助基于 GPT‑6 构建应用的开发者进一步节省应用重复使用上下文的成本。我们改进了 GPT‑6 的提示词缓存,默认即可实现更高的缓存命中率,帮助智能体复用更多上下文、更快响应,并让缓存输入 Token 的读取费用享受 90% 的折扣。

开发者也有更多方式来衡量和优化缓存性能:

GitHub 报告称,在过去几个月中,这些改进让发送至 OpenAI 模型的数十亿次请求中,需要重新处理的提示词 Token 占比降低了 50% 以上,从而帮助 Copilot 更快响应。

持续改进对齐

GPT‑6 Sol 和 Luna 延续了 Astra 引入的对齐工作;Astra 是我们迄今对齐程度最高的模型。在对齐评估中,Sol 和 Luna 相比各自的 GPT‑5.6 版本均有提升,包括更少对其编程工作作出误导性陈述。

以下评估刻意测试具有挑战性的情境,并不用于衡量典型使用中的失败率。完整结果请参阅系统卡⁠(在新窗口中打开)。

可用性

从今天起,所有 Plus、Pro、Business、Enterprise 和 Edu 用户均可在“ChatGPT 工作”和 Codex 中使用 GPT‑6 Sol 与 GPT‑6 Luna。免费版和 Go 用户可在桌面应用中使用 GPT‑6 Luna。这些模型尚未在聊天中推出。在 OpenAI API 中,它们分别以 gpt-6-sol 和 gpt-6-luna 提供。

为确保所有用户都能获得稳定的服务,我们计划在今天内逐步向 ChatGPT 推出这些模型。如果你在“ChatGPT 工作”或 Codex 中没有看到新模型,请稍后重试。


GPT 的评估在我们的研究环境中或通过 API 进行。由于系统提示词、可用工具等方面存在差异,其输出可能与正式版 ChatGPT 略有不同。竞品模型的评估结果取自公开报告。如果没有 Claude Fable 5.1 的得分,则采用 Claude Fable 5 的公开得分。

作者

OpenAI