隆重推出 GPT‑6 Sol 和 Luna
以更多方式将前沿智能融入你的日常工作
本月早些时候,我们推出了全球迄今最智能、对齐程度最高的模型 GPT‑6 Astra。要求更高的重要项目仍需充分发挥 Astra 的强大能力,但不同工作有着不同的规模、节奏和预算。
因此,我们推出 GPT‑6 Sol 和 GPT‑6 Luna。GPT‑6 Astra 开启了新一代智能,而这些模型进一步拓展成本效益的前沿,让更多人受益于这种智能。我们采用与 GPT‑6 Astra 相似的方法训练 GPT‑6 Sol 和 Luna,将 Astra 在专业工作、事实准确性、编程、计算机操作和对齐方面实现顶尖性能的技术突破,带到速度更快、价格更实惠的模型中。
GPT‑6 系列模型在成本与智能水平的各个区间均处于领先地位,不仅每一档都具备卓越能力,还依托基础设施实现高效的大规模交付。缓存和推理方面的改进降低了这些模型的服务成本,我们也将节省的成本直接回馈给用户和客户:与 GPT‑5.6 的推广价相比,Sol 和 Luna 的 API 价格降低了 50%。这些改进共同推动先进 AI 更切实地应用于更多日常任务,并实现规模化部署。
模型 | 输入 | 输出 | 降价幅度 |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 成本低 50% |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 成本低 50% |
价格按每 100 万个 Token 计算。
GPT‑6 Astra 仍是我们迄今综合表现最佳的模型。如果你追求最佳结果和毫不妥协的体验,请选择它。
GPT‑6 Sol 和 Luna 为你熟悉并已在使用的模型带来智能升级和更高的成本效益,尤其提升了完成复杂工作所需的关键能力。
GPT‑6 Sol 能够承担高难度工作任务,同时凭借更高的使用限额和更低的成本,为你留出更多迭代空间;与定价相近的竞品模型相比,它更智能,结果也更出色。
在测试跨应用业务工作流的 AutomationBench 上,采用 xhigh 推理强度的 GPT‑6 Sol 表现优于采用 max 推理强度的 Claude Opus 5,而每项任务的成本仅为 Opus 5 的 9%。在 high 推理强度下,GPT‑6 Luna 比上一代模型提高 5.4 个百分点,而每项任务的成本降低 58%。
在 AutomationBench 1.0.6(在新窗口中打开) 中,会使用涵盖销售、营销、运营、支持、财务和人力资源领域的 47 种工具,测试 AI 智能体执行端到端工作流的能力。Claude Fable 5.1 的数据点低估了其实际成本,因为其中未计入约 40% 的任务回退至 Opus 5 所产生的成本。
GPT‑6 Sol 还以低得多的成本超越 Claude Fable 5.1,甚至优于 low 推理强度的 GPT‑6 Astra。
模型(及推理强度) | 得分 | 每项任务成本 |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (low) | 30.3% | GPT‑6 Sol 的 3.9 倍 |
Claude Opus 5 (max) | 26.9% | GPT‑6 Sol 的 11.1 倍 |
Claude Fable 5.1(回退至 Opus 5,max) | 31.4% | GPT‑6 Sol 的 >8.9 倍 (未报告回退成本) |
在评估智能体处理复杂专业工作流能力的 Agents’ Last Exam 中,采用 max 推理强度的 GPT‑6 Sol 得分为 56.4%,高于 Claude Opus 5 在该评估中的最高分,而每项任务的成本低 60%。
在 Agents’ Last Exam V1(在新窗口中打开) 中,会评估 AI 智能体处理横跨 55 个细分行业、周期较长且具有经济价值的任务的能力,涵盖通过计算机完成的专业工作中的大多数主要领域。
回答是否有用取决于事实是否准确,而我们正在持续提升事实可靠性。在我们的内部事实准确性评估中,GPT‑6 Sol 的错误数量约为上一代模型的一半,以低得多的成本接近 Astra 的可靠性水平。该评估基于经过去标识化处理的真实对话,其中用户曾标记我们模型所犯的错误。GPT‑6 Luna 也有显著提升;在较高推理强度下,它能以约百分之一的成本达到 GPT‑5.6 Sol 的水平。
我们在经过去标识化处理的 ChatGPT 对话中评估事实准确性;这些对话中的用户曾标记先前模型所犯的事实错误。这些容易诱发错误的对话并不代表典型使用情况,因为在一般使用中,事实错误更为少见。评分未按回答长度进行控制;不过,我们对不同详略程度的测试表明,回答长度几乎不会影响结果。
今年,编程智能体开始处理复杂程度更高、范围更广、耗时更长的任务。在 OpenAI,我们的内部使用量呈指数级增长。按 API 价格计算,研究人员每日 Token 用量成本的中位数已超过 600 美元,第 90 百分位研究人员则超过 7,000 美元(加速研究:OpenAI 内部视角)。随着编程智能体承担耗时更长、要求更高的任务,持续使用的成本愈发重要。GPT‑6 Sol 和 Luna 兼具强大的编程性能与更低的 API 价格,让开发者拥有更多迭代空间,也让团队更有信心交给 Codex 更具挑战性的任务。
在评估编程智能体能否生成可直接合并到真实代码库中的更改的 FrontierCode 上,GPT‑6 Sol 相比 GPT‑5.6 Sol 有显著提升,并能以低得多的成本达到采用 xhigh 推理强度的 Claude Fable 5.1 的水平。
在 FrontierCode 1.1 Main(在新窗口中打开) 中,AI 智能体编写的代码不仅要按正确性评分,还要评估“可合并性”,例如测试质量、范围控制、代码风格以及是否遵循代码库标准。
在 DeepSWE v1.1 上,该基准测试模型处理真实代码库中复杂软件工程任务的表现。采用 max 推理强度的 GPT‑6 Sol 得分为 68.8%,与 Claude Fable 5 在该评估中的最高分仅相差 1.1 个百分点 — 后者在 xhigh 推理强度下得分为 69.9% — 而 GPT‑6 Sol 每项任务的成本约低 80%。
采用 max 推理强度的 GPT‑6 Luna 得分为 66.6%,与采用 medium 推理强度的 Claude Opus 5 和 Fable 5 相当。在这些比较中,Luna 每项任务的成本比 Opus 5 低 93%,比 Fable 5 低 96%。
在 DeepSWE 1.1(在新窗口中打开) 中,AI 智能体解决原创的长周期软件工程任务。
尽管 GPT‑6 Astra 仍是迄今全球计算机操作能力最强的模型,但 GPT‑6 Sol 和 Luna 的成本效益均优于各自的上一代模型。在 OSWorld 2.0 离线集上,采用 xhigh 推理强度的 GPT‑6 Sol 得分与采用 medium 推理强度的 Claude Opus 5 相近 — 分别为 60.5% 和 60.3% — 而每项任务的成本约低 80%。采用 max 推理强度的 GPT‑6 Luna 能以十分之一的成本超越采用 medium 推理强度的 GPT‑5.6 Sol。
在 OSWorld 2.0(在新窗口中打开) 中,AI 智能体尝试执行涵盖日常和专业任务的长周期计算机操作工作流。我们报告的是 v2026.08.08 版本离线集的部分奖励得分。
我们还将 GPT‑6 Astra 改进后的沟通风格引入 Sol 和 Luna;我们认为,这种变化在技术和编程对话中会尤为明显。你会看到表达更清晰、术语更少、措辞更自然、低价值细节更少,回答整体也会略短,同时不失实质内容。
尽管风格带有主观性,但在这里我们更偏好 GPT‑6 Sol 的回复。它不会过快下结论,也不会花太多篇幅重复提问者可能已经清楚的细节(例如网站有四个页面);它较少使用含糊的措辞(例如“便当盒风格”“围绕该系统重塑……”),会更坦率地说明自己检查过和未检查过的内容,也不会无谓地分享图像工具提示词等实现细节。
除了降低 Token 价格,我们还帮助基于 GPT‑6 构建应用的开发者进一步节省应用重复使用上下文的成本。我们改进了 GPT‑6 的提示词缓存,默认即可实现更高的缓存命中率,帮助智能体复用更多上下文、更快响应,并让缓存输入 Token 的读取费用享受 90% 的折扣。
开发者也有更多方式来衡量和优化缓存性能:
监控和诊断。提示词缓存控制面板(在新窗口中打开)可显示缓存的输入量,以及这一数据如何随时间变化。诊断工具(在新窗口中打开)可帮助解释哪些内容错失了缓存机会,以及应如何修复。
调整推理强度和工具可用性,同时不破坏缓存。对于较难的任务,可提高推理强度(在新窗口中打开);对于较简单的后续问题,则可降低强度。你还可以根据智能体需求的变化启用或停用工具(在新窗口中打开)。现在,这两项控制均可保留先前的上下文,以供缓存复用。
优化要缓存的前缀。通过显式断点,开发者可以选择缓存提示词前缀的结束位置。这让开发者能更好地控制缓存复用,并可改善性能。
GitHub 报告称,在过去几个月中,这些改进让发送至 OpenAI 模型的数十亿次请求中,需要重新处理的提示词 Token 占比降低了 50% 以上,从而帮助 Copilot 更快响应。
GPT‑6 Sol 和 Luna 延续了 Astra 引入的对齐工作;Astra 是我们迄今对齐程度最高的模型。在对齐评估中,Sol 和 Luna 相比各自的 GPT‑5.6 版本均有提升,包括更少对其编程工作作出误导性陈述。
以下评估刻意测试具有挑战性的情境,并不用于衡量典型使用中的失败率。完整结果请参阅系统卡(在新窗口中打开)。
从今天起,所有 Plus、Pro、Business、Enterprise 和 Edu 用户均可在“ChatGPT 工作”和 Codex 中使用 GPT‑6 Sol 与 GPT‑6 Luna。免费版和 Go 用户可在桌面应用中使用 GPT‑6 Luna。这些模型尚未在聊天中推出。在 OpenAI API 中,它们分别以 gpt-6-sol 和 gpt-6-luna 提供。
为确保所有用户都能获得稳定的服务,我们计划在今天内逐步向 ChatGPT 推出这些模型。如果你在“ChatGPT 工作”或 Codex 中没有看到新模型,请稍后重试。
GPT 的评估在我们的研究环境中或通过 API 进行。由于系统提示词、可用工具等方面存在差异,其输出可能与正式版 ChatGPT 略有不同。竞品模型的评估结果取自公开报告。如果没有 Claude Fable 5.1 的得分,则采用 Claude Fable 5 的公开得分。


