跳至主要内容
OpenAI

GPT-6.1Sol

智能水平接近 Astra,价格仅为其五分之一

我们正式推出 GPT‑6.1 Sol,这是 GPT‑6 Sol 的升级版,在智能体编程、计算机使用和专业工作方面表现尤为出色。它让 Sol 在高难度任务上的表现更接近 GPT‑6 Astra,而标准输入和输出 Token 价格仅为 Astra 的五分之一,让开发者在相同预算下有更多空间构建和运行能力强大的智能体。

GPT‑6.1 Sol 以 Sol 的价格提供接近 Astra 的性能,成为目前同等性能下最具成本效益的模型。缓存输入每百万 Token 仅需 0.10 美元,比标准输入价格低 95%,让需要在多次请求中复用上下文的智能体工作负载更加经济实惠。

GPT‑6 Astra 仍是我们综合能力最强的前沿模型。无论是用户希望更频繁地完成的重要工作,还是 API 客户大规模构建和运行应用的需求,GPT‑6.1 Sol 都为能力与成本提供了新的平衡。

三张模型卡片:GPT-6 Astra,我们智能水平最高的模型,可提供最佳结果,输入价格为 10 美元,输出为 50 美元,缓存输入为 1 美元;GPT-6.1 Sol,以五分之一的价格提供接近 Astra 的智能水平,输入价格为 2 美元,输出为 10 美元,缓存输入为 0.10 美元;GPT-6 Luna,快速高效地处理大规模日常工作,输入价格为 0.10 美元,输出为 0.50 美元,缓存输入为 0.01 美元。

各项任务上能力更强的 Sol

从编写和调试代码,到理解文档和执行多步骤业务工作流,GPT‑6.1 Sol 在复杂专业工作中的表现相较 GPT‑6 Sol 有了显著提升。在其中多项评估中,它以显著更低的成本实现了接近 GPT‑6 Astra 的性能。

编程

DeepSWE v1.1 评估模型在真实代码库中完成复杂软件工程任务的能力。在这项评估中,GPT‑6.1 Sol 以约五分之一的成本达到与 GPT‑6 Astra 相当的水平,同时以更低的推理强度和成本,比 GPT‑6 Sol 的最高得分高出 6.4 个百分点。

在 DeepSWE 1.1⁠⁠(在新窗口中打开) 中,AI 智能体完成原创的、需要长程规划与执行的软件工程任务。

专业工作

GDP.pdf 衡量模型利用复杂 PDF 文档(包括表格、图表、示意图和小字细节)回答专业问题的准确程度。在所测试的各档推理设置下,GPT‑6.1 Sol 的得分均高于带回退机制的 Opus 5.5,而单任务成本不到其一半。它还以约五分之一的单任务成本,接近 GPT‑6 Astra 的业界领先性能。

在 GDP.pdf⁠(在新窗口中打开) 中,模型必须根据复杂的 PDF 文档回答实际工作中的问题。这些文档来自金融、医疗、法律及其他七个专业领域的工作流程。

AutomationBench 衡量智能体能否正确完成多步骤业务工作流。在这项评估中,GPT‑6.1 Sol 在中等推理强度下的得分比 Opus 5.5 高 2.2 个百分点,成本则约为其三分之一。这一得分也比相同设置下的 GPT‑6 Sol 高出 4.8 个百分点。

In AutomationBench 1.0.6⁠⁠(在新窗口中打开), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

计算机使用

在需要与计算机应用交互的任务上,GPT‑6.1 Sol 也取得了显著进步。OSWorld 2.0 的离线集评估智能体处理高难度计算机使用工作流的能力。在最高推理强度下,GPT‑6.1 Sol 的得分比 GPT‑6 Sol 高 7 个百分点,成本却不到其一半。在最高推理强度下,它与 Astra 的得分差距缩小至 2.1 个百分点以内,单任务成本约为其七分之一。

In OSWorld 2.0⁠⁠(在新窗口中打开), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

科学研究

Terminal-Bench Science 0.1 评估包括数据分析、模拟和定理证明在内的科学工作流。在最高推理强度下,GPT‑6.1 Sol 的得分超过 GPT‑6 Sol 的两倍,单任务成本却不到其一半。在最高推理强度下,GPT‑6.1 Sol 的平均单任务成本为 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元。它提供了强大的科研能力,同时成本比这两款模型均降低超过 75%。

GPT‑6 Astra 仍以 68.1% 的得分在受测模型中排名第一,最具挑战性的科学研究任务应使用该模型。

在 Terminal-Bench Science 0.1⁠(在新窗口中打开) 中,智能体使用代码和终端工具完成科研工作流程,包括分析数据、运行模拟和拟合模型。

事实准确性

GPT‑6.1 Sol 在高难度提示下的事实准确性也有所提升。在超高推理强度下,它的事实错误率为 4.1%,低于 GPT‑6 Sol 的 4.5%,更接近相同设置下 Astra 的 4.0%,而单任务成本比 Astra 低约 83%。

这项评估使用去标识化的对话,衡量回答中包含至少一处事实错误的比例;用户曾在这些对话中指出早期模型的错误。这些刻意挑选的高难度提示并不代表典型使用情况。

我们使用去标识化的 ChatGPT 对话来评估事实准确性,用户曾在这些对话中指出早期模型的事实错误。这些容易引发错误的对话并不代表典型使用情况;在典型使用中,事实错误更为少见。

安全部署 GPT‑6.1 Sol

在我们的对齐评估中,GPT‑6.1 Sol 相较 GPT‑6 Sol 有了显著提升,更接近 GPT‑6 Astra 的水平。

GPT‑6.1 Sol 能更坦诚地说明自身局限,也能更可靠地尊重用户意图和遵守安全约束。在高难度评估中,无论是如实告知搜索工具故障、遵守明确限制,还是在智能体任务中避免未经授权的结果,它的失误率均低于 GPT‑6 Sol。我们未观察到它有任何绕过自动化安全审核机制的尝试,与 GPT‑6 Astra 和 GPT‑6 Sol 的表现一致。

以下评估专门测试高难度情境,并不衡量典型使用中的失误率。

定价与可用性

即日起,所有 Plus、Pro、Business、Enterprise 和 Edu 用户均可在 ChatGPT 工作和 Codex 中使用 GPT‑6.1 Sol。这些模型尚未在聊天中提供。开发者也可通过 OpenAI API,以 gpt-6.1-sol 调用该模型。其标准 API 价格为:每百万输入 Token 2 美元,每百万缓存输入 Token 0.10 美元,每百万输出 Token 10 美元。

与此同时,我们还推出了 GPT‑6 Astra Ultrafast 和 GPT‑6.1 Sol Ultrafast。GPT‑6 Astra Ultrafast 是全球速度最快的前沿模型,速度最高可达 GPT‑6 Astra 的 8 倍。这些模型通过 API 提供,也面向我们全新 Pro 档位的用户在 ChatGPT 工作和 Codex 中开放。该档位每月 500 美元,提供最高使用额度。借助 GPT‑6.1 Sol Ultrafast,开发者只需支付与此前使用 GPT‑6 Astra 大致相同的 API 费用,即可获得接近 Astra 的智能水平,速度最高可达其 8 倍。

作者

OpenAI

GPT 评估在我们的研究环境中或通过我们的 API 进行。由于系统提示、可用工具、推理强度等方面存在差异,其输出可能与正式版 ChatGPT 略有不同。竞争对手模型的评估结果取自公开报告。