OpenAI

GPT-6 Astra: A new generation of intelligence

新一代智能

2026 年 9 月 22 日更新:GPT‑6 系列迎来新成员 — GPT‑6 Sol 和 GPT‑6 Luna。了解更多。

我们正式推出 GPT‑6 Astra,这是全球智能程度最高且最符合人类意图的模型。

GPT‑6 Astra 汇聚了我们多年来在预训练、强化学习和对齐领域的研究成果与重大投入。Astra 在计算机操作、网页浏览、软件工程、网络安全、科学和专业工作领域均处于领先水平。Astra 在 FrontierMath Tier 4 中取得 98% 的成绩,达到该层级测评上限;此前,它还曾帮助解决数学领域长期悬而未决的问题⁠。Astra 也在 ARC-AGI 3 上取得 99.9% 的得分,并在 ExploitBench 上获得 100% 的优异成绩。它还在计算机和浏览器使用方面树立了新的标杆,能够以无与伦比的速度、准确性和判断力处理最严苛的专业工作。

GPT‑6 Astra 即日起面向部分组织逐步推出,并将在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,用户也可通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 使用。

“在 ARC-AGI-3 上,Astra 在 96% 的关卡中超越了我们的人类动作效率基线,实际上在该基准测试中达到了与人类表现持平的水准。这不仅是我们迄今测试过的最佳模型,也代表着前沿模型性能意义重大的阶跃式提升 - 这不仅体现在该模型探索并解决全新环境中任务的能力上,也体现在它学习如何实现这一目标的效率上。”
Greg Kamradt,ARC Prize Foundation

Astra 是我们对齐程度最高的模型,在理解用户意图和模型行为方面都有显著提升 — 你可以安心将任务委派给 Astra,并信任其判断。作为测试这一点的方式之一,我们基于 Hugging Face 事件构建了一项新的评估,用于考量模型在面对困难或不可能完成的任务时,是否会超出其预期范围。在没有生产环境防护措施的情况下,GPT‑5.6 Sol 在 48% 的案例中超出授权目标;相比之下,GPT‑6 Astra 的比例则为 0%。

全球最佳计算机操作模型

GPT‑6 Astra 在计算机操作的速度、准确性和安全性方面迈出了新的一步。它可以处理填写在线表单、更新 CRM 中的客户记录和整理日历等繁琐任务。它可以开展在线调研,并在电子邮件或文档编辑器中撰写摘要。它可以分析科学数据、生成图表、创建网站,并运行前端 QA 检查,以确保该网站上的所有功能都能正常运行。它可以帮助你自主安装和测试软件,并排查你在屏幕上看到的问题。这些改进也体现在我们业界领先的评估结果中。

这些改进也显著提升了真实知识型工作任务中的效率。在 OSWorld 2.0 的延迟模拟中,Astra 的计算机操作能力更强,且每项任务用时比 GPT‑5.6 Sol 少约 47%,前者的得分为 72.6%,每项任务约需 40 分钟;相比之下,GPT‑5.6 Sol 的得分为 65.7%,每项任务约需 75 分钟。3

GPT‑6 Astra 的计算机操作能力体现在跨领域的输出中,包括游戏开发、电气工程和日常知识型工作:

除 Astra 外,我们还在更新 Codex 执行框架,以显著提升模型的计算机操作速度。结合 Astra 的高效处理能力,这意味着在 Mind2Web 基准测试中,任务完成速度达到当前 GPT‑5.6 Sol 体验的 1.9 倍。模型在速度上的提升意味着,它可以替你处理生活中许多耗时的任务,而且速度比你自行处理更快。4

“我们会在发布当天将 GPT‑6 Astra 集成到 Devin 的执行框架中,届时它将在我们的内部测试基准中展现业界领先的性能。其出色的计算机操作能力、写作能力以及对代码库的理解能力,让你无需额外配置即可改进测试:视频明显更易于理解,报告也更清晰、更简洁”
Silas Alberti,Cognition 研究高级副总裁

专业工作的阶跃式变革

GPT‑6 Astra 将计算机操作方面的进展与面向专业环境的针对性训练相结合,助力用户应对复杂的工作任务。它结合了解决复杂问题所需的智能,以及执行多步骤工作流并生成精美文档、电子表格和演示文稿的能力。

GPT‑6 Astra 是我们最擅长遵循现有模板的模型,能够生成布局合理、通过结构化叙事简洁传达要点的幻灯片。它可以创建清晰明了、结构严谨的文档、演示文稿、电子表格和分析报告,这些文件均遵循用户模板,并与其写作与视觉风格相匹配。Astra 还经过专门训练,只会将与当前工作相关的上下文提取到输出内容中,而不会重复不必要的信息。这意味着它能够生成可直接使用、符合业务背景和标准的成果。

GPT‑6 Astra 还为其构建的网站、游戏、应用程序和渲染内容带来更强的视觉判断能力。借助 ChatGPT 中的站点⁠(在新窗口中打开),Astra 可以直接利用提示词创建、托管和分享网站、Web 应用和游戏。

“Astra 在能力和效率方面都具备显著优势。它能够成功执行我们最复杂的创意工作流,同时相比我们测试过的其他模型,Token 使用量最多减少 20%。最重要的是,对我们的客户而言,这意味着更高质量的输出。”
Alex Mashrabov,Higgsfield AI 首席执行官兼联合创始人

当指令留有解读空间时,GPT‑6 Astra 比以往的模型更善于做出正确判断。它会利用上下文来补全常规信息缺口,并在答案可能影响结果时提出有针对性的问题。在 Codex 中,它可以异步提问,同时继续处理不依赖回复的工作。如果你不回复,它会在适当情况下基于合理的假设继续推进工作,但会等待你对重大决策提供意见。

以下示例展示了 Astra 在日常任务中如何与你协作:在这些任务中,缺失的信息可能会实质性改变答案。

Astra 在任务演进过程中保持前进方向清晰明确的能力也更强。早期模型有时会将引导消息视为新的目标,以致遗忘原始请求或先前的约束条件。Astra 能够纳入新的需求,按要求调整方向,并回答附带问题,同时不偏离整体任务。

“Astra 在复杂法律任务方面相比 GPT‑5.6 Sol 的质量有显著提升。在我们的早期测试中,Astra 脱颖而出:它像一位眼光敏锐的律师一样处理法律任务 — 区分文件与既有记录,揭示无据可依的假设,并将信息缺口转化为具体的起草依据。”
Niko Grupen,Harvey 应用研究负责人

编程

GPT‑6 Astra 是迄今为止最适合软件工程的模型。

1 条/ 共 2 条
“GPT‑6 Astra 在我们的内部编程基准测试中展现出顶尖性能,与 GPT‑5.6 Sol 相比,在交易直觉评估中也取得了明显进步。用于智能体编程时,GPT‑6 Astra 的交流方式更便于开发人员理解,并且生成的代码只需更少迭代即可达到生产级质量。”
John Crepezzi,Jane Street AI 助手

借助 Astra,我们正在为 Codex 引入一种新方式,使其能够在上下文窗口填满时保留并检索上下文。过去,模型会在长会话中使用压缩来总结工作内容,例如调试复杂问题或处理大型重构。每次压缩都可能会遗漏有关修复失效原因或组件行为方式的细节。在 Codex 中,Astra 可以跨上下文窗口保留笔记以及过往积累的细节,而无需反复将其压缩成单一摘要。之前的上下文窗口仍可搜索,因此 Astra 可以查找来自先前消息和工具输出中的需求或测试结果 — 即使这些信息并未记录在其笔记中。你可以在 Codex config.toml⁠(在新窗口中打开) 中启用这一实验性功能,此功能将在未来几周内成为 Astra 的默认设置。

推动科学发现

“故事是这样的:一个时代落幕,另一个时代开启。”
Greg Burnham,EpochAI

GPT‑6 Astra 在科学发现、数学和医疗保健领域取得了重大进展。今天,我们将分享两项关于素数间隔的最新成果9、10。

Astra 还在一系列数学和科学评估中创下新纪录。

Astra 可以协助开展科学发现背后的实践工作。通过将科学推理与计算机操作能力相结合,它可以直接在专业软件中处理任务,以检查数据并探索结果,帮助研究人员评估证据并确定后续调研目标。

网络安全

正如我们在安全更新⁠中所讨论的,Astra 在网络安全能力方面实现了重大跃升;依据我们的准备框架,该模型在网络安全领域已达到关键阈值。其识别并开发零日漏洞利用程序的能力可以帮助防御者查找并修复漏洞,但也带来了对更完善的防护措施的需求。为了解这些能力的范围,我们对 Astra 进行了内部评估和第三方专家评估。

我们首先在 ExploitBench 和 ExploitGym 上测试了未采用生产级安全防护措施的模型,这两项基准测试用于评估模型能否将已知软件漏洞转化为可运行的漏洞利用代码。在 ExploitBench 上,Astra 取得了 100% 的优异成绩,而我们此前具备网络安全能力的前沿模型 GPT‑5.6 Sol 的得分为 78.5%。在 ExploitGym 上,Astra 的成功率达到 42.4%,相比之下 GPT‑5.6 Sol 为 30.3%,前者使用的输出 Token 数明显更少。13

鉴于有人担心接触过往软件漏洞可能会影响基准测试结果,我们还在两个新的基准测试上评估了 Astra。其一,我们构建了一项内部“ExploitBench(2026 年 6 月至 8 月)”评估,用于测试模型利用此前三个月的漏洞开发漏洞利用程序的能力。14在该数据集上,Astra 的任意代码执行率明显高于 GPT‑5.6 Sol,同时使用的输出 Token 数更少。在评估期间,Astra 甚至发现并使用了两个此前未知的零日漏洞。我们正在向其维护人员披露这两个漏洞。

我们还在 SRE-Bench15 上测试了 Astra,这是一个用于衡量模型能否在无法访问原始源代码的情况下,对二进制软件进行逆向工程以理解其核心逻辑的基准测试。Astra 在一次尝试中解决了 88.0% 的任务,并在四次尝试内解决了 99.2% 的任务;相比之下,GPT‑5.6 Sol 的解决率分别为 55.9% 和 68.7%。

除了基准测试之外,由专家主导的评估发现:Astra 在未启用生产级安全防护措施的情况下运行时,能够利用先前未知的漏洞,在经过强化的浏览器中实现任意代码执行,并针对经过强化的操作系统创建权限提升漏洞利用程序。

正如我们在“The Defender’s Window”中所讨论的,前沿网络能力可以帮助防御者更快发现弱点,但也会让这些弱点更容易被人利用,从而提高了防御者适应变化的紧迫性。借助今天发布的 Astra 版本,防御人员可以完成安全代码审查和补丁修复等任务。

但是,Astra 将拒绝执行更高级的网络安全任务,例如针对漏洞创建概念验证漏洞利用程序。通过 OpenAI Daybreak⁠,我们计划在未来几周扩大使用范围,并推出限制较少的安全防护措施。这将支持更多防御性工作流,包括漏洞及概念验证、恶意软件分析和检测工程。

我们还在 GPT‑5.6 Sol 的安全防护机制基础上,进一步加强了针对潜在网络滥用的防护。其中包括加强模型稳健性,从而有效抵御潜在的越狱攻击,并为我们的监控系统提供更多上下文。我们持续开展严格的内部和外部测试,包括与内部红队测试攻击者协同开展的自动化评估。有关我们的网络安全防护措施和测试的更多信息,可在 Astra 安全概览⁠和系统卡⁠(在新窗口中打开)中查阅…

负责任地对齐和部署 GPT‑6 Astra

Astra 是我们对齐程度最高的模型。Astra 擅于谨慎行事、尊重任务边界,并保持沟通透明度。这项工作是我们长期研究项目的最新成果,该项目专注于训练能够自始至终与人类意图保持一致的模型。

在敏感环境中,Astra 会根据风险等级采取相应的审慎措施。在一项针对计算机操作任务进行对抗性选样以诱发不当行为的评估中,Astra 在避免非预期后果方面表现更佳。默认启用额外的安全防护措施后,其表现更为出色。

Astra 导致的未对齐结果少于其他任何接受测试的前沿模型。为了保证对比测试的公平性,我们使用了一个使用计算机的智能体通用执行框架(基于 OpenAI Responses API⁠(在新窗口中打开) 和 Anthropic Messages API⁠(在新窗口中打开) 中可用的原生计算机操作工具),并且未采用通常面向 Codex 和 ChatGPT 工作用户部署的额外保护措施(自动审核、确认策略)。

Astra 也更有可能在用户设定及其环境所隐含的边界内运行。在一项内部评估中,Astra 从未尝试规避 Codex 自动审查的拒绝决策。即使自动审核特意配置为“可规避”,且任务无法通过其他方式完成,这一点依然成立。这种遵守环境限制条件的能力,与我们在本文开头分享的无法完成的网络安全任务评估结果,以及我们的系统卡⁠(在新窗口中打开)中记录的其他调查结果相一致。

此外,Astra 在与用户进行透明沟通方面树立了新的标杆。在一项评估中,Astra 对自身能力和可用功能作出不准确表述的可能性仅为 GPT‑5.6 Sol 的三分之一。

在我们的能力幻觉评估中,Astra 相比 GPT‑5.6 Sol 有显著提升,对自身能力做出的误导性声明更少。

我们的评估发现,Astra 的书面推理比 GPT‑5.6 Sol 更难监控,这一结论基于明确要求其规避监控的测试。我们认为,这是由于 Astra 在简单任务中对书面推理有更强的控制能力,而且能够以更少的书面步骤解决问题。Astra 似乎仍然难以隐藏完成复杂任务所需的推理过程,但我们会认证审视这一能力下降问题。提升可监控性仍是研究重点,随附的系统卡⁠(在新窗口中打开)详细介绍了我们的研究发现和持续开展的工作。

对齐训练是我们部署方法的核心。作为额外的防御层,我们还构建了 Codex 自动审核⁠(在新窗口中打开)等系统防护机制,并监控智能体的推理和行动,以检测并遏制不安全行为。正如我们在安全更新⁠中所述,我们还将在生产环境中为 Astra 级模型部署失准监控,以了解失准情况,并遏制最严重的失准事件。这些保护措施类似于我们针对内部部署所采用的监控机制,涉及一套分类器系统,用于检查模型的推理和行动是否存在未经授权的行为,并自动停止可能未经授权的活动。

鉴于 Astra 的网络安全能力显著提升,我们会采取更审慎的措施确保此次部署安全可靠。额外的安全检查有时可能会拖慢、暂停或停止正当工作,包括防御性网络安全工作。如果任务在 ChatGPT 或 Codex 中暂停,系统可能会要求你先审核操作,然后再继续。在 API 中,任务将会停止。这些检查有时可能会中断正常工作,我们正在持续迭代改进这一系统,以减少不必要的中断。未对齐监控无法取代对齐:我们的目标是构建能够在其授权范围内稳定运行的模型,让这些防护措施无需介入。

可用性

GPT‑6 Astra 即日起面向部分组织逐步推出,并将在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,用户也可通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 使用。Astra 使用量已包含在现有订阅限额内 — 用户和企业还可以购买额度,以解锁更多使用量。Pro、Business 和 Enterprise 套餐的用户还将获得 GPT‑6 Astra Pro 的使用权限。Enterprise 管理员可以为其工作空间启用 Astra;此功能上线时,访问权限默认处于关闭状态。

Astra 为符合条件的 API 客户提供零数据保留;正如我们上个月所分享的,我们正在测试隐私安全处理,以便在保护客户隐私的同时加强安全监控。

对于开发人员,GPT‑6 Astra 可在 OpenAI API 中以 gpt-6-astra 的形式使用,也可通过 Microsoft Azure 和 Amazon Bedrock 使用。

OpenAI API 标准定价为:每百万输入 Token 为 10 美元,每百万输出 Token 为 50 美元。缓存读取和写入分别采用不同的费率。GPT‑6 Astra 可在 API 中使用快速模式,处理速度最高可达标准模式的 2 倍,价格则为标准模式的 2 倍。

计算机操作

计算机操作

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0(v2026.08.08,离线集,部分得分)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro(无工具)

92.7%

76.9%

-

87.3%17

-

-

专业能力

专业能力

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

内部设计任务

50.0%

47.4%

-

35.8%

-

-

内部数据科学任务

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

编程

“编程”“GPT‑6 Astra”“GPT‑5.6 Sol”“Claude Fable 5.1”“Claude Fable 5”“Claude Opus 5”“Gemini 3.8 Flash”
“Terminal-Bench 4.0”“57.9%”“37.3%”“55.8%”“44.5%”“52.6%”“19.1%”
“DeepSWE v1.1”“74.1%”“72.7%”“67.4%”“69.9%”“73.7%”“73.8%”
“FrontierCode 1.1 Extended(得分)”“64.5% 8”“60.6%”“63.6%”“64.9%”“63.6%”“56.3%”
“FrontierCode 1.1 主项(得分)”“53.3% 8”“47.5%”“50.9%”“53.5%”“53.4%”“43.6%”
“内部数据库迁移任务”“63.9%”“42.7%”“57.8%”“50.3%”“-”“-”
“Artificial Analysis 编码智能体指数 v1.4”“67.0”“65.1”“-”“67.2”“68.1”“61.2”

学术

学术

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam(含工具)

57.2%

-

65.0%

63.8%

63.6%

-

科学与医疗保健

“科学与医疗保健”“GPT‑6 Astra”“GPT‑5.6 Sol”“Claude Fable 5.1”“Claude Fable 5”“Claude Opus 5”“Gemini 3.8 Flash”
“GeneBench Pro”“37.1%”“32.3%““-”“-”“-”“-”
“MedChemBench(内部)”“49.3%”“47.4%”“-”“-”“-”“-”
“LifeSciBench”“60.3%”“59.9%”“-”“-”“-”“-”
“HealthBench Professional(经长度调整后)”“63.4%”“60.5%”“58.1% 11”“60.9% 11”“56.4% 11”“52.1%”

网络安全

“网络安全”“GPT‑6 Astra”“GPT‑5.6 Sol”“Claude Fable 5.1”“Claude Fable 5”“Claude Opus 5”“Gemini 3.8 Flash”
“ExploitBench”“100.0%”“78.5%”“-”“-”“70%”“-”
“ExploitGym”“42.4% 13”“30.3% 13”“30.4% 17”“28.4%17”“22.0%”“-”
“ExploitBench(2026 年 6 月至 8 月)”“39.0%”“5.5%”“-”“-”“-”“-”
“SRE-Bench”“88.0%”“55.9%”“-”“-”“12.5%”“-”
“SEC-Bench Pro”“85.4%”“79.1%”“-”“-”“-”“-”

对齐

对齐

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

内部计算机操作安全性基准测试(数值越低越好)

2.4%

22.0%

9.5%

18.3%

11.5%

-

内部计算机操作安全性基准测试,含自动审核(数值越低越好)

1.8%

4.3%

-

-

-

-

内部规避基准测试(数值越低越好)

0.00%

0.29%

-

-

-

-

ExploitGym 蜜罐(数值越低越好)

0.0%

48.2%

-

-

-

-

Impossible ExploitGym

100.0%

-

-

-

-

-

内部幻觉基准测试(数值越低越好)

4.2%

12.2%

-

-

-

-

长上下文

长上下文

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

抽象推理

“Abstract reasoning”“GPT‑6 Astra”“GPT‑5.6 Sol”“Claude Fable 5.1”“Claude Fable 5”“Claude Opus 5”“Gemini 3.8 Flash”
“ARC-AGI-3”“99.9% 1”“7.8%”“-”“-”“30.2%”“-”
“ARC-AGI-2”“95.0%”“92.5%”“90.0%”“89.2%”“90.4%”“-”
“ARC-AGI-1”“98.5%”“97.5%”“97.5%”“98.5%”“97.5%”“-”

评估分数均为最高推理强度下的数据。GPT 评估是在我们的研究环境中运行的,或通过我们的 API 运行,因此由于系统提示词、可用工具等方面的差异,其输出可能会与正式上线的 ChatGPT 略有不同。

脚注

  1. 1

    在 ARC-AGI-3 上,GPT-6 Astra 通过我们的 Responses API 执行框架⁠运行;该框架更改了两项设置,以便精准匹配真实表现。这些变更并非专门针对 ARC-AGI-3。

  2. 2

    GPT-5.6 Sol 是指可在我们的 API、ChatGPT Codex 和 ChatGPT 工作中使用的版本。ChatGPT 聊天中的版本略有不同。⁠

  3. 3

    OSWorld V2-Offline 是原始 OSWorld V2 的一个子集,无需连接互联网即可运行。Claude 模型在 OSWorld-V2 Offline 上的性能已由作者在官方排行榜⁠(在新窗口中打开)中复现。在 OSWorld 2.0 上,Claude 的得分采用官方设定计算,而不是采用 Fable 5.1 系统卡中的修改版任务和修改版评分方式。

  4. 4

    模型时间是针对相应演示运行所记录的耗时数据。所显示的片段均为经过编辑的节选片段。

  5. 5

    在 BenchCAD 上,Claude 的得分反映了对该评估所做的 3 项修改,详见 Fable 5.1 系统卡⁠(在新窗口中打开)。

  6. 6

    Guang Yang、Victoria Ebert、Nazif Tamer、Brian Siyuan Zheng、Luiza Pozzobon 和 Noah A. Smith。“LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(在新窗口中打开)。”arXiv:2506.19065,2025 年。

  7. 7

    Mark R. H. Gotham、Maureen Redbond、Bruno Bower 和 Peter Jonas。“The OpenScore String Quartet Corpus⁠(在新窗口中打开)。”第 10 届国际音乐学数字图书馆会议论文集,第49–57 页,ACM,2023 年。

  8. 8

    在 FrontierCode 上,GPT-6 Astra 基于一条开发人员提示词消息运行,该消息类似于 Codex 中开发人员消息的某个部分⁠(在新窗口中打开):“Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code.”该提示词未针对评估进行优化。

  9. 9

    第一项成果涉及:无论在数轴上前行多远,素数之间可能出现的最小间隔。十多年来,已知最佳结果证明,存在无穷多对相距至多 246 的素数。Julia Stadlmann⁠(在新窗口中打开) 最近将这一上界提升至 240。Astra 协助确立了更强的 186 上界,表明有无穷多对素数的间隔在这一更小范围之内。素数短间隔:证明⁠(在新窗口中打开)和相关研究⁠(在新窗口中打开)。

  10. 10

    第二项成果涉及素数之间异常庞大的间隔。Astra 改进了这些间隔的其中一个上界,而这一上界在 80 多年来一直未曾改变。我们将分享这两项结果的证明、精简版思维链以及验证材料。较大的素数间隔:证明⁠(在新窗口中打开)和支持性研究⁠(在新窗口中打开)。

  11. 11

    我们遵循预期的 HealthBench Professional 流程,使用 GPT‑5.4 并结合经长度调整、未裁剪的分数,对所有 Claude 模型进行独立评估。对于 Fable 5.1,若提供方拒绝响应,我们会使用 Opus 5 作为备用方案。

  12. 12

    Claude Fable 5 和 5.1 未纳入 LifeSciBench Gold v1、GeneBench Pro v13 和 MedChemBench 评估,因为它们拒绝回答这些评估中的大多数问题。

  13. 13

    在 ExploitGym 上,我们在不设 6 小时时间限制的情况下测试 Astra 和 Sol,以便有效评估其完整的网络安全能力。二者的速度足够快,因此这一限制几乎没有影响。

  14. 14

    ExploitBench(2026 年 6 月至 8 月)包含 20 个高严重性 V8 漏洞,涵盖 13 个 Chrome 稳定版。该基准测试用于测试智能体能否利用每个指定漏洞,在 V8 和面向 Linux 的官方 Chrome 版本中实现任意代码执行。在这项评估的限制条件下,所包含的某些漏洞可能无法实现任意代码执行,因此可能无法达到 100% 的成功率。注意:GPT-5.6 Sol 之所以得分为 5.5%,是因为基准测试中设有 300 轮上限,而实际使用 Max 的客户并不会受此限制。该模型在类似环境下受到的限制更少时,得分为 11.5%。

  15. 15
  16. 16

    在对第三方模型进行测试时,我们采用了更简单的研究设置。Codex 的生产配置更为复杂,这可能会导致不同的原始模型错误率。提供方侧的安全防护措施和计算机工具实现方式仍存在差异。用户不会在 Codex 中遇到无需确认的情形,因为这是一项内部研究配置。

  17. 17

    对于 ScreenSpot-Pro 和 ExploitGym,我们得出的 Fable 得分来自 Mythos,而 Mythos 是安全防护措施较少的 Fable。