跳至主要内容
OpenAI

2026年6月17日

研究刊发

推出 LifeSciBench

一个由专家撰写、专家评审,并植根于真实生命科学研究的基准

正在加载…

智能体 AI 系统执行科学任务的能力正在不断增强。然而,它们对生命科学研究人员的实用性,取决于它们处理真实研究复杂性的能力。这类工作很少像单个事实回忆题或清晰的预测问题那样简单。研究人员需要解读不完整的证据,调和相互矛盾的结果,设计困难实验,排查检测问题,评估转化风险,并在不确定性下决定下一步行动。

现有基准并未充分捕捉这些能力。许多生命科学评估聚焦于狭窄领域或孤立技能,因此问题格式结构化,并配有明确的参考答案。这些评估虽有价值,却往往无法真正评估模型是否能在更广泛的研究级工作中发挥作用。

我们设计了 LifeSciBench,以帮助弥合这一差距。每项任务都基于在职生命科学家的判断;这些科学家受过博士级训练,并有在生物技术和制药环境中直接推进药物发现项目的经验。

LifeSciBench 包含 750 项由专家撰写的任务,覆盖七类工作流程和七个生物学领域。

1,062

任务材料

173

科学家贡献者

19,020

评分标准

453

专家评审者

LifeSciBench 衡量什么

LifeSciBench 衡量 AI 系统能否支持真实的生命科学研究任务,而不只是回答生物学问题。为定义基准分类体系,我们调研了在职生命科学家,了解他们在应用研究环境中最常使用的工作流程。随后,我们将他们的回答归纳为七个反复出现的类别:证据处理、分析、设计与优化、科学推理、验证与运营、转化以及科学沟通。

每项任务的结构都类似科学家可能向知识丰富的合作者提出的请求:科学提示、任何相关背景或材料,以及自由作答的答案。由专家撰写的评分细则会评估模型能否针对具体问题给出正确答案,并达到科学家所期待的细节、论证、限定说明和格式要求。

数据集构建

LifeSciBench 评估科学推理,同时评估真实科学应用所必需但定义不那么清晰的实践技能。其任务要求模型处理真实研究问题:解读证据、作出基于领域知识的判断,并传达对专家评审者有用的结论。许多任务还要求模型处理不确定性,并基于支持性数据文件进行推理,而不是只依赖提示文本。

该基准旨在反映生命科学工作的复杂性。总体而言,79% 的任务需要多个推理或决策步骤,平均每项任务包含四个步骤。LifeSciBench 包含 1,062 个附加材料,涵盖图表、PDF、表格、序列文件、结构或化学文件以及网页参考。超过半数任务(53%)要求模型解读或综合至少一个材料中的信息。

这些任务由来自不同生命科学学科的 173 位专家科学家创建。每位科学家都受过博士级训练,并具备生物技术或制药行业经验。任务在被接受前可按需经历任意多轮修订,不设固定轮次上限;被接受的任务平均经历六轮自导式自动审查,并完成至少两轮专家评审。评审以可验证的正确答案或强专家共识为依据,相关领域评审者的一致率至少达到 90%。这一流程有助于确保被接受的任务具备科学依据、足够清晰以便评分,并能代表应用研究。

示意图展示 LifeSciBench 任务,这些任务将基因组序列、分子结构、图表、文档、电子表格和网页链接等生命科学数据来源,与多步推理和专家评审相结合。

评分与评分细则拆解

LifeSciBench 任务采用详细且针对任务定制的评分细则,将预期回答拆解为具体的科学主张、计算、决策、论证等。在整个基准中,专家制定的评分细则包含 19,020 条标准,平均每项任务 25 条,用于评估科学正确性以及对研究决策的实用性。

这种设计反映了科学工作在实践中的评估方式:许多生命科学任务不能只通过检查最终答案来评分。一个回答可能得出正确的高层结论,但如果例如忽略了关键检测局限,或未能主动指出影响重大的生物学细节,仍会被判定为不完整。相反,即使未能完全解决任务,部分回答也可能包含高质量推理。

细粒度评分细则能够捕捉这种差异。LifeSciBench 不仅评估最终答案的准确性,还评估模型是否以科学有效且操作上有用的方式得出答案。

从论文、图表、表格和实验记录中提取、协调并审计科学证据。

评估示例

We’re preparing for a Type B FDA meeting on AAV9-microDys-X, an AAV9-based micro-dystrophin gene therapy for Duchenne muscular dystrophy that expresses a 138 kDa construct from an MCK promoter, and we want a hard-nosed critique of whether our current package really supports accelerated approval on micro-dystrophin expression as a surrogate endpoint reasonably likely to predict clinical benefit.

Study context: open-label Phase 1b/2 in 12 ambulatory boys age 4–7 with confirmed DMD and out-of-frame rod-domain deletions. The package is:

  • Pre-treatment vastus lateralis biopsies: 0–3% of healthy-control dystrophin by quantitative Western blot using MANEX1A against the N-terminal actin-binding domain.
  • 12-week post-treatment contralateral vastus lateralis biopsies: mean micro-dystrophin 38% of healthy control (range 18–61%) by the same Western blot, normalized to total protein by Coomassie staining.
  • Post-treatment immunofluorescence: sarcolemmal signal in 75–95% of fibers using a polyclonal anti-dystrophin C-terminal antibody.
  • 48-week function: mean NSAA change +1.4 points from baseline versus −0.6 in an external published natural-history registry cohort (p = 0.03 by unpaired t-test).
  • Safety: transient transaminitis in 8/12 patients managed with steroid taper; one resolved myocarditis; no deaths.
  • Biodistribution/persistence: AAV9 vector genomes detectable in muscle at 12 weeks at a mean of 2.3 vector genomes per nucleus.
  • Eligibility: no baseline anti-AAV9 neutralizing antibodies (titer <1:400) and no exon-44 deletions.

Please pressure-test this package item by item: where would FDA or a skeptical reviewer say the evidence, as presented, fails to support our conclusion, and what additional data, analyses, or design changes would be needed to close those gaps if possible? For anything not specified, assume what is known from other clinical-grade 138 kDa micro-dystrophin programs and relevant clinical trials through December 31, 2025 also applies.

备选回复

底线:按目前呈现的资料包,其强度不足以支持将微抗肌萎缩蛋白表达作为合理可能预测临床获益的替代终点来加速批准。持怀疑态度的 FDA 审评员可能会认为生物标志物、功能、持久性、安全性和普适性证据均存在实质性支持不足。

资料包项目

关键失败模式

所需内容

Western blot 定量

MANEX1A 结合内源性全长抗肌萎缩蛋白和微抗肌萎缩蛋白转基因共有的 N 端表位,因此该检测无法清晰区分转基因与残余/回复突变抗肌萎缩蛋白。用健康全长抗肌萎缩蛋白标准品来定量 138 kDa 微抗肌萎缩蛋白也是无效的。

使用重组微抗肌萎缩蛋白标准品,以及可区分转基因与内源性抗肌萎缩蛋白的正交方法,如靶向质谱或转基因特异性/表位特异性检测。

免疫荧光

C 端多克隆抗体并不适合,因为 138 kDa 构建体缺少 C 端结构域。许多 DMD 患者有回复肌纤维,而回复突变抗肌萎缩蛋白可保留 C 端表位。回复肌纤维可能随年龄克隆性扩增,使 IF 信号产生偏倚,尤其是在年龄较大的男孩中。

使用针对转基因中存在但回复突变抗肌萎缩蛋白中不存在表位的抗体重复 IF。将转基因阳性纤维与回复肌纤维分开定量。

替代终点有效性

该资料包将蛋白量与临床功能混为一谈。“健康对照蛋白质量的 38%”并不意味着正常抗肌萎缩蛋白功能的 38%,因为微抗肌萎缩蛋白在结构上被截短。

在将表达作为替代终点前,应经验性验证微抗肌萎缩蛋白质量百分比、肌膜定位、下游功能恢复与临床获益之间的关系。

活检设计

治疗前后对侧股外侧肌活检会引入左右侧和肌内空间变异。疾病进展和纤维脂肪替代也会改变按总蛋白归一化的信号。

使用一致解剖标志标准化活检部位,按肌肉特异性蛋白归一化,并同步测量纤维脂肪成分。

NSAA 比较组/统计

外部自然史队列不是随机同期对照。试验入选条件、支持治疗、参与效应、基线 NSAA、类固醇方案、年龄和外显子类别都可能使比较产生偏倚。非配对 t 检验并不足够。此外,+1.4 NSAA 变化处于该年龄组的重测变异范围内。

开展随机同期安慰剂对照研究,或至少使用校正分析,纳入基线 NSAA、年龄、类固醇方案、外显子类别和其他混杂因素。

年龄窗口混杂

4–7 岁男孩处于发育窗口,未经治疗的可行走 DMD 患者在衰退占主导前可能获得运动功能。48 周 NSAA 变化混合了发育增益、疾病进展和可能的治疗效应。

使用按年龄分层的同期随机对照,以将发育轨迹与治疗效应分开。

既往临床先例

开放标签微抗肌萎缩蛋白功能信号未能可靠预测确证获益;已发表先例包括微抗肌萎缩蛋白基因治疗确证试验未能复现开放标签 NSAA 改善。

不要把开放标签 NSAA 变化作为决定性支持。需要受控的功能证据。

构建体的结构限制

138 kDa 构建体删除了含 nNOS 结合位点的血影蛋白重复 R16/17。nNOS 招募丧失会损害运动期间的功能性交感溶解和缺血保护,形成独立于表达水平的机制性救援上限。

增加机制研究,显示该特定构建体是否恢复相关抗肌萎缩蛋白相关复合物功能、nNOS 定位、运动生理和肌肉保护。

AAV 持久性

12 周的载体基因组不能证明表达持久。AAV9 基因组大多是不整合的游离体,可能随时间下降。载体基因组持续存在并不等同于蛋白表达持续。

测量 12 周以后的纵向转基因蛋白表达和功能生物标志物持久性。

免疫/安全性特征

8/12 名患者出现转氨酶升高,与对 AAV 转导细胞的免疫反应一致,但机制尚未确定。鉴于 AAV9 的心脏嗜性,一例心肌炎令人担忧。

提供更深入的免疫监测、肝脏/心脏安全性表征,并强化心脏随访。

患者选择/普适性

排除抗 AAV9 中和抗体阳性患者会限制普适性。排除外显子 44 缺失会限制对该 DMD 亚组的适用性。n=12 太小,无法表征更广泛 DMD 人群的安全性和疗效。

在可能情况下扩大入选范围,或在使用结果支持广泛批准前,预先规定按抗体状态、基因型/外显子类别、年龄和基线功能进行分层分析。

监管结论:该资料包可能显示生物活性,但尚未确立测得的微抗肌萎缩蛋白表达是合理可能预测临床获益的可靠替代指标。主要缺口包括检测特异性、无效定量标准、可能的回复肌纤维混杂、缺乏随机对照、年龄相关 NSAA 混杂、持久性不确定,以及未解决的安全性/普适性问题。

为弥合差距,该项目需要采用受控、年龄分层的临床设计,并配备转基因特异性表达检测、正交蛋白定量、组织成分控制、纵向持久性数据、针对截短构建体的机制性功能检测,以及更强的安全监测,尤其是肝脏和心脏方面。

评分标准和等级

标准
分数
Identifies assay/measurement problems in micro-dystrophin quantification, including MANEX1A epitope sharing, invalid full-length dystrophin standards, and need for recombinant or orthogonal transgene-specific measurement.
+24
Explains why micro-dystrophin expression level is not automatically a valid surrogate for functional clinical benefit.
+22
Flags biopsy-site, tissue-composition, and age-window confounding that weaken expression and NSAA interpretation.
+19
Critiques the NSAA comparator/statistics, especially reliance on external natural-history controls.
+12
Addresses AAV durability, immune response, transaminitis, myocarditis, and need for longer-term expression/safety follow-up.
+15
Notes patient-selection/generalizability gaps, including anti-AAV9 exclusion, exon-44 exclusion, and small sample size.
+8

验证 LifeSciBench

我们通过独立专家评审验证了 LifeSciBench。反馈来自 453 位未参与任务撰写的评审者。在这些评审者中,97% 拥有博士学位或同等博士学位,平均有 12 年领域经验和 14 篇同行评审论文;88% 报告曾获得至少一项奖项或研究资助。

评审者对每项任务是否体现强基准问题所需的特质进行评分:与真实研究工作的契合度、对科学推理和领域专业能力的适当测试、以证据或专家共识为基础,以及用于评估模型表现的总体实用性。每个类别的一致率均超过 96%。

现实相关性

这项任务是否反映了现实中的生命科学工作?

非常同意
90.4%
总体同意
98.3%

科学推理 / 领域技能

这项任务是否测试并评分了恰当的科学推理和生命科学领域技能?

非常同意
86.4%
总体同意
98.1%

科学依据

这项任务是否具备科学依据、可回答,并以适当的证据、数据、材料或专家共识为基础?

非常同意
77.1%
总体同意
96.5%

总体实用性

总体而言,这是一项有力的生命科学评估任务吗?

非常同意
79.1%
总体同意
96.6%

评审者评论进一步支持了定量评分:

1 条/ 共 3 条
总体而言,这是一项很强的任务,因为它有一个正确的核心解读,同时仍能通过答案对不确定性边界把握的细致程度区分优劣。

结果

我们报告两项互补指标。通过率是指模型达到任务级 70% 成功阈值的任务占比。得分是平均评分细则得分,即使完整任务未被解决,也会对单项标准给予部分分。两者都很重要,因为科学任务的回答即使未满足完整答案的所有要求,也可能部分正确或有用。

模型表现会随任务类型、工作流程和回答格式而显著变化。

AI 系统初步展现优势的领域

LifeSciBench 显示,前沿模型在涉及科学综合、沟通和结构化解读的任务上相对最强。绝对通过率仍然不高,因此这些基准领域远未饱和,但 GPT‑Rosalind 相比 GPT‑5.5 显示出有意义的进步,整体精确通过率从 25.7% 提升到 36.1%。

模型能力进步最明显的方向出现在科学沟通和转化。例如,科学沟通的通过率从 GPT‑5.5 的 56.3% 提升到 GPT‑Rosalind 的 71.1%;该类别样本较小(n=9),因此应谨慎解读,但它表明前沿模型在组织证据并生成面向专家的有说服力解释方面正在快速提升。转化(药物开发中的“从实验台到病床”过程)呈现类似模式,从 GPT‑5.5 的 36.8% 升至 GPT‑Rosalind 的 57.7%,表明模型在将临床前证据与临床意义相连接方面正迅速提高。

评分细则层面的结果也指向同一方向。在要求输出对专家有用或可执行的任务上,GPT‑Rosalind 得分为 44.7%,而 GPT‑5.5 为 29.1%。在要求处理不确定性和限定说明的任务上,它得分 44.8%,相比之下为 29.3%。这一模式表明,当任务有清晰的证据边界并要求结构化科学判断时,模型最有用。

GPT‑Rosalind 在由行业和学术专家确定的具有科学价值的任务中表现领先。

GPT‑Rosalind 在行业和学术专家确定的具有科学价值任务中表现领先。

GPT‑Rosalind 在行业和学术专家确定的具有科学价值任务中表现领先。

AI 系统仍显不足的领域

在材料密集、设计密集且受操作约束的科学工作中,表现仍明显较弱。具体而言,设计、优化与预测仍是最困难的工作流程之一,GPT‑Rosalind 通过率为 30.7%;分析同样困难,为 30.3%。

材料使用是一个尤其明显的短板。尽管 GPT‑Rosalind 在材料密集场景中的表现优于 GPT‑5.5,但其通过率仍从仅文本任务的 45.1% 降至带有材料或 URL 的任务的 28.1%。GPT‑5.5 也呈现同样模式,从 29.9% 降至 21.9%。更详细的分析证实,前沿模型在从复杂图表或大型序列文件中提取信息,并将这些信息整合进最终答案方面存在困难。

当任务需要基于来源的推理或处理材料时,通过率会下降

答案格式同样重要。要求精确序列、结构或构建体级输出的任务通过率较低:GPT‑Rosalind 在数值任务上仅达到 14.8%,在序列或结构输出上为 24.0%。构建体生成任务也很脆弱,GPT‑Rosalind 为 27.3%,相比 GPT‑5.5 改善不大。这一差距的一部分可能反映出精确答案任务的评分面更严格,在这类任务中,计算或格式上的细小差异都可能导致回答低于通过阈值。不过,这些失败在科学上具有实际意义,因为许多生命科学工作流程要求输出足够精确,以便直接使用,例如 CRISPR/HDR 供体设计或 siRNA 设计。

模型也常常能完成一部分,但无法完全解决任务。在约 14% 的任务中,模型虽未达到精确通过阈值,却获得了可观的评分细则分数。对于 GPT‑Rosalind,有 109 项任务的通过率低于 20%,但仍获得至少 50% 的评分细则得分。在实践中,这意味着模型可能识别出相关证据或给出看似合理的部分答案,但仍会失败,因为它们遗漏了关键约束、使用了错误证据、计算不完整,或没有把推理连接到科学上有用的最终决策。

局限与下一步

LifeSciBench 是衡量 AI 系统对生命科学研究有多大实用性的一步,但它不能替代在真实研究环境中研究模型。该基准聚焦于自包含任务,反映反复出现的行业工作流程,同时也将许多科学专科和任务类型留在当前范围之外。真实研究是迭代式的:科学家收集新证据、修订假设、设计后续实验,并随着结果出现调整计划。

因此,LifeSciBench 上的强表现应解读为现实任务级能力的证据,而不是下游研究影响的直接衡量。该基准以行业工作流程为基础,但未能捕捉真实研究项目的全部多样性或动态性;在真实项目中,进展取决于随时间展开的因素。

下一步是将基准表现与真实研究工作流程中的部署研究连接起来。虽然 LifeSciBench 是与在职科学家共同开发的,但要衡量 AI 系统是否能加速发现或改善研发成果,还需要在真实研究环境中、以更长时间跨度,并跨越多轮推理、反馈和实验跟进来研究模型的使用和表现。

参与其中

帮助塑造下一代生命科学 AI 基准,或申请访问 GPT-Rosalind。

作者

OpenAI