智能体 AI 系统执行科学任务的能力正在不断增强。然而,它们对生命科学研究人员的实用性,取决于它们处理真实研究复杂性的能力。这类工作很少像单个事实回忆题或清晰的预测问题那样简单。研究人员需要解读不完整的证据,调和相互矛盾的结果,设计困难实验,排查检测问题,评估转化风险,并在不确定性下决定下一步行动。
现有基准并未充分捕捉这些能力。许多生命科学评估聚焦于狭窄领域或孤立技能,因此问题格式结构化,并配有明确的参考答案。这些评估虽有价值,却往往无法真正评估模型是否能在更广泛的研究级工作中发挥作用。
我们设计了 LifeSciBench,以帮助弥合这一差距。每项任务都基于在职生命科学家的判断;这些科学家受过博士级训练,并有在生物技术和制药环境中直接推进药物发现项目的经验。
LifeSciBench 包含 750 项由专家撰写的任务,覆盖七类工作流程和七个生物学领域。
1,062
任务材料
173
科学家贡献者
19,020
评分标准
453
专家评审者
LifeSciBench 衡量什么
LifeSciBench 衡量 AI 系统能否支持真实的生命科学研究任务,而不只是回答生物学问题。为定义基准分类体系,我们调研了在职生命科学家,了解他们在应用研究环境中最常使用的工作流程。随后,我们将他们的回答归纳为七个反复出现的类别:证据处理、分析、设计与优化、科学推理、验证与运营、转化以及科学沟通。
每项任务的结构都类似科学家可能向知识丰富的合作者提出的请求:科学提示、任何相关背景或材料,以及自由作答的答案。由专家撰写的评分细则会评估模型能否针对具体问题给出正确答案,并达到科学家所期待的细节、论证、限定说明和格式要求。
数据集构建
LifeSciBench 评估科学推理,同时评估真实科学应用所必需但定义不那么清晰的实践技能。其任务要求模型处理真实研究问题:解读证据、作出基于领域知识的判断,并传达对专家评审者有用的结论。许多任务还要求模型处理不确定性,并基于支持性数据文件进行推理,而不是只依赖提示文本。
该基准旨在反映生命科学工作的复杂性。总体而言,79% 的任务需要多个推理或决策步骤,平均每项任务包含四个步骤。LifeSciBench 包含 1,062 个附加材料,涵盖图表、PDF、表格、序列文件、结构或化学文件以及网页参考。超过半数任务(53%)要求模型解读或综合至少一个材料中的信息。
这些任务由来自不同生命科学学科的 173 位专家科学家创建。每位科学家都受过博士级训练,并具备生物技术或制药行业经验。任务在被接受前可按需经历任意多轮修订,不设固定轮次上限;被接受的任务平均经历六轮自导式自动审查,并完成至少两轮专家评审。评审以可验证的正确答案或强专家共识为依据,相关领域评审者的一致率至少达到 90%。这一流程有助于确保被接受的任务具备科学依据、足够清晰以便评分,并能代表应用研究。
评分与评分细则拆解
LifeSciBench 任务采用详细且针对任务定制的评分细则,将预期回答拆解为具体的科学主张、计算、决策、论证等。在整个基准中,专家制定的评分细则包含 19,020 条标准,平均每项任务 25 条,用于评估科学正确性以及对研究决策的实用性。
这种设计反映了科学工作在实践中的评估方式:许多生命科学任务不能只通过检查最终答案来评分。一个回答可能得出正确的高层结论,但如果例如忽略了关键检测局限,或未能主动指出影响重大的生物学细节,仍会被判定为不完整。相反,即使未能完全解决任务,部分回答也可能包含高质量推理。
细粒度评分细则能够捕捉这种差异。LifeSciBench 不仅评估最终答案的准确性,还评估模型是否以科学有效且操作上有用的方式得出答案。
验证 LifeSciBench
我们通过独立专家评审验证了 LifeSciBench。反馈来自 453 位未参与任务撰写的评审者。在这些评审者中,97% 拥有博士学位或同等博士学位,平均有 12 年领域经验和 14 篇同行评审论文;88% 报告曾获得至少一项奖项或研究资助。
评审者对每项任务是否体现强基准问题所需的特质进行评分:与真实研究工作的契合度、对科学推理和领域专业能力的适当测试、以证据或专家共识为基础,以及用于评估模型表现的总体实用性。每个类别的一致率均超过 96%。
评审者评论进一步支持了定量评分:
结果
我们报告两项互补指标。通过率是指模型达到任务级 70% 成功阈值的任务占比。得分是平均评分细则得分,即使完整任务未被解决,也会对单项标准给予部分分。两者都很重要,因为科学任务的回答即使未满足完整答案的所有要求,也可能部分正确或有用。
模型表现会随任务类型、工作流程和回答格式而显著变化。
AI 系统初步展现优势的领域
LifeSciBench 显示,前沿模型在涉及科学综合、沟通和结构化解读的任务上相对最强。绝对通过率仍然不高,因此这些基准领域远未饱和,但 GPT‑Rosalind 相比 GPT‑5.5 显示出有意义的进步,整体精确通过率从 25.7% 提升到 36.1%。
模型能力进步最明显的方向出现在科学沟通和转化。例如,科学沟通的通过率从 GPT‑5.5 的 56.3% 提升到 GPT‑Rosalind 的 71.1%;该类别样本较小(n=9),因此应谨慎解读,但它表明前沿模型在组织证据并生成面向专家的有说服力解释方面正在快速提升。转化(药物开发中的“从实验台到病床”过程)呈现类似模式,从 GPT‑5.5 的 36.8% 升至 GPT‑Rosalind 的 57.7%,表明模型在将临床前证据与临床意义相连接方面正迅速提高。
评分细则层面的结果也指向同一方向。在要求输出对专家有用或可执行的任务上,GPT‑Rosalind 得分为 44.7%,而 GPT‑5.5 为 29.1%。在要求处理不确定性和限定说明的任务上,它得分 44.8%,相比之下为 29.3%。这一模式表明,当任务有清晰的证据边界并要求结构化科学判断时,模型最有用。
GPT‑Rosalind 在由行业和学术专家确定的具有科学价值的任务中表现领先。
GPT‑Rosalind 在行业和学术专家确定的具有科学价值任务中表现领先。
GPT‑Rosalind 在行业和学术专家确定的具有科学价值任务中表现领先。
AI 系统仍显不足的领域
在材料密集、设计密集且受操作约束的科学工作中,表现仍明显较弱。具体而言,设计、优化与预测仍是最困难的工作流程之一,GPT‑Rosalind 通过率为 30.7%;分析同样困难,为 30.3%。
材料使用是一个尤其明显的短板。尽管 GPT‑Rosalind 在材料密集场景中的表现优于 GPT‑5.5,但其通过率仍从仅文本任务的 45.1% 降至带有材料或 URL 的任务的 28.1%。GPT‑5.5 也呈现同样模式,从 29.9% 降至 21.9%。更详细的分析证实,前沿模型在从复杂图表或大型序列文件中提取信息,并将这些信息整合进最终答案方面存在困难。
当任务需要基于来源的推理或处理材料时,通过率会下降
答案格式同样重要。要求精确序列、结构或构建体级输出的任务通过率较低:GPT‑Rosalind 在数值任务上仅达到 14.8%,在序列或结构输出上为 24.0%。构建体生成任务也很脆弱,GPT‑Rosalind 为 27.3%,相比 GPT‑5.5 改善不大。这一差距的一部分可能反映出精确答案任务的评分面更严格,在这类任务中,计算或格式上的细小差异都可能导致回答低于通过阈值。不过,这些失败在科学上具有实际意义,因为许多生命科学工作流程要求输出足够精确,以便直接使用,例如 CRISPR/HDR 供体设计或 siRNA 设计。
模型也常常能完成一部分,但无法完全解决任务。在约 14% 的任务中,模型虽未达到精确通过阈值,却获得了可观的评分细则分数。对于 GPT‑Rosalind,有 109 项任务的通过率低于 20%,但仍获得至少 50% 的评分细则得分。在实践中,这意味着模型可能识别出相关证据或给出看似合理的部分答案,但仍会失败,因为它们遗漏了关键约束、使用了错误证据、计算不完整,或没有把推理连接到科学上有用的最终决策。
局限与下一步
LifeSciBench 是衡量 AI 系统对生命科学研究有多大实用性的一步,但它不能替代在真实研究环境中研究模型。该基准聚焦于自包含任务,反映反复出现的行业工作流程,同时也将许多科学专科和任务类型留在当前范围之外。真实研究是迭代式的:科学家收集新证据、修订假设、设计后续实验,并随着结果出现调整计划。
因此,LifeSciBench 上的强表现应解读为现实任务级能力的证据,而不是下游研究影响的直接衡量。该基准以行业工作流程为基础,但未能捕捉真实研究项目的全部多样性或动态性;在真实项目中,进展取决于随时间展开的因素。
下一步是将基准表现与真实研究工作流程中的部署研究连接起来。虽然 LifeSciBench 是与在职科学家共同开发的,但要衡量 AI 系统是否能加速发现或改善研发成果,还需要在真实研究环境中、以更长时间跨度,并跨越多轮推理、反馈和实验跟进来研究模型的使用和表现。


