跳至主要内容
OpenAI

2026年6月30日

研究刊发

推出 GeneBench-Pro

这是一项研究级基准测试,旨在衡量 AI 智能体如何在计算生物学领域应对模糊性并做出关键判断。

正在加载…

科学数据很少自带使用说明。研究人员必须判断某种模式究竟是真实的生物学现象还是技术噪音,评估当前数据能否支撑所探究的问题,并决定每一个分析结果应如何影响下一步的行动方向。尽管 AI 智能体越来越擅长执行复杂的分析,但真实的科学研究不仅依赖于检索已知事实或遵循预设的工作流,同样依赖于做出这些高阶判断。

今天,我们正式推出 GeneBench-Pro。这是一项具有挑战性的研究级基准测试,用于检验模型是否能够处理真实计算生物学中高度依赖判断的分析任务。它在 GeneBench(在新窗口中打开) 的基础上进行了扩展,涵盖了基因组学、定量生物学和转化医学领域中难度更高、更贴近现实的任务,从而真实反映了计算生物学研究中的复杂性、迭代特征以及模糊性。

迄今为止,关于系统级判断能力的评估方法依然很少,而正是这些判断构成了真实世界计算研究的难点。这些能力包括:处理模棱两可的情况、修正假设、选择正确的分析路径,以及判断分析结果何时已满足支持下游决策的条件。由于这些技能难以形式化,因此也很难进行严谨的评估,尽管模型在这些方面的不足正日益制约着 AI 的整体表现。

标题为“生物学基准测试差距”的示意图,对比了传统基准测试工作流与端到端科学分析流程,展示了在得出科学结论前所需的额外步骤,如预处理、建模、诊断及迭代优化。

GeneBench-Pro 的设计初衷正是为了准确衡量这些高阶能力。在 GeneBench-Pro 中,我们将“科研品味 (research taste)”定义为塑造整个分析过程的一系列判断链:例如,当前数据能支撑回答哪些问题、初步的数据探查结果应如何促使模型或目标估计量 (estimand) 发生改变,以及初始计划在何时需要被推翻重来。GeneBench-Pro 的每一道题都会为模型提供未经清洗的真实数据集、简短的实验背景说明,以及一个与下游决策直接相关的目标估计量。为了得出正确答案,模型必须主动探索数据、选择合适的分析方法、参与反复迭代的实验过程,并最终提供答案。

数据集构建

在生物学领域,数据生成(如基因组测序)的成本已大幅下降,一些研究人员现在认为(在新窗口中打开),制约该领域发展的瓶颈已不再是样本采集,而是下游的计算与分析。GeneBench-Pro 旨在评估业界在突破这一瓶颈方面所取得的进展,其包含的 129 个问题广泛覆盖了计算生物学中的各类应用场景与研究方法。

域图谱:共 10 个域、21 个子域,包含 129 个问题

使用方向键在基准测试问题之间切换。所选问题的详细信息将显示在下方。

点击上方圆点,了解基准测试问题。

本图集提供了 GeneBench-Pro 广度的一个概览。访问案例研究页面,深入探索 10 道代表性题目。

同时,GeneBench-Pro 的设计也规避了常规基准测试中的局限性。许多长周期的生物学基准测试会基于杂乱的历史数据集构建多步问题,而这类数据往往不存在唯一正确的分析路径。在这种情况下,一个智能体可能会选择一个合理的阈值,而另一个可能会选择不同但同样合理的阈值;这种结果上的偏差更多反映的是基准测试构建者的主观偏好,而非模型性能上的实质性差异。反之亦然:如果某道题目的数值敏感度过低,智能体即使在分析中犯了根本性错误,依然可能输出看似通过的答案。

为了避免这些缺陷,GeneBench-Pro 的每一道问题均通过合成数据构建:由于我们掌握完整的因果结构,并能直接模拟数据生成的过程,因此我们能够灵活调整每道题的复杂度。这样一来,我们既能保证不同且合理的主观分析选择依然能得出可接受的数值结果,又能通过消融实验验证那些“看似合理实则错误”的分析路径必定会得出错误结论。随后,我们通过详细的追踪分析对问题草案进行审查,以排查信息泄露和意外的“捷径”解法。通过这些机制,我们确信:模型得出正确答案的前提是选择了正确的分析路径,而非利用了测试漏洞或迎合了出题者的主观偏好。

标题为“GeneBench-Pro 问题的构建与验证”的示意图,展示了从构建可运行任务,到审查、稳健性检查、智能体测试、专家评审、修订,最终形成成品基准测试题的工作流。

我们将 GeneBench-Pro 129 道测试题中的 82 道提交给了外部领域专家,涵盖研究生、博士后研究员、业界科学家以及高校教授。评审人员评估了每道题目的真实程度、目标答案是否具备可识别性,以及所用的方法和估计量 (estimators) 是否恰当。我们随后利用这些反馈对题目进行了优化。

1 条/ 共 2 条
我所评审的这些题目,若没有经验丰富的导师反复指导,即便是研究生也很难完成。数据中存在技术和质量控制层面的问题,需要经过深思熟虑、具备反思能力的数据分析,并时刻警惕潜在的陷阱才能顺利解决;这绝非仅仅是将现成方法简单套用于干净、经过精心整理的数据集那么简单。
Alexander Strudwick Young,加州大学洛杉矶分校 (UCLA) 人类遗传学助理教授

评估与评分

GeneBench-Pro 中的每道题都是一项独立完整的科学分析任务。智能体会获得一个独立工作空间的访问权限,其中包含简短的提示词、数据文件,以及标准的生物信息学技术栈(包括 Python、科学计算库和基础基因组学工具包,如 PLINK 2.0),不过这些题目实际上并不强制要求使用特定领域的工具。

基于结构变异的肿瘤治疗获益与风险决策

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

由于我们掌控了完整的数据生成过程,因此能够将模型输出与已知答案进行比对,得出确定性的客观评分;这有效避免了在常规的人工评分量表 (rubric-based evaluation) 评估中常见的“模型偏好差异”以及“长篇大论更易得高分 (verbosity effects)”的干扰。

每道题还附带了丰富的元数据,包括预期的分析框架、随附的数据文件、长达数页的详尽案例研究,以及专家评审结果。我们已在 Hugging Face(在新窗口中打开) 上完全开源了 10 道具有代表性的 GeneBench-Pro 题目,并提供了一个供用户浏览的交互式网页界面。此外,在不久的将来,我们会将包含 50 道题的子集提交给 Artificial Analysis(在新窗口中打开),用于独立、第三方的基准评测。

结果

我们目前最强大的模型 GPT‑5.6 Sol,在最高推理级别下达到了 28.7% 的通过率(在开启 Pro 模式后为 31.5%)。相比于我们最初构建初代 GeneBench 时,这是一个显著的跨越;当时,我们最出色的前沿模型 GPT‑5 的得分还不到 5%。该基准测试上的进展表明,前沿模型的进步速度非常快,即使是在那些相对抽象、系统级的科学推理能力上也是如此。按照当前的发展速度,这项基准测试的成绩可能在今年年底前就会达到饱和。

评估结果还展示了扩展“测试时计算 (test-time compute)”所带来的影响。在最低的推理级别下,GPT‑5.6 Sol 的通过率仅为个位数。而在最高推理级别下,GPT‑5.6 Sol 解决的题目数量几乎是 GPT‑5.2 的六倍,同时消耗的 Token 数量却仅为其三分之二左右。

对不同模型系列的对比表明,在面对存在量化不确定性的高阶科学推理任务时,GPT 模型处于最强系统之列。GPT‑5.6、GPT‑5.5 与诸如 GLM 5.2 等领先开源模型之间的性能差距,远大于我们基于编程基准测试(在新窗口中打开)推断出的结果。这表明,开源模型更偏向于在编程任务上进行特化,而在更广泛的推理能力上则有所欠缺。

在开发阶段,我们使用前沿的 GPT 模型来评估并打磨这些题目。因此,我们曾猜测 GeneBench-Pro 可能会在评估其他模型系列时存在不利于它们的偏差。然而,竞争模型表现最佳时也只能追平同期发布的对应 GPT 模型的成绩,而且通常还会出现明显的落后。

考虑到 GeneBench-Pro 测试题的高难度,这些评估结果 — 尤其是 GPT‑5.6 Sol (Pro) 高达 31.5% 的通过率 — 令人印象深刻。在一项调查中,我们的评审专家预估,解决一道典型的 GeneBench-Pro 题目大约需要一位人类专家耗费 20 到 40 个小时。按保守估计每小时 200 美元计算,攻克单道题目的人工成本将高达数千美元。尽管目前的 AI 智能体在可靠性上还不足以完全替代人类专家,但两者之间的成本差距是巨大的,模型处理一道题的推理成本仅需几美元。这意味着,即使在当前的模型能力下仅实现部分自动化,也能创造出可观的经济与科学价值。

1 条/ 共 2 条
这些基准测试的初衷涵盖了多样化的生物学问题,但...真正的挑战在于探索性数据分析以及对分析发现的推理过程:即识别模式和伪迹,并决定是否应剔除或调整数据。这与真实生物学数据集杂乱无章的特性如出一辙。回顾这些评估,凸显了在基于智能体的科学问题求解中,明确的求解协议 (solver contracts) 是多么重要。提示词的措辞或任务规范的不同,可能会极大地影响哪些分析路径被视为是可接受的。
Cyrillus Tan,纽约基因组中心 (New York Genome Center) 博士后研究助理

尽管如此,前沿模型目前仍只能解决不到三分之一的题目,这说明其仍有很大的提升空间。面对具有挑战性的题目,模型虽然能取得一定的进展,却难以形成完整的推理闭环 (close the inferential loop)。这种失败模式,恰好映射了人类专家与新手之间的差距。专家会利用自身经验来构建问题的分析框架,并灵活调整解决策略;而新手虽然能够观察到一些现象,却很难将这些发现整合到问题更宏观的上下文之中。

问题:具有时变治疗特征的药物基因组学事件发生时间响应

治疗启动、基因型特异性响应、延迟的药效动力学、现有用药者标记 (prevalent-user flags) 以及纵向生物标志物共同决定了因果生存估计量。

GPT-5.5 模式

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

GPT-5.6 Sol 模式

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

要想实现接近完美的表现,我们需要一种既能可靠衡量技术进展,又能定位模型薄弱环节的评估机制。像 GeneBench-Pro 这样的基准测试,能够将那些原本模糊的能力缺陷,转化为可诊断、可改进的具体指标。

如果智能体能够可靠地自动执行此类分析,它们将极大加速科学发现的进程。目前,人类遗传学证据已经是靶点优先级评估 (target prioritization) 以及转化医学后续研究的核心要素,因为具备遗传学支持的机制更有可能促成疗法的获批。

与此同时,测序成本已大幅下降,生物样本库级别的数据集正以前所未有的广度,将分子数据、表型特征与健康记录信息连接起来。行业的发展瓶颈,正从数据生成转向如何将这些海量信息转化为可执行的洞见。如果模型能够稳定执行目前由人类专家团队负责的分析工作,将极大加速假设筛选 (hypothesis triage)、靶点跟进,以及从生成数据到制定决策之间的迭代周期,从而彻底改变产业界的研究模式。

GeneBench-Pro 代表了我们的一项初步尝试,旨在评估那些通常只有资深科研人员才具备的、能够做出优秀科学判断的抽象技能。正是凭借这些技能,他们能靠直觉锁定最具有潜力的初步分析方向;当数据与初始假设相悖时,他们能迅速迭代思路并加以修正,最终得出能够支撑下游临床、学术或商业决策的结论。

我们预计,随着模型能力的不断演进,新的基准测试将变得愈发重要。这些测试不再局限于书本知识或常规分析能力,而是着力探测模型在更高抽象层面的表现。

作者

OpenAI