深入探索 Genebench-Pro
深入了解该基准测试、测试问题及其辅助材料。
这 10 个案例研究展示了 GeneBench-Pro 中具有代表性的测试问题。每个案例均包含原始提示词 (prompt)、数据集及辅助材料。如需了解该基准测试的概况及核心发现,请参阅发布公告。
注:文件预览仅展示完整数据集的节选内容。
评估一种合成的 TXR1 靶向抑制剂,在靶点激活由结构变异驱动的肿瘤中,是否具有正向的临床效用。TXR1、TXR1i、DLR1 以及星等位基因 (star-allele) 均为合成的基准测试标签。
在将获益与毒性表现转化为最终的治疗决策之前,必须先从长读长测序 (long-read)、基因表达、肿瘤质量以及药物基因组学证据中识别出目标亚组。
向模型展示的公开提示词
提供给模型的文件
| patient_id | analysis_set | age | sex | site | calendar_period | ecog | tumor_burden | prior_lines | prior_resistance | lineage_class | therapy_class | assessed16 | benefit16 | tox_stop_8wk | time_zero_day |
| MTB0001 | 1 | 73.8 | M | S1 | P2 | 2 | 0.787 | 3 | 1 | A | TXR1i | 0 | 1 | 0 | |
| MTB0002 | 1 | 55.2 | M | S3 | P1 | 1 | 2.637 | 0 | 1 | A | TXR1i | 1 | 0 | 0 | 0 |
| MTB0003 | 1 | 68.8 | F | S4 | P2 | 0 | 0.891 | 2 | 1 | A | TXR1i | 1 | 1 | 1 | 0 |
| MTB0004 | 1 | 82.8 | F | S2 | P2 | 2 | 4.101 | 0 | 0 | B | TXR1i | 1 | 0 | 0 | 0 |
| MTB0005 | 1 | 65.5 | F | S1 | P3 | 1 | 7.0 | 1 | 1 | A | TXR1i | 1 | 0 | 0 | 0 |
登记协变量、治疗方案、第 16 周评估结果、临床获益以及早期毒性。
判定某种显性的 lncRNA 依赖性究竟是转录本特异性的,还是由邻近位点及邻近基因效应所驱动的。
指向转录本层面的证据,必须能够经受住针对局部 DNA 位点扰动、邻近基因抑制、guide RNA 交换 (guide swaps)、GC 毒性以及孔板效应 (plate effects) 的对照检验。
向模型展示的公开提示词
提供给模型的文件
| guide_id | nominal_target | chr | coord | strand | dist_lnc_tss_bp | dist_neighbor_tss_bp | guide_gc_frac |
| g001 | LINC473 | chr7 | 100014 | + | 14 | 30 | 0.624 |
| g002 | LINC473 | chr7 | 100035 | - | 43 | 67 | 0.584 |
| g003 | LINC473 | chr7 | 100051 | + | 116 | 56 | 0.622 |
| g004 | LINC473 | chr7 | 100066 | - | 59 | 66 | 0.617 |
| g005 | LINC473 | chr7 | 100088 | + | 74 | 77 | 0.715 |
guide RNA 的坐标、靶标、距离及 GC 特征。
在处理检测量标 (assay scale)、等位基因方向、赢家诅咒 (winner's curse)、连锁不平衡 (LD) 以及残余局部多效性的同时,利用顺式多变量孟德尔随机化 (cis-MVMR) 评估两种临近蛋白质对疾病的直接因果效应。
这两种蛋白质共享一个存在连锁相关性的基因座。分析过程必须从边缘关联 (marginal associations) 推进到在统一的蛋白质尺度上,对考虑了 LD 的条件疾病效应进行评估。
向模型展示的公开提示词
提供给模型的文件
| snp | pos_bp | effect_allele | other_allele | maf | beta | se | pval |
| rs200000 | 50000000 | A | C | 0.42215 | 0.006438668310706808 | 0.003267330091203412 | 0.04876727714241972 |
| rs200001 | 50010126 | A | C | 0.05709 | 0.011008993337581301 | 0.006955239208750407 | 0.11345916603941006 |
| rs200002 | 50020253 | G | T | 0.09021 | 0.009922014757116319 | 0.005633023027015518 | 0.07817048492026045 |
| rs200003 | 50030379 | G | T | 0.48399 | 0.010569215614164573 | 0.0032291419740237445 | 0.0010638520681901973 |
| rs200004 | 50040506 | A | G | 0.37703 | 0.007036551378238654 | 0.0033297592321269802 | 0.034580976884336506 |
蛋白质 PROTA 在筛选阶段的关联汇总数据。
基于携带者筛查检测数据,评估特定族群的携带频率、筛查阴性后的残余风险、伴侣的携带频率,以及受累胎儿 (affected-conceptus) 风险。
残余风险的评估依赖于:排除假基因干扰的携带者检出 (pseudogene-aware carrier calls)、奠基者单倍型合并 (founder-haplotype collapse)、针对特定族群的实验校准,以及将已受试伴侣的数据标准化推算至全体伴侣名单。
向模型展示的公开提示词
提供给模型的文件
| sample_id | collection | ancestry | family_history_tier |
| S_EUR_0001 | screening | EUR | 0 |
| S_EUR_0002 | screening | EUR | 0 |
| S_EUR_0003 | screening | EUR | 0 |
| S_EUR_0004 | screening | EUR | 0 |
| S_EUR_0005 | screening | EUR | 1 |
筛查名单中成年人的族群背景与筛查背景信息。
在从单细胞 RNA 测序 (scRNA-seq) 数据中去除环境 RNA 与技术污染后,评估基因型对活化单核细胞基因表达的影响。
环境 RNA 会同时影响靶基因的表达以及用于判定细胞活化状态的标志物组合 (marker panel),因此必须在构建 eQTL 模型之前完成校正。
向模型展示的公开提示词
提供给模型的文件
| cell_id | donor | total_umi | HBB | IFI6 | ISG15 | LST1 | CXCL10 |
| D01_C001 | D01 | 1113 | 7 | 3 | 4 | 83 | 5 |
| D01_C002 | D01 | 1103 | 6 | 3 | 3 | 112 | 10 |
| D01_C003 | D01 | 1141 | 9 | 8 | 12 | 63 | 9 |
| D01_C004 | D01 | 1250 | 7 | 60 | 43 | 2 | 17 |
| D01_C005 | D01 | 1045 | 9 | 1 | 2 | 51 | 15 |
标志物基因、污染标志物以及靶基因的单细胞 UMI 计数。
评估一个匿名的类倒位 (inversion-like) 基因座内部的嵌套结构子单倍型,是否具有经过校准的临床关联以及可信的表达支持证据。
由于嵌套的拷贝数剂量 (copy-dosage) 信号极易受到更大范围倒位方向的混淆,因此剂量校准、表达支持证据分析以及临床建模必须作为相互独立的步骤分别进行处理。
向模型展示的公开提示词
提供给模型的文件
| sample_id | case | age | age_band | sex | pc1 | pc2 | pc3 | ancestry_group | clinic_stratum | recruitment_stream |
| Q00012 | 1 | 50.45 | 50_64 | 0 | -1.01514 | -0.21032 | -0.08849 | EUR | tertiary | clinic |
| Q00028 | 0 | 57.39 | 50_64 | 0 | -1.25987 | -0.12498 | 0.2344 | EUR | regional | registry |
| Q00029 | 1 | 68.4 | 65_plus | 0 | 0.91598 | 0.62177 | 0.01891 | AFR | tertiary | clinic |
| Q00030 | 1 | 74.07 | 65_plus | 1 | 0.21125 | -0.59634 | -0.08197 | EAS | community | registry |
| Q00032 | 1 | 82.82 | 65_plus | 0 | -1.12034 | -0.24372 | 0.14665 | EUR | community | clinic |
完整队列的临床及协变量数据。
在从期望接触背景 (expected-contact background) 中去除低可比对性区域 (low-mappability) 与结构变异伪迹后,定量评估特定病例-对照组之间的 Hi-C 染色质环强度差异。
目标染色质环是在 20 kb 分辨率下定义的,但如果不先屏蔽低可比对性的接触信号以及仅在病例组中出现的结构变异 (SV) 条带 (stripe),期望接触模型就会失真。
向模型展示的公开提示词
提供给模型的文件
| bin_id | chrom | start | end | gc_content | mappability | re_sites |
| 0 | chr8 | 400000 | 420000 | 0.46199033821572594 | 0.9787574214704273 | 5 |
| 1 | chr8 | 420000 | 440000 | 0.5044124208534677 | 0.8901084943498397 | 5 |
| 2 | chr8 | 440000 | 460000 | 0.43218451584938194 | 0.9056879289326712 | 3 |
| 3 | chr8 | 460000 | 480000 | 0.4733197282681218 | 0.9376529840664789 | 3 |
| 4 | chr8 | 480000 | 500000 | 0.4444956062150748 | 0.8682565517981877 | 4 |
目标分辨率的区间 (bin) 注释。
在一个拥有八个奠基者 (founder) 的重组群体中,通过在检测表型关联之前重构奠基者祖源信息,对 1 号染色体上的数量性状位点 (QTL) 进行定位。
观测到的标记数据虽然是双等位基因的,但生物学信号源自奠基者祖源。因此,一个严谨的分析必须先重构奠基者状态,核对标记方向,并将目标 QTL 与一个批次对齐产生的干扰峰值 (nuisance peak) 区分开来。
向模型展示的公开提示词
提供给模型的文件
| marker_id | chr | pos_cM |
| m2_065 | 2 | 59.762431265596575 |
| m2_103 | 2 | 94.52656615104739 |
| m2_107 | 2 | 98.18761427503033 |
| m2_079 | 2 | 72.20130244108847 |
| m1_054 | 1 | 49.907510212292195 |
标记标识符、染色体编号及遗传图谱位置。
在修复互反性片段伪迹 (reciprocal artifacts) 及特定染色体标签倒置后,基于定相的局部祖源片段,推断双亲特异性祖源比例及近期基因混合时间。
如果对互反性片段伪迹、染色体局部标签倒置或遗传图谱分母处理不当,祖源比例和混合脉冲时间 (pulse times) 均会发生改变。
向模型展示的公开提示词
提供给模型的文件
| chrom | hap | start_morgan | end_morgan | anc | posterior | low_complexity_frac |
| chr1 | h1 | 0.03 | 0.505 | A | 0.985 | 0.08 |
| chr1 | h1 | 0.505 | 0.535 | B | 0.62 | 0.92 |
| chr1 | h1 | 0.535 | 1.478849 | A | 0.985 | 0.08 |
| chr1 | h1 | 1.503727 | 1.852681 | B | 0.985 | 0.08 |
| chr1 | h1 | 1.852681 | 2.422373 | A | 0.985 | 0.08 |
包含坐标、祖源标签、后验概率值及质控 (QC) 注释的定相局部祖源片段。
在考虑等位基因方向、方向性误差、遗传漂变及动态种群规模的前提下,从古等位基因频率时间序列中推断两个单倍型位点中哪一个受到更强的正向选择作用。
在将两个位点转换至相同的衍生等位基因尺度并对提供的样本级测序错误值进行直接建模之前,这些有噪的古代频率演化轨迹无法直接进行比较。
提供给模型的文件
| generation | alt_reads | total_reads | seq_error | sample_year |
| 6 | 36 | 40 | 0.16 | -4500 |
| 12 | 34 | 45 | 0.16 | -4278 |
| 18 | 41 | 55 | 0.16 | -4056 |
| 24 | 38 | 70 | 0.16 | -3833 |
| 30 | 36 | 90 | 0.16 | -3611 |
基因座 A 的读取计数时间序列。