深入了解 GeneBench-Pro
進一步了解這項基準測試、題目及相關支援資料。
這 10 項案例研究展示 GeneBench-Pro 中具代表性的題目。每項案例研究均包括原始提示詞、資料集和輔助材料。如要了解基準測試概況和主要發現,請參閱公告網誌。
注意:檔案預覽會顯示完整資料集的摘錄。
評估一種合成 TXR1 靶向抑制劑,對靶點活化由結構變異驅動的腫瘤是否具有正向臨床效用。TXR1、TXR1i、DLR1 及星號等位基因標籤均為合成基準測試標籤。
必須先根據長讀長、表達、腫瘤質素及藥物基因組學證據識別目標亞組,才能評估療效和毒性,並據此作出治療決策。
向模型顯示的已發佈提示詞
提供給模型的檔案
| patient_id | analysis_set | age | sex | site | calendar_period | ecog | tumor_burden | prior_lines | prior_resistance | lineage_class | therapy_class | assessed16 | benefit16 | tox_stop_8wk | time_zero_day |
| MTB0001 | 1 | 73.8 | M | S1 | P2 | 2 | 0.787 | 3 | 1 | A | TXR1i | 0 | 1 | 0 | |
| MTB0002 | 1 | 55.2 | M | S3 | P1 | 1 | 2.637 | 0 | 1 | A | TXR1i | 1 | 0 | 0 | 0 |
| MTB0003 | 1 | 68.8 | F | S4 | P2 | 0 | 0.891 | 2 | 1 | A | TXR1i | 1 | 1 | 1 | 0 |
| MTB0004 | 1 | 82.8 | F | S2 | P2 | 2 | 4.101 | 0 | 0 | B | TXR1i | 1 | 0 | 0 | 0 |
| MTB0005 | 1 | 65.5 | F | S1 | P3 | 1 | 7.0 | 1 | 1 | A | TXR1i | 1 | 0 | 0 | 0 |
登記資料庫中的協變量、治療、第 16 週評估、療效及早期毒性。
判斷看似的 lncRNA 依賴性是轉錄本特異性的,還是由鄰近基因座及鄰近基因效應所驅動。
轉錄本導向證據必須通過多項對照驗證,包括局部 DNA 基因座擾動、鄰近基因抑制、導引序列互換、GC 毒性及培養板效應。
向模型顯示的已發佈提示詞
提供給模型的檔案
| guide_id | nominal_target | chr | coord | strand | dist_lnc_tss_bp | dist_neighbor_tss_bp | guide_gc_frac |
| g001 | LINC473 | chr7 | 100014 | + | 14 | 30 | 0.624 |
| g002 | LINC473 | chr7 | 100035 | - | 43 | 67 | 0.584 |
| g003 | LINC473 | chr7 | 100051 | + | 116 | 56 | 0.622 |
| g004 | LINC473 | chr7 | 100066 | - | 59 | 66 | 0.617 |
| g005 | LINC473 | chr7 | 100088 | + | 74 | 77 | 0.715 |
導引序列座標、靶點、距離及 GC 特徵。
使用順式多變量孟德爾隨機化 (cis-MVMR),估算兩種鄰近蛋白質對疾病的直接效應,同時處理測定尺度、等位基因方向、贏家詛咒、連鎖不平衡 (LD) 及殘餘局部多效性。
這兩種蛋白質共用一個相關基因座。分析必須由邊際關聯轉向條件式、考慮連鎖不平衡 (LD) 的疾病效應,並以統一的蛋白質尺度表示。
向模型提供的已發佈提示詞
提供給模型的檔案
| snp | pos_bp | effect_allele | other_allele | maf | beta | se | pval |
| rs200000 | 50000000 | A | C | 0.42215 | 0.006438668310706808 | 0.003267330091203412 | 0.04876727714241972 |
| rs200001 | 50010126 | A | C | 0.05709 | 0.011008993337581301 | 0.006955239208750407 | 0.11345916603941006 |
| rs200002 | 50020253 | G | T | 0.09021 | 0.009922014757116319 | 0.005633023027015518 | 0.07817048492026045 |
| rs200003 | 50030379 | G | T | 0.48399 | 0.010569215614164573 | 0.0032291419740237445 | 0.0010638520681901973 |
| rs200004 | 50040506 | A | G | 0.37703 | 0.007036551378238654 | 0.0033297592321269802 | 0.034580976884336506 |
PROTA 的篩選階段蛋白質關聯摘要。
根據帶因者篩查檢測資料,估算不同祖源群組的帶因者頻率、陰性篩查後的殘餘風險、伴侶帶因者頻率,以及受影響胚胎的風險。
殘餘風險估算取決於可識別假基因的帶因者判定、創始者單倍型歸併、按祖源群組進行的檢測校準,以及由已檢測伴侶標準化回推至完整伴侶名單。
向模型提供的已發佈提示詞
提供給模型的檔案
| sample_id | collection | ancestry | family_history_tier |
| S_EUR_0001 | screening | EUR | 0 |
| S_EUR_0002 | screening | EUR | 0 |
| S_EUR_0003 | screening | EUR | 0 |
| S_EUR_0004 | screening | EUR | 0 |
| S_EUR_0005 | screening | EUR | 1 |
附有祖源及篩查背景資料的篩查名冊成年人。
從單細胞 RNA-seq 資料中移除環境 RNA 和技術污染後,估算基因型對活化單核細胞基因表達的影響。
環境 RNA 會同時影響目標表達,以及用於判定活化狀態的標記物組合,因此必須在 eQTL 模型之前進行校正。
向模型提供的已發佈提示詞
提供給模型的檔案
| cell_id | donor | total_umi | HBB | IFI6 | ISG15 | LST1 | CXCL10 |
| D01_C001 | D01 | 1113 | 7 | 3 | 4 | 83 | 5 |
| D01_C002 | D01 | 1103 | 6 | 3 | 3 | 112 | 10 |
| D01_C003 | D01 | 1141 | 9 | 8 | 12 | 63 | 9 |
| D01_C004 | D01 | 1250 | 7 | 60 | 43 | 2 | 17 |
| D01_C005 | D01 | 1045 | 9 | 1 | 2 | 51 | 15 |
每個細胞的標記基因、污染標記及靶基因 UMI 計數。
評估位於未命名類倒位基因座內的巢狀結構亞單倍型,是否具備經校準的臨床關聯和可信的表達證據。
巢狀拷貝劑量訊號可能受較大範圍的倒位方向混淆,因此必須分開處理劑量校準、表達證據和臨床建模。
向模型提供的已發佈提示詞
提供給模型的檔案
| sample_id | case | age | age_band | sex | pc1 | pc2 | pc3 | ancestry_group | clinic_stratum | recruitment_stream |
| Q00012 | 1 | 50.45 | 50_64 | 0 | -1.01514 | -0.21032 | -0.08849 | EUR | tertiary | clinic |
| Q00028 | 0 | 57.39 | 50_64 | 0 | -1.25987 | -0.12498 | 0.2344 | EUR | regional | registry |
| Q00029 | 1 | 68.4 | 65_plus | 0 | 0.91598 | 0.62177 | 0.01891 | AFR | tertiary | clinic |
| Q00030 | 1 | 74.07 | 65_plus | 1 | 0.21125 | -0.59634 | -0.08197 | EAS | community | registry |
| Q00032 | 1 | 82.82 | 65_plus | 0 | -1.12034 | -0.24372 | 0.14665 | EUR | community | clinic |
完整隊列的臨床及協變量資料。
從預期接觸背景中移除低可比對性及結構變異偽影後,量化局部病例對照 Hi-C 環路強度的差異。
目標環路以 20 kb 解像度界定,但必須先遮罩低可比對性接觸和病例特有的 SV 條帶,否則預期接觸模型會失真。
向模型提供的已發佈提示詞
提供給模型的檔案
| bin_id | chrom | start | end | gc_content | mappability | re_sites |
| 0 | chr8 | 400000 | 420000 | 0.46199033821572594 | 0.9787574214704273 | 5 |
| 1 | chr8 | 420000 | 440000 | 0.5044124208534677 | 0.8901084943498397 | 5 |
| 2 | chr8 | 440000 | 460000 | 0.43218451584938194 | 0.9056879289326712 | 3 |
| 3 | chr8 | 460000 | 480000 | 0.4733197282681218 | 0.9376529840664789 | 3 |
| 4 | chr8 | 480000 | 500000 | 0.4444956062150748 | 0.8682565517981877 | 4 |
目標解析度分箱註釋。
在八個創始親本的重組族群中,先重建創始親本祖源,再測試表型關聯,以定位第一號染色體上的數量性狀基因座。
可見的標記資料是雙等位基因的,但生物學訊號則是創始者祖源。因此,一項站得住腳的分析必須重建創始者狀態、檢查標記方向,並將 QTL(數量性狀基因座)與一個與批次效應相符的干擾峰區分開來。
向模型提供的已發佈提示詞
提供給模型的檔案
| marker_id | chr | pos_cM |
| m2_065 | 2 | 59.762431265596575 |
| m2_103 | 2 | 94.52656615104739 |
| m2_107 | 2 | 98.18761427503033 |
| m2_079 | 2 | 72.20130244108847 |
| m1_054 | 1 | 49.907510212292195 |
標記識別碼、染色體及遺傳圖譜位置。
修正互易偽影及特定染色體的標籤反轉後,根據已定相的局部祖源片段,推斷父母各自的祖源比例及近期基因混合時間。
如果互易片段偽影、染色體局部標籤反轉或圖譜分母處理不當,祖源比例和脈衝時間都會改變。
向模型提供的已發佈提示詞
提供給模型的檔案
| chrom | hap | start_morgan | end_morgan | anc | posterior | low_complexity_frac |
| chr1 | h1 | 0.03 | 0.505 | A | 0.985 | 0.08 |
| chr1 | h1 | 0.505 | 0.535 | B | 0.62 | 0.92 |
| chr1 | h1 | 0.535 | 1.478849 | A | 0.985 | 0.08 |
| chr1 | h1 | 1.503727 | 1.852681 | B | 0.985 | 0.08 |
| chr1 | h1 | 1.852681 | 2.422373 | A | 0.985 | 0.08 |
已定相的局部祖源區段,包含座標、祖源標籤、後驗值及質控註釋。
根據古代等位基因頻率的時間序列,推斷兩個單倍體基因座中哪一個受到較強的正向選擇,同時考慮等位基因方向、方向性誤差、遺傳漂變及族群大小變化。
在把兩個基因座置於相同的衍生等位基因尺度,並直接對所提供的樣本層級測序誤差值建模前,無法直接比較含有雜訊的古代軌跡。
提供給模型的檔案
| generation | alt_reads | total_reads | seq_error | sample_year |
| 6 | 36 | 40 | 0.16 | -4500 |
| 12 | 34 | 45 | 0.16 | -4278 |
| 18 | 41 | 55 | 0.16 | -4056 |
| 24 | 38 | 70 | 0.16 | -3833 |
| 30 | 36 | 90 | 0.16 | -3611 |
基因座 A 的讀段計數時間序列。