GeneBench-Pro 살펴보기
벤치마크와 문제, 관련 자료를 자세히 살펴보세요.
이 10개의 사례 연구는 GeneBench-Pro의 대표적인 문제를 보여줍니다. 각 사례 연구에는 원본 프롬프트와 데이터세트, 그리고 관련 자료가 포함되어 있습니다. 벤치마크와 주요 결과에 대한 개요는 발표 블로그에서 확인하세요.
참고: 파일 미리보기에는 전체 데이터세트의 일부만 발췌되어 표시됩니다.
표적 활성화가 구조 변이에 의해 유도되는 종양에서 합성 TXR1 표적 억제제가 임상적으로 유익한지 추정합니다. TXR1, TXR1i, DLR1 및 스타 대립유전자 레이블은 합성 벤치마크 레이블입니다.
치료 효과와 독성을 치료 결정의 근거로 해석하기 전에 장기 판독, 발현, 종양 품질 및 약물유전체학 근거를 바탕으로 표적 하위군을 먼저 식별해야 합니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| patient_id | analysis_set | age | sex | site | calendar_period | ecog | tumor_burden | prior_lines | prior_resistance | lineage_class | therapy_class | assessed16 | benefit16 | tox_stop_8wk | time_zero_day |
| MTB0001 | 1 | 73.8 | M | S1 | P2 | 2 | 0.787 | 3 | 1 | A | TXR1i | 0 | 1 | 0 | |
| MTB0002 | 1 | 55.2 | M | S3 | P1 | 1 | 2.637 | 0 | 1 | A | TXR1i | 1 | 0 | 0 | 0 |
| MTB0003 | 1 | 68.8 | F | S4 | P2 | 0 | 0.891 | 2 | 1 | A | TXR1i | 1 | 1 | 1 | 0 |
| MTB0004 | 1 | 82.8 | F | S2 | P2 | 2 | 4.101 | 0 | 0 | B | TXR1i | 1 | 0 | 0 | 0 |
| MTB0005 | 1 | 65.5 | F | S1 | P3 | 1 | 7.0 | 1 | 1 | A | TXR1i | 1 | 0 | 0 | 0 |
등록 데이터 공변량, 치료 정보, 16주차 평가, 치료 효과 및 초기 독성.
겉으로 드러난 lncRNA 의존성이 해당 전사체에 특이적인 것인지, 아니면 인접 좌위와 주변 유전자의 영향에 의해 나타난 것인지 판별합니다.
전사체 표적 효과에 대한 근거는 국소 DNA 좌위 교란, 인접 유전자 억제, 가이드 혼동, GC 독성, 플레이트 효과를 통제한 후에도 유지되어야 합니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| guide_id | nominal_target | chr | coord | strand | dist_lnc_tss_bp | dist_neighbor_tss_bp | guide_gc_frac |
| g001 | LINC473 | chr7 | 100014 | + | 14 | 30 | 0.624 |
| g002 | LINC473 | chr7 | 100035 | - | 43 | 67 | 0.584 |
| g003 | LINC473 | chr7 | 100051 | + | 116 | 56 | 0.622 |
| g004 | LINC473 | chr7 | 100066 | - | 59 | 66 | 0.617 |
| g005 | LINC473 | chr7 | 100088 | + | 74 | 77 | 0.715 |
가이드 좌표, 표적, 거리 및 GC 특성.
분석 규모, 대립유전자 방향성, 승자의 저주, LD 및 잔여 국소 다면발현성을 고려하면서 cis 다변수 멘델 무작위배정(cis-MVMR)을 사용해 서로 인접한 두 단백질의 직접적인 질환 효과를 추정합니다.
두 단백질은 서로 상관된 동일한 좌위를 공유합니다. 이 분석에서는 주변 연관성에서 벗어나 공통 단백질 척도에서 LD를 고려한 조건부 질환 효과를 추정해야 합니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| snp | pos_bp | effect_allele | other_allele | maf | beta | se | pval |
| rs200000 | 50000000 | A | C | 0.42215 | 0.006438668310706808 | 0.003267330091203412 | 0.04876727714241972 |
| rs200001 | 50010126 | A | C | 0.05709 | 0.011008993337581301 | 0.006955239208750407 | 0.11345916603941006 |
| rs200002 | 50020253 | G | T | 0.09021 | 0.009922014757116319 | 0.005633023027015518 | 0.07817048492026045 |
| rs200003 | 50030379 | G | T | 0.48399 | 0.010569215614164573 | 0.0032291419740237445 | 0.0010638520681901973 |
| rs200004 | 50040506 | A | G | 0.37703 | 0.007036551378238654 | 0.0033297592321269802 | 0.034580976884336506 |
PROTA의 스크리닝 단계 단백질 연관성 요약.
보인자 선별 검사 데이터를 바탕으로 조상 집단별 보인자 빈도, 음성 판정 후 잔여 위험도, 배우자의 보인자 빈도 및 영향을 받은 태아의 위험도를 추정합니다.
잔여 위험도 추정은 유사유전자를 고려한 보인자 판정, 시조 하플로타입 통합, 조상 집단별 검사 보정, 그리고 검사받은 배우자 집단을 전체 배우자 명단에 맞춰 표준화하는 과정에 좌우됩니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| sample_id | collection | ancestry | family_history_tier |
| S_EUR_0001 | screening | EUR | 0 |
| S_EUR_0002 | screening | EUR | 0 |
| S_EUR_0003 | screening | EUR | 0 |
| S_EUR_0004 | screening | EUR | 0 |
| S_EUR_0005 | screening | EUR | 1 |
조상 계통과 선별 검사 관련 정보를 포함한 성인 대상자 명단.
단일세포 RNA 시퀀싱 데이터에서 주변 RNA와 기술적 오염을 제거한 후, 활성화된 단핵구 발현에 대한 유전자형 효과를 추정합니다.
주변 RNA는 표적 발현과 활성화 상태를 판별하는 마커 패널 모두에 영향을 미치므로, eQTL 모델을 적용하기 전에 반드시 이를 보정해야 합니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| cell_id | donor | total_umi | HBB | IFI6 | ISG15 | LST1 | CXCL10 |
| D01_C001 | D01 | 1113 | 7 | 3 | 4 | 83 | 5 |
| D01_C002 | D01 | 1103 | 6 | 3 | 3 | 112 | 10 |
| D01_C003 | D01 | 1141 | 9 | 8 | 12 | 63 | 9 |
| D01_C004 | D01 | 1250 | 7 | 60 | 43 | 2 | 17 |
| D01_C005 | D01 | 1045 | 9 | 1 | 2 | 51 | 15 |
마커 유전자, 오염 마커 및 표적 유전자의 세포별 UMI 카운트.
익명 처리된 역위 유사 좌위 내의 중첩 구조 서브하플로타입이 보정된 임상적 연관성과 신뢰할 수 있는 발현 근거를 갖는지 추정합니다.
중첩된 복제수 신호는 더 큰 역위 방향성의 영향을 받아 혼동될 수 있으므로, 복제수 보정, 발현 근거 평가, 임상 모델링은 서로 구분하여 수행해야 합니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| sample_id | case | age | age_band | sex | pc1 | pc2 | pc3 | ancestry_group | clinic_stratum | recruitment_stream |
| Q00012 | 1 | 50.45 | 50_64 | 0 | -1.01514 | -0.21032 | -0.08849 | EUR | tertiary | clinic |
| Q00028 | 0 | 57.39 | 50_64 | 0 | -1.25987 | -0.12498 | 0.2344 | EUR | regional | registry |
| Q00029 | 1 | 68.4 | 65_plus | 0 | 0.91598 | 0.62177 | 0.01891 | AFR | tertiary | clinic |
| Q00030 | 1 | 74.07 | 65_plus | 1 | 0.21125 | -0.59634 | -0.08197 | EAS | community | registry |
| Q00032 | 1 | 82.82 | 65_plus | 0 | -1.12034 | -0.24372 | 0.14665 | EUR | community | clinic |
전체 코호트의 임상 및 공변량 데이터.
예상 접촉 배경에서 낮은 매핑 가능성과 구조 변이 아티팩트를 제거한 후, 사례군과 대조군 간 특정 Hi-C 루프 강도의 차이를 정량화합니다.
대상 루프는 20kb 해상도로 정의되어 있지만, 낮은 매핑 가능성을 보이는 접촉과 사례군에만 존재하는 구조 변이 스트라이프를 먼저 마스킹하지 않으면 예상 접촉 모델이 왜곡됩니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| bin_id | chrom | start | end | gc_content | mappability | re_sites |
| 0 | chr8 | 400000 | 420000 | 0.46199033821572594 | 0.9787574214704273 | 5 |
| 1 | chr8 | 420000 | 440000 | 0.5044124208534677 | 0.8901084943498397 | 5 |
| 2 | chr8 | 440000 | 460000 | 0.43218451584938194 | 0.9056879289326712 | 3 |
| 3 | chr8 | 460000 | 480000 | 0.4733197282681218 | 0.9376529840664789 | 3 |
| 4 | chr8 | 480000 | 500000 | 0.4444956062150748 | 0.8682565517981877 | 4 |
표적 해상도 빈 주석 정보.
시조 계통을 재구성한 후 표현형과의 연관성을 검정하여, 8개 시조 계통으로 구성된 재조합 집단에서 1번 염색체의 정량형질 좌위를 매핑합니다.
표시된 마커 데이터는 이대립유전자형이지만, 실제 생물학적 신호는 시조 계통에 있습니다. 따라서 타당한 분석을 위해서는 시조 계통을 재구성하고, 마커 방향성을 확인한 뒤, 배치와 정렬된 잡음 피크와 QTL을 구분해야 합니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| marker_id | chr | pos_cM |
| m2_065 | 2 | 59.762431265596575 |
| m2_103 | 2 | 94.52656615104739 |
| m2_107 | 2 | 98.18761427503033 |
| m2_079 | 2 | 72.20130244108847 |
| m1_054 | 1 | 49.907510212292195 |
마커 식별자, 염색체 및 유전 지도 위치.
상호 아티팩트와 염색체별 레이블 반전을 보정한 후, 위상 결정된 국소 조상 계통 구간으로부터 부모별 조상 계통 비율과 최근 혼합 시기를 추정합니다.
상호 구간 아티팩트, 염색체별 레이블 반전 또는 지도 분모를 잘못 처리하면 조상 계통 비율과 혼합 시기 모두 달라집니다.
모델에 제공된 프롬프트
모델에 제공된 파일
| chrom | hap | start_morgan | end_morgan | anc | posterior | low_complexity_frac |
| chr1 | h1 | 0.03 | 0.505 | A | 0.985 | 0.08 |
| chr1 | h1 | 0.505 | 0.535 | B | 0.62 | 0.92 |
| chr1 | h1 | 0.535 | 1.478849 | A | 0.985 | 0.08 |
| chr1 | h1 | 1.503727 | 1.852681 | B | 0.985 | 0.08 |
| chr1 | h1 | 1.852681 | 2.422373 | A | 0.985 | 0.08 |
좌표, 조상 계통 레이블, 사후확률 및 품질 관리 주석이 포함된 위상 결정된 국소 조상 계통 구간.
대립유전자 방향성, 방향성 오류, 유전적 부동 및 변화하는 집단 크기를 고려하여 고대 대립유전자 빈도 시계열 데이터로부터 두 반수체 좌위 중 어느 쪽이 더 강한 양성 선택을 받는지 추정합니다.
잡음이 포함된 고대 빈도 변화는 두 좌위를 동일한 파생 대립유전자 기준으로 맞추고 제공된 샘플 수준의 시퀀싱 오류 값을 직접 모델링하기 전까지는 서로 직접 비교할 수 없습니다.
모델에 제공된 파일
| generation | alt_reads | total_reads | seq_error | sample_year |
| 6 | 36 | 40 | 0.16 | -4500 |
| 12 | 34 | 45 | 0.16 | -4278 |
| 18 | 41 | 55 | 0.16 | -4056 |
| 24 | 38 | 70 | 0.16 | -3833 |
| 30 | 36 | 90 | 0.16 | -3611 |
좌위 A의 리드 수 시계열 데이터.