Passer au contenu principal
OpenAI

30 juin 2026

Dans Genebench-Pro

Analyse approfondie du benchmark, de ses questions et des documents d’accompagnement.

Études de cas

Ces 10 études de cas présentent des questions représentatives issues de GeneBench-Pro. Chaque étude de cas comprend le prompt d’origine, les jeux de données et les supports complémentaires. Pour obtenir un aperçu du benchmark et de ses principaux enseignements, consultez le article d’annonce.

Remarque : les aperçus de fichiers affichent des extraits des jeux de données complets.


Étude de cas 1

Oncologie somatique  : décision bénéfice-risque concernant un traitement anti-cancer guidée par les variants structuraux

Estimez si un inhibiteur synthétique dirigé contre TXR1 présente une utilité clinique positive dans des tumeurs dont l’activation de la cible est due à un variant structural. Les étiquettes TXR1, TXR1i, DLR1 et star-allele sont des étiquettes synthétiques de référence. 

Le sous-groupe cible doit être retrouvé à partir de données probantes issues du séquençage à lectures longues, de l’expression, de la qualité tumorale et de la pharmacogénomique avant que le bénéfice et la toxicité puissent être interprétés comme une décision thérapeutique.

Prompt publié affiché au modèle

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

Fichiers fournis au modèle

id_patientjeu_analyseagesexesiteperiode_calendaireecogcharge_tumoralelignes_anterieuresresistance_anterieureclasse_ligneeclasse_therapieevalue16benefice16arret_tox_8semjour_temps_zero
MTB0001173.8MS1P220.78731ATXR1i010
MTB0002155.2MS3P112.63701ATXR1i1000
MTB0003168.8FS4P200.89121ATXR1i1110
MTB0004182.8FS2P224.10100BTXR1i1000
MTB0005165.5FS1P317.011ATXR1i1000

Covariables du registre, traitement, évaluation à la semaine 16, bénéfice et toxicité précoce.


Étude de cas 2

Génomique fonctionnelle  : validation de cible CRISPR  : transcrit d’ARNlnc ou locus génomique ?

Déterminez si une dépendance apparente à un lncRNA est spécifique du transcrit ou due à des effets de locus à proximité et de gènes voisins.

Les éléments probants axés sur les transcrits doivent rester robustes après application de contrôles portant sur la perturbation locale du locus d’ADN, la répression des gènes voisins, les échanges de guides, la toxicité liée au GC et les effets de plaque.

Prompt publié affiché au modèle

You are given pooled CRISPRi screening data, guide-level local expression measurements, transcript-targeting CasRx follow-up data, and single-guide follow-up growth measurements for a nominated lncRNA program (LINC473) and a nearby coding gene (KIN1). The identifiers LINC473, KIN1, and ANKRD42 are synthetic benchmark labels; any resemblance to real human genes is coincidental.

Estimate the requested quantities.

Definitions:

  • lncrna_specific_lfc: the pooled-screen matched-control day-10 log2 growth effect expected at 100% effective knockdown of the dominant LINC473 transcript, not local DNA-locus effects.
  • neighbor_mediated_lfc: the pooled-screen matched-control day-10 log2 growth effect expected at 100% KIN1 repression in the local LINC473-locus model after accounting for concomitant LINC473 transcript knockdown.
  • advance_target: 1 if the evidence supports advancing LINC473 as a transcript-directed target, else 0.

Conventions:

  • all growth effects are log2(day10/day0) competitive-growth effects relative to matched controls;
  • more negative numbers indicate stronger loss of fitness;
  • set advance_target to 1 only if lncrna_specific_lfc <= -0.08 and neighbor_mediated_lfc > -0.25; otherwise 0.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"advance_target": <int>,
4
"lncrna_specific_lfc": <float>,
5
"neighbor_mediated_lfc": <float>
6
},
7
"reasoning": "<description of method and QC>"
8
}

Fichiers fournis au modèle

guide_idnominal_targetchrcoordstranddist_lnc_tss_bpdist_neighbor_tss_bpguide_gc_frac
g001LINC473chr7100014+14300.624
g002LINC473chr7100035-43670.584
g003LINC473chr7100051+116560.622
g004LINC473chr7100066-59660.617
g005LINC473chr7100088+74770.715

Coordonnées, cibles, distances et fonctionnalités GC


Étude de cas 3

Génétique statistique : priorisation des cibles médicamenteuses protéiques dans un locus génétique lié

Estimez les effets directs de deux protéines voisines sur la maladie à l’aide de la randomisation mendélienne multivariable cis (cis-MVMR), tout en tenant compte de l’échelle des dosages, de l’orientation allélique, du biais du gagnant, du déséquilibre de liaison (LD) et de la pléiotropie locale résiduelle.

Les deux protéines partagent un locus corrélé. L’analyse doit passer des associations marginales aux effets conditionnels de la maladie tenant compte du déséquilibre de liaison (LD), sur une échelle protéique commune.

Prompt publié affiché au modèle

You are given association summary statistics and metadata for two nearby proteins (PROTA and PROTB), a binary disease outcome, a locus correlation reference, and protein measurement records.

Goal: estimate the direct log-odds effect of each protein on the disease outcome per +1 SD increase in log10 concentration, conditional on the other protein.

Interpretation: theta_PROTA and theta_PROTB use the same log-odds per-SD scale defined in the goal.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"theta_PROTA": <float>,
4
"theta_PROTB": <float>
5
},
6
"reasoning": "<description of method and QC>"
7
}

Fichiers fournis au modèle

snppos_bpeffect_alleleother_allelemafbetasepval
rs20000050000000AC0.422150.0064386683107068080.0032673300912034120.04876727714241972
rs20000150010126AC0.057090.0110089933375813010.0069552392087504070.11345916603941006
rs20000250020253GT0.090210.0099220147571163190.0056330230270155180.07817048492026045
rs20000350030379GT0.483990.0105692156141645730.00322914197402374450.0010638520681901973
rs20000450040506AG0.377030.0070365513782386540.00332975923212698020.034580976884336506

Synthèses des associations protéiques en phase de criblage pour PROTA.


Étude de cas 4

Génomique clinique / dépistage des porteurs : risque résiduel du dépistage des porteurs de DRX1 après calibration des CNV et des pseudogènes

Estimer les fréquences de porteurs spécifiques à chaque ascendance, le risque résiduel après un dépistage négatif, la fréquence de porteurs chez les partenaires, ainsi que le risque pour le conceptus affecté, à partir des données issues du test de dépistage des porteurs.

L’estimation du risque résiduel dépend des déterminations du statut de porteur tenant compte des pseudogènes, du regroupement des haplotypes fondateurs, de l’étalonnage du test propre à l’ascendance et de la standardisation des partenaires testés par rapport à la liste complète des partenaires.

Prompt publié affiché au modèle

Using cohort_roster.tsv.gz, partner_roster.tsv.gz, calibration_controls.tsv.gz, target_metadata.tsv.gz, and assay_observations.tsv.gz, estimate residual reproductive risk for an autosomal recessive DRX1 condition. Report all quantities on the probability scale, not as percentages: carrier_frequency_afr and carrier_frequency_eur among screening-roster adults; residual_carrier_risk_afr_negative for an AFR screening-roster adult with a negative DRX1 screen; partner_carrier_frequency_full_roster for a uniformly sampled partner_roster.tsv.gz row; and couple_reproductive_risk for an affected conceptus when the index person is AFR and screen-negative and the partner is drawn from partner_roster.tsv.gz. Assume autosomal recessive inheritance with a 1/4 affected-conceptus risk conditional on both biological parents being carriers. 

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"carrier_frequency_afr": <float>,
4
"carrier_frequency_eur": <float>,
5
"residual_carrier_risk_afr_negative": <float>,
6
"partner_carrier_frequency_full_roster": <float>,
7
"couple_reproductive_risk": <float>
8
},
9
"reasoning": "<description of method and QC>"
10
}

Fichiers fournis au modèle

id_échantilloncollectionascendanceniveau_antécédents_familiaux
S_EUR_0001dépistageEUR0
S_EUR_0002dépistageEUR0
S_EUR_0003dépistageEUR0
S_EUR_0004dépistageEUR0
S_EUR_0005dépistageEUR1

Adultes du registre de dépistage : ascendance et contexte de dépistage


Étude de cas 5

Génomique unicellulaire : eQTL des monocytes activés après correction de l’ARN ambiant

Estimer l’effet du génotype sur l’expression des monocytes activés après suppression de l’ARN ambiant et de la contamination technique des données de RNA-seq unicellulaire.

L’ARN ambiant affecte à la fois l’expression cible et le panel de marqueurs utilisé pour déterminer l’état d’activation ; la correction doit donc être effectuée avant d’appliquer le modèle eQTL.

Prompt publié affiché au modèle

Estimate the per-allele log rate ratio for CXCL10 expression in the activated monocyte subpopulation from the provided single-cell RNA-seq data. 

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"beta_activated": <float>
4
},
5
"reasoning": "<description of method and QC>"
6
}

Fichiers fournis au modèle

cell_iddonortotal_umiHBBIFI6ISG15LST1CXCL10
D01_C001D011113734835
D01_C002D01110363311210
D01_C003D0111419812639
D01_C004D01125076043217
D01_C005D0110459125115

Nombre d’UMI par cellule pour les gènes marqueurs, les marqueurs de contamination et le gène cible.


Étude de cas 6

Génétique structurale : variant structurel imbriqué : données d’expression à l’appui et association clinique

Estimer si un sous-haplotype structural imbriqué au sein d’un locus anonyme de type inversion présente une association clinique calibrée et un soutien crédible au niveau de l’expression.

Un signal imbriqué de dosage en nombre de copies peut être sujet à un facteur de confusion lié à l’orientation de l’inversion englobante ; l’étalonnage du dosage, les éléments d’appui issus de l’expression et la modélisation clinique doivent donc rester distincts.

Prompt publié affiché au modèle

Analyze the released files for anonymous Locus Q. Estimate the full-cohort source-population clinical association and molecular expression support for the calibrated nested segment-B structural copy dosage, separating the nested segment-B dosage from the broader outer-orientation dosage. Report subhap_log_or as the natural-log source-population total-effect odds ratio for case status per additional calibrated segment-B copy. Report expression_log_fc as the natural-log expression fold-change per calibrated segment-B copy for the expression-supported gene. Report target_support_code as 1 if the supported gene has a positive expression_log_fc and the clinical association is protective (subhap_log_or < 0), otherwise 0. Report n_calibrated_carriers as the number of reliable breakpoint-panel samples carrying at least one segment-B copy. 

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"n_calibrated_carriers": <int>,
4
"target_support_code": <int>,
5
"expression_log_fc": <float>,
6
"subhap_log_or": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

Fichiers fournis au modèle

id_échantilloncasagetranche_agesexepc1pc2pc3groupe_ascendancestrate_cliniquefilière_recrutement
Q00012150.4550_640-1.01514-0.21032-0.08849EURtertiaireclinique
Q00028057.3950_640-1.25987-0.124980.2344EURrégionalregistre
Q00029168.465_plus00.915980.621770.01891AFRtertiaireclinique
Q00030174.0765_plus10.21125-0.59634-0.08197EAScommunautéregistre
Q00032182.8265_plus0-1.12034-0.243720.14665EURcommunautéclinique

Données cliniques et de covariables pour l’ensemble de la cohorte.


Étude de cas 7

Génomique régulatrice : mesure de la force des boucles de chromatine après masquage des variants structuraux et des artefacts de cartographie

Quantifier une différence focale de la force de boucle Hi-C entre cas et témoins après avoir supprimé du fond de contacts attendus les artefacts liés à une faible mappabilité et aux variants structuraux.

La boucle cible est définie à une résolution de 20 Kb, mais le modèle de contacts attendus est faussé à moins que les contacts à faible mappabilité et une bande SV spécifique aux cas ne soient d’abord masqués.

Prompt publié affiché au modèle

You are given Hi-C contact matrices at 20 kb and 40 kb resolution plus bin annotations. Estimate the loop enrichment at the 20 kb interaction between `bin_id = 8` and `bin_id = 17` in `bins_20kb.tsv.gz`. Report three quantities: `case_loop_strength` (mean log2(observed/expected) across case replicates), `control_loop_strength` (mean log2(observed/expected) across control replicates), and `delta_loop_strength` (case minus control).

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"case_loop_strength": <float>,
4
"control_loop_strength": <float>,
5
"delta_loop_strength": <float>
6
},
7
"reasoning": "<description of method and QC>"
8
}

Fichiers fournis au modèle

bin_idchromstartendgc_contentmappabilityre_sites
0chr84000004200000.461990338215725940.97875742147042735
1chr84200004400000.50441242085346770.89010849434983975
2chr84400004600000.432184515849381940.90568792893267123
3chr84600004800000.47331972826812180.93765298406647893
4chr84800005000000.44449560621507480.86825655179818774

Annotations des intervalles à la résolution cible


Étude de cas 8

Génétique statistique : cartographie de QTL multiparentale avec reconstruction des haplotypes fondateurs

Cartographier un locus de caractère quantitatif sur le chromosome 1 dans une population recombinante issue de huit fondateurs en reconstituant l’ascendance des fondateurs avant de tester l’association avec le phénotype.

Les données de marqueurs visibles sont bialléliques, mais le signal biologique correspond à l’ascendance des fondateurs. Une analyse justifiable doit donc reconstruire l’état des fondateurs, vérifier l’orientation des marqueurs, et distinguer le QTL d’un pic parasite aligné sur les lots.

Prompt publié affiché au modèle

Map the chromosome 1 QTL in an 8-founder multi-parent population. Report the position (cM) and which founder carries the high-effect allele.

Report high_founder as "F1".."F8".

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"high_founder": "<string>",
4
"qtl_pos_cM": <float>
5
},
6
"reasoning": "<description of method and QC>"
7
}

Data files:

  • markers.tsv.gz: marker metadata
  • founders.tsv.gz: founder alleles at each marker
  • ril_genotypes.npz: observed RIL genotypes (biallelic)
  • phenotypes.tsv.gz: phenotype and covariates

Fichiers fournis au modèle

marker_idchrpos_cM
m2_065259.762431265596575
m2_103294.52656615104739
m2_107298.18761427503033
m2_079272.20130244108847
m1_054149.907510212292195

Identifiants de marqueurs, chromosomes et positions sur la carte génétique.


Étude de cas 9

Génétique des populations : ascendance spécifique à chaque parent et moment du métissage récent

Inférer les proportions d’ascendance spécifiques à chaque parent et la datation du mélange génétique récent à partir de segments d’ascendance locale phasés, après correction des artefacts réciproques et d’une inversion d’étiquettes spécifique à un chromosome.

Les fractions d’ascendance et les temps d’impulsion changent tous deux si les artefacts de segments réciproques, l’inversion des étiquettes locales des chromosomes ou les dénominateurs des cartes sont mal traités.

Prompt publié affiché au modèle

You are given phased local-ancestry tracts for one admixed individual. Estimate, for each transmitted parental haplotype, the fraction of ancestry A across the called tract span and the number of generations since a single recent admixture pulse. Label parent1 as the haplotype with the smaller ancestry-A fraction and parent2 as the haplotype with the larger ancestry-A fraction. 

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"parent1_A_fraction": <float>,
4
"parent1_t": <float>,
5
"parent2_A_fraction": <float>,
6
"parent2_t": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

Fichiers fournis au modèle

chromhapstart_morganend_morganancposteriorlow_complexity_frac
chr1h10.030.505A0.9850.08
chr1h10.5050.535B0.620.92
chr1h10.5351.478849A0.9850.08
chr1h11.5037271.852681B0.9850.08
chr1h11.8526812.422373A0.9850.08

Segments d’ascendance locale phasés avec coordonnées, étiquettes d’ascendance, valeurs a posteriori et annotations de contrôle qualité (QC).


Étude de cas 10

Génétique des populations  : estimation de la sélection à partir de séries temporelles bruitées d’ADN ancien

Inférer lequel de deux loci haploïdes est soumis à une sélection positive plus forte à partir de séries temporelles de fréquences alléliques anciennes, tout en tenant compte de l’orientation des allèles, de l’erreur directionnelle, de la dérive et des variations de la taille de la population.

Les trajectoires anciennes bruitées ne sont pas directement comparables tant que les deux loci ne sont pas placés sur la même échelle d’allèles dérivés et que les valeurs d’erreur de séquençage fournies au niveau des échantillons ne sont pas modélisées directement.

You are given allele-frequency time series data from two haploid loci sampled over multiple generations.

One locus is under stronger positive selection than the other. Estimate the selection coefficient s for the more strongly selected locus, where s > 0 means the derived allele is favored.

Assume instrument-driven sequencing error is ~1%. The seq_error column is the average of the two directional allele-miscall rates for that locus and sample.

The selected_locus value must be "A" or "B".

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"selected_locus": "<string>",
4
"s": <float>
5
},
6
"reasoning": "<description of method and QC>"
7
}

Fichiers fournis au modèle

générationlectures alternativeslectures totaleserreur de séquenceannée échantillon
636400.16-4500
1234450.16-4278
1841550.16-4056
2438700.16-3833
3036900.16-3611

Série temporelle du nombre de lectures pour le locus A.