Dans Genebench-Pro
Analyse approfondie du benchmark, de ses questions et des documents d’accompagnement.
Ces 10 études de cas présentent des questions représentatives issues de GeneBench-Pro. Chaque étude de cas comprend le prompt d’origine, les jeux de données et les supports complémentaires. Pour obtenir un aperçu du benchmark et de ses principaux enseignements, consultez le article d’annonce.
Remarque : les aperçus de fichiers affichent des extraits des jeux de données complets.
Estimez si un inhibiteur synthétique dirigé contre TXR1 présente une utilité clinique positive dans des tumeurs dont l’activation de la cible est due à un variant structural. Les étiquettes TXR1, TXR1i, DLR1 et star-allele sont des étiquettes synthétiques de référence.
Le sous-groupe cible doit être retrouvé à partir de données probantes issues du séquençage à lectures longues, de l’expression, de la qualité tumorale et de la pharmacogénomique avant que le bénéfice et la toxicité puissent être interprétés comme une décision thérapeutique.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| id_patient | jeu_analyse | age | sexe | site | periode_calendaire | ecog | charge_tumorale | lignes_anterieures | resistance_anterieure | classe_lignee | classe_therapie | evalue16 | benefice16 | arret_tox_8sem | jour_temps_zero |
| MTB0001 | 1 | 73.8 | M | S1 | P2 | 2 | 0.787 | 3 | 1 | A | TXR1i | 0 | 1 | 0 | |
| MTB0002 | 1 | 55.2 | M | S3 | P1 | 1 | 2.637 | 0 | 1 | A | TXR1i | 1 | 0 | 0 | 0 |
| MTB0003 | 1 | 68.8 | F | S4 | P2 | 0 | 0.891 | 2 | 1 | A | TXR1i | 1 | 1 | 1 | 0 |
| MTB0004 | 1 | 82.8 | F | S2 | P2 | 2 | 4.101 | 0 | 0 | B | TXR1i | 1 | 0 | 0 | 0 |
| MTB0005 | 1 | 65.5 | F | S1 | P3 | 1 | 7.0 | 1 | 1 | A | TXR1i | 1 | 0 | 0 | 0 |
Covariables du registre, traitement, évaluation à la semaine 16, bénéfice et toxicité précoce.
Déterminez si une dépendance apparente à un lncRNA est spécifique du transcrit ou due à des effets de locus à proximité et de gènes voisins.
Les éléments probants axés sur les transcrits doivent rester robustes après application de contrôles portant sur la perturbation locale du locus d’ADN, la répression des gènes voisins, les échanges de guides, la toxicité liée au GC et les effets de plaque.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| guide_id | nominal_target | chr | coord | strand | dist_lnc_tss_bp | dist_neighbor_tss_bp | guide_gc_frac |
| g001 | LINC473 | chr7 | 100014 | + | 14 | 30 | 0.624 |
| g002 | LINC473 | chr7 | 100035 | - | 43 | 67 | 0.584 |
| g003 | LINC473 | chr7 | 100051 | + | 116 | 56 | 0.622 |
| g004 | LINC473 | chr7 | 100066 | - | 59 | 66 | 0.617 |
| g005 | LINC473 | chr7 | 100088 | + | 74 | 77 | 0.715 |
Coordonnées, cibles, distances et fonctionnalités GC
Estimez les effets directs de deux protéines voisines sur la maladie à l’aide de la randomisation mendélienne multivariable cis (cis-MVMR), tout en tenant compte de l’échelle des dosages, de l’orientation allélique, du biais du gagnant, du déséquilibre de liaison (LD) et de la pléiotropie locale résiduelle.
Les deux protéines partagent un locus corrélé. L’analyse doit passer des associations marginales aux effets conditionnels de la maladie tenant compte du déséquilibre de liaison (LD), sur une échelle protéique commune.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| snp | pos_bp | effect_allele | other_allele | maf | beta | se | pval |
| rs200000 | 50000000 | A | C | 0.42215 | 0.006438668310706808 | 0.003267330091203412 | 0.04876727714241972 |
| rs200001 | 50010126 | A | C | 0.05709 | 0.011008993337581301 | 0.006955239208750407 | 0.11345916603941006 |
| rs200002 | 50020253 | G | T | 0.09021 | 0.009922014757116319 | 0.005633023027015518 | 0.07817048492026045 |
| rs200003 | 50030379 | G | T | 0.48399 | 0.010569215614164573 | 0.0032291419740237445 | 0.0010638520681901973 |
| rs200004 | 50040506 | A | G | 0.37703 | 0.007036551378238654 | 0.0033297592321269802 | 0.034580976884336506 |
Synthèses des associations protéiques en phase de criblage pour PROTA.
Estimer les fréquences de porteurs spécifiques à chaque ascendance, le risque résiduel après un dépistage négatif, la fréquence de porteurs chez les partenaires, ainsi que le risque pour le conceptus affecté, à partir des données issues du test de dépistage des porteurs.
L’estimation du risque résiduel dépend des déterminations du statut de porteur tenant compte des pseudogènes, du regroupement des haplotypes fondateurs, de l’étalonnage du test propre à l’ascendance et de la standardisation des partenaires testés par rapport à la liste complète des partenaires.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| id_échantillon | collection | ascendance | niveau_antécédents_familiaux |
| S_EUR_0001 | dépistage | EUR | 0 |
| S_EUR_0002 | dépistage | EUR | 0 |
| S_EUR_0003 | dépistage | EUR | 0 |
| S_EUR_0004 | dépistage | EUR | 0 |
| S_EUR_0005 | dépistage | EUR | 1 |
Adultes du registre de dépistage : ascendance et contexte de dépistage
Estimer l’effet du génotype sur l’expression des monocytes activés après suppression de l’ARN ambiant et de la contamination technique des données de RNA-seq unicellulaire.
L’ARN ambiant affecte à la fois l’expression cible et le panel de marqueurs utilisé pour déterminer l’état d’activation ; la correction doit donc être effectuée avant d’appliquer le modèle eQTL.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| cell_id | donor | total_umi | HBB | IFI6 | ISG15 | LST1 | CXCL10 |
| D01_C001 | D01 | 1113 | 7 | 3 | 4 | 83 | 5 |
| D01_C002 | D01 | 1103 | 6 | 3 | 3 | 112 | 10 |
| D01_C003 | D01 | 1141 | 9 | 8 | 12 | 63 | 9 |
| D01_C004 | D01 | 1250 | 7 | 60 | 43 | 2 | 17 |
| D01_C005 | D01 | 1045 | 9 | 1 | 2 | 51 | 15 |
Nombre d’UMI par cellule pour les gènes marqueurs, les marqueurs de contamination et le gène cible.
Estimer si un sous-haplotype structural imbriqué au sein d’un locus anonyme de type inversion présente une association clinique calibrée et un soutien crédible au niveau de l’expression.
Un signal imbriqué de dosage en nombre de copies peut être sujet à un facteur de confusion lié à l’orientation de l’inversion englobante ; l’étalonnage du dosage, les éléments d’appui issus de l’expression et la modélisation clinique doivent donc rester distincts.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| id_échantillon | cas | age | tranche_age | sexe | pc1 | pc2 | pc3 | groupe_ascendance | strate_clinique | filière_recrutement |
| Q00012 | 1 | 50.45 | 50_64 | 0 | -1.01514 | -0.21032 | -0.08849 | EUR | tertiaire | clinique |
| Q00028 | 0 | 57.39 | 50_64 | 0 | -1.25987 | -0.12498 | 0.2344 | EUR | régional | registre |
| Q00029 | 1 | 68.4 | 65_plus | 0 | 0.91598 | 0.62177 | 0.01891 | AFR | tertiaire | clinique |
| Q00030 | 1 | 74.07 | 65_plus | 1 | 0.21125 | -0.59634 | -0.08197 | EAS | communauté | registre |
| Q00032 | 1 | 82.82 | 65_plus | 0 | -1.12034 | -0.24372 | 0.14665 | EUR | communauté | clinique |
Données cliniques et de covariables pour l’ensemble de la cohorte.
Quantifier une différence focale de la force de boucle Hi-C entre cas et témoins après avoir supprimé du fond de contacts attendus les artefacts liés à une faible mappabilité et aux variants structuraux.
La boucle cible est définie à une résolution de 20 Kb, mais le modèle de contacts attendus est faussé à moins que les contacts à faible mappabilité et une bande SV spécifique aux cas ne soient d’abord masqués.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| bin_id | chrom | start | end | gc_content | mappability | re_sites |
| 0 | chr8 | 400000 | 420000 | 0.46199033821572594 | 0.9787574214704273 | 5 |
| 1 | chr8 | 420000 | 440000 | 0.5044124208534677 | 0.8901084943498397 | 5 |
| 2 | chr8 | 440000 | 460000 | 0.43218451584938194 | 0.9056879289326712 | 3 |
| 3 | chr8 | 460000 | 480000 | 0.4733197282681218 | 0.9376529840664789 | 3 |
| 4 | chr8 | 480000 | 500000 | 0.4444956062150748 | 0.8682565517981877 | 4 |
Annotations des intervalles à la résolution cible
Cartographier un locus de caractère quantitatif sur le chromosome 1 dans une population recombinante issue de huit fondateurs en reconstituant l’ascendance des fondateurs avant de tester l’association avec le phénotype.
Les données de marqueurs visibles sont bialléliques, mais le signal biologique correspond à l’ascendance des fondateurs. Une analyse justifiable doit donc reconstruire l’état des fondateurs, vérifier l’orientation des marqueurs, et distinguer le QTL d’un pic parasite aligné sur les lots.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| marker_id | chr | pos_cM |
| m2_065 | 2 | 59.762431265596575 |
| m2_103 | 2 | 94.52656615104739 |
| m2_107 | 2 | 98.18761427503033 |
| m2_079 | 2 | 72.20130244108847 |
| m1_054 | 1 | 49.907510212292195 |
Identifiants de marqueurs, chromosomes et positions sur la carte génétique.
Inférer les proportions d’ascendance spécifiques à chaque parent et la datation du mélange génétique récent à partir de segments d’ascendance locale phasés, après correction des artefacts réciproques et d’une inversion d’étiquettes spécifique à un chromosome.
Les fractions d’ascendance et les temps d’impulsion changent tous deux si les artefacts de segments réciproques, l’inversion des étiquettes locales des chromosomes ou les dénominateurs des cartes sont mal traités.
Prompt publié affiché au modèle
Fichiers fournis au modèle
| chrom | hap | start_morgan | end_morgan | anc | posterior | low_complexity_frac |
| chr1 | h1 | 0.03 | 0.505 | A | 0.985 | 0.08 |
| chr1 | h1 | 0.505 | 0.535 | B | 0.62 | 0.92 |
| chr1 | h1 | 0.535 | 1.478849 | A | 0.985 | 0.08 |
| chr1 | h1 | 1.503727 | 1.852681 | B | 0.985 | 0.08 |
| chr1 | h1 | 1.852681 | 2.422373 | A | 0.985 | 0.08 |
Segments d’ascendance locale phasés avec coordonnées, étiquettes d’ascendance, valeurs a posteriori et annotations de contrôle qualité (QC).
Inférer lequel de deux loci haploïdes est soumis à une sélection positive plus forte à partir de séries temporelles de fréquences alléliques anciennes, tout en tenant compte de l’orientation des allèles, de l’erreur directionnelle, de la dérive et des variations de la taille de la population.
Les trajectoires anciennes bruitées ne sont pas directement comparables tant que les deux loci ne sont pas placés sur la même échelle d’allèles dérivés et que les valeurs d’erreur de séquençage fournies au niveau des échantillons ne sont pas modélisées directement.
Fichiers fournis au modèle
| génération | lectures alternatives | lectures totales | erreur de séquence | année échantillon |
| 6 | 36 | 40 | 0.16 | -4500 |
| 12 | 34 | 45 | 0.16 | -4278 |
| 18 | 41 | 55 | 0.16 | -4056 |
| 24 | 38 | 70 | 0.16 | -3833 |
| 30 | 36 | 90 | 0.16 | -3611 |
Série temporelle du nombre de lectures pour le locus A.