Siirry pääsisältöön
OpenAI

30. kesäkuuta 2026

TutkimusJulkaisu

Esittelyssä GeneBench-Pro

Tutkimustason vertailuarviointi, joka mittaa, miten tekoälyagentit selviytyvät monitulkintaisuudesta ja tekevät merkityksellisiä arvioita laskennallisessa biologiassa.

Ladataan...

Tieteellinen data tulee harvoin ohjeiden mukana. Tutkijoiden on päätettävä, kuvastaako havaittu kuvio biologisia ilmiöitä vai kohinaa, riittääkö aineisto tukemaan esitettyä kysymystä ja miten kunkin tuloksen tulisi muuttaa heidän seuraavia toimiaan. Tekoälyagentit kykenevät yhä paremmin suorittamaan monimutkaisia analyysejä, mutta varsinainen tieteellinen tutkimus ei perustu pelkästään tosiasioiden muistamiseen tai ennalta määritellyn työnkulun noudattamiseen, vaan myös tällaisten korkeamman tason arvioiden tekemiseen.

Tänään esittelemme GeneBench-Pron: haastavan tutkimustasoisen vertailuarvioinnin, jolla testataan, pystyvätkö mallit tekemään sellaista harkintaa vaativaa analyysiä, jota todellisen maailman laskennallinen biologia edellyttää. Se laajentaa GeneBenchiä(avautuu uudessa ikkunassa) kattamaan vaativampia ja realistisempia tehtäviä genomiikan, kvantitatiivisen biologian ja translationaalisen lääketieteen aloilta, kuvaten laskennallisen biologian tieteellisen tutkimuksen monimutkaisuutta, iteratiivista luonnetta ja monitulkintaisuutta. 

Toistaiseksi on tehty vain vähän vakuuttavia arvioita järjestelmätason harkintaa edellyttävistä ratkaisuista, jotka tekevät todellisen maailman laskennallisesta tutkimuksesta haastavaa. Näihin kuuluvat monitulkintaisuuden hallinta, oletusten uudelleenarviointi, oikean analyysipolun valitseminen sekä sen tunnistaminen, milloin tulos on valmis päätöksenteon pohjaksi. Koska näitä taitoja on vaikea formalisoida, niitä on myös vaikea arvioida täsmällisesti, samalla kun niihin liittyvät heikkoudet rajoittavat yhä enemmän tekoälyn kokonaissuorituskykyä.

Kaavio nimeltä ”Biologian vertailuarvokuilu”, jossa verrataan perinteisiä vertailuarvojen työnkulkuja kokonaisvaltaiseen tieteelliseen analyysiin ja esitetään lisävaiheet, kuten esikäsittely, mallinnus, diagnostiikka ja iteratiivinen hienosäätö, ennen tieteelliseen johtopäätökseen pääsemistä.

GeneBench-Pro on suunniteltu mittaamaan tarkasti näitä korkeamman tason kyvykkyyksiä. GeneBench-Prossa määrittelemme ”tutkimustajun” harkinnanvaraisten ratkaisujen ketjuiksi, jotka muovaavat analyysiä: mitä kysymyksiä data voi tukea, miten varhaisten diagnostisten tarkastelujen tulisi muuttaa mallia tai estimaattia ja milloin alkuperäistä suunnitelmaa on tarkistettava. Jokainen GeneBench-Pro-tehtävä antaa mallille realistisen ja sekavan tietoaineiston, lyhyen kokeellisen kontekstin sekä kohde-estimaatin, joka liittyy myöhemmän vaiheen päätökseen. Vastatakseen oikein mallin on tutkittava dataa, valittava sopiva analyyttinen lähestymistapa, käytävä läpi iteratiivinen kokeiluprosessi ja annettava lopullinen vastaus.

Aineiston rakentaminen

Biologiassa datan tuottamisen kustannukset (esim. genomin sekvensoinnissa) ovat laskeneet jyrkästi, ja jotkut tutkijat väittävät nyt(avautuu uudessa ikkunassa), että rajoittava tekijä ei enää ole näytteiden kerääminen vaan myöhemmän vaiheen laskenta ja analyysi. GeneBench-Pro on kehitetty arvioimaan edistystä kyseisen pullonkaulan ratkaisemisessa, ja se sisältää 129 kysymystä, jotka kattavat laajan kirjon laskennallisen biologian ympäristöjä ja menetelmiä.

Domain Atlas: 129 ongelmaa 10 verkkotunnuksessa ja 21 aliverkkotunnuksessa

Käytä nuolinäppäimiä siirtyäksesi vertailutehtävien välillä. Valitun ongelman tiedot näkyvät alla.

Napsauta yllä olevaa pistettä saadaksesi tietoa vertailuongelmasta.

Tämä atlas tarjoaa esimakua GeneBench-Pron laajuudesta. Tutustu tapaustutkimussivulla tarkemmin 10 edustavaan kysymykseen.

GeneBench-Pro on myös suunniteltu välttämään yleisiä vertailutestien epäonnistumisia. Monet pitkän aikavälin biologian vertailutestit rakentavat monivaiheisia kysymyksiä sekavien historiallisten aineistojen ympärille, jolloin analyysin läpi ei välttämättä ole yhtä ainoaa oikeaa etenemistapaa. Yksi agentti saattaa valita yhden perusteltavissa olevan raja-arvon, kun taas toinen saattaa valita erilaisen mutta yhtä lailla perusteltavissa olevan vaihtoehdon, mikä kuvastaa pikemminkin vertailutestin laatijan tekemiä mielivaltaisia valintoja kuin mitään perustavanlaatuisia eroja mallin suorituskyvyssä. Myös päinvastainen voi tapahtua: jos ongelma on numeerisesti liian epäherkkä, agentti voi tehdä analyysissa perustavanlaatuisia virheitä ja silti tuottaa hyväksytyn tuloksen.

Näiden vikatilanteiden välttämiseksi jokainen GeneBench-Pro-tehtävä rakennetaan synteettisesti: tunnemme koko kausaalirakenteen ja simuloimme suoraan dataa tuottavaa prosessia. Tämän ansiosta voimme säätää kunkin tehtävän monimutkaisuutta; varmistaa, että perustellut erot subjektiivisissa analyysivalinnoissa johtavat silti hyväksyttyihin numeerisiin tuloksiin; ja varmentaa (ablaatiotutkimusten avulla), että uskottavat mutta virheelliset analyysit eivät läpäise arviointia. Sen jälkeen auditoimme tehtäväluonnoksia yksityiskohtaisten jäljitysanalyysien avulla tarkistaaksemme, ettei niissä esiinny tietovuotoja tai tahattomia ratkaisupolkuja. Tämä antaa meille varmuutta siitä, että oikean vastauksen saaminen riippuu oikean analyyttisen etenemistavan valinnasta, ei oikotien hyödyntämisestä tai kirjoittajan mielivaltaisen mieltymyksen mukailemisesta.

Kaavio nimeltä ”GeneBench-Pro-ongelman rakentaminen ja validointi”, joka näyttää työnkulun suoritettavan tehtävän rakentamisesta tarkistuksen, luotettavuustarkistusten, agenttitestauksen, asiantuntija-arvioinnin, revisioinnin ja valmiin vertailuongelman läpi.

Lähetimme 82 kaikesta 129 GeneBench-Pro-kysymyksestä ulkopuolisille alan asiantuntijoille, kuten jatko-opiskelijoille, tutkijatohtoreille, alan tutkijoille ja professoreille. Arvioijat arvioivat kunkin ongelman realistisuutta; sitä, oliko tavoitevastaus tunnistettavissa; sekä sitä, olivatko menetelmät ja estimaattorit asianmukaisia. Palautetta hyödynnettiin ongelmien parantamisessa.

1 / 2
Arvioimani tehtävät olisivat olleet haastavia jatko-opiskelijalle ilman kokeneelta ohjaajalta saatua toistuvaa palautetta. Aineistossa oli teknisiä ja laadunvalvontaan liittyviä ongelmia, joiden onnistunut käsittely edellytti harkittua ja reflektoivaa data-analyysiä sekä tietoisuutta mahdollisista sudenkuopista; kyse ei ollut vain jonkin valmiin menetelmän soveltamisesta puhtaaseen ja hyvin kuratoituun aineistoon.
Alexander Strudwick Young, ihmisgenetiikan apulaisprofessori, UCLA

Arviointi ja arvostelu

Jokainen GeneBench-Pro-tehtävä on itsenäinen tieteellinen analyysi. Agentit saavat käyttöönsä eristetyn työtilan, jossa on lyhyt kehote, datatiedostoja ja tavanomainen bioinformatiikan ohjelmistopino, mukaan lukien Python, tieteellisen laskennan kirjastot ja perustason genomiikkapaketit, kuten PLINK 2.0 (vaikka tehtävät eivät edellytä alakohtaisten työkalujen käyttöä).

Rakennevarianttien ohjaaman kasvainterapian hyöty-riskipäätös

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

Koska hallitsemme koko datan generointiprosessia, voimme arvioida oikeellisuutta deterministisesti suhteessa tunnettuihin tavoitearvoihin ja välttää mallin valinnan vaihtelun sekä monisanaisuuden vaikutukset, joita esiintyy tavanomaisessa arviointikriteeristöön perustuvassa arvioinnissa.

Kunkin tehtävän mukana toimitetaan myös monipuoliset metatiedot, joihin sisältyvät suunniteltu analyysirakenne, liitetyt datatiedostot, yksityiskohtainen monisivuinen tapaustutkimus ja asiantuntija-arvioinnin tulokset. Avaamme 10 edustavaa GeneBench-Pro-kysymystä kokonaan avoimeksi lähdekoodiksi Hugging Facessa(avautuu uudessa ikkunassa), ja tarjoamme niiden selaamiseen interaktiivisen verkkokäyttöliittymän. Lopuksi toimitamme 50 kysymyksen osajoukon Artificial Analysisille(avautuu uudessa ikkunassa) riippumatonta kolmannen osapuolen vertailuarviointia varten lähitulevaisuudessa.

Tulokset

Vahvin mallimme, GPT‑5.6 Sol, saavuttaa 28,7 %:n läpäisyasteen korkeimmalla päättelytasolla (31,5 %, kun Pro-tila on käytössä). Se on jyrkkä nousu verrattuna aikaan, jolloin aloimme rakentaa alkuperäistä GeneBenchiä; tuolloin paras edistynyt mallimme, GPT‑5, sai tulokseksi alle 5 %. Edistyminen tässä vertailuarvioinnissa viittaa siihen, että edistyneet mallit kehittyvät nopeasti, jopa vähemmän konkreettisessa järjestelmätason tieteellisessä päättelyssä. Nykyisellä tahdilla tämä vertailutesti voi saavuttaa kyllästymispisteen vuoden loppuun mennessä.

Tulokset osoittavat myös testiajan laskentatehon skaalaamisen vaikutuksen. Alimmalla päättelytasolla GPT‑5.6 Sol saavuttaa vain yksinumeroisen läpäisyasteen. Korkeimmalla päättelytasolla GPT‑5.6 Sol ratkaisee lähes kuusi kertaa enemmän kysymyksiä kuin GPT‑5.2, vaikka se käyttää vain noin kaksi kolmasosaa tokenien määrästä.

Eri malliperheiden väliset vertailut viittaavat siihen, että GPT‑mallit ovat vahvimpien järjestelmien joukossa korkean tason tieteellisessä päättelyssä kvantitatiivisen epävarmuuden olosuhteissa. Suorituskykyero GPT‑5.6:n, GPT‑5.5:n ja johtavien avoimen lähdekoodin mallien, kuten GLM 5.2:n, välillä on huomattavasti suurempi kuin voisimme odottaa koodaustesteistä(avautuu uudessa ikkunassa) ekstrapoloimalla, mikä viittaa siihen, että avoimen lähdekoodin mallit ovat erikoistuneet enemmän koodaukseen kuin laajempaan päättelykykyyn.

Käytimme kehityksen aikana edistyneitä GPT‑malleja tehtävien arviointiin ja vahvistamiseen. Siksi epäilimme, että GeneBench-Pro saattaa vääristää tuloksia GPT‑mallien haitaksi suhteessa muihin malliperheisiin. Kilpailevien mallien suorituskyky vastasi kuitenkin parhaimmillaankin vastaavaa GPT‑mallia julkaisuhetkellä, ja ne jäivät yleensä huomattavasti jälkeen.

Nämä arviointitulokset – jopa 31,5 % GPT‑5.6 Sol (Pro) -mallilla – ovat huomionarvoisia, kun otetaan huomioon GeneBench-Pro-kysymysten vaikeus. Kyselyssä arvioijamme arvioivat, että tyypillisen GeneBench-Pro-tehtävän suorittaminen veisi ihmisasiantuntijalta noin 20–40 tuntia. Varovaisen arvion mukaan 200 dollarin tuntihinnalla yhden ongelman ihmistyön kustannukset nousevat tuhansiin dollareihin. Nykyiset tekoälyagentit ovat vielä liian epäluotettavia korvaamaan ihmisasiantuntijoita, mutta kustannusero on suuri, sillä päättelykustannukset ovat vain muutamia dollareita ongelmaa kohden. Tämä tarkoittaa, että jopa osittainen automatisointi nykyisillä kyvykkyyksillä voisi luoda merkittävää taloudellista ja tieteellistä arvoa.

1 / 2
Vertailuarvoja motivoi monipuolinen kirjo biologisia kysymyksiä, mutta… varsinainen haaste tulee tutkivasta data-analyysistä ja näiden löydösten pohjalta tehtävästä päättelystä: kuvioiden ja artefaktien tunnistamisesta sekä sen päättämisestä, pitäisikö data sulkea pois vai korjata. Tämä muistuttaa todellisten biologisten tietoaineistojen sekavaa luonnetta. Näiden arviointien tarkastelu korostaa, kuinka tärkeitä selkeät ratkaisijan sopimukset ovat agenttipohjaisessa tieteellisessä ongelmanratkaisussa. Kehotteen erilainen sanamuoto tai tehtävän määrittely voi vaikuttaa merkittävästi siihen, mitkä analyysit näyttävät sallittavilta.
Cyrillus Tan, tutkijatohtori, New York Genome Center

Silti se, että edistyneet mallit ratkaisevat edelleen alle kolmanneksen näistä ongelmista, osoittaa, että parantamisen varaa on huomattavasti. Mallit voivat edistyä osittain haastavien ongelmien ratkaisemisessa, mutta niillä on vaikeuksia saada päättelyketju päätökseen. Tämä epäonnistumismalli kuvastaa ihmisasiantuntijoiden ja -aloittelijoiden välistä eroa. Asiantuntijat hyödyntävät kokemustaan ongelman jäsentämiseen ja lähestymistapansa mukauttamiseen, kun taas aloittelijat tekevät havaintoja mutta heidän on vaikea liittää niitä ongelman laajempaan kontekstiin.

Ongelma: Farmakogenominen vasteaika tapahtumaan ajassa vaihtelevalla hoidolla

Hoidon aloitus, genotyyppikohtainen vaste, viivästynyt farmakodynamiikka, vallitsevan käyttäjän merkinnät ja pitkittäiset biomarkkerit määrittävät yhdessä syy-seuraussuhteen eloonjäämisarvion.

GPT-5.5-kuvio

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

GPT-5.6 Sol -kuvio

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

Lähes täydellisen suorituskyvyn saavuttaminen edellyttää arviointeja, jotka sekä mittaavat edistymistä luotettavasti että tunnistavat, missä mallit edelleen epäonnistuvat. GeneBench-Pron kaltaiset vertailutestit voivat auttaa muuttamaan epämääräisen kyvykkyyspuutteen asiaksi, jonka voimme diagnosoida ja jota voimme parantaa. 

Jos agentit pystyvät automatisoimaan tämäntyyppisen analyysin luotettavasti, ne voisivat merkittävästi nopeuttaa tieteellistä löytöä. Ihmisgenetiikkaan perustuva näyttö on jo keskeisessä asemassa tavoitteiden priorisoinnissa ja translationaalisessa jatkotutkimuksessa, koska geneettisesti tuetut mekanismit johtavat paljon todennäköisemmin hyväksyttyihin hoitoihin.

Samaan aikaan sekvensoinnin kustannukset ovat romahtaneet, ja biopankkimittakaavan tietoaineistot yhdistävät nykyään molekyyli-, fenotyyppi- ja terveystietuetiedot ennennäkemättömän laajasti. Rajoittava tekijä on siirtymässä datan tuottamisesta tiedon muuttamiseen käytännön toimiksi. Mallit, jotka pystyvät luotettavasti suorittamaan analyysejä, joita nykyisin hoitavat ihmisasiantuntijoista koostuvat tiimit, voisivat muuttaa teollista tutkimusta nopeuttamalla hypoteesien priorisointia, kohteiden jatkoselvitystä sekä datan tuottamisen ja päätöksenteon välistä iterointisykliä.

GeneBench-Pro on alustava yritys arvioida abstraktimpia taitoja, jotka liittyvät kokeneiden asiantuntijoiden hyvään tieteelliseen arvostelukykyyn. Näiden taitojen avulla he pystyvät intuitiivisesti havaitsemaan ja tunnistamaan lupaavimmat alustavat analyysit; iteroimaan ja tarkistamaan ajatteluaan, kun tiedot ovat ristiriidassa alkuperäisten oletusten kanssa; ja päätymään johtopäätöksiin, joista myöhemmät kliiniset, akateemiset tai liiketoiminnalliset päätökset voivat riippua. 

Ennakoimme, että mallien suorituskyvyn kehittyessä sellaisten suorituskykytestien hyödyllisyys korostuu, jotka mittaavat kykyjä näillä korkeammilla abstraktiotasoilla – sen sijaan, että testattaisiin vain pelkkää kirjatietoa tai kykyä suorittaa rutiinianalyysejä.

Tekijä

OpenAI