Jäta vahele ja mine põhisisu juurde
OpenAI

17. juuni 2026

TeadustööVäljaanne

Tutvustame LifeSciBenchi

Ekspertide koostatud ja hinnatud võrdlustest, mis põhineb päris eluteaduste uurimistööl

Laadimine…

Agentse tehisintellekti süsteemid muutuvad teaduslike ülesannete täitmisel üha võimekamaks. Nende kasulikkus eluteaduste teadlastele sõltub aga sellest, kui hästi nad tulevad toime päris teadustöö keerukusega. See töö meenutab harva üksikut faktide meenutamise küsimust või puhast ennustusprobleemi. Teadlased tõlgendavad puudulikke tõendeid, lepitavad vastuolulisi tulemusi, kavandavad keerukaid katseid, lahendavad analüüside probleeme, hindavad translatsiooniriski ja otsustavad määramatuse tingimustes, mida järgmiseks teha.

Praegused võrdlustestid ei hõlma neid võimeid täielikult. Paljud eluteaduste hindamised keskenduvad kitsastele valdkondadele või eraldiseisvatele oskustele, mistõttu küsimustel on struktureeritud vorming ja selged etalonvastused. Kuigi need on väärtuslikud, ei suuda need sageli päriselt hinnata, kas mudel saab panustada uurimistaseme töö laiemasse spektrisse.

Lõime LifeSciBenchi, et aidata seda lünka vähendada. Iga ülesanne põhineb praktiseerivate eluteadlaste hinnangul, kellel on doktoritaseme väljaõpe ja otsene kogemus ravimileidmise programmide edendamisel biotehnoloogia- ja farmaatsiakeskkondades.

LifeSciBench sisaldab 750 ekspertide koostatud ülesannet, mis hõlmavad seitset töövoogu ja seitset bioloogilist valdkonda.

1,062

Ülesande artefaktid

173

Teadlastest panustajad

19,020

Hindamisjuhendi kriteeriumid

453

Ekspertarvustajad

Mida LifeSciBench mõõdab

LifeSciBench mõõdab, kas AI süsteemid suudavad toetada realistlikke eluteaduste uurimisülesandeid, mitte üksnes vastata bioloogiaküsimustele. Võrdlustesti taksonoomia määratlemiseks küsitlesime praktiseerivaid eluteadlasi töövoogude kohta, mida nad rakendusuuringutes kõige sagedamini kasutavad. Seejärel rühmitasime nende vastused seitsmesse korduvasse kategooriasse: tõendite käsitlemine, analüüs, disain ja optimeerimine, teaduslik arutlus, valideerimine ja operatsioonid, siire ning teaduskommunikatsioon.

Iga ülesanne on üles ehitatud nagu palve, mille teadlane võiks esitada asjatundlikule koostööpartnerile: teaduslik viip, asjakohane kontekst või artefaktid ning vabas vormis vastus. Ekspertide kirjutatud hindamisjuhendid hindavad, kas mudel suudab konkreetsele probleemile anda õige vastuse teadlase ootustele vastava detailsuse, põhjenduse, reservatsioonide ja vorminguga.

Andmestiku koostamine

LifeSciBench hindab teaduslikku arutlust koos vähem täpselt määratletud praktiliste oskustega, mida on vaja teaduse kasutamiseks päriselus. Selle ülesanded paluvad mudelitel läbi töötada realistlikke uurimisprobleeme: tõlgendada tõendeid, teha valdkonnapõhiseid hinnanguid ja sõnastada järeldusi, mis oleksid ekspertarvustajatele kasulikud. Paljud ülesanded nõuavad mudelitelt ka määramatuse käsitlemist ja arutlemist toetavate andmefailide põhjal, mitte üksnes viiba tekstile toetumist.

Võrdlustest on loodud peegeldama eluteaduste töö keerukust. Kokku nõuab 79% ülesannetest mitut arutlus- või otsustusetappi, keskmiselt neli sammu ülesande kohta. LifeSciBench sisaldab 1062 lisatud artefakti, sealhulgas jooniseid, PDF-e, tabeleid, järjestusfaile, struktuuri- või keemiafaile ning veebiviiteid. Üle poole ülesannetest (53%) nõuab mudelitelt vähemalt ühest artefaktist pärineva teabe tõlgendamist või sünteesimist.

Ülesanded lõid 173 ekspertteadlast eri eluteaduste erialadelt. Igal teadlasel oli doktoritaseme väljaõpe ning biotehnoloogia- või farmaatsiatööstuse kogemus. Ülesanded võisid enne vastuvõtmist läbida nii palju parandusringe kui vaja, ilma kindla ringide ülempiirita; vastuvõetud ülesanded läbisid keskmiselt kuus isejuhitud automatiseeritud ülevaatusringi ja vähemalt kaks ekspertülevaatuse ringi. Ülevaated tuginesid kas kontrollitavale õigele vastusele või tugevale ekspertide konsensusele, kus asjakohase valdkonna arvustajate nõusolek oli vähemalt 90%. See protsess aitas tagada, et vastuvõetud ülesanded olid teaduslikult põhjendatud, hindamiseks piisavalt selged ja rakendusuuringuid esindavad.

Diagramm, mis näitab LifeSciBenchi ülesandeid, kus eluteaduste andmeallikad, nagu genoomijärjestused, molekulaarstruktuurid, joonised, dokumendid, arvutustabelid ja veebilingid, on ühendatud mitmeetapilise arutluse ja ekspertülevaatusega.

Hindamine ja hindamisjuhendi jaotus

LifeSciBenchi ülesandeid hinnatakse üksikasjaliku ülesandespetsiifilise hindamisjuhendi alusel, mis jaotab oodatava vastuse konkreetseteks teaduslikeks väideteks, arvutusteks, otsusteks, põhjendusteks ja muuks. Kogu võrdlustestis sisaldavad ekspertide koostatud hindamisjuhendid 19 020 kriteeriumi – keskmiselt 25 ülesande kohta –, et hinnata nii teaduslikku korrektsust kui ka kasulikkust uurimisotsuste tegemisel.

See ülesehitus peegeldab seda, kuidas teadustööd praktikas hinnatakse: paljusid eluteaduste ülesandeid ei saa hinnata üksnes lõppvastust kontrollides. Vastus võib jõuda õige üldise järelduseni, kuid seda võidakse siiski pidada puudulikuks, kui see näiteks jätab tähelepanuta olulise analüüsipiirangu või ei tõstata ennetavalt väga mõjukaid bioloogilisi nüansse. Teisalt võib osaline vastus sisaldada kvaliteetset arutlust isegi siis, kui see ei lahenda ülesannet täielikult.

Granulaarsed hindamisjuhendid tabavad selle nüansi. LifeSciBench hindab mitte ainult lõppvastuse täpsust, vaid ka seda, kas mudel jõuab vastuseni teaduslikult põhjendatud ja praktiliselt kasulikul viisil.

LifeSciBenchi valideerimine

Valideerisime LifeSciBenchi sõltumatu ekspertülevaatuse kaudu. Tagasisidet andsid 453 arvustajat, kes ei osalenud ülesannete kirjutamises. Neist arvustajatest 97%-l oli Ph.D. või samaväärne doktorikraad, keskmiselt 12 aastat valdkonnakogemust ja 14 eelretsenseeritud publikatsiooni; 88% teatas, et on saanud vähemalt ühe auhinna või stipendiumi.

Arvustajad hindasid, kas iga ülesanne peegeldas tugeva võrdlustestiküsimuse jaoks vajalikke omadusi: vastavust päris uurimistööle, teadusliku arutluse ja valdkonnaekspertiisi sobivat testimist, toetumist tõenditele või ekspertide konsensusele ning üldist kasulikkust mudeli jõudluse hindamisel. Nõustumus ületas igas kategoorias 96%.

Seos päriseluga

Kas see ülesanne kajastab realistlikku päris eluteaduste tööd?

Nõustun täielikult
90.4%
Üldiselt nõustun
98.3%

Teaduslik arutlus / valdkonnaoskus

Kas see ülesanne testib ja hindab õiget teaduslikku arutlust ning eluteaduste valdkonnaoskusi?

Nõustun täielikult
86.4%
Üldiselt nõustun
98.1%

Teaduslik põhjendatus

Kas see ülesanne on teaduslikult põhjendatud, vastatav ning toetub sobivatele tõenditele, andmetele, artefaktidele või ekspertide konsensusele?

Nõustun täielikult
77.1%
Üldiselt nõustun
96.5%

Üldine kasulikkus

Kas see on kokkuvõttes tugev eluteaduste hindamisülesanne?

Nõustun täielikult
79.1%
Üldiselt nõustun
96.6%

Arvustajate kommentaarid kinnitasid kvantitatiivseid hinnanguid:

1 / 3
Kokkuvõttes on see tugev ülesanne, sest sellel on üks õige põhituletus, kuid samas jätab see ruumi eristada paremaid vastuseid selle järgi, kui hoolikalt need määramatust piiritlevad.

Tulemused

Esitame kaks teineteist täiendavat mõõdikut. Läbimismäär on nende ülesannete protsent, mille puhul mudel saavutab ülesandetaseme edukünnise 70%. Skoor on keskmine hindamisjuhendi tulemus, mis annab üksikute kriteeriumide eest osalist tunnustust ka siis, kui kogu ülesannet ei lahendata. Mõlemad on olulised, sest teadusliku ülesande vastus võib olla osaliselt õige või kasulik ka siis, kui see ei täida kõiki täieliku vastuse nõudeid.

Mudeli jõudlus varieerub oluliselt ülesandetüübi, töövoo ja vastusevormingu lõikes.

Kus AI süsteemid näitavad esmast tugevust

LifeSciBench näitab, et tippmudelid on suhteliselt tugevaimad ülesannetes, mis hõlmavad teaduslikku sünteesi, kommunikatsiooni ja struktureeritud tõlgendamist. Absoluutsed läbimismäärad on endiselt tagasihoidlikud, seega pole need võrdlustesti valdkonnad kaugeltki ammendunud, kuid GPT‑Rosalind näitab GPT‑5.5‑ga võrreldes märkimisväärset edenemist, parandades üldist täpset läbimismäära 25,7%-lt 36,1%-le.

Mudelite võimekuse tugevaim areng ilmneb teaduskommunikatsioonis ja siirdes. Näiteks teaduskommunikatsiooni läbimismäär kasvab GPT‑5.5 56,3%-lt GPT‑Rosalindi 71,1%-le; see kategooria on väike (n=9), seega tuleks seda tõlgendada ettevaatlikult, kuid see viitab, et tippmudelid arenevad kiiresti tõendite korrastamisel ja ekspertidele suunatud veenvate selgituste koostamisel. Siire (ravimiarenduse "laborist patsiendini" protsess) näitab sarnast mustrit, tõustes GPT‑5.5 36,8%-lt GPT‑Rosalindi 57,7%-le, mis viitab, et mudelite võime siduda prekliinilisi tõendeid kliiniliste järeldustega paraneb kiiresti.

Hindamisjuhendi tasandi tulemused osutavad samas suunas. Ülesannetes, mis nõuavad ekspertidele kasulikke või tegutsemist võimaldavaid väljundeid, saab GPT‑Rosalind skooriks 44,7%, võrreldes GPT‑5.5 29,1%-ga. Ülesannetes, mis nõuavad määramatuse ja reservatsioonide käsitlemist, saab see skooriks 44,8%, võrreldes 29,3%-ga. See muster viitab, et mudelid on kõige kasulikumad siis, kui ülesandel on selge tõendipiir ja see nõuab struktureeritud teaduslikku hinnangut.

GPT‑Rosalind juhib jõudlust teaduslikult väärtuslikes ülesannetes, mille on määratlenud tööstuse ja akadeemilised eksperdid.

GPT‑Rosalind juhib jõudlust teaduslikult väärtuslikes ülesannetes, mille on määratlenud tööstuse ja akadeemilised eksperdid.

GPT‑Rosalind juhib jõudlust teaduslikult väärtuslikes ülesannetes, mille on määratlenud tööstuse ja akadeemilised eksperdid.

Kus AI süsteemid jäävad endiselt vajaka

Jõudlus on palju nõrgem teadustöös, mis on artefaktimahukas, disainimahukas ja operatsiooniliselt piiratud. Nimelt on disain, optimeerimine & ennustamine endiselt üks raskemaid töövooge, kus GPT‑Rosalindi läbimismäär on 30,7%; analüüs on sarnaselt keeruline, 30,3%.

Artefaktide kasutamine on eriti selge lünk. Kuigi GPT‑Rosalind toimib artefaktimahukates olukordades paremini kui GPT‑5.5, langeb selle läbimismäär siiski ainult tekstiga ülesannete 45,1%-lt artefaktide või URL-idega ülesannete 28,1%-le. GPT‑5.5 näitab sama mustrit, langedes 29,9%-lt 21,9%-le. Üksikasjalikum analüüs kinnitab, et tippmudelitel on raskusi keerukatest joonistest või suurtest järjestusfailidest teabe eraldamise ja selle lõppvastusesse lõimimisega.

Läbimismäärad langevad, kui ülesanded nõuavad allikapõhist arutlust või artefaktidega töötamist

Oluline on ka vastuse vorming. Ülesanded, mis nõuavad täpseid järjestuse-, struktuuri- või konstrukti tasandi väljundeid, näitavad madalamaid läbimismäärasid: GPT‑Rosalind saavutab arvulistes ülesannetes vaid 14,8% ning järjestuse- või struktuuriväljundites 24,0%. Ka konstrukti genereerimise ülesanded on haprad: GPT‑Rosalindi tulemus on 27,3% ja paranemist GPT‑5.5‑ga võrreldes on vähe. Osa sellest lõhest võib tuleneda täpse vastusega ülesannete rangemast hindamispinnast, kus väikesed erinevused arvutuses või vormingus võivad viia vastuse alla läbimiskünnise. Need ebaõnnestumised on siiski teaduslikult tähenduslikud, sest paljud eluteaduste töövood nõuavad väljundeid, mis on piisavalt täpsed otseseks kasutamiseks, näiteks CRISPR/HDR doonori disainis või siRNA disainis.

Mudelite vastused jõuavad sageli ka osaliselt õige suunani, ilma ülesannet täielikult lahendamata. Ligikaudu 14% ülesannetes teenisid mudelid märkimisväärse hindamisjuhendi skoori, kuigi ei ületanud täpse läbimise künnist. GPT‑Rosalindi puhul oli 109 ülesandel läbimismäär alla 20%, kuid hindamisjuhendi skoor vähemalt 50%. Praktikas tähendab see, et mudelid võivad tuvastada asjakohaseid tõendeid või anda usutava osalise vastuse, kuid siiski ebaõnnestuda, sest nad jätavad märkamata olulise piirangu, kasutavad valesid tõendeid, teevad mittetäieliku arvutuse või ei seo oma arutlust teaduslikult kasuliku lõppotsusega.

Piirangud & mis saab edasi

LifeSciBench on samm selle mõõtmise suunas, kui kasulikud võivad AI süsteemid olla eluteaduste uurimistöös, kuid see ei asenda mudelite uurimist elavates uurimiskeskkondades. Võrdlustest keskendub iseseisvatele ülesannetele, mis peegeldavad korduvaid tööstuse töövooge, jättes samal ajal paljud teaduserialad ja ülesandetüübid praegusest ulatusest välja. Päris teadustöö on iteratiivne: teadlased koguvad uusi tõendeid, täpsustavad hüpoteese, kavandavad järelkatseid ja kohandavad plaane tulemuste ilmnemisel.

Seetõttu tuleks tugevat tulemust LifeSciBenchis tõlgendada realistliku ülesandetaseme võimekuse tõendina, mitte otsese mõõdikuna hilisema uurimismõju kohta. Võrdlustest põhineb tööstuse töövoogudel, kuid ei hõlma elavate uurimisprogrammide kogu mitmekesisust ega dünaamikat, kus edasiminek sõltub aja jooksul kujunevatest teguritest.

Järgmine samm on siduda võrdlustesti jõudlus kasutuselevõtu-uuringutega elavates uurimistöövoogudes. Kuigi LifeSciBench töötati välja koos praktiseerivate teadlastega, nõuab selle mõõtmine, kas AI süsteemid kiirendavad avastusi või parandavad teadus- ja arendustöö tulemusi, mudelite kasutuse ja jõudluse uurimist päris teaduskeskkondades, pikemate ajahorisontide jooksul ning mitme arutlus-, tagasiside- ja katselise järeltegevuse vooru lõikes.

Löö kaasa

Aita kujundada järgmise põlvkonna eluteaduste AI võrdlusteste või taotle juurdepääsu GPT-Rosalindile.

Autor

OpenAI