Memperkenalkan LifeSciBench
Penanda aras ditulis dan disemak pakar, berasaskan penyelidikan sains hayat dunia sebenar
Sistem AI beragen semakin berupaya melaksanakan tugas saintifik. Namun, kegunaannya kepada penyelidik sains hayat bergantung pada keupayaan menangani kerumitan penyelidikan sebenar. Kerja itu jarang kelihatan seperti satu soalan mengingat fakta atau masalah ramalan yang bersih. Penyelidik mentafsir bukti tidak lengkap, menyelaraskan hasil bercanggah, mereka bentuk eksperimen sukar, menyelesaikan masalah asai, menilai risiko translasi dan memutuskan langkah seterusnya dalam ketidakpastian.
Penanda aras semasa belum menangkap sepenuhnya keupayaan ini. Banyak penilaian sains hayat tertumpu pada domain sempit atau kemahiran terasing, lalu menghasilkan soalan berformat berstruktur dan jawapan rujukan yang bersih. Walaupun bernilai, penilaian ini sering gagal menilai dengan sebenar-benarnya sama ada model boleh menyumbang merentas julat kerja tahap penyelidikan yang lebih luas.
Kami mereka bentuk LifeSciBench untuk membantu merapatkan jurang ini. Setiap tugas berasaskan pertimbangan saintis sains hayat yang beramal, terlatih pada tahap Ph.D. dan berpengalaman langsung memajukan program penemuan ubat dalam bioteknologi dan farmaseutikal.
LifeSciBench merangkumi 750 tugas karangan pakar merentas tujuh aliran kerja dan tujuh domain biologi.
1,062
Artifak tugas
173
Penyumbang saintis
19,020
Kriteria rubrik
453
Pengulas pakar
Apa yang diukur oleh LifeSciBench
LifeSciBench mengukur sama ada sistem AI boleh menyokong tugas penyelidikan sains hayat yang realistik, bukan sekadar menjawab soalan biologi. Untuk mentakrif taksonomi penanda aras, kami meninjau saintis sains hayat yang beramal tentang aliran kerja paling kerap mereka gunakan dalam penyelidikan gunaan. Kemudian, kami mengumpulkan jawapan mereka kepada tujuh kategori berulang: pengendalian bukti, analisis, reka bentuk dan pengoptimuman, penaakulan saintifik, pengesahan dan operasi, translasi serta komunikasi saintifik.
Setiap tugas distruktur seperti permintaan seorang saintis kepada kolaborator berpengetahuan: gesaan saintifik, sebarang konteks atau artifak berkaitan dan jawapan respons bebas. Rubrik tulisan pakar menilai sama ada model boleh menghasilkan jawapan tepat untuk masalah tertentu, dengan tahap perincian, justifikasi, peringatan dan format yang dijangka oleh saintis.
Pembinaan set data
LifeSciBench menilai penaakulan saintifik bersama kemahiran praktikal yang kurang jelas tetapi perlu untuk kegunaan saintifik dunia sebenar. Tugasnya meminta model mengerjakan masalah penyelidikan realistik: mentafsir bukti, membuat pertimbangan berasaskan domain dan menyampaikan kesimpulan yang berguna kepada pengulas pakar. Banyak tugas juga memerlukan model menangani ketidakpastian dan menaakul atas fail data sokongan, bukan bergantung pada teks gesaan semata-mata.
Penanda aras ini direka untuk mencerminkan kerumitan kerja sains hayat. Secara keseluruhan, 79% tugas memerlukan beberapa langkah penaakulan atau membuat keputusan, dengan purata empat langkah bagi setiap tugas. LifeSciBench merangkumi 1,062 artifak lampiran meliputi rajah, PDF, jadual, fail jujukan, fail struktur atau kimia dan rujukan web. Lebih separuh tugas (53%) memerlukan model mentafsir atau mensintesis maklumat daripada sekurang-kurangnya satu artifak.
Tugas dicipta oleh 173 saintis pakar merentas pelbagai disiplin sains hayat. Setiap saintis mempunyai latihan tahap Ph.D. dan pengalaman industri bioteknologi atau farmaseutikal. Tugas boleh melalui sebanyak mana kitaran semakan yang diperlukan sebelum diterima, tanpa had tetap bilangan pusingan; tugas yang diterima mencatat purata enam kitaran semakan automatik kendiri dan menamatkan sekurang-kurangnya dua pusingan semakan pakar. Semakan berpaksikan sama ada jawapan betul yang boleh disahkan atau konsensus pakar yang kukuh, dengan sekurang-kurangnya 90% persetujuan dalam kalangan pengulas domain berkaitan. Proses ini membantu memastikan tugas yang diterima berasaskan sains, cukup jelas untuk digredkan dan mewakili penyelidikan gunaan.
Pecahan penggredan dan rubrik
Tugas LifeSciBench digredkan dengan rubrik terperinci khusus tugas yang menguraikan respons dijangka kepada dakwaan saintifik, pengiraan, keputusan, justifikasi dan sebagainya yang khusus. Merentas penanda aras, rubrik dibangunkan pakar merangkumi 19,020 kriteria—purata 25 bagi setiap tugas—untuk menilai ketepatan saintifik dan kegunaan bagi keputusan penyelidikan.
Reka bentuk ini mencerminkan cara kerja saintifik dinilai dalam amalan: banyak tugas sains hayat tidak boleh digredkan dengan menyemak jawapan akhir sahaja. Sesuatu respons mungkin mencapai kesimpulan aras tinggi yang betul tetapi masih dianggap tidak lengkap jika, contohnya, ia terlepas had asai utama atau gagal mengutarakan secara proaktif nuansa biologi yang amat penting. Sebaliknya, respons separa mungkin mengandungi penaakulan berkualiti tinggi walaupun tidak menyelesaikan tugas sepenuhnya.
Rubrik berbutir menangkap nuansa ini. LifeSciBench menilai bukan sahaja ketepatan jawapan akhir, tetapi sama ada model mencapai jawapannya secara sah dari segi sains dan berguna dari segi operasi.
Mengekstrak, menyelaraskan dan mengaudit bukti saintifik daripada kertas, rajah, jadual dan rekod eksperimen.
Contoh Penilaian
We’re preparing for a Type B FDA meeting on AAV9-microDys-X, an AAV9-based micro-dystrophin gene therapy for Duchenne muscular dystrophy that expresses a 138 kDa construct from an MCK promoter, and we want a hard-nosed critique of whether our current package really supports accelerated approval on micro-dystrophin expression as a surrogate endpoint reasonably likely to predict clinical benefit.
Study context: open-label Phase 1b/2 in 12 ambulatory boys age 4–7 with confirmed DMD and out-of-frame rod-domain deletions. The package is:
- Pre-treatment vastus lateralis biopsies: 0–3% of healthy-control dystrophin by quantitative Western blot using MANEX1A against the N-terminal actin-binding domain.
- 12-week post-treatment contralateral vastus lateralis biopsies: mean micro-dystrophin 38% of healthy control (range 18–61%) by the same Western blot, normalized to total protein by Coomassie staining.
- Post-treatment immunofluorescence: sarcolemmal signal in 75–95% of fibers using a polyclonal anti-dystrophin C-terminal antibody.
- 48-week function: mean NSAA change +1.4 points from baseline versus −0.6 in an external published natural-history registry cohort (p = 0.03 by unpaired t-test).
- Safety: transient transaminitis in 8/12 patients managed with steroid taper; one resolved myocarditis; no deaths.
- Biodistribution/persistence: AAV9 vector genomes detectable in muscle at 12 weeks at a mean of 2.3 vector genomes per nucleus.
- Eligibility: no baseline anti-AAV9 neutralizing antibodies (titer <1:400) and no exon-44 deletions.
Please pressure-test this package item by item: where would FDA or a skeptical reviewer say the evidence, as presented, fails to support our conclusion, and what additional data, analyses, or design changes would be needed to close those gaps if possible? For anything not specified, assume what is known from other clinical-grade 138 kDa micro-dystrophin programs and relevant clinical trials through December 31, 2025 also applies.
Respons Calon
Pokoknya: Seperti yang dibentangkan, pakej ini tidak cukup kuat untuk menyokong kelulusan dipercepatkan pada ekspresi mikro-distrofi sebagai titik akhir pengganti yang berkemungkinan besar untuk meramalkan manfaat klinikal. Pengulas FDA yang ragu-ragu mungkin akan melihat bukti biomarker, fungsi, ketahanan, keselamatan, dan kebolehumuman sebagai kurang disokong secara material.
Item Pakej | Mod Kegagalan Kunci | Apa yang Diperlukan |
|---|---|---|
Kuantifikasi Western blot | MANEX1A mengikat epitop N-terminal yang dikongsi oleh distrofi panjang penuh endogen dan transgen mikro-distrofin, jadi ujian tidak membezakan transgen dengan bersih daripada distrofin sisa/pembalikan. Mengukur mikro-distrofi 138 kDa terhadap piawaian distrofi panjang penuh yang sihat juga tidak sah. | Gunakan piawaian mikro-distrofi rekombinan dan kaedah ortogonal yang membezakan transgen daripada distrofin endogen, seperti spektrometri jisim yang disasarkan atau ujian khusus transgen/khusus epitop. |
Imunofluoresensi | Antibodi poliklonal terminal-C tidak sesuai kerana binaan 138 kDa tidak mempunyai domain terminal-C. Ramai pesakit DMD mempunyai gentian berbalik, dan distrofi berbalik boleh mengekalkan epitop C-terminal. Gentian berbalik boleh mengembang secara klon dengan usia, berat sebelah isyarat IF, terutamanya pada kanak-kanak lelaki yang lebih tua. | Ulangi IF dengan antibodi terhadap epitop yang terdapat dalam transgen tetapi tiada distrofin kembali. Ukur gentian positif transgen secara berasingan daripada gentian berbalik. |
Kesahan titik akhir pengganti | Pakej ini menggabungkan jumlah protein dengan fungsi klinikal. "38% jisim protein kawalan sihat" tidak bermakna 38% daripada fungsi distrofi normal kerana mikro-distrofi dipotong secara struktur. | Secara empirik mengesahkan hubungan antara peratus jisim mikro-distrofin, penyetempatan sarcolemmal, pemulihan fungsi hiliran dan faedah klinikal sebelum merawat ekspresi sebagai titik akhir pengganti. |
Reka bentuk biopsi | Biopsi vastus lateralis kontralateral sebelum dan selepas rawatan memperkenalkan kebolehubahan spatial kiri-kanan dan intramuskular. Perkembangan penyakit dan penggantian fibro-lemak juga boleh mengubah isyarat yang dinormalisasi jumlah protein. | Seragamkan tapak biopsi menggunakan mercu tanda anatomi yang konsisten, normalkan kepada protein khusus otot, dan ukur komposisi fibro-lemak secara selari. |
Pembanding/statistik NSAA | Kohort sejarah semula jadi luaran bukanlah kawalan serentak rawak. Kelayakan percubaan, penjagaan sokongan, kesan penyertaan, NSAA asas, rejimen steroid, umur, dan kelas ekson semuanya boleh berat sebelah perbandingan. Ujian-t tidak berpasangan tidak mencukupi. Selain itu, perubahan NSAA +1.4 berada dalam kebolehubahan ujian-ujian semula untuk kumpulan umur ini. | Jalankan kajian terkawal plasebo serentak secara rawak, atau sekurang-kurangnya penggunaan analisis diselaraskan yang mengambil kira NSAA asas, umur, rejimen steroid, kelas ekson dan pengacau lain. |
Mengelirukan tetingkap umur | Kanak-kanak lelaki berumur 4–7 tahun berada dalam tetingkap perkembangan di mana pesakit DMD ambulatori yang tidak dirawat boleh mendapat fungsi motor sebelum penurunan mendominasi. Perubahan NSAA selama 48 minggu mencampurkan keuntungan perkembangan, perkembangan penyakit, dan kemungkinan kesan rawatan. | Gunakan kawalan rawak serentak dengan stratifikasi umur untuk memisahkan trajektori perkembangan daripada kesan rawatan. |
Duluan klinikal terdahulu | Isyarat fungsi mikro-distrofi label terbuka tidak meramalkan faedah pengesahan dengan pasti; duluan yang diterbitkan termasuk ujian pengesahan terapi gen mikro-distrofi yang gagal menghasilkan semula penambahbaikan NSAA label terbuka. | Jangan bergantung pada perubahan NSAA label terbuka sebagai sokongan yang menentukan. Memerlukan bukti fungsi terkawal. |
Had struktur pembinaan | Binaan 138 kDa memadamkan ulangan spektrum R16/17, yang mengandungi tapak pengikat nNOS. Kehilangan pengambilan nNOS boleh menjejaskan simpatilisis berfungsi dan perlindungan iskemia semasa bersenam, mewujudkan siling mekanistik pada penyelamatan bebas daripada tahap ekspresi. | Tambah kajian mekanistik yang menunjukkan sama ada binaan khusus ini memulihkan fungsi kompleks berkaitan dystrfin yang berkaitan, penyetempatan nNOS, fisiologi senaman, dan perlindungan otot yang berkaitan. |
Ketahanan AAV | Genom vektor pada 12 minggu tidak mewujudkan ekspresi tahan lama. Genom AAV9 sebahagian besarnya adalah episom yang tidak bersepadu dan mungkin merosot dari semasa ke semasa. Kegigihan vektor-genom tidak sama dengan ekspresi protein berterusan. | Ukur ekspresi protein transgen membujur dan ketahanan biomarker berfungsi melebihi 12 minggu. |
Profil imun/keselamatan | Transaminitis pada 8/12 pesakit adalah konsisten dengan tindak balas imun kepada sel yang ditransduksi AAV, tetapi mekanismenya tidak ditubuhkan. Satu kes miokarditis membimbangkan memandangkan tropisme jantung AAV9. | Menyediakan pemantauan imun yang lebih mendalam, pencirian keselamatan hati/jantung, dan susulan jantung yang dipergiatkan. |
Pemilihan/kebolehumuman pesakit | Tidak termasuk pesakit anti-AAV9 yang meneutralkan antibodi positif mengehadkan kebolehumuman. Tidak termasuk pemadaman exon-44 mengehadkan kebolehgunaan kepada subkumpulan DMD itu. n=12 terlalu kecil untuk mencirikan keselamatan dan keberkesanan merentasi populasi DMD yang lebih luas. | Meluaskan kelayakan jika boleh atau pra-tentukan analisis berstrata mengikut status antibodi, kelas genotip/ekson, umur, dan fungsi asas sebelum menggunakan keputusan untuk menyokong kelulusan yang meluas. |
Kesimpulan kawal selia: Pakej itu mungkin menunjukkan aktiviti biologi, tetapi ia belum lagi membuktikan bahawa ekspresi mikro-distrofi yang diukur adalah pengganti yang boleh dipercayai yang berkemungkinan besar untuk meramalkan manfaat klinikal. Jurang utama ialah kekhususan ujian, piawaian kuantifikasi yang tidak sah, kemungkinan kekeliruan gentian kembali, kekurangan kawalan rawak, kekeliruan NSAA yang berkaitan dengan usia, ketahanan yang tidak menentu dan isu keselamatan/kebolehumuman yang tidak dapat diselesaikan.
Untuk merapatkan jurang, program ini memerlukan reka bentuk klinikal terkawal berstrata umur dengan ujian ekspresi khusus transgen, kuantifikasi protein ortogonal, kawalan komposisi tisu, data ketahanan membujur, ujian fungsi mekanistik untuk binaan terpotong, dan pemantauan keselamatan yang lebih kuat, terutamanya hepatik dan jantung.
Kriteria Rubrik & Gred
Mengesahkan LifeSciBench
Kami mengesahkan LifeSciBench melalui semakan pakar bebas. Maklum balas datang daripada 453 pengulas yang tidak terlibat menulis tugas. Daripada pengulas itu, 97% memiliki Ph.D. atau doktor falsafah setara, dengan purata 12 tahun pengalaman bidang dan 14 penerbitan semakan rakan sebaya; 88% melaporkan menerima sekurang-kurangnya satu anugerah atau felowship.
Pengulas menskor sama ada setiap tugas mencerminkan kualiti yang diperlukan untuk soalan penanda aras yang kukuh: keselarasan dengan kerja penyelidikan dunia sebenar, ujian penaakulan saintifik dan kepakaran domain yang sesuai, asas pada bukti atau konsensus pakar serta kegunaan keseluruhan untuk menilai prestasi model. Persetujuan melebihi 96% dalam setiap kategori.
Komen pengulas mengukuhkan penarafan kuantitatif:
Keputusan
Kami melaporkan dua metrik yang saling melengkapi. Kadar lulus ialah peratusan tugas yang model memenuhi ambang kejayaan tahap tugas sebanyak 70%. Skor ialah purata ganjaran rubrik, memberi kredit separa untuk kriteria individu walaupun tugas penuh tidak diselesaikan. Kedua-duanya penting kerana respons kepada tugas saintifik boleh betul atau berguna secara separa tanpa memenuhi setiap keperluan jawapan lengkap.
Prestasi model berbeza dengan ketara mengikut jenis tugas, aliran kerja dan format respons.
Bidang awal kekuatan sistem AI
LifeSciBench menunjukkan model perintis paling kuat secara relatif pada tugas yang melibatkan sintesis saintifik, komunikasi dan tafsiran berstruktur. Kadar lulus mutlak masih sederhana, jadi domain penanda aras ini masih jauh daripada tepu, tetapi GPT‑Rosalind menunjukkan kemajuan bermakna berbanding GPT‑5.5, dengan kadar lulus tepat keseluruhan meningkat daripada 25.7% kepada 36.1%.
Arah kemajuan paling kuat dalam keupayaan model muncul pada Komunikasi Saintifik dan Translasi. Contohnya, kadar lulus Komunikasi Saintifik meningkat daripada 56.3% bagi GPT‑5.5 kepada 71.1% bagi GPT‑Rosalind; kategori ini kecil (n=9), jadi harus ditafsir dengan berhati-hati, tetapi ia mencadangkan model perintis cepat bertambah baik dalam menyusun bukti dan menghasilkan penjelasan meyakinkan untuk pakar. Translasi (proses pembangunan ubat "daripada bangku makmal ke katil pesakit") menunjukkan pola serupa, meningkat daripada 36.8% bagi GPT‑5.5 kepada 57.7% bagi GPT‑Rosalind, mencadangkan model cepat bertambah baik dalam menghubungkan bukti praklinikal dengan implikasi klinikal.
Keputusan peringkat rubrik menunjukkan arah yang sama. Pada tugas yang memerlukan output berguna kepada pakar atau boleh diambil tindakan, GPT‑Rosalind menskor 44.7%, berbanding 29.1% bagi GPT‑5.5. Pada tugas yang memerlukan pengendalian ketidakpastian dan peringatan, ia menskor 44.8%, berbanding 29.3%. Pola ini mencadangkan model paling berguna apabila tugas mempunyai sempadan bukti yang jelas dan memerlukan pertimbangan saintifik berstruktur.
GPT‑Rosalind mendahului prestasi merentas tugas bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.
GPT‑Rosalind menerajui prestasi merentas tugasan bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.
GPT‑Rosalind menerajui prestasi merentas tugasan bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.
Bidang sistem AI masih ketinggalan
Prestasi kekal jauh lebih lemah pada kerja saintifik yang sarat artifak, berat reka bentuk dan terhad secara operasi. Khususnya, Reka Bentuk, Pengoptimuman & Ramalan kekal antara aliran kerja paling sukar, dengan kadar lulus GPT‑Rosalind pada 30.7%; Analisis juga sukar pada 30.3%.
Penggunaan artifak ialah jurang yang sangat jelas. Walaupun GPT‑Rosalind berprestasi lebih baik daripada GPT‑5.5 dalam tetapan sarat artifak, kadar lulusnya masih turun daripada 45.1% pada tugas teks sahaja kepada 28.1% pada tugas dengan artifak atau URL. GPT‑5.5 menunjukkan pola sama, turun daripada 29.9% kepada 21.9%. Analisis lebih terperinci mengesahkan bahawa model perintis bergelut mengekstrak maklumat daripada rajah kompleks atau fail jujukan besar dan menyepadukan maklumat itu ke dalam jawapan akhir.
Kadar lulus menurun apabila tugas memerlukan penaakulan berpaksikan sumber atau kerja dengan artifak
Format jawapan juga penting. Tugas yang memerlukan output tepat pada tahap jujukan, struktur atau konstruk menunjukkan kadar lulus lebih rendah: GPT‑Rosalind hanya mencapai 14.8% pada tugas numerik dan 24.0% pada output jujukan atau struktur. Tugas penjanaan konstruk juga rapuh, dengan GPT‑Rosalind pada 27.3% dan hanya sedikit peningkatan berbanding GPT‑5.5. Sebahagian jurang ini mungkin mencerminkan permukaan penggredan lebih ketat bagi tugas jawapan tepat, apabila perbezaan kecil dalam pengiraan atau format boleh menyebabkan respons jatuh di bawah ambang lulus. Namun, kegagalan ini bermakna dari segi sains kerana banyak aliran kerja sains hayat memerlukan output yang cukup tepat untuk digunakan terus, seperti dalam reka bentuk penderma CRISPR/HDR atau reka bentuk siRNA.
Model juga sering hampir sampai tanpa menyelesaikan tugas sepenuhnya. Dalam kira-kira 14% tugas, model memperoleh kredit rubrik yang besar walaupun gagal ambang lulus tepat. Bagi GPT‑Rosalind, 109 tugas mempunyai kadar lulus di bawah 20% sambil masih memperoleh sekurang-kurangnya 50% ganjaran rubrik. Dalam amalan, ini bermakna model mungkin mengenal pasti bukti berkaitan atau menghasilkan jawapan separa yang munasabah, tetapi masih gagal kerana terlepas kekangan utama, menggunakan bukti salah, membuat pengiraan tidak lengkap atau tidak menghubungkan penaakulan kepada keputusan akhir yang berguna secara saintifik.
Batasan & langkah seterusnya
LifeSciBench ialah langkah ke arah mengukur sejauh mana sistem AI boleh berguna untuk penyelidikan sains hayat, tetapi ia bukan pengganti kajian model dalam persekitaran penyelidikan langsung. Penanda aras ini tertumpu pada tugas serba lengkap yang mencerminkan aliran kerja industri berulang, sambil banyak kepakaran saintifik dan jenis tugas masih berada di luar skop semasanya. Penyelidikan sebenar bersifat berulang: saintis mengumpul bukti baharu, menyemak hipotesis, mereka bentuk eksperimen susulan dan menyesuaikan rancangan apabila hasil muncul.
Oleh itu, prestasi kukuh pada LifeSciBench harus ditafsir sebagai bukti keupayaan tahap tugas yang realistik, bukan ukuran langsung impak penyelidikan hiliran. Penanda aras ini berasaskan aliran kerja industri, tetapi tidak menangkap kepelbagaian atau dinamik penuh program penyelidikan langsung, yang kemajuannya bergantung pada faktor yang berkembang mengikut masa.
Langkah seterusnya ialah menghubungkan prestasi penanda aras dengan kajian penggunaan dalam aliran kerja penyelidikan langsung. Walaupun LifeSciBench dibangunkan bersama saintis yang beramal, pengukuran sama ada sistem AI mempercepat penemuan atau meningkatkan hasil R&D memerlukan kajian penggunaan dan prestasi model dalam tetapan penyelidikan sebenar, merentas tempoh lebih panjang serta beberapa pusingan penaakulan, maklum balas dan susulan eksperimen.


