Langkau ke kandungan utama
OpenAI

Memperkenalkan LifeSciBench

Penanda aras ditulis dan disemak pakar, berasaskan penyelidikan sains hayat dunia sebenar

Memuat…

Sistem AI beragen semakin berupaya melaksanakan tugas saintifik. Namun, kegunaannya kepada penyelidik sains hayat bergantung pada keupayaan menangani kerumitan penyelidikan sebenar. Kerja itu jarang kelihatan seperti satu soalan mengingat fakta atau masalah ramalan yang bersih. Penyelidik mentafsir bukti tidak lengkap, menyelaraskan hasil bercanggah, mereka bentuk eksperimen sukar, menyelesaikan masalah asai, menilai risiko translasi dan memutuskan langkah seterusnya dalam ketidakpastian.

Penanda aras semasa belum menangkap sepenuhnya keupayaan ini. Banyak penilaian sains hayat tertumpu pada domain sempit atau kemahiran terasing, lalu menghasilkan soalan berformat berstruktur dan jawapan rujukan yang bersih. Walaupun bernilai, penilaian ini sering gagal menilai dengan sebenar-benarnya sama ada model boleh menyumbang merentas julat kerja tahap penyelidikan yang lebih luas.

Kami mereka bentuk LifeSciBench untuk membantu merapatkan jurang ini. Setiap tugas berasaskan pertimbangan saintis sains hayat yang beramal, terlatih pada tahap Ph.D. dan berpengalaman langsung memajukan program penemuan ubat dalam bioteknologi dan farmaseutikal.

LifeSciBench merangkumi 750 tugas karangan pakar merentas tujuh aliran kerja dan tujuh domain biologi.

1,062

Artifak tugas

173

Penyumbang saintis

19,020

Kriteria rubrik

453

Pengulas pakar

Apa yang diukur oleh LifeSciBench

LifeSciBench mengukur sama ada sistem AI boleh menyokong tugas penyelidikan sains hayat yang realistik, bukan sekadar menjawab soalan biologi. Untuk mentakrif taksonomi penanda aras, kami meninjau saintis sains hayat yang beramal tentang aliran kerja paling kerap mereka gunakan dalam penyelidikan gunaan. Kemudian, kami mengumpulkan jawapan mereka kepada tujuh kategori berulang: pengendalian bukti, analisis, reka bentuk dan pengoptimuman, penaakulan saintifik, pengesahan dan operasi, translasi serta komunikasi saintifik.

Setiap tugas distruktur seperti permintaan seorang saintis kepada kolaborator berpengetahuan: gesaan saintifik, sebarang konteks atau artifak berkaitan dan jawapan respons bebas. Rubrik tulisan pakar menilai sama ada model boleh menghasilkan jawapan tepat untuk masalah tertentu, dengan tahap perincian, justifikasi, peringatan dan format yang dijangka oleh saintis.

Pembinaan set data

LifeSciBench menilai penaakulan saintifik bersama kemahiran praktikal yang kurang jelas tetapi perlu untuk kegunaan saintifik dunia sebenar. Tugasnya meminta model mengerjakan masalah penyelidikan realistik: mentafsir bukti, membuat pertimbangan berasaskan domain dan menyampaikan kesimpulan yang berguna kepada pengulas pakar. Banyak tugas juga memerlukan model menangani ketidakpastian dan menaakul atas fail data sokongan, bukan bergantung pada teks gesaan semata-mata.

Penanda aras ini direka untuk mencerminkan kerumitan kerja sains hayat. Secara keseluruhan, 79% tugas memerlukan beberapa langkah penaakulan atau membuat keputusan, dengan purata empat langkah bagi setiap tugas. LifeSciBench merangkumi 1,062 artifak lampiran meliputi rajah, PDF, jadual, fail jujukan, fail struktur atau kimia dan rujukan web. Lebih separuh tugas (53%) memerlukan model mentafsir atau mensintesis maklumat daripada sekurang-kurangnya satu artifak.

Tugas dicipta oleh 173 saintis pakar merentas pelbagai disiplin sains hayat. Setiap saintis mempunyai latihan tahap Ph.D. dan pengalaman industri bioteknologi atau farmaseutikal. Tugas boleh melalui sebanyak mana kitaran semakan yang diperlukan sebelum diterima, tanpa had tetap bilangan pusingan; tugas yang diterima mencatat purata enam kitaran semakan automatik kendiri dan menamatkan sekurang-kurangnya dua pusingan semakan pakar. Semakan berpaksikan sama ada jawapan betul yang boleh disahkan atau konsensus pakar yang kukuh, dengan sekurang-kurangnya 90% persetujuan dalam kalangan pengulas domain berkaitan. Proses ini membantu memastikan tugas yang diterima berasaskan sains, cukup jelas untuk digredkan dan mewakili penyelidikan gunaan.

Rajah menunjukkan tugas LifeSciBench yang menggabungkan sumber data sains hayat seperti jujukan genomik, struktur molekul, rajah, dokumen, hamparan dan pautan web dengan penaakulan berbilang langkah serta semakan pakar.

Pecahan penggredan dan rubrik

Tugas LifeSciBench digredkan dengan rubrik terperinci khusus tugas yang menguraikan respons dijangka kepada dakwaan saintifik, pengiraan, keputusan, justifikasi dan sebagainya yang khusus. Merentas penanda aras, rubrik dibangunkan pakar merangkumi 19,020 kriteria—purata 25 bagi setiap tugas—untuk menilai ketepatan saintifik dan kegunaan bagi keputusan penyelidikan.

Reka bentuk ini mencerminkan cara kerja saintifik dinilai dalam amalan: banyak tugas sains hayat tidak boleh digredkan dengan menyemak jawapan akhir sahaja. Sesuatu respons mungkin mencapai kesimpulan aras tinggi yang betul tetapi masih dianggap tidak lengkap jika, contohnya, ia terlepas had asai utama atau gagal mengutarakan secara proaktif nuansa biologi yang amat penting. Sebaliknya, respons separa mungkin mengandungi penaakulan berkualiti tinggi walaupun tidak menyelesaikan tugas sepenuhnya.

Rubrik berbutir menangkap nuansa ini. LifeSciBench menilai bukan sahaja ketepatan jawapan akhir, tetapi sama ada model mencapai jawapannya secara sah dari segi sains dan berguna dari segi operasi.

Mengekstrak, menyelaraskan dan mengaudit bukti saintifik daripada kertas, rajah, jadual dan rekod eksperimen.

Contoh Penilaian

We’re preparing for a Type B FDA meeting on AAV9-microDys-X, an AAV9-based micro-dystrophin gene therapy for Duchenne muscular dystrophy that expresses a 138 kDa construct from an MCK promoter, and we want a hard-nosed critique of whether our current package really supports accelerated approval on micro-dystrophin expression as a surrogate endpoint reasonably likely to predict clinical benefit.

Study context: open-label Phase 1b/2 in 12 ambulatory boys age 4–7 with confirmed DMD and out-of-frame rod-domain deletions. The package is:

  • Pre-treatment vastus lateralis biopsies: 0–3% of healthy-control dystrophin by quantitative Western blot using MANEX1A against the N-terminal actin-binding domain.
  • 12-week post-treatment contralateral vastus lateralis biopsies: mean micro-dystrophin 38% of healthy control (range 18–61%) by the same Western blot, normalized to total protein by Coomassie staining.
  • Post-treatment immunofluorescence: sarcolemmal signal in 75–95% of fibers using a polyclonal anti-dystrophin C-terminal antibody.
  • 48-week function: mean NSAA change +1.4 points from baseline versus −0.6 in an external published natural-history registry cohort (p = 0.03 by unpaired t-test).
  • Safety: transient transaminitis in 8/12 patients managed with steroid taper; one resolved myocarditis; no deaths.
  • Biodistribution/persistence: AAV9 vector genomes detectable in muscle at 12 weeks at a mean of 2.3 vector genomes per nucleus.
  • Eligibility: no baseline anti-AAV9 neutralizing antibodies (titer <1:400) and no exon-44 deletions.

Please pressure-test this package item by item: where would FDA or a skeptical reviewer say the evidence, as presented, fails to support our conclusion, and what additional data, analyses, or design changes would be needed to close those gaps if possible? For anything not specified, assume what is known from other clinical-grade 138 kDa micro-dystrophin programs and relevant clinical trials through December 31, 2025 also applies.

Respons Calon

Pokoknya: Seperti yang dibentangkan, pakej ini tidak cukup kuat untuk menyokong kelulusan dipercepatkan pada ekspresi mikro-distrofi sebagai titik akhir pengganti yang berkemungkinan besar untuk meramalkan manfaat klinikal. Pengulas FDA yang ragu-ragu mungkin akan melihat bukti biomarker, fungsi, ketahanan, keselamatan, dan kebolehumuman sebagai kurang disokong secara material.

Item Pakej

Mod Kegagalan Kunci

Apa yang Diperlukan

Kuantifikasi Western blot

MANEX1A mengikat epitop N-terminal yang dikongsi oleh distrofi panjang penuh endogen dan transgen mikro-distrofin, jadi ujian tidak membezakan transgen dengan bersih daripada distrofin sisa/pembalikan. Mengukur mikro-distrofi 138 kDa terhadap piawaian distrofi panjang penuh yang sihat juga tidak sah.

Gunakan piawaian mikro-distrofi rekombinan dan kaedah ortogonal yang membezakan transgen daripada distrofin endogen, seperti spektrometri jisim yang disasarkan atau ujian khusus transgen/khusus epitop.

Imunofluoresensi

Antibodi poliklonal terminal-C tidak sesuai kerana binaan 138 kDa tidak mempunyai domain terminal-C. Ramai pesakit DMD mempunyai gentian berbalik, dan distrofi berbalik boleh mengekalkan epitop C-terminal. Gentian berbalik boleh mengembang secara klon dengan usia, berat sebelah isyarat IF, terutamanya pada kanak-kanak lelaki yang lebih tua.

Ulangi IF dengan antibodi terhadap epitop yang terdapat dalam transgen tetapi tiada distrofin kembali. Ukur gentian positif transgen secara berasingan daripada gentian berbalik.

Kesahan titik akhir pengganti

Pakej ini menggabungkan jumlah protein dengan fungsi klinikal. "38% jisim protein kawalan sihat" tidak bermakna 38% daripada fungsi distrofi normal kerana mikro-distrofi dipotong secara struktur.

Secara empirik mengesahkan hubungan antara peratus jisim mikro-distrofin, penyetempatan sarcolemmal, pemulihan fungsi hiliran dan faedah klinikal sebelum merawat ekspresi sebagai titik akhir pengganti.

Reka bentuk biopsi

Biopsi vastus lateralis kontralateral sebelum dan selepas rawatan memperkenalkan kebolehubahan spatial kiri-kanan dan intramuskular. Perkembangan penyakit dan penggantian fibro-lemak juga boleh mengubah isyarat yang dinormalisasi jumlah protein.

Seragamkan tapak biopsi menggunakan mercu tanda anatomi yang konsisten, normalkan kepada protein khusus otot, dan ukur komposisi fibro-lemak secara selari.

Pembanding/statistik NSAA

Kohort sejarah semula jadi luaran bukanlah kawalan serentak rawak. Kelayakan percubaan, penjagaan sokongan, kesan penyertaan, NSAA asas, rejimen steroid, umur, dan kelas ekson semuanya boleh berat sebelah perbandingan. Ujian-t tidak berpasangan tidak mencukupi. Selain itu, perubahan NSAA +1.4 berada dalam kebolehubahan ujian-ujian semula untuk kumpulan umur ini.

Jalankan kajian terkawal plasebo serentak secara rawak, atau sekurang-kurangnya penggunaan analisis diselaraskan yang mengambil kira NSAA asas, umur, rejimen steroid, kelas ekson dan pengacau lain.

Mengelirukan tetingkap umur

Kanak-kanak lelaki berumur 4–7 tahun berada dalam tetingkap perkembangan di mana pesakit DMD ambulatori yang tidak dirawat boleh mendapat fungsi motor sebelum penurunan mendominasi. Perubahan NSAA selama 48 minggu mencampurkan keuntungan perkembangan, perkembangan penyakit, dan kemungkinan kesan rawatan.

Gunakan kawalan rawak serentak dengan stratifikasi umur untuk memisahkan trajektori perkembangan daripada kesan rawatan.

Duluan klinikal terdahulu

Isyarat fungsi mikro-distrofi label terbuka tidak meramalkan faedah pengesahan dengan pasti; duluan yang diterbitkan termasuk ujian pengesahan terapi gen mikro-distrofi yang gagal menghasilkan semula penambahbaikan NSAA label terbuka.

Jangan bergantung pada perubahan NSAA label terbuka sebagai sokongan yang menentukan. Memerlukan bukti fungsi terkawal.

Had struktur pembinaan

Binaan 138 kDa memadamkan ulangan spektrum R16/17, yang mengandungi tapak pengikat nNOS. Kehilangan pengambilan nNOS boleh menjejaskan simpatilisis berfungsi dan perlindungan iskemia semasa bersenam, mewujudkan siling mekanistik pada penyelamatan bebas daripada tahap ekspresi.

Tambah kajian mekanistik yang menunjukkan sama ada binaan khusus ini memulihkan fungsi kompleks berkaitan dystrfin yang berkaitan, penyetempatan nNOS, fisiologi senaman, dan perlindungan otot yang berkaitan.

Ketahanan AAV

Genom vektor pada 12 minggu tidak mewujudkan ekspresi tahan lama. Genom AAV9 sebahagian besarnya adalah episom yang tidak bersepadu dan mungkin merosot dari semasa ke semasa. Kegigihan vektor-genom tidak sama dengan ekspresi protein berterusan.

Ukur ekspresi protein transgen membujur dan ketahanan biomarker berfungsi melebihi 12 minggu.

Profil imun/keselamatan

Transaminitis pada 8/12 pesakit adalah konsisten dengan tindak balas imun kepada sel yang ditransduksi AAV, tetapi mekanismenya tidak ditubuhkan. Satu kes miokarditis membimbangkan memandangkan tropisme jantung AAV9.

Menyediakan pemantauan imun yang lebih mendalam, pencirian keselamatan hati/jantung, dan susulan jantung yang dipergiatkan.

Pemilihan/kebolehumuman pesakit

Tidak termasuk pesakit anti-AAV9 yang meneutralkan antibodi positif mengehadkan kebolehumuman. Tidak termasuk pemadaman exon-44 mengehadkan kebolehgunaan kepada subkumpulan DMD itu. n=12 terlalu kecil untuk mencirikan keselamatan dan keberkesanan merentasi populasi DMD yang lebih luas.

Meluaskan kelayakan jika boleh atau pra-tentukan analisis berstrata mengikut status antibodi, kelas genotip/ekson, umur, dan fungsi asas sebelum menggunakan keputusan untuk menyokong kelulusan yang meluas.

Kesimpulan kawal selia: Pakej itu mungkin menunjukkan aktiviti biologi, tetapi ia belum lagi membuktikan bahawa ekspresi mikro-distrofi yang diukur adalah pengganti yang boleh dipercayai yang berkemungkinan besar untuk meramalkan manfaat klinikal. Jurang utama ialah kekhususan ujian, piawaian kuantifikasi yang tidak sah, kemungkinan kekeliruan gentian kembali, kekurangan kawalan rawak, kekeliruan NSAA yang berkaitan dengan usia, ketahanan yang tidak menentu dan isu keselamatan/kebolehumuman yang tidak dapat diselesaikan.

Untuk merapatkan jurang, program ini memerlukan reka bentuk klinikal terkawal berstrata umur dengan ujian ekspresi khusus transgen, kuantifikasi protein ortogonal, kawalan komposisi tisu, data ketahanan membujur, ujian fungsi mekanistik untuk binaan terpotong, dan pemantauan keselamatan yang lebih kuat, terutamanya hepatik dan jantung.

Kriteria Rubrik & Gred

Kriteria
Mata
Identifies assay/measurement problems in micro-dystrophin quantification, including MANEX1A epitope sharing, invalid full-length dystrophin standards, and need for recombinant or orthogonal transgene-specific measurement.
+24
Explains why micro-dystrophin expression level is not automatically a valid surrogate for functional clinical benefit.
+22
Flags biopsy-site, tissue-composition, and age-window confounding that weaken expression and NSAA interpretation.
+19
Critiques the NSAA comparator/statistics, especially reliance on external natural-history controls.
+12
Addresses AAV durability, immune response, transaminitis, myocarditis, and need for longer-term expression/safety follow-up.
+15
Notes patient-selection/generalizability gaps, including anti-AAV9 exclusion, exon-44 exclusion, and small sample size.
+8

Mengesahkan LifeSciBench

Kami mengesahkan LifeSciBench melalui semakan pakar bebas. Maklum balas datang daripada 453 pengulas yang tidak terlibat menulis tugas. Daripada pengulas itu, 97% memiliki Ph.D. atau doktor falsafah setara, dengan purata 12 tahun pengalaman bidang dan 14 penerbitan semakan rakan sebaya; 88% melaporkan menerima sekurang-kurangnya satu anugerah atau felowship.

Pengulas menskor sama ada setiap tugas mencerminkan kualiti yang diperlukan untuk soalan penanda aras yang kukuh: keselarasan dengan kerja penyelidikan dunia sebenar, ujian penaakulan saintifik dan kepakaran domain yang sesuai, asas pada bukti atau konsensus pakar serta kegunaan keseluruhan untuk menilai prestasi model. Persetujuan melebihi 96% dalam setiap kategori.

Kerelevanan dunia sebenar

Adakah tugas ini mencerminkan kerja sains hayat dunia sebenar yang realistik?

Sangat setuju
90.4%
Setuju secara keseluruhan
98.3%

Penaakulan saintifik / kemahiran domain

Adakah tugas ini menguji dan menilai penaakulan saintifik serta kemahiran domain sains hayat yang betul?

Sangat setuju
86.4%
Setuju secara keseluruhan
98.1%

Asas saintifik

Adakah tugas ini berasaskan sains, boleh dijawab dan berpaksikan bukti, data, artifak atau konsensus pakar yang sesuai?

Sangat setuju
77.1%
Setuju secara keseluruhan
96.5%

Kegunaan keseluruhan

Secara keseluruhan, adakah ini tugas penilaian sains hayat yang kukuh?

Sangat setuju
79.1%
Setuju secara keseluruhan
96.6%

Komen pengulas mengukuhkan penarafan kuantitatif:

1 daripada 3
Secara keseluruhan, ini tugas yang kukuh kerana ia mempunyai satu tafsiran teras yang betul, sambil masih memberi ruang untuk membezakan jawapan yang lebih baik melalui ketelitian membatasi ketidakpastian.

Keputusan

Kami melaporkan dua metrik yang saling melengkapi. Kadar lulus ialah peratusan tugas yang model memenuhi ambang kejayaan tahap tugas sebanyak 70%. Skor ialah purata ganjaran rubrik, memberi kredit separa untuk kriteria individu walaupun tugas penuh tidak diselesaikan. Kedua-duanya penting kerana respons kepada tugas saintifik boleh betul atau berguna secara separa tanpa memenuhi setiap keperluan jawapan lengkap.

Prestasi model berbeza dengan ketara mengikut jenis tugas, aliran kerja dan format respons.

Bidang awal kekuatan sistem AI

LifeSciBench menunjukkan model perintis paling kuat secara relatif pada tugas yang melibatkan sintesis saintifik, komunikasi dan tafsiran berstruktur. Kadar lulus mutlak masih sederhana, jadi domain penanda aras ini masih jauh daripada tepu, tetapi GPT‑Rosalind menunjukkan kemajuan bermakna berbanding GPT‑5.5, dengan kadar lulus tepat keseluruhan meningkat daripada 25.7% kepada 36.1%.

Arah kemajuan paling kuat dalam keupayaan model muncul pada Komunikasi Saintifik dan Translasi. Contohnya, kadar lulus Komunikasi Saintifik meningkat daripada 56.3% bagi GPT‑5.5 kepada 71.1% bagi GPT‑Rosalind; kategori ini kecil (n=9), jadi harus ditafsir dengan berhati-hati, tetapi ia mencadangkan model perintis cepat bertambah baik dalam menyusun bukti dan menghasilkan penjelasan meyakinkan untuk pakar. Translasi (proses pembangunan ubat "daripada bangku makmal ke katil pesakit") menunjukkan pola serupa, meningkat daripada 36.8% bagi GPT‑5.5 kepada 57.7% bagi GPT‑Rosalind, mencadangkan model cepat bertambah baik dalam menghubungkan bukti praklinikal dengan implikasi klinikal.

Keputusan peringkat rubrik menunjukkan arah yang sama. Pada tugas yang memerlukan output berguna kepada pakar atau boleh diambil tindakan, GPT‑Rosalind menskor 44.7%, berbanding 29.1% bagi GPT‑5.5. Pada tugas yang memerlukan pengendalian ketidakpastian dan peringatan, ia menskor 44.8%, berbanding 29.3%. Pola ini mencadangkan model paling berguna apabila tugas mempunyai sempadan bukti yang jelas dan memerlukan pertimbangan saintifik berstruktur.

GPT‑Rosalind mendahului prestasi merentas tugas bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.

GPT‑Rosalind menerajui prestasi merentas tugasan bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.

GPT‑Rosalind menerajui prestasi merentas tugasan bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.

Bidang sistem AI masih ketinggalan

Prestasi kekal jauh lebih lemah pada kerja saintifik yang sarat artifak, berat reka bentuk dan terhad secara operasi. Khususnya, Reka Bentuk, Pengoptimuman & Ramalan kekal antara aliran kerja paling sukar, dengan kadar lulus GPT‑Rosalind pada 30.7%; Analisis juga sukar pada 30.3%.

Penggunaan artifak ialah jurang yang sangat jelas. Walaupun GPT‑Rosalind berprestasi lebih baik daripada GPT‑5.5 dalam tetapan sarat artifak, kadar lulusnya masih turun daripada 45.1% pada tugas teks sahaja kepada 28.1% pada tugas dengan artifak atau URL. GPT‑5.5 menunjukkan pola sama, turun daripada 29.9% kepada 21.9%. Analisis lebih terperinci mengesahkan bahawa model perintis bergelut mengekstrak maklumat daripada rajah kompleks atau fail jujukan besar dan menyepadukan maklumat itu ke dalam jawapan akhir.

Kadar lulus menurun apabila tugas memerlukan penaakulan berpaksikan sumber atau kerja dengan artifak

Format jawapan juga penting. Tugas yang memerlukan output tepat pada tahap jujukan, struktur atau konstruk menunjukkan kadar lulus lebih rendah: GPT‑Rosalind hanya mencapai 14.8% pada tugas numerik dan 24.0% pada output jujukan atau struktur. Tugas penjanaan konstruk juga rapuh, dengan GPT‑Rosalind pada 27.3% dan hanya sedikit peningkatan berbanding GPT‑5.5. Sebahagian jurang ini mungkin mencerminkan permukaan penggredan lebih ketat bagi tugas jawapan tepat, apabila perbezaan kecil dalam pengiraan atau format boleh menyebabkan respons jatuh di bawah ambang lulus. Namun, kegagalan ini bermakna dari segi sains kerana banyak aliran kerja sains hayat memerlukan output yang cukup tepat untuk digunakan terus, seperti dalam reka bentuk penderma CRISPR/HDR atau reka bentuk siRNA.

Model juga sering hampir sampai tanpa menyelesaikan tugas sepenuhnya. Dalam kira-kira 14% tugas, model memperoleh kredit rubrik yang besar walaupun gagal ambang lulus tepat. Bagi GPT‑Rosalind, 109 tugas mempunyai kadar lulus di bawah 20% sambil masih memperoleh sekurang-kurangnya 50% ganjaran rubrik. Dalam amalan, ini bermakna model mungkin mengenal pasti bukti berkaitan atau menghasilkan jawapan separa yang munasabah, tetapi masih gagal kerana terlepas kekangan utama, menggunakan bukti salah, membuat pengiraan tidak lengkap atau tidak menghubungkan penaakulan kepada keputusan akhir yang berguna secara saintifik.

Batasan & langkah seterusnya

LifeSciBench ialah langkah ke arah mengukur sejauh mana sistem AI boleh berguna untuk penyelidikan sains hayat, tetapi ia bukan pengganti kajian model dalam persekitaran penyelidikan langsung. Penanda aras ini tertumpu pada tugas serba lengkap yang mencerminkan aliran kerja industri berulang, sambil banyak kepakaran saintifik dan jenis tugas masih berada di luar skop semasanya. Penyelidikan sebenar bersifat berulang: saintis mengumpul bukti baharu, menyemak hipotesis, mereka bentuk eksperimen susulan dan menyesuaikan rancangan apabila hasil muncul.

Oleh itu, prestasi kukuh pada LifeSciBench harus ditafsir sebagai bukti keupayaan tahap tugas yang realistik, bukan ukuran langsung impak penyelidikan hiliran. Penanda aras ini berasaskan aliran kerja industri, tetapi tidak menangkap kepelbagaian atau dinamik penuh program penyelidikan langsung, yang kemajuannya bergantung pada faktor yang berkembang mengikut masa.

Langkah seterusnya ialah menghubungkan prestasi penanda aras dengan kajian penggunaan dalam aliran kerja penyelidikan langsung. Walaupun LifeSciBench dibangunkan bersama saintis yang beramal, pengukuran sama ada sistem AI mempercepat penemuan atau meningkatkan hasil R&D memerlukan kajian penggunaan dan prestasi model dalam tetapan penyelidikan sebenar, merentas tempoh lebih panjang serta beberapa pusingan penaakulan, maklum balas dan susulan eksperimen.

Libatkan diri

Bantu bentuk generasi seterusnya penanda aras AI sains hayat, atau mohon akses kepada GPT-Rosalind.

Penulis

OpenAI