Memperkenalkan LifeSciBench
Penanda aras ditulis dan disemak pakar, berasaskan penyelidikan sains hayat dunia sebenar
Sistem AI beragen semakin berupaya melaksanakan tugas saintifik. Namun, kegunaannya kepada penyelidik sains hayat bergantung pada keupayaan menangani kerumitan penyelidikan sebenar. Kerja itu jarang kelihatan seperti satu soalan mengingat fakta atau masalah ramalan yang bersih. Penyelidik mentafsir bukti tidak lengkap, menyelaraskan hasil bercanggah, mereka bentuk eksperimen sukar, menyelesaikan masalah asai, menilai risiko translasi dan memutuskan langkah seterusnya dalam ketidakpastian.
Penanda aras semasa belum menangkap sepenuhnya keupayaan ini. Banyak penilaian sains hayat tertumpu pada domain sempit atau kemahiran terasing, lalu menghasilkan soalan berformat berstruktur dan jawapan rujukan yang bersih. Walaupun bernilai, penilaian ini sering gagal menilai dengan sebenar-benarnya sama ada model boleh menyumbang merentas julat kerja tahap penyelidikan yang lebih luas.
Kami mereka bentuk LifeSciBench untuk membantu merapatkan jurang ini. Setiap tugas berasaskan pertimbangan saintis sains hayat yang beramal, terlatih pada tahap Ph.D. dan berpengalaman langsung memajukan program penemuan ubat dalam bioteknologi dan farmaseutikal.
LifeSciBench merangkumi 750 tugas karangan pakar merentas tujuh aliran kerja dan tujuh domain biologi.
1,062
Artifak tugas
173
Penyumbang saintis
19,020
Kriteria rubrik
453
Pengulas pakar
Apa yang diukur oleh LifeSciBench
LifeSciBench mengukur sama ada sistem AI boleh menyokong tugas penyelidikan sains hayat yang realistik, bukan sekadar menjawab soalan biologi. Untuk mentakrif taksonomi penanda aras, kami meninjau saintis sains hayat yang beramal tentang aliran kerja paling kerap mereka gunakan dalam penyelidikan gunaan. Kemudian, kami mengumpulkan jawapan mereka kepada tujuh kategori berulang: pengendalian bukti, analisis, reka bentuk dan pengoptimuman, penaakulan saintifik, pengesahan dan operasi, translasi serta komunikasi saintifik.
Setiap tugas distruktur seperti permintaan seorang saintis kepada kolaborator berpengetahuan: gesaan saintifik, sebarang konteks atau artifak berkaitan dan jawapan respons bebas. Rubrik tulisan pakar menilai sama ada model boleh menghasilkan jawapan tepat untuk masalah tertentu, dengan tahap perincian, justifikasi, peringatan dan format yang dijangka oleh saintis.
Pembinaan set data
LifeSciBench menilai penaakulan saintifik bersama kemahiran praktikal yang kurang jelas tetapi perlu untuk kegunaan saintifik dunia sebenar. Tugasnya meminta model mengerjakan masalah penyelidikan realistik: mentafsir bukti, membuat pertimbangan berasaskan domain dan menyampaikan kesimpulan yang berguna kepada pengulas pakar. Banyak tugas juga memerlukan model menangani ketidakpastian dan menaakul atas fail data sokongan, bukan bergantung pada teks gesaan semata-mata.
Penanda aras ini direka untuk mencerminkan kerumitan kerja sains hayat. Secara keseluruhan, 79% tugas memerlukan beberapa langkah penaakulan atau membuat keputusan, dengan purata empat langkah bagi setiap tugas. LifeSciBench merangkumi 1,062 artifak lampiran meliputi rajah, PDF, jadual, fail jujukan, fail struktur atau kimia dan rujukan web. Lebih separuh tugas (53%) memerlukan model mentafsir atau mensintesis maklumat daripada sekurang-kurangnya satu artifak.
Tugas dicipta oleh 173 saintis pakar merentas pelbagai disiplin sains hayat. Setiap saintis mempunyai latihan tahap Ph.D. dan pengalaman industri bioteknologi atau farmaseutikal. Tugas boleh melalui sebanyak mana kitaran semakan yang diperlukan sebelum diterima, tanpa had tetap bilangan pusingan; tugas yang diterima mencatat purata enam kitaran semakan automatik kendiri dan menamatkan sekurang-kurangnya dua pusingan semakan pakar. Semakan berpaksikan sama ada jawapan betul yang boleh disahkan atau konsensus pakar yang kukuh, dengan sekurang-kurangnya 90% persetujuan dalam kalangan pengulas domain berkaitan. Proses ini membantu memastikan tugas yang diterima berasaskan sains, cukup jelas untuk digredkan dan mewakili penyelidikan gunaan.
Pecahan penggredan dan rubrik
Tugas LifeSciBench digredkan dengan rubrik terperinci khusus tugas yang menguraikan respons dijangka kepada dakwaan saintifik, pengiraan, keputusan, justifikasi dan sebagainya yang khusus. Merentas penanda aras, rubrik dibangunkan pakar merangkumi 19,020 kriteria—purata 25 bagi setiap tugas—untuk menilai ketepatan saintifik dan kegunaan bagi keputusan penyelidikan.
Reka bentuk ini mencerminkan cara kerja saintifik dinilai dalam amalan: banyak tugas sains hayat tidak boleh digredkan dengan menyemak jawapan akhir sahaja. Sesuatu respons mungkin mencapai kesimpulan aras tinggi yang betul tetapi masih dianggap tidak lengkap jika, contohnya, ia terlepas had asai utama atau gagal mengutarakan secara proaktif nuansa biologi yang amat penting. Sebaliknya, respons separa mungkin mengandungi penaakulan berkualiti tinggi walaupun tidak menyelesaikan tugas sepenuhnya.
Rubrik berbutir menangkap nuansa ini. LifeSciBench menilai bukan sahaja ketepatan jawapan akhir, tetapi sama ada model mencapai jawapannya secara sah dari segi sains dan berguna dari segi operasi.
Mengesahkan LifeSciBench
Kami mengesahkan LifeSciBench melalui semakan pakar bebas. Maklum balas datang daripada 453 pengulas yang tidak terlibat menulis tugas. Daripada pengulas itu, 97% memiliki Ph.D. atau doktor falsafah setara, dengan purata 12 tahun pengalaman bidang dan 14 penerbitan semakan rakan sebaya; 88% melaporkan menerima sekurang-kurangnya satu anugerah atau felowship.
Pengulas menskor sama ada setiap tugas mencerminkan kualiti yang diperlukan untuk soalan penanda aras yang kukuh: keselarasan dengan kerja penyelidikan dunia sebenar, ujian penaakulan saintifik dan kepakaran domain yang sesuai, asas pada bukti atau konsensus pakar serta kegunaan keseluruhan untuk menilai prestasi model. Persetujuan melebihi 96% dalam setiap kategori.
Komen pengulas mengukuhkan penarafan kuantitatif:
Keputusan
Kami melaporkan dua metrik yang saling melengkapi. Kadar lulus ialah peratusan tugas yang model memenuhi ambang kejayaan tahap tugas sebanyak 70%. Skor ialah purata ganjaran rubrik, memberi kredit separa untuk kriteria individu walaupun tugas penuh tidak diselesaikan. Kedua-duanya penting kerana respons kepada tugas saintifik boleh betul atau berguna secara separa tanpa memenuhi setiap keperluan jawapan lengkap.
Prestasi model berbeza dengan ketara mengikut jenis tugas, aliran kerja dan format respons.
Bidang awal kekuatan sistem AI
LifeSciBench menunjukkan model perintis paling kuat secara relatif pada tugas yang melibatkan sintesis saintifik, komunikasi dan tafsiran berstruktur. Kadar lulus mutlak masih sederhana, jadi domain penanda aras ini masih jauh daripada tepu, tetapi GPT‑Rosalind menunjukkan kemajuan bermakna berbanding GPT‑5.5, dengan kadar lulus tepat keseluruhan meningkat daripada 25.7% kepada 36.1%.
Arah kemajuan paling kuat dalam keupayaan model muncul pada Komunikasi Saintifik dan Translasi. Contohnya, kadar lulus Komunikasi Saintifik meningkat daripada 56.3% bagi GPT‑5.5 kepada 71.1% bagi GPT‑Rosalind; kategori ini kecil (n=9), jadi harus ditafsir dengan berhati-hati, tetapi ia mencadangkan model perintis cepat bertambah baik dalam menyusun bukti dan menghasilkan penjelasan meyakinkan untuk pakar. Translasi (proses pembangunan ubat "daripada bangku makmal ke katil pesakit") menunjukkan pola serupa, meningkat daripada 36.8% bagi GPT‑5.5 kepada 57.7% bagi GPT‑Rosalind, mencadangkan model cepat bertambah baik dalam menghubungkan bukti praklinikal dengan implikasi klinikal.
Keputusan peringkat rubrik menunjukkan arah yang sama. Pada tugas yang memerlukan output berguna kepada pakar atau boleh diambil tindakan, GPT‑Rosalind menskor 44.7%, berbanding 29.1% bagi GPT‑5.5. Pada tugas yang memerlukan pengendalian ketidakpastian dan peringatan, ia menskor 44.8%, berbanding 29.3%. Pola ini mencadangkan model paling berguna apabila tugas mempunyai sempadan bukti yang jelas dan memerlukan pertimbangan saintifik berstruktur.
GPT‑Rosalind mendahului prestasi merentas tugas bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.
GPT‑Rosalind menerajui prestasi merentas tugasan bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.
GPT‑Rosalind menerajui prestasi merentas tugasan bernilai saintifik yang dikenal pasti oleh pakar industri dan akademik.
Bidang sistem AI masih ketinggalan
Prestasi kekal jauh lebih lemah pada kerja saintifik yang sarat artifak, berat reka bentuk dan terhad secara operasi. Khususnya, Reka Bentuk, Pengoptimuman & Ramalan kekal antara aliran kerja paling sukar, dengan kadar lulus GPT‑Rosalind pada 30.7%; Analisis juga sukar pada 30.3%.
Penggunaan artifak ialah jurang yang sangat jelas. Walaupun GPT‑Rosalind berprestasi lebih baik daripada GPT‑5.5 dalam tetapan sarat artifak, kadar lulusnya masih turun daripada 45.1% pada tugas teks sahaja kepada 28.1% pada tugas dengan artifak atau URL. GPT‑5.5 menunjukkan pola sama, turun daripada 29.9% kepada 21.9%. Analisis lebih terperinci mengesahkan bahawa model perintis bergelut mengekstrak maklumat daripada rajah kompleks atau fail jujukan besar dan menyepadukan maklumat itu ke dalam jawapan akhir.
Kadar lulus menurun apabila tugas memerlukan penaakulan berpaksikan sumber atau kerja dengan artifak
Format jawapan juga penting. Tugas yang memerlukan output tepat pada tahap jujukan, struktur atau konstruk menunjukkan kadar lulus lebih rendah: GPT‑Rosalind hanya mencapai 14.8% pada tugas numerik dan 24.0% pada output jujukan atau struktur. Tugas penjanaan konstruk juga rapuh, dengan GPT‑Rosalind pada 27.3% dan hanya sedikit peningkatan berbanding GPT‑5.5. Sebahagian jurang ini mungkin mencerminkan permukaan penggredan lebih ketat bagi tugas jawapan tepat, apabila perbezaan kecil dalam pengiraan atau format boleh menyebabkan respons jatuh di bawah ambang lulus. Namun, kegagalan ini bermakna dari segi sains kerana banyak aliran kerja sains hayat memerlukan output yang cukup tepat untuk digunakan terus, seperti dalam reka bentuk penderma CRISPR/HDR atau reka bentuk siRNA.
Model juga sering hampir sampai tanpa menyelesaikan tugas sepenuhnya. Dalam kira-kira 14% tugas, model memperoleh kredit rubrik yang besar walaupun gagal ambang lulus tepat. Bagi GPT‑Rosalind, 109 tugas mempunyai kadar lulus di bawah 20% sambil masih memperoleh sekurang-kurangnya 50% ganjaran rubrik. Dalam amalan, ini bermakna model mungkin mengenal pasti bukti berkaitan atau menghasilkan jawapan separa yang munasabah, tetapi masih gagal kerana terlepas kekangan utama, menggunakan bukti salah, membuat pengiraan tidak lengkap atau tidak menghubungkan penaakulan kepada keputusan akhir yang berguna secara saintifik.
Batasan & langkah seterusnya
LifeSciBench ialah langkah ke arah mengukur sejauh mana sistem AI boleh berguna untuk penyelidikan sains hayat, tetapi ia bukan pengganti kajian model dalam persekitaran penyelidikan langsung. Penanda aras ini tertumpu pada tugas serba lengkap yang mencerminkan aliran kerja industri berulang, sambil banyak kepakaran saintifik dan jenis tugas masih berada di luar skop semasanya. Penyelidikan sebenar bersifat berulang: saintis mengumpul bukti baharu, menyemak hipotesis, mereka bentuk eksperimen susulan dan menyesuaikan rancangan apabila hasil muncul.
Oleh itu, prestasi kukuh pada LifeSciBench harus ditafsir sebagai bukti keupayaan tahap tugas yang realistik, bukan ukuran langsung impak penyelidikan hiliran. Penanda aras ini berasaskan aliran kerja industri, tetapi tidak menangkap kepelbagaian atau dinamik penuh program penyelidikan langsung, yang kemajuannya bergantung pada faktor yang berkembang mengikut masa.
Langkah seterusnya ialah menghubungkan prestasi penanda aras dengan kajian penggunaan dalam aliran kerja penyelidikan langsung. Walaupun LifeSciBench dibangunkan bersama saintis yang beramal, pengukuran sama ada sistem AI mempercepat penemuan atau meningkatkan hasil R&D memerlukan kajian penggunaan dan prestasi model dalam tetapan penyelidikan sebenar, merentas tempoh lebih panjang serta beberapa pusingan penaakulan, maklum balas dan susulan eksperimen.


