Liwati menyang isi utama
OpenAI

30 Juni 2026

RisetPublikasi

Ngenalake GeneBench-Pro

Tolok ukur tataran riset sing ngukur kepriyé agen AI ngadhepi lan ngatasi ambiguitas sarta nggawe kaputusan sing duwé akibat wigati ing biologi komputasional.

Lagi dimuat…

Data ilmiah arang teka kanthi pandhuan. Para panaliti perlu mutusake apa sawijining pola nggambarake proses biologis utawa mung derau, apa data kasebut bisa nyengkuyung pitakonan sing diajukake, lan kepiye saben asil kudu ngowahi apa sing bakal ditindakake sabanjure. Agen AI saya suwe saya nduwèni kemampuan kanggo nindakake analisis sing rumit, nanging panaliten ilmiah sing nyata ora mung gumantung marang ngelingi fakta utawa ngetutake alur kerja sing wis ditemtokake sadurungé, nanging uga marang nggawe panimbangan tingkat luwih dhuwur iki.

Dina iki, kita ngenalake GeneBench-Pro—pathokan tataran riset sing nantang kanggo nguji apa model bisa nangani jinis analisis sing mbutuhake akeh pertimbangan kaya sing dibutuhake biologi komputasional ing donya nyata. Iki ngembangaké GeneBench(mbukak ing jendhela anyar) supaya nyakup tugas-tugas sing luwih angel lan luwih realistis ing genomika, biologi kuantitatif, lan kedhokteran translasional, kanthi nggambarake kerumitan, sipat iteratif, lan ambiguitas panaliten ilmiah ing biologi komputasional. 

Nganti saiki, durung akeh pambiji sing ngyakinake babagan keputusan adhedhasar pertimbangan ing tataran sistem sing ndadekake riset komputasional ing donya nyata dadi angel. Iki kalebu nangani kahanan sing ambigu, nyemak maneh asumsi, milih jalur analisis sing bener, lan ngerti kapan asil wis siap dadi dhasar keputusan. Amarga katrampilan-katrampilan iki angel diformalake, katrampilan kasebut uga angel dinilai kanthi ketat lan tliti, sanajan kekurangan ing babagan iki saya mbatesi kinerja AI sacara sakabèhé.

Diagram kanthi irah-irahan “Longkangan benchmark ing biologi” sing mbandhingake alur kerja benchmark tradisional karo analisis ilmiah saka wiwitan nganti pungkasan, nuduhake langkah tambahan kayata praproses, pemodelan, diagnostik, lan panyempurnaan iteratif sadurunge tekan kesimpulan ilmiah.

GeneBench-Pro dirancang kanggo ngukur kanthi tepat kapabilitas tingkat sing luwih dhuwur iki. Ing GeneBench-Pro, kita nemtokake “rasa panaliten” minangka rerangkening keputusan adhedhasar tetimbangan sing mbentuk sawijining analisis: pitakon apa wae sing bisa didhukung dening data, kepiye diagnostik awal kudu ngowahi model utawa estimand, lan kapan rencana wiwitan perlu direvisi. Saben soal GeneBench-Pro menehi model dataset sing realistis lan semrawut, konteks eksperimen ringkes, sarta estimand sasaran sing digandhengake karo kaputusan hilir. Kanggo menehi wangsulan kanthi bener, model kudu njelajah data, milih pendekatan analitis sing cocog, nindakake proses eksperimen kanthi iteratif, lan nyedhiyakake wangsulan pungkasan.

Konstruksi set data

Ing biologi, biaya kanggo ngasilake data (contone, sekuensing genom) wis mudhun kanthi drastis, lan sawetara panaliti saiki negesake(mbukak ing jendhela anyar) yen faktor sing mbatesi saiki dudu maneh pangumpulan sampel, nanging komputasi lan analisis sabanjure. GeneBench-Pro dirancang kanggo ngevaluasi kemajuan kanggo ngatasi hambatan kasebut, kanthi 129 pitakonan sing nyakup maneka warna konteks lan metode biologi komputasional.

Domain Atlas: 129 masalah ing 10 domain lan 21 subdomain

Gunakake tombol panah kanggo pindhah ing antarane soal benchmark. Rincian masalah sing dipilih ditampilake ing ngisor iki.

Klik titik ing ndhuwur kanggo mangerteni babagan masalah benchmark.

Atlas iki nyedhiyakake pratilik babagan jembare cakupan GeneBench-Pro. Bukak kaca studi kasus kanggo njelajah 10 pitakonan representatif kanthi luwih rinci.

GeneBench-Pro uga dirancang kanggo ngindhari kegagalan benchmark sing umum. Akeh benchmark biologi jangka panjang nyusun pitakonan multi-langkah adhedhasar dataset historis sing ora rapi, ing ngendi bisa wae ora ana siji jalur sing bener kanggo ngliwati analisis kasebut. Sawijining agen bisa wae milih siji ambang wates sing bisa dipertanggungjawabake, dene agen liyane bisa milih opsi sing beda nanging padha-padha bisa dipertanggungjawabake, sing luwih nggambarake pilihan arbitrer sing digawe dening panyipta benchmark tinimbang prabédan dhasar apa wae ing kinerja model. Kosok baline uga bisa kedadeyan: yen sawijining masalah kakehan ora sensitif sacara numerik, agen bisa nggawe kesalahan dhasar ing analisis lan isih ngasilake asil sing lolos.

Kanggo nyingkiri mode-mode kegagalan iki, saben masalah GeneBench-Pro dibangun kanthi sintetis: kita ngerti struktur kausal kanthi lengkap lan langsung nyimulasi proses pangasilan data. Iki ndadekake kita bisa nyetel tingkat keruwetan saben masalah, mesthekake manawa prabédan sing lumrah ing pilihan analitis subjektif isih bisa ngasilake asil numerik sing ditampa, lan verifikasi (liwat studi ablasi) manawa analisis sing katon masuk akal nanging ora bener bakal gagal. Kita banjur ngaudit draf soal liwat analisis jejak sing rinci kanggo mriksa anané bocoran informasi lan jalur solusi sing ora disengaja. Iki ndadekake kita yakin manawa entuk jawaban sing bener gumantung marang milih jalur analitis sing pas, dudu marang nggunakake trabasan utawa nyocogake karo preferensi penulis sing sewenang-wenang.

Diagram kanthi irah-irahan “Konstruksi lan validasi masalah GeneBench-Pro,” sing nuduhaké alur kerja saka mbangun tugas sing bisa dijalanké liwat paninjauan, pamariksaan ketangguhan, pangujian agen, paninjauan ahli, revisi, nganti dadi masalah benchmark sing wis rampung.

Kita wis ngirim 82 saka 129 pitakon GeneBench-Pro marang para ahli bidang saka njaba, kalebu mahasiswa pascasarjana, peneliti pascadoktoral, ilmuwan industri, lan profesor. Para panelaah mbiji tingkat realistis saben masalah, apa wangsulan target bisa diidentifikasi, lan apa metode lan estimator sing digunakake wis cocog. Umpan balik digunakake kanggo ngapikake masalah.

1 saka 2
Masalah-masalah sing dakpriksa iku mesthiné bakal angel kanggo mahasiswa pascasarjana kanggo dirampungaké tanpa umpan balik bola-bali saka pembimbing sing wis pengalaman. Data kasebut ngemot masalah teknis lan kontrol mutu sing mbutuhake analisis data kanthi tliti, dipikir kanthi mateng, lan reflektif, kanthi kesadaran marang potensi jebakan utawa kaluputan supaya bisa dirampungake kanthi sukses; sing ditindakake dudu mung ngetrapake metodhe siap-pakai marang data sing resik lan wis dikurasi kanthi becik.
Alexander Strudwick Young, Asisten Profesor Genetika Manungsa ing UCLA

Evaluasi lan pambiji

Saben masalah GeneBench-Pro minangka analisis ilmiah sing mandhiri. Agen nampa akses menyang ruang kerja sing kapisah kanthi prompt cekak, File data, lan stack bioinformatika standar sing kalebu Python, pustaka komputasi ilmiah, lan paket genomika dhasar kayata PLINK 2.0 (sanajan masalah kasebut ora mbutuhake piranti khusus domain).

Kaputusan Manfaat-Risiko Terapi Tumor Adhedhasar Varian Struktural

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

Amarga kita ngontrol kabeh proses ngasilake data, kita bisa mbiji kabeneran kanthi deterministik adhedhasar target sing wis dingerteni, saéngga nyingkiri variasi amarga pilihan model lan efek kakehan tembung sing ditemokake ing evaluasi standar adhedhasar rubrik.

Saben masalah uga dilengkapi karo metadata sing sugih, kalebu struktur analisis sing dituju, File data sing dilampirake, studi kasus rinci pirang-pirang kaca, lan asil tinjauan ahli. Kita mbukak kanthi lengkap 10 pitakonan GeneBench-Pro sing representatif minangka sumber terbuka ing Hugging Face(mbukak ing jendhela anyar), kanthi antarmuka web interaktif kanggo njelajah pitakonan kasebut. Pungkasané, kita bakal nyedhiyakake subset 50 pitakonan marang Artificial Analysis(mbukak ing jendhela anyar) kanggo benchmarking independen dening pihak katelu ing wektu cedhak.

Asil

Model paling kuwat kita, GPT‑5.6 Sol, nggayuh tingkat kelulusan 28,7% ing tingkat penalaran paling dhuwur (31,5% yen mode Pro diaktifake). Iki minangka kenaikan sing tajem dibandhingake nalika kita miwiti mbangun GeneBench asli; nalika semana, model frontier paling apik kita, GPT‑5, entuk skor ing ngisor 5%. Kemajuan ing pathokan pambiji iki nuduhake manawa model frontier saya cepet ningkat, sanajan ing panalaran ilmiah tingkat sistem sing kurang kasatmata. Kanthi laju saiki, tolok ukur iki bisa uga bakal jenuh ing pungkasan taun.

Asil kasebut uga nuduhake pangaruh saka ningkatake skala komputasi nalika wektu uji. Ing tingkat penalaran paling endhek, GPT‑5.6 Sol mung nggayuh tingkat kelulusan siji digit. Ing tingkat penalaran paling dhuwur, GPT‑5.6 Sol ngrampungaké meh kaping enem luwih akeh pitakon tinimbang GPT‑5.2 nindakake kanthi nggunakake udakara rong pertelu saka jumlah token.

Pambandhingan antarane kulawarga modèl nuduhaké yèn modèl GPT kalebu sistem sing paling kuwat kanggo panalaran ilmiah tingkat dhuwur ing kahanan ora mesthi kuantitatif. Prabédan kinerja antarane GPT‑5.6, Prabédan antara GPT‑5.5 lan model sumber terbuka unggulan kayata GLM 5.2 luwih gedhé banget tinimbang sing bakal kita kira nalika diekstrapolasi saka tolok ukur pemrograman(mbukak ing jendhela anyar), nuduhaké manawa model sumber terbuka luwih khusus kanggo pemrograman tinimbang kanggo kabisan nalar sing luwih jembar.

Kita nggunakake model GPT paling maju kanggo ngevaluasi lan nggawe soal-soal luwih kukuh sajrone pangembangan. Mula saka kuwi, kita nduga GeneBench-Pro bisa uga duwe bias marang model GPT yen dibandhingake karo kulawarga model liyane. Nanging, model pesaing paling apik mung bisa nyamai kinerja model GPT sing cocog nalika dirilis, lan biasane ketinggalan cukup adoh.

Asil evaluasi iki—nganti tekan 31,5% ing GPT‑5.6 Sol (Pro)—nggumunaké, yen ngelingi tingkat angèlé pitakonan GeneBench-Pro. Ing sawijining survei, para paninjau kita ngira manawa masalah GeneBench-Pro sing umum bakal mbutuhake pakar manungsa watara 20–40 jam kanggo ngrampungake. Kanthi taksiran konservatif $200 saben jam, iki ndadekake biaya tenaga kerja manungsa kanggo siji masalah tekan ewonan dolar. Agen AI saiki isih durung cukup andal kanggo ngganteni para pakar manungsa, nanging prabédan biayane gedhé, kanthi biaya inferensi mung sawetara dolar saben masalah. Tegesé, sanajan otomatisasi sing mung parsial kanthi kapabilitas saiki bisa ngasilaké nilai ekonomi lan ilmiah sing wigati.

1 saka 2
Tolok ukur kasebut dimotivasi dening maneka warna pitakon biologis, nanging … tantangan sejatine asale saka analisis data eksploratif lan panalaran adhedhasar panemon-panemon iki: ngenali pola lan artefak, lan mutusake apa data kudu dikecualekake utawa diatur. Iki mirip karo sipaté kumpulan data biologis nyata sing ruwet. Nyemak evaluasi-evaluasi iki negesake sepira pentinge kontrak solver sing cetha kanggo ngrampungake masalah ilmiah adhedhasar agen. Rumusan prompt utawa spesifikasi tugas sing beda bisa banget mengaruhi analisis apa wae sing katon kena ditindakake.
Cyrillus Tan, Rekan Peneliti Pascadoktoral ing New York Genome Center

Sanajan mangkono, kasunyatan manawa model-model frontier isih ngrampungaké kurang saka saprateloné masalah iki nuduhaké yèn isih ana ruang gedhé kanggo paningkatan. Model bisa nggayuh kemajuan sebagean ing masalah sing nantang, nanging kangelan kanggo ngrampungake daur inferensial. Pola kegagalan iki nyerminké prabédan antarane para ahli manungsa lan para pamula. Para ahli migunakaké pengalamané kanggo ngrumusaké masalah lan nyelarasaké pendekatané, déné para pamula nindakake pengamatan nanging kangèlan nggabungaké pengamatan kuwi menyang konteks masalah sing luwih jembar.

Masalah: Respons farmakogenomik wektu-nganti-kedadeyan kanthi pangobatan sing owah miturut wektu

Wiwitan pangobatan, tanggapan khusus genotipe, farmakodinamika sing tertunda, indikator pangguna prevalen, lan biomarker longitudinal bebarengan nemtokake estimand kasintasan kausal.

Pola GPT-5.5

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

Pola GPT-5.6 Sol

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

Kanggo nggayuh kinerja sing meh sampurna, dibutuhake evaluasi sing bisa ngukur kemajuan kanthi andal lan ngenali ing endi model isih gagal. Tolok ukur kaya GeneBench-Pro bisa mbantu ngowahi kekurangan kemampuan sing durung cetha dadi bab sing bisa didiagnosis lan ditingkatake. 

Yen para agen bisa ngotomatisasi jinis analisis iki kanthi andal, dheweke bisa nyepetake panemuan ilmiah kanthi signifikan. Bukti genetik manungsa wis dadi unsur utama ing prioritisasi target lan tindak lanjut translasi, amarga mekanisme sing nduwèni dhukungan genetik luwih gedhé kemungkinané bakal ngasilaké pangobatan sing disetujoni.

Sauntara kuwi, biaya pangurutan sekuens wis mudhun drastis, lan dataset skala biobank saiki nggayutake informasi molekuler, fenotipik, lan cathetan kesehatan kanthi jembar sing durung tau ana sadurunge. Faktor sing dadi watesan lagi owah saka ngasilake data dadi ngowahi informasi kasebut dadi wawasan sing bisa ditindaklanjuti. Model sing bisa kanthi konsisten nindakake analisis sing saiki ditangani dening tim ahli manungsa bisa ngowahi panaliten industri kanthi nyepetake triase hipotesis, tindak lanjut target, lan siklus iterasi antarane pangasilan data lan pangambilan keputusan.

GeneBench-Pro nggambarake upaya wiwitan kanggo ngevaluasi katrampilan sing luwih abstrak sing dibutuhake kanggo panimbangan ilmiah sing apik, sing diduweni dening wong-wong sing wis berpengalaman. Katrampilan iki ngidini dheweke nggraita lan ngenali analisis wiwitan sing paling njanjeni, mbaleni proses lan nyemak maneh pamikirane nalika data mbantah asumsi wiwitan, sarta tekan dudutan sing bisa dadi dhasar kanggo keputusan klinis, akademik, utawa bisnis ing tahap sabanjure. 

Kita ngira manawa nalika kabisan model saya maju, tolok ukur sing nguji kabisan model ing tataran abstraksi sing luwih dhuwur iki bakal saya migunani, ngluwihi tolok ukur sing mung nguji kawruh saka buku utawa kabisan kanggo nindakake analisis rutin.

Pangarang

OpenAI