Ngenalake GeneBench-Pro
Tolok ukur tataran riset sing ngukur kepriyé agen AI ngadhepi lan ngatasi ambiguitas sarta nggawe kaputusan sing duwé akibat wigati ing biologi komputasional.
Data ilmiah arang teka kanthi pandhuan. Para panaliti perlu mutusake apa sawijining pola nggambarake proses biologis utawa mung derau, apa data kasebut bisa nyengkuyung pitakonan sing diajukake, lan kepiye saben asil kudu ngowahi apa sing bakal ditindakake sabanjure. Agen AI saya suwe saya nduwèni kemampuan kanggo nindakake analisis sing rumit, nanging panaliten ilmiah sing nyata ora mung gumantung marang ngelingi fakta utawa ngetutake alur kerja sing wis ditemtokake sadurungé, nanging uga marang nggawe panimbangan tingkat luwih dhuwur iki.
Dina iki, kita ngenalake GeneBench-Pro—pathokan tataran riset sing nantang kanggo nguji apa model bisa nangani jinis analisis sing mbutuhake akeh pertimbangan kaya sing dibutuhake biologi komputasional ing donya nyata. Iki ngembangaké GeneBench(mbukak ing jendhela anyar) supaya nyakup tugas-tugas sing luwih angel lan luwih realistis ing genomika, biologi kuantitatif, lan kedhokteran translasional, kanthi nggambarake kerumitan, sipat iteratif, lan ambiguitas panaliten ilmiah ing biologi komputasional.
Nganti saiki, durung akeh pambiji sing ngyakinake babagan keputusan adhedhasar pertimbangan ing tataran sistem sing ndadekake riset komputasional ing donya nyata dadi angel. Iki kalebu nangani kahanan sing ambigu, nyemak maneh asumsi, milih jalur analisis sing bener, lan ngerti kapan asil wis siap dadi dhasar keputusan. Amarga katrampilan-katrampilan iki angel diformalake, katrampilan kasebut uga angel dinilai kanthi ketat lan tliti, sanajan kekurangan ing babagan iki saya mbatesi kinerja AI sacara sakabèhé.
GeneBench-Pro dirancang kanggo ngukur kanthi tepat kapabilitas tingkat sing luwih dhuwur iki. Ing GeneBench-Pro, kita nemtokake “rasa panaliten” minangka rerangkening keputusan adhedhasar tetimbangan sing mbentuk sawijining analisis: pitakon apa wae sing bisa didhukung dening data, kepiye diagnostik awal kudu ngowahi model utawa estimand, lan kapan rencana wiwitan perlu direvisi. Saben soal GeneBench-Pro menehi model dataset sing realistis lan semrawut, konteks eksperimen ringkes, sarta estimand sasaran sing digandhengake karo kaputusan hilir. Kanggo menehi wangsulan kanthi bener, model kudu njelajah data, milih pendekatan analitis sing cocog, nindakake proses eksperimen kanthi iteratif, lan nyedhiyakake wangsulan pungkasan.
Ing biologi, biaya kanggo ngasilake data (contone, sekuensing genom) wis mudhun kanthi drastis, lan sawetara panaliti saiki negesake(mbukak ing jendhela anyar) yen faktor sing mbatesi saiki dudu maneh pangumpulan sampel, nanging komputasi lan analisis sabanjure. GeneBench-Pro dirancang kanggo ngevaluasi kemajuan kanggo ngatasi hambatan kasebut, kanthi 129 pitakonan sing nyakup maneka warna konteks lan metode biologi komputasional.
Domain Atlas: 129 masalah ing 10 domain lan 21 subdomain
Klik titik ing ndhuwur kanggo mangerteni babagan masalah benchmark.
Atlas iki nyedhiyakake pratilik babagan jembare cakupan GeneBench-Pro. Bukak kaca studi kasus kanggo njelajah 10 pitakonan representatif kanthi luwih rinci.
GeneBench-Pro uga dirancang kanggo ngindhari kegagalan benchmark sing umum. Akeh benchmark biologi jangka panjang nyusun pitakonan multi-langkah adhedhasar dataset historis sing ora rapi, ing ngendi bisa wae ora ana siji jalur sing bener kanggo ngliwati analisis kasebut. Sawijining agen bisa wae milih siji ambang wates sing bisa dipertanggungjawabake, dene agen liyane bisa milih opsi sing beda nanging padha-padha bisa dipertanggungjawabake, sing luwih nggambarake pilihan arbitrer sing digawe dening panyipta benchmark tinimbang prabédan dhasar apa wae ing kinerja model. Kosok baline uga bisa kedadeyan: yen sawijining masalah kakehan ora sensitif sacara numerik, agen bisa nggawe kesalahan dhasar ing analisis lan isih ngasilake asil sing lolos.
Kanggo nyingkiri mode-mode kegagalan iki, saben masalah GeneBench-Pro dibangun kanthi sintetis: kita ngerti struktur kausal kanthi lengkap lan langsung nyimulasi proses pangasilan data. Iki ndadekake kita bisa nyetel tingkat keruwetan saben masalah, mesthekake manawa prabédan sing lumrah ing pilihan analitis subjektif isih bisa ngasilake asil numerik sing ditampa, lan verifikasi (liwat studi ablasi) manawa analisis sing katon masuk akal nanging ora bener bakal gagal. Kita banjur ngaudit draf soal liwat analisis jejak sing rinci kanggo mriksa anané bocoran informasi lan jalur solusi sing ora disengaja. Iki ndadekake kita yakin manawa entuk jawaban sing bener gumantung marang milih jalur analitis sing pas, dudu marang nggunakake trabasan utawa nyocogake karo preferensi penulis sing sewenang-wenang.
Kita wis ngirim 82 saka 129 pitakon GeneBench-Pro marang para ahli bidang saka njaba, kalebu mahasiswa pascasarjana, peneliti pascadoktoral, ilmuwan industri, lan profesor. Para panelaah mbiji tingkat realistis saben masalah, apa wangsulan target bisa diidentifikasi, lan apa metode lan estimator sing digunakake wis cocog. Umpan balik digunakake kanggo ngapikake masalah.
“Masalah-masalah sing dakpriksa iku mesthiné bakal angel kanggo mahasiswa pascasarjana kanggo dirampungaké tanpa umpan balik bola-bali saka pembimbing sing wis pengalaman. Data kasebut ngemot masalah teknis lan kontrol mutu sing mbutuhake analisis data kanthi tliti, dipikir kanthi mateng, lan reflektif, kanthi kesadaran marang potensi jebakan utawa kaluputan supaya bisa dirampungake kanthi sukses; sing ditindakake dudu mung ngetrapake metodhe siap-pakai marang data sing resik lan wis dikurasi kanthi becik.”
“Sanajan model-model saiki durung bisa kanthi andal nindakake analisis mandiri saka wiwitan nganti pungkasan, model sing kinerjane apik ing masalah GeneBench-Pro kanthi cetha bakal bisa mbantu para panliti nemtokake alur kerja sing bener lan njelajah data. Aku bisa mangerteni manawa iku bisa ningkatake kanthi gedhe kacepetan, ketlitenan, lan reprodusibilitas panaliten.”
Saben masalah GeneBench-Pro minangka analisis ilmiah sing mandhiri. Agen nampa akses menyang ruang kerja sing kapisah kanthi prompt cekak, File data, lan stack bioinformatika standar sing kalebu Python, pustaka komputasi ilmiah, lan paket genomika dhasar kayata PLINK 2.0 (sanajan masalah kasebut ora mbutuhake piranti khusus domain).
Kaputusan Manfaat-Risiko Terapi Tumor Adhedhasar Varian Struktural
Amarga kita ngontrol kabeh proses ngasilake data, kita bisa mbiji kabeneran kanthi deterministik adhedhasar target sing wis dingerteni, saéngga nyingkiri variasi amarga pilihan model lan efek kakehan tembung sing ditemokake ing evaluasi standar adhedhasar rubrik.
Saben masalah uga dilengkapi karo metadata sing sugih, kalebu struktur analisis sing dituju, File data sing dilampirake, studi kasus rinci pirang-pirang kaca, lan asil tinjauan ahli. Kita mbukak kanthi lengkap 10 pitakonan GeneBench-Pro sing representatif minangka sumber terbuka ing Hugging Face(mbukak ing jendhela anyar), kanthi antarmuka web interaktif kanggo njelajah pitakonan kasebut. Pungkasané, kita bakal nyedhiyakake subset 50 pitakonan marang Artificial Analysis(mbukak ing jendhela anyar) kanggo benchmarking independen dening pihak katelu ing wektu cedhak.
Model paling kuwat kita, GPT‑5.6 Sol, nggayuh tingkat kelulusan 28,7% ing tingkat penalaran paling dhuwur (31,5% yen mode Pro diaktifake). Iki minangka kenaikan sing tajem dibandhingake nalika kita miwiti mbangun GeneBench asli; nalika semana, model frontier paling apik kita, GPT‑5, entuk skor ing ngisor 5%. Kemajuan ing pathokan pambiji iki nuduhake manawa model frontier saya cepet ningkat, sanajan ing panalaran ilmiah tingkat sistem sing kurang kasatmata. Kanthi laju saiki, tolok ukur iki bisa uga bakal jenuh ing pungkasan taun.
Asil kasebut uga nuduhake pangaruh saka ningkatake skala komputasi nalika wektu uji. Ing tingkat penalaran paling endhek, GPT‑5.6 Sol mung nggayuh tingkat kelulusan siji digit. Ing tingkat penalaran paling dhuwur, GPT‑5.6 Sol ngrampungaké meh kaping enem luwih akeh pitakon tinimbang GPT‑5.2 nindakake kanthi nggunakake udakara rong pertelu saka jumlah token.
Pambandhingan antarane kulawarga modèl nuduhaké yèn modèl GPT kalebu sistem sing paling kuwat kanggo panalaran ilmiah tingkat dhuwur ing kahanan ora mesthi kuantitatif. Prabédan kinerja antarane GPT‑5.6, Prabédan antara GPT‑5.5 lan model sumber terbuka unggulan kayata GLM 5.2 luwih gedhé banget tinimbang sing bakal kita kira nalika diekstrapolasi saka tolok ukur pemrograman(mbukak ing jendhela anyar), nuduhaké manawa model sumber terbuka luwih khusus kanggo pemrograman tinimbang kanggo kabisan nalar sing luwih jembar.
Kita nggunakake model GPT paling maju kanggo ngevaluasi lan nggawe soal-soal luwih kukuh sajrone pangembangan. Mula saka kuwi, kita nduga GeneBench-Pro bisa uga duwe bias marang model GPT yen dibandhingake karo kulawarga model liyane. Nanging, model pesaing paling apik mung bisa nyamai kinerja model GPT sing cocog nalika dirilis, lan biasane ketinggalan cukup adoh.
Asil evaluasi iki—nganti tekan 31,5% ing GPT‑5.6 Sol (Pro)—nggumunaké, yen ngelingi tingkat angèlé pitakonan GeneBench-Pro. Ing sawijining survei, para paninjau kita ngira manawa masalah GeneBench-Pro sing umum bakal mbutuhake pakar manungsa watara 20–40 jam kanggo ngrampungake. Kanthi taksiran konservatif $200 saben jam, iki ndadekake biaya tenaga kerja manungsa kanggo siji masalah tekan ewonan dolar. Agen AI saiki isih durung cukup andal kanggo ngganteni para pakar manungsa, nanging prabédan biayane gedhé, kanthi biaya inferensi mung sawetara dolar saben masalah. Tegesé, sanajan otomatisasi sing mung parsial kanthi kapabilitas saiki bisa ngasilaké nilai ekonomi lan ilmiah sing wigati.
“Tolok ukur kasebut dimotivasi dening maneka warna pitakon biologis, nanging … tantangan sejatine asale saka analisis data eksploratif lan panalaran adhedhasar panemon-panemon iki: ngenali pola lan artefak, lan mutusake apa data kudu dikecualekake utawa diatur. Iki mirip karo sipaté kumpulan data biologis nyata sing ruwet. Nyemak evaluasi-evaluasi iki negesake sepira pentinge kontrak solver sing cetha kanggo ngrampungake masalah ilmiah adhedhasar agen. Rumusan prompt utawa spesifikasi tugas sing beda bisa banget mengaruhi analisis apa wae sing katon kena ditindakake.”
“Umumé, aku seneng karo [pitakonan-pitakonan kuwi]. Dheweke cenderung nduwèni campuran saka: (1) Kawruh sing dibutuhake babagan subjek kasebut, kayata bias C>T ing DNA kuna, (2) Ketakcocokan data, kayata ijol-ijolan asal-usul leluhur, (3) Sawijining jinis kawruh babagan piranti analitis sing pas kanggo tugas kasebut lan carane ngetrapaké. Katoné akèh-akèhé agen gagal ing (2). Dheweke ora cukup ngati-ati babagan masalah data. Mbokmenawa kuwi nyorot kelemahane model-model saiki. Lan akeh data biologis nduweni ketidakteraturan.”
Sanajan mangkono, kasunyatan manawa model-model frontier isih ngrampungaké kurang saka saprateloné masalah iki nuduhaké yèn isih ana ruang gedhé kanggo paningkatan. Model bisa nggayuh kemajuan sebagean ing masalah sing nantang, nanging kangelan kanggo ngrampungake daur inferensial. Pola kegagalan iki nyerminké prabédan antarane para ahli manungsa lan para pamula. Para ahli migunakaké pengalamané kanggo ngrumusaké masalah lan nyelarasaké pendekatané, déné para pamula nindakake pengamatan nanging kangèlan nggabungaké pengamatan kuwi menyang konteks masalah sing luwih jembar.
Masalah: Respons farmakogenomik wektu-nganti-kedadeyan kanthi pangobatan sing owah miturut wektu
Pola GPT-5.5
Pola GPT-5.6 Sol
Kanggo nggayuh kinerja sing meh sampurna, dibutuhake evaluasi sing bisa ngukur kemajuan kanthi andal lan ngenali ing endi model isih gagal. Tolok ukur kaya GeneBench-Pro bisa mbantu ngowahi kekurangan kemampuan sing durung cetha dadi bab sing bisa didiagnosis lan ditingkatake.
Yen para agen bisa ngotomatisasi jinis analisis iki kanthi andal, dheweke bisa nyepetake panemuan ilmiah kanthi signifikan. Bukti genetik manungsa wis dadi unsur utama ing prioritisasi target lan tindak lanjut translasi, amarga mekanisme sing nduwèni dhukungan genetik luwih gedhé kemungkinané bakal ngasilaké pangobatan sing disetujoni.
Sauntara kuwi, biaya pangurutan sekuens wis mudhun drastis, lan dataset skala biobank saiki nggayutake informasi molekuler, fenotipik, lan cathetan kesehatan kanthi jembar sing durung tau ana sadurunge. Faktor sing dadi watesan lagi owah saka ngasilake data dadi ngowahi informasi kasebut dadi wawasan sing bisa ditindaklanjuti. Model sing bisa kanthi konsisten nindakake analisis sing saiki ditangani dening tim ahli manungsa bisa ngowahi panaliten industri kanthi nyepetake triase hipotesis, tindak lanjut target, lan siklus iterasi antarane pangasilan data lan pangambilan keputusan.
GeneBench-Pro nggambarake upaya wiwitan kanggo ngevaluasi katrampilan sing luwih abstrak sing dibutuhake kanggo panimbangan ilmiah sing apik, sing diduweni dening wong-wong sing wis berpengalaman. Katrampilan iki ngidini dheweke nggraita lan ngenali analisis wiwitan sing paling njanjeni, mbaleni proses lan nyemak maneh pamikirane nalika data mbantah asumsi wiwitan, sarta tekan dudutan sing bisa dadi dhasar kanggo keputusan klinis, akademik, utawa bisnis ing tahap sabanjure.
Kita ngira manawa nalika kabisan model saya maju, tolok ukur sing nguji kabisan model ing tataran abstraksi sing luwih dhuwur iki bakal saya migunani, ngluwihi tolok ukur sing mung nguji kawruh saka buku utawa kabisan kanggo nindakake analisis rutin.


