Үндсэн агуулга руу алгасах
OpenAI

2026 оны зургаадугаар сарын 30

СудалгааНийтлэл

GeneBench-Pro-ийг танилцуулж байна

Тооцооллын биологид хиймэл оюун ухааны агентууд хоёрдмол утгыг хэрхэн даван туулж, үр дагаварт хүргэх дүгнэлтийг хэрхэн гаргадагийг хэмждэг судалгааны түвшний жишиг.

Ачаалж байна…

Шинжлэх ухааны өгөгдөл зааварчилгаатай хамт ирэх нь ховор. Судлаачид хэв маяг нь биологи эсвэл чимээ шуугианыг тусгасан эсэх, өгөгдөл нь асууж буй асуултыг дэмжиж чадах эсэх, үр дүн бүр нь тэдний дараагийн алхамыг хэрхэн өөрчлөх ёстойг шийдэх ёстой. Хиймэл оюун ухааны агентууд нарийн төвөгтэй дүн шинжилгээ хийх чадвараа улам бүр нэмэгдүүлж байгаа ч жинхэнэ шинжлэх ухааны судалгаа нь зөвхөн баримтуудыг эргэн санах эсвэл урьдчилан тодорхойлсон ажлын урсгалыг дагахаас гадна эдгээр өндөр түвшний дүгнэлтийг гаргахаас хамаарна.

Өнөөдөр бид GeneBench-Pro-ийг танилцуулж байна. Энэ нь бодит ертөнцийн тооцооллын биологид шаардлагатай, дүгнэлт хийх өндөр чадвар шаардсан шинжилгээг загварууд гүйцэтгэж чадах эсэхийг үнэлэхэд зориулагдсан, судалгааны түвшний сорилт бүхий бенчмарк юм. Энэ нь {GeneBench(шинэ цонхонд нээгдэнэ)}-ийг өргөжүүлэн хөгжүүлж, геномик, тоон биологи болон трансляцийн анагаах ухааны хүрээнд илүү төвөгтэй, бодит нөхцөлд ойр даалгавруудыг хамарсан бөгөөд тооцооллын биологийн шинжлэх ухааны судалгаанд байдаг нарийн төвөгтэй байдал, давтагдан сайжруулдаг шинж чанар болон тодорхойгүй байдлыг тусган харуулдаг. 

Өнөөдрийг хүртэл бодит ертөнцийн тооцооллын судалгааг хүндрүүлдэг системийн түвшний дүгнэлтийн талаар итгэл үнэмшилтэй үнэлгээ цөөн байсан. Үүнд тодорхойгүй нөхцөл байдлыг зохицуулах, таамаглалуудыг дахин үнэлэх, зөв шинжилгээний замыг сонгох, мөн үр дүн шийдвэр гаргахад хангалттай болсон эсэхийг таних зэрэг чадварууд багтана. Эдгээр ур чадварыг албан ёсоор тогтоох нь хэцүү тул, тэдгээрийн сул талууд нь хиймэл оюун ухааны нийт гүйцэтгэлийг улам бүр хязгаарлаж байгаа ч нарийн үнэлэхэд хэцүү хэвээр байна.

“Биологи дахь бенчмаркийн зөрүү” нэртэй диаграмм бөгөөд уламжлалт бенчмаркийн ажлын урсгалыг төгсгөлөөс төгсгөл хүртэлх шинжлэх ухааны шинжилгээтэй харьцуулан, шинжлэх ухааны дүгнэлтэд хүрэхээс өмнөх өгөгдөл урьдчилан боловсруулах, загварчлал хийх, оношилгоо хийх, давтан сайжруулах зэрэг нэмэлт алхмуудыг харуулсан байна.

GeneBench-Pro нь эдгээр илүү өндөр түвшний чадваруудыг нарийн хэмжих зорилгоор бүтээгдсэн. GeneBench-Pro-д бид “судалгааны мэдрэмж”-ийг шинжилгээг хэлбэржүүлдэг шүүн тунгаах шийдвэрүүдийн хэлхээ гэж тодорхойлдог: өгөгдөл ямар асуултуудыг дэмжиж чадах, эхний оношилгоонууд загвар эсвэл үнэлэгдэх хэмжигдэхүүнийг хэрхэн өөрчлөх ёстой, мөн анхны төлөвлөгөөг хэзээ шинэчлэх шаардлагатай болох зэрэг. GeneBench-Pro-ийн асуудал бүр нь загварт бодит нөхцөлтэй, эмх цэгцгүй өгөгдлийн багц, туршилтын товч нөхцөл мэдээлэл, мөн дараагийн шатны шийдвэртэй холбоотой зорилтот үнэлэгдэх хэмжигдэхүүнийг өгдөг. Зөв хариулахын тулд загвар нь өгөгдлийг судалж, зохих аналитик аргыг сонгож, туршилтын давталтын үйл явцад оролцож, эцсийн хариултыг өгөх ёстой.

Өгөгдлийн багц бүрдүүлэлт

Биологийн салбарт өгөгдөл үүсгэх (жишээлбэл, геномын дараалал тогтоох) зардал эрс буурсан бөгөөд зарим судлаачид одоо хязгаарлах хүчин зүйл нь дээж цуглуулах биш харин дараагийн тооцоолол, шинжилгээ гэж үзэж байна(шинэ цонхонд нээгдэнэ). GeneBench-Pro нь энэхүү саадыг даван туулах ахиц дэвшлийг үнэлэх зорилгоор бүтээгдсэн бөгөөд тооцооллын биологийн өргөн хүрээний нөхцөл байдал, арга зүйг хамарсан 129 асуултаас бүрддэг.

Домэйн Атлас: 10 домэйн болон 21 дэд домэйн дэх 129 асуудлууд

Жишиг бодлогуудын хооронд шилжихийн тулд сумтай товчлууруудыг ашиглана уу. Сонгосон асуудлын дэлгэрэнгүй мэдээлэл доор харагдаж байна.

Бенчмаркийн асуудлын талаар мэдэхийн тулд дээрх цэг дээр дарна уу.

Энэхүү атлас нь GeneBench-Pro-ийн хамрах хүрээний өргөн цар хүрээг урьдчилан харуулж байна. Кейс судалгааны хуудсанд зочилж, төлөөлөх шинжтэй 10 асуулттай илүү дэлгэрэнгүй танилцана уу.

GeneBench-Pro нь түгээмэл тохиолддог бенчмаркийн дутагдлуудаас зайлсхийх зорилгоор мөн бүтээгдсэн. Олон урт хугацааны биологийн жишигүүд нь эмх замбараагүй түүхэн өгөгдлийн багцын эргэн тойронд олон үе шаттай асуултуудыг бий болгодог бөгөөд шинжилгээнд ганц зөв зам байхгүй байж магадгүй юм. Агент нэг хамгаалалттай хязгаарыг сонгож, нөгөө нь өөр боловч ижил хамгаалалттай сонголтыг сонгож болох бөгөөд энэ нь загварын гүйцэтгэлийн үндсэн ялгаанаас илүү бенчмарк бүтээгчийн гаргасан дурын сонголтыг илэрхийлнэ. Эсрэгээрээ ч тохиолдож болно: хэрэв асуудал нь тоон хувьд хэт мэдрэг биш бол агент шинжилгээнд үндсэн алдаа гаргаж, гэлээ ч амжилттай үр дүн гаргаж чадна.

Эдгээр алдааны горимуудаас зайлсхийхийн тулд GeneBench-Pro асуудал бүрийг синтетик аргаар бүтээдэг: бид учир шалтгааны бүтцийг бүрэн мэддэг бөгөөд өгөгдөл үүсгэх процессыг шууд дуурайдаг. Энэ нь бидэнд асуудал бүрийн нарийн төвөгтэй байдлыг тохируулах, субъектив аналитик сонголтуудын боломжийн ялгаа нь хүлээн зөвшөөрөгдсөн тоон үр дүнг гаргаж байгаа эсэхийг баталгаажуулах, мөн (абляцийн судалгаагаар дамжуулан) үнэмшилтэй боловч буруу дүн шинжилгээ амжилтгүй болохыг баталгаажуулах боломжийг олгодог. Дараа нь бид мэдээллийн алдагдал болон зориудаар үүсээгүй шийдлийн замуудыг шалгахын тулд нарийвчилсан ул мөрийн шинжилгээгээр дамжуулан асуудлын ноорогуудыг аудит хийдэг. Энэ нь зөв хариултыг авах нь богино замыг ашиглах эсвэл зохиогчийн дурын сонголтод нийцүүлэхгүй байх бус харин зөв аналитик замыг сонгохоос хамаарна гэсэн итгэлийг бидэнд өгдөг.

"GeneBench-Pro асуудлыг боловсруулах ба баталгаажуулах нь” гэсэн гарчигтай диаграмм бөгөөд ажиллуулж болох даалгавар бүтээхээс эхлээд хянан шалгах, бат бөх байдлын шалгалт хийх, агентын туршилт явуулах, мэргэжилтний үнэлгээ авах, засварлах, улмаар эцсийн бенчмарк асуудал болгон боловсруулах хүртэлх ажлын урсгалыг харуулсан.

Бид GeneBench-Pro-ийн 129 асуултын 82-ыг гадаад салбарын мэргэжилтнүүдэд илгээсэн бөгөөд үүнд докторын оюутнууд, докторын дараах судлаачид, үйлдвэрлэлийн салбарын эрдэмтэд болон профессор багш нар багтсан. Шүүмжлэгчид асуудал бүрийн бодит байдал, зорилтот хариултыг тодорхойлох боломжтой эсэх, арга зүй, тооцоолол тохиромжтой эсэхийг үнэлсэн. Асуудлыг сайжруулахын тулд санал хүсэлтийг ашигласан.

1 -н 2
Миний хянаж үзсэн асуудлуудыг туршлагатай удирдагчаас давтамжтай санал зөвлөгөө авахгүйгээр магистрын түвшний оюутан бүрэн гүйцэтгэхэд хүндрэлтэй байх байсан. Өгөгдөл нь амжилттай дуусгахын тулд болзошгүй алдаа дутагдлын талаар мэдлэгтэй, сайтар бодож боловсруулсан, тунгаан бодох шаардлагатай техникийн болон чанарын хяналтын асуудлуудыг агуулсан байсан; тэдгээр нь зүгээр л цэвэр, сайн боловсруулсан өгөгдөлд бэлэн аргыг хэрэглээгүй юм.
UCLA-ийн Хүний генетикийн туслах профессор Александр Струдвик Янг

Үнэлгээ ба дүгнэлт

GeneBench-Pro-ийн асуудал бүр нь бие даасан шинжлэх ухааны шинжилгээ юм. Агентуудад богино хэмжээний өгөгдөл, өгөгдлийн файлууд, мөн Python, шинжлэх ухааны тооцооллын сангууд болон PLINK 2.0 зэрэг үндсэн геномикийн багцуудыг (хэдийгээр асуудлууд нь тухайн салбарын тусгай хэрэгслүүдийг заавал шаарддаггүй ч) багтаасан стандарт биоинформатикийн орчин бүхий тусгаарлагдсан ажлын талбарт хандах боломж олгогддог.

Бүтцийн хувилбарт тулгуурласан хавдрын эмчилгээний ашиг тус–эрсдэлийн шийдвэр

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

Бид өгөгдөл үүсгэх бүх үйл явцыг бүрэн хянадаг тул мэдэгдэж буй зорилтуудтай харьцуулан зөв байдлыг тодорхой, тогтвортой үнэлж, стандарт рубрик дээр суурилсан үнэлгээнд байдаг загвар сонголтын хувьсах байдал болон илүү дэлгэрэнгүй тайлбарын нөлөөллөөс зайлсхийдэг.

Асуудал бүр нь зориулалтын дүн шинжилгээний бүтэц, хавсаргасан өгөгдлийн файлууд, олон хуудастай дэлгэрэнгүй кейс судалгаа, шинжээчийн хяналтын үр дүн зэрэг баялаг мета өгөгдөлтэй ирдэг. Бид GeneBench-Pro-ийн төлөөлөх шинжтэй 10 асуултыг Hugging Face-(шинэ цонхонд нээгдэнэ)-д бүрэн нээлттэй эхийн хэлбэрээр нийтэлж байгаа бөгөөд тэдгээрийг үзэж танилцах зориулалттай интерактив вэб интерфэйс мөн санал болгож байна. Эцэст нь, бид ойрын хугацаанд бие даасан гуравдагч талын бенчмарк үнэлгээ хийх зорилгоор 50 асуултаас бүрдэх дэд багцыг Artificial Analysis(шинэ цонхонд нээгдэнэ)-д өгөх болно.

Үр дүн

Манай хамгийн хүчирхэг загвар болох GPT‑5.6 Sol нь сэтгэн бодох хамгийн өндөр түвшинд 28.7% тэнцэх хувь үзүүлдэг (Pro горимыг идэвхжүүлсэн үед 31.5%). Энэ нь бид анхны GeneBench-ийг боловсруулж эхэлж байсан үеийнхээс эрс өссөн үзүүлэлт юм. Тухайн үед манай хамгийн дэвшилтэт хил хязгаарын загвар болох GPT‑5 нь 5%-иас бага оноо авч байв. Энэ шалгуур дээрх ахиц дэвшил нь хил хязгаарын загварууд хурдан сайжирч байгааг харуулж байна, тэр ч байтугай системийн түвшний шинжлэх ухааны сэтгэн бодох дээр ч гэсэн. Одоогийн хурдаар энэ жишиг жилийн эцэс гэхэд хангагдаж магадгүй юм.

Үр дүн нь туршилтын хугацааны тооцооллыг өргөжүүлэх нөлөөг харуулж байна. Хамгийн доод түвшний сэтгэн бодох тохиргоонд GPT‑5.6 Sol нь зөвхөн нэг оронтой тооны давсан хувьд хүрдэг. Хамгийн өндөр түвшний сэтгэн бодох тохиргоонд GPT‑5.6 Sol нь GPT‑5.2‑оос бараг зургаа дахин олон асуултыг бодож шийддэг. үүнийг хийхдээ мөн ойролцоогоор гуравны хоёр дахин цөөн токен ашигладаг.

Загварын бүлгүүдийн хооронд хийсэн харьцуулалтууд нь GPT загварууд тоон тодорхойгүй байдлын нөхцөлд өндөр түвшний шинжлэх ухааны сэтгэн бодох чадвараараа хамгийн хүчирхэг системүүдийн нэг болохыг харуулж байна. GPT‑5.6‑ийн гүйцэтгэлийн ялгаа GPT‑5.6, GPT‑5.5 болон GLM 5.2 зэрэг тэргүүлэх нээлттэй эхийн загваруудын хоорондын гүйцэтгэлийн зөрүү нь кодчиллын бенчмаркууд(шинэ цонхонд нээгдэнэ)-аас экстраполяци хийхэд хүлээгдэж байснаас мэдэгдэхүйц их байгаа нь нээлттэй эхийн загварууд өргөн хүрээний сэтгэн бодох чадвараас илүүтэй кодчилолд илүү мэргэшсэн болохыг харуулж байна.

Бид хөгжүүлэлтийн явцад асуудлуудыг үнэлж, улам боловсронгуй болгохын тулд хамгийн дэвшилтэт GPT загваруудыг ашигласан. Иймээс GeneBench-Pro нь бусад загварын гэр бүлүүдтэй харьцуулахад GPT загваруудад сөрөг өрөөсгөл хандлагатай байж магадгүй гэж бид таамагласан. Гэсэн хэдий ч өрсөлдөгч загварууд нь гарсан үед харгалзах GPT загварын гүйцэтгэлтэй хамгийн сайн таарч, ихэвчлэн нэлээд дутагдалтай байсан.

GeneBench-Pro-ийн асуултуудын —өндөр төвөгшилтэй байдлыг харгалзан үзвэл GPT‑5.6 Sol (Pro)—-ийн 31.5%-д хүрсэн эдгээр үнэлгээний үр дүн үнэхээр онцгой юм. Манай хянан үнэлэгчдийн дунд явуулсан судалгаагаар GeneBench-Pro-ийн нэг асуудлыг шийдвэрлэхэд хүний мэргэжилтэн дунджаар 20–40 цаг зарцуулна гэж үнэлсэн. Цагийн хөлсийг болгоомжтойгоор 200 ам.доллар гэж тооцвол нэг асуудлыг шийдвэрлэх хүний хөдөлмөрийн өртөг хэдэн мянган ам.долларт хүрнэ. Одоогийн хиймэл оюуны агентууд хүний мэргэжилтнүүдийг орлох хэмжээнд хараахан найдвартай биш хэвээр байгаа ч өртгийн ялгаа асар их бөгөөд нэг асуудалд ногдох интерфэйсийн зардал ердөө хэдхэн ам.доллар байдаг. Энэ нь одоогийн хүчин чадлаар хэсэгчилсэн автоматжуулалт ч гэсэн эдийн засаг, шинжлэх ухааны ач холбогдолтой үнэ цэнийг бий болгож чадна гэсэн үг юм.

1 -н 2
Эдгээр шалгуур үзүүлэлтүүд нь биологийн олон янзын асуултуудаас үүдэлтэй боловч бодит сорилт нь хайгуулын өгөгдлийн шинжилгээ, эдгээр нээлтүүдийн талаарх сэтгэн бодох үйл явцаас үүдэлтэй: хэв маяг, олдворуудыг тодорхойлох, өгөгдлийг хасах эсвэл тохируулах эсэхийг шийдэх юм. Энэ нь бодит биологийн өгөгдлийн багцуудын төвөгтэй, эмх замбараагүй шинж чанарыг тусгасан байдаг. Эдгээр үнэлгээг авч үзэхэд агентэд суурилсан шинжлэх ухааны асуудал шийдвэрлэлтийн хувьд шийдэгчийн үүрэг, хариуцлагыг тодорхой заасан гэрээ маш чухал болохыг харуулж байна. Өгөгдөлийн өөр өөр найруулга эсвэл даалгаврын тодорхойлолт нь ямар шинжилгээ хийхийг зөвшөөрнө гэж үзэхэд ихээхэн нөлөөлж болно.
Сириллус Тан, Нью-Йоркийн Геномын Төвийн докторын дараах судалгааны ажилтан

Гэсэн хэдий ч хил хязгаарын загварууд эдгээр асуудлуудын гуравны нэгээс бага хувийг шийдэж байгаа нь сайжруулах их боломж байгааг харуулж байна. Загварууд төвөгтэй асуудлууд дээр хэсэгчлэн ахиц гаргаж чаддаг ч дүгнэлт хийх бүх үйл явцыг бүрэн дуусгаж, эцсийн үндэслэлтэй шийдэлд хүрэхэд хүндрэлтэй байдаг. Энэхүү алдааны хэв маяг нь хүний мэргэжилтнүүд болон анхан шатны суралцагчдын хоорондын ялгаатай төстэй байна. Мэргэжилтнүүд асуудлыг тодорхойлж, арга барилаа өөрчлөхийн тулд туршлагаа ашигладаг бол шинэ гишүүд ажиглалт хийдэг боловч тэдгээрийг асуудлын өргөн хүрээнд нэгтгэхэд бэрхшээлтэй байдаг.

Асуудал: Цаг хугацааны явцад өөрчлөгдөж буй эмчилгээтэй холбоотой фармакогеномикийн үйл явдал хүртэлх хугацааны хариу урвал

Эмчилгээ эхлэх хугацаа, генотипээс хамаарах хариу урвал, удаашралтай фармакодинамик нөлөө, өмнө нь хэрэглэж байсан эсэхийг илтгэх үзүүлэлтүүд, мөн уртын хугацааны биомаркерууд нь шалтгаант амьд үлдэх үзүүлэлтийг хамтад нь тодорхойлдог.

GPT-5.5 загвар

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

GPT-5.6 Sol загвар

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

Төгстэй ойрхон гүйцэтгэлд хүрэхийн тулд ахиц дэвшлийг найдвартай хэмжих, мөн загваруудын алдаатай хэсгүүдийг тодорхойлох үнэлгээ шаардлагатай. GeneBench-Pro зэрэг бенчмаркууд нь тодорхойгүй мэт харагддаг чадварын дутагдлыг оношилж, сайжруулах боломжтой тодорхой асуудал болгон хувиргахад тусалж чадна. 

Хэрэв агентууд энэ төрлийн шинжилгээг найдвартай автоматжуулж чадвал шинжлэх ухааны нээлтийг мэдэгдэхүйц хурдасгаж чадна. Хүний генетикийн нотолгоо нь зорилтот эрэмбэлэлт болон трансляцийн хяналтад аль хэдийн гол үүрэг гүйцэтгэдэг, учир нь генетикийн дэмжлэгтэй механизм нь батлагдсан эмчилгээнд хүрэх магадлал өндөр байдаг.

Үүний зэрэгцээ дарааллын зардал буурч, биобанкийн хэмжээний өгөгдлийн багц одоо молекул, фенотип, эрүүл мэндийн бүртгэлийн мэдээллийг урьд өмнө байгаагүй өргөн хүрээнд холбодог. Хязгаарлагч хүчин зүйл нь өгөгдөл бий болгохоос мэдээллийг хэрэгжүүлэх боломжтой ойлголт, дүгнэлт болгон хувиргах үйл явц руу шилжиж байна. Одоо хүний мэргэжилтнүүдийн багууд гүйцэтгэдэг шинжилгээг тогтмол гүйцэтгэх чадвартай загварууд нь таамаглалын ангилалт, зорилтот мөрдлөг, өгөгдөл үүсгэх ба шийдвэр гаргах хоорондох давталтын мөчлөгийг хурдасгах замаар үйлдвэрлэлийн судалгааг өөрчилж чадна.

GeneBench-Pro нь туршлагатай мэргэжилтнүүдийн эзэмшдэг, шинжлэх ухааны үндэслэлтэй зөв дүгнэлт гаргахад шаардлагатай илүү хийсвэр чадваруудыг үнэлэх анхны оролдлого юм. Эдгээр чадварууд нь тэдэнд хамгийн ирээдүйтэй анхны дүн шинжилгээг зөн совингоороо олж харах, тодорхойлох, өгөгдөл анхны таамаглалтай зөрчилдөх үед сэтгэлгээгээ давтаж, өөрчлөх, цаашдын клиник, эрдэм шинжилгээний эсвэл бизнесийн шийдвэрүүдээс хамаарч болох дүгнэлтэд хүрэх боломжийг олгодог. 

Бид загварын чадвар хөгжихийн хэрээр эдгээр өндөр түвшний абстракт чадварыг шалгадаг шалгуур үзүүлэлтүүд номын мэдлэг эсвэл энгийн шинжилгээ хийх чадвараас гадна улам бүр чухал болохыг таамаглаж байна.

Зохиогч

OpenAI