GeneBench-Pro-ийг танилцуулж байна
Тооцооллын биологид хиймэл оюун ухааны агентууд хоёрдмол утгыг хэрхэн даван туулж, үр дагаварт хүргэх дүгнэлтийг хэрхэн гаргадагийг хэмждэг судалгааны түвшний жишиг.
Шинжлэх ухааны өгөгдөл зааварчилгаатай хамт ирэх нь ховор. Судлаачид хэв маяг нь биологи эсвэл чимээ шуугианыг тусгасан эсэх, өгөгдөл нь асууж буй асуултыг дэмжиж чадах эсэх, үр дүн бүр нь тэдний дараагийн алхамыг хэрхэн өөрчлөх ёстойг шийдэх ёстой. Хиймэл оюун ухааны агентууд нарийн төвөгтэй дүн шинжилгээ хийх чадвараа улам бүр нэмэгдүүлж байгаа ч жинхэнэ шинжлэх ухааны судалгаа нь зөвхөн баримтуудыг эргэн санах эсвэл урьдчилан тодорхойлсон ажлын урсгалыг дагахаас гадна эдгээр өндөр түвшний дүгнэлтийг гаргахаас хамаарна.
Өнөөдөр бид GeneBench-Pro-ийг танилцуулж байна. Энэ нь бодит ертөнцийн тооцооллын биологид шаардлагатай, дүгнэлт хийх өндөр чадвар шаардсан шинжилгээг загварууд гүйцэтгэж чадах эсэхийг үнэлэхэд зориулагдсан, судалгааны түвшний сорилт бүхий бенчмарк юм. Энэ нь {GeneBench(шинэ цонхонд нээгдэнэ)}-ийг өргөжүүлэн хөгжүүлж, геномик, тоон биологи болон трансляцийн анагаах ухааны хүрээнд илүү төвөгтэй, бодит нөхцөлд ойр даалгавруудыг хамарсан бөгөөд тооцооллын биологийн шинжлэх ухааны судалгаанд байдаг нарийн төвөгтэй байдал, давтагдан сайжруулдаг шинж чанар болон тодорхойгүй байдлыг тусган харуулдаг.
Өнөөдрийг хүртэл бодит ертөнцийн тооцооллын судалгааг хүндрүүлдэг системийн түвшний дүгнэлтийн талаар итгэл үнэмшилтэй үнэлгээ цөөн байсан. Үүнд тодорхойгүй нөхцөл байдлыг зохицуулах, таамаглалуудыг дахин үнэлэх, зөв шинжилгээний замыг сонгох, мөн үр дүн шийдвэр гаргахад хангалттай болсон эсэхийг таних зэрэг чадварууд багтана. Эдгээр ур чадварыг албан ёсоор тогтоох нь хэцүү тул, тэдгээрийн сул талууд нь хиймэл оюун ухааны нийт гүйцэтгэлийг улам бүр хязгаарлаж байгаа ч нарийн үнэлэхэд хэцүү хэвээр байна.
GeneBench-Pro нь эдгээр илүү өндөр түвшний чадваруудыг нарийн хэмжих зорилгоор бүтээгдсэн. GeneBench-Pro-д бид “судалгааны мэдрэмж”-ийг шинжилгээг хэлбэржүүлдэг шүүн тунгаах шийдвэрүүдийн хэлхээ гэж тодорхойлдог: өгөгдөл ямар асуултуудыг дэмжиж чадах, эхний оношилгоонууд загвар эсвэл үнэлэгдэх хэмжигдэхүүнийг хэрхэн өөрчлөх ёстой, мөн анхны төлөвлөгөөг хэзээ шинэчлэх шаардлагатай болох зэрэг. GeneBench-Pro-ийн асуудал бүр нь загварт бодит нөхцөлтэй, эмх цэгцгүй өгөгдлийн багц, туршилтын товч нөхцөл мэдээлэл, мөн дараагийн шатны шийдвэртэй холбоотой зорилтот үнэлэгдэх хэмжигдэхүүнийг өгдөг. Зөв хариулахын тулд загвар нь өгөгдлийг судалж, зохих аналитик аргыг сонгож, туршилтын давталтын үйл явцад оролцож, эцсийн хариултыг өгөх ёстой.
Биологийн салбарт өгөгдөл үүсгэх (жишээлбэл, геномын дараалал тогтоох) зардал эрс буурсан бөгөөд зарим судлаачид одоо хязгаарлах хүчин зүйл нь дээж цуглуулах биш харин дараагийн тооцоолол, шинжилгээ гэж үзэж байна(шинэ цонхонд нээгдэнэ). GeneBench-Pro нь энэхүү саадыг даван туулах ахиц дэвшлийг үнэлэх зорилгоор бүтээгдсэн бөгөөд тооцооллын биологийн өргөн хүрээний нөхцөл байдал, арга зүйг хамарсан 129 асуултаас бүрддэг.
Домэйн Атлас: 10 домэйн болон 21 дэд домэйн дэх 129 асуудлууд
Бенчмаркийн асуудлын талаар мэдэхийн тулд дээрх цэг дээр дарна уу.
Энэхүү атлас нь GeneBench-Pro-ийн хамрах хүрээний өргөн цар хүрээг урьдчилан харуулж байна. Кейс судалгааны хуудсанд зочилж, төлөөлөх шинжтэй 10 асуулттай илүү дэлгэрэнгүй танилцана уу.
GeneBench-Pro нь түгээмэл тохиолддог бенчмаркийн дутагдлуудаас зайлсхийх зорилгоор мөн бүтээгдсэн. Олон урт хугацааны биологийн жишигүүд нь эмх замбараагүй түүхэн өгөгдлийн багцын эргэн тойронд олон үе шаттай асуултуудыг бий болгодог бөгөөд шинжилгээнд ганц зөв зам байхгүй байж магадгүй юм. Агент нэг хамгаалалттай хязгаарыг сонгож, нөгөө нь өөр боловч ижил хамгаалалттай сонголтыг сонгож болох бөгөөд энэ нь загварын гүйцэтгэлийн үндсэн ялгаанаас илүү бенчмарк бүтээгчийн гаргасан дурын сонголтыг илэрхийлнэ. Эсрэгээрээ ч тохиолдож болно: хэрэв асуудал нь тоон хувьд хэт мэдрэг биш бол агент шинжилгээнд үндсэн алдаа гаргаж, гэлээ ч амжилттай үр дүн гаргаж чадна.
Эдгээр алдааны горимуудаас зайлсхийхийн тулд GeneBench-Pro асуудал бүрийг синтетик аргаар бүтээдэг: бид учир шалтгааны бүтцийг бүрэн мэддэг бөгөөд өгөгдөл үүсгэх процессыг шууд дуурайдаг. Энэ нь бидэнд асуудал бүрийн нарийн төвөгтэй байдлыг тохируулах, субъектив аналитик сонголтуудын боломжийн ялгаа нь хүлээн зөвшөөрөгдсөн тоон үр дүнг гаргаж байгаа эсэхийг баталгаажуулах, мөн (абляцийн судалгаагаар дамжуулан) үнэмшилтэй боловч буруу дүн шинжилгээ амжилтгүй болохыг баталгаажуулах боломжийг олгодог. Дараа нь бид мэдээллийн алдагдал болон зориудаар үүсээгүй шийдлийн замуудыг шалгахын тулд нарийвчилсан ул мөрийн шинжилгээгээр дамжуулан асуудлын ноорогуудыг аудит хийдэг. Энэ нь зөв хариултыг авах нь богино замыг ашиглах эсвэл зохиогчийн дурын сонголтод нийцүүлэхгүй байх бус харин зөв аналитик замыг сонгохоос хамаарна гэсэн итгэлийг бидэнд өгдөг.
Бид GeneBench-Pro-ийн 129 асуултын 82-ыг гадаад салбарын мэргэжилтнүүдэд илгээсэн бөгөөд үүнд докторын оюутнууд, докторын дараах судлаачид, үйлдвэрлэлийн салбарын эрдэмтэд болон профессор багш нар багтсан. Шүүмжлэгчид асуудал бүрийн бодит байдал, зорилтот хариултыг тодорхойлох боломжтой эсэх, арга зүй, тооцоолол тохиромжтой эсэхийг үнэлсэн. Асуудлыг сайжруулахын тулд санал хүсэлтийг ашигласан.
“Миний хянаж үзсэн асуудлуудыг туршлагатай удирдагчаас давтамжтай санал зөвлөгөө авахгүйгээр магистрын түвшний оюутан бүрэн гүйцэтгэхэд хүндрэлтэй байх байсан. Өгөгдөл нь амжилттай дуусгахын тулд болзошгүй алдаа дутагдлын талаар мэдлэгтэй, сайтар бодож боловсруулсан, тунгаан бодох шаардлагатай техникийн болон чанарын хяналтын асуудлуудыг агуулсан байсан; тэдгээр нь зүгээр л цэвэр, сайн боловсруулсан өгөгдөлд бэлэн аргыг хэрэглээгүй юм.”
“Одоогийн загварууд эхнээс нь дуустал бие даасан шинжилгээг найдвартай гүйцэтгэж чадахгүй байгаа ч GeneBench-Pro-ийн асуудлууд дээр өндөр гүйцэтгэл үзүүлдэг загварууд нь зөв ажлын урсгалыг тодорхойлох, өгөгдлийг судлан шинжлэхэд судлаачдад тодорхой хэмжээгээр туслах боломжтой юм. Энэ нь судалгааны хурд, нарийвчлал, давтагдах чадварыг эрс сайжруулж байгааг би харж байна.”
GeneBench-Pro-ийн асуудал бүр нь бие даасан шинжлэх ухааны шинжилгээ юм. Агентуудад богино хэмжээний өгөгдөл, өгөгдлийн файлууд, мөн Python, шинжлэх ухааны тооцооллын сангууд болон PLINK 2.0 зэрэг үндсэн геномикийн багцуудыг (хэдийгээр асуудлууд нь тухайн салбарын тусгай хэрэгслүүдийг заавал шаарддаггүй ч) багтаасан стандарт биоинформатикийн орчин бүхий тусгаарлагдсан ажлын талбарт хандах боломж олгогддог.
Бүтцийн хувилбарт тулгуурласан хавдрын эмчилгээний ашиг тус–эрсдэлийн шийдвэр
Бид өгөгдөл үүсгэх бүх үйл явцыг бүрэн хянадаг тул мэдэгдэж буй зорилтуудтай харьцуулан зөв байдлыг тодорхой, тогтвортой үнэлж, стандарт рубрик дээр суурилсан үнэлгээнд байдаг загвар сонголтын хувьсах байдал болон илүү дэлгэрэнгүй тайлбарын нөлөөллөөс зайлсхийдэг.
Асуудал бүр нь зориулалтын дүн шинжилгээний бүтэц, хавсаргасан өгөгдлийн файлууд, олон хуудастай дэлгэрэнгүй кейс судалгаа, шинжээчийн хяналтын үр дүн зэрэг баялаг мета өгөгдөлтэй ирдэг. Бид GeneBench-Pro-ийн төлөөлөх шинжтэй 10 асуултыг Hugging Face-(шинэ цонхонд нээгдэнэ)-д бүрэн нээлттэй эхийн хэлбэрээр нийтэлж байгаа бөгөөд тэдгээрийг үзэж танилцах зориулалттай интерактив вэб интерфэйс мөн санал болгож байна. Эцэст нь, бид ойрын хугацаанд бие даасан гуравдагч талын бенчмарк үнэлгээ хийх зорилгоор 50 асуултаас бүрдэх дэд багцыг Artificial Analysis(шинэ цонхонд нээгдэнэ)-д өгөх болно.
Манай хамгийн хүчирхэг загвар болох GPT‑5.6 Sol нь сэтгэн бодох хамгийн өндөр түвшинд 28.7% тэнцэх хувь үзүүлдэг (Pro горимыг идэвхжүүлсэн үед 31.5%). Энэ нь бид анхны GeneBench-ийг боловсруулж эхэлж байсан үеийнхээс эрс өссөн үзүүлэлт юм. Тухайн үед манай хамгийн дэвшилтэт хил хязгаарын загвар болох GPT‑5 нь 5%-иас бага оноо авч байв. Энэ шалгуур дээрх ахиц дэвшил нь хил хязгаарын загварууд хурдан сайжирч байгааг харуулж байна, тэр ч байтугай системийн түвшний шинжлэх ухааны сэтгэн бодох дээр ч гэсэн. Одоогийн хурдаар энэ жишиг жилийн эцэс гэхэд хангагдаж магадгүй юм.
Үр дүн нь туршилтын хугацааны тооцооллыг өргөжүүлэх нөлөөг харуулж байна. Хамгийн доод түвшний сэтгэн бодох тохиргоонд GPT‑5.6 Sol нь зөвхөн нэг оронтой тооны давсан хувьд хүрдэг. Хамгийн өндөр түвшний сэтгэн бодох тохиргоонд GPT‑5.6 Sol нь GPT‑5.2‑оос бараг зургаа дахин олон асуултыг бодож шийддэг. үүнийг хийхдээ мөн ойролцоогоор гуравны хоёр дахин цөөн токен ашигладаг.
Загварын бүлгүүдийн хооронд хийсэн харьцуулалтууд нь GPT загварууд тоон тодорхойгүй байдлын нөхцөлд өндөр түвшний шинжлэх ухааны сэтгэн бодох чадвараараа хамгийн хүчирхэг системүүдийн нэг болохыг харуулж байна. GPT‑5.6‑ийн гүйцэтгэлийн ялгаа GPT‑5.6, GPT‑5.5 болон GLM 5.2 зэрэг тэргүүлэх нээлттэй эхийн загваруудын хоорондын гүйцэтгэлийн зөрүү нь кодчиллын бенчмаркууд(шинэ цонхонд нээгдэнэ)-аас экстраполяци хийхэд хүлээгдэж байснаас мэдэгдэхүйц их байгаа нь нээлттэй эхийн загварууд өргөн хүрээний сэтгэн бодох чадвараас илүүтэй кодчилолд илүү мэргэшсэн болохыг харуулж байна.
Бид хөгжүүлэлтийн явцад асуудлуудыг үнэлж, улам боловсронгуй болгохын тулд хамгийн дэвшилтэт GPT загваруудыг ашигласан. Иймээс GeneBench-Pro нь бусад загварын гэр бүлүүдтэй харьцуулахад GPT загваруудад сөрөг өрөөсгөл хандлагатай байж магадгүй гэж бид таамагласан. Гэсэн хэдий ч өрсөлдөгч загварууд нь гарсан үед харгалзах GPT загварын гүйцэтгэлтэй хамгийн сайн таарч, ихэвчлэн нэлээд дутагдалтай байсан.
GeneBench-Pro-ийн асуултуудын —өндөр төвөгшилтэй байдлыг харгалзан үзвэл GPT‑5.6 Sol (Pro)—-ийн 31.5%-д хүрсэн эдгээр үнэлгээний үр дүн үнэхээр онцгой юм. Манай хянан үнэлэгчдийн дунд явуулсан судалгаагаар GeneBench-Pro-ийн нэг асуудлыг шийдвэрлэхэд хүний мэргэжилтэн дунджаар 20–40 цаг зарцуулна гэж үнэлсэн. Цагийн хөлсийг болгоомжтойгоор 200 ам.доллар гэж тооцвол нэг асуудлыг шийдвэрлэх хүний хөдөлмөрийн өртөг хэдэн мянган ам.долларт хүрнэ. Одоогийн хиймэл оюуны агентууд хүний мэргэжилтнүүдийг орлох хэмжээнд хараахан найдвартай биш хэвээр байгаа ч өртгийн ялгаа асар их бөгөөд нэг асуудалд ногдох интерфэйсийн зардал ердөө хэдхэн ам.доллар байдаг. Энэ нь одоогийн хүчин чадлаар хэсэгчилсэн автоматжуулалт ч гэсэн эдийн засаг, шинжлэх ухааны ач холбогдолтой үнэ цэнийг бий болгож чадна гэсэн үг юм.
“Эдгээр шалгуур үзүүлэлтүүд нь биологийн олон янзын асуултуудаас үүдэлтэй боловч бодит сорилт нь хайгуулын өгөгдлийн шинжилгээ, эдгээр нээлтүүдийн талаарх сэтгэн бодох үйл явцаас үүдэлтэй: хэв маяг, олдворуудыг тодорхойлох, өгөгдлийг хасах эсвэл тохируулах эсэхийг шийдэх юм. Энэ нь бодит биологийн өгөгдлийн багцуудын төвөгтэй, эмх замбараагүй шинж чанарыг тусгасан байдаг. Эдгээр үнэлгээг авч үзэхэд агентэд суурилсан шинжлэх ухааны асуудал шийдвэрлэлтийн хувьд шийдэгчийн үүрэг, хариуцлагыг тодорхой заасан гэрээ маш чухал болохыг харуулж байна. Өгөгдөлийн өөр өөр найруулга эсвэл даалгаврын тодорхойлолт нь ямар шинжилгээ хийхийг зөвшөөрнө гэж үзэхэд ихээхэн нөлөөлж болно.”
“Надад [the questions] хамгийн их таалагдсан. Эдгээр нь ихэвчлэн дараах хүчин зүйлсийн хослолыг агуулж байсан: (1) Эртний ДНХ-д ажиглагддаг C>T хазайлт зэрэг тухайн салбарын зайлшгүй шаардлагатай мэдлэг, (2) Угсаа гарлын солигдолт зэрэг өгөгдлийн зөрчил, (3) Тухайн асуудалд тохирох шинжилгээний арга хэрэгслийг мэдэх болон тэдгээрийг хэрхэн хэрэгжүүлэх талаарх ойлголт. Ихэнх төлөөлөгчид (2) дээр бүтэлгүйтсэн юм шиг санагдсан. Тэд өгөгдлийн асуудалд хангалттай болгоомжтой ханддаггүй. Магадгүй энэ нь одоогийн загваруудын сул талыг тодруулж байна. Мөн биологийн өгөгдлийн ихэнх хэсэгт янз бүрийн жигд бус байдал, гажуудал байдаг.”
Гэсэн хэдий ч хил хязгаарын загварууд эдгээр асуудлуудын гуравны нэгээс бага хувийг шийдэж байгаа нь сайжруулах их боломж байгааг харуулж байна. Загварууд төвөгтэй асуудлууд дээр хэсэгчлэн ахиц гаргаж чаддаг ч дүгнэлт хийх бүх үйл явцыг бүрэн дуусгаж, эцсийн үндэслэлтэй шийдэлд хүрэхэд хүндрэлтэй байдаг. Энэхүү алдааны хэв маяг нь хүний мэргэжилтнүүд болон анхан шатны суралцагчдын хоорондын ялгаатай төстэй байна. Мэргэжилтнүүд асуудлыг тодорхойлж, арга барилаа өөрчлөхийн тулд туршлагаа ашигладаг бол шинэ гишүүд ажиглалт хийдэг боловч тэдгээрийг асуудлын өргөн хүрээнд нэгтгэхэд бэрхшээлтэй байдаг.
Асуудал: Цаг хугацааны явцад өөрчлөгдөж буй эмчилгээтэй холбоотой фармакогеномикийн үйл явдал хүртэлх хугацааны хариу урвал
GPT-5.5 загвар
GPT-5.6 Sol загвар
Төгстэй ойрхон гүйцэтгэлд хүрэхийн тулд ахиц дэвшлийг найдвартай хэмжих, мөн загваруудын алдаатай хэсгүүдийг тодорхойлох үнэлгээ шаардлагатай. GeneBench-Pro зэрэг бенчмаркууд нь тодорхойгүй мэт харагддаг чадварын дутагдлыг оношилж, сайжруулах боломжтой тодорхой асуудал болгон хувиргахад тусалж чадна.
Хэрэв агентууд энэ төрлийн шинжилгээг найдвартай автоматжуулж чадвал шинжлэх ухааны нээлтийг мэдэгдэхүйц хурдасгаж чадна. Хүний генетикийн нотолгоо нь зорилтот эрэмбэлэлт болон трансляцийн хяналтад аль хэдийн гол үүрэг гүйцэтгэдэг, учир нь генетикийн дэмжлэгтэй механизм нь батлагдсан эмчилгээнд хүрэх магадлал өндөр байдаг.
Үүний зэрэгцээ дарааллын зардал буурч, биобанкийн хэмжээний өгөгдлийн багц одоо молекул, фенотип, эрүүл мэндийн бүртгэлийн мэдээллийг урьд өмнө байгаагүй өргөн хүрээнд холбодог. Хязгаарлагч хүчин зүйл нь өгөгдөл бий болгохоос мэдээллийг хэрэгжүүлэх боломжтой ойлголт, дүгнэлт болгон хувиргах үйл явц руу шилжиж байна. Одоо хүний мэргэжилтнүүдийн багууд гүйцэтгэдэг шинжилгээг тогтмол гүйцэтгэх чадвартай загварууд нь таамаглалын ангилалт, зорилтот мөрдлөг, өгөгдөл үүсгэх ба шийдвэр гаргах хоорондох давталтын мөчлөгийг хурдасгах замаар үйлдвэрлэлийн судалгааг өөрчилж чадна.
GeneBench-Pro нь туршлагатай мэргэжилтнүүдийн эзэмшдэг, шинжлэх ухааны үндэслэлтэй зөв дүгнэлт гаргахад шаардлагатай илүү хийсвэр чадваруудыг үнэлэх анхны оролдлого юм. Эдгээр чадварууд нь тэдэнд хамгийн ирээдүйтэй анхны дүн шинжилгээг зөн совингоороо олж харах, тодорхойлох, өгөгдөл анхны таамаглалтай зөрчилдөх үед сэтгэлгээгээ давтаж, өөрчлөх, цаашдын клиник, эрдэм шинжилгээний эсвэл бизнесийн шийдвэрүүдээс хамаарч болох дүгнэлтэд хүрэх боломжийг олгодог.
Бид загварын чадвар хөгжихийн хэрээр эдгээр өндөр түвшний абстракт чадварыг шалгадаг шалгуур үзүүлэлтүүд номын мэдлэг эсвэл энгийн шинжилгээ хийх чадвараас гадна улам бүр чухал болохыг таамаглаж байна.


