Անցնել հիմնական բովանդակությանը
OpenAI

Ներկայացնում ենք GeneBench-Pro-ն

Հետազոտական մակարդակի չափորոշիչ, որը գնահատում է, թե ինչպես են արհեստական բանականության գործակալները կողմնորոշվում անորոշության մեջ և նշանակալի հետևանքներ ունեցող դատողություններ կատարում հաշվողական կենսաբանության ոլորտում։

Բեռնվում է…

Գիտական տվյալները հազվադեպ են ուղեկցվում հրահանգներով։ Հետազոտողները պետք է որոշեն՝ արդյոք որևէ օրինաչափություն արտացոլում է կենսաբանական երևույթ, թե՞ աղմուկ, արդյոք տվյալները կարող են հիմնավորել առաջադրված հարցը, և ինչպես պետք է յուրաքանչյուր արդյունք փոխի նրանց հետագա քայլերը։ Արհեստական բանականության գործակալները դառնում են ավելի ունակ բարդ վերլուծություններ իրականացնել, սակայն իրական գիտական հետազոտությունը հիմնված է ոչ միայն փաստեր հիշելու կամ նախապես սահմանված աշխատանքային գործընթացին հետևելու վրա, այլև այդ բարձր կարգի դատողություններ կատարելու վրա։

Այսօր ներկայացնում ենք GeneBench-Pro-ն՝ բարդ, հետազոտական մակարդակի չափանիշ, որը նախատեսված է ստուգելու, թե արդյոք մոդելները կարող են կատարել այնպիսի դատողություն պահանջող վերլուծություն, որն անհրաժեշտ է իրական աշխարհի հաշվողական կենսաբանության մեջ։ Այն ընդլայնում է GeneBench(բացվում է նոր պատուհանում) ՝ ընդգրկելով ավելի բարդ և ավելի իրատեսական առաջադրանքներ գենոմիկայի, քանակական կենսաբանության և տրանսլացիոն բժշկության ոլորտներում՝ արտացոլելով հաշվարկային կենսաբանության մեջ գիտական հետազոտության բարդությունը, կրկնվող բնույթը և անորոշությունը։ 

Մինչ օրս քիչ են եղել համոզիչ գնահատումները համակարգային մակարդակի այն դատողության վրա հիմնված որոշումների վերաբերյալ, որոնք դժվարացնում են իրական միջավայրերում հաշվարկային հետազոտությունների իրականացումը։ Դրանք ներառում են անորոշության կառավարումը, ենթադրությունների վերանայումը, վերլուծության ճիշտ ուղու ընտրությունը և հասկանալը, թե երբ է արդյունքը պատրաստ որոշումների կայացման համար։ Քանի որ այս հմտությունները դժվար է ձևականացնել, դրանք նաև դժվար է խիստ գնահատել, մինչդեռ դրանցում առկա թույլ կողմերը գնալով ավելի են սահմանափակում արհեստական բանականության ընդհանուր արդյունավետությունը։

«Բենչմարկային բացը կենսաբանության մեջ» վերնագրով դիագրամ, որը համեմատում է ավանդական բենչմարկային աշխատանքային գործընթացները սկզբից մինչև վերջ ընդգրկող գիտական վերլուծության հետ՝ ցույց տալով լրացուցիչ քայլեր, ինչպիսիք են նախամշակումը, մոդելավորումը, ախտորոշումը և կրկնվող կատարելագործումը՝ մինչև գիտական եզրակացության հասնելը։

GeneBench-Pro-ը նախագծված է այս ավելի բարձր մակարդակի կարողությունները ճշգրտորեն չափելու համար։ GeneBench-Pro-ի շրջանակում մենք «հետազոտական ճաշակը» սահմանում ենք որպես դատողական որոշումների շղթաներ, որոնք ձևավորում են վերլուծությունը. որ հարցերը կարող են հիմնավորվել տվյալներով, ինչպես պետք է վաղ ախտորոշումները փոխեն մոդելը կամ գնահատվող մեծությունը, և երբ է անհրաժեշտ վերանայել նախնական պլանը։ GeneBench-Pro-ի յուրաքանչյուր խնդիր մոդելին տրամադրում է իրատեսական և խառնաշփոթ տվյալների հավաքածու, հակիրճ փորձարարական համատեքստ և հետագա որոշման հետ կապված թիրախային գնահատվող մեծություն։ Ճիշտ պատասխանելու համար մոդելը պետք է ուսումնասիրի տվյալները, ընտրի համապատասխան վերլուծական մոտեցում, ներգրավվի փորձարկումների կրկնվող գործընթացում և տրամադրի վերջնական պատասխան։

Տվյալակազմի կառուցում

Կենսաբանության մեջ տվյալների ստեղծման արժեքը (օրինակ՝ գենոմի սեկվենավորումը) կտրուկ նվազել է, և որոշ հետազոտողներ այժմ պնդում են(բացվում է նոր պատուհանում), որ սահմանափակող գործոնն այլևս ոչ թե նմուշների հավաքագրումն է, այլ հետագա հաշվարկային մշակումն ու վերլուծությունը։ GeneBench-Pro-ը ստեղծվել է այդ խոչընդոտի հաղթահարման ուղղությամբ առաջընթացը գնահատելու համար՝ ներառելով 129 հարց, որոնք ընդգրկում են հաշվողական կենսաբանության համատեքստերի և մեթոդների լայն շրջանակ։

Տիրույթների ատլաս․ 129 խնդիրներ 10 տիրույթներում և 21 ենթատիրույթներում

Օգտագործել սլաքները՝ հենանիշային խնդիրների միջև տեղափոխվելու համար։ Ընտրված խնդրի մանրամասները ցուցադրվում են ստորև։

Սեղմեք վերևի կետերից մեկի վրա՝ չափանիշային խնդրի մասին տեղեկանալու համար։

Այս ատլասը նախնական պատկերացում է տալիս GeneBench-Pro-ի լայն ընդգրկման մասին։ Այցելեք դեպքերի ուսումնասիրությունների էջը ՝ 10 ներկայացուցչական հարցերն ավելի մանրամասն ուսումնասիրելու համար։

GeneBench-Pro-ը նաև նախագծված է այնպես, որ խուսափի տարածված չափորոշիչների ձախողումներից։ Երկարաժամկետ հեռանկարով կենսաբանության բազմաթիվ չափորոշիչներ բազմաքայլ հարցեր են կառուցում անկանոն պատմական տվյալների հավաքածուների շուրջ, որտեղ վերլուծության ընթացքում կարող է չլինել մեկ միակ ճիշտ ուղի։ Մի գործակալ կարող է ընտրել մեկ հիմնավորելի շեմ, մինչդեռ մեկ այլ գործակալ կարող է ընտրել այլ, բայց նույնքան հիմնավորելի տարբերակ, ավելի շատ արտացոլելով չափորոշիչի ստեղծողի կատարած կամայական ընտրությունները, քան մոդելների կատարողականության որևէ հիմնարար տարբերություն։ Հակառակն էլ կարող է տեղի ունենալ․ եթե խնդիրը թվային փոփոխությունների նկատմամբ չափազանց անզգայուն է, գործակալը կարող է վերլուծության մեջ հիմնարար սխալներ անել և, այնուամենայնիվ, ստուգումն անցնող արդյունք ստանալ։

Ձախողման այս սցենարներից խուսափելու համար GeneBench-Pro-ի յուրաքանչյուր խնդիր կառուցվում է սինթետիկ եղանակով։ Մենք գիտենք ամբողջական պատճառահետևանքային կառուցվածքը և ուղղակիորեն մոդելավորում ենք տվյալների գեներացման գործընթացը։ Դա մեզ հնարավորություն է տալիս կարգաբերել յուրաքանչյուր խնդրի բարդությունը, ապահովել, որ սուբյեկտիվ վերլուծական ընտրություններում ողջամիտ տարբերությունները դեռևս հանգեցնեն ընդունելի թվային արդյունքների, և ստուգել (աբլացիոն ուսումնասիրությունների միջոցով), որ հավանական թվացող, բայց սխալ վերլուծությունները ձախողվում են։ Այնուհետև մենք մանրամասն հետագծային վերլուծությունների միջոցով աուդիտի ենք ենթարկում խնդիրների սևագրերը՝ տեղեկատվության արտահոսքը և լուծման չնախատեսված ուղիները ստուգելու համար։ Սա մեզ վստահություն է տալիս, որ ճիշտ պատասխան ստանալը կախված է վերլուծական ճիշտ ուղի ընտրելուց, այլ ոչ թե կարճ ճանապարհի օգտագործումից կամ հեղինակի կամայական նախապատվությանը համապատասխանելուց։

Գծապատկեր՝ «GeneBench-Pro խնդրի կառուցում և վավերացում» վերնագրով, որը ցույց է տալիս աշխատանքային հոսք՝ գործարկելի առաջադրանքի կառուցումից մինչև վերանայում, կայունության ստուգումներ, գործակալի փորձարկում, փորձագիտական վերանայում, լրամշակում և պատրաստի չափորոշիչային խնդիր։

Մենք GeneBench-Pro-ի 129 հարցերից 82-ն ուղարկեցինք արտաքին ոլորտային փորձագետների, այդ թվում՝ մագիստրոսական և դոկտորական ծրագրերի ուսանողների, հետդոկտորական հետազոտողների, արդյունաբերության ոլորտի գիտնականների և պրոֆեսորների։ Գրախոսները գնահատեցին յուրաքանչյուր խնդրի իրատեսականությունը, այն, թե արդյոք թիրախային պատասխանը հնարավոր էր նույնականացնել, և արդյոք մեթոդներն ու գնահատիչները համապատասխան էին։ Հետադարձ կապը օգտագործվեց խնդիրների բարելավման համար։

1 -ը 2-ից
Իմ վերանայած խնդիրները դժվար կլիներ մագիստրատուրայի ուսանողի համար լուծել՝ առանց փորձառու ղեկավարի պարբերական հետադարձ կապի։ Տվյալները պարունակում էին տեխնիկական և որակի վերահսկման խնդիրներ, որոնք հաջողությամբ հաղթահարելու համար պահանջվում էր մտածված և կշռադատված տվյալների վերլուծություն՝ հնարավոր խոչընդոտների գիտակցմամբ։ Նրանք պարզապես որևէ պատրաստի մեթոդ չէին կիրառում մաքուր և խնամքով մշակված տվյալների նկատմամբ։
Ալեքսանդր Ստրադվիք Յանգ, UCLA-ի մարդու գենետիկայի օգնական պրոֆեսոր

Գնահատում և գնահատական

ՋինԲենչ-Pro-ի յուրաքանչյուր խնդիր ինքնաբավ գիտական վերլուծություն է։ Գործակալները ստանում են հասանելիություն մեկուսացված աշխատատարածքին՝ կարճ հարցումով, տվյալների ֆայլերով և բիոինֆորմատիկայի ստանդարտ գործիքակազմով, որը ներառում է Python-ը, գիտական հաշվարկների գրադարաններ և հիմնական գենոմիկայի փաթեթներ, ինչպիսիք են PLINK 2.0-ը (թեև խնդիրները ոլորտին հատուկ գործիքակազմ չեն պահանջում)։

Կառուցվածքային տարբերակներով ուղղորդվող ուռուցքի բուժման օգուտ-ռիսկի որոշում

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

Քանի որ մենք վերահսկում ենք տվյալների գեներացման ամբողջ գործընթացը, կարող ենք ճշտությունը դետերմինիստորեն գնահատել հայտնի թիրախների նկատմամբ՝ խուսափելով մոդելի ընտրությամբ պայմանավորված փոփոխականությունից և երկարաբանության ազդեցություններից, որոնք հանդիպում են ստանդարտ չափանիշային աղյուսակի վրա հիմնված գնահատման մեջ։

Յուրաքանչյուր խնդիր նաև ուղեկցվում է հարուստ մետատվյալներով, ներառյալ նախատեսված վերլուծության կառուցվածքը, կցված տվյալների ֆայլերը, մանրամասն բազմաէջ դեպքի ուսումնասիրությունը և փորձագիտական վերանայման արդյունքները։ Մենք ամբողջությամբ բաց կոդով հրապարակում ենք GeneBench-Pro-ի 10 ներկայացուցչական հարց Hugging Face(բացվում է նոր պատուհանում)-ում՝ դրանք դիտարկելու համար նախատեսված ինտերակտիվ վեբ միջերեսով ։ Վերջապես, մոտ ապագայում մենք 50 հարցից բաղկացած ենթաբազմություն կտրամադրենք Artificial Analysis(բացվում է նոր պատուհանում) ին՝ անկախ երրորդ կողմի համեմատական գնահատման համար։

Արդյունքներ

Մեր ամենաուժեղ մոդելը՝ GPT‑5.6 Sol-ը, հիմնավորման ամենաբարձր մակարդակում հասնում է 28.7% անցման ցուցանիշի (31.5%՝ Pro ռեժիմը միացված լինելու դեպքում)։ Դա կտրուկ աճ է համեմատած այն ժամանակի հետ, երբ մենք սկսեցինք մշակել սկզբնական GeneBench-ը; այդ ժամանակ մեր լավագույն առաջադեմ մոդելը՝ GPT‑5‑ը, 5%-ից ցածր արդյունք էր գրանցում։ Այս չափանիշում գրանցված առաջընթացը վկայում է, որ առաջադեմ մոդելներն արագ բարելավվում են՝ նույնիսկ ավելի քիչ շոշափելի՝ համակարգային մակարդակի գիտական հիմնավորման հարցերում։ Ներկայիս տեմպերով այս չափանիշը կարող է հագեցման հասնել մինչև տարվա վերջ։

Արդյունքները նաև ցույց են տալիս թեստավորման ժամանակ օգտագործվող հաշվարկային ռեսուրսների մասշտաբավորման ազդեցությունը։ Հիմնավորման ամենացածր մակարդակում GPT‑5.6 Sol-ը հասնում է միայն միանիշ անցման ցուցանիշի։ Հիմնավորման ամենաբարձր մակարդակում GPT‑5.6 Sol-ը լուծում է գրեթե վեց անգամ ավելի շատ հարցեր, քան GPT‑5.2‑ը։ դա անում է՝ օգտագործելով մոտ երկու երրորդ թոքեններ։

Մոդելների ընտանիքների միջև համեմատությունները հուշում են, որ GPT մոդելները քանակական անորոշության պայմաններում բարձր մակարդակի գիտական հիմնավորման ամենաուժեղ համակարգերից են։ GPT‑5.6‑ի, GPT‑5.5‑ի և առաջատար բաց կոդով մոդելների, ինչպիսին է GLM 5.2-ը, միջև տարբերությունը զգալիորեն ավելի մեծ է, քան կակնկալեինք՝ կոդավորման չափանիշներից(բացվում է նոր պատուհանում) արտածելիս, ինչը ցույց է տալիս, որ բաց կոդով մոդելներն ավելի մասնագիտացած են կոդավորման, քան ավելի լայն հիմնավորման կարողության մեջ։

Մենք օգտագործել ենք առաջադեմ GPT մոդելներ՝ մշակման ընթացքում խնդիրները գնահատելու և ամրապնդելու համար։ Հետևաբար մենք կասկածում էինք, որ GeneBench-Pro-ն կարող է կողմնակալ լինել GPT մոդելների նկատմամբ՝ մոդելների այլ ընտանիքների համեմատ։ Այնուամենայնիվ, մրցակից մոդելները, լավագույն դեպքում, թողարկման պահին համարժեք էին համապատասխան GPT մոդելի կատարողականին, սակայն սովորաբար զգալիորեն զիջում էին։

Գնահատման այս արդյունքները, որոնք GPT‑5.6 Sol (Pro)-ի դեպքում հասնում են մինչև 31.5%-ի, տպավորիչ են՝ հաշվի առնելով GeneBench-Pro-ի հարցերի բարդությունը։ Հարցման ընթացքում մեր գրախոսները գնահատել են, որ GeneBench-Pro-ի սովորական խնդիրը մարդ փորձագետից կպահանջեր մոտ 20–40 ժամ՝ ավարտելու համար։ Ժամը զուսպ գնահատմամբ 200 ԱՄՆ դոլար հաշվարկելու դեպքում մեկ խնդրի համար մարդկային աշխատանքի ծախսը հասնում է հազարավոր դոլարների։ Ներկայիս արհեստական բանականության գործակալները դեռևս չափազանց անվստահելի են՝ մարդկային փորձագետներին փոխարինելու համար, սակայն ծախսերի տարբերությունը մեծ է, քանի որ ինֆերենցիայի ծախսերը մեկ խնդրի հաշվով կազմում են ընդամենը մի քանի ԱՄՆ դոլար։ Դա նշանակում է, որ նույնիսկ մասնակի ավտոմատացումը ներկայիս հնարավորությունների պայմաններում կարող է զգալի տնտեսական և գիտական արժեք ստեղծել։

1 -ը 2-ից
Բենչմարքները պայմանավորված են կենսաբանական հարցերի բազմազան շրջանակով, սակայն … իրական մարտահրավերը բխում է հետախուզական տվյալների վերլուծությունից և այս բացահայտումների հիման վրա հիմնավորում կատարելուց՝ օրինաչափություններ և արտեֆակտներ հայտնաբերելուց, ինչպես նաև որոշելուց, թե արդյոք տվյալները պետք է բացառվեն կամ ճշգրտվեն։ Սա հիշեցնում է իրական կենսաբանական տվյալների հավաքածուներին բնորոշ խառնաշփոթ բնույթը։ Այս գնահատումների դիտարկումը ցույց է տալիս, թե որքան կարևոր են լուծիչների հստակ պայմանագրերը գործակալների վրա հիմնված գիտական խնդիրների լուծման համար։ Հարցման տարբեր ձևակերպումը կամ առաջադրանքի բնութագրումը կարող են զգալիորեն ազդել այն բանի վրա, թե որ վերլուծություններն են թույլատրելի թվում։
Կիրիլուս Թան, հետդոկտորական հետազոտական աշխատակից Նյու Յորքի գենոմի կենտրոնում

Այնուամենայնիվ, այն փաստը, որ առաջադեմ մոդելները դեռ լուծում են այս խնդիրների մեկ երրորդից պակասը, ցույց է տալիս, որ բարելավման զգալի տեղ կա։ Մոդելները կարող են մասնակի առաջընթաց գրանցել բարդ խնդիրների լուծման հարցում, սակայն դժվարանում են փակել եզրահանգման օղակը։ Ձախողման այս օրինաչափությունն արտացոլում է մարդկային փորձագետների և սկսնակների միջև եղած հակադրությունը։ Փորձագետներն օգտագործում են իրենց փորձը՝ խնդիրը ձևակերպելու և իրենց մոտեցումը հարմարեցնելու համար, մինչդեռ սկսնակները դիտարկումներ են անում, սակայն դժվարանում են դրանք ներառել խնդրի ավելի լայն համատեքստում։

Խնդիր․ Ֆարմակոգենոմային մինչև իրադարձություն ժամանակի արձագանք՝ ժամանակի ընթացքում փոփոխվող բուժմամբ

Բուժման մեկնարկը, գենոտիպին հատուկ արձագանքը, ուշացած ֆարմակոդինամիկան, նախապես օգտագործող անձանց ցուցիչները և երկայնական կենսամարկերները համատեղ որոշում են պատճառահետևանքային գոյատևման գնահատվող պարամետրը։

GPT-5.5 կաղապար

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

GPT-5.6 Sol կաղապար

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

Գրեթե կատարյալ կատարողականության հասնելու համար անհրաժեշտ են այնպիսի գնահատումներ, որոնք միաժամանակ հուսալիորեն չափում են առաջընթացը և բացահայտում, թե որտեղ են մոդելները դեռևս ձախողվում։ GeneBench-Pro-ի նման հենանիշերը կարող են օգնել կարողությունների անորոշ բացը վերածել մի բանի, որը կարող ենք ախտորոշել և բարելավել։ 

Եթե գործակալները կարողանան հուսալիորեն ավտոմատացնել վերլուծության այս տեսակը, ապա դրանք կարող են զգալիորեն արագացնել գիտական հայտնագործությունները։ Մարդու գենետիկական ապացույցներն արդեն առանցքային են թիրախների առաջնահերթության սահմանման և հետագա տրանսլացիոն ուսումնասիրությունների համար, քանի որ գենետիկական աջակցությամբ մեխանիզմները շատ ավելի հավանական է, որ նրանք հանգեցնեն հաստատված բուժումների։

Միևնույն ժամանակ, սեկվենավորման ծախսերը շեշտակի նվազել են, և բիոբանկային մասշտաբի տվյալների հավաքածուներն այժմ աննախադեպ լայն ընդգրկմամբ կապակցում են մոլեկուլային, ֆենոտիպային և առողջության գրառումների տեղեկատվությունը։ Սահմանափակող գործոնը տվյալների ստեղծումից տեղափոխվում է դեպի տեղեկատվությունը գործնականում կիրառելի վերլուծական եզրահանգումների վերածելը։ Մոդելները, որոնք կարող են հետևողականորեն կատարել վերլուծություններ, որոնք այժմ իրականացնում են մարդկային փորձագետների թիմերը, կարող են վերափոխել արդյունաբերական հետազոտությունները՝ արագացնելով վարկածների առաջնահերթավորումը, թիրախների հետագա ուսումնասիրությունը և տվյալների ստեղծման ու որոշումների կայացման միջև կրկնության ցիկլը։

GeneBench-Pro-ն նախնական փորձ է՝ գնահատելու լավ գիտական դատողություն ձևավորող առավել վերացական հմտությունները, որոնք բնորոշ են փորձառուներին։ Այս հմտությունները թույլ են տալիս նրանց ինտուիտիվ կերպով կռահել և բացահայտել ամենահեռանկարային նախնական վերլուծությունները, վերանայել և ճշգրտել իրենց մտածողությունը, երբ տվյալները հակասում են նախնական ենթադրություններին, և հանգել այնպիսի եզրակացությունների, որոնցից կարող են կախված լինել հետագա կլինիկական, ակադեմիական կամ գործարար որոշումները։ 

Մենք ակնկալում ենք, որ մոդելների կարողությունների զարգացմանը զուգընթաց՝ այն չափանիշները, որոնք ստուգում են մոդելի կարողություններն աբստրակցիայի այս ավելի բարձր մակարդակներում, կդառնան ավելի ու ավելի օգտակար՝ գերազանցելով այն չափանիշներին, որոնք պարզապես ստուգում են գրքային գիտելիքները կամ սովորական վերլուծություններ կատարելու կարողությունը։

Հեղինակ

OpenAI