முக்கிய உள்ளடக்கத்திற்கு செல்க
OpenAI

GeneBench-Pro-ஐ அறிமுகப்படுத்துகிறோம்

கணக்கீட்டு உயிரியலில் AI ஏஜென்ட்கள் தெளிவின்மையை எவ்வாறு கையாளுகின்றனர் மற்றும் முக்கிய விளைவுகளைக் கொண்ட தீர்மானங்களை எவ்வாறு எடுக்கின்றனர் என்பதை அளவிடும் ஆராய்ச்சி-நிலை குறியீட்டு அளவுகோல்.

ஏற்றுகிறது…

அறிவியல் தரவுகள் வழிமுறைகளுடன் வருவது அரிது. ஒரு வடிவம் உயிரியல் காரணத்தை பிரதிபலிக்கிறதா அல்லது சீரற்ற இரைச்சலா, கேட்கப்படும் கேள்விக்கு தரவு ஆதரவு அளிக்க முடியுமா, மேலும் ஒவ்வொரு முடிவும் அவர்கள் அடுத்து என்ன செய்ய வேண்டும் என்பதை எவ்வாறு மாற்ற வேண்டும் என்பதையும் ஆராய்ச்சியாளர்கள் தீர்மானிக்க வேண்டும். AI ஏஜென்ட்கள் சிக்கலான பகுப்பாய்வுகளை மேற்கொள்ளும் திறனை அதிகரித்துக் கொண்டிருக்கின்றன; ஆனால் உண்மையான அறிவியல் ஆராய்ச்சி என்பது உண்மைத்தகவல்களை நினைவுகூர்வது அல்லது முன்கூட்டியே வரையறுக்கப்பட்ட பணிப்பாய்வைப் பின்பற்றுவது மட்டுமல்ல, இத்தகைய உயர்நிலைத் தீர்மானங்களை எடுப்பதையும் சார்ந்துள்ளது.

இன்று, நிஜ உலகக் கணிப்பியல் உயிரியல் தேவைப்படுத்தும் நுண்ணறிவான மதிப்பீடு அதிகம் தேவைப்படும் பகுப்பாய்வை மாடல்கள் கையாள முடியுமா என்பதைச் சோதிப்பதற்கான சவாலான, ஆராய்ச்சி நிலை பெஞ்ச்மார்க்கான GeneBench-Pro-வை நாங்கள் அறிமுகப்படுத்துகிறோம். இது GeneBench(புதிய சாளரத்தில் திறக்கும்) -ஐ விரிவுபடுத்தி, ஜீனோமிக்ஸ், அளவுசார் உயிரியல் மற்றும் மாற்றுப்பயன்பாட்டு மருத்துவம் ஆகிய துறைகளில் மேலும் கடினமான, அதிக யதார்த்தமான பணிகளை உள்ளடக்குகிறது; மேலும் கணினிசார் உயிரியலில் அறிவியல் ஆராய்ச்சியின் சிக்கல்தன்மை, மீள்முறை இயல்பு மற்றும் தெளிவின்மையைப் பதிவு செய்கிறது. 

இன்றுவரை, நிஜ உலகக் கணக்கீட்டு ஆராய்ச்சியை கடினமாக்கும் அமைப்பு-நிலை தீர்மானங்கள் குறித்த நம்பத்தகுந்த மதிப்பீடுகள் மிகக் குறைவாகவே உள்ளன. இதில் தெளிவின்மையை கையாளுதல், முன்னெண்ணங்களை மறுபரிசீலனை செய்தல், சரியான பகுப்பாய்வு பாதையைத் தேர்ந்தெடுத்தல், மற்றும் ஒரு பகுப்பாய்வு முடிவு எப்போது தீர்மானம் எடுக்கப் பயன்படத் தயாராக உள்ளது என்பதை அறிதல் ஆகியவை அடங்கும். இந்தத் திறன்களை முறைப்படுத்துவது கடினமானதால், இவற்றிலுள்ள பலவீனங்கள் ஒட்டுமொத்த AI செயல்திறனை அதிகமாகக் கட்டுப்படுத்தி வரும் நிலையிலும், அவற்றைத் துல்லியமான முறையில் மதிப்பிடுவதும் கடினமாகிறது.

“உயிரியலில் பெஞ்ச்மார்க் இடைவெளி” என்ற தலைப்புடைய வரைபடம், பாரம்பரிய பெஞ்ச்மார்க் பணிப்பாய்வுகளை தொடக்கம் முதல் முடிவு வரையிலான அறிவியல் பகுப்பாய்வுடன் ஒப்பிடுகிறது; இதில் அறிவியல் முடிவை அடைவதற்கு முன் முன்செயலாக்கம், மாதிரியாக்கம், கண்டறிதல்கள் மற்றும் மீள்முறை மேம்படுத்தல் போன்ற கூடுதல் படிகள் காட்டப்படுகின்றன.

GeneBench-Pro இந்த உயர்-நிலை திறன்களைத் துல்லியமாக அளவிட வடிவமைக்கப்பட்டுள்ளது. GeneBench-Pro-க்குள், “ஆராய்ச்சி ரசனை” என்பதை, ஒரு பகுப்பாய்வை வடிவமைக்கும் தீர்மான அழைப்புகளின் தொடர்களாக நாங்கள் வரையறுக்கிறோம்: தரவு எந்தக் கேள்விகளை ஆதரிக்க முடியும், ஆரம்பகால நோயறிதல்கள் மாடல் அல்லது மதிப்பிடப்பட வேண்டிய அளவீட்டை எவ்வாறு மாற்ற வேண்டும், மற்றும் ஆரம்பத் திட்டம் எப்போது திருத்தப்பட வேண்டும் என்பவை. ஒவ்வொரு GeneBench-Pro பிரச்சினையும் மாடலுக்கு யதார்த்தமானதும் ஒழுங்கற்றதுமான தரவுத்தொகுப்பு, சுருக்கமான பரிசோதனைச் சூழல், மற்றும் அடுத்தடுத்த கட்ட முடிவுடன் தொடர்புடைய இலக்கு மதிப்பிடப்பட வேண்டிய அளவை வழங்குகிறது. சரியாகப் பதிலளிக்க, மாடல் தரவை ஆராய்ந்து, பொருத்தமான பகுப்பாய்வு அணுகுமுறையைத் தேர்ந்தெடுத்து, பரிசோதனையின் மீள்முறை செயல்முறையில் ஈடுபட்டு, இறுதி பதிலை வழங்க வேண்டும்.

தரவுத்தொகுப்பு உருவாக்கம்

உயிரியல் துறையில், தரவு உருவாக்கத்தின் செலவு (எ.கா., ஜீனோம் வரிசைப்படுத்தல்) மிகக் கடுமையாகக் குறைந்துள்ளது; மேலும், வரம்பிடும் காரணி இனி மாதிரி சேகரிப்பு அல்ல, மாறாக அடுத்தடுத்த கணக்கீடும் பகுப்பாய்வும் தான் என்று சில ஆராய்ச்சியாளர்கள் இப்போது வாதிடுகின்றனர்(புதிய சாளரத்தில் திறக்கும்). அந்த இடையூறைச் சமாளிப்பதில் ஏற்பட்ட முன்னேற்றத்தை மதிப்பிடுவதற்காக GeneBench-Pro உருவாக்கப்பட்டுள்ளது. இது கணக்கீட்டு உயிரியல் சார்ந்த பல்வேறு சூழல்கள் மற்றும் முறைகளை உள்ளடக்கிய 129 கேள்விகளைக் கொண்டுள்ளது.

டொமைன் அட்லஸ்: 129 சிக்கல்கள் 10 டொமைன்களிலும் 21 துணை டொமைன்களிலும்

பெஞ்ச்மார்க் பிரச்சினைகளுக்கு இடையே செல்ல அம்புக்குறி விசைகளைப் பயன்படுத்தவும். தேர்ந்தெடுக்கப்பட்ட பிரச்சனையின் விவரங்கள் கீழே காட்டப்படும்.

மேலே உள்ள ஒரு புள்ளியைக் கிளிக் செய்து, ஒரு அளவுகோல் பிரச்சினையைப் பற்றி அறியுங்கள்.

இந்த அட்லஸ் GeneBench-Pro-இன் பரந்த வரம்பைப் பற்றிய முன்காட்சியை வழங்குகிறது. 10 பிரதிநிதித்துவக் கேள்விகளை மேலும் விரிவாக ஆராய வழக்கு ஆய்வுகள் பக்கத்தை பார்வையிடவும்.

பொதுவான பெஞ்ச்மார்க் தோல்விகளைத் தவிர்க்கும் வகையிலும் GeneBench-Pro வடிவமைக்கப்பட்டுள்ளது. பல நீண்ட-கால நோக்குடைய உயிரியல் பெஞ்ச்மார்க்கள், ஒழுங்கற்ற வரலாற்றுத் தரவுத்தொகுப்புகளைச் சுற்றி பல-படி கேள்விகளை உருவாக்குகின்றன; அவற்றில் பகுப்பாய்வின் வழியாகச் செல்ல ஒரே ஒரு சரியான பாதை இல்லாமல் இருக்கலாம். ஒரு ஏஜென்ட் நியாயமாக ஆதரிக்கக்கூடிய ஒரு கட்-ஆஃப் மதிப்பைத் தேர்வு செய்யலாம்; அதே சமயம் மற்றொரு ஏஜென்ட் வேறுபட்டதானாலும் சம அளவில் நியாயமாக ஆதரிக்கக்கூடிய விருப்பத்தைத் தேர்வு செய்யலாம். இது, மாடல் செயல்திறனில் உள்ள அடிப்படை வேறுபாடுகளை விட, பெஞ்ச்மார்க் உருவாக்குநர் செய்த தன்னிச்சையான தேர்வுகளையே அதிகமாக பிரதிபலிக்கிறது. இதற்கு மாறானதும் நிகழலாம்: ஒரு சிக்கல் எண்ணியல் மாற்றங்களுக்கு மிகக் குறைந்த உணர்திறன் கொண்டதாக இருந்தால், ஒரு ஏஜென்ட் பகுப்பாய்வில் அடிப்படைப் பிழைகளைச் செய்தாலும் ஏற்றுக்கொள்ளத்தக்க முடிவை உருவாக்க முடியும்.

இந்தத் தோல்வி நிலைகளைத் தவிர்க்க, ஒவ்வொரு GeneBench-Pro பிரச்சினையும் செயற்கையாக உருவாக்கப்படுகிறது: முழுமையான காரண அமைப்பை நாங்கள் அறிந்திருக்கிறோம், மேலும் தரவை உருவாக்கும் செயல்முறையை நேரடியாக உருவகப்படுத்துகிறோம். அது ஒவ்வொரு பிரச்சினையின் சிக்கல்தன்மையைச் சீரமைக்கவும், அகநிலையான பகுப்பாய்வு தேர்வுகளில் உள்ள நியாயமான வேறுபாடுகள் இருந்தாலும் ஏற்றுக்கொள்ளப்படும் எண் சார்ந்த முடிவுகள் கிடைப்பதை உறுதிசெய்யவும், மேலும் நம்பத்தகுந்ததாகத் தோன்றினாலும் தவறான பகுப்பாய்வுகள் தோல்வியடைவதை (அப்லேஷன் ஆய்வுகள் மூலம்) சரிபார்க்கவும் எங்களுக்கு உதவுகிறது. அதன்பின், தகவல் கசிவு மற்றும் திட்டமிடப்படாத தீர்வு வழித்தடங்கள் உள்ளனவா என்பதைச் சரிபார்க்க, விரிவான தடயப் பகுப்பாய்வுகள் மூலம் பிரச்சினை வரைவுகளை நாங்கள் தணிக்கை செய்கிறோம். சரியான பதிலைப் பெறுவது சரியான பகுப்பாய்வு வழிமுறையைத் தேர்ந்தெடுப்பதில்தான் சார்ந்துள்ளது; குறுக்கு வழியைப் பயன்படுத்துவதிலோ அல்லது ஆசிரியரின் தன்னிச்சையான விருப்பத்துடன் பொருந்துவதிலோ அல்ல என்பதில் இது நமக்கு நம்பிக்கையளிக்கிறது.

“GeneBench-Pro சிக்கலை உருவாக்குதல் மற்றும் சரிபார்த்தல்” என்ற தலைப்புடைய வரைபடம், இயக்கக்கூடிய பணியை உருவாக்குவதிலிருந்து மதிப்பாய்வு, உறுதித்தன்மைச் சோதனைகள், ஏஜென்ட் சோதனை, நிபுணர் மதிப்பாய்வு, திருத்தம் மற்றும் முடிக்கப்பட்ட அளவுகோல் சிக்கல் வரை உள்ள பணிப்பாய்வைக் காட்டுகிறது.

129 GeneBench-Pro கேள்விகளில் 82-ஐ, பட்டமேற்படிப்பு மாணவர்கள், முனைவர் பட்டத்திற்குப் பிந்தைய ஆராய்ச்சியாளர்கள், தொழில்துறை விஞ்ஞானிகள் மற்றும் பேராசிரியர்கள் உள்ளிட்ட வெளியகத் துறை நிபுணர்களுக்கு அனுப்பினோம். மதிப்பாய்வாளர்கள் ஒவ்வொரு பிரச்சினையின் யதார்த்தத்தன்மை, இலக்கு விடை அடையாளம் காணக்கூடியதாக இருந்ததா, மற்றும் முறைகளும் மதிப்பீட்டிகளும் பொருத்தமானவையாக இருந்தனவா என்பவற்றை மதிப்பிட்டனர். சிக்கல்களை மேம்படுத்த பின்னூட்டம் பயன்படுத்தப்பட்டது.

2இல் 1
நான் மதிப்பாய்வு செய்த பிரச்சினைகளை, அனுபவமுள்ள மேற்பார்வையாளரிடமிருந்து மீண்டும் மீண்டும் கிடைக்கும் பின்னூட்டம் இல்லாமல் முடிப்பது ஒரு பட்ட மேற்படிப்பு மாணவருக்குச் சவாலாக இருந்திருக்கும். தரவுகளில் தொழில்நுட்ப மற்றும் தரக் கட்டுப்பாட்டு பிரச்சினைகள் இருந்ததால், அதை வெற்றிகரமாக முடிக்க சாத்தியமான இடர்பாடுகள் குறித்த விழிப்புணர்வுடன், சிந்தனையுடனும் பரிசீலனையுடனும் கூடிய தரவு பகுப்பாய்வு தேவைப்பட்டது; அவர்கள் சுத்தமான மற்றும் நன்கு செம்மைப்படுத்தப்பட்ட தரவுகளில் தயாராகக் கிடைக்கும் ஏதோ ஒரு முறையை வெறுமனே பயன்படுத்திக் கொண்டிருக்கவில்லை.
Alexander Strudwick Young, UCLA-வில் மனித மரபியலில் உதவிப் பேராசிரியர்

மதிப்பீடு மற்றும் தரமிடல்

ஒவ்வொரு GeneBench-Pro பிரச்சினையும் தன்னிறைவு கொண்ட அறிவியல் பகுப்பாய்வாகும். ஏஜெண்ட்கள், குறுகிய ப்ராம்ப்ட், தரவு கோப்புகள், மேலும் Python, அறிவியல் கணினியியல் நூலகங்கள், மற்றும் PLINK 2.0 போன்ற அடிப்படை ஜீனோமிக்ஸ் தொகுப்புகள் உட்பட ஒரு தரநிலை உயிர்தகவலியல் ஸ்டாக் கொண்ட தனிமைப்படுத்தப்பட்ட வர்க்ஸ்பேஸிற்கான அணுகலைப் பெறுகின்றன (இருப்பினும், பிரச்சினைகளுக்கு துறை-சார்ந்த கருவிகள் தேவையில்லை).

கட்டமைப்பு மாறுபாட்டால் வழிநடத்தப்படும் கட்டி சிகிச்சை நன்மை-ஆபத்து தீர்மானம்

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

முழு தரவு உருவாக்க செயல்முறையை நாங்கள் முழுமையாக கட்டுப்படுத்துவதால், அறியப்பட்ட இலக்குகளுக்கு எதிராக சரியானதைக் கணக்கிட முடிகிறது. இதனால், நிலையான ரூப்ரிக் அடிப்படையிலான மதிப்பீட்டில் காணப்படும் மாடல் தேர்வு மாறுபாடு மற்றும் அதிக சொல் பயன்பாட்டின் விளைவுகளைத் தவிர்க்க முடிகிறது.

ஒவ்வொரு பிரச்சினைக்கும், உத்தேசிக்கப்பட்ட பகுப்பாய்வு கட்டமைப்பு, இணைக்கப்பட்ட தரவுக் கோப்புகள், பல பக்கங்களைக் கொண்ட விரிவான வழக்குக் கள ஆய்வு மற்றும் நிபுணர் மதிப்பாய்வு முடிவுகள் உள்ளிட்ட செறிவான மெட்டாடேட்டாவும் வழங்கப்படுகிறது. நாங்கள் பத்து பிரதிநிதித்துவமான GeneBench-Pro கேள்விகளை Hugging Face(புதிய சாளரத்தில் திறக்கும்)-இல் முழுமையாக திறந்த மூலமாக வெளியிடுகிறோம், அவற்றை உலாவி பார்க்க இணைய இடைமுகத்துடன். இறுதியாக, விரைவில் சுயாதீனமான, மூன்றாம் தரப்பு பெஞ்ச்மார்க்கிங்கிற்காக 50 கேள்விகளைக் கொண்ட துணைத்தொகுப்பை Artificial Analysis(புதிய சாளரத்தில் திறக்கும்) -க்கு வழங்குவோம்.

முடிவுகள்

எங்களின் மிக வலுவான மாடலான GPT‑5.6 Sol, மிக உயர்ந்த ரீஸனிங் நிலையில் 28.7% தேர்ச்சி விகிதத்தை அடைகிறது (Pro பயன்முறை இயக்கப்பட்டிருக்கும்போது 31.5%). அசல் GeneBench-ஐ உருவாக்கத் தொடங்கிய காலத்துடன் ஒப்பிடும்போது இது ஒரு கணிசமான உயர்வு; அப்போது, எங்கள் சிறந்த அதிநவீன மாடலான GPT‑5, 5%-க்கு கீழே மதிப்பெண் பெற்றது. இந்த பெஞ்ச்மார்க்கில் ஏற்பட்ட முன்னேற்றம், குறைவாகத் தெளிவாகப் புலப்படும், அமைப்புகள்-நிலை அறிவியல் ரீஸனிங்கிலும் கூட, அதிநவீன மாடல்கள் விரைவாக மேம்பட்டு வருகின்றன என்பதைச் சுட்டிக்காட்டுகிறது. தற்போதைய வேகத்தில் தொடர்ந்தால், இந்த அளவுகோல் ஆண்டின் இறுதிக்குள் பூரித நிலையை அடையலாம்.

சோதனை நேரக் கணிப்பீட்டு வளங்களை அளவுபடுத்துவதின் தாக்கத்தையும் முடிவுகள் காட்டுகின்றன. மிகக் குறைந்த ரீஸனிங் நிலையில், GPT‑5.6 Sol வெறும் ஒற்றை இலக்க தேர்ச்சி விகிதத்தை மட்டுமே அடைகிறது. மிக உயர்ந்த ரீஸனிங் நிலையில், GPT‑5.6 Sol, GPT‑5.2‑ஐ விட கிட்டத்தட்ட ஆறு மடங்கு அதிகமான கேள்விகளைத் தீர்க்கிறது சுமார் இரண்டு மூன்றில் பங்கு அளவு டோக்கன்களைப் பயன்படுத்தி செய்கிறது.

மாடல் குடும்பங்களுக்கிடையேயான ஒப்பீடுகள், அளவியல் நிச்சயமின்மையின் கீழ் உயர்நிலை அறிவியல் ரீஸனிங்கில் GPT மாடல்கள் மிக வலுவான அமைப்புகளில் ஒன்றாக உள்ளன. GPT‑5.6‑க்கும் இடையிலான செயல்திறன் இடைவெளி, GPT‑5.5 மற்றும் GLM 5.2 போன்ற முன்னணி ஓபன்-சோர்ஸ் மாடல்களுக்கிடையேயான வித்தியாசம், கோடிங் பெஞ்ச்மார்க்குகள்(புதிய சாளரத்தில் திறக்கும்) இலிருந்து கணித்துப் பார்க்கும்போது நாம் எதிர்பார்ப்பதை விட கணிசமாகப் பெரியதாக உள்ளது; இது, ஓபன்-சோர்ஸ் மாடல்கள் பரந்த ரீஸனிங் திறனை விட கோடிங்கிற்காக அதிகமாக சிறப்புப்படுத்தப்பட்டுள்ளன என்பதைக் காட்டுகிறது.

உருவாக்கத்தின் போது சிக்கல்களை மதிப்பிடவும் வலுப்படுத்தவும் நாங்கள் அதிநவீன GPT மாடல்களைப் பயன்படுத்தினோம். எனவே, பிற மாடல் குடும்பங்களுடன் ஒப்பிடும்போது GeneBench-Pro GPT மாடல்களுக்கு எதிராக சாய்வு கொண்டிருக்கலாம் என்று நாங்கள் சந்தேகித்தோம். இருப்பினும், போட்டியாளர் மாடல்கள் அதிகபட்சமாக வெளியீட்டு நேரத்தில் தொடர்புடைய GPT மாடலின் செயல்திறனுக்கு இணையாகவே இருந்தன, மேலும் பெரும்பாலும் கணிசமாக பின்தங்கின.

GeneBench-Pro கேள்விகளின் கடினத்தன்மையை கருத்தில் கொண்டால், GPT‑5.6 Sol (Pro) இல் 31.5% வரை உயர்ந்துள்ள இந்த மதிப்பீட்டு முடிவுகள் குறிப்பிடத்தக்கவை. ஒரு கருத்துக்கணிப்பில், எங்கள் மதிப்பாய்வாளர்கள் வழக்கமான GeneBench-Pro சிக்கலைத் தீர்க்க ஒரு மனித நிபுணருக்கு சுமார் 20–40 மணிநேரம் ஆகும் என்று மதிப்பிட்டனர். குறைந்தபட்ச மதிப்பீடாக ஒரு மணிநேரத்திற்கு $200 எனக் கொண்டாலும், ஒரே ஒரு சிக்கலுக்கான மனித உழைப்புச் செலவு ஆயிரக்கணக்கான டாலர்களாக ஆகிறது. தற்போதைய AI ஏஜென்ட்கள் மனித நிபுணர்களை மாற்றுவதற்கு இன்னும் மிகவும் நம்பகமற்றவையாகவே உள்ளன. ஆனால் செலவு வித்தியாசம் பெரியதாக உள்ளது, அனுமானச் செலவுகள் ஒவ்வொரு சிக்கலுக்கும் சில டாலர்கள் மட்டுமே. அதாவது, தற்போதைய திறன்களிலேயே பகுதியளவு தானியக்கம்கூட குறிப்பிடத்தக்க பொருளாதார மற்றும் அறிவியல் மதிப்பை உருவாக்க முடியும்.

2இல் 1
பெஞ்ச்மார்க்குகள் பல்வேறு வகையான உயிரியல் கேள்விகளால் தூண்டப்படுகின்றன, ஆனால் உண்மையான சவால் ஆய்வுசார் தரவு பகுப்பாய்வு மற்றும் இந்தக் கண்டுபிடிப்புகள் குறித்த ரீஸனிங் உள்ளது: வடிவங்கள் மற்றும் ஆர்டிஃபாக்ட்களை அடையாளம் காணுதல், மேலும் தரவை நீக்க வேண்டுமா அல்லது சரிசெய்ய வேண்டுமா என்பதைத் தீர்மானித்தல். இது உண்மையான உயிரியல் தரவுத்தொகுப்புகளின் குழப்பமான இயல்பை ஒத்திருக்கிறது. இந்த மதிப்பீடுகளை மதிப்பாய்வு செய்வது, ஏஜென்ட்-அடிப்படையிலான அறிவியல் சிக்கல் தீர்வில் தெளிவான தீர்வாளர் ஒப்பந்தங்கள் எவ்வளவு முக்கியமானவை என்பதை எடுத்துக்காட்டுகிறது. வேறுபட்ட ப்ராம்ப்ட் வார்த்தையாக்கம் அல்லது பணி விவரக்குறிப்பு, எந்தப் பகுப்பாய்வுகள் அனுமதிக்கத்தக்கவையாகத் தோன்றும் என்பதை பெரிதும் பாதிக்கலாம்.
Cyrillus Tan, நியூயார்க் ஜீனோம் சென்டரில் முனைவர் பட்டத்துக்குப் பிந்தைய இணை ஆராய்ச்சியாளர்

இருப்பினும், அதிநவீன மாடல்கள் இன்னும் இந்தப் பிரச்சினைகளில் மூன்றில் ஒரு பங்குக்கும் குறைவானவற்றையே தீர்க்கின்றன என்பது, மேம்பாட்டிற்கு கணிசமான இடம் உள்ளது என்பதைக் காட்டுகிறது. மாடல்கள் சவாலான பிரச்சினைகளில் பகுதியளவு முன்னேற்றம் காண முடியும், ஆனால் அனுமானச் சுழற்சியை நிறைவு செய்வதில் அவை சிரமப்படுகின்றன. இந்தத் தோல்விப் பாங்கு, மனித நிபுணர்களுக்கும் தொடக்கநிலையினருக்கும் இடையிலான வேறுபாட்டைப் பிரதிபலிக்கிறது. நிபுணர்கள் தங்கள் அனுபவத்தைப் பயன்படுத்தி பிரச்சினையை வரையறுத்து, தங்கள் அணுகுமுறையை ஏற்ப மாற்றுகின்றனர்; அதே சமயம், தொடக்கநிலையினர் கவனிப்புகளைச் செய்கிறார்கள், ஆனால் அவற்றை பிரச்சினையின் பரந்த சூழலில் ஒருங்கிணைக்க சிரமப்படுகிறார்கள்.

பிரச்சனை: காலம் மாறும் சிகிச்சையுடன் மருந்து மரபணு நிகழ்வு நேரம்-படி பதில்

சிகிச்சை தொடக்கம், மரபணுவகை-குறிப்பிட்ட பதில்வினை, தாமதமான மருந்து விளைவியக்கவியல், முன்னாள் பயனர் குறிகாட்டிகள் மற்றும் நீளவியல் உயிர்குறியீடுகள் ஒன்றிணைந்து காரணவியல் உயிர்வாழ்வு மதிப்பீட்டிலக்கை நிர்ணயிக்கின்றன.

GPT-5.5 முறை

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

GPT-5.6 Sol முறை

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

கிட்டத்தட்ட பூரணமான செயல்திறனை அடைவதற்கு, முன்னேற்றத்தை நம்பகமாக அளந்து, மாடல்கள் இன்னும் எங்கு தோல்வியடைகின்றன என்பதையும் அடையாளம் காணும் மதிப்பீடுகள் தேவைப்படும். GeneBench-Pro போன்ற செயல்திறன் அளவுகோல்கள், தெளிவற்ற திறன் குறைபாட்டை நாம் கண்டறிந்து மேம்படுத்தக்கூடிய ஒன்றாக மாற்ற உதவலாம். 

ஏஜென்ட்கள் இந்த வகை பகுப்பாய்வை நம்பகமாக தானியக்கமாக்க முடிந்தால், அவை அறிவியல் கண்டுபிடிப்புகளை குறிப்பிடத்தக்க அளவில் வேகப்படுத்தக்கூடும். மனித மரபணு ஆதாரங்கள், சிகிச்சை இலக்குகளை முன்னுரிமைப்படுத்துவதிலும் மருத்துவப் பயன்பாட்டுக்கான தொடராய்விலும் ஏற்கனவே மையப் பங்கு வகிக்கின்றன. ஏனெனில் மரபணு ஆதரவு கொண்ட செயல்முறைகள் அங்கீகரிக்கப்பட்ட சிகிச்சைகளுக்கு வழிவகுக்கும் வாய்ப்பு அதிகமாகும்.

இதற்கிடையில், வரிசையாக்கச் செலவுகள் கடுமையாகக் குறைந்துள்ளன, மேலும் உயிரிவங்கி அளவிலான தரவுத்தொகுப்புகள் இப்போது மூலக்கூறு, பண்புரு மற்றும் ஹெல்த் பதிவுத் தகவல்களை முன்னெப்போதும் இல்லாத பரந்த அளவில் இணைக்கின்றன. கட்டுப்படுத்தும் காரணி தரவு உருவாக்கத்திலிருந்து, தகவலை செயல்படுத்தக்கூடிய தெளிவான நுண்ணறிவுகளாக மாற்றுவதற்கு மாறிக்கொண்டிருக்கிறது. தற்போது மனித நிபுணர்கள் குழுக்களால் கையாளப்படும் பகுப்பாய்வுகளை நிலையாகச் செய்யக்கூடிய மாடல்கள், கருதுகோள்களை முன்னுரிமைப்படுத்தி வகைப்படுத்துதல், இலக்குகளைத் தொடர்ந்து ஆய்வு செய்தல், மற்றும் தரவு உருவாக்கம் மற்றும் முடிவெடுத்தல் ஆகியவற்றுக்கிடையிலான மறுசுழற்சியை வேகப்படுத்துவதன் மூலம் தொழில்துறை ஆராய்ச்சியை மாற்றியமைக்கக்கூடும்.

GeneBench-Pro என்பது அனுபவமிக்கவர்களிடம் உள்ள நல்ல அறிவியல் தீர்மானத் திறன்களை மதிப்பிடுவதற்கான ஒரு ஆரம்ப முயற்சியாகும். இந்தத் திறன்கள், அவர்கள் மிக நம்பிக்கைக்குரிய ஆரம்ப பகுப்பாய்வுகளை உள்ளுணர்வின் மூலம் கணித்து அடையாளம் காணவும், தரவுகள் ஆரம்ப ஊகங்களுக்கு முரணாக இருக்கும்போது தங்கள் சிந்தனையை மீண்டும் பரிசீலித்து திருத்திக்கொள்ளவும், பின்னர் எடுக்கப்படும் மருத்துவ, கல்விசார் அல்லது வணிகத் தீர்மானங்கள் சார்ந்திருக்கக்கூடிய முடிவுகளை எட்டவும் உதவுகின்றன. 

மாடல்களின் திறன்கள் மேம்படும்போது, புத்தக அறிவையோ அல்லது வழக்கமான பகுப்பாய்வுகளைச் செய்வதற்கான திறனையோ மட்டும் சோதிக்கும் தரநிலைகளை விட, உயர்மட்ட சிந்தனை மற்றும் பகுத்தறியும் திறன்களை மதிப்பிடும் தரநிலைகள் அதிக முக்கியத்துவம் பெறும் என்று நாங்கள் எதிர்பார்க்கிறோம்.

ஆசிரியர்

OpenAI