GeneBench-Pro-ஐ அறிமுகப்படுத்துகிறோம்
கணக்கீட்டு உயிரியலில் AI ஏஜென்ட்கள் தெளிவின்மையை எவ்வாறு கையாளுகின்றனர் மற்றும் முக்கிய விளைவுகளைக் கொண்ட தீர்மானங்களை எவ்வாறு எடுக்கின்றனர் என்பதை அளவிடும் ஆராய்ச்சி-நிலை குறியீட்டு அளவுகோல்.
அறிவியல் தரவுகள் வழிமுறைகளுடன் வருவது அரிது. ஒரு வடிவம் உயிரியல் காரணத்தை பிரதிபலிக்கிறதா அல்லது சீரற்ற இரைச்சலா, கேட்கப்படும் கேள்விக்கு தரவு ஆதரவு அளிக்க முடியுமா, மேலும் ஒவ்வொரு முடிவும் அவர்கள் அடுத்து என்ன செய்ய வேண்டும் என்பதை எவ்வாறு மாற்ற வேண்டும் என்பதையும் ஆராய்ச்சியாளர்கள் தீர்மானிக்க வேண்டும். AI ஏஜென்ட்கள் சிக்கலான பகுப்பாய்வுகளை மேற்கொள்ளும் திறனை அதிகரித்துக் கொண்டிருக்கின்றன; ஆனால் உண்மையான அறிவியல் ஆராய்ச்சி என்பது உண்மைத்தகவல்களை நினைவுகூர்வது அல்லது முன்கூட்டியே வரையறுக்கப்பட்ட பணிப்பாய்வைப் பின்பற்றுவது மட்டுமல்ல, இத்தகைய உயர்நிலைத் தீர்மானங்களை எடுப்பதையும் சார்ந்துள்ளது.
இன்று, நிஜ உலகக் கணிப்பியல் உயிரியல் தேவைப்படுத்தும் நுண்ணறிவான மதிப்பீடு அதிகம் தேவைப்படும் பகுப்பாய்வை மாடல்கள் கையாள முடியுமா என்பதைச் சோதிப்பதற்கான சவாலான, ஆராய்ச்சி நிலை பெஞ்ச்மார்க்கான GeneBench-Pro-வை நாங்கள் அறிமுகப்படுத்துகிறோம். இது GeneBench(புதிய சாளரத்தில் திறக்கும்) -ஐ விரிவுபடுத்தி, ஜீனோமிக்ஸ், அளவுசார் உயிரியல் மற்றும் மாற்றுப்பயன்பாட்டு மருத்துவம் ஆகிய துறைகளில் மேலும் கடினமான, அதிக யதார்த்தமான பணிகளை உள்ளடக்குகிறது; மேலும் கணினிசார் உயிரியலில் அறிவியல் ஆராய்ச்சியின் சிக்கல்தன்மை, மீள்முறை இயல்பு மற்றும் தெளிவின்மையைப் பதிவு செய்கிறது.
இன்றுவரை, நிஜ உலகக் கணக்கீட்டு ஆராய்ச்சியை கடினமாக்கும் அமைப்பு-நிலை தீர்மானங்கள் குறித்த நம்பத்தகுந்த மதிப்பீடுகள் மிகக் குறைவாகவே உள்ளன. இதில் தெளிவின்மையை கையாளுதல், முன்னெண்ணங்களை மறுபரிசீலனை செய்தல், சரியான பகுப்பாய்வு பாதையைத் தேர்ந்தெடுத்தல், மற்றும் ஒரு பகுப்பாய்வு முடிவு எப்போது தீர்மானம் எடுக்கப் பயன்படத் தயாராக உள்ளது என்பதை அறிதல் ஆகியவை அடங்கும். இந்தத் திறன்களை முறைப்படுத்துவது கடினமானதால், இவற்றிலுள்ள பலவீனங்கள் ஒட்டுமொத்த AI செயல்திறனை அதிகமாகக் கட்டுப்படுத்தி வரும் நிலையிலும், அவற்றைத் துல்லியமான முறையில் மதிப்பிடுவதும் கடினமாகிறது.
GeneBench-Pro இந்த உயர்-நிலை திறன்களைத் துல்லியமாக அளவிட வடிவமைக்கப்பட்டுள்ளது. GeneBench-Pro-க்குள், “ஆராய்ச்சி ரசனை” என்பதை, ஒரு பகுப்பாய்வை வடிவமைக்கும் தீர்மான அழைப்புகளின் தொடர்களாக நாங்கள் வரையறுக்கிறோம்: தரவு எந்தக் கேள்விகளை ஆதரிக்க முடியும், ஆரம்பகால நோயறிதல்கள் மாடல் அல்லது மதிப்பிடப்பட வேண்டிய அளவீட்டை எவ்வாறு மாற்ற வேண்டும், மற்றும் ஆரம்பத் திட்டம் எப்போது திருத்தப்பட வேண்டும் என்பவை. ஒவ்வொரு GeneBench-Pro பிரச்சினையும் மாடலுக்கு யதார்த்தமானதும் ஒழுங்கற்றதுமான தரவுத்தொகுப்பு, சுருக்கமான பரிசோதனைச் சூழல், மற்றும் அடுத்தடுத்த கட்ட முடிவுடன் தொடர்புடைய இலக்கு மதிப்பிடப்பட வேண்டிய அளவை வழங்குகிறது. சரியாகப் பதிலளிக்க, மாடல் தரவை ஆராய்ந்து, பொருத்தமான பகுப்பாய்வு அணுகுமுறையைத் தேர்ந்தெடுத்து, பரிசோதனையின் மீள்முறை செயல்முறையில் ஈடுபட்டு, இறுதி பதிலை வழங்க வேண்டும்.
உயிரியல் துறையில், தரவு உருவாக்கத்தின் செலவு (எ.கா., ஜீனோம் வரிசைப்படுத்தல்) மிகக் கடுமையாகக் குறைந்துள்ளது; மேலும், வரம்பிடும் காரணி இனி மாதிரி சேகரிப்பு அல்ல, மாறாக அடுத்தடுத்த கணக்கீடும் பகுப்பாய்வும் தான் என்று சில ஆராய்ச்சியாளர்கள் இப்போது வாதிடுகின்றனர்(புதிய சாளரத்தில் திறக்கும்). அந்த இடையூறைச் சமாளிப்பதில் ஏற்பட்ட முன்னேற்றத்தை மதிப்பிடுவதற்காக GeneBench-Pro உருவாக்கப்பட்டுள்ளது. இது கணக்கீட்டு உயிரியல் சார்ந்த பல்வேறு சூழல்கள் மற்றும் முறைகளை உள்ளடக்கிய 129 கேள்விகளைக் கொண்டுள்ளது.
டொமைன் அட்லஸ்: 129 சிக்கல்கள் 10 டொமைன்களிலும் 21 துணை டொமைன்களிலும்
மேலே உள்ள ஒரு புள்ளியைக் கிளிக் செய்து, ஒரு அளவுகோல் பிரச்சினையைப் பற்றி அறியுங்கள்.
இந்த அட்லஸ் GeneBench-Pro-இன் பரந்த வரம்பைப் பற்றிய முன்காட்சியை வழங்குகிறது. 10 பிரதிநிதித்துவக் கேள்விகளை மேலும் விரிவாக ஆராய வழக்கு ஆய்வுகள் பக்கத்தை பார்வையிடவும்.
பொதுவான பெஞ்ச்மார்க் தோல்விகளைத் தவிர்க்கும் வகையிலும் GeneBench-Pro வடிவமைக்கப்பட்டுள்ளது. பல நீண்ட-கால நோக்குடைய உயிரியல் பெஞ்ச்மார்க்கள், ஒழுங்கற்ற வரலாற்றுத் தரவுத்தொகுப்புகளைச் சுற்றி பல-படி கேள்விகளை உருவாக்குகின்றன; அவற்றில் பகுப்பாய்வின் வழியாகச் செல்ல ஒரே ஒரு சரியான பாதை இல்லாமல் இருக்கலாம். ஒரு ஏஜென்ட் நியாயமாக ஆதரிக்கக்கூடிய ஒரு கட்-ஆஃப் மதிப்பைத் தேர்வு செய்யலாம்; அதே சமயம் மற்றொரு ஏஜென்ட் வேறுபட்டதானாலும் சம அளவில் நியாயமாக ஆதரிக்கக்கூடிய விருப்பத்தைத் தேர்வு செய்யலாம். இது, மாடல் செயல்திறனில் உள்ள அடிப்படை வேறுபாடுகளை விட, பெஞ்ச்மார்க் உருவாக்குநர் செய்த தன்னிச்சையான தேர்வுகளையே அதிகமாக பிரதிபலிக்கிறது. இதற்கு மாறானதும் நிகழலாம்: ஒரு சிக்கல் எண்ணியல் மாற்றங்களுக்கு மிகக் குறைந்த உணர்திறன் கொண்டதாக இருந்தால், ஒரு ஏஜென்ட் பகுப்பாய்வில் அடிப்படைப் பிழைகளைச் செய்தாலும் ஏற்றுக்கொள்ளத்தக்க முடிவை உருவாக்க முடியும்.
இந்தத் தோல்வி நிலைகளைத் தவிர்க்க, ஒவ்வொரு GeneBench-Pro பிரச்சினையும் செயற்கையாக உருவாக்கப்படுகிறது: முழுமையான காரண அமைப்பை நாங்கள் அறிந்திருக்கிறோம், மேலும் தரவை உருவாக்கும் செயல்முறையை நேரடியாக உருவகப்படுத்துகிறோம். அது ஒவ்வொரு பிரச்சினையின் சிக்கல்தன்மையைச் சீரமைக்கவும், அகநிலையான பகுப்பாய்வு தேர்வுகளில் உள்ள நியாயமான வேறுபாடுகள் இருந்தாலும் ஏற்றுக்கொள்ளப்படும் எண் சார்ந்த முடிவுகள் கிடைப்பதை உறுதிசெய்யவும், மேலும் நம்பத்தகுந்ததாகத் தோன்றினாலும் தவறான பகுப்பாய்வுகள் தோல்வியடைவதை (அப்லேஷன் ஆய்வுகள் மூலம்) சரிபார்க்கவும் எங்களுக்கு உதவுகிறது. அதன்பின், தகவல் கசிவு மற்றும் திட்டமிடப்படாத தீர்வு வழித்தடங்கள் உள்ளனவா என்பதைச் சரிபார்க்க, விரிவான தடயப் பகுப்பாய்வுகள் மூலம் பிரச்சினை வரைவுகளை நாங்கள் தணிக்கை செய்கிறோம். சரியான பதிலைப் பெறுவது சரியான பகுப்பாய்வு வழிமுறையைத் தேர்ந்தெடுப்பதில்தான் சார்ந்துள்ளது; குறுக்கு வழியைப் பயன்படுத்துவதிலோ அல்லது ஆசிரியரின் தன்னிச்சையான விருப்பத்துடன் பொருந்துவதிலோ அல்ல என்பதில் இது நமக்கு நம்பிக்கையளிக்கிறது.
129 GeneBench-Pro கேள்விகளில் 82-ஐ, பட்டமேற்படிப்பு மாணவர்கள், முனைவர் பட்டத்திற்குப் பிந்தைய ஆராய்ச்சியாளர்கள், தொழில்துறை விஞ்ஞானிகள் மற்றும் பேராசிரியர்கள் உள்ளிட்ட வெளியகத் துறை நிபுணர்களுக்கு அனுப்பினோம். மதிப்பாய்வாளர்கள் ஒவ்வொரு பிரச்சினையின் யதார்த்தத்தன்மை, இலக்கு விடை அடையாளம் காணக்கூடியதாக இருந்ததா, மற்றும் முறைகளும் மதிப்பீட்டிகளும் பொருத்தமானவையாக இருந்தனவா என்பவற்றை மதிப்பிட்டனர். சிக்கல்களை மேம்படுத்த பின்னூட்டம் பயன்படுத்தப்பட்டது.
“நான் மதிப்பாய்வு செய்த பிரச்சினைகளை, அனுபவமுள்ள மேற்பார்வையாளரிடமிருந்து மீண்டும் மீண்டும் கிடைக்கும் பின்னூட்டம் இல்லாமல் முடிப்பது ஒரு பட்ட மேற்படிப்பு மாணவருக்குச் சவாலாக இருந்திருக்கும். தரவுகளில் தொழில்நுட்ப மற்றும் தரக் கட்டுப்பாட்டு பிரச்சினைகள் இருந்ததால், அதை வெற்றிகரமாக முடிக்க சாத்தியமான இடர்பாடுகள் குறித்த விழிப்புணர்வுடன், சிந்தனையுடனும் பரிசீலனையுடனும் கூடிய தரவு பகுப்பாய்வு தேவைப்பட்டது; அவர்கள் சுத்தமான மற்றும் நன்கு செம்மைப்படுத்தப்பட்ட தரவுகளில் தயாராகக் கிடைக்கும் ஏதோ ஒரு முறையை வெறுமனே பயன்படுத்திக் கொண்டிருக்கவில்லை.”
“தற்போதைய மாடல்கள் தொடக்கம் முதல் முடிவு வரை சுயாதீனமான பகுப்பாய்வுகளை நம்பகமாக இயக்க முடியாவிட்டாலும், GeneBench-Pro சிக்கல்களில் சிறப்பாக செயல்படும் மாடல்கள், ஆராய்ச்சியாளர்களுக்கு சரியான பணிப்பாய்வுகளைத் தீர்மானிப்பதிலும் தரவை ஆராய்வதிலும் உதவ முடியும். அது ஆராய்ச்சியின் வேகம், முழுமைத்தன்மை மற்றும் மீளுருவாக்கத்தன்மையை பெரிதும் மேம்படுத்தும் என்பதை நான் காண முடிந்தது.”
ஒவ்வொரு GeneBench-Pro பிரச்சினையும் தன்னிறைவு கொண்ட அறிவியல் பகுப்பாய்வாகும். ஏஜெண்ட்கள், குறுகிய ப்ராம்ப்ட், தரவு கோப்புகள், மேலும் Python, அறிவியல் கணினியியல் நூலகங்கள், மற்றும் PLINK 2.0 போன்ற அடிப்படை ஜீனோமிக்ஸ் தொகுப்புகள் உட்பட ஒரு தரநிலை உயிர்தகவலியல் ஸ்டாக் கொண்ட தனிமைப்படுத்தப்பட்ட வர்க்ஸ்பேஸிற்கான அணுகலைப் பெறுகின்றன (இருப்பினும், பிரச்சினைகளுக்கு துறை-சார்ந்த கருவிகள் தேவையில்லை).
கட்டமைப்பு மாறுபாட்டால் வழிநடத்தப்படும் கட்டி சிகிச்சை நன்மை-ஆபத்து தீர்மானம்
முழு தரவு உருவாக்க செயல்முறையை நாங்கள் முழுமையாக கட்டுப்படுத்துவதால், அறியப்பட்ட இலக்குகளுக்கு எதிராக சரியானதைக் கணக்கிட முடிகிறது. இதனால், நிலையான ரூப்ரிக் அடிப்படையிலான மதிப்பீட்டில் காணப்படும் மாடல் தேர்வு மாறுபாடு மற்றும் அதிக சொல் பயன்பாட்டின் விளைவுகளைத் தவிர்க்க முடிகிறது.
ஒவ்வொரு பிரச்சினைக்கும், உத்தேசிக்கப்பட்ட பகுப்பாய்வு கட்டமைப்பு, இணைக்கப்பட்ட தரவுக் கோப்புகள், பல பக்கங்களைக் கொண்ட விரிவான வழக்குக் கள ஆய்வு மற்றும் நிபுணர் மதிப்பாய்வு முடிவுகள் உள்ளிட்ட செறிவான மெட்டாடேட்டாவும் வழங்கப்படுகிறது. நாங்கள் பத்து பிரதிநிதித்துவமான GeneBench-Pro கேள்விகளை Hugging Face(புதிய சாளரத்தில் திறக்கும்)-இல் முழுமையாக திறந்த மூலமாக வெளியிடுகிறோம், அவற்றை உலாவி பார்க்க இணைய இடைமுகத்துடன். இறுதியாக, விரைவில் சுயாதீனமான, மூன்றாம் தரப்பு பெஞ்ச்மார்க்கிங்கிற்காக 50 கேள்விகளைக் கொண்ட துணைத்தொகுப்பை Artificial Analysis(புதிய சாளரத்தில் திறக்கும்) -க்கு வழங்குவோம்.
எங்களின் மிக வலுவான மாடலான GPT‑5.6 Sol, மிக உயர்ந்த ரீஸனிங் நிலையில் 28.7% தேர்ச்சி விகிதத்தை அடைகிறது (Pro பயன்முறை இயக்கப்பட்டிருக்கும்போது 31.5%). அசல் GeneBench-ஐ உருவாக்கத் தொடங்கிய காலத்துடன் ஒப்பிடும்போது இது ஒரு கணிசமான உயர்வு; அப்போது, எங்கள் சிறந்த அதிநவீன மாடலான GPT‑5, 5%-க்கு கீழே மதிப்பெண் பெற்றது. இந்த பெஞ்ச்மார்க்கில் ஏற்பட்ட முன்னேற்றம், குறைவாகத் தெளிவாகப் புலப்படும், அமைப்புகள்-நிலை அறிவியல் ரீஸனிங்கிலும் கூட, அதிநவீன மாடல்கள் விரைவாக மேம்பட்டு வருகின்றன என்பதைச் சுட்டிக்காட்டுகிறது. தற்போதைய வேகத்தில் தொடர்ந்தால், இந்த அளவுகோல் ஆண்டின் இறுதிக்குள் பூரித நிலையை அடையலாம்.
சோதனை நேரக் கணிப்பீட்டு வளங்களை அளவுபடுத்துவதின் தாக்கத்தையும் முடிவுகள் காட்டுகின்றன. மிகக் குறைந்த ரீஸனிங் நிலையில், GPT‑5.6 Sol வெறும் ஒற்றை இலக்க தேர்ச்சி விகிதத்தை மட்டுமே அடைகிறது. மிக உயர்ந்த ரீஸனிங் நிலையில், GPT‑5.6 Sol, GPT‑5.2‑ஐ விட கிட்டத்தட்ட ஆறு மடங்கு அதிகமான கேள்விகளைத் தீர்க்கிறது சுமார் இரண்டு மூன்றில் பங்கு அளவு டோக்கன்களைப் பயன்படுத்தி செய்கிறது.
மாடல் குடும்பங்களுக்கிடையேயான ஒப்பீடுகள், அளவியல் நிச்சயமின்மையின் கீழ் உயர்நிலை அறிவியல் ரீஸனிங்கில் GPT மாடல்கள் மிக வலுவான அமைப்புகளில் ஒன்றாக உள்ளன. GPT‑5.6‑க்கும் இடையிலான செயல்திறன் இடைவெளி, GPT‑5.5 மற்றும் GLM 5.2 போன்ற முன்னணி ஓபன்-சோர்ஸ் மாடல்களுக்கிடையேயான வித்தியாசம், கோடிங் பெஞ்ச்மார்க்குகள்(புதிய சாளரத்தில் திறக்கும்) இலிருந்து கணித்துப் பார்க்கும்போது நாம் எதிர்பார்ப்பதை விட கணிசமாகப் பெரியதாக உள்ளது; இது, ஓபன்-சோர்ஸ் மாடல்கள் பரந்த ரீஸனிங் திறனை விட கோடிங்கிற்காக அதிகமாக சிறப்புப்படுத்தப்பட்டுள்ளன என்பதைக் காட்டுகிறது.
உருவாக்கத்தின் போது சிக்கல்களை மதிப்பிடவும் வலுப்படுத்தவும் நாங்கள் அதிநவீன GPT மாடல்களைப் பயன்படுத்தினோம். எனவே, பிற மாடல் குடும்பங்களுடன் ஒப்பிடும்போது GeneBench-Pro GPT மாடல்களுக்கு எதிராக சாய்வு கொண்டிருக்கலாம் என்று நாங்கள் சந்தேகித்தோம். இருப்பினும், போட்டியாளர் மாடல்கள் அதிகபட்சமாக வெளியீட்டு நேரத்தில் தொடர்புடைய GPT மாடலின் செயல்திறனுக்கு இணையாகவே இருந்தன, மேலும் பெரும்பாலும் கணிசமாக பின்தங்கின.
GeneBench-Pro கேள்விகளின் கடினத்தன்மையை கருத்தில் கொண்டால், GPT‑5.6 Sol (Pro) இல் 31.5% வரை உயர்ந்துள்ள இந்த மதிப்பீட்டு முடிவுகள் குறிப்பிடத்தக்கவை. ஒரு கருத்துக்கணிப்பில், எங்கள் மதிப்பாய்வாளர்கள் வழக்கமான GeneBench-Pro சிக்கலைத் தீர்க்க ஒரு மனித நிபுணருக்கு சுமார் 20–40 மணிநேரம் ஆகும் என்று மதிப்பிட்டனர். குறைந்தபட்ச மதிப்பீடாக ஒரு மணிநேரத்திற்கு $200 எனக் கொண்டாலும், ஒரே ஒரு சிக்கலுக்கான மனித உழைப்புச் செலவு ஆயிரக்கணக்கான டாலர்களாக ஆகிறது. தற்போதைய AI ஏஜென்ட்கள் மனித நிபுணர்களை மாற்றுவதற்கு இன்னும் மிகவும் நம்பகமற்றவையாகவே உள்ளன. ஆனால் செலவு வித்தியாசம் பெரியதாக உள்ளது, அனுமானச் செலவுகள் ஒவ்வொரு சிக்கலுக்கும் சில டாலர்கள் மட்டுமே. அதாவது, தற்போதைய திறன்களிலேயே பகுதியளவு தானியக்கம்கூட குறிப்பிடத்தக்க பொருளாதார மற்றும் அறிவியல் மதிப்பை உருவாக்க முடியும்.
“பெஞ்ச்மார்க்குகள் பல்வேறு வகையான உயிரியல் கேள்விகளால் தூண்டப்படுகின்றன, ஆனால் உண்மையான சவால் ஆய்வுசார் தரவு பகுப்பாய்வு மற்றும் இந்தக் கண்டுபிடிப்புகள் குறித்த ரீஸனிங் உள்ளது: வடிவங்கள் மற்றும் ஆர்டிஃபாக்ட்களை அடையாளம் காணுதல், மேலும் தரவை நீக்க வேண்டுமா அல்லது சரிசெய்ய வேண்டுமா என்பதைத் தீர்மானித்தல். இது உண்மையான உயிரியல் தரவுத்தொகுப்புகளின் குழப்பமான இயல்பை ஒத்திருக்கிறது. இந்த மதிப்பீடுகளை மதிப்பாய்வு செய்வது, ஏஜென்ட்-அடிப்படையிலான அறிவியல் சிக்கல் தீர்வில் தெளிவான தீர்வாளர் ஒப்பந்தங்கள் எவ்வளவு முக்கியமானவை என்பதை எடுத்துக்காட்டுகிறது. வேறுபட்ட ப்ராம்ப்ட் வார்த்தையாக்கம் அல்லது பணி விவரக்குறிப்பு, எந்தப் பகுப்பாய்வுகள் அனுமதிக்கத்தக்கவையாகத் தோன்றும் என்பதை பெரிதும் பாதிக்கலாம்.”
“எனக்கு [the questions] பெரும்பாலும் பிடித்திருந்தன. அவற்றில் பொதுவாக பின்வருவன கலவையாக இருந்தன: (1) பண்டைய DNA-இல் C>T சார்பு போன்ற, அந்தப் பொருள் குறித்துத் தேவையான அறிவு, (2) வம்சாவளி இடமாற்றங்கள் போன்ற தரவு முரண்பாடுகள், (3) அந்தப் பணிக்கான சரியான பகுப்பாய்வு கருவிகள் மற்றும் அவற்றை எவ்வாறு செயல்படுத்துவது குறித்த ஒரு வகையான அறிவு. பெரும்பாலான ஏஜென்ட்கள் (2)-இல் தோல்வியடைந்ததாகத் தோன்றியது. தரவு சிக்கல்கள் குறித்து அவர்கள் போதுமான அளவு எச்சரிக்கையாக இல்லை. ஒருவேளை அது தற்போதைய மாடல்களின் ஒரு பலவீனத்தை வெளிப்படுத்துகிறது. மேலும், பல உயிரியல் தரவுகளில் ஒழுங்கற்ற தன்மைகள் உள்ளன.”
இருப்பினும், அதிநவீன மாடல்கள் இன்னும் இந்தப் பிரச்சினைகளில் மூன்றில் ஒரு பங்குக்கும் குறைவானவற்றையே தீர்க்கின்றன என்பது, மேம்பாட்டிற்கு கணிசமான இடம் உள்ளது என்பதைக் காட்டுகிறது. மாடல்கள் சவாலான பிரச்சினைகளில் பகுதியளவு முன்னேற்றம் காண முடியும், ஆனால் அனுமானச் சுழற்சியை நிறைவு செய்வதில் அவை சிரமப்படுகின்றன. இந்தத் தோல்விப் பாங்கு, மனித நிபுணர்களுக்கும் தொடக்கநிலையினருக்கும் இடையிலான வேறுபாட்டைப் பிரதிபலிக்கிறது. நிபுணர்கள் தங்கள் அனுபவத்தைப் பயன்படுத்தி பிரச்சினையை வரையறுத்து, தங்கள் அணுகுமுறையை ஏற்ப மாற்றுகின்றனர்; அதே சமயம், தொடக்கநிலையினர் கவனிப்புகளைச் செய்கிறார்கள், ஆனால் அவற்றை பிரச்சினையின் பரந்த சூழலில் ஒருங்கிணைக்க சிரமப்படுகிறார்கள்.
பிரச்சனை: காலம் மாறும் சிகிச்சையுடன் மருந்து மரபணு நிகழ்வு நேரம்-படி பதில்
GPT-5.5 முறை
GPT-5.6 Sol முறை
கிட்டத்தட்ட பூரணமான செயல்திறனை அடைவதற்கு, முன்னேற்றத்தை நம்பகமாக அளந்து, மாடல்கள் இன்னும் எங்கு தோல்வியடைகின்றன என்பதையும் அடையாளம் காணும் மதிப்பீடுகள் தேவைப்படும். GeneBench-Pro போன்ற செயல்திறன் அளவுகோல்கள், தெளிவற்ற திறன் குறைபாட்டை நாம் கண்டறிந்து மேம்படுத்தக்கூடிய ஒன்றாக மாற்ற உதவலாம்.
ஏஜென்ட்கள் இந்த வகை பகுப்பாய்வை நம்பகமாக தானியக்கமாக்க முடிந்தால், அவை அறிவியல் கண்டுபிடிப்புகளை குறிப்பிடத்தக்க அளவில் வேகப்படுத்தக்கூடும். மனித மரபணு ஆதாரங்கள், சிகிச்சை இலக்குகளை முன்னுரிமைப்படுத்துவதிலும் மருத்துவப் பயன்பாட்டுக்கான தொடராய்விலும் ஏற்கனவே மையப் பங்கு வகிக்கின்றன. ஏனெனில் மரபணு ஆதரவு கொண்ட செயல்முறைகள் அங்கீகரிக்கப்பட்ட சிகிச்சைகளுக்கு வழிவகுக்கும் வாய்ப்பு அதிகமாகும்.
இதற்கிடையில், வரிசையாக்கச் செலவுகள் கடுமையாகக் குறைந்துள்ளன, மேலும் உயிரிவங்கி அளவிலான தரவுத்தொகுப்புகள் இப்போது மூலக்கூறு, பண்புரு மற்றும் ஹெல்த் பதிவுத் தகவல்களை முன்னெப்போதும் இல்லாத பரந்த அளவில் இணைக்கின்றன. கட்டுப்படுத்தும் காரணி தரவு உருவாக்கத்திலிருந்து, தகவலை செயல்படுத்தக்கூடிய தெளிவான நுண்ணறிவுகளாக மாற்றுவதற்கு மாறிக்கொண்டிருக்கிறது. தற்போது மனித நிபுணர்கள் குழுக்களால் கையாளப்படும் பகுப்பாய்வுகளை நிலையாகச் செய்யக்கூடிய மாடல்கள், கருதுகோள்களை முன்னுரிமைப்படுத்தி வகைப்படுத்துதல், இலக்குகளைத் தொடர்ந்து ஆய்வு செய்தல், மற்றும் தரவு உருவாக்கம் மற்றும் முடிவெடுத்தல் ஆகியவற்றுக்கிடையிலான மறுசுழற்சியை வேகப்படுத்துவதன் மூலம் தொழில்துறை ஆராய்ச்சியை மாற்றியமைக்கக்கூடும்.
GeneBench-Pro என்பது அனுபவமிக்கவர்களிடம் உள்ள நல்ல அறிவியல் தீர்மானத் திறன்களை மதிப்பிடுவதற்கான ஒரு ஆரம்ப முயற்சியாகும். இந்தத் திறன்கள், அவர்கள் மிக நம்பிக்கைக்குரிய ஆரம்ப பகுப்பாய்வுகளை உள்ளுணர்வின் மூலம் கணித்து அடையாளம் காணவும், தரவுகள் ஆரம்ப ஊகங்களுக்கு முரணாக இருக்கும்போது தங்கள் சிந்தனையை மீண்டும் பரிசீலித்து திருத்திக்கொள்ளவும், பின்னர் எடுக்கப்படும் மருத்துவ, கல்விசார் அல்லது வணிகத் தீர்மானங்கள் சார்ந்திருக்கக்கூடிய முடிவுகளை எட்டவும் உதவுகின்றன.
மாடல்களின் திறன்கள் மேம்படும்போது, புத்தக அறிவையோ அல்லது வழக்கமான பகுப்பாய்வுகளைச் செய்வதற்கான திறனையோ மட்டும் சோதிக்கும் தரநிலைகளை விட, உயர்மட்ட சிந்தனை மற்றும் பகுத்தறியும் திறன்களை மதிப்பிடும் தரநிலைகள் அதிக முக்கியத்துவம் பெறும் என்று நாங்கள் எதிர்பார்க்கிறோம்.


