ወደ ዋና ይዘት እለፍ
OpenAI

GeneBench-Proን ማስተዋወቅ

በኮምፒውቴሽናል ባዮሎጂ ውስጥ የሰው ሠራሽ አስተውሎት (AI) ወኪሎች አሻሚነትን እንዴት እንደሚያልፉ እና ጉልህ ተጽዕኖ ያላቸውን ውሳኔዎች እንዴት እንደሚያደርጉ የሚለካ የምርምር-ደረጃ መመዘኛ።

በመጫን ላይ…

ሳይንሳዊ ውሂቦች ከመመሪያዎች ጋር የሚመጡት አልፎ አልፎ ነው። ተመራማሪዎች አንድ ቅጥ ባዮሎጂያዊ ክስተትን ወይም የመረጃ ዝብርቅርቅነትን የሚያመለክት መሆኑን፣ መረጃው የቀረበውን ጥያቄ ለመደገፍ ይችል እንደሆነ፣ እና እያንዳንዱ ውጤት ቀጥሎ የሚያደርጉትን ነገር እንዴት ሊቀይር እንደሚገባ መወሰን አለባቸው። የሰው ሠራሽ አስተውሎት (AI) ወኪሎች ውስብስብ ትንታኔዎችን ለማከናወን ያላቸው ችሎታ እየጨመረ ነው፣ ነገር ግን እውነታዊ ሳይንሳዊ ምርምር በእውነታዎችን በማስታወስ ወይም በቀድሞ የተወሰነ የሥራ ፍሰት መከተል ብቻ ሳይሆን፣ ከፍተኛ ደረጃ የማመዛዘን ፍርዶች ማድረግ እንደሚጠቅም ይመሠረታል።

ዛሬ፣ GeneBench-Proን እያስተዋወቅን ነው—በእውነተኛው ዓለም የኮምፒውቴሽናል ባዮሎጂ የሚፈልገውን ዓይነት በፍርድ እና በጥልቅ ግምገማ ላይ የሚመሠረት ትንተና ሞዴሎች መያዝ ይችላሉ ወይም አይችሉም ለመፈተሽ የተዘጋጀ ፈታኝ፣ የምርምር ደረጃ መመዘኛ። ይህ በ GeneBench(በአዲስ መስኮት ውስጥ ይክፈታል) ላይ በመጨመር፣ በጂኖሚክስ፣ በቁጥራዊ ባዮሎጂ እና በትራንስሌሽናል ሕክምና ዘርፎች ውስጥ የበለጠ ከባድና የበለጠ እውነታዊ ተግባራትን ለመሸፈን ይሰፋል፤ በኮምፒውቴሽናል ባዮሎጂ ውስጥ ያለውን የሳይንሳዊ ምርምር ውስብስብነት፣ ተደጋጋሚ ባህሪ እና አሻሚነት ይይዛል። 

እስከ ዛሬ ድረስ፣ በሥርዓት ስር የሚደረጉ የሙያዊ ፍርድ ውሳኔዎች የእውነተኛ ዓለም ስሌታዊ ምርምርን አስቸጋሪ የሚያደርጉትን በአሳማኝ ሁኔታ የሚገመግሙ ጥናቶች ጥቂት ብቻ ተገኝተዋል። እነዚህም አሻሚነትን መቆጣጠር፣ ግምቶችን እንደገና መመርመር፣ ትክክለኛውን የትንተና መንገድ መምረጥ፣ እና ውጤት ለውሳኔ ለመጠቀም መቼ ዝግጁ እንደሚሆን ማወቅን ያካትታሉ። እነዚህ ክህሎቶች በመደበኛ መልክ ለመቅረጽ አስቸጋሪ ስለሆኑ፣ በእነሱ ውስጥ ያሉ ድክመቶች አጠቃላይ የሰው ሠራሽ አስተውሎት (AI) አፈጻጸምን እየጨመረ ቢገድቡም፣ እነሱን በጥብቅ ለመገምገምም አስቸጋሪ ነው።።

"በባዮሎጂ ውስጥ ያለው የመመዘኛ ክፍተት" በሚል ርዕስ የተሰየመ ዲያግራም፣ ባህላዊ የመመዘኛ የሥራ ፍሰቶችን ከመጀመሪያ እስከ መጨረሻ ከሚካሄድ ሳይንሳዊ ትንተና ጋር ያነጻጽራል፣ ወደ ሳይንሳዊ መደምደሚያ ከመድረስ በፊት እንደ ቅድመ-ማቀናበር፣ ሞዴል ማዘጋጀት፣ ምርመራዎች እና ተደጋጋሚ ማሻሻያ ያሉ ተጨማሪ ደረጃዎችን ያሳያል።

GeneBench-Pro እነዚህን ከፍተኛ ደረጃ ችሎታዎች በትክክል ለመለካት የተነደፈ ነው። በGeneBench-Pro ውስጥ፣ "የምርምር ጣዕም" ማለት ትንተናን የሚቀርጹ ተከታታይ የሙያዊ ግምገማ ውሳኔዎች እንደሆኑ እንገልጻለን፦ ውሂቡ የትኞቹን ጥያቄዎች ሊደግፍ እንደሚችል፣ ቀደምት ዳያግኖስቲክሶች ሞዴሉን ወይም ግምት-ግቡን እንዴት መቀየር እንዳለባቸው፣ እና የመጀመሪያ ዕቅድ መቼ መከለስ እንዳለበት። እያንዳንዱ የGeneBench-Pro ችግር ለሞዴሉ እውነታዊና የተዝረከረከ የውሂብ ስብስብ፣ አጭር የሙከራ ዐውድ፣ እና ከቀጣይ ውሳኔ ጋር የተያያዘ ዒላማ ግምት-ግብ መጠን ይሰጣል። በትክክል ለመመለስ፣ ሞዴሉ ውሂቡን መመርመር፣ ተገቢ የትንተና አቀራረብ መምረጥ፣ በተደጋጋሚ የሙከራ ሂደት ውስጥ መሳተፍ፣ እና የመጨረሻ መልስ ማቅረብ አለበት።

የውሂብ ስብስብ ግንባታ

በባዮሎጂ መስክ፣ የውሂብ ማመንጨት ወጪ (ለምሳሌ፣ የጂኖም ቅደም ተከተል መወሰን) በጣም ቀነሰ፣ እና ገዳቢው ምክንያት ከእንግዲህ ናሙና መሰብሰብ ሳይሆን ተከታይ ስሌትና ትንተና መሆኑን አንዳንድ ተመራማሪዎች አሁን ይናገራሉ(በአዲስ መስኮት ውስጥ ይክፈታል) ። GeneBench-Pro ያንን ማነቆ በመፍታት ያለውን እድገት ለመገምገም የተገነባ ሲሆን፣ ሰፊ የኮምፒውቴሽናል ባዮሎጂ ሁኔታዎችን እና ዘዴዎችን የሚሸፍኑ 129 ጥያቄዎችን ይዟል።

የዶሜይን አትላስ፦ በ 10 ዶሜይኖች እና በ 21 ንዑስ-ዶሜይኖች ውስጥ 129 ችግሮች

በመለኪያ ችግሮች መካከል ለመዘዋወር የቀስት ቁልፎቹን ይጠቀሙ። የተመረጠው ችግር ዝርዝሮች ከዚህ በታች ይታያሉ።

ስለ የመለኪያ ችግር ለማወቅ ከላይ ባለው ነጥብ ላይ ጠቅ ያድርጉ።

ይህ አትላስ የGeneBench-Pro ስፋትን ቅድመ ዕይታ ያቀርባል። 10 ተወካይ ጥያቄዎችን በበለጠ ዝርዝር ለማሰስ የጉዳይ ጥናቶች ገጽን ይጎብኙ።

GeneBench-Pro እንዲሁም የተለመዱ የመለኪያ አለመሳካቶችን ለማስወገድ ተዘጋጅቷል። ብዙ የረጅም ጊዜ የባዮሎጂ መመዘኛዎች በውስብስብ ታሪካዊ የውሂብ ስብስቦች ዙሪያ በብዙ ደረጃ ጥያቄዎች ይገነባሉ፣ በዚህም በትንተናው ውስጥ አንድ ብቻ ትክክለኛ መንገድ ላይ እንደማይኖር ይችላል። አንድ ወኪል አንድ የመቁረጫ ገደብ ሊመርጥ ይችላል፣ ሌላ ወኪል ደግሞ ሌላ ነገር እኩል በሚያስተዋውቅ መንገድ ሊመርጥ ይችላል፣ ይህም በሞዴል አፈጻጸም ውስጥ ካሉ መሠረታዊ ልዩነቶች ይልቅ፣ በመለኪያው ፈጣሪ የተደረጉ የዘፈቀደ ምርጫዎችን ይገልጻል። ተቃራኒውም ሊከሰት ይችላል፦ አንድ ችግር በቁጥራዊ መለኪያዎች ላይ በጣም ተጽዕኖ የማይቀበል ከሆነ፣ ወኪል በትንተና ውስጥ መሠረታዊ ስህተቶችን ሊፈጽም እና እንዲሁም የሚያሳልፍ ውጤት ሊያመነጭ ይችላል።

እነዚህን የውድቀት ሁኔታዎች ለማስወገድ፣ እያንዳንዱ የGeneBench-Pro ችግር ሲንተቲክ በሆነ መንገድ ይገነባል፦ ሙሉውን ምክንያታዊ መዋቅር እናውቃለን እና ውሂብ የሚያመነጨውን ሂደት በቀጥታ እናስመስላለን። ይህም የእያንዳንዱን ችግር ውስብስብነት እንድናስተካክል፣ በግላዊ የትንታኔ ምርጫዎች ውስጥ ያሉ ምክንያታዊ ልዩነቶች እንኳን ተቀባይነት ያላቸው ቁጥራዊ ውጤቶችን እንዲያስገኙ እንድናረጋግጥ፣ እና ተመን ያላቸው ቢመስሉም ትክክል ያልሆኑ ትንታኔዎች እንደሚወድቁ በአብሌሽን ጥናቶች በኩል እንድናረጋግጥ ያስችለናል። ከዚያም የመረጃ መፍሰስን እና ያልታሰቡ የመፍትሄ መንገዶችን ለመፈተሽ፣ የችግር ረቂቆችን በዝርዝር የመከታተያ ትንተናዎችን ኦዲት እናደርጋለን። ይህ ትክክለኛውን መልስ ማግኘት ትክክለኛውን የትንተና መንገድ በመምረጥ ላይ እንደሚመሠረት፣ አቋራጭ መንገድን በመጠቀም ወይም የደራሲውን ያለምክንያት ምርጫ በመከተል ላይ እንዳልሆነ እምነት ይሰጠናል።

"የGeneBench-Pro ችግር ግንባታና ማረጋገጫ" በሚል ርዕስ ያለ ዲያግራም፤ ሊካሄድ የሚችል ተግባር ከመገንባት ጀምሮ በግምገማ፣ በጽናት ምርመራዎች፣ በወኪል ሙከራ፣ በባለሙያ ግምገማ፣ በክለሳ እና በተጠናቀቀ የመመዘኛ ችግር የሚያበቃ የሥራ ፍሰት ያሳያል።

ከ129 የGeneBench-Pro ጥያቄዎች 82ቱን ወደ ውጫዊ የዘርፍ ባለሙያዎች ላክን፣ እነዚህም የምረቃ ተማሪዎች፣ የድህረ ምረቃ ተመራማሪዎች፣ የኢንዱስትሪ ሳይንቲስቶች እና ፕሮፌሰሮች ናቸው። ገምጋሚዎች የእያንዳንዱን ችግር እውነታነት፣ የታለመው መልስ መለየት የሚቻል መሆኑን፣ እና ዘዴዎቹና ግምት ሰጪ መለኪያዎቹ ተገቢ መሆናቸውን ገምግመዋል። ግብረመልስ ችግሮችን ለማሻሻል ጥቅም ላይ ውለዋል።

1 ከ 2
የገመገምኳቸው ችግሮች ልምድ ያለው አማካሪ ተደጋጋሚ ግብረ-መልስ ባይሰጥ ኖሮ ለማጠናቀቅ ለምረቃ ተማሪ ፈታኝ ይሆኑ ነበር። መረጃው በተሳካ ሁኔታ ለማጠናቀቅ ሊከሰቱ የሚችሉ ችግሮችን በማስተዋል፣ በጥንቃቄ የታሰበና አስተውሎታዊ የመረጃ ትንተና የሚያስፈልጉ ቴክኒካዊ እና የጥራት ቁጥጥር ችግሮችን ይዟል፤ እነሱ በንጹህና በጥሩ ሁኔታ በተደራጀ መረጃ ላይ ዝግጁ የሆነ ዘዴን ብቻ እየተገበሩ አልነበረም።
Alexander Strudwick Young፣ በUCLA የሂዩማን ጄኔቲክስ የረዳት ፕሮፌሰር

ግምገማ እና ደረጃ አሰጣጥ

እያንዳንዱ የGeneBench-Pro ችግር ራሱን የቻለ ሳይንሳዊ ትንታኔ ነው። ወኪሎች አጭር እርምጃ፣ የውሂብ ፋይሎች፣ እና Python፣ የሳይንሳዊ ስሌት ላይብረሪዎች፣ እና እንደ PLINK 2.0 ያሉ መሠረታዊ የጂኖሚክስ ፓኬጆችን የሚያካትት መደበኛ የባዮኢንፎርማቲክስ መተግበሪያ ስብስብ ያለው ተነጥሎ የተዘጋጀ የሥራ ቦታ መዳረሻ ያገኛሉ (ምንም እንኳን ችግሮቹ ዘርፍ ተኮር መሣሪያዎችን ባይፈልጉም)።

በመዋቅራዊ ተለዋጭ የሚመራ የዕጢ ሕክምና የጥቅም-አደጋ ውሳኔ

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

ሙሉውን የውሂብ-ማመንጨት ሂደት ስለምንቆጣጠር፣ በመደበኛ በመመዘኛ መስፈርቶች ላይ የተመሠረተ ግምገማ ውስጥ የሚገኙትን የሞዴል-ምርጫ ተለዋዋጭነት እና የዝርዝርነት ተጽዕኖዎች በማስወገድ፣ ትክክለኛነትን ከታወቁ ዒላማዎች ጋር በውስን እና በተወሰነ መንገድ መመዘን እንችላለን።

እያንዳንዱ ችግር የታሰበውን የትንተና መዋቅር፣ የተያያዙ የውሂብ ፋይሎች፣ ዝርዝር ባለብዙ ገጽ የኬዝ ጥናት፣ እና የባለሙያ ግምገማ ውጤቶችን ጨምሮ የበለጸገ ሜታዳታ ይዞ ይመጣል። እኛ 10 ተወካይ የGeneBench-Pro ጥያቄዎችን በ Hugging Face(በአዲስ መስኮት ውስጥ ይክፈታል) ላይ ሙሉ በሙሉ ክፍት ምንጭ ሆኖ እንቀርባለን፣ እነዚህን ለማሰስ የሚያስችል መስተጋብራዊ የድር በይነገጽ አለ። በመጨረሻ፣ በቅርብ ጊዜ ለገለልተኛ የሶስተኛ ወገን የአፈጻጸም ማመሳከሪያ ግምገማ 50 ጥያቄዎችን ያካተተ ንዑስ ስብስብ ለ የሰው ሠራሽ ትንተና(በአዲስ መስኮት ውስጥ ይክፈታል) እናቀርባለን።

ውጤቶች

በጣም ጠንካራው ሞዴላችን፣ GPT‑5.6 Sol፣ በከፍተኛው የማመዛዘን ደረጃ 28.7% የማለፍ መጠን ያሳካል (የPro ሁነታ ሲነቃ 31.5%)። ይህ መጀመሪያውን GeneBench መገንባት ከጀመርንበት ጊዜ ጋር ሲነጻጸር ጉልህ ጭማሪ ነው፤ በዚያን ጊዜ፣ ምርጡ ግንባር ቀደም ሞዴል GPT‑5 ከ5% በታች ነጥብ አስመዝግቧል። በዚህ መለኪያ ላይ የታየው እድገት፣ ግንባር ቀደም ሞዴሎች በፍጥነት እየተሻሻሉ እንዳሉ ያመለክታል፣ በቀላሉ በማይዳሰስ፣ በሥርዓት-ደረጃ የሳይንሳዊ ማመዛዘን ላይም እንኳ። በአሁኑ ፍጥነት፣ ይህ መለኪያ እስከ ዓመቱ መጨረሻ ሙሉ በሙሉ ሊሞላ ይችላል።

ውጤቶቹ እንዲሁም በሙከራ ጊዜ የስሌት መጠን ማስፋት ያሳያሉ። በዝቅተኛው የማመዛዘን ደረጃ፣ GPT‑5.6 Sol አንድ ቁጥር ውስጥ የማለፊያ ደረጃ ብቻ ያሳካል። በከፍተኛው የማመዛዘን ደረጃ፣ GPT‑5.6 Sol ከ GPT‑5.2 በስድስት ጊዜ በቅርብ ያህል ብዙ ጥያቄዎችን ይፈታል። ይህንንም በግምት ሁለት ሦስተኛ ያህል tokenዎችን በመጠቀም ያደርጋል።

በሞዴል ቤተሰቦች መካከል ያሉ ንጽጽሮች እንደሚያመለክቱት፣ GPT ሞዴሎች በመጠናዊ አለመረጋገጥ ሁኔታ ውስጥ በከፍተኛ ደረጃ ሳይንሳዊ ማመዛዘን ላይ ከጠንካራ ሥርዓቶች መካከል እንደሆኑ ይገልጻሉ። በGPT‑5.6 ፣ መካከል ያለው የአፈጻጸም ክፍተት በGPT‑5.5 እና እንደ GLM 5.2 ያሉ መሪ ክፍት-ምንጭ ሞዴሎች መካከል ያለው ልዩነት፣ ከ የኮዲንግ መመዘኛዎች(በአዲስ መስኮት ውስጥ ይክፈታል) በመነሳት ስንገምት ከምንጠብቀው በእጅጉ ይበልጣል፤ ይህም ክፍት-ምንጭ ሞዴሎች ለሰፊ ማመዛዘን ከሚሆኑት ይልቅ ለኮዲንግ የበለጠ ልዩ ትኩረት እንዳላቸው ያመለክታል።

በግንባታ ወቅት ችግሮችን ለመገምገም እና ለማጠናከር ግንባር ቀደም GPT ሞዴሎችን ተጠቅመናል። በመሆኑም፣ GeneBench-Pro ከሌሎች የሞዴል ቤተሰቦች ጋር ሲነጻጸር በGPT ሞዴል ላይ አድልዎ ሊኖረው ይችላል ብለን ጠርጥረናል። ሆኖም፣ የተወዳዳሪ ሞዴሎች ቢበዛ በሚለቀቁበት ጊዜ የነበረውን ተዛማጅ GPT ሞዴል አፈጻጸም ብቻ ይመጣጠኑ ነበር፣ እናም በአብዛኛው በከፍተኛ መጠን ያንሱ ነበር።

እነዚህ የግምገማ ውጤቶች—በGPT‑5.6 Sol (Pro) ላይ እስከ 31.5% ድረስ የደረሱ—እንደ የGeneBench-Pro ጥያቄዎች አስቸጋሪነት አስደናቂ ናቸው። በአንድ ዳሰሳ ጥናት፣ ገምጋሚዎቻችን አንድ መደበኛ የGeneBench-Pro ችግር ለማጠናቀቅ ለሰው ባለሙያ በግምት 20–40 ሰዓታት እንደሚወስድ ገምተዋል። በሰዓት 200 ዶላር የሚሆን ቁጥብ ግምት እንኳን፣ ይህ የአንድ ችግር የሰው ጉልበት ወጪን በሺዎች የሚቆጠር ዶላር ያደርሰዋል። አሁን ያሉት የሰው ሠራሽ አስተውሎት (AI) ወኪሎች የሰው ባለሙያዎችን ለመተካት አሁንም በቂ አስተማማኝ አይደሉም፣ ነገር ግን የወጪው ልዩነት ትልቅ ነው፣ የግምት ወጪዎችም ለእያንዳንዱ ችግር ጥቂት ዶላሮች ብቻ ናቸው። ይህ ማለት፣ በአሁኑ የችሎታ ደረጃ እንኳን ከፊል ራስ-ሰር ማድረግ አስፈላጊ የኢኮኖሚና ሳይንሳዊ እሴት ሊፈጥር ይችላል ማለት ነው።

1 ከ 2
መለኪያዎቹ በተለያዩ የባዮሎጂ ጥያቄዎች ይነሳሳሉ፣ ነገር ግን … ትክክለኛው ፈተና የሚመጣው ከአሰሳዊ የውሂብ ትንተና እና በእነዚህ ግኝቶች ላይ ከሚደረግ ማመዛዘን ነው፦ ንድፎችን እና አርቲፋክቶችን መለየት፣ እንዲሁም ውሂቡ መገለል ወይም መስተካከል እንዳለበት መወሰን። ይህ የእውነተኛ ባዮሎጂያዊ የውሂብ ስብስቦችን የተዘበራረቀ ባህሪ ይመስላል። እነዚህን ግምገማዎች መከለስ፣ በወኪል ላይ ተመሥርቶ ለሚከናወን ሳይንሳዊ ችግር አፈታት የሶልቨር ግልጽ ውል-መግለጫዎች ምን ያህል አስፈላጊ እንደሆኑ ያጎላል። የተለያየ እርምጃ አቀራረብ ወይም የተግባር መግለጫ፣ የትኞቹ ትንታኔዎች የሚፈቀዱ መስለው እንደሚታዩ በእጅጉ ተጽዕኖ ሊያሳድር ይችላል።
Cyrillus Tan፣ በኒው ዮርክ ጂኖም ማዕከል የድህረ-ዶክትሬት የምርምር ተባባሪ

ሆኖም፣ ግንባር ቀደም ሞዴል ከእነዚህ ችግሮች ከሦስተኛው በታች ብቻ መፍታታቸው እንደሚያሳየው ለመሻሻል ብዙ ዕድል አለ። ሞዴሎች በችግር ችግሮች ላይ ከፊል እድገት ሊያሳዩ ይችላሉ፣ ነገር ግን የማመዛዘን ዑደቱን ለመዝጋት ይቸገራሉ። ይህ የውድቀት ንድፍ በሰው ባለሙያዎችና በጀማሪዎች መካከል ያለውን ልዩነት ያንጸባርቃል። ባለሙያዎች ችግሩን ለመቅረጽ እና አቀራረባቸውን ለማስማማት ልምዳቸውን ይጠቀማሉ፣ ጀማሪዎች ግን ምልከታዎችን ቢያደርጉም እነዚህን ከችግሩ ሰፊ ዐውድ ጋር ለማዋሃድ ይቸገራሉ።

ችግር፦ ከጊዜ ጋር የሚለዋወጥ ሕክምና ያለው የፋርማኮጄኖሚክ የጊዜ እስከ ክስተት ምላሽ

የሕክምና መጀመሪያ ሂደት፣ በጂኖታይፕ የተለየ ምላሽ፣ የዘገየ ፋርማኮዳይናሚክስ፣ የተለመዱ ተጠቃሚ ምልክቶች፣ እና በረዥም ጊዜ የሚከተሉ ባዮማርከሮች በጋራ የምክንያታዊ በሕይወት መቆየት ግምት-ግብን ይወስናሉ።

GPT-5.5 ንድፍ

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

GPT-5.6 Sol ንድፍ

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

ከፍጹም ቅርብ የሆነ አፈጻጸምን ማሳካት የሚፈልጉ ግምገማዎች እድገትን በአስተማማኝ ሁኔታ ለመለካት እና ሞዴሎች እያልፉባቸው ያሉትን ቦታዎች ለማወቅ አስፈላጊ ናቸው። እንደ GeneBench-Pro ያሉ መመዘኛዎች ግልጽ ያልሆነን የችሎታ ጉድለት ልንመረምረው እና ልናሻሽለው የምንችለው ነገር ለመሆን ሊረዱ ይችላሉ። 

ወኪሎች ይህን ዓይነት ትንተና በአስተማማኝ ሁኔታ ራስ-ሰር ማድረግ ከቻሉ፣ ሳይንሳዊ ግኝትን በእጅጉ ሊያፋጥኑ ይችላሉ። የሂዩማን ጄኔቲክ ማስረጃ በዒላማዎች ቅድሚያ መስጠት እና በትርጉም ምርምር ተከታይ ሥራ ውስጥ አስቀድሞ ዋና ሚና እየተጫወተ ነው፤ ምክንያቱም በጄኔቲክ ድጋፍ የተደገፉ መካኒዝሞች ወደ ተፈቀዱ ሕክምናዎች ሊያመሩ የሚችሉበት ዕድል እጅግ ከፍተኛ ነው።

በዚህ መካከል፣ የሲኩዌንሲንግ ወጪዎች በእጅጉ ቀንሰዋል፣ እና የባዮባንክ ደረጃ ያላቸው የውሂብ ስብስቦች አሁን ሞለኪውላዊ፣ ፊኖታይፓዊ እና የጤንነት መዝገብ መረጃን በከዚህ በፊት ባልታየ ስፋት ያገናኛሉ። ገዳቢው ምክንያት ከውሂብ ማመንጨት ወደ መረጃውን በተግባር ሊውሉ የሚችሉ ግንዛቤዎች ለማድረግ እየተሸጋገረ ነው። አሁን በሰው ባለሙያዎች ቡድኖች የሚከናወኑትን ትንተናዎች በተስማሚና በተሟላ ሁኔታ ማፈጸም የሚችሉ ሞዴሎች፣ የመላምት ማጣራትን፣ የዒላማ ክትትልን፣ እና በውሂብ ማመንጨት እና በውሳኔ አሰጣጥ መካከል ያለውን የድግግሞሽ ዑደት በማፋጠን ኢንዱስትሪያዊ ምርምርን ሊለውጡ ይችላሉ።

GeneBench-Pro በተሞክሮ ያላቸው ሰዎች ያላቸውን ጥሩ ሳይንሳዊ ፍርድ ላይ የሚያሳይ የተለያዩ ክህሎቶችን ለመገምገም የመጀመሪያ ጥረት ነው። እነዚህ ክህሎቶች በጣም ተስፋ ሰጪ የመጀመሪያ ትንታኔዎችን በጥልቅ ግንዛቤ እንዲገምቱና እንዲለዩ፣ መረጃዎች የመጀመሪያ ግምቶቻቸውን ሲቃረኑ አስተሳሰባቸውን በድግግሞሽ እንዲያሻሽሉና እንዲከልሱ፣ እንዲሁም በኋላ የሚወሰኑ ክሊኒካዊ፣ አካዳሚያዊ ወይም የንግድ ውሳኔዎች ሊመሠረቱባቸው የሚችሉ መደምደሚያዎች ላይ እንዲደርሱ ያስችላቸዋል። 

የሞዴል አቅሞች እየተሻሻሉ ሲሄዱ፣ በእነዚህ ከፍተኛ የረቂቅነት ደረጃዎች ላይ የሞዴል ችሎታዎችን የሚመረምሩ መመዘኛዎች፣ በቀላሉ የመጽሐፍ እውቀትን ወይም የተለመዱ ትንተናዎችን የማከናወን ችሎታን ከሚፈትሹት ባሻገር፣ እየጨመረ ጠቃሚ እንደሚሆኑ እንገምታለን።

ደራሲ

OpenAI