মূল কনটেন্টে যান
OpenAI

৩০ জুন, ২০২৬

গবেষণাপাবলিকেশন

GeneBench-Pro উপস্থাপন করা হচ্ছে

কম্পিউটেশনাল বায়োলজিতে AI এজেন্টরা কিভাবে অস্পষ্টতা সামলে চলে এবং গুরুত্বপূর্ণ প্রভাবসম্পন্ন বিচারমূলক সিদ্ধান্ত নেয়, তা পরিমাপ করার জন্য একটি গবেষণা-স্তরের বেঞ্চমার্ক.

লোডিং…

বৈজ্ঞানিক উপাত্ত খুব কমই নির্দেশনাসহ আসে. গবেষকদের সিদ্ধান্ত নিতে হবে কোনো প্যাটার্ন জৈবিক বাস্তবতাকে প্রতিফলিত করছে নাকি নয়েজকে, ডেটা উত্থাপিত প্রশ্নটিকে সমর্থন করার মতো যথেষ্ট কিনা এবং প্রতিটি ফলাফল তাদের পরবর্তী করণীয় কিভাবে পরিবর্তন করা উচিত. AI এজেন্টগুলো ক্রমেই জটিল বিশ্লেষণ সম্পাদনে সক্ষম হয়ে উঠছে, কিন্তু প্রকৃত বৈজ্ঞানিক গবেষণা কেবল তথ্য স্মরণ করা বা পূর্বনির্ধারিত কর্মপ্রবাহ অনুসরণ করার উপরই নির্ভর করে না; বরং এই উচ্চতর স্তরের বিচার-বিবেচনা করার উপরও নির্ভর করে.

আজ আমরা GeneBench-Pro উন্মোচন করছি—একটি চ্যালেঞ্জিং, গবেষণা-স্তরের বেঞ্চমার্ক, যা পরীক্ষা করে যে মডেলগুলো বাস্তব জগতের কম্পিউটেশনাল বায়োলজিতে প্রয়োজনীয় বিচার-বিবেচনানির্ভর বিশ্লেষণ সামলাতে পারে কি না. এটি GeneBench(একটি নতুন উইন্ডোতে খোলে)-কে সম্প্রসারিত করে জিনোমিক্স, পরিমাণগত জীববিজ্ঞান এবং ট্রান্সলেশনাল মেডিসিন জুড়ে আরও কঠিন ও বাস্তবসম্মত কাজকে অন্তর্ভুক্ত করে, যা কম্পিউটেশনাল বায়োলজিতে বৈজ্ঞানিক গবেষণার জটিলতা, পুনরাবৃত্তিমূলক প্রকৃতি এবং অস্পষ্টতাকে তুলে ধরে. 

এ পর্যন্ত, বাস্তব-জগতের গণনামূলক গবেষণাকে কঠিন করে তোলে এমন সিস্টেম-স্তরের বিচারমূলক সিদ্ধান্তগুলোর বিশ্বাসযোগ্য মূল্যায়ন খুব কমই হয়েছে. এর মধ্যে রয়েছে অস্পষ্টতা সামলানো, অনুমানগুলো পুনর্বিবেচনা করা, সঠিক বিশ্লেষণ পথ বেছে নেওয়া এবং কোনো ফলাফল কখন সিদ্ধান্ত গ্রহণের জন্য প্রস্তুত তা জানা. যেহেতু এই দক্ষতাগুলোকে আনুষ্ঠানিকভাবে রূপ দেওয়া কঠিন, তাই এগুলোকে কঠোরভাবে মূল্যায়ন করাও কঠিন—যদিও এগুলোর দুর্বলতা ক্রমেই AI-এর সামগ্রিক কর্মক্ষমতাকে সীমিত করছে.

“জীববিজ্ঞানে বেঞ্চমার্ক ব্যবধান” শিরোনামের চিত্র, যেখানে প্রচলিত বেঞ্চমার্ক কর্মপ্রবাহের সঙ্গে এন্ড-টু-এন্ড বৈজ্ঞানিক বিশ্লেষণের তুলনা করা হয়েছে এবং একটি বৈজ্ঞানিক সিদ্ধান্তে পৌঁছানোর আগে প্রিপ্রসেসিং, মডেলিং, ডায়াগনস্টিকস এবং পুনরাবৃত্তিমূলক পরিমার্জনের মতো অতিরিক্ত ধাপ দেখানো হয়েছে.

GeneBench-Pro এই উচ্চতর স্তরের সক্ষমতাগুলো নির্ভুলভাবে পরিমাপ করার জন্য ডিজাইন করা হয়েছে. GeneBench-Pro-তে, আমরা “গবেষণা-রুচি” বলতে সেই ধারাবাহিক বিচারমূলক সিদ্ধান্তগুলোকে বুঝি যা একটি বিশ্লেষণকে আকার দেয়: ডেটা কোন প্রশ্নগুলোকে সমর্থন করতে পারে, প্রাথমিক ডায়াগনস্টিক কিভাবে মডেল বা এস্টিম্যান্ড পরিবর্তন করবে এবং কখন একটি প্রাথমিক পরিকল্পনা সংশোধন করা প্রয়োজন. প্রতিটি GeneBench-Pro সমস্যা মডেলকে একটি বাস্তবসম্মত ও অগোছালো ডেটাসেট, সংক্ষিপ্ত পরীক্ষামূলক প্রেক্ষাপট এবং পরবর্তী ধাপের সিদ্ধান্তের সঙ্গে যুক্ত একটি লক্ষ্য এস্টিম্যান্ড দেয়. সঠিকভাবে উত্তর দিতে, মডেলকে ডেটা অন্বেষণ করতে হবে, একটি উপযুক্ত বিশ্লেষণাত্মক পদ্ধতি বেছে নিতে হবে, পরীক্ষা-নিরীক্ষার একটি পুনরাবৃত্তিমূলক প্রক্রিয়ায় যুক্ত হতে হবে এবং একটি চূড়ান্ত উত্তর প্রদান করতে হবে.

ডেটাসেট নির্মাণ

জীববিজ্ঞানে, ডেটা উৎপাদনের খরচ (যেমন, জিনোম সিকোয়েন্সিং) নাটকীয়ভাবে কমে গেছে, এবং কিছু গবেষক এখন যুক্তি দেন(একটি নতুন উইন্ডোতে খোলে) যে সীমাবদ্ধকারী বিষয়টি আর নমুনা সংগ্রহ নয়, বরং পরবর্তী ধাপের কম্পিউটেশন ও বিশ্লেষণ. সেই বটলনেক মোকাবিলায় অগ্রগতি মূল্যায়নের জন্য GeneBench-Pro তৈরি করা হয়েছে, যেখানে কম্পিউটেশনাল বায়োলজির বিস্তৃত পরিসরের প্রেক্ষাপট ও পদ্ধতি কভার করা 129-টি প্রশ্ন রয়েছে.

ডোমেইন অ্যাটলাস: ১২৯-টি সমস্যা ১০-টি ডোমেইন এবং ২১-টি সাব-ডোমেইনে

বেঞ্চমার্ক সমস্যাগুলোর মধ্যে চলাচল করতে অ্যারো কী ব্যবহার করুন. নির্বাচিত সমস্যার বিবরণ নিচে দেখানো হয়েছে.

একটি বেঞ্চমার্ক সমস্যা সম্পর্কে জানতে উপরের একটি বিন্দুতে ক্লিক করুন.

এই অ্যাটলাসটি GeneBench-Pro-এর বিস্তৃতির একটি সংক্ষিপ্ত পরিচিতি দেয়. দশটি প্রতিনিধিত্বমূলক প্রশ্ন আরও বিস্তারিতভাবে জানতে কেস স্টাডি পৃষ্ঠা দেখুন.

GeneBench-Pro-ও সাধারণ বেঞ্চমার্ক ব্যর্থতা এড়ানোর জন্য ডিজাইন করা হয়েছে. অনেক দীর্ঘ-পরিসরের জীববিজ্ঞান বেঞ্চমার্ক অগোছালো ঐতিহাসিক ডেটাসেটকে কেন্দ্র করে বহু-ধাপের প্রশ্ন তৈরি করে, যেখানে বিশ্লেষণের মধ্য দিয়ে এগোনোর একক সঠিক পথ নাও থাকতে পারে. একজন এজেন্ট একটি সমর্থনযোগ্য কাটঅফ বেছে নিতে পারে, আর অন্যজন ভিন্ন কিন্তু সমানভাবে সমর্থনযোগ্য একটি বিকল্প বেছে নিতে পারে, যা মডেলের কর্মক্ষমতার কোনো মৌলিক পার্থক্যের চেয়ে বেঞ্চমার্ক নির্মাতার করা ইচ্ছাধীন পছন্দগুলোকেই বেশি প্রতিফলিত করে. এর উল্টোটাও ঘটতে পারে: যদি কোনো সমস্যা সংখ্যাগতভাবে খুব কম সংবেদনশীল হয়, তাহলে কোনো এজেন্ট বিশ্লেষণে মৌলিক ভুল করেও উত্তীর্ণ ফলাফল তৈরি করতে পারে.

এই ব্যর্থতার ধরনগুলো এড়াতে, প্রতিটি GeneBench-Pro সমস্যা কৃত্রিমভাবে তৈরি করা হয়: আমরা পূর্ণ কার্যকারণ কাঠামো জানি এবং সরাসরি ডেটা-উৎপাদন প্রক্রিয়া সিমুলেট করি. এটি আমাদের প্রতিটি সমস্যার জটিলতা সমন্বয় করতে, ব্যক্তিনির্ভর বিশ্লেষণাত্মক পছন্দের যুক্তিসঙ্গত পার্থক্যগুলো সত্ত্বেও যেন গ্রহণযোগ্য সংখ্যাগত ফলাফল পাওয়া যায় তা নিশ্চিত করতে, এবং (অ্যাবলেশন স্টাডির মাধ্যমে) আপাতদৃষ্টিতে যুক্তিযুক্ত কিন্তু ভুল বিশ্লেষণগুলো যে ব্যর্থ হয় তা যাচাই করতে সক্ষম করে. এরপর আমরা তথ্য ফাঁস এবং অনাকাঙ্ক্ষিত সমাধান পথ খুঁজে বের করার জন্য বিস্তারিত ট্রেস বিশ্লেষণের মাধ্যমে সমস্যার খসড়াগুলো নিরীক্ষা করি. এটি আমাদের এই আত্মবিশ্বাস দেয় যে, সঠিক উত্তর পাওয়াটা কোনো সংক্ষিপ্ত পথ অবলম্বন করা বা লেখকের খেয়ালখুশিমতো পছন্দ মেলানোর উপর নির্ভর করে না, বরং সঠিক বিশ্লেষণাত্মক পথ বেছে নেওয়ার উপর নির্ভর করে.

“GeneBench-Pro সমস্যা নির্মাণ ও যাচাইকরণ” শিরোনামের ডায়াগ্রাম, যেখানে একটি চালানো যায় এমন টাস্ক তৈরি করা থেকে শুরু করে পর্যালোচনা, দৃঢ়তা যাচাই, এজেন্ট টেস্টিং, বিশেষজ্ঞ পর্যালোচনা, সংশোধন এবং একটি সম্পূর্ণ বেঞ্চমার্ক সমস্যা পর্যন্ত কর্মপ্রবাহ দেখানো হয়েছে.

129-টি GeneBench-Pro প্রশ্নের মধ্যে 82-টি আমরা বহিরাগত ডোমেইন বিশেষজ্ঞদের কাছে পাঠিয়েছিলাম, যার মধ্যে স্নাতকোত্তর শিক্ষার্থী, পোস্টডক্টরাল গবেষক, শিল্পখাতের বিজ্ঞানী এবং অধ্যাপকরা অন্তর্ভুক্ত ছিলেন. পর্যালোচকরা প্রতিটি সমস্যার বাস্তবসম্মততা, লক্ষ্য উত্তরটি শনাক্ত করা যেত কি না এবং পদ্ধতি ও প্রাক্কলকগুলো উপযুক্ত ছিল কি না—এসব মূল্যায়ন করেছিলেন. সমস্যাগুলো সংশোধন করতে মতামত ব্যবহার করা হয়েছে.

1 এর মধ্যে 2
আমি যে সমস্যাগুলো পর্যালোচনা করেছি, সেগুলো অভিজ্ঞ তত্ত্বাবধায়কের ধারাবাহিক মতামত ছাড়া সমাধান করা স্নাতকোত্তর পর্যায়ের শিক্ষার্থীর জন্য কঠিন হতো. ডেটাটিতে এমন কারিগরি ও মান নিয়ন্ত্রণসংক্রান্ত সমস্যা ছিল, যা সফলভাবে সম্পন্ন করতে সম্ভাব্য ঝুঁকি সম্পর্কে সচেতন থেকে চিন্তাশীল ও পর্যালোচনামূলক ডেটা বিশ্লেষণের প্রয়োজন ছিল; তারা কেবল পরিচ্ছন্ন ও ভালোভাবে কিউরেট করা ডেটার উপর আগে থেকে তৈরি কোনো পদ্ধতি প্রয়োগ করছিলেন না.
আলেকজান্ডার স্ট্রুডউইক ইয়ং, UCLA-এর মানব জিনতত্ত্ব বিভাগের সহকারী অধ্যাপক

মূল্যায়ন ও গ্রেডিং

প্রতিটি GeneBench-Pro সমস্যা একটি স্বয়ংসম্পূর্ণ বৈজ্ঞানিক বিশ্লেষণ. এজেন্টরা একটি বিচ্ছিন্ন ওয়ার্কস্পেসে অ্যাক্সেস পায়, যেখানে একটি সংক্ষিপ্ত প্রম্পট, ডেটা ফাইল এবং Python, বৈজ্ঞানিক কম্পিউটিং লাইব্রেরি ও PLINK 2.0-এর মতো মৌলিক জেনোমিক্স প্যাকেজসহ একটি স্ট্যান্ডার্ড বায়োইনফরমেটিক্স স্ট্যাক থাকে (যদিও সমস্যাগুলোর জন্য ডোমেইন-নির্দিষ্ট টুলিং প্রয়োজন হয় না).

স্ট্রাকচারাল ভ্যারিয়েন্ট-নির্দেশিত টিউমার থেরাপির সুবিধা-ঝুঁকি সিদ্ধান্ত

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

যেহেতু আমরা সম্পূর্ণ ডেটা-জেনারেশন প্রক্রিয়া নিয়ন্ত্রণ করি, আমরা পরিচিত লক্ষ্যগুলোর বিপরীতে সঠিকতা নির্ধারণমূলকভাবে গ্রেড করতে পারি, ফলে প্রচলিত রুব্রিক-ভিত্তিক মূল্যায়নে দেখা মডেল-পছন্দজনিত পরিবর্তনশীলতা এবং বাক্যবহুলতার প্রভাব এড়ানো যায়.

প্রতিটি সমস্যার সঙ্গে আরও থাকে সমৃদ্ধ মেটাডেটা, যার মধ্যে অন্তর্ভুক্ত থাকে প্রত্যাশিত বিশ্লেষণ কাঠামো, সংযুক্ত ডেটা ফাইলসমূহ, একটি বিস্তারিত বহু-পৃষ্ঠার কেস স্টাডি এবং বিশেষজ্ঞ পর্যালোচনার ফলাফলসমূহ. আমরা Hugging Face(একটি নতুন উইন্ডোতে খোলে)-এ 10-টি প্রতিনিধিত্বমূলক GeneBench-Pro প্রশ্ন সম্পূর্ণভাবে ওপেন-সোর্স হিসেবে প্রকাশ করছি, এবং সেগুলো ব্রাউজ করার জন্য একটি ইন্টারঅ্যাক্টিভ ওয়েব ইন্টারফেস দিচ্ছি. অবশেষে, অদূর ভবিষ্যতে আমরা স্বাধীন, তৃতীয় পক্ষের বেঞ্চমার্কিংয়ের জন্য আর্টিফিশিয়াল অ্যানালাইসিসে(একটি নতুন উইন্ডোতে খোলে) 50-টি প্রশ্নের একটি উপসেট প্রদান করব.

ফলাফল

আমাদের সবচেয়ে শক্তিশালী মডেল, GPT‑5.6 Sol, সর্বোচ্চ রিজনিং স্তরে 28.7% পাসের হার অর্জন করে (Pro মোড চালু থাকলে 31.5%). আমরা যখন মূল GeneBench তৈরি করা শুরু করেছিলাম, সেই সময়ের তুলনায় এটি একটি তীব্র বৃদ্ধি; তখন আমাদের সেরা অত্যাধুনিক মডেল, GPT‑5, 5%-এর কম স্কোর করেছিল. এই বেঞ্চমার্কে অগ্রগতি ইঙ্গিত দেয় যে অত্যাধুনিক মডেলগুলো দ্রুত উন্নত হচ্ছে, এমনকি কম স্পষ্ট, সিস্টেম-স্তরের বৈজ্ঞানিক যুক্তিতেও. বর্তমান গতিতে, এই বেঞ্চমার্কটি বছরের শেষ নাগাদ স্যাচুরেটেড হয়ে যেতে পারে.

ফলাফলগুলো টেস্ট-টাইম কম্পিউট স্কেল করার প্রভাবও দেখায়. সর্বনিম্ন রিজনিং স্তরে, GPT‑5.6 Sol মাত্র এক অঙ্কের পাসরেট অর্জন করে. সর্বোচ্চ রিজনিং স্তরে, GPT‑5.6 Sol GPT‑5.2 যত প্রশ্ন সমাধান করে, তার প্রায় ছয় গুণ প্রশ্ন সমাধান করে. করে, প্রায় দুই-তৃতীয়াংশ সংখ্যক টোকেন ব্যবহার করেই.

মডেল family জুড়ে তুলনা ইঙ্গিত দেয় যে quantitative uncertainty-এর মধ্যে high-level scientific reasoning-এ GPT মডেলগুলো সবচেয়ে শক্তিশালী system-গুলোর মধ্যে আছে. GPT‑5.6, GPT‑5.5 এবং GLM 5.2-এর মতো leading open-source মডেলের মধ্যে performance gap coding benchmark(একটি নতুন উইন্ডোতে খোলে) থেকে extrapolate করলে যতটা আশা করতাম তার চেয়ে অনেক বড়; এটি ইঙ্গিত দেয় যে open-source মডেলগুলো broader reasoning ability-র চেয়ে coding-এর জন্য বেশি specialized.

উন্নয়নের সময় সমস্যাগুলো মূল্যায়ন ও আরও মজবুত করতে আমরা অত্যাধুনিক GPT মডেল ব্যবহার করেছি. সেই কারণে, আমাদের সন্দেহ হয়েছিল যে GeneBench-Pro অন্যান্য মডেল পরিবারের তুলনায় GPT মডেলগুলোর বিরুদ্ধে পক্ষপাতদুষ্ট হতে পারে. তবে, প্রতিদ্বন্দ্বী মডেলগুলো সর্বোত্তম ক্ষেত্রেও রিলিজের সময়কার সংশ্লিষ্ট GPT মডেলের কর্মক্ষমতার সমকক্ষ হতে পেরেছিল এবং সাধারণত উল্লেখযোগ্যভাবে পিছিয়ে থাকত.

GeneBench-Pro-এর প্রশ্নগুলোর কাঠিন্য বিবেচনা করলে, GPT‑5.6 Sol (Pro)-তে সর্বোচ্চ 31.5% পর্যন্ত এই মূল্যায়ন ফলাফলগুলো বেশ চমকপ্রদ. একটি সমীক্ষায়, আমাদের পর্যালোচকেরা অনুমান করেছেন যে একটি সাধারণ GeneBench-Pro সমস্যা সম্পূর্ণ করতে একজন মানব বিশেষজ্ঞের প্রায় 20–40 ঘণ্টা সময় লাগবে. রক্ষণশীল হিসাবে ঘণ্টাপ্রতি $200 ধরলেও, একটি মাত্র সমস্যার মানবশ্রমের ব্যয় কয়েক হাজার ডলারে পৌঁছে যায়. বর্তমান AI এজেন্টগুলো এখনও মানব বিশেষজ্ঞদের প্রতিস্থাপন করার মতো যথেষ্ট নির্ভরযোগ্য নয়, তবে খরচের ব্যবধান অনেক বড়, যেখানে প্রতি সমস্যায় ইনফারেন্স খরচ মাত্র কয়েক ডলার. এর অর্থ হলো, বর্তমান সক্ষমতাতেও আংশিক স্বয়ংক্রিয়করণ উল্লেখযোগ্য অর্থনৈতিক ও বৈজ্ঞানিক মূল্য সৃষ্টি করতে পারে.

1 এর মধ্যে 2
বেঞ্চমার্কগুলো বিভিন্ন ধরনের জীববৈজ্ঞানিক প্রশ্ন থেকে অনুপ্রাণিত, কিন্তু প্রকৃত চ্যালেঞ্জ আসে অনুসন্ধানমূলক ডেটা বিশ্লেষণ এবং এসব আবিষ্কার নিয়ে যুক্তিনির্ভর বিশ্লেষণ থেকে: প্যাটার্ন ও আর্টিফ্যাক্ট শনাক্ত করা এবং ডেটা বাদ দেওয়া বা সমন্বয় করা উচিত কি না তা নির্ধারণ করা. এটি বাস্তব জৈবিক ডেটাসেটের অগোছালো প্রকৃতির সঙ্গে সাদৃশ্যপূর্ণ. এই মূল্যায়নগুলো পর্যালোচনা করলে এজেন্ট-ভিত্তিক বৈজ্ঞানিক সমস্যা সমাধানে স্পষ্ট সলভার কনট্র্যাক্ট কতটা গুরুত্বপূর্ণ তা বোঝা যায়. প্রম্পটের ভিন্ন শব্দচয়ন বা কাজের স্পেসিফিকেশন কোন বিশ্লেষণগুলো অনুমোদনযোগ্য বলে মনে হয় তা ব্যাপকভাবে প্রভাবিত করতে পারে.
সিরিলাস ট্যান, নিউ ইয়র্ক জিনোম সেন্টারের পোস্টডক্টরাল রিসার্চ অ্যাসোসিয়েট

তবুও, অত্যাধুনিক মডেলগুলো এখনও এই সমস্যাগুলোর এক-তৃতীয়াংশেরও কম সমাধান করে—এই বিষয়টি দেখায় যে উন্নতির জন্য যথেষ্ট সুযোগ রয়েছে. মডেলগুলো কঠিন সমস্যাগুলোতে আংশিক অগ্রগতি করতে পারে, কিন্তু অনুমানগত লুপটি সম্পূর্ণ করতে তারা হিমশিম খায়. ব্যর্থতার এই ধরনটি মানব বিশেষজ্ঞ ও নবীনদের মধ্যকার বৈসাদৃশ্যকে প্রতিফলিত করে. বিশেষজ্ঞরা তাদের অভিজ্ঞতা ব্যবহার করে সমস্যাটিকে কাঠামোবদ্ধ করেন এবং নিজেদের পদ্ধতি মানিয়ে নেন, অন্যদিকে নবীনরা পর্যবেক্ষণ করলেও সেগুলোকে সমস্যার বৃহত্তর প্রেক্ষাপটে একীভূত করতে হিমশিম খান.

সমস্যা: সময়-পরিবর্তনশীল চিকিৎসার সঙ্গে ফার্মাকোজেনোমিক সময়-ঘটনা প্রতিক্রিয়া

চিকিৎসা শুরু, জিনোটাইপ-নির্দিষ্ট প্রতিক্রিয়া, বিলম্বিত ফার্মাকোডাইনামিক্স, প্রচলিত ব্যবহারকারীর ফ্ল্যাগ এবং দীর্ঘমেয়াদী বায়োমার্কার একসঙ্গে কারণগত সারভাইভাল এস্টিমেট নির্ধারণ করে.

GPT-5.5 প্যাটার্ন

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

GPT-5.6 Sol প্যাটার্ন

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

প্রায় নিখুঁত পারফরম্যান্স অর্জনের জন্য এমন মূল্যায়ন প্রয়োজন হবে, যা নির্ভরযোগ্যভাবে অগ্রগতি পরিমাপ করবে এবং মডেল এখনও কোথায় ব্যর্থ হচ্ছে তা শনাক্ত করবে. GeneBench-Pro-এর মতো বেঞ্চমার্কগুলো একটি অস্পষ্ট সক্ষমতার ঘাটতিকে এমন কিছুতে রূপান্তর করতে সাহায্য করতে পারে, যা আমরা নির্ণয় ও উন্নত করতে পারি. 

যদি এজেন্টরা নির্ভরযোগ্যভাবে এই ধরনের বিশ্লেষণ স্বয়ংক্রিয় করতে পারে, তবে তারা বৈজ্ঞানিক আবিষ্কারকে উল্লেখযোগ্যভাবে ত্বরান্বিত করতে পারে. মানব জেনেটিক প্রমাণ ইতিমধ্যেই টার্গেট অগ্রাধিকার নির্ধারণ এবং ট্রান্সলেশনাল ফলো-আপে কেন্দ্রীয় ভূমিকা পালন করছে, কারণ জেনেটিক সমর্থনযুক্ত প্রক্রিয়াগুলো অনুমোদিত চিকিৎসায় পরিণত হওয়ার সম্ভাবনা অনেক বেশি.

এদিকে, সিকোয়েন্সিংয়ের খরচ দ্রুত কমে গেছে, এবং বায়োব্যাংক-স্কেলের ডেটাসেটগুলো এখন অভূতপূর্ব বিস্তারে অণু, রূপগত বৈশিষ্ট্য এবং হেলথ রেকর্ডের তথ্য সংযুক্ত করছে. প্রধান সীমাবদ্ধতা এখন ডেটা তৈরি করা থেকে সেই তথ্যকে কার্যকর অন্তর্দৃষ্টিতে রূপান্তর করার দিকে সরে যাচ্ছে. যেসব মডেল ধারাবাহিকভাবে এমন বিশ্লেষণ করতে পারে, যা বর্তমানে মানব বিশেষজ্ঞদের দল সম্পাদন করে, সেগুলো অনুমান যাচাই, লক্ষ্য অনুসরণ এবং ডেটা তৈরি ও সিদ্ধান্ত গ্রহণের মধ্যকার পুনরাবৃত্তিমূলক চক্রকে দ্রুততর করার মাধ্যমে শিল্প গবেষণাকে রূপান্তরিত করতে পারে.

GeneBench-Pro হলো অভিজ্ঞদের মধ্যে থাকা ভালো বৈজ্ঞানিক বিচারবোধের সঙ্গে জড়িত আরও বিমূর্ত দক্ষতাগুলো মূল্যায়নের একটি প্রাথমিক প্রচেষ্টা. এই দক্ষতাগুলো তাদের সবচেয়ে সম্ভাবনাময় প্রাথমিক বিশ্লেষণগুলো স্বজ্ঞাতভাবে অনুধাবন ও শনাক্ত করতে, তথ্য প্রাথমিক অনুমানের সঙ্গে সাংঘর্ষিক হলে তাদের চিন্তাভাবনা পুনরাবৃত্তিমূলকভাবে পর্যালোচনা ও সংশোধন করতে এবং এমন উপসংহারে পৌঁছাতে সক্ষম করে, যার উপর পরবর্তী পর্যায়ের ক্লিনিক্যাল, একাডেমিক বা ব্যবসায়িক সিদ্ধান্ত নির্ভর করতে পারে. 

আমরা প্রত্যাশা করি যে মডেলের সক্ষমতা যত অগ্রসর হবে, বিমূর্ততার এই উচ্চতর স্তরগুলোতে মডেলের সক্ষমতা যাচাই করে এমন বেঞ্চমার্কগুলো ক্রমশ আরও উপযোগী হয়ে উঠবে—সেসব বেঞ্চমার্কের বাইরে, যেগুলো কেবল পুঁথিগত জ্ঞান বা রুটিন বিশ্লেষণ সম্পাদনের সক্ষমতা পরীক্ষা করে.

লেখক

OpenAI