გადადით მთავარ შინაარსზე
OpenAI

წარმოგიდგენთ GeneBench-Pro-ს

კვლევითი დონის ბენჩმარკი, რომელიც ზომავს, როგორ ახდენე ნავიგაციას AI აგენტები გაურკვევლობაში და როგორ იღებენ მნიშვნელოვან შეფასებებზე დაფუძნებულ გადაწყვეტილებებს გამოთვლით ბიოლოგიაში.

იტვირთება…

სამეცნიერო მონაცემებს იშვიათად ახლავს ინსტრუქციები. მკვლევრებმა უნდა გადაწყვიტონ, ასახავს თუ არა კანონზომიერება ბიოლოგიას ან ხმაურს, იძლევა თუ არა მონაცემები დასმული კითხვის საფუძველს და როგორ უნდა შეცვალოს თითოეულმა შედეგმა მათი შემდგომი მოქმედებები. ხელოვნური ინტელექტის აგენტები სულ უფრო მეტად ახერხებენ რთული ანალიზების ჩატარებას, მაგრამ რეალური სამეცნიერო კვლევა ასევე დამოკიდებულია არა მხოლოდ ფაქტების გახსენებაზე ან წინასწარ განსაზღვრული სამუშაო პროცესის მიყოლაზე, არამედ ამ უფრო მაღალი დონის მსჯელობით შეფასებების გაკეთებაზეც.

დღეს წარმოგიდგენთ GeneBench-Pro-ს — რთულ, კვლევითი დონის ბენჩმარკს, რომელიც ამოწმებს, შეუძლიათ თუ არა მოდელებს გაუმკლავდნენ ისეთი ტიპის განსჯაზე ძლიერ დაყრდნობილ ანალიზს, როგორსაც რეალურ სამყაროში გამოთვლითი ბიოლოგია მოითხოვს. ის აფართოვებს GeneBench(იხსნება ახალ ფანჯარაში)-ს, რომელიც მოიცვას უფრო რთულ და უფრო რეალისტურ ამოცანებს გენომიკის, რაოდენობითი ბიოლოგიისა და ტრანსლაციური მედიცინის სფეროებში და აფიქსირებს გამოთვლით ბიოლოგიაში სამეცნიერო კვლევის სირთულეს, იტერაციულბუნებას და გაურკვევლობას. 

დღემდე არსებობს მცირე რაოდენობის დამაჯერებელი შეფასებები სისტემური დონის მსჯელობით მიღებული გადაწყვეტილებებისა, რომლებიც რეალურ სამყაროში გამოთვლით კვლევას ართულებს. მათ შორისაა გაურკვევლობასთან გამკლავება, დაშვებების გადახედვა, ანალიზის სწორი გზის არჩევა და იმის ცოდნა, როდის არის შედეგი მზად გადაწყვეტილების მისაღებად. ვინაიდან ამ უნარების ფორმალიზება რთულია, მათი მკაცრი შეფასებაც არ არის მარტივი, მაშინაც კი, როცა მათი სისუსტეები სულ უფრო მეტად ზღუდავს ხელოვნური ინტელექტის საერთო წარმადობას.

დიაგრამა სათაურით „ბიოლოგიაში ბენჩმარკის ხარვეზი“, რომელიც ადარებს ტრადიციულ ბენჩმარკის სამუშაო პროცესებს საწყისიდან ბოლომდე სამეცნიერო ანალიზთან და აჩვენებს დამატებით ნაბიჯებს, როგორიცაა წინასწარი დამუშავება, მოდელირება, დიაგნოსტიკა და იტერაციული დახვეწა, სამეცნიერო დასკვნამდე მისვლამდე.

GeneBench-Pro შემუშავებულია იმისთვის, რომ ზუსტად გაზომოს ეს უფრო მაღალი დონის შესაძლებლობები. GeneBench-Pro-ში „კვლევით გემოვნებას“ განვსაზღვრავთ, როგორც შეფასებითი გადაწყვეტილებების ჯაჭვებს, რომლებიც ანალიზს აყალიბებს: რომელი კითხვების მხარდაჭერა შეუძლია მონაცემებს, როგორ უნდა შეცვალოს ადრეულმა დიაგნოსტიკამ მოდელი ან შეფასება და როდის საჭიროებს საწყისი გეგმა გადახედვას. GeneBench-Pro-ის თითოეული ამოცანა მოდელს აძლევს რეალისტურ და მოუწესრიგებელ მონაცემთა ნაკრებს, მოკლე ექსპერიმენტულ კონტექსტს და სამიზნე შესაფასებელ სიდიდეს, რომელიც დაკავშირებულია შემდგომ გადაწყვეტილებასთან. სწორად პასუხის გასაცემად, მოდელმა უნდა შეისწავლოს მონაცემები, აირჩიოს შესაბამისი ანალიტიკური მიდგომა, ჩაერთოს ექსპერიმენტირების იტერაციულ პროცესში და წარმოადგინოს საბოლოო პასუხი.

მონაცემთა ნაკრების შექმნა

ბიოლოგიაში მონაცემთა გენერირების ღირებულება (მაგ., გენომის სეკვენირება) მკვეთრად შემცირდა და ზოგიერთი მკვლევარი ახლა ამტკიცებს(იხსნება ახალ ფანჯარაში), რომ შემზღუდველი ფაქტორი აღარ არის ნიმუშების შეგროვება, არამედ შემდგომი გამოთვლითი დამუშავება და ანალიზი. GeneBench-Pro შექმნილია იმის შესაფასებლად, თუ რა პროგრესია მიღწეული ამ ბარიერის დაძლევაში, 129 კითხვით, რომლებიც გამოთვლითი ბიოლოგიის კონტექსტებისა და მეთოდების ფართო სპექტრს მოიცავს.

დომენების ატლასი: 129 პრობლემა 10 დომენსა და 21 ქვედომენში

ეტალონურ ამოცანებს შორის გადასაადგილებლად გამოიყენეთ ისრის ღილაკები. არჩეული ამოცანის დეტალები ქვემოთაა მოცემული.

დააწკაპუნეთ ზემოთ მდებარე წერტილზე, რათა გაეცნოთ ეტალონურ ამოცანას.

ეს ატლასი წინასწარ წარმოდგენას გვიქმნის GeneBench-Pro-ის მასშტაბის შესახებ. გთხოვთ, ეწვიეთ შემთხვევების ანალიზის გვერდს, რათა უფრო დეტალურად გაეცნოთ 10 წარმომადგენლობით შეკითხვას.

GeneBench-Pro ასევე შექმნილია ისე, რომ თავიდან აიცილოს ბენჩმარკის ხარვეზები. ბიოლოგიის გრძელვადიანი ბენჩმარკები მრავალსაფეხურიან კითხვებს აყალიბებს მოუწესრიგებელ ისტორიულ მონაცემთა ნაკრებების გარშემო, სადაც ანალიზის პროცესში შესაძლოა არ არსებობდეს ერთი, ცალსახად სწორი გზა. ერთმა აგენტმა შეიძლება აირჩიოს ერთი დასაბუთებადი ზღვრული მნიშვნელობა, ხოლო მეორემ — განსხვავებული, მაგრამ თანაბრად დასაბუთებადი ვარიანტი; ეს უფრო ასახავს ბენჩმარკის შემქმნელის მიერ გაკეთებულ პირობით არჩევანებს, ვიდრე რაიმე ფუნდამენტურ განსხვავებებს მოდელის წარმადობაში. საპირისპიროც შეიძლება მოხდეს: თუ პრობლემა რიცხობრივად ზედმეტად არამგრძნობიარეა, აგენტს შეუძლია ანალიზში ფუნდამენტური შეცდომები დაუშვას და მაინც დამაკმაყოფილებელი შედეგი მიიღოს.

ამ ტიპების წარუმატებლობების თავიდან ასაცილებლად, GeneBench-Pro-ის თითოეული ამოცანა სინთეზურად არის შექმნილი: ჩვენ ვიცით სრული მიზეზ-შედეგობრივი სტრუქტურა და უშუალოდ ვახდენთ მონაცემთა გენერირების პროცესის სიმულირებას. ეს საშუალებას გვაძლევს დავარეგულიროთ თითოეული ამოცანის სირთულე, უზრუნველვყოთ, რომ სუბიექტურ ანალიტიკურ არჩევანებში გონივრულმა განსხვავებებმა მაინც მისაღები რიცხვითი შედეგები გამოიღოს, და დავადასტუროთ (აბლაციის კვლევების საშუალებით), რომ დამაჯერებელი, მაგრამ არასწორი ანალიზები წარუმატებელია. შემდეგ ამოცანების მონახაზებს ვუტარებთ აუდიტს დეტალური კვალის ანალიზის მეშვეობით, რათა შევამოწმოთ ინფორმაციის გაჟონვა და გაუთვალისწინებელი ამოხსნის გზები. ეს გვარწმუნებს, რომ სწორი პასუხის მიღება დამოკიდებულია სწორი ანალიტიკური გზის არჩევაზე და არა მოკლე გზის გამოყენებაზე ან ავტორის მიერ არჩეულ უპირატესობასთან შესაბამისობაზე.

დიაგრამა სათაურით „GeneBench-Pro-ის ამოცანის შექმნა და ვალიდაცია“, რომელზეც ნაჩვენებია სამუშაო პროცესი გაშვებადი ამოცანის შექმნიდან განხილვის, მდგრადობის შემოწმებების, აგენტის ტესტირების, ექსპერტული განხილვის, გადამუშავებისა და დასრულებული ბენჩმარკის ამოცანის მიღებამდე.

GeneBench-Pro-ის 129 კითხვიდან 82 გავუგზავნეთ გარე დარგის ექსპერტებს, მათ შორის სამაგისტრო და სადოქტორო პროგრამების სტუდენტებს, პოსტდოქტორანტ მკვლევრებს, ინდუსტრიის მეცნიერებსა და პროფესორებს. რეცენზენტებმა შეაფასეს თითოეული ამოცანის რეალისტურობა, იყო თუ არა სამიზნე პასუხი იდენტიფიცირებადი და იყო თუ არა მეთოდები და შემფასებლები შესაბამისი. უკუკავშირი გამოყენებულ იქნა ამოცანების გასაუმჯობესებლად.

1/2
ჩემ მიერ განხილული ამოცანები ასპირანტისთვის რთულად შესასრულებელი იქნებოდა გამოცდილი ხელმძღვანელისგან განმეორებითი უკუკავშირის გარეშე. მონაცემები შეიცავდა ტექნიკურ და ხარისხის კონტროლის საკითხებს, რომლებიც წარმატებით დასასრულებლად საჭიროებდა გააზრებულ და რეფლექსიურ მონაცემთა ანალიზს პოტენციური ხარვეზების გათვალისწინებით; ისინი უბრალოდ არ იყენებდნენ რაიმე მზა მეთოდს სუფთა და კარგად კურირებულ მონაცემებზე.
ალექსანდერ სტრადვიკ იანგი, UCLA-ს ადამიანის გენეტიკის ასისტენტ-პროფესორი

შეფასება და გრადაცია

GeneBench-Pro-ის თითოეული ამოცანა დამოუკიდებელი სამეცნიერო ანალიზია. აგენტები იღებენ წვდომას იზოლირებულ სამუშაო სივრცეზე, რომელიც შეიცავს მოკლე მოთხოვნას, მონაცემთა ფაილებს და ბიოინფორმატიკის სტანდარტულ პროგრამულ სტეკს, მათ შორის Python-ს, სამეცნიერო გამოთვლების ბიბლიოთეკებს და გენომიკის საბაზისო პაკეტებს, როგორიცაა PLINK 2.0 (თუმცა ამოცანები არ მოითხოვს დომენ-სპეციფიკური ინსტრუმენტების გამოყენებას).

სტრუქტურული ვარიანტებით მართული სიმსივნის თერაპიის სარგებელ-რისკის გადაწყვეტილება

A molecular tumor board registry contains trial-eligible advanced solid-tumor cases considered for a TXR1-directed inhibitor. Estimate, for tumors with SV-driven TXR1 target-mediated activation at time zero, the marginal effect of TXR1i versus non-TXR1 systemic therapy on week-16 clinical benefit as if all patients had an assessable week-16 visit. Also estimate the 8-week treatment-limiting toxicity/discontinuation risk under TXR1i in the same target population. Report net clinical utility = benefit risk difference (percentage points) - 0.35 * toxicity risk (percentage points), and choose therapy_class_code 1 if TXR1i has positive net utility and 0 otherwise. 

Use percentage-point units for all non-code quantities. Positive benefit means TXR1i improves week-16 clinical benefit relative to non-TXR1 systemic therapy.

These data came from a real experiment; you will be graded not just on numerical correctness but the quality of analytical reasoning you exhibit; do not attempt to take any shortcuts.

Return your final answer as exactly one JSON object.
Do not wrap the JSON in markdown.
Do not add prose before or after the JSON.
Do not omit any keys shown in the example.
Return the JSON object in your final answer:

JSON

1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}

რადგან მონაცემთა გენერირების სრულ პროცესს ჩვენ ვაკონტროლებთ, შეგვიძლია სისწორე დეტერმინისტულად შევაფასოთ ცნობილ სამიზნეებთან მიმართებაში, რითაც თავიდან ავიცილებთ მოდელის არჩევანით გამოწვეულ ცვალებადობასა და ჭარბი ტრანსკრიფციის ეფექტებს, რომლებიც სტანდარტულ რუბრიკაზე დაფუძნებულ შეფასებაში გვხვდება.

თითოეულ ამოცანას ასევე ახლავს მდიდარი მეტამონაცემები, მათ შორის განსაზღვრული ანალიზის სტრუქტურა, თანდართული მონაცემთა ფაილები, დეტალური მრავალგვერდიანი შემთხვევის ანალიზი და ექსპერტული შეფასების შედეგები. ჩვენ სრულად ღია წყაროდ ვაქვეყნებთ GeneBench-Pro-ის 10 წარმომადგენლობით შეკითხვას Hugging Face(იხსნება ახალ ფანჯარაში)-ზე, მათ დასათვალიერებლად ხელმისაწვდომი ინტერაქტიული ვებინტერფეისით. და ბოლოს, უახლოეს მომავალში Artificial Analysis(იხსნება ახალ ფანჯარაში)-ს მივაწვდით 50 კითხვიან ქვეკრებულს დამოუკიდებელი, მესამე მხარის შეფასებისთვის.

შედეგები

ჩვენი უძლიერესი მოდელი, GPT‑5.6 Sol, მსჯელობის უმაღლეს დონეზე აღწევს წარმატებულ 28,7%-იან მაჩვენებელს (31,5%-ს Pro რეჟიმის ჩართვისას). ეს მკვეთრი ზრდაა იმ პერიოდთან შედარებით, როცა თავდაპირველი GeneBench-ის შექმნა დავიწყეთ; იმ დროისთვის ჩვენმა საუკეთესო მოწინავე მოდელმა, GPT‑5‑მა, 5%-ზე ნაკლები შედეგი აჩვენა. ამ ბენჩმარკზე პროგრესი მიუთითებს, რომ მოწინავე მოდელები სწრაფად უმჯობესდება, მათ შორის ნაკლებად ხელშესახებ, სისტემების დონის სამეცნიერო მსჯელობაშიც. ამჟამინდელი ტემპით, წლის ბოლომდე ეს ბენჩმარკი შესაძლოა შეივსოს.

შედეგები ასევე აჩვენებს ტესტირების დროს გამოთვლითი რესურსების მასშტაბირების გავლენას. მსჯელობის ყველაზე დაბალ დონეზე GPT‑5.6 Sol მხოლოდ ერთნიშნა პროცენტულ მაჩვენებელს აღწევს. მსჯელობის უმაღლეს დონეზე, GPT‑5.6 Sol წყვეტს თითქმის ექვსჯერ მეტ კითხვას, ვიდრე GPT‑5.2, ამასთან დაახლოებით ორი მესამედით მეტ token-ს იყენებს.

მოდელების ოჯახებს შორის შედარებები მიუთითებს, რომ GPT მოდელები რაოდენობრივი გაურკვევლობის პირობებში მაღალი დონის სამეცნიერო მსჯელობაში ყველაზე ძლიერ სისტემებს შორისაა. წარმადობის სხვაობა GPT‑5.6‑ს, GPT‑5.5‑სა და წამყვან ღია კოდის მოდელებს, როგორიცაა GLM 5.2, შორის მნიშვნელოვნად უფრო დიდია, ვიდრე მოველოდით პროგრამირების ბენჩმარკებიდან(იხსნება ახალ ფანჯარაში) ექსტრაპოლაციისას, რაც მიუთითებს, რომ ღია კოდის მოდელები უფრო მეტად პროგრამირებაზეა სპეციალიზებული, ვიდრე უფრო ფართო მსჯელობის უნარზე.

განვითარების პროცესში ამოცანების შესაფასებლად და გასამყარებლად მოწინავე GPT მოდელები გამოვიყენეთ. ამიტომ ვივარაუდეთ რომ GeneBench-Pro შესაძლოა მიკერძოებული იყოს GPT მოდელების მიმართ, მოდელების სხვა ოჯახებთან შედარებით. თუმცა კონკურენტი მოდელები, უკეთეს შემთხვევაში, შესაბამისი GPT მოდელის წარმადობას უთანაბრდებოდნენ მისი გამოშვების დროს და, როგორც წესი, მნიშვნელოვნად ჩამორჩებოდნენ.

ეს შეფასების შედეგები — GPT‑5.6 Sol (Pro)-ზე 31.5%-მდე — განსაკუთრებით შთამბეჭდავია GeneBench-Pro-ის კითხვების სირთულის გათვალისწინებით. გამოკითხვაში ჩვენმა შემფასებლებმა ივარაუდეს, რომ GeneBench-Pro-ის ტიპური ამოცანის შესრულებას ადამიან ექსპერტს დაახლოებით 20–40 საათი დასჭირდებოდა. საათში $200-ის კონსერვატიულ პირობებში, ერთი ამოცანის შესასრულებლად საჭირო ადამიანური შრომის ღირებულება ათასობით დოლარს აღწევს. ამჟამინდელი AI აგენტები ჯერ კიდევ მნივნელოვნად არასანდოა იმისთვის, რომ ადამიანი ექსპერტები ჩაანაცვლოს, თუმცა ხარჯების სხვაობა დიდია, რადგან დასკვნის გამოტანის ხარჯები თითო ამოცანაზე მხოლოდ რამდენიმე დოლარს შეადგენს. ეს ნიშნავს, რომ ამჟამინდელი შესაძლებლობების პირობებშიც კი ნაწილობრივ ავტომატიზაციას შეუძლია მნიშვნელოვანი ეკონომიკური და სამეცნიერო ღირებულების შექმნა.

1/2
ბენჩმარკები განპირობებულია ბიოლოგიური საკითხების მრავალფეროვანი სპექტრით, მაგრამ რეალური გამოწვევა მდგომარეობს მონაცემთა კვლევით ანალიზსა და ამ აღმოჩენების შესახებ მსჯელობაში: კანონზომიერებებისა და არტეფაქტების იდენტიფიცირებასა და იმის გადაწყვეტაში, უნდა გამოირიცხოს თუ შესწორდეს მონაცემები. ეს წააგავს რეალური ბიოლოგიური მონაცემთა ნაკრებების აღრეულ ბუნებას. ამ შეფასებების მიმოხილვა ცხადყოფს, რამდენად მნიშვნელოვანია მკაფიო ამომხსნელის კონტრაქტები აგენტებზე დაფუძნებული სამეცნიერო პრობლემების გადაჭრისთვის. მოთხოვნის განსხვავებულმა ფორმულირებამ ან დავალების სპეციფიკაციამ შეიძლება მნიშვნელოვნად იმოქმედოს იმაზე, თუ რომელი ანალიზები აღიქმება დასაშვებად.
სირილუს ტანი, ნიუ-იორკის გენომის ცენტრის პოსტდოქტორანტი მკვლევარი

მიუხედავად ამისა, ის ფაქტი, რომ მოწინავე მოდელები ამ ამოცანების მესამედზე ნაკლებს მაინც ასრულებენ, აჩვენებს, რომ გაუმჯობესების მნიშვნელოვანი შესაძლებლობა არსებობს. მოდელებს შეუძლიათ რთული პრობლემების შემთხვევაში ნაწილობრივი წინსვლის მიღწევა, მაგრამ მათ უჭირთ დასკვნითი მარყუჟის დახურვა. წარუმატებლობის ეს კანონზომიერება ასახავს განსხვავებას ექსპერტ ადამიანებსა და დამწყებებს შორის. ექსპერტები თავიანთ გამოცდილებას იყენებენ ამოცანის კონტექსტის განსაზღვრისა და საკუთარი მიდგომის ადაპტირებისთვის, მაშინ როცა დამწყებები დაკვირვებებს ახორციელებენ, მაგრამ უჭირთ მათი ამოცანის უფრო ფართო კონტექსტში ინტეგრირება.

ფარმაკოგენომიკური პასუხი დროში ცვალებადი მკურნალობით

მკურნალობის დაწყება, გენოტიპ-სპეციფიკური პასუხი, დაგვიანებული ფარმაკოდინამიკა, პრევალენტული მომხმარებლის ნიშნები და დინამიკური ბიომარკერები ერთობლივად განსაზღვრავენ მიზეზობრივ გადარჩენადობის მნიშვნელობას.

GPT-5.5-ის შაბლონი

Handles treatment timing with a conventional Cox outcome model but does not address treatment-confounder feedback.

Fit a counting-process Cox model with treatment as a time-varying exposure, effective only after treat_start+90 days ... The model included G, treatment×G, baseline severity, age, and sex.

GPT-5.6 Sol-ის შაბლონი

Uses a more appropriate causal inference method to properly account for treatment-confounder feedback.

Used a new-user marginal structural Cox model: excluded 818 flagged prevalent users, modeled treatment initiation with stabilized inverse-probability weights using baseline covariates and current biomarker, and treated exposure as time-varying with a 90-day efficacy lag.

თითქმის სრულყოფილი წარმადობის მიღწევა მოითხოვს ისეთ შეფასებებს, რომლებიც სანდოდ გაზომავენ პროგრესს და გამოავლენენ, სად ვერ ახერხებენ მოდელები წარმატების მიღწევას. GeneBench-Pro-ის მსგავსი ბენჩმარკები შეიძლება დაგვეხმაროს, შესაძლებლობების ბუნდოვანი ხარვეზი ვაქციოთ ისეთ რამედ, რისი დიაგნოსტირებაც და გაუმჯობესებაც შეგვიძლია. 

თუ აგენტებს ამ კატეგორიის ანალიზის საიმედოდ ავტომატიზაცია შეუძლიათ, ისინი მნიშვნელოვნად დააჩქარებენ სამეცნიერო აღმოჩენების პროცესს. ადამიანის გენეტიკური მტკიცებულებები უკვე ცენტრალურ როლს ასრულებს სამიზნეების პრიორიტეტიზაციასა და შემდგომ ტრანსლაციურ კვლევებში, რადგან გენეტიკურად მხარდაჭერილი მექანიზმები გაცილებით უფრო ხშირად უწყობენ ხელს დამტკიცებული მკურნალობების მიღწევას.

ამავდროულად, სეკვენირების ხარჯები მკვეთრად შემცირდა, ხოლო ბიობანკის მასშტაბის მონაცემთა ნაკრებები ახლა მოლეკულურ, ფენოტიპურ და ჯანმრთელობის ჩანაწერების ინფორმაციას უპრეცედენტო მასშტაბით აკავშირებს. შემზღუდველი ფაქტორი მონაცემების გენერირებიდან ინფორმაციის ქმედით ანალიტიკურ მიგნებებად გარდაქმნაზე გადადის. მოდელები, რომლებიც თანმიმდევრულად ასრულებენ იმ ანალიზებს, რომლებიც ამჟამად ადამიან ექსპერტთა გუნდების მიერ ხორციელდება, სამრეწველო კვლევას გარდაქმნიან ჰიპოთეზების პრიორიტეტიზაციის, სამიზნეებზე შემდგომი მუშაობისა და მონაცემთა გენერირებასა და გადაწყვეტილებების მიღებას შორის იტერაციული ციკლის დაჩქარებით.

GeneBench-Pro წარმოადგენს საწყის მცდელობას შეაფასოს უფრო აბსტრაქტული უნარები, რომლებიც გამოცდილი სპეციალისტების კარგ სამეცნიერო განსჯაში მონაწილეობს. ეს უნარები მათ საშუალებას აძლევს, ინტუიციურად განსაზღვრონ და გამოავლინონ ყველაზე პერსპექტიული საწყისი ანალიზები, განმეორებით გადაამუშაონ და გადახედონ თავიანთ მსჯელობას, როდესაც მონაცემები ეწინააღმდეგება საწყის დაშვებებს, და მივიდნენ დასკვნებამდე, რომლებზეც შესაძლოა დამოკიდებული იყოს შემდგომი კლინიკური, აკადემიური ან ბიზნეს გადაწყვეტილებები. 

ვვარაუდობთ, რომ მოდელების შესაძლებლობების განვითარებასთან ერთად, ბენჩმარკები, რომლებიც მოდელების უნარებს აბსტრაქციის ამ უფრო მაღალ დონეებზე ამოწმებენ, სულ უფრო სასარგებლო გახდებიან — იმ ბენჩმარკებს მიღმა, რომლებიც უბრალოდ წიგნიდან მიღებულ ცოდნას ან რუტინული ანალიზების შესრულების უნარს ამოწმებენ.

ავტორი

OpenAI