წარმოგიდგენთ GeneBench-Pro-ს
კვლევითი დონის ბენჩმარკი, რომელიც ზომავს, როგორ ახდენე ნავიგაციას AI აგენტები გაურკვევლობაში და როგორ იღებენ მნიშვნელოვან შეფასებებზე დაფუძნებულ გადაწყვეტილებებს გამოთვლით ბიოლოგიაში.
სამეცნიერო მონაცემებს იშვიათად ახლავს ინსტრუქციები. მკვლევრებმა უნდა გადაწყვიტონ, ასახავს თუ არა კანონზომიერება ბიოლოგიას ან ხმაურს, იძლევა თუ არა მონაცემები დასმული კითხვის საფუძველს და როგორ უნდა შეცვალოს თითოეულმა შედეგმა მათი შემდგომი მოქმედებები. ხელოვნური ინტელექტის აგენტები სულ უფრო მეტად ახერხებენ რთული ანალიზების ჩატარებას, მაგრამ რეალური სამეცნიერო კვლევა ასევე დამოკიდებულია არა მხოლოდ ფაქტების გახსენებაზე ან წინასწარ განსაზღვრული სამუშაო პროცესის მიყოლაზე, არამედ ამ უფრო მაღალი დონის მსჯელობით შეფასებების გაკეთებაზეც.
დღეს წარმოგიდგენთ GeneBench-Pro-ს — რთულ, კვლევითი დონის ბენჩმარკს, რომელიც ამოწმებს, შეუძლიათ თუ არა მოდელებს გაუმკლავდნენ ისეთი ტიპის განსჯაზე ძლიერ დაყრდნობილ ანალიზს, როგორსაც რეალურ სამყაროში გამოთვლითი ბიოლოგია მოითხოვს. ის აფართოვებს GeneBench(იხსნება ახალ ფანჯარაში)-ს, რომელიც მოიცვას უფრო რთულ და უფრო რეალისტურ ამოცანებს გენომიკის, რაოდენობითი ბიოლოგიისა და ტრანსლაციური მედიცინის სფეროებში და აფიქსირებს გამოთვლით ბიოლოგიაში სამეცნიერო კვლევის სირთულეს, იტერაციულბუნებას და გაურკვევლობას.
დღემდე არსებობს მცირე რაოდენობის დამაჯერებელი შეფასებები სისტემური დონის მსჯელობით მიღებული გადაწყვეტილებებისა, რომლებიც რეალურ სამყაროში გამოთვლით კვლევას ართულებს. მათ შორისაა გაურკვევლობასთან გამკლავება, დაშვებების გადახედვა, ანალიზის სწორი გზის არჩევა და იმის ცოდნა, როდის არის შედეგი მზად გადაწყვეტილების მისაღებად. ვინაიდან ამ უნარების ფორმალიზება რთულია, მათი მკაცრი შეფასებაც არ არის მარტივი, მაშინაც კი, როცა მათი სისუსტეები სულ უფრო მეტად ზღუდავს ხელოვნური ინტელექტის საერთო წარმადობას.
GeneBench-Pro შემუშავებულია იმისთვის, რომ ზუსტად გაზომოს ეს უფრო მაღალი დონის შესაძლებლობები. GeneBench-Pro-ში „კვლევით გემოვნებას“ განვსაზღვრავთ, როგორც შეფასებითი გადაწყვეტილებების ჯაჭვებს, რომლებიც ანალიზს აყალიბებს: რომელი კითხვების მხარდაჭერა შეუძლია მონაცემებს, როგორ უნდა შეცვალოს ადრეულმა დიაგნოსტიკამ მოდელი ან შეფასება და როდის საჭიროებს საწყისი გეგმა გადახედვას. GeneBench-Pro-ის თითოეული ამოცანა მოდელს აძლევს რეალისტურ და მოუწესრიგებელ მონაცემთა ნაკრებს, მოკლე ექსპერიმენტულ კონტექსტს და სამიზნე შესაფასებელ სიდიდეს, რომელიც დაკავშირებულია შემდგომ გადაწყვეტილებასთან. სწორად პასუხის გასაცემად, მოდელმა უნდა შეისწავლოს მონაცემები, აირჩიოს შესაბამისი ანალიტიკური მიდგომა, ჩაერთოს ექსპერიმენტირების იტერაციულ პროცესში და წარმოადგინოს საბოლოო პასუხი.
ბიოლოგიაში მონაცემთა გენერირების ღირებულება (მაგ., გენომის სეკვენირება) მკვეთრად შემცირდა და ზოგიერთი მკვლევარი ახლა ამტკიცებს(იხსნება ახალ ფანჯარაში), რომ შემზღუდველი ფაქტორი აღარ არის ნიმუშების შეგროვება, არამედ შემდგომი გამოთვლითი დამუშავება და ანალიზი. GeneBench-Pro შექმნილია იმის შესაფასებლად, თუ რა პროგრესია მიღწეული ამ ბარიერის დაძლევაში, 129 კითხვით, რომლებიც გამოთვლითი ბიოლოგიის კონტექსტებისა და მეთოდების ფართო სპექტრს მოიცავს.
დომენების ატლასი: 129 პრობლემა 10 დომენსა და 21 ქვედომენში
დააწკაპუნეთ ზემოთ მდებარე წერტილზე, რათა გაეცნოთ ეტალონურ ამოცანას.
ეს ატლასი წინასწარ წარმოდგენას გვიქმნის GeneBench-Pro-ის მასშტაბის შესახებ. გთხოვთ, ეწვიეთ შემთხვევების ანალიზის გვერდს, რათა უფრო დეტალურად გაეცნოთ 10 წარმომადგენლობით შეკითხვას.
GeneBench-Pro ასევე შექმნილია ისე, რომ თავიდან აიცილოს ბენჩმარკის ხარვეზები. ბიოლოგიის გრძელვადიანი ბენჩმარკები მრავალსაფეხურიან კითხვებს აყალიბებს მოუწესრიგებელ ისტორიულ მონაცემთა ნაკრებების გარშემო, სადაც ანალიზის პროცესში შესაძლოა არ არსებობდეს ერთი, ცალსახად სწორი გზა. ერთმა აგენტმა შეიძლება აირჩიოს ერთი დასაბუთებადი ზღვრული მნიშვნელობა, ხოლო მეორემ — განსხვავებული, მაგრამ თანაბრად დასაბუთებადი ვარიანტი; ეს უფრო ასახავს ბენჩმარკის შემქმნელის მიერ გაკეთებულ პირობით არჩევანებს, ვიდრე რაიმე ფუნდამენტურ განსხვავებებს მოდელის წარმადობაში. საპირისპიროც შეიძლება მოხდეს: თუ პრობლემა რიცხობრივად ზედმეტად არამგრძნობიარეა, აგენტს შეუძლია ანალიზში ფუნდამენტური შეცდომები დაუშვას და მაინც დამაკმაყოფილებელი შედეგი მიიღოს.
ამ ტიპების წარუმატებლობების თავიდან ასაცილებლად, GeneBench-Pro-ის თითოეული ამოცანა სინთეზურად არის შექმნილი: ჩვენ ვიცით სრული მიზეზ-შედეგობრივი სტრუქტურა და უშუალოდ ვახდენთ მონაცემთა გენერირების პროცესის სიმულირებას. ეს საშუალებას გვაძლევს დავარეგულიროთ თითოეული ამოცანის სირთულე, უზრუნველვყოთ, რომ სუბიექტურ ანალიტიკურ არჩევანებში გონივრულმა განსხვავებებმა მაინც მისაღები რიცხვითი შედეგები გამოიღოს, და დავადასტუროთ (აბლაციის კვლევების საშუალებით), რომ დამაჯერებელი, მაგრამ არასწორი ანალიზები წარუმატებელია. შემდეგ ამოცანების მონახაზებს ვუტარებთ აუდიტს დეტალური კვალის ანალიზის მეშვეობით, რათა შევამოწმოთ ინფორმაციის გაჟონვა და გაუთვალისწინებელი ამოხსნის გზები. ეს გვარწმუნებს, რომ სწორი პასუხის მიღება დამოკიდებულია სწორი ანალიტიკური გზის არჩევაზე და არა მოკლე გზის გამოყენებაზე ან ავტორის მიერ არჩეულ უპირატესობასთან შესაბამისობაზე.
GeneBench-Pro-ის 129 კითხვიდან 82 გავუგზავნეთ გარე დარგის ექსპერტებს, მათ შორის სამაგისტრო და სადოქტორო პროგრამების სტუდენტებს, პოსტდოქტორანტ მკვლევრებს, ინდუსტრიის მეცნიერებსა და პროფესორებს. რეცენზენტებმა შეაფასეს თითოეული ამოცანის რეალისტურობა, იყო თუ არა სამიზნე პასუხი იდენტიფიცირებადი და იყო თუ არა მეთოდები და შემფასებლები შესაბამისი. უკუკავშირი გამოყენებულ იქნა ამოცანების გასაუმჯობესებლად.
“ჩემ მიერ განხილული ამოცანები ასპირანტისთვის რთულად შესასრულებელი იქნებოდა გამოცდილი ხელმძღვანელისგან განმეორებითი უკუკავშირის გარეშე. მონაცემები შეიცავდა ტექნიკურ და ხარისხის კონტროლის საკითხებს, რომლებიც წარმატებით დასასრულებლად საჭიროებდა გააზრებულ და რეფლექსიურ მონაცემთა ანალიზს პოტენციური ხარვეზების გათვალისწინებით; ისინი უბრალოდ არ იყენებდნენ რაიმე მზა მეთოდს სუფთა და კარგად კურირებულ მონაცემებზე.”
“მაშინაც კი, თუ ამჟამინდელ მოდელებს არ შეუძლიათ დამოუკიდებელი ანალიზების თავიდან ბოლომდე საიმედოდ ჩატარება, ის მოდელები, რომლებიც GeneBench-Pro-ის ამოცანებზე კარგად მუშაობენ, აშკარად შეძლებდნენ მკვლევრების დახმარებას სწორი სამუშაო პროცესების განსაზღვრასა და მონაცემების შესწავლაში. ვხედავ, რომ ეს მნიშვნელოვნად აუმჯობესებს კვლევის ტემპს, საფუძვლიანობასა და რეპროდუცირებადობას.”
GeneBench-Pro-ის თითოეული ამოცანა დამოუკიდებელი სამეცნიერო ანალიზია. აგენტები იღებენ წვდომას იზოლირებულ სამუშაო სივრცეზე, რომელიც შეიცავს მოკლე მოთხოვნას, მონაცემთა ფაილებს და ბიოინფორმატიკის სტანდარტულ პროგრამულ სტეკს, მათ შორის Python-ს, სამეცნიერო გამოთვლების ბიბლიოთეკებს და გენომიკის საბაზისო პაკეტებს, როგორიცაა PLINK 2.0 (თუმცა ამოცანები არ მოითხოვს დომენ-სპეციფიკური ინსტრუმენტების გამოყენებას).
სტრუქტურული ვარიანტებით მართული სიმსივნის თერაპიის სარგებელ-რისკის გადაწყვეტილება
რადგან მონაცემთა გენერირების სრულ პროცესს ჩვენ ვაკონტროლებთ, შეგვიძლია სისწორე დეტერმინისტულად შევაფასოთ ცნობილ სამიზნეებთან მიმართებაში, რითაც თავიდან ავიცილებთ მოდელის არჩევანით გამოწვეულ ცვალებადობასა და ჭარბი ტრანსკრიფციის ეფექტებს, რომლებიც სტანდარტულ რუბრიკაზე დაფუძნებულ შეფასებაში გვხვდება.
თითოეულ ამოცანას ასევე ახლავს მდიდარი მეტამონაცემები, მათ შორის განსაზღვრული ანალიზის სტრუქტურა, თანდართული მონაცემთა ფაილები, დეტალური მრავალგვერდიანი შემთხვევის ანალიზი და ექსპერტული შეფასების შედეგები. ჩვენ სრულად ღია წყაროდ ვაქვეყნებთ GeneBench-Pro-ის 10 წარმომადგენლობით შეკითხვას Hugging Face(იხსნება ახალ ფანჯარაში)-ზე, მათ დასათვალიერებლად ხელმისაწვდომი ინტერაქტიული ვებინტერფეისით. და ბოლოს, უახლოეს მომავალში Artificial Analysis(იხსნება ახალ ფანჯარაში)-ს მივაწვდით 50 კითხვიან ქვეკრებულს დამოუკიდებელი, მესამე მხარის შეფასებისთვის.
ჩვენი უძლიერესი მოდელი, GPT‑5.6 Sol, მსჯელობის უმაღლეს დონეზე აღწევს წარმატებულ 28,7%-იან მაჩვენებელს (31,5%-ს Pro რეჟიმის ჩართვისას). ეს მკვეთრი ზრდაა იმ პერიოდთან შედარებით, როცა თავდაპირველი GeneBench-ის შექმნა დავიწყეთ; იმ დროისთვის ჩვენმა საუკეთესო მოწინავე მოდელმა, GPT‑5‑მა, 5%-ზე ნაკლები შედეგი აჩვენა. ამ ბენჩმარკზე პროგრესი მიუთითებს, რომ მოწინავე მოდელები სწრაფად უმჯობესდება, მათ შორის ნაკლებად ხელშესახებ, სისტემების დონის სამეცნიერო მსჯელობაშიც. ამჟამინდელი ტემპით, წლის ბოლომდე ეს ბენჩმარკი შესაძლოა შეივსოს.
შედეგები ასევე აჩვენებს ტესტირების დროს გამოთვლითი რესურსების მასშტაბირების გავლენას. მსჯელობის ყველაზე დაბალ დონეზე GPT‑5.6 Sol მხოლოდ ერთნიშნა პროცენტულ მაჩვენებელს აღწევს. მსჯელობის უმაღლეს დონეზე, GPT‑5.6 Sol წყვეტს თითქმის ექვსჯერ მეტ კითხვას, ვიდრე GPT‑5.2, ამასთან დაახლოებით ორი მესამედით მეტ token-ს იყენებს.
მოდელების ოჯახებს შორის შედარებები მიუთითებს, რომ GPT მოდელები რაოდენობრივი გაურკვევლობის პირობებში მაღალი დონის სამეცნიერო მსჯელობაში ყველაზე ძლიერ სისტემებს შორისაა. წარმადობის სხვაობა GPT‑5.6‑ს, GPT‑5.5‑სა და წამყვან ღია კოდის მოდელებს, როგორიცაა GLM 5.2, შორის მნიშვნელოვნად უფრო დიდია, ვიდრე მოველოდით პროგრამირების ბენჩმარკებიდან(იხსნება ახალ ფანჯარაში) ექსტრაპოლაციისას, რაც მიუთითებს, რომ ღია კოდის მოდელები უფრო მეტად პროგრამირებაზეა სპეციალიზებული, ვიდრე უფრო ფართო მსჯელობის უნარზე.
განვითარების პროცესში ამოცანების შესაფასებლად და გასამყარებლად მოწინავე GPT მოდელები გამოვიყენეთ. ამიტომ ვივარაუდეთ რომ GeneBench-Pro შესაძლოა მიკერძოებული იყოს GPT მოდელების მიმართ, მოდელების სხვა ოჯახებთან შედარებით. თუმცა კონკურენტი მოდელები, უკეთეს შემთხვევაში, შესაბამისი GPT მოდელის წარმადობას უთანაბრდებოდნენ მისი გამოშვების დროს და, როგორც წესი, მნიშვნელოვნად ჩამორჩებოდნენ.
ეს შეფასების შედეგები — GPT‑5.6 Sol (Pro)-ზე 31.5%-მდე — განსაკუთრებით შთამბეჭდავია GeneBench-Pro-ის კითხვების სირთულის გათვალისწინებით. გამოკითხვაში ჩვენმა შემფასებლებმა ივარაუდეს, რომ GeneBench-Pro-ის ტიპური ამოცანის შესრულებას ადამიან ექსპერტს დაახლოებით 20–40 საათი დასჭირდებოდა. საათში $200-ის კონსერვატიულ პირობებში, ერთი ამოცანის შესასრულებლად საჭირო ადამიანური შრომის ღირებულება ათასობით დოლარს აღწევს. ამჟამინდელი AI აგენტები ჯერ კიდევ მნივნელოვნად არასანდოა იმისთვის, რომ ადამიანი ექსპერტები ჩაანაცვლოს, თუმცა ხარჯების სხვაობა დიდია, რადგან დასკვნის გამოტანის ხარჯები თითო ამოცანაზე მხოლოდ რამდენიმე დოლარს შეადგენს. ეს ნიშნავს, რომ ამჟამინდელი შესაძლებლობების პირობებშიც კი ნაწილობრივ ავტომატიზაციას შეუძლია მნიშვნელოვანი ეკონომიკური და სამეცნიერო ღირებულების შექმნა.
“ბენჩმარკები განპირობებულია ბიოლოგიური საკითხების მრავალფეროვანი სპექტრით, მაგრამ რეალური გამოწვევა მდგომარეობს მონაცემთა კვლევით ანალიზსა და ამ აღმოჩენების შესახებ მსჯელობაში: კანონზომიერებებისა და არტეფაქტების იდენტიფიცირებასა და იმის გადაწყვეტაში, უნდა გამოირიცხოს თუ შესწორდეს მონაცემები. ეს წააგავს რეალური ბიოლოგიური მონაცემთა ნაკრებების აღრეულ ბუნებას. ამ შეფასებების მიმოხილვა ცხადყოფს, რამდენად მნიშვნელოვანია მკაფიო ამომხსნელის კონტრაქტები აგენტებზე დაფუძნებული სამეცნიერო პრობლემების გადაჭრისთვის. მოთხოვნის განსხვავებულმა ფორმულირებამ ან დავალების სპეციფიკაციამ შეიძლება მნიშვნელოვნად იმოქმედოს იმაზე, თუ რომელი ანალიზები აღიქმება დასაშვებად.”
“მე [კითხვები] ძირითადად მომეწონა. მათ, როგორც წესი, ჰქონდათ შემდეგის ნაზავი: (1) საგნის აუცილებელი ცოდნა, როგორიცაა C>T მიკერძოება უძველეს დნმ-ში, (2) მონაცემთა შეუსაბამობები, როგორიცაა წარმომავლობის შეცვლები, (3) გარკვეული ცოდნა იმის შესახებ, თუ რომელი ანალიტიკური ინსტრუმენტებია შესაფერისი კონკრეტული ამოცანისთვის და როგორ უნდა განხორციელდეს მათი გამოყენება. როგორც ჩანდა, აგენტების უმეტესობამ (2)-ზე ვერ გაართვა თავი. ისინი მონაცემებთან დაკავშირებულ პრობლემებს საკმარისი სიფრთხილით არ ეკიდებიან. შესაძლოა, ეს ამჟამინდელი მოდელების სისუსტეზე მიუთითებს. და ბიოლოგიური მონაცემების დიდ ნაწილს არარეგულარულობები ახასიათებს.”
მიუხედავად ამისა, ის ფაქტი, რომ მოწინავე მოდელები ამ ამოცანების მესამედზე ნაკლებს მაინც ასრულებენ, აჩვენებს, რომ გაუმჯობესების მნიშვნელოვანი შესაძლებლობა არსებობს. მოდელებს შეუძლიათ რთული პრობლემების შემთხვევაში ნაწილობრივი წინსვლის მიღწევა, მაგრამ მათ უჭირთ დასკვნითი მარყუჟის დახურვა. წარუმატებლობის ეს კანონზომიერება ასახავს განსხვავებას ექსპერტ ადამიანებსა და დამწყებებს შორის. ექსპერტები თავიანთ გამოცდილებას იყენებენ ამოცანის კონტექსტის განსაზღვრისა და საკუთარი მიდგომის ადაპტირებისთვის, მაშინ როცა დამწყებები დაკვირვებებს ახორციელებენ, მაგრამ უჭირთ მათი ამოცანის უფრო ფართო კონტექსტში ინტეგრირება.
ფარმაკოგენომიკური პასუხი დროში ცვალებადი მკურნალობით
GPT-5.5-ის შაბლონი
GPT-5.6 Sol-ის შაბლონი
თითქმის სრულყოფილი წარმადობის მიღწევა მოითხოვს ისეთ შეფასებებს, რომლებიც სანდოდ გაზომავენ პროგრესს და გამოავლენენ, სად ვერ ახერხებენ მოდელები წარმატების მიღწევას. GeneBench-Pro-ის მსგავსი ბენჩმარკები შეიძლება დაგვეხმაროს, შესაძლებლობების ბუნდოვანი ხარვეზი ვაქციოთ ისეთ რამედ, რისი დიაგნოსტირებაც და გაუმჯობესებაც შეგვიძლია.
თუ აგენტებს ამ კატეგორიის ანალიზის საიმედოდ ავტომატიზაცია შეუძლიათ, ისინი მნიშვნელოვნად დააჩქარებენ სამეცნიერო აღმოჩენების პროცესს. ადამიანის გენეტიკური მტკიცებულებები უკვე ცენტრალურ როლს ასრულებს სამიზნეების პრიორიტეტიზაციასა და შემდგომ ტრანსლაციურ კვლევებში, რადგან გენეტიკურად მხარდაჭერილი მექანიზმები გაცილებით უფრო ხშირად უწყობენ ხელს დამტკიცებული მკურნალობების მიღწევას.
ამავდროულად, სეკვენირების ხარჯები მკვეთრად შემცირდა, ხოლო ბიობანკის მასშტაბის მონაცემთა ნაკრებები ახლა მოლეკულურ, ფენოტიპურ და ჯანმრთელობის ჩანაწერების ინფორმაციას უპრეცედენტო მასშტაბით აკავშირებს. შემზღუდველი ფაქტორი მონაცემების გენერირებიდან ინფორმაციის ქმედით ანალიტიკურ მიგნებებად გარდაქმნაზე გადადის. მოდელები, რომლებიც თანმიმდევრულად ასრულებენ იმ ანალიზებს, რომლებიც ამჟამად ადამიან ექსპერტთა გუნდების მიერ ხორციელდება, სამრეწველო კვლევას გარდაქმნიან ჰიპოთეზების პრიორიტეტიზაციის, სამიზნეებზე შემდგომი მუშაობისა და მონაცემთა გენერირებასა და გადაწყვეტილებების მიღებას შორის იტერაციული ციკლის დაჩქარებით.
GeneBench-Pro წარმოადგენს საწყის მცდელობას შეაფასოს უფრო აბსტრაქტული უნარები, რომლებიც გამოცდილი სპეციალისტების კარგ სამეცნიერო განსჯაში მონაწილეობს. ეს უნარები მათ საშუალებას აძლევს, ინტუიციურად განსაზღვრონ და გამოავლინონ ყველაზე პერსპექტიული საწყისი ანალიზები, განმეორებით გადაამუშაონ და გადახედონ თავიანთ მსჯელობას, როდესაც მონაცემები ეწინააღმდეგება საწყის დაშვებებს, და მივიდნენ დასკვნებამდე, რომლებზეც შესაძლოა დამოკიდებული იყოს შემდგომი კლინიკური, აკადემიური ან ბიზნეს გადაწყვეტილებები.
ვვარაუდობთ, რომ მოდელების შესაძლებლობების განვითარებასთან ერთად, ბენჩმარკები, რომლებიც მოდელების უნარებს აბსტრაქციის ამ უფრო მაღალ დონეებზე ამოწმებენ, სულ უფრო სასარგებლო გახდებიან — იმ ბენჩმარკებს მიღმა, რომლებიც უბრალოდ წიგნიდან მიღებულ ცოდნას ან რუტინული ანალიზების შესრულების უნარს ამოწმებენ.


