Sari la conținutul principal
OpenAI

17 iunie 2026

CercetarePublicare

Vă prezentăm LifeSciBench

Un benchmark scris și evaluat de experți, ancorat în cercetarea reală din științele vieții

Se încarcă…

Sistemele de AI agentivă devin tot mai capabile să îndeplinească sarcini științifice. Utilitatea lor pentru cercetătorii din științele vieții depinde însă de cât de bine gestionează complexitatea cercetării reale. Aceasta seamănă rareori cu o întrebare de memorie sau cu o predicție simplă. Cercetătorii interpretează dovezi incomplete, împacă rezultate contradictorii, proiectează experimente, depanează teste, evaluează riscuri translaționale și decid sub incertitudine.

Benchmarkurile actuale nu surprind pe deplin aceste capacități. Multe evaluări din științele vieții vizează domenii înguste sau abilități izolate, cu întrebări structurate și răspunsuri de referință clare. Deși utile, ele nu arată mereu dacă un model poate contribui la întreaga muncă de cercetare.

Am creat LifeSciBench pentru a reduce acest decalaj. Fiecare sarcină se bazează pe judecata unor specialiști activi, cu doctorat și experiență directă în programe de descoperire a medicamentelor în biotehnologie și farmaceutică.

LifeSciBench include 750 de sarcini scrise de experți, în șapte fluxuri de lucru și șapte domenii biologice.

1,062

Artefacte ale sarcinii

173

Cercetători participanți

19,020

Criterii de evaluare

453

Evaluatori experți

Ce măsoară LifeSciBench

LifeSciBench măsoară dacă sistemele AI pot sprijini sarcini realiste de cercetare, nu doar răspunde la întrebări de biologie. Pentru taxonomie, am întrebat cercetători activi ce fluxuri de lucru folosesc cel mai des în cercetarea aplicată. Am grupat răspunsurile în șapte categorii: gestionarea dovezilor, analiză, proiectare și optimizare, raţionament științific, validare și operațiuni, translație și comunicare științifică.

Fiecare sarcină arată ca o cerere către un colaborator avizat: solicitare științifică, context sau artefacte relevante și răspuns liber. Grilele experților verifică dacă un model dă răspunsul corect, cu detaliile, justificările, rezervele și formatul așteptate de un cercetător.

Construirea setului de date

LifeSciBench evaluează raţionamentul științific și abilitățile practice, mai greu de definit, necesare utilizării reale. Sarcinile cer modelelor să abordeze probleme realiste: să interpreteze dovezi, să judece în contextul domeniului și să comunice concluzii utile experților. Multe cer și gestionarea incertitudinii și raţionament pe fișiere de date, nu doar pe textul solicitării.

Benchmarkul reflectă complexitatea muncii din științele vieții. În total, 79% dintre sarcini cer mai mulți pași de raţionament sau decizie, în medie patru pe sarcină. LifeSciBench include 1.062 de artefacte atașate: figuri, PDF-uri, tabele, fișiere de secvențe, structurale sau chimice și referințe web. Peste jumătate dintre sarcini (53%) cer interpretarea sau sintetizarea informațiilor din cel puțin un artefact.

Sarcinile au fost create de 173 de cercetători experți din diverse discipline ale științelor vieții. Toți aveau doctorat și experiență în biotehnologie sau industria farmaceutică. Sarcinile puteau fi revizuite de câte ori era necesar înainte de acceptare; cele acceptate au avut, în medie, șase cicluri automate de autoevaluare și cel puțin două runde de evaluare de către experți. Evaluările s-au bazat pe un răspuns corect verificabil sau pe consens solid, cu cel puțin 90% acord între experții domeniului. Astfel, sarcinile acceptate au rămas fundamentate științific, ușor de notat și reprezentative pentru cercetarea aplicată.

Diagramă care ilustrează sarcinile LifeSciBench care combină surse de date din domeniul științelor vieții, precum secvențe genomice, structuri moleculare, figuri, documente, foi de calcul și linkuri web, cu procese de raționament în mai multe etape și evaluare de către experți.

Evaluare și structura grilei

Sarcinile LifeSciBench sunt notate cu o grilă detaliată, specifică fiecărei sarcini, care împarte răspunsul așteptat în afirmații științifice, calcule, decizii, justificări etc. În întregul benchmark, grilele experților includ 19.020 de criterii — în medie 25 pe sarcină — pentru corectitudine științifică și utilitate decizională.

Această abordare reflectă practica: multe sarcini din științele vieții nu pot fi notate doar după răspunsul final. Un răspuns poate avea concluzia generală corectă, dar rămâne incomplet dacă omite, de pildă, o limitare-cheie a unui test sau o nuanță biologică importantă. Invers, un răspuns parțial poate include raţionament de calitate, chiar dacă nu rezolvă complet sarcina.

Grilele granulare surprind această nuanță. LifeSciBench evaluează nu doar acuratețea finală, ci și dacă modelul ajunge la răspuns într-un mod valid științific și util practic.

Validarea LifeSciBench

Am validat LifeSciBench printr-o evaluare independentă de experți. Feedbackul a venit de la 453 de evaluatori neimplicați în scrierea sarcinilor. Dintre ei, 97% aveau doctorat sau echivalent, în medie 12 ani de experiență și 14 publicații evaluate inter pares; 88% primiseră cel puțin un premiu sau o bursă.

Evaluatorii au notat dacă fiecare sarcină avea calitățile unei întrebări solide de benchmark: legătură cu cercetarea reală, testare adecvată a raţionamentului științific și expertizei, bază în dovezi sau consens și utilitate pentru evaluarea performanței modelului. Acordul a depășit 96% în fiecare categorie.

Relevanță în lumea reală

Această sarcină reflectă activitatea reală din domeniul științelor vieții?

Sunt ferm de acord
90.4%
Sunt de acord în general
98.3%

Raţionament științific / competență de domeniu

Această sarcină evaluează și notează corect raționamentul științific și competențele specifice domeniului științelor vieții?

Sunt ferm de acord
86.4%
Sunt de acord în general
98.1%

Fundamentare științifică

Această sarcină are o bază științifică, poate fi evaluată și se bazează pe dovezi, date, artefacte sau un consens al experților adecvate?

Sunt ferm de acord
77.1%
Sunt de acord în general
96.5%

Utilitate generală

Per ansamblu, este aceasta o sarcină solidă de evaluare în științele vieții?

Sunt ferm de acord
79.1%
Sunt de acord în general
96.6%

Comentariile evaluatorilor au confirmat scorurile:

1 din 3
În ansamblu, este o sarcină solidă, deoarece are o singură interpretare de bază corectă, lăsând totuși loc pentru a distinge răspunsurile mai bune în funcție de cât de precis limitează incertitudinea.

Rezultate

Raportăm două metrici complementare. Rata de promovare este procentul de sarcini în care un model atinge pragul de succes de 70%. Scorul este recompensa medie din grilă, cu credit parțial pentru criterii individuale chiar dacă sarcina nu e rezolvată complet. Ambele contează: un răspuns științific poate fi parțial corect sau util fără să îndeplinească toate cerințele.

Performanța modelului variază mult după tipul sarcinii, fluxul de lucru și formatul răspunsului.

Unde sistemele AI arată deja puncte forte

LifeSciBench arată că modelele de frontieră sunt cele mai puternice la sinteză științifică, comunicare și interpretare structurată. Ratele absolute de promovare rămân modeste, deci domeniile nu sunt saturate, dar GPT‑Rosalind progresează clar față de GPT‑5.5: rata exactă totală crește de la 25,7% la 36,1%.

Cele mai mari progrese apar la Comunicare științifică și Translație. De exemplu, la Comunicare științifică rata crește de la 56,3% pentru GPT‑5.5 la 71,1% pentru GPT‑Rosalind; categoria este mică (n=9), deci interpretarea cere prudență, dar sugerează îmbunătățiri rapide în organizarea dovezilor și explicații convingătoare pentru experți. Translația (procesul "de la laborator la pacient" în dezvoltarea medicamentelor) are un tipar similar, crescând de la 36,8% pentru GPT‑5.5 la 57,7% pentru GPT‑Rosalind; modelele leagă tot mai bine dovezile preclinice de implicațiile clinice.

Rezultatele pe criterii indică aceeași direcție. La sarcini care cer rezultate utile experților sau acționabile, GPT‑Rosalind obține 44,7%, față de 29,1% pentru GPT‑5.5. La sarcini care cer gestionarea incertitudinii și a rezervelor, scorul este 44,8%, față de 29,3%. Tiparul sugerează că modelele sunt mai utile când sarcina are limite clare ale dovezilor și cere judecată științifică structurată.

GPT‑Rosalind excelează în îndeplinirea sarcinilor cu valoare științifică identificate de experți din domeniu și din mediul universitar.

GPT‑Rosalind conduce performanța în sarcini cu valoare științifică identificate de experți din industrie și mediul academic.

GPT‑Rosalind conduce performanța în sarcini cu valoare științifică identificate de experți din industrie și mediul academic.

Unde sistemele AI încă nu ajung

Performanța rămâne mult mai slabă în munca științifică bogată în artefacte, orientată spre proiectare sau constrânsă operațional. Astfel, Proiectare, optimizare & predicție rămâne printre cele mai grele fluxuri, cu rată GPT‑Rosalind de 30,7%; Analiza este similară, la 30,3%.

Utilizarea artefactelor este o lacună clară. Deși GPT‑Rosalind depășește GPT‑5.5 în contexte cu multe artefacte, rata sa scade de la 45,1% la sarcini doar text la 28,1% la sarcini cu artefacte sau URL-uri. GPT‑5.5 urmează același tipar, scăzând de la 29,9% la 21,9%. O analiză detaliată confirmă că modelele de frontieră extrag greu informații din figuri complexe sau fișiere mari de secvențe și le integrează greu în răspuns.

Ratele de promovare scad când sarcinile cer raţionament ancorat în surse sau lucrul cu artefacte

Contează și formatul răspunsului. Sarcinile care cer ieșiri exacte la nivel de secvență, structură sau construct au rate mai mici: GPT‑Rosalind ajunge la 14,8% la sarcini numerice și 24,0% la ieșiri de secvență sau structură. Și generarea de constructe este fragilă: GPT‑Rosalind are 27,3% și progrese mici față de GPT‑5.5. O parte din decalaj poate ține de notarea mai strictă a răspunsurilor exacte, unde mici diferențe de calcul sau format pot coborî răspunsul sub prag. Totuși, aceste eșecuri contează științific: multe fluxuri din științele vieții cer ieșiri suficient de exacte pentru utilizare directă, ca în proiectarea donatorilor CRISPR/HDR sau a siRNA.

Modelele ajung adesea aproape, dar nu rezolvă complet sarcina. În circa 14% dintre sarcini, modelele au primit credit substanțial în grilă, deși nu au trecut pragul exact. Pentru GPT‑Rosalind, 109 sarcini au avut rate sub 20%, dar au primit totuși cel puțin 50% din recompensa grilei. Practic, modelele pot găsi dovezi relevante sau un răspuns parțial plauzibil, dar eșuează fiindcă omit o constrângere, folosesc dovezi greșite, calculează incomplet sau nu leagă raţionamentul de o decizie finală utilă științific.

Limitări & pașii următori

LifeSciBench este un pas spre măsurarea utilității sistemelor AI în cercetarea din științele vieții, dar nu înlocuiește studiile în medii reale. Benchmarkul vizează sarcini autonome din fluxuri industriale recurente, lăsând în afara domeniului actual multe specialități și tipuri de sarcini. Cercetarea reală este iterativă: cercetătorii adună dovezi, revizuiesc ipoteze, proiectează experimente ulterioare și își adaptează planurile pe măsură ce apar rezultate.

Performanța bună în LifeSciBench trebuie deci văzută ca dovadă de capacitate realistă la nivel de sarcină, nu ca măsură directă a impactului asupra cercetării. Benchmarkul se bazează pe fluxuri industriale, dar nu surprinde întreaga diversitate și dinamică a programelor reale, unde progresul depinde de factori care evoluează în timp.

Următorul pas este legarea performanței din benchmark de studii de implementare în fluxuri reale de cercetare. Deși LifeSciBench a fost dezvoltat cu cercetători activi, a măsura dacă sistemele AI accelerează descoperirea sau îmbunătățesc rezultatele de C&D cere studierea utilizării și performanței modelului în cercetare reală, pe termen mai lung și în mai multe runde de raţionament, feedback și urmărire experimentală.

Implică-te

Contribuie la dezvoltarea următoarei generații de teste de performanță pentru IA în domeniul științelor vieții sau solicită acces la GPT-Rosalind.

Autor

OpenAI