Langkau ke kandungan utama
OpenAI

16 Disember 2025

PenyelidikanPenerbitan

Menilai keupayaan AI untuk melaksanakan tugas penyelidikan saintifik

Kami memperkenalkan FrontierScience, satu penanda aras baharu yang menilai keupayaan AI untuk penaakulan saintifik pada tahap pakar dalam bidang fizik, kimia dan biologi.

Grafik separa dengan latar belakang kecerunan lembut hijau dan kuning, perkataan besar yang dipotong bermula dengan “Fro…,” dan menyekat teks berlapis di sebelah kanan yang menyenaraikan kriteria semakan seperti “Berfakta,” “Boleh Digred,” “Objektif,” dan “Sukar.”
Memuat…

Penaakulan adalah teras kerja saintifik. Selain mengingati fakta, saintis menjana hipotesis, mengujinya dan memperhalusinya, serta mensintesis idea pelbagai bidang. Apabila model kami menjadi lebih berkebolehan, persoalan utama adalah bagaimana ia boleh melakukan penaakulan secara mendalam untuk menyumbang kepada penyelidikan saintifik.

Sepanjang tahun lalu, model kami telah mencapai pencapaian besar, termasuk meraih prestasi pingat emas di Sukan Olimpik Matematik Antarabangsa dan Sukan Olimpik Informatik Antarabangsa. Secara selari, kami mula melihat model kami yang paling berkemampuan, seperti GPT‑5, mempercepatkan aliran kerja saintifik sebenar dengan bermakna. Penyelidik menggunakan sistem ini untuk tugas seperti carian sastera merentas disiplin dan bahasa serta menyelesaikan bukti matematik yang rumit. Dalam kebanyakan kes, model memendekkan tempoh kerja yang mungkin mengambil masa beberapa hari atau minggu kepada beberapa jam. Kemajuan ini didokumentasikan dalam kertas kerja Eksperimen mempercepatkan sains awal dengan GPT‑5, pengeluaran November 2025, yang membentangkan bukti awal bahawa GPT‑5 dapat mempercepatkan aliran kerja saintifik secara terukur.

Memperkenalkan FrontierScience

Memandangkan kemajuan saintifik yang dipercepatkan adalah salah satu peluang paling menjanjikan untuk AI memberi manfaat kepada manusia, kami sedang memperbaiki model kami dalam tugas matematik dan sains yang sukar serta berfungsi pada alat yang akan membantu saintis mendapatkan manfaatnya.

Apabila GPQA(dibuka dalam tetingkap baru), penanda aras sains “Google-Proof” yang terdiri daripada soalan yang ditulis oleh pakar PhD, pengeluaran November 2023, GPT‑4 mencatatkan skor 39%, di bawah garis dasar pakar sebanyak 70%. Dua tahun kemudian, GPT‑5.2 mendapat skor 92%. Apabila keupayaan penaakulan dan pengetahuan model meneruskan skala, penanda aras yang lebih sukar akan menjadi penting untuk mengukur dan meramalkan keupayaan model untuk mempercepatkan penyelidikan saintifik. Penanda aras saintifik sebelum ini kebanyakannya tertumpu pada soalan aneka pilihan, sudah tepu atau tidak menumpukan pada sains secara langsung.

Untuk merapatkan jurang ini, kami memperkenalkan FrontierScience: satu penanda aras baharu yang direka untuk menilai keupayaan saintifik pada tahap pakar. FrontierScience ditulis dan mengesahkan oleh pakar dalam bidang fizik, kimia dan biologi, terdiri daripada ratusan soalan yang direka bentuk untuk menjadi sukar, asli dan bermakna. FrontierScience merangkumi dua laluan soalan: Sukan Olimpik, yang mengukur keupayaan penaakulan saintifik gaya Sukan Olimpik dan Penyelidikan, yang mengukur keupayaan penyelidikan saintifik dunia sebenar. Memberikan lebih banyak wawasan tentang keupayaan saintifik model membantu kita menjejaki kemajuan dan memajukan sains yang dipercepatkan oleh AI.

Dalam penilaian awal kami, GPT‑5.2 adalah model berprestasi terbaik kami dalam Sukan Olimpik FrontierScience (dengan skor 77%) dan Penyelidikan (dengan skor 25%), mendahului model-model perintis yang lain. Kami telah melihat kemajuan yang ketara dalam menyelesaikan soalan tahap pakar sambil meninggalkan ruang untuk lebih banyak kemajuan, terutamanya dalam tugas gaya penyelidikan yang terbuka. Bagi saintis, ini mencadangkan bahawa model semasa sudah boleh menyokong bahagian penyelidikan yang melibatkan penaakulan berstruktur, sambil menekankan bahawa masih banyak kerja yang perlu dilakukan untuk meningkatkan keupayaannya dalam melaksanakan pemikiran terbuka. Keputusan ini selaras dengan cara saintis sudah menggunakan model hari ini: untuk mempercepatkan aliran kerja penyelidikan sambil bergantung pada pertimbangan manusia untuk pembidangan masalah dan pengesahan serta meningkatkan penerokaan idea dan hubungan yang sebaliknya akan mengambil masa yang lebih lama untuk ditemui—termasuk, dalam sesetengah kes, menyumbang cerapan baharu yang kemudian dinilai dan diuji oleh pakar.

Akhirnya, penanda aras terpenting untuk keupayaan saintifik AI adalah penemuan baharu yang dibantu menjananya; itulah yang paling penting kepada sains dan masyarakat. FrontierScience berada di huluan semua itu. Ia memberikan kita panduan utama untuk penaakulan saintifik tahap pakar, membolehkan kita menguji model pada set soalan yang diseragamkan, melihat di mana ia berjaya atau gagal dan mengenal pasti di mana kita perlu memperbaikinya. FrontierScience adalah terhad dan mempunyai kekangan dalam beberapa aspek utama (contohnya, memberi tumpuan kepada kekangan, masalah yang ditulis oleh pakar) dan tidak menangkap semua yang dilakukan oleh saintis dalam kerja harian mereka. Tetapi bidang ini memerlukan penanda aras sains yang lebih sukar, asli dan bermakna, FrontierScience menyediakan satu langkah ke hadapan dalam arah ini.

Apa yang diukur oleh FrontierScience dan bagaimana kami membinanya

Penilaian penuh FrontierScience merangkumi lebih daripada 700 soalan teks (dengan 160 dalam set emas) yang meliputi subbidang dalam fizik, kimia dan biologi. Penanda aras ini terdiri daripada Sukan Olimpik dan pecahan Penyelidikan. Sukan Olimpik FrontierScience mengandungi 100 soalan yang direka oleh pemenang pingat sukan olimpik antarabangsa untuk menilai penaakulan saintifik dalam kekangan format jawapan pendek. Set Sukan Olimpik direka bentuk untuk mengandungi soalan teori yang sekurang-kurangnya sama sukar dengan masalah di pertandingan sukan olimpik antarabangsa. Penyelidikan FrontierScience terdiri daripada 60 subtugas penyelidikan asal yang direka oleh saintis PhD (calon doktor, profesor atau penyelidik pasca kedoktoran) yang digred menggunakan rubrik 10 mata. Set Penyelidikan cipta untuk mengandungi subtugas berbilang kekangan yang berdiri sendiri pada tahap kesukaran yang mungkin dihadapi oleh seorang saintis PhD semasa penyelidikan mereka.

Soalan contoh

B1 reacts with aqueous bromine (Br2) to form B2. B2 reacts with potassium nitrite (KNO2) to form B3. B3 is nitrated in nitric acid (HNO3) and sulfuric acid (H2SO4) to form B4.

  • B1 contains a monosubstituted aromatic 5-membered heterocycle and has a molar mass of 96.08 g/mol. It may be produced by dehydrating 5-carbon sugars (e.g. xylose) in an acid catalyst.
  • B2 has the molecular formula C4H2Br2O3 and contains a tetrasubstituted alkene with 2 substituents being bromines cis to each other.
  • B3 is a dipotassium salt with a molar mass of 269.27 g/mol. It contains 1 hydrogen.
  • B4 is an achiral pseudohalogen dimer with 2 carbons, no hydrogens and a molar mass of 300. g/mol.

When B4 decomposes in solution, it forms an intermediate B5 and 1 equivalent of dinitrogen tetroxide (N2O4) as a side product. Intermediate B5 can be trapped and detected as a Diels-Alder adduct.

Provide the structures of B1, B2, B3, B4, and B5 in the following format, "B1: X; B2: X; B3: X; B4: X; B5: X".

Setiap tugas dalam FrontierScience ditulis dan disahkan oleh pakar domain dalam fizik, kimia atau biologi. Untuk set Sukan Olimpik, semua pakar dianugerahkan pingat dalam sekurang-kurangnya satu (dan sering kali pelbagai) pertandingan sukan olimpik antarabangsa. Untuk set Penyelidikan, semua pakar memiliki ijazah PhD yang relevan.

Soalan Sukan Olimpik telah dicipta dengan kerjasama 42 bekas pemenang pingat antarabangsa atau jurulatih pasukan kebangsaan dalam domain yang relevan, dengan jumlah keseluruhan 109 pingat sukan olimpik. Soalan penyelidikan telah cipta dengan kerjasama 45 saintis dan pakar domain yang berkelayakan. Semua saintis sama ada calon kedoktoran, penyelidik pasca kedoktoran atau profesor. Bidang kepakaran mereka merangkumi pelbagai disiplin saintifik yang khusus dan penting, daripada elektrodinamik kuantum kepada kimia organik sintetik kepada biologi evolusi.

Proses penciptaan tugas untuk kedua-dua set termasuk beberapa pemilihan terhadap model dalaman OpenAI (contohnya, membuang tugas yang berjaya diselesaikan oleh model, jadi kami menjangkakan penilaian ini agak berat sebelah terhadap model ini berbanding yang lain). Kami membuka sumber set emas Sukan Olimpik yang mengandungi 100 soalan dan set emas Penyelidikan yang mengandungi 60 soalan, sambil menyimpan soalan-soalan lain untuk mengesan pencemaran.

Carta aliran menunjukkan empat peringkat dalam saluran pembangunan tugas—Penciptaan, Semakan, Penyelesaian dan Semakan semula—dengan penerangan ringkas bagi setiap langkah dan tanda semak untuk kriteria berfakta, boleh digred, objektif dan sukar.

Tugas melalui empat peringkat: Penciptaan, Semakan, Penyelesaian, Semakan. Pakar bebas menyemak tugas antara satu sama lain untuk mengesahkan ia selaras dengan kriteria.

Bagaimana kami menilai prestasi model

Set Sukan Olimpik boleh digred dengan jawapan ringkas: sama ada dengan nombor, ungkapan atau padanan rentetan kabur, yang membantu dalam mengesahkan ketepatan. Namun, pengesahan ini sering mengorbankan ekspresiviti dan keterbukaan masalah tersebut. Untuk set Penyelidikan, kami memperkenalkan seni bina berasaskan rubrik untuk menilai tugas yang lebih terbuka. Setiap soalan mengandungi rubrik skor dengan pelbagai item yang boleh dinilai secara bebas dan objektif, berjumlah keseluruhan 10 mata. Rubrik gred menilai bukan sahaja ketepatan jawapan akhir, tetapi juga ketepatan langkah penaakulan perantaraan, membolehkan analisis prestasi dan kegagalan model yang lebih terperinci. Satu penyelesaian dianggap "betul" jika ia diberikan sekurang-kurangnya 7/10 mata rubrik.

Tindak balas dinilai mengikut penggred berasaskan model (GPT‑5) berdasarkan jawapan ringkas atau kriteria rubrik. Walaupun kami lebih suka menggunakan pakar manusia untuk memberikan gred setiap tindak balas, pendekatan ini tidak dapat diskalakan, jadi kami telah mereka bentuk rubrik yang boleh diperiksa menggunakan penggred model. Kami membangunkan saluran pengesahan untuk memastikan rubrik dan soalan ditentukur dengan baik dari segi tahap kesukaran dan ketepatan.

Sample chemistry research problem

Phthalocyanines are important macrocyclic compounds widely utilized in material and life sciences due to their outstanding physicochemical properties, including intense absorption in the visible-near-IR region and high electron-accepting ability. However, unlike porphyrins, the structural diversity of phthalocyanines has been limited by traditional synthetic methods that rely on one-step condensation of isoindoline units. The development of methodologies that allow controlled modification of the phthalocyanine framework, particularly at the meso-positions, represents a significant advancement in expanding the structural and electronic diversity of these compounds.

Analyze how the modification of meso-nitrogen atoms in nickel(II) phthalocyanine affects the electronic structure, aromaticity, spectroscopic properties, and reactivity of the resulting macrocycles. Explain the synthetic methodology that enables these modifications, the relationship between π-electron count and observed properties, and how these systems compare to traditional phthalocyanines and related porphyrinoids.

Sample response

1. Introduction: Why Modify the meso-Nitrogens of Phthalocyanines?

Phthalocyanines (Pc) are a class of macrocyclic dyes known for their remarkable chemical, electronic, and optical properties. Their widespread use in materials science, catalysis, and biology stems from strong absorptions in the visible/near-IR regions, exceptional redox characteristics (i.e., high electron affinity), and rigid π-conjugation. Traditional synthetic methods, however, typically form the macrocycle in a single step from phthalonitrile or isoindoline precursors, restricting the ability to introduce substitutions selectively at key ring positions-especially the "meso" (bridging) nitrogens. Recently, methodologies allowing targeted modification of the meso-nitrogen atoms in Ni(II) phthalocyanines have emerged as a powerful means to expand the structural and electronic diversity of these macrocycles.

2. Effect on Electronic Structure and Aromaticity

  1. π-Electron Count and Ring Currents

    Phthalocyanines are classical 18-electron aromatic systems, conferring high stability and planarity. Altering the meso-nitrogens through substitution or ring expansion can shift the effective π-electron count. For example, introducing additional unsaturated moieties or heteroatoms may expand the cyclic conjugation to 20 or 22 electrons, moving the molecule between Hückel aromaticity and other regimes that affect ring currents and magnetic properties.

  2. Charge Distribution and Frontier Orbitals

    Meso-substitution can tune the electron density distribution around the macrocycle. Electron-donating groups can push electron density toward the ring center, lowering the energy of the lowest unoccupied molecular orbital (LUMO). Electron-withdrawing groups, conversely, stabilize the highest occupied molecular orbital (HOMO) and shift redox potentials toward more positive values, altering both the electrochemical profile and the Q- and B-band positions in the UV-vis spectrum.

3. Spectroscopic Consequences

  1. UV-Vis Absorption (Q and B Bands)

    The principal absorption features of phthalocyanines lie in the visible (Q-band, typically 600-700 nm) and near-UV (B-band, typically 300-400 nm).

    Substitution that expands the ring conjugation or introduces strong electron-donating/withdrawing groups can:

    • Shift the Q-band to longer wavelengths (bathochromic shift), reaching into the near-IR, which is highly desirable for optoelectronic and photodynamic applications.
    • Alter relative intensities of these bands and merge or split them, reflecting changes in orbital symmetries and energies.
  2. NMR Spectroscopy and Aromatic Ring Currents

    Modifications to the π-electron count and distribution are directly observed in 1H and 13C NMR chemical shifts.

    More highly conjugated (or expanded) aromatic rings exhibit distinct downfield shifts for protons located within induced ring currents, while any partial loss of aromaticity or incorporation of antiaromatic segments can cause atypical shielding/deshielding patterns.

4. Reactivity and Coordination Chemistry

Because phthalocyanines are often used as redox catalysts or sensors, the meso-nitrogen modifications can significantly influence reactivity:

  • Electron-rich meso substituents facilitate nucleophilic or electrophilic attacks at the ring periphery, enabling site-selective functionalizations that are otherwise difficult.

(... shortened for the purposes of this figure)

Sample grading rubric
Analysis of Traditional Phthalocyanine Synthesis Limitations (1 point)
Lulus 1.0 point: Correctly explains that traditional phthalocyanine synthesis involves one-step condensation with simultaneous formation of all meso-nitrogen bridges, providing limited control over substitution patterns at these positions.

0.5 point: Mentions limitations of traditional methods but without specific focus on meso-position control challenges.

0.0 point: Fails to identify key limitations of traditional synthetic approaches or provides incorrect analysis.

Thiolate-Mediated Tetramerization Process (1 point)

1.0 point: Correctly describes the thiolate-mediated reductive tetramerization and explains how counter cation size (K+ or Cs+ vs. Na+) affects selectivity between tetramer formation and direct macrocyclization.

0.5 point: Mentions thiolate-mediated tetramerization but without explaining factors controlling selectivity.

Gagal 0.0 point: Incorrectly describes the oligomerization process or omits critical details about selectivity control.
Analysis of NMR Spectroscopic Features (1 point)

1.0 point: Correctly explains that upfield shifts in the 16π system indicate paratropic ring current (antiaromaticity), contrasts this with the broad signals in 17π systems due to paramagnetism, and connects these observations to the underlying electronic structures.

Lulus 0.5 point: Identifies basic NMR patterns but without clear connection to ring currents or electronic structure.

0.0 point: Incorrectly interprets NMR data or fails to connect spectral features to electronic properties.

Electrochemical Property Analysis (1 point)

1.0 point: Correctly explains that the 16π system shows two reversible reductions reflecting conversion to 17π radical and 18π aromatic states, while 17π systems show narrow redox gaps due to facile interconversion between 16π, 17π, and 18π states, and relates these patterns to the underlying electronic structures.

Lulus 0.5 point: Describes redox patterns without clearly connecting them to specific electronic state changes.

0.0 point: Incorrectly interprets electrochemical data or fails to connect redox behavior to electronic properties.

Analysis of Absorption Spectroscopy (1 point)

1.0 point: Correctly explains that the 16π system shows weak/broad absorption due to symmetry-forbidden HOMO-LUMO transitions in antiaromatic systems, while 17π systems show Q-like bands plus NIR-II absorptions characteristic of radical species, and contrasts these with typical phthalocyanine spectral features.

Lulus 0.5 point: Describes absorption features but provides limited connection to underlying electronic structures.

0.0 point: Incorrectly interprets absorption data or fails to relate spectral features to electronic properties.

Reactivity Analysis of Antiaromatic System (1 point)

1.0 point: Correctly explains the high reactivity of the 16π system toward nucleophiles, details specific reactions with hydroxide (ring opening) and hydrazine (ring expansion), and explains how these transformations relieve antiaromatic destabilization.

0.5 point: Mentions reactivity but provides limited analysis of specific transformations or the driving forces behind them.

Gagal 0.0 point: Incorrectly analyzes reactivity patterns or fails to connect them to the antiaromatic character of the 16π system.

(... and more)

Setiap tugas dalam set penyelidikan diberikan gred menggunakan rubrik yang berjumlah 10 mata dan boleh digunakan oleh pakar atau penggred model. Untuk meningkatkan keupayaan kami menilai model, kami menggunakan model lain untuk tindak balasn gred jawapan.

Prestasi model

Kami menilai beberapa model perintis: GPT‑5.2, Claude Opus 4.5 dan Gemini 3 Pro, GPT‑4o, OpenAI o4-mini, dan OpenAI o3 pada Sukan Olimpik FrontierScience dan Penyelidikan FrontierScience. Semua model penaakulan dinilai pada usaha penaakulan "tinggi" kecuali GPT‑5.2 pada "xhigh". Dalam penilaian awal kami, GPT‑5.2 adalah model berprestasi terbaik kami dalam Sukan Olimpik FrontierScience (dengan skor 77%) dan Penyelidikan (dengan skor 25%), mendahului model-model perintis yang lain. Gemini 3 Pro adalah setanding dengan GPT‑5.2 pada set Sukan Olimpik (dengan skor 76%).

Kami telah melihat kemajuan yang ketara dalam menyelesaikan soalan tahap pakar, terutamanya dalam tugas gaya penyelidikan yang bersifat terbuka. Masih ada ruang untuk berkembang: daripada menganalisis transkrip untuk kegagalan, model perintis kadangkala membuat kesilapan dalam penaakulan, logik dan pengiraan, tidak memahami konsep bidang saintifik dan membuat ketidaktepatan fakta.

Kami membandingkan ketepatan antara beberapa model perintis. GPT‑5.2 ialah model berprestasi tertinggi kami pada Penyelidikan FrontierScience dan set Sukan Olimpik.

Kami membandingkan ketepatan pelbagai usaha penaakulan untuk GPT‑5.2 dan o3. Masa berfikir yang lebih lama untuk menambah baik ketepatan.

Batasan dan langkah seterusnya

Walaupun FrontierScience mewakili satu langkah ke hadapan dalam kesukaran penanda aras saintifik, masih terdapat banyak had. FrontierScience terdiri daripada soalan dengan pernyataan kekangan masalah, yang memfokuskan kepada menilai jawapan akhir (Sukan Olimpik) atau menilai penaakulan untuk menyelesaikan tugas penyelidikan (Penyelidikan). Selain itu, menggunakan rubrik dengan pelbagai komponen pada tugas yang lebih panjang adalah kurang objektif berbanding memeriksa jawapan akhir. 

FrontierScience menawarkan gambar resolusi lebih tinggi tentang penaakulan model terhadap soalan-soalan sukar yang ditulis oleh pakar, tetapi bukan gambaran penuh tentang cara sains diamalkan. Khususnya, ia tidak menilai bahagian penting penyelidikan saintifik: cara model menjana hipotesis baharu yang benar-benar asli atau berinteraksi dengan pelbagai modaliti, termasuk data video dan sistem eksperimen sebenar dalam dunia fizikal.

Melihat ke hadapan, kami menjangkakan kemajuan dalam penaakulan saintifik akan datang daripada kedua-dua sistem penaakulan tujuan umum yang lebih baik dan usaha tertumpu untuk meningkatkan keupayaan saintifik. FrontierScience adalah salah satu di antara banyak alat, dan apabila model ditambah baik, kami merancang untuk mengulangi penanda aras ini, mengembangkannya ke domain baharu dan memasangkannya dengan lebih banyak penilaian dunia sebenar yang melihat apa yang sistem ini sebenarnya membolehkan perkara yang saintis lakukan. Penanda aras seperti FrontierScience membantu kami memahami kelemahan sistem AI masa kini untuk memfokuskan usaha kami dalam menjadikan model sebagai rakan kongsi yang boleh dipercayai dalam penemuan saintifik.