Penyerahan First Proof kami
Kami berkongsi percubaan pembuktian kami untuk First Proof, satu cabaran matematik yang menguji sama ada AI boleh menghasilkan bukti yang boleh disemak untuk masalah khusus domain.
Kami menjalankan model dalaman pada kesemua 10 masalah First Proof(dibuka dalam tetingkap baru), satu cabaran matematik peringkat penyelidikan yang direka untuk menguji sama ada sistem AI boleh menghasilkan percubaan pembuktian yang betul dan boleh disemak. Tidak seperti matematik jawapan ringkas atau gaya pertandingan, masalah ini memerlukan pembinaan hujah menyeluruh dalam domain khusus, dan ketepatan sukar ditentukan tanpa semakan pakar. Para penulis masalah First Proof adalah pakar terkemuka dalam bidang masing-masing, dan sekurang-kurangnya beberapa masalah tersebut kekal terbuka selama bertahun-tahun sebelum para penulis menemui penyelesaian. Sebuah jabatan akademik yang mempunyai pertindihan ketara dengan bidang subjek mungkin dapat menyelesaikan banyak masalah dalam seminggu.
Kami kongsikan(dibuka dalam tetingkap baru) percubaan pembuktian kami pada Sabtu, 14 Februari 2026 pada 12:00 PG PT. Berdasarkan maklum balas daripada pakar, kami percaya sekurang-kurangnya lima daripada percubaan pembuktian model (masalah 4, 5, 6, 9, dan 10) mempunyai peluang tinggi untuk betul, dan beberapa yang lain masih dalam semakan. Kami pada mulanya percaya bahawa percubaan kami untuk masalah 2 mungkin betul. Berdasarkan ulasan rasmi First Proof dan analisis lanjut oleh komuniti, kami kini percaya bahawa ia adalah salah. Kami berterima kasih atas penglibatan tersebut dan menantikan semakan yang berterusan. Set lengkap percubaan pembuktian kami boleh didapati di sini(dibuka dalam tetingkap baru). Pracetak ini merangkumi kesemua sepuluh percubaan pembuktian, serta lampiran yang baharu ditambah dengan corak prom dan contoh yang bertujuan untuk mensimulasikan interaksi manual kami dengan model semasa proses tersebut.
Kami percaya penyelidikan perbatasan yang baharu mungkin merupakan cara yang paling penting untuk menilai keupayaan model AI generasi seterusnya. Penanda aras berguna, tetapi ia boleh terlepas beberapa bahagian paling sukar dalam penyelidikan: mengekalkan rantaian penaakulan yang panjang, memilih pengabstrakan yang tepat, menangani kekaburan dalam pernyataan masalah, dan menghasilkan hujah yang mampu bertahan daripada penelitian pakar. Cabaran perbatasan seperti First Proof membantu kami menguji ketahanan keupayaan tersebut dalam situasi di mana ketepatan sukar untuk disahkan dan mod kegagalan memberikan maklumat yang berguna.
“Kami sedang melatih model baharu yang tumpuan utamanya adalah untuk meningkatkan tahap ketelitian dalam pemikirannya, dengan matlamat agar model itu boleh berfikir secara berterusan selama berjam-jam dan kekal yakin dengan kesimpulannya. Apabila masalah First Proof diumumkan, ia kelihatan seperti medan ujian yang sempurna, jadi pada hujung minggu saya mencubanya. Ia sudah dapat menyelesaikan dua daripada masalah tersebut (#9 dan #10). Semakin ia dilatih, ia menjadi semakin berkebolehan, akhirnya menyelesaikan–mengikut anggaran kami–sekurang-kurangnya tiga lagi. Kami amat gembira apabila ia menyelesaikan #6 dan kemudian, dua hari kemudian, #4, kerana masalah tersebut adalah daripada bidang yang biasa bagi ramai di antara kami. "Memang cukup menakjubkan untuk melihat model menjadi lebih pintar secara nyata dari hari ke hari.”
– James R. Lee (Penyelidik OpenAI, Penaakulan)
Kami menjalankan model dengan pengawasan manusia yang terhad. Apabila mengemukakan versi-versi model semasa latihan, kami kadang-kadang mencadangkan strategi mencuba semula yang kelihatan berkesan dalam percubaan terdahulu. Untuk beberapa percubaan, kami meminta model untuk mengembangkan atau menjelaskan bahagian-bahagian bukti selepas menerima maklum balas pakar, bagi memudahkan pengesahan penaakulan. Kami juga memudahkan pertukaran maklumat antara model ini dan ChatGPT untuk pengesahan, pemformatan, dan gaya. Untuk beberapa masalah, kami mempersembahkan yang terbaik daripada beberapa percubaan, dipilih berdasarkan penilaian manusia. Ini adalah pecutan yang pantas, dan proses kami tidak sebersih yang kami harapkan dalam penilaian yang dikawal dengan baik. Kami berharap untuk berbincang dengan penganjur First Proof mengenai rangka kerja eksperimen dan penilaian yang lebih ketat untuk iterasi masa depan.
Kerja ini dibina berdasarkan hasil terdahulu daripada model penaakulan perbatasan dalam matematik dan sains. Pada Julai 2025, kami mencapai prestasi tahap pingat emas(dibuka dalam tetingkap baru) dalam Olimpik Matematik Antarabangsa dengan model penaakulan serba guna (35/42 mata). Pada November 2025, kami berkongsi “Eksperimen Awal dalam Mempercepatkan Sains dengan GPT‑5”, satu set kajian kes di mana GPT‑5 membantu penyelidik mencapai kemajuan konkrit dalam bidang matematik, fizik, biologi, dan bidang lain, bersama dengan batasan yang kami perhatikan. Dan yang paling terkini, kami melaporkan satu kerjasama fizik di mana GPT‑5.2 mencadangkan ungkapan calon untuk formula amplitud gluon yang kemudian dibuktikan secara formal oleh model dalaman dan disahkan oleh penulis.
Kami berharap untuk penglibatan yang lebih mendalam dengan komuniti tentang cara menilai penaakulan bertaraf penyelidikan, termasuk maklum balas pakar mengenai usaha ini, dan kami teruja untuk menjadikan keupayaan baharu ini tersedia dalam model awam pada masa hadapan.


