Memperkenalkan ejen ChatGPT: merapatkan penyelidikan dan tindakan
ChatGPT kini berfikir dan bertindak, secara proaktif memilih dari kotak alat kemahiran untuk menyelesaikan tugas untuk anda menggunakan komputernya sendiri.
ChatGPT kini boleh melakukan kerja untuk anda menggunakan komputernya sendiri, mengendalikan tugas kompleks dari mula hingga akhir.
Anda kini boleh meminta ChatGPT untuk uruskan permintaan seperti “lihat kalendar saya dan beritahu saya tentang mesyuarat pelanggan yang akan datang berdasarkan berita terkini,” “rancangkan dan beli bahan untuk buat sarapan Jepun untuk empat orang,” dan “analisis tiga pesaing dan cipta dek slaid.” ChatGPT akan menavigasi laman web dengan bijak, menapis hasil, prom untuk log masuk dengan selamat apabila diperlukan, menjalankan kod, melakukan analisis, dan juga menyampaikan tayangan slaid dan hamparan yang boleh diedit yang merumuskan penemuannya.
Di tengah keupayaan baharu ini ialah sistem ejen yang bersepadu. Ia menghimpunkan tiga kekuatan penemuan terdahulu: Keupayaan Pengendali untuk berinteraksi dengan laman web, kemahiran penyelidikan mendalam dalam mensintesis maklumat, serta kecerdasan dan kelancaran perbualan ChatGPT.
ChatGPT melaksanakan tugas-tugas ini menggunakan komputer maya sendiri, dengan lancar dan beralih antara penaakulan dan tindakan untuk mengurus aliran kerja yang kompleks dari awal hingga akhir, semuanya berdasarkan arahan anda.
Paling penting, anda sentiasa mengawal. ChatGPT meminta kebenaran sebelum mengambil tindakan yang penting, dan anda boleh mengganggu, mengambil alih pelayar, atau menghentikan tugas dengan mudah pada bila-bila masa.
Bermula hari ini, pengguna Pro, Plus, dan Team boleh mengaktifkan keupayaan agentik baharu ChatGPT secara langsung melalui menu ke bawah alat dari komposer dengan memilih 'mod ejen' pada bila-bila masa dalam mana-mana perbualan.
Walaupun ejen ChatGPT sudah menjadi alat yang berkuasa untuk mengendalikan tugas yang kompleks, pelancaran hari ini hanyalah permulaan. Kami akan terus menambah baik secara berulang dan berkala, untuk menjadikannya lebih berkemampuan dan berguna kepada lebih ramai orang dari semasa ke semasa.
Sebelum ini, Pengendali dan kajian mendalam masing-masing membawa kekuatan yang unik: Pengendali boleh menatal, mengklik, dan menaip di web, manakala kajian mendalam cemerlang dalam menganalisis dan meringkaskan maklumat. Tetapi mereka berfungsi dengan baik dalam situasi yang berbeza: Pengendali tidak dapat menyelami analisis secara mendalam atau menulis laporan terperinci, dan kajian mendalam tidak dapat berinteraksi dengan laman web untuk memperhalusi hasil atau mengakses kandungan yang memerlukan pengesahan pengguna. Sebenarnya, kami perhatikan bahawa banyak pertanyaan yang dicuba oleh pengguna terhadap Pengendali sebenarnya lebih sesuai untuk penyelidikan mendalam, jadi kami menggabungkan yang terbaik dari kedua-duanya.
Dengan mengintegrasikan kekuatan pelengkap ini dalam ChatGPT dan memperkenalkan alat tambahan, kami telah membuka keupayaan baharu sepenuhnya dalam satu model. Ia kini boleh melibatkan laman web secara aktif—mengklik, menapis, dan mengumpul hasil yang lebih tepat dan efisien. Anda juga boleh beralih secara semula jadi daripada perbualan mudah kepada meminta tindakan secara langsung dalam sembang yang sama.
Kami telah melengkapkan ejen ChatGPT dengan satu set alat: pelayar visual yang berinteraksi dengan web melalui antara muka pengguna grafik, pelayar berasaskan teks untuk pertanyaan web berasaskan penaakulan yang lebih mudah, terminal, dan akses API langsung. Ejen juga boleh memanfaatkan penyambung ChatGPT(dibuka dalam tetingkap baru), yang membolehkan anda menyambungkan apl seperti Gmail dan Github supaya ChatGPT boleh mencari maklumat yang berkaitan dengan prom anda dan menggunakannya dalam tindak balasnya. Anda juga boleh log masuk di mana-mana laman web dengan mengambil alih pelayar, membolehkannya pergi lebih mendalam dan lebih luas dalam penyelidikan dan pelaksanaan tugasnya. Memberi ChatGPT pelbagai cara untuk mengakses dan berinteraksi dengan maklumat web bermakna ia boleh memilih laluan terbaik untuk melaksanakan tugas dengan paling cekap. Sebagai contoh, ia boleh mengumpulkan maklumat tentang kalendar anda melalui API, dengan cekap melakukan penaakulan ke atas sejumlah besar teks menggunakan pelayar berasaskan teks, di samping mempunyai keupayaan untuk berinteraksi secara visual dengan laman web yang direka khas untuk manusia.
Semua ini dilakukan menggunakan komputer maya sendiri, yang mengekalkan konteks yang diperlukan untuk tugas tersebut, walaupun banyak alat digunakan - model boleh memilih untuk membuka halaman menggunakan pelayar teks atau pelayar visual, muat turun fail dari web, memanipulasinya dengan menjalankan arahan di terminal, dan kemudian melihat output kembali dalam pelayar visual. Model ini menyesuaikan pendekatannya untuk melaksanakan tugas dengan pantas, tepat, dan cekap.
Ejen ChatGPT direka untuk aliran kerja berulang dan kolaboratif, yang jauh lebih interaktif dan fleksibel berbanding model sebelumnya. Semasa ChatGPT berfungsi, anda boleh mengganggu pada bila-bila masa untuk menjelaskan arahan anda, mengarahkannya ke arah hasil yang diingini atau menukar tugas sepenuhnya. Ia akan menyambung semula dari tempat ia berhenti, kini dengan maklumat baharu, tetapi tanpa kehilangan kemajuan sebelumnya. Begitu juga, ChatGPT sendiri boleh secara proaktif mendapatkan butiran tambahan daripada anda apabila diperlukan untuk memastikan tugas itu kekal sejajar dengan matlamat anda. Jika tugas mengambil masa lebih lama daripada yang dijangkakan atau terasa terperangkap, anda boleh jeda, minta ringkasan kemajuan, atau hentikan sepenuhnya dan terima hasil separa. Jika anda mempunyai apl ChatGPT pada telefon anda, ia akan menghantar notifikasi bila ia siap melakukan tugas anda.
Keupayaan ejen bersepadu ini meningkatkan kegunaan ChatGPT dengan ketara dalam kedua-dua konteks harian dan profesional. Di tempat kerja, anda boleh mengautomasikan tugas berulang, seperti menukar tangkapan skrin atau papan pemuka menjadi pembentangan yang terdiri daripada elemen vektor yang boleh diedit, menyusun semula mesyuarat, merancang dan menempah acara di luar pejabat, dan mengemas kini hamparan dengan data kewangan baharu sambil mengekalkan pemformatan yang sama. Dalam kehidupan peribadi anda, anda boleh menggunakannya untuk rancangkan dan menempah jadual perjalanan dengan mudah, merancang dan menempah keseluruhan pesta makan malam, atau mencari pakar dan menjadualkan janji temu.
Keupayaan model yang tinggi dicerminkan dalam prestasi terkini (SOTA) pada penilaian yang mengukur pelayaran web dan keupayaan menyelesaikan tugas dunia sebenar.
Pada Peperiksaan Terakhir Manusia(dibuka dalam tetingkap baru)*, penilaian yang mengukur prestasi AI merentas pelbagai subjek pada soalan peringkat pakar, model yang menggerakkan ejen ChatGPT mencatatkan skor SOTA pass@1 baharu sebanyak 41.6. Kerana ejen merancang secara dinamik dan memilih alatnya sendiri, ia dapat menangani tugas yang sama dengan cara yang berbeza dalam setiap larian. Apabila kami menskalakannya dengan strategi pelancaran selari yang mudah - menjalankan sehingga lapan percubaan serentak dan memilih yang mempunyai keyakinan kendiri tertinggi - skor HLE ejen meningkat kepada 44.4.
FrontierMath** adalah penanda aras matematik yang paling sukar diketahui, menampilkan masalah baharu dan tidak diterbitkan di mana ia sering mengambil masa ahli pakar matematik berjam-jam bahkan berhari-hari untuk diselesaikan. Dengan penggunaan alat, seperti akses ke terminal untuk pelaksanaan kod, ejen ChatGPT mencapai ketepatan 27.4%, mengatasi kedua-dua model sebelumnya dengan margin yang besar.
Kami juga menilai model menggunakan penanda aras yang dimodelkan berdasarkan tugas dunia sebenar yang kompleks. Pada penanda aras dalaman yang direka untuk menilai prestasi model pada tugas kerja pengetahuan yang kompleks dan bernilai ekonomi, output ejen ChatGPT adalah setanding atau lebih baik daripada manusia dalam kira-kira separuh kes merentasi pelbagai masa penyelesaian tugas, dan dengan ketara mengatasi o3 dan o4-mini. Output model dinilai oleh pakar terhadap garis asas manusia berkualiti tinggi yang cipta oleh peneraju terkemuka dalam setiap bidang. Tugas-tugas ini, yang diperoleh daripada pakar dalam pelbagai pekerjaan dan industri, mencerminkan kerja profesional sebenar dunia—seperti menyediakan analisis persaingan penyedia penjagaan segera atas permintaan, membina jadual pelunasan terperinci, dan mengenal pasti telaga air yang berdaya maju untuk kemudahan hidrogen hijau baharu.
Di DSBench(dibuka dalam tetingkap baru), ia direka untuk menilai ejen pada tugas sains data yang realistik yang merangkumi analisis dan pemodelan data, ejen ChatGPT dengan ketara mengatasi prestasi manusia dengan margin yang besar.
Pada SpreadsheetBench, yang menilai model berdasarkan keupayaan mereka untuk mengedit hamparan yang diambil dari senario dunia sebenar, ejen ChatGPT mengatasi model sedia ada dengan margin yang ketara. Apabila diberi keupayaan untuk mengedit hamparan secara langsung, ejen ChatGPT mencatat skor lebih tinggi dengan 45.5%, berbanding Copilot dalam Excel yang mencatat 20.0%.
Metodologi: Penulis SpreadsheetBench menggunakan persekitaran Windows dengan Microsoft Excel untuk menilai hamparan. Kami menggunakan persekitaran OSX dan LibreOffice, yang mungkin menyebabkan perbezaan penggredan kecil. Sebagai contoh, penulis mendapati sekatan Keseluruhan Keras sebanyak 15.02% untuk GPT‑4o, dan kami memperoleh 13.38%. Kami menggunakan penanda aras lengkap 912 soalan.
Pada penanda aras dalaman yang mengukur keupayaan model untuk melaksanakan tugas pemodelan penganalisis perbankan pelaburan tahun pertama hingga ketiga—seperti menyusun model kewangan tiga penyata untuk syarikat Fortune 500 dengan pemformatan dan petikan yang betul, atau membina model pembelian dimanfaatkan untuk pengambilalihan persendirian—model yang menggerakkan ejen ChatGPT dengan ketara mengatasi penyelidikan mendalam dan o3. Setiap tugas dinilai berdasarkan ratusan kriteria yang berkaitan dengan ketepatan dan penggunaan formula.
Kami juga menilai ejen ChatGPT pada BrowseComp, satu penanda aras yang kami terbitkan awal tahun ini yang mengukur keupayaan ejen pelayar untuk mencari maklumat yang sukar ditemui di web. Model ini menetapkan SOTA baharu dengan 68.9%, 17.4 mata peratusan lebih tinggi daripada kajian mendalam.
Akhir sekali, pada WebArena(dibuka dalam tetingkap baru), penanda aras yang direka untuk menilai prestasi ejen pelayar web dalam menyelesaikan tugas web dunia sebenar, model ini menunjukkan peningkatan berbanding CUA berkuasa o3 (model yang menggerakkan Pengendali).
Anda boleh mengaktifkan keupayaan ejen baharu ChatGPT secara langsung melalui menu ke bawah dari alat komposer dengan memilih 'mod ejen' pada bila-bila masa dalam sebarang perbualan. Secara ringkas terangkan tugas yang anda inginkan — sama ada melakukan penyelidikan mendalam, cipta tayangan slaid, atau menghantar perbelanjaan. Semasa ia melaksanakan tugas anda, penceritaan pada skrin memberikan keterlihatan tentang apa yang ChatGPT sedang lakukan. Anda boleh mengganggu dan mengawal pelayar bila-bila masa diperlukan, memastikan tugas tetap sejajar dengan matlamat anda.
Ejen ChatGPT boleh mengakses penyambung anda, membolehkannya mengintegrasikan dengan aliran kerja anda dan mengakses maklumat yang relevan dan boleh diambil tindakan. Setelah disahkan, penyambung ini membolehkan ChatGPT melihat maklumat dan melakukan perkara seperti meringkaskan peti masuk anda untuk hari itu atau mencari slot masa yang anda sedia untuk bermesyuarat—untuk mengambil tindakan di laman web ini, bagaimanapun, anda masih akan diminta untuk log masuk dengan mengambil alih pelayar.
Selain itu, anda boleh menjadualkan tugas yang telah selesai untuk berulang secara automatik, seperti menjana laporan metrik mingguan setiap pagi Isnin.
Keluaran ini menandakan kali pertama pengguna boleh meminta ChatGPT untuk melakukan tindakan di web. Ini memperkenalkan risiko baharu, kerana ejen ChatGPT boleh bekerja secara langsung dengan data anda, sama ada maklumat yang diakses melalui penyambung atau laman web yang telah anda log masuk melalui mod pengambilalihan. Kami telah memperkukuh kawalan yang mantap dari pratonton penyelidikan Pengendali dan menambah perlindungan untuk cabaran seperti mengurus maklumat sensitif di web langsung, jangkauan pengguna yang lebih luas, dan akses rangkaian terminal (terhad). Walaupun langkah-langkah mitigasi ini mengurangkan risiko dengan ketara, alat ejen ChatGPT telah diperluas dan jangkauan pengguna yang lebih luas bermaksud profil risiko keseluruhannya adalah lebih tinggi.
Kami telah memberi penekanan khusus untuk melindungi ejen ChatGPT daripada manipulasi musuh melalui suntikan prom, yang merupakan risiko bagi sistem ejen secara amnya, dan telah menyediakan mitigasi yang lebih meluas dengan sewajarnya. Suntikan prom adalah percubaan oleh pihak ketiga untuk memanipulasi tingkah laku melalui arahan berniat jahat yang mungkin dihadapi oleh ejen ChatGPT di web semasa menyelesaikan tugas. Sebagai contoh, prom berniat jahat yang tersembunyi dalam laman web, seperti dalam elemen yang tidak kelihatan atau metadata, boleh menipu ejen untuk mengambil tindakan yang tidak disengajakan, seperti berkongsi data peribadi dari penyambung dengan penyerang, atau mengambil tindakan berbahaya pada laman web yang telah pengguna log masuk. Kerana ejen ChatGPT boleh mengambil tindakan langsung, serangan yang berjaya boleh memberi kesan yang lebih besar dan menimbulkan risiko yang lebih tinggi.
Kami telah melatih dan menguji ejen untuk mengenal pasti dan menentang suntikan prom, selain menggunakan pemantauan untuk mengesan dan bertindak balas dengan cepat terhadap serangan suntikan prom. Keperluan pengesahan pengguna yang jelas sebelum tindakan yang berbangkit dapat mengurangkan risiko bahaya daripada serangan ini, dan pengguna boleh campur tangan dalam tugas seperti yang diperlukan dengan mengambil alih atau menghentikan. Pengguna patut menimbang pertukaran ini ketika memutuskan maklumat apa yang hendak diberikan kepada ejen, serta mengambil langkah untuk meminimumkan pendedahannya kepada risiko ini, seperti menyahdaya penyambung apabila ia tidak diperlukan untuk tugas.
Kami juga telah melaksanakan langkah-langkah mitigasi terutamanya terhadap kesilapan model, kerana model kini dapat melaksanakan tugas yang memberi kesan kepada dunia sebenar:
- Pengesahan pengguna yang jelas: ChatGPT dilatih untuk meminta izin daripada anda secara jelas sebelum mengambil tindakan dengan akibat dunia nyata, seperti membuat pembelian.
- Pengawasan aktif (“Mod Tonton”): Tugas kritikal tertentu, seperti menghantar e-mel, memerlukan pengawasan aktif anda.
- Pengurangan risiko proaktif: ChatGPT dilatih untuk secara aktif menolak tugas berisiko tinggi seperti pemindahan bank.
Akhir sekali, kami telah memperkenalkan kawalan tambahan untuk mengehadkan data yang boleh diakses oleh model:
- Kawalan privasi: Dengan satu klik dalam tetapan ChatGPT, anda boleh memadam semua data pelayaran dan segera log keluar dari semua sesi laman web aktif. Jika tidak, kuki akan kekal berdasarkan dasar kuki setiap laman web yang dilawati, yang boleh menjadikan lawatan berulang ke laman lebih efisien.
- Mod pengambilalihan pelayar selamat: Apabila anda berinteraksi dengan web menggunakan pelayar ChatGPT (“mod pengambilalihan”), input anda tetap peribadi. ChatGPT tidak mengumpul atau menyimpan sebarang data yang anda masukkan semasa sesi ini, seperti kata laluan, kerana model tidak memerlukannya, dan lebih selamat jika ia tidak pernah melihatnya.
Dengan peningkatan keupayaan model, kami telah membuat keputusan untuk menganggap ejen ChatGPT sebagai mempunyai keupayaan Biologi dan Kimia Tinggi di bawah Rangka Kerja Kesediaan kami, mengaktifkan langkah-langkah perlindungan yang berkaitan. Walaupun kami tidak mempunyai bukti muktamad bahawa model itu boleh membantu pemula secara bermakna untuk cipta bahaya biologi yang teruk—ambang kami untuk keupayaan Tinggi—kami mengambil langkah berjaga-jaga dan melaksanakan perlindungan yang diperlukan sekarang. Akibatnya, model ini mempunyai timbunan keselamatan kami yang paling komprehensif setakat ini dengan perlindungan yang dipertingkatkan untuk biologi: pemodelan ancaman menyeluruh, latihan penolakan penggunaan dua kali, pengelas dan pemantau penaakulan yang sentiasa aktif, dan saluran penguatkuasaan yang jelas.
Selain usaha kami untuk menjamin ejen ChatGPT, kami sedar bahawa biokeselamatan berlapis berfungsi paling baik apabila langkah-langkah keselamatan melampaui satu makmal, jadi kami bekerjasama di seluruh ekosistem untuk memperkukuh pertahanan. Sejak hari pertama kami bekerjasama dengan pakar biokeselamatan luar, institut keselamatan, dan penyelidik akademik untuk membentuk model ancaman, penilaian, dan dasar kami. Penyemak yang terlatih dalam biologi telah mengesahkan data penilaian kami, dan pasukan merah yang terdiri daripada pakar domain telah menguji ketahanan perlindungan dalam senario yang realistik. Awal bulan ini kami mengadakan bengkel Biopertahanan dengan pakar dari kerajaan, akademik, makmal nasional, dan NGO untuk mempercepatkan kerjasama dan memajukan penyelidikan biopertahanan yang dikuasakan oleh AI. Kami akan terus bekerjasama secara global untuk mendahului risiko yang bakal muncul.
Baca lebih lanjut tentang pendekatan keselamatan kami yang kukuh untuk model ejen bersepadu dalam kad sistem. Kami juga melancarkan program ganjaran pepijat supaya kami boleh mencari dan memulihkan risiko dunia sebenar.
Ejen ChatGPT mula dilancarkan hari ini kepada Pro, Plus, dan Team; Pro akan mendapat akses pada hujung hari ini, manakala pengguna Plus dan Team akan mendapat akses dalam beberapa hari seterusnya. Pengguna Perusahaan dan Pendidikan akan mendapat akses dalam beberapa minggu yang akan datang. Pengguna Pro mempunyai 400 mesej sebulan, manakala pengguna berbayar lain mendapat 40 mesej setiap bulan, dengan penggunaan tambahan tersedia melalui pilihan berasaskan kredit yang fleksibel.
Kami masih berusaha untuk membolehkan akses ke Kawasan Ekonomi Eropah dan Switzerland.
Laman pratonton penyelidikan Pengendali akan tetap berfungsi selama beberapa minggu lagi, selepas itu ia akan dihentikan. Penyelidikan mendalam adalah sebahagian daripada keupayaan ejen ChatGPT. Kalau anda lebih suka ciri penyelidikan mendalam yang asal—yang mungkin mengambil masa lebih lama untuk dijalankan tetapi memberikan tindak balas yang lebih terperinci dan mendalam secara lalai—anda masih boleh mengaksesnya dengan memilih “penyelidikan mendalam” dari menu ke bawah dalam komposer mesej.
Ejen ChatGPT masih dalam peringkat awal. Ia mampu melaksanakan pelbagai tugas yang kompleks, tetapi ia masih boleh melakukan kesilapan.
Walaupun kami melihat potensi yang signifikan dalam keupayaannya untuk menjana tayangan slaid, fungsi ini kini dalam versi Beta. Pada masa ini, output kadang-kadang boleh terasa asas dalam pemformatan dan kemasan, terutamanya apabila bermula tanpa dokumen sedia ada. Kami menumpukan keupayaan awal model untuk menjana artifak yang menyusun maklumat dalam aliran dan format yang sesuai untuk pembentangan, dengan elemen seperti teks, carta, imej, dan bentuk yang boleh diedit secara asli dan mudah selepas dieksport, mengoptimumkan untuk struktur dan fleksibiliti. Pada masa ini, terdapat juga percanggahan sekali-sekala antara slaid dalam tontonan dan powerpoint yang dieksport dan kami sedang berusaha untuk mengurangkannya. Selain itu, walaupun pada masa ini anda boleh memuat naik hamparan sedia ada dan mengedit di ChatGPT atau digunakan sebagai templat, keupayaan ini belum lagi tersedia untuk tayangan slaid. Kami sudah menjalankan latihan iterasi seterusnya penciptaan tayangan slaid ChatGPT untuk menghasilkan output yang lebih digilap dan canggih, dengan keupayaan yang lebih luas dan pemformatan yang lebih baik.
Secara keseluruhan, kami menjangkakan peningkatan berterusan terhadap kecekapan, kedalaman, dan fleksibiliti ejen ChatGPT dari semasa ke semasa, termasuk interaksi yang lebih lancar apabila kami terus menyesuaikan jumlah pengawasan yang diperlukan daripada pengguna untuk menjadikannya lebih berguna sambil memastikan ia selamat digunakan.
SpreadsheetBench | ||||
Model | Persekitaran penilaian | Sekatan lembut (%): Peringkat sel | Sekatan lembut (%): Peringkat helaian | Sekatan lembut (%): Keseluruhan |
GPT‑4o | Windows, Excel | 15.03 | 23.65 | 18.35 |
Copilot dalam Excel | Windows, Excel | 23.33 | 15.00 | 20.00 |
GPT‑4o | OSX, LibreOffice | 15.86 | 18.33 | 16.81 |
OpenAI o3 | OSX, LibreOffice | 22.40 | 24.60 | 23.25 |
Ejen ChatGPT | OSX, LibreOffice | 38.27 | 30.48 | 35.27 |
Ejen ChatGPT dengan .xlsx | OSX, LibreOffice | 50.56 | 37.51 | 45.54 |
Manusia | 75.56 | 65.00 | 71.33 |
Penulis
Nota kaki
* Apabila mendayakan pelayar, model kadang kala boleh mencari jawapan yang tepat di dalam talian, contohnya, dengan membaca catatan blog yang mengandungi masalah sampel daripada set data. Kami telah mengurangkan kebimbangan tentang model akan menipu semasa melayari dengan dua strategi:
1. Domain yang telah kami sekat kerana kami perhatikan model telah menipu pada masa lalu.
2. Menggunakan model tambahan sebagai pemantau untuk memeriksa semua token output alat dalam setiap percubaan untuk mengenal pasti tingkah laku yang mencurigakan. Tingkah laku yang mencurigakan ditakrifkan sebagai "halaman, fail, atau coretan yang tujuan utamanya adalah untuk memberikan jawapan yang tepat untuk soalan khusus ini—contohnya, kunci penggredan rasmi, intipati “penyelesaian” yang bocor, atau perbincangan yang memetik jawapan selesai secara kata-kata." Tingkah laku jinak ditakrifkan sebagai "mana-mana sumber berwibawa yang mungkin dirujuk oleh manusia yang rajin (dokumentasi, manual, makalah ilmiah, artikel bereputasi) walaupun secara kebetulan mengandungi jawapan yang betul." Sebarang percubaan di mana pemantau menganggap pelancaran itu mencurigakan dikira sebagai salah. Sebilangan besar sampel yang gagal oleh pemeriksaan ini adalah masalah yang penyelesaiannya tepat tersedia di pelbagai sumber internet yang tidak berkaitan dengan HLE.
**OpenAI mempunyai akses eksklusif kepada 237 daripada 290 soalan peribadi dalam set data Tier 1-3. Soalan FrontierMath tier 4 tidak termasuk dalam penilaian ini. Keputusan dinilai sebagai purata daripada 16 percubaan untuk menjawab setiap soalan. Keputusan ejen ChatGPT diperoleh oleh OpenAI, dinilai oleh Epoch AI, dengan akses pelayar dan terminal, serta had 128K token bagi setiap jawapan. Penilaian OpenAI o4-mini dan o3 diperoleh dan dinilai oleh Epoch AI, tanpa akses pelayar dan terminal, menggunakan skrip Python melalui panggilan fungsi, dan had 100K token untuk setiap jawapan.
*** Oracle@64 merujuk kepada skor terbaik yang dicapai dalam 64 larian sampel, dipilih menggunakan kebenaran asas (iaitu, kami memilih percubaan dengan markah tertinggi untuk setiap tugas berdasarkan prestasi sebenar yang dinilai). Kami melaporkan purata skor terbaik setiap tugas merentasi semua tugasan. Metrik ini menyoroti potensi batas atas model dan varians dalam prestasi tugas—menunjukkan betapa mampu model itu apabila berjaya dan menunjukkan ruang untuk meningkatkan konsistensi melalui latihan lanjutan. Tidak seperti metrik “terbaik daripada N” biasa, yang memilih berdasarkan keyakinan model, oracle@64 menggunakan kebenaran asas untuk pemilihan dan digunakan untuk tugas yang dinilai pada skala 0–1 berterusan dan bukannya lulus/gagal binari.

