Mengukur prestasi model kami dalam tugas dunia sebenar
Kami memperkenalkan GDPval, satu penilaian baharu yang mengukur prestasi model pada tugas dunia sebenar yang bernilai ekonomi merentasi 44 jenis pekerjaan.
Misi kami adalah untuk memastikan kecerdasan am buatan memberikan manfaat kepada seluruh umat manusia. Sebagai sebahagian daripada misi kami, kami ingin berkomunikasi secara telus tentang kemajuan bagaimana model AI boleh membantu orang ramai dalam dunia sebenar. Itulah sebabnya kami memperkenalkan GDPval: satu penilaian baharu yang direka untuk membantu kami menjejaki sejauh mana model kami dan model lain berprestasi dalam tugas dunia sebenar yang bernilai dari segi ekonomi. Kami panggil penilaian ini GDPval kerana kami bermula dengan konsep Keluaran Dalam Negara Kasar (GDP) sebagai penunjuk ekonomi utama dan mengambil tugas daripada pekerjaan utama dalam industri yang paling banyak menyumbang kepada GDP.
Orang ramai sering berspekulasi tentang kesan AI yang lebih luas terhadap masyarakat, tetapi cara paling jelas untuk memahami potensinya adalah dengan melihat apa yang model sudah mampu lakukan. Sejarah menunjukkan bahawa teknologi utama—daripada Internet kepada telefon pintar—mengambil masa lebih daripada satu dekad untuk beralih daripada penciptaan kepada penggunaan meluas. Penilaian seperti GDPval membantu memantapkan perbualan tentang penambahbaikan AI masa depan berdasarkan bukti dan bukannya tekaan, dan boleh membantu kami menjejaki penambahbaikan model dari semasa ke semasa.
Penilaian AI sebelum ini seperti ujian akademik yang mencabar dan cabaran pengekodan kompetitif telah menjadi penting dalam mendorong batas keupayaan penaakulan model, tetapi sering kali tidak memenuhi jenis tugas yang ditangani oleh ramai orang dalam kerja harian mereka.
Untuk merapatkan jurang ini, kami telah membangunkan penilaian yang mengukur keupayaan yang semakin realistik dan relevan dari segi ekonomi. Perkembangan ini telah bergerak dari penanda aras akademik klasik seperti MMLU (soalan gaya peperiksaan merentasi berpuluh-puluh subjek), kepada penilaian yang lebih diterapkan seperti SWE-Bench (tugas pembetulan pepijat kejuruteraan perisian), MLE-Bench (tugas kejuruteraan pembelajaran mesin seperti latihan model dan analisis), dan Paper-Bench (penaakulan saintifik dan kritikan terhadap kertas penyelidikan), dan baru-baru ini kepada penilaian berasaskan pasaran seperti SWE-Lancer (projek kejuruteraan perisian bebas berdasarkan pembayaran sebenar).
GDPval adalah langkah seterusnya dalam perkembangan itu. Ia mengukur prestasi model pada tugas yang diambil terus daripada kerja pengetahuan dunia sebenar oleh profesional berpengalaman merentasi pelbagai pekerjaan dan sektor, memberikan gambaran yang lebih jelas tentang bagaimana model berprestasi dalam tugas yang bernilai ekonomi. Menilai model pada tugas pekerjaan yang realistik membantu kami memahami bukan sahaja sejauh mana prestasi ia di makmal, tetapi juga bagaimana ia mungkin memberikan sokongan kepada orang dalam kerja yang ia lakukan setiap hari.
GDPval, versi pertama penilaian ini, merangkumi 44 pekerjaan yang dipilih daripada 9 industri teratas yang menyumbang kepada KDNK AS. Set penuh GDPval merangkumi 1,320 tugas khusus (220 dalam set sumber terbuka emas), setiap satu direka dan disemak dengan teliti oleh profesional berpengalaman dengan purata lebih daripada 14 tahun pengalaman dalam bidang ini. Tugas adalah berdasarkan produk kerja sebenar, seperti ringkasan undang-undang, pelan biru kejuruteraan, perbualan sokongan pelanggan, atau pelan penjagaan kejururawatan.
GDPval menonjol dalam realisme dan kepelbagaian tugas yang dinilai. Tidak seperti penilaian lain yang berkaitan dengan nilai ekonomi yang menumpukan pada domain tertentu (contohnya, SWE-Lancer), GDPval merangkumi pelbagai tugas dan pekerjaan. Dan tidak seperti penanda aras yang melibatkan cipta tugas secara sintetik dalam gaya peperiksaan atau ujian akademik (contohnya, Peperiksaan Terakhir Manusia atau MMLU), GDPval memberi tumpuan kepada tugas berdasarkan hasil kerja yang sama ada merupakan hasil kerja sebenar atau produk yang wujud hari ini atau merupakan hasil kerja yang dibina dengan cara yang serupa.
Tidak seperti penanda aras tradisional, tugas GDPval bukanlah prom teks yang mudah. Ia disertakan dengan fail rujukan dan konteks, dan hasil yang dijangka termasuk dokumen, slaid, diagram, hamparan, dan multimedia. Realisme ini menjadikan GDPval sebagai ujian yang lebih realistik tentang bagaimana model mungkin memberikan sokongan kepada para profesional.
GDPval adalah langkah awal yang tidak sepenuhnya mencerminkan nuansa pelbagai tugas ekonomi. Walaupun ia merangkumi 44 pekerjaan dan ratusan tugas kerja pengetahuan, ia terhad kepada penilaian satu kali, jadi ia tidak dapat menangkap kes di mana model perlu membina konteks atau memperbaiki melalui pelbagai draf. Versi masa depan akan diperluaskan kepada aliran kerja yang lebih interaktif dan tugas yang kaya dengan konteks untuk lebih mencerminkan kerumitan kerja pengetahuan dunia sebenar (lihat lebih lanjut dalam bahagian Keterbatasan kami di bawah).
GDPval merangkumi tugas merentas 9 industri dan 44 pekerjaan, dan versi masa depan akan teruskan memperluaskan liputan. 9 industri awal dipilih berdasarkan sumbangan mereka melebihi 5% kepada KDNK A.S., seperti yang ditentukan oleh data dari Federal Reserve Bank of St. Louis. Kemudian, kami memilih 5 pekerjaan dalam setiap industri yang menyumbang paling banyak kepada jumlah gaji dan pampasan dan kebanyakannya adalah pekerjaan berasaskan pengetahuan, menggunakan data gaji dan pekerjaan dari laporan pekerjaan Biro Statistik Buruh AS (BLS) Mei 2024(dibuka dalam tetingkap baru). Untuk menentukan sama ada pekerjaan tersebut kebanyakannya adalah kerja pengetahuan, kami menggunakan data tugas dari O*NET(dibuka dalam tetingkap baru), sebuah pangkalan data maklumat pekerjaan A.S. yang ditaja oleh Jabatan Buruh A.S. Kami mengklasifikasikan sama ada setiap tugas untuk setiap pekerjaan dalam O*NET adalah kerja pengetahuan atau kerja fizikal/buruh manual (memerlukan tindakan diambil dalam dunia fizikal). Sesuatu pekerjaan diklasifikasikan secara keseluruhan sebagai "kerja pengetahuan yang dominan" jika sekurang-kurangnya 60% daripada tugas komponennya diklasifikasikan sebagai tidak melibatkan kerja fizikal atau kerja manual. Kami memilih ambang 60% ini sebagai titik permulaan untuk versi pertama GDPval, dengan menumpukan perhatian kepada pekerjaan di mana AI boleh memberi kesan terbesar terhadap produktiviti dunia sebenar.
Proses ini menghasilkan 44 jawatan untuk dimasukkan.
Hartanah, penyewaan, dan pajakan
Pekerja rencam
Pengurus hartanah, pengurusan hartanah, dan persatuan komuniti
Ejen jualan hartanah
Ejen hartanah
Kerani kaunter dan kerani sewa
Kerajaan
Pekerja rekreasi
Pegawai Pematuhan
Penyelia barisan hadapan polis dan penyiasat
Pengurus perkhidmatan pentadbiran
Pekerja sosial kanak-kanak, keluarga, dan sekolah
Pembuatan
Jurutera mekanikal
Jurutera Perindustrian
Pembeli dan ejen pembelian
Kerani penghantaran, penerimaan, dan inventori
Penyelia barisan hadapan pekerja pengeluaran dan operasi
Perkhidmatan profesional, saintifik, dan teknikal
Pembangun perisian
Peguam
Akauntan dan juruaudit
Pengurus sistem komputer dan sistem maklumat
Pakar pengurusan projek
Penjagaan kesihatan dan bantuan sosial
Jururawat berdaftar
Pengamal jururawat
Pengurus perkhidmatan perubatan dan kesihatan
Penyelia barisan hadapan bagi pekerja sokongan pejabat dan pentadbiran
Setiausaha perubatan dan pembantu pentadbiran
Kewangan dan insurans
Wakil Perkhidmatan Pelanggan
Penganalisis kewangan dan pelaburan
Pengurus Kewangan
Penasihat kewangan peribadi
Ejen jualan sekuriti, komoditi dan perkhidmatan kewangan
Perdagangan runcit
Ahli Farmasi
Penyelia barisan hadapan pekerja jualan runcit
Pengurus am dan operasi
Detektif dan penyiasat persendirian
Perdagangan borong
Pengurus jualan
Kerani pesanan
Penyelia barisan hadapan pekerja jualan bukan runcit
Wakil jualan, borong dan pembuatan, kecuali produk teknikal dan saintifik
Wakil jualan, borong dan pembuatan, produk teknikal dan saintifik
Maklumat
Juruteknik audio dan video
Penerbit dan pengarah
Penganalisis berita, wartawan, dan jurnalis
Penyunting filem dan video
Penyunting
Bagi setiap pekerjaan, kami bekerjasama dengan profesional berpengalaman untuk mencipta tugas yang mencerminkan kerja harian mereka. Para profesional ini mempunyai purata 14 tahun pengalaman, dengan rekod kemajuan yang kuat. Kami dengan sengaja merekrut pelbagai pakar—seperti peguam dari pelbagai bidang amalan dan firma dengan saiz yang berbeza—untuk memaksimumkan keterwakilan.
Setiap tugas melalui proses semakan berbilang langkah untuk memastikan ia mewakili kerja sebenar, boleh dilaksanakan oleh profesional lain, dan jelas untuk dinilai. Secara purata, setiap tugas menerima 5 pusingan semakan pakar, termasuk semakan daripada penulis tugas lain, penyemak pekerjaan tambahan, dan pengesahan berasaskan model.
Set data yang dihasilkan merangkumi 30 tugas yang telah disemak sepenuhnya bagi setiap pekerjaan (set penuh) dengan 5 tugas bagi setiap pekerjaan dalam set emas sumber terbuka kami, menyediakan asas kukuh untuk menilai prestasi model dalam kerja pengetahuan dunia sebenar.
Contoh-contoh tugas GDPval
Prom + konteks tugas
Hasil kerja manusia berpengalaman

Untuk menilai prestasi model pada tugas GDPval, kami bergantung kepada "penggred" pakar—kumpulan profesional berpengalaman dari pekerjaan yang sama yang diwakili dalam set data. Penilai ini membandingkan secara membuta tuli hasil kerja yang dijana oleh model dengan yang dihasilkan oleh penulis tugas (tanpa mengetahui yang mana satu dijana oleh AI atau manusia), dan memberikan kritikan serta penilaian. Penggred kemudian menyusun kedudukan hasil kerja manusia dan AI serta mengklasifikasikan setiap hasil kerja AI sebagai "lebih baik", "sama baik", atau "lebih buruk" berbanding satu sama lain.
Penulis tugas juga mencipta rubrik pemarkahan terperinci untuk pekerjaan mereka, yang menambah konsistensi dan ketelusan kepada proses penggredan. Kami juga membina "penggred automatik", iaitu sistem AI yang dilatih untuk menganggarkan bagaimana pakar manusia akan menilai sesuatu hasil kerja. Dalam erti kata lain, daripada menjalankan semakan pakar penuh setiap kali, penggred automatik boleh dengan cepat meramalkan output yang mungkin lebih disukai orang. Kami melancarkan alat ini melalui evals.openai.com sebagai perkhidmatan penyelidikan eksperimen, tetapi ia belum sehandal penggred pakar, jadi kami tidak menggunakannya untuk menggantikan mereka.
Kami mendapati bahawa model termaju terbaik hari ini sudah menghampiri kualiti kerja yang dihasilkan oleh pakar industri. Untuk menguji ini, kami menjalankan penilaian buta di mana pakar industri membandingkan hasil kerja daripada beberapa model terkemuka—GPT‑4o, o4-mini, OpenAI o3, GPT‑5, Claude Opus 4.1, Gemini 2.5 Pro, dan Grok 4—dengan kerja yang dihasilkan oleh manusia. Di seluruh 220 tugas dalam set emas GDPval, kami merekodkan apabila output model dinilai lebih baik daripada (“menang”) atau setara dengan (“seri”) hasil kerja daripada pakar industri, seperti yang ditunjukkan dalam carta bar di bawah. Claude Opus 4.1 adalah model yang berprestasi terbaik dalam set ini, cemerlang terutamanya dalam estetika (contohnya, pemformatan dokumen, susun atur slaid), dan GPT‑5 cemerlang terutamanya dalam ketepatan (contohnya, mencari pengetahuan khusus domain). Kami juga melihat kemajuan yang jelas dari masa ke masa pada tugas-tugas ini. Prestasi telah meningkat lebih daripada dua kali ganda dari GPT‑4o (dikeluarkan pada musim bunga 2024) ke GPT‑5 (dikeluarkan pada musim panas 2025), mengikuti trend linear yang jelas.
Selain itu, kami mendapati bahawa model termaju boleh menyelesaikan tugas GDPval kira-kira 100x lebih pantas dan 100x lebih murah berbanding pakar industri. Walau bagaimanapun, angka-angka ini mencerminkan masa inferens model tulen dan kadar bil API, dan oleh itu tidak merangkumi pengawasan manusia, iterasi, dan langkah integrasi yang diperlukan dalam persekitaran tempat kerja sebenar untuk menggunakan model kami. Namun, terutamanya pada subset tugas di mana model sangat kuat, kami menjangkakan bahawa memberikan tugas kepada model sebelum mencubanya dengan manusia akan menjimatkan masa dan wang.
Penggred pakar membandingkan hasil kerja daripada model terkemuka dengan pakar manusia. Model termaju hari ini sudah hampir mencapai kualiti kerja yang dihasilkan oleh pakar industri. Claude Opus 4.1 menghasilkan output yang dinilai sama baik atau lebih baik daripada manusia dalam kurang daripada separuh tugas.
Dari GPT‑4o ke GPT‑5, prestasi pada tugas GDPval meningkat lebih daripada tiga kali ganda dalam setahun.
Akhirnya, kami melatih secara berperingkat versi dalaman dan eksperimen GPT‑5 untuk menilai jika kami boleh meningkatkan prestasi pada GDPval. Kami mendapati proses ini meningkatkan prestasi, mencipta jalan untuk potensi penambahbaikan selanjutnya. Eksperimen terkawal lain menyokong ini: meningkatkan saiz model, menggalakkan lebih banyak langkah penaakulan, dan memberikan konteks tugas yang lebih kaya yang mana masing-masing membawa kepada peningkatan yang boleh diukur.
Anda boleh membaca keputusan penuh dalam kertas kerja kami. Kami juga melancarkan subset emas tugas GDPval dan perkhidmatan penilaian awam supaya penyelidik lain boleh membina berdasarkan kerja ini.
Apabila AI menjadi lebih berkebolehan, ia mungkin akan menyebabkan perubahan dalam pasaran kerja. Keputusan awal GDPval menunjukkan bahawa model sudah boleh mengambil beberapa tugas yang berulang dan ditentukan dengan baik dengan lebih cepat dan pada kos yang lebih rendah daripada pakar. Namun, kebanyakan pekerjaan lebih daripada sekadar himpunan tugas yang boleh dicatat. GDPval menekankan di mana AI boleh mengendalikan tugas rutin supaya orang dapat menghabiskan lebih banyak masa pada bahagian kerja yang memerlukan kreativiti dan penilaian yang mendalam. Apabila AI melengkapi pekerja dengan cara ini, ia boleh membawa kepada pertumbuhan ekonomi yang ketara. Matlamat kami adalah untuk memastikan semua orang berada di "lif naik" AI dengan mendemokrasikan akses kepada alat-alat ini, menyokong pekerja melalui perubahan, dan membina sistem yang memberi ganjaran kepada sumbangan yang meluas.
GDPval adalah langkah awal. Walaupun ia merangkumi 44 pekerjaan dan ratusan tugas, kami terus memperhalusi pendekatan kami untuk memperluaskan skop ujian kami dan menjadikan hasilnya lebih bermakna. Versi semasa penilaian ini juga adalah satu-satu, jadi ia tidak menangkap kes di mana model perlu membina konteks atau memperbaiki melalui beberapa draf—contohnya, menyemak semula ringkasan undang-undang selepas maklum balas pelanggan atau mengulangi analisis data selepas mengesan anomali. Selain itu, dalam dunia sebenar, tugas tidak selalu ditakrifkan dengan jelas dengan prom dan fail rujukan; sebagai contoh, seorang peguam mungkin perlu mengatasi kekaburan dan bercakap dengan pelanggan mereka sebelum memutuskan bahawa mencipta ringkasan undang-undang adalah pendekatan yang tepat untuk membantu mereka. Kami merancang untuk memperluaskan GDPval bagi merangkumi lebih banyak pekerjaan, industri, dan jenis tugas, dengan peningkatan interaktiviti, dan lebih banyak tugas yang melibatkan kekaburan pengemudian, dengan matlamat jangka panjang untuk mengukur kemajuan dalam kerja pengetahuan yang pelbagai dengan lebih baik.
- Jika anda pakar industri yang berminat untuk menyumbang kepada GDPval, sila tunjukkan minat anda di sini.
- Jika anda seorang pelanggan yang bekerja dengan OpenAI dan ingin menyumbang kepada pusingan GDPval yang akan datang, sila nyatakan minat di sini.
Penyertaan komuniti adalah penting—kami teruja untuk membina GDPval bersama penyelidik, pengamal, dan organisasi yang berkongsi matlamat kami untuk menjadikan AGI lebih berguna bagi orang di tempat kerja.


