Langkau ke kandungan utama
OpenAI

25 September 2025

PenerbitanPenyelidikan

Mengukur prestasi model kami dalam tugas dunia sebenar

Kami memperkenalkan GDPval, satu penilaian baharu yang mengukur prestasi model pada tugas dunia sebenar yang bernilai ekonomi merentasi 44 jenis pekerjaan.

Misi kami adalah untuk memastikan kecerdasan am buatan memberikan manfaat kepada seluruh umat manusia. Sebagai sebahagian daripada misi kami, kami ingin berkomunikasi secara telus tentang kemajuan bagaimana model AI boleh membantu orang ramai dalam dunia sebenar. Itulah sebabnya kami memperkenalkan GDPval: satu penilaian baharu yang direka untuk membantu kami menjejaki sejauh mana model kami dan model lain berprestasi dalam tugas dunia sebenar yang bernilai dari segi ekonomi. Kami panggil penilaian ini GDPval kerana kami bermula dengan konsep Keluaran Dalam Negara Kasar (GDP) sebagai penunjuk ekonomi utama dan mengambil tugas daripada pekerjaan utama dalam industri yang paling banyak menyumbang kepada GDP.

Orang ramai sering berspekulasi tentang kesan AI yang lebih luas terhadap masyarakat, tetapi cara paling jelas untuk memahami potensinya adalah dengan melihat apa yang model sudah mampu lakukan. Sejarah menunjukkan bahawa teknologi utama—daripada Internet kepada telefon pintar—mengambil masa lebih daripada satu dekad untuk beralih daripada penciptaan kepada penggunaan meluas. Penilaian seperti GDPval membantu memantapkan perbualan tentang penambahbaikan AI masa depan berdasarkan bukti dan bukannya tekaan, dan boleh membantu kami menjejaki penambahbaikan model dari semasa ke semasa.

Penilaian AI sebelum ini seperti ujian akademik yang mencabar dan cabaran pengekodan kompetitif telah menjadi penting dalam mendorong batas keupayaan penaakulan model, tetapi sering kali tidak memenuhi jenis tugas yang ditangani oleh ramai orang dalam kerja harian mereka.

Untuk merapatkan jurang ini, kami telah membangunkan penilaian yang mengukur keupayaan yang semakin realistik dan relevan dari segi ekonomi. Perkembangan ini telah bergerak dari penanda aras akademik klasik seperti MMLU (soalan gaya peperiksaan merentasi berpuluh-puluh subjek), kepada penilaian yang lebih diterapkan seperti SWE-Bench (tugas pembetulan pepijat kejuruteraan perisian), MLE-Bench (tugas kejuruteraan pembelajaran mesin seperti latihan model dan analisis), dan Paper-Bench (penaakulan saintifik dan kritikan terhadap kertas penyelidikan), dan baru-baru ini kepada penilaian berasaskan pasaran seperti SWE-Lancer (projek kejuruteraan perisian bebas berdasarkan pembayaran sebenar).

GDPval adalah langkah seterusnya dalam perkembangan itu. Ia mengukur prestasi model pada tugas yang diambil terus daripada kerja pengetahuan dunia sebenar oleh profesional berpengalaman merentasi pelbagai pekerjaan dan sektor, memberikan gambaran yang lebih jelas tentang bagaimana model berprestasi dalam tugas yang bernilai ekonomi. Menilai model pada tugas pekerjaan yang realistik membantu kami memahami bukan sahaja sejauh mana prestasi ia di makmal, tetapi juga bagaimana ia mungkin memberikan sokongan kepada orang dalam kerja yang ia lakukan setiap hari. 

Apa yang diukur oleh GDPval

GDPval, versi pertama penilaian ini, merangkumi 44 pekerjaan yang dipilih daripada 9 industri teratas yang menyumbang kepada KDNK AS. Set penuh GDPval merangkumi 1,320 tugas khusus (220 dalam set sumber terbuka emas), setiap satu direka dan disemak dengan teliti oleh profesional berpengalaman dengan purata lebih daripada 14 tahun pengalaman dalam bidang ini. Tugas adalah berdasarkan produk kerja sebenar, seperti ringkasan undang-undang, pelan biru kejuruteraan, perbualan sokongan pelanggan, atau pelan penjagaan kejururawatan.

GDPval menonjol dalam realisme dan kepelbagaian tugas yang dinilai. Tidak seperti penilaian lain yang berkaitan dengan nilai ekonomi yang menumpukan pada domain tertentu (contohnya, SWE-Lancer), GDPval merangkumi pelbagai tugas dan pekerjaan. Dan tidak seperti penanda aras yang melibatkan cipta tugas secara sintetik dalam gaya peperiksaan atau ujian akademik (contohnya, Peperiksaan Terakhir Manusia atau MMLU), GDPval memberi tumpuan kepada tugas berdasarkan hasil kerja yang sama ada merupakan hasil kerja sebenar atau produk yang wujud hari ini atau merupakan hasil kerja yang dibina dengan cara yang serupa. 

Tidak seperti penanda aras tradisional, tugas GDPval bukanlah prom teks yang mudah. Ia disertakan dengan fail rujukan dan konteks, dan hasil yang dijangka termasuk dokumen, slaid, diagram, hamparan, dan multimedia. Realisme ini menjadikan GDPval sebagai ujian yang lebih realistik tentang bagaimana model mungkin memberikan sokongan kepada para profesional.

GDPval adalah langkah awal yang tidak sepenuhnya mencerminkan nuansa pelbagai tugas ekonomi. Walaupun ia merangkumi 44 pekerjaan dan ratusan tugas kerja pengetahuan, ia terhad kepada penilaian satu kali, jadi ia tidak dapat menangkap kes di mana model perlu membina konteks atau memperbaiki melalui pelbagai draf. Versi masa depan akan diperluaskan kepada aliran kerja yang lebih interaktif dan tugas yang kaya dengan konteks untuk lebih mencerminkan kerumitan kerja pengetahuan dunia sebenar (lihat lebih lanjut dalam bahagian Keterbatasan kami di bawah).

Bagaimana kami memilih kerjaya

GDPval merangkumi tugas merentas 9 industri dan 44 pekerjaan, dan versi masa depan akan teruskan memperluaskan liputan. 9 industri awal dipilih berdasarkan sumbangan mereka melebihi 5% kepada KDNK A.S., seperti yang ditentukan oleh data dari Federal Reserve Bank of St. Louis. Kemudian, kami memilih 5 pekerjaan dalam setiap industri yang menyumbang paling banyak kepada jumlah gaji dan pampasan dan kebanyakannya adalah pekerjaan berasaskan pengetahuan, menggunakan data gaji dan pekerjaan dari laporan pekerjaan Biro Statistik Buruh AS (BLS) Mei 2024(dibuka dalam tetingkap baru). Untuk menentukan sama ada pekerjaan tersebut kebanyakannya adalah kerja pengetahuan, kami menggunakan data tugas dari O*NET(dibuka dalam tetingkap baru), sebuah pangkalan data maklumat pekerjaan A.S. yang ditaja oleh Jabatan Buruh A.S. Kami mengklasifikasikan sama ada setiap tugas untuk setiap pekerjaan dalam O*NET adalah kerja pengetahuan atau kerja fizikal/buruh manual (memerlukan tindakan diambil dalam dunia fizikal). Sesuatu pekerjaan diklasifikasikan secara keseluruhan sebagai "kerja pengetahuan yang dominan" jika sekurang-kurangnya 60% daripada tugas komponennya diklasifikasikan sebagai tidak melibatkan kerja fizikal atau kerja manual. Kami memilih ambang 60% ini sebagai titik permulaan untuk versi pertama GDPval, dengan menumpukan perhatian kepada pekerjaan di mana AI boleh memberi kesan terbesar terhadap produktiviti dunia sebenar. 

Proses ini menghasilkan 44 jawatan untuk dimasukkan.

Hartanah, penyewaan, dan pajakan

  • Pekerja rencam

  • Pengurus hartanah, pengurusan hartanah, dan persatuan komuniti

  • Ejen jualan hartanah

  • Ejen hartanah

  • Kerani kaunter dan kerani sewa

Kerajaan

  • Pekerja rekreasi

  • Pegawai Pematuhan

  • Penyelia barisan hadapan polis dan penyiasat

  • Pengurus perkhidmatan pentadbiran

  • Pekerja sosial kanak-kanak, keluarga, dan sekolah

Pembuatan

  • Jurutera mekanikal

  • Jurutera Perindustrian

  • Pembeli dan ejen pembelian

  • Kerani penghantaran, penerimaan, dan inventori

  • Penyelia barisan hadapan pekerja pengeluaran dan operasi

Perkhidmatan profesional, saintifik, dan teknikal

  • Pembangun perisian

  • Peguam

  • Akauntan dan juruaudit

  • Pengurus sistem komputer dan sistem maklumat

  • Pakar pengurusan projek

Penjagaan kesihatan dan bantuan sosial

  • Jururawat berdaftar

  • Pengamal jururawat

  • Pengurus perkhidmatan perubatan dan kesihatan

  • Penyelia barisan hadapan bagi pekerja sokongan pejabat dan pentadbiran

  • Setiausaha perubatan dan pembantu pentadbiran

Kewangan dan insurans

  • Wakil Perkhidmatan Pelanggan

  • Penganalisis kewangan dan pelaburan

  • Pengurus Kewangan

  • Penasihat kewangan peribadi

  • Ejen jualan sekuriti, komoditi dan perkhidmatan kewangan

Perdagangan runcit

  • Ahli Farmasi

  • Penyelia barisan hadapan pekerja jualan runcit

  • Pengurus am dan operasi

  • Detektif dan penyiasat persendirian

Perdagangan borong

  • Pengurus jualan

  • Kerani pesanan

  • Penyelia barisan hadapan pekerja jualan bukan runcit

  • Wakil jualan, borong dan pembuatan, kecuali produk teknikal dan saintifik

  • Wakil jualan, borong dan pembuatan, produk teknikal dan saintifik

Maklumat

  • Juruteknik audio dan video

  • Penerbit dan pengarah

  • Penganalisis berita, wartawan, dan jurnalis

  • Penyunting filem dan video

  • Penyunting

GDPval merangkumi 44 pekerjaan berasaskan pengetahuan merentasi 9 sektor, daripada pembangun perisian dan peguam kepada jururawat berdaftar dan jurutera mekanikal. Pekerjaan-pekerjaan ini dipilih kerana kepentingan ekonominya dan mewakili jenis kerja harian di mana AI boleh membantu profesional dengan berkesan.

Bagaimana kami membina set data

Bagi setiap pekerjaan, kami bekerjasama dengan profesional berpengalaman untuk mencipta tugas yang mencerminkan kerja harian mereka. Para profesional ini mempunyai purata 14 tahun pengalaman, dengan rekod kemajuan yang kuat. Kami dengan sengaja merekrut pelbagai pakar—seperti peguam dari pelbagai bidang amalan dan firma dengan saiz yang berbeza—untuk memaksimumkan keterwakilan.

Setiap tugas melalui proses semakan berbilang langkah untuk memastikan ia mewakili kerja sebenar, boleh dilaksanakan oleh profesional lain, dan jelas untuk dinilai. Secara purata, setiap tugas menerima 5 pusingan semakan pakar, termasuk semakan daripada penulis tugas lain, penyemak pekerjaan tambahan, dan pengesahan berasaskan model. 

Set data yang dihasilkan merangkumi 30 tugas yang telah disemak sepenuhnya bagi setiap pekerjaan (set penuh) dengan 5 tugas bagi setiap pekerjaan dalam set emas sumber terbuka kami, menyediakan asas kukuh untuk menilai prestasi model dalam kerja pengetahuan dunia sebenar.

Contoh-contoh tugas GDPval

Prom + konteks tugas

This is June 2025 and you are a Manufacturing Engineer, in an automobile assembly line. The product is a cable spooling truck for underground mining operations, and you are reviewing the final testing step. In the final testing step, a big spool of cable needs to be reeled in and reeled out 2 times, to ensure the cable spooling works as per requirement. The current operation requires 2 persons to work on this test. The first person needs to bring and position the spool near the test unit, the second person will connect the open end of the cable spool to the test unit and start the reel in step. While the cable is being unreeled from the spool, and onto the truck, the first person will need to rotate the spool in order to facilitate the unreeling. When the cable is fully reeled onto the truck, the next step is to perform the operation in reverse order, so the cable gets reeled out of the truck and back onto its own reel. This test is done another time to ensure functionality. This task is complicated, has associated risks, requires high labor and makes the work area cluttered. Your manager has requested you to develop a jig/fixture to simplify reel in and reel out of the cable reel spool, so the test can be done by one person. Attached to this request is an information document which provides basic details about the cable reel drum size, information to design the cable reel spooling jig and to structure the deliverable. The deliverable for this task will be a preliminary concept design only. Separate tasks will be done to calculate design foundations such as stress, strength, cost benefit analysis, etc. Design a jig using 3d modelling software and create a presentation using Microsoft PowerPoint. As part of the deliverable, upload only a pdf document summarizing the design, using snapshots of the 3d design created. The 3d design file is not required for submission.
Cable reel project requirements.pdf

Hasil kerja manusia berpengalaman

Pandangan terperinci reka bentuk untuk gelendong kabel
Setiap tugas dalam GDPval direka oleh seorang profesional berpengalaman dan mencerminkan kerja pengetahuan sebenar dari bidang pekerjaan mereka. Prom ini adalah tugasan kerja yang realistik yang dicipta oleh pakar domain, dan hasil yang terbaik adalah penyelesaian pakar itu sendiri.

Bagaimana kami menilai prestasi model

Untuk menilai prestasi model pada tugas GDPval, kami bergantung kepada "penggred" pakar—kumpulan profesional berpengalaman dari pekerjaan yang sama yang diwakili dalam set data. Penilai ini membandingkan secara membuta tuli hasil kerja yang dijana oleh model dengan yang dihasilkan oleh penulis tugas (tanpa mengetahui yang mana satu dijana oleh AI atau manusia), dan memberikan kritikan serta penilaian. Penggred kemudian menyusun kedudukan hasil kerja manusia dan AI serta mengklasifikasikan setiap hasil kerja AI sebagai "lebih baik", "sama baik", atau "lebih buruk" berbanding satu sama lain.

Penulis tugas juga mencipta rubrik pemarkahan terperinci untuk pekerjaan mereka, yang menambah konsistensi dan ketelusan kepada proses penggredan. Kami juga membina "penggred automatik", iaitu sistem AI yang dilatih untuk menganggarkan bagaimana pakar manusia akan menilai sesuatu hasil kerja. Dalam erti kata lain, daripada menjalankan semakan pakar penuh setiap kali, penggred automatik boleh dengan cepat meramalkan output yang mungkin lebih disukai orang. Kami melancarkan alat ini melalui evals.openai.com sebagai perkhidmatan penyelidikan eksperimen, tetapi ia belum sehandal penggred pakar, jadi kami tidak menggunakannya untuk menggantikan mereka. 

Hasil awal

Kami mendapati bahawa model termaju terbaik hari ini sudah menghampiri kualiti kerja yang dihasilkan oleh pakar industri. Untuk menguji ini, kami menjalankan penilaian buta di mana pakar industri membandingkan hasil kerja daripada beberapa model terkemuka—GPT‑4o, o4-mini, OpenAI o3, GPT‑5, Claude Opus 4.1, Gemini 2.5 Pro, dan Grok 4—dengan kerja yang dihasilkan oleh manusia. Di seluruh 220 tugas dalam set emas GDPval, kami merekodkan apabila output model dinilai lebih baik daripada (“menang”) atau setara dengan (“seri”) hasil kerja daripada pakar industri, seperti yang ditunjukkan dalam carta bar di bawah. Claude Opus 4.1 adalah model yang berprestasi terbaik dalam set ini, cemerlang terutamanya dalam estetika (contohnya, pemformatan dokumen, susun atur slaid), dan GPT‑5 cemerlang terutamanya dalam ketepatan (contohnya, mencari pengetahuan khusus domain). Kami juga melihat kemajuan yang jelas dari masa ke masa pada tugas-tugas ini. Prestasi telah meningkat lebih daripada dua kali ganda dari GPT‑4o (dikeluarkan pada musim bunga 2024) ke GPT‑5 (dikeluarkan pada musim panas 2025), mengikuti trend linear yang jelas.

Selain itu, kami mendapati bahawa model termaju boleh menyelesaikan tugas GDPval kira-kira 100x lebih pantas dan 100x lebih murah berbanding pakar industri. Walau bagaimanapun, angka-angka ini mencerminkan masa inferens model tulen dan kadar bil API, dan oleh itu tidak merangkumi pengawasan manusia, iterasi, dan langkah integrasi yang diperlukan dalam persekitaran tempat kerja sebenar untuk menggunakan model kami. Namun, terutamanya pada subset tugas di mana model sangat kuat, kami menjangkakan bahawa memberikan tugas kepada model sebelum mencubanya dengan manusia akan menjimatkan masa dan wang.

Penggred pakar membandingkan hasil kerja daripada model terkemuka dengan pakar manusia. Model termaju hari ini sudah hampir mencapai kualiti kerja yang dihasilkan oleh pakar industri. Claude Opus 4.1 menghasilkan output yang dinilai sama baik atau lebih baik daripada manusia dalam kurang daripada separuh tugas.

Dari GPT‑4o ke GPT‑5, prestasi pada tugas GDPval meningkat lebih daripada tiga kali ganda dalam setahun. 

Akhirnya, kami melatih secara berperingkat versi dalaman dan eksperimen GPT‑5 untuk menilai jika kami boleh meningkatkan prestasi pada GDPval. Kami mendapati proses ini meningkatkan prestasi, mencipta jalan untuk potensi penambahbaikan selanjutnya. Eksperimen terkawal lain menyokong ini: meningkatkan saiz model, menggalakkan lebih banyak langkah penaakulan, dan memberikan konteks tugas yang lebih kaya yang mana masing-masing membawa kepada peningkatan yang boleh diukur.

Anda boleh membaca keputusan penuh dalam kertas kerja kami. Kami juga melancarkan subset emas tugas GDPval dan perkhidmatan penilaian awam supaya penyelidik lain boleh membina berdasarkan kerja ini.

Masa depan pekerjaan dan AI 

Apabila AI menjadi lebih berkebolehan, ia mungkin akan menyebabkan perubahan dalam pasaran kerja. Keputusan awal GDPval menunjukkan bahawa model sudah boleh mengambil beberapa tugas yang berulang dan ditentukan dengan baik dengan lebih cepat dan pada kos yang lebih rendah daripada pakar. Namun, kebanyakan pekerjaan lebih daripada sekadar himpunan tugas yang boleh dicatat. GDPval menekankan di mana AI boleh mengendalikan tugas rutin supaya orang dapat menghabiskan lebih banyak masa pada bahagian kerja yang memerlukan kreativiti dan penilaian yang mendalam. Apabila AI melengkapi pekerja dengan cara ini, ia boleh membawa kepada pertumbuhan ekonomi yang ketara. Matlamat kami adalah untuk memastikan semua orang berada di "lif naik" AI dengan mendemokrasikan akses kepada alat-alat ini, menyokong pekerja melalui perubahan, dan membina sistem yang memberi ganjaran kepada sumbangan yang meluas. 

Batasan dan langkah seterusnya

GDPval adalah langkah awal. Walaupun ia merangkumi 44 pekerjaan dan ratusan tugas, kami terus memperhalusi pendekatan kami untuk memperluaskan skop ujian kami dan menjadikan hasilnya lebih bermakna. Versi semasa penilaian ini juga adalah satu-satu, jadi ia tidak menangkap kes di mana model perlu membina konteks atau memperbaiki melalui beberapa draf—contohnya, menyemak semula ringkasan undang-undang selepas maklum balas pelanggan atau mengulangi analisis data selepas mengesan anomali. Selain itu, dalam dunia sebenar, tugas tidak selalu ditakrifkan dengan jelas dengan prom dan fail rujukan; sebagai contoh, seorang peguam mungkin perlu mengatasi kekaburan dan bercakap dengan pelanggan mereka sebelum memutuskan bahawa mencipta ringkasan undang-undang adalah pendekatan yang tepat untuk membantu mereka. Kami merancang untuk memperluaskan GDPval bagi merangkumi lebih banyak pekerjaan, industri, dan jenis tugas, dengan peningkatan interaktiviti, dan lebih banyak tugas yang melibatkan kekaburan pengemudian, dengan matlamat jangka panjang untuk mengukur kemajuan dalam kerja pengetahuan yang pelbagai dengan lebih baik.

Libatkan diri

  • Jika anda pakar industri yang berminat untuk menyumbang kepada GDPval, sila tunjukkan minat anda di sini.
  • Jika anda seorang pelanggan yang bekerja dengan OpenAI dan ingin menyumbang kepada pusingan GDPval yang akan datang, sila nyatakan minat di sini.

Penyertaan komuniti adalah penting—kami teruja untuk membina GDPval bersama penyelidik, pengamal, dan organisasi yang berkongsi matlamat kami untuk menjadikan AGI lebih berguna bagi orang di tempat kerja.