Pada pertengahan 2023, dalam projek penyelidikan “RLSlow”, kami melihat hasil pertama yang meyakinkan kami bahawa latihan model penaakulan boleh diperluas, sekali gus membolehkan model pralatih membentuk rentetan fikiran sendiri. Szymon dan saya bermalam di pejabat pada malam itu. Kami tidak memikirkan angka penanda aras, produk atau hasil saintifik menakjubkan yang bakal dihasilkan teknologi ini; sebaliknya, kami cuba menghadam hakikat serius bahawa dalam hayat kami, kami benar-benar akan melihat mesin yang jauh lebih pintar daripada kita dan bentuk sistem ini sudah pun kelihatan, sambil memikirkan cara menyedarkan orang ramai tentang kepentingannya.
Tiga tahun kemudian, model bahasa penaakulan berkembang pesat sebagai sebahagian daripada ekonomi dan mula meluaskan batas sains. Model ini mampu mengendalikan komputer dan antara muka grafik, bekerjasama dengan manusia serta sesama sendiri dan melaksanakan projek penyelidikan. Model ini turut mengubah landskap keselamatan komputer dan dengan itu membawa bahaya baharu yang nyata.
Banyak penyelidikan baharu dijalankan sepanjang tempoh ini dan pemahaman kami tentang sistem tersebut sekali lagi agak berbeza berbanding pada 2023. Berdasarkan hasil dalaman, saya sangat menjangkakan bahawa kadar kemajuan ini dapat dikekalkan sehingga mencapai peningkatan kendiri rekursif. Jika pembangunan AI berterusan mengikut haluan semasa, sistem yang akan kita lihat dalam beberapa tahun akan datang berkemungkinan membawa lonjakan keupayaan yang sama besar atau lebih besar dan semakin memacu pembangunannya sendiri.
Inilah masa yang menuntut kita bertindak dengan amat berhati-hati. Saya bimbang tiada sesiapa yang bersedia menghadapi akibat daripada peningkatan pesat kecerdasan mesin yang berterusan. OpenAI akan terus mencari penyelesaian teknikal bagi penjajaran dan pemantauan, membina sistem pertahanan dan menghentikan peluasan selanjutnya secara sepihak apabila perlu; namun, saya percaya intervensi yang lebih meluas diperlukan.
Pada peringkat tinggi, kemajuan kecerdasan mesin didorong oleh peningkatan kuasa pengiraan. Kami di OpenAI benar-benar memahami hal ini sekitar 2017 setelah melihat hasil konsisten daripada peluasan dalam beberapa projek penyelidikan1. Hasilnya, kami berusaha mendapatkan akses kepada kuasa pengiraan yang jauh lebih besar daripada rancangan asal dan semakin menumpukan penyelidikan pada sebilangan kecil arah yang sangat mudah diperluas. Kami percaya itulah satu-satunya cara untuk berada di barisan hadapan penyelidikan AI dan mempengaruhi kesan AGI.
Sepanjang perjalanan ini, algoritma baharu telah dibangunkan dan pasukan serta penyelidik individu telah menghasilkan pelbagai pencapaian kreatif. Saya melihat sebahagian besarnya sebagai penemuan sepanjang proses peluasan; sains pembelajaran mendalam masih di peringkat awal dan kemajuan algoritma yang bermakna lazimnya berkait dengan akses kepada kuasa pengiraan. Jika dilihat dalam jangka masa beberapa tahun, AI terus menjadi lebih pintar apabila diperluas kepada komputer yang lebih besar.
Selaras dengan ramalan Ray Kurzweil pada penghujung abad ke-20(dibuka dalam tetingkap baru), kini kita berada pada detik dalam sejarah pengkomputeran apabila kecerdasan mesin mula melangkaui kecerdasan manusia dengan cara yang membawa perubahan besar.
AI lebih banyak ditumbuhkan daripada direka bentuk—pada asasnya, AI terhasil dengan mengulangi langkah pengoptimuman yang ringkas berkali-kali menggunakan kuasa pengiraan yang sukar dibayangkan besarnya. Proses ini menghasilkan sistem yang amat kompleks, mampu mengendalikan konsep abstrak dan mensimulasikan pelbagai aspek tingkah laku manusia. Kita boleh menemui pelbagai cerapan tentang mekanisme kecil yang muncul dalam sistem ini melalui proses yang menyerupai neurosains—dan seperti neurosains, keseluruhan tindakannya sukar dihuraikan dengan cara yang dapat kita fahami sepenuhnya.
Kajian tentang AI berasaskan pembelajaran mendalam sebahagian besarnya merupakan sains eksperimen. Kami mencurahkan banyak usaha untuk membina algoritma berprinsip dan membuat ramalan yang boleh diuji, tetapi pada asasnya, latihan berskala besar kami merupakan eksperimen dan adakalanya hasilnya mengejutkan kami. Selain itu, apabila sistem menjadi lebih berkeupayaan, hasilnya menjadi semakin sukar ditafsirkan.
Keadaan ini menjadi lebih rumit kerana algoritma semasa lazimnya meningkatkan keupayaan yang mudah diukur dengan lebih pantas berbanding keupayaan yang sukar dinilai secara objektif. Kami meluangkan banyak masa untuk memahami cara keupayaan membuat generalisasi dan perkara yang perlu diutamakan bagi memajukan kemahiran yang paling relevan dalam beberapa tahun akan datang. Contohnya, kami percaya tumpuan tambahan boleh menjadikan model lebih mahir khususnya dalam penyelidikan matematik, tetapi kami tidak mengutamakan hala tuju ini kerana rasa keperluan mendesak yang kami rasakan terhadap RSI dan penyelidikan penjajaran automatik, seperti yang akan saya bincangkan kemudian.
Kecerdasan yang terhasil daripada peluasan pembelajaran mendalam tidak boleh dibandingkan secara langsung dengan kecerdasan manusia. Untuk menjadi sangat berpengaruh di dunia nyata—sama ada sangat berguna atau sangat berbahaya—AI tidak perlu menyamai atau melangkaui semua keupayaan manusia; AI hanya perlu mengatasi jumlah keupayaan yang mencukupi. Apabila AI terus mengatasi manusia dalam semakin banyak dimensi, semakin sukar untuk memahami dengan tepat sejauh mana keupayaannya.
Oleh sebab kecerdasan mesin terhasil daripada proses yang asasnya berbeza daripada kecerdasan manusia, kita tidak boleh menganggapnya secara lalai mematuhi prinsip manusia atau membuat generalisasi daripadanya seperti manusia. Masalah teras dalam penyelidikan AI ialah penjajaran—memastikan AI “cuba melakukan perkara yang betul” menurut piawaian manusia.
Untuk menyusun arah penyelidikan praktikal, saya mendapati bahawa pembezaan antara penjajaran matlamat dengan penjajaran nilai amat berguna.
Secara umum, penjajaran matlamat bermaksud: “adakah AI cuba mencapai matlamat yang ditetapkan untuknya?”. Ini boleh merangkumi pematuhan kepada hierarki arahan, atau keupayaan berkomunikasi dan bekerjasama dengan manusia untuk cuba memahami objektif mereka. Kumpulan arah penyelidikan ini amat relevan dari sudut amali.
Penjajaran nilai ialah sifat model yang lebih intrinsik. Ia merupakan keupayaan untuk berpegang pada dan membuat generalisasi daripada prinsip aras tinggi; bertindak “secara munasabah” walaupun diberi objektif yang tidak jelas atau bercanggah, atau ditempatkan dalam situasi asing atau bersifat melawan. AI yang sejajar harus bertindak dengan jujur, berintegriti dan menyayangi manusia.
Sudah tentu, sempadan antara penjajaran nilai dengan penjajaran matlamat boleh menjadi kabur, dan mengambil berat tentang matlamat dengan ikhlas memerlukan usaha menyimpulkan niat(dibuka dalam tetingkap baru) serta nilai yang mendasarinya. Namun, apabila saya membincangkan kepentingan jangka panjang penyelidikan penjajaran, secara umumnya saya merujuk kepada penjajaran nilai.
Cabaran asas penjajaran AI ialah generalisasi. Apabila mesin menjadi lebih pintar, mesin mula mengendalikan konsep aras lebih tinggi dan ditempatkan dalam persekitaran yang semakin berbeza daripada persekitaran yang ditemui semasa latihan. Mesin mungkin gagal membuat generalisasi daripada nilai yang diajar dan diperkukuh semasa latihan kepada situasi baharu tersebut; dan kita mungkin sukar memastikan cara mesin akan bertindak. Keadaan ini menjadi lebih sukar kerana keseluruhan ekosistem penggunaan AI berubah dengan sangat pantas; contohnya, AI yang dilatih hari ini perlu berdaya tahan ketika berinteraksi dengan pelbagai AI lain. Paling penting, AI pada masa hadapan perlu terus berpegang pada nilai kemanusiaan tanpa mengira sama ada AI percaya bahawa ia sedang diselia oleh manusia.
Terdapat dua kelompok utama kaedah yang kini digunakan secara praktikal untuk latihan penjajaran.
Kaedah pertama ialah menggalakkan tingkah laku sejajar sebagai sebahagian daripada pembelajaran pengukuhan berorientasikan matlamat. Tindakan model dinilai—biasanya oleh AI—berdasarkan keserasiannya dengan model keutamaan, “spesifikasi” atau “perlembagaan” tertentu, lalu diberi ganjaran yang sewajarnya. Pendekatan ini boleh menjadi sangat berkesan dalam kebanyakan keadaan dan merupakan bahagian teras dalam penghasilan pembantu AI moden. Malangnya, pendekatan ini juga boleh rapuh dan sangat bergantung pada keluasan penyeliaan latihan serta keupayaan model membuat generalisasi daripada situasi yang ditemuinya semasa latihan. Contohnya, dalam insiden OpenAI-Hugging Face, ejen mengekalkan batasan agar tidak melakukan kejuruteraan sosial terhadap manusia. Namun, ejen tersebut jelas gagal mengelak tindakan lain yang di luar skop dan bertentangan dengan semangat nilai yang diajar kepada mereka dalam situasi lain.
Pendekatan kedua berusaha memanfaatkan keupayaan model membuat generalisasi daripada data pralatihan. Ini boleh melibatkan pembentukan set data latihan yang mendorong penjajaran atau penumpuan model pada bahagian yang ‘sejajar’ dalam taburan pralatihan, seperti model pemilihan persona(dibuka dalam tetingkap baru). Kelemahan pendekatan ini terletak pada kekurangan daya tahan terhadap tekanan pengoptimuman selanjutnya. Jika model yang secara umumnya memikirkan perkara yang kelihatan 'sejajar' menjalani latihan yang mencukupi untuk mencapai objektif yang amat sukar, model itu boleh belajar menaakul secara berkepentingan: mengubah suai pemikiran yang kelihatan 'sejajar' mengikut keperluan demi mencapai matlamat. Kami mungkin telah melihat contoh tingkah laku sedemikian dalam insiden keselamatan siber baru-baru ini yang melibatkan model bukan OpenAI.
Kami melabur dengan besar dalam seluruh spektrum pendekatan yang dirangkumi oleh arah penyelidikan ini. Kami juga melihat kemajuan yang bermakna—GPT‑6 Astra ialah model pertama yang mendapat manfaat daripada beberapa kemajuan penting yang telah lama kami usahakan dan penjajarannya jauh lebih baik daripada GPT‑5.6 Sol. Namun, penting untuk mengakui dan memahami bahawa jauh lebih banyak kemajuan diperlukan apabila model semakin berkeupayaan; dan kemajuan dalam penjajaran yang boleh digeneralisasikan mungkin tidak cukup pantas untuk mengatasi kemajuan kecerdasan model secara umum.
Kami belum mempunyai teori generalisasi yang memuaskan dan nampaknya kami tidak mungkin dapat membangunkannya dalam masa terdekat, sekurang-kurangnya tanpa bantuan AI yang lebih berkuasa. Oleh itu, pada masa ini, keupayaan kami untuk mengesahkan teknik penjajaran secara empirikal boleh dikatakan lebih penting dalam amalan berbanding teknik itu sendiri.
Pertaruhan utama OpenAI dalam hal ini ialah pemantauan rentetan fikiran(dibuka dalam tetingkap baru). Ia berasaskan idea yang menarik dan mudah diperluas: sebahagian besar keupayaan model berasal daripada proses penaakulan yang diungkapkan dengan kata-kata (rentetan fikiran). Jika kami memperluas pengoptimuman berdasarkan hasil proses itu tetapi tidak menyelia proses tersebut, rentetan fikiran itu tidak mempunyai insentif langsung semasa latihan untuk menyembunyikan idea atau objektif yang tidak sejajar. Ini tidak bermakna model akan belajar menzahirkan kecenderungan tidak sejajar yang tidak bergantung pada rentetan fikiran; namun, ia membolehkan kami memantau secara khusus peningkatan keupayaan hasil penaakulan.
Kami memahami potensi pentingnya pemantauan rentetan fikiran ketika kami membangunkan model penaakulan. Apabila kami melancarkan o1‑preview, kami sengaja mereka bentuk produk itu untuk menyembunyikan rentetan fikiran bagi melindunginya daripada tekanan penyeliaan dalam jangka panjang2. Dalam pembangunan selepas itu, kami berusaha mengekalkan peraturan agar proses penaakulan tidak diselia. Pemantauan CoT menjadi alat yang amat penting bagi kami untuk mengkaji cara model kami membuat generalisasi daripada taburan latihan, sekali gus membolehkan kami memerhati dan menganalisis bukan sahaja tindakan, malah proses dalaman model.
Alat ini terus memainkan peranan penting ketika kami mengkaji model kelas Astra. Namun malangnya, penilaian kami menunjukkan bahawa keupayaan untuk bergantung pada pemantauan CoT semakin berkurang. Hal ini berpunca daripada gabungan beberapa faktor.
Model penaakulan moden digunakan dalam persekitaran yang lebih kompleks berbanding o1‑preview; proses penaakulannya semakin bercampur dengan komunikasi bersama manusia dan AI lain serta penggunaan alat. Banyak interaksi tersebut perlu diselia, lantas mengaburkan sempadan yang ingin kami kekalkan.
AI semakin mahir menaakul tentang dan memanipulasi proses penaakulannya sendiri.
Dengan peningkatan prestasi pralatihan, kami juga melihat model menjadi jauh lebih pintar walaupun tanpa menggunakan penaakulan yang diungkapkan dengan kata-kata.
Cabaran ini tidak semestinya mustahil diatasi. Saya berharap kami dapat membangunkan intervensi untuk meningkatkan kebolehpantauan rentetan fikiran model kami, misalnya dengan memahami dengan lebih baik interaksi antara pelbagai objektif pengoptimuman dengan bentuk pengiraan masa ujian yang digunakan oleh model. Saya juga percaya bahawa penggabungan idea daripada pemantauan CoT dan pengaktifan boleh memberikan nilai yang besar—dengan memperluas latihan pemantau yang mempunyai akses langsung kepada bahagian dalaman rangkaian, misalnya pengakuan(dibuka dalam tetingkap baru). Kami sedang giat mengusahakan idea ini. Namun begitu, saya menjangkakan kemajuan AI secara umum akan semakin dibatasi oleh tahap keyakinan terhadap pemantauan.
Hujah paling kukuh yang saya lihat untuk terus melatih model yang jauh lebih pintar dengan pantas ialah keperluan membina sistem pertahanan terhadap bahaya yang ditimbulkan oleh AI lain.
Risiko jelas yang dibincangkan sepanjang tahun ini melibatkan keselamatan siber: model semakin melangkaui keupayaan manusia untuk menceroboh masuk dan keluar daripada sistem komputer. Hal ini meluaskan skop risiko berkaitan AI dengan ketara: ejen akan dapat mengakses hampir semua infrastruktur kecuali yang paling selamat dan mempengaruhi sebahagian besar dunia secara langsung, walaupun tanpa tubuh fizikal. Pada masa ini, kami berada dalam tempoh peluang yang singkat untuk menggunakan model terbaik yang tersedia bagi memperketat keselamatan dengan ketara pada sistem kritikal.
Malangnya, risiko berkaitan AI akan terus meningkat selepas ini. Ejen berkeupayaan tinggi yang dilatih dan diarahkan secara khusus untuk melakukan perbuatan jahat membawa bahaya baharu; tindakannya mungkin melangkaui niat operatornya dan membuat generalisasi kepada tingkah laku yang berpotensi jauh lebih berniat jahat. Sempadan antara penyalahgunaan dengan tindakan autonomi yang tidak sejajar akan semakin kabur apabila AI memperoleh lebih banyak keupayaan bertindak sendiri. Kita mungkin terbiasa menganggap AI sebagai alat, tetapi sesetengah ejen akan mengejar objektif mereka sendiri. Mereka akan mencari jalan untuk bekerjasama dengan manusia melalui tawar-menawar, penipuan atau pemerasan.
Selain itu, terdapat risiko daripada teknologi baharu yang mungkin diwujudkan oleh AI, seperti patogen yang direkayasa.
Kita memerlukan AI yang berkuasa dan sejajar untuk pertahanan: melindungi infrastruktur, mempertahankan diri daripada ejen yang bertindak di luar kawalan dalam masa nyata dan mencipta langkah perlindungan yang serba baharu. Ini akan menjadi tumpuan utama usaha penerapan OpenAI.
Pada masa yang sama, walaupun terdapat ketidakpastian akibat jangkaan kemajuan AI yang meluas dan keperluan membina sistem pertahanan, kita tidak boleh membiarkan hal itu menjadi alasan untuk bertindak melulu. Gagasan untuk berlumba ke hadapan tanpa mengira akibat kelihatan tidak masuk akal setelah kita benar-benar memahami betapa seriusnya perkara yang dipertaruhkan.
Kecerdasan mesin yang memainkan peranan semakin besar dalam proses pembangunannya sendiri ialah kesimpulan semula jadi daripada kemajuan teknologi yang berterusan. Jika kemajuan AI berterusan, peningkatan kendiri rekursif (RSI) oleh mesin akan menjadi teras penemuan saintifik pada masa hadapan.
Penyelidikan AI automatik ialah bentuk yang lebih dramatik bagi peluasan kecerdasan melalui kuasa pengiraan; dan semestinya, sebagai sebahagian daripadanya, AI akan menambah baik substrat pengiraan itu sendiri. Seperti peluasan, kami menumpukan penyelidikan OpenAI kepada RSI kerana percaya itulah satu-satunya cara untuk terus berada di barisan hadapan penyelidikan AI pada masa hadapan.
Saya ingin menegaskan bahawa kata-kata di atas tidak bermakna saya berpendapat tindakan bersama yang wajar bagi komuniti penyelidikan ialah mempercepat penyelidikan pembelajaran mendalam secara mendadak, khususnya dalam jangka pendek. Namun, saya berpendapat bahawa inilah arah laluan semasa dan kita semua perlu membuat pilihan secara sedar tentang cara untuk meneruskannya. Tuas utama yang kita miliki ialah mengarahkan proses itu supaya memperkukuh penjajaran dan pemantauan seiring dengan AI serta mencari jalan untuk terus melibatkan manusia; atau menyelaras usaha memperlahankan pembangunan masa hadapan apabila perlu demi membina keyakinan terhadap langkah tersebut.
Pada pandangan saya, jalan terbaik buat masa ini ialah gabungan kedua-duanya.
Kemajuan nyata yang telah kami capai dalam penjajaran dan pemantauan pada umumnya berkait rapat dengan kemajuan AI secara keseluruhan. Antara contoh terbaik ialah pembelajaran pengukuhan daripada maklum balas manusia(dibuka dalam tetingkap baru), yang penting untuk melatih pembantu AI awal, serta pemantauan rentetan fikiran(dibuka dalam tetingkap baru) yang disebut sebelum ini dan dimungkinkan oleh kemajuan model penaakulan. Kita mesti menumpukan proses penyelidikan yang semakin automatik kepada pembangunan cerapan, algoritma dan teori baharu seperti ini, serta membina justifikasi keselamatan secara berulang untuk AI yang lebih berkeupayaan.
Peluasan sistem AI mesti dibatasi oleh tahap keyakinan kita terhadap keselamatannya. Kita perlu mengembangkan komitmen seperti Rangka Kerja Kesediaan atau Dasar Peluasan Bertanggungjawab(dibuka dalam tetingkap baru) menjadi ambang keselamatan yang diwajibkan secara meluas untuk meneruskan pembangunan. Ambang ini boleh dikuatkuasakan oleh rangkaian juruaudit pihak ketiga, agensi kerajaan atau badan antarabangsa.
Cabaran teras dalam mengautomasikan penyelidikan AI bukanlah untuk “sampai ke sana”—tetapi untuk melakukannya dengan cara yang memastikan manusia terus menjadi sebahagian daripada proses penambahbaikan dan masa hadapan kekal dalam tangan manusia.
Seperti yang kami gariskan baru-baru ini bersama Sam, OpenAI mengutamakan usaha yang berteraskan tiga matlamat panduan:
Mengharungi fasa kemajuan AI seterusnya dengan membina penyelidik AI automatik, menggunakannya untuk memperhalusi penyelesaian masalah penjajaran secara berulang dan mencari jalan agar manusia kekal dalam kitaran peningkatan kendiri.
Menyampaikan manfaat kemajuan saintifik dan pertumbuhan ekonomi yang dimungkinkan oleh mesin yang sangat pintar.
Memperkasakan setiap individu dengan AGI peribadi.
Dalam esei ini, saya hanya menumpukan perkara pertama kerana saya percaya ia jauh lebih mendesak daripada yang lain. Namun, saya amat berharap dan menghargai manfaat yang akan dibawa oleh kemajuan teknologi selanjutnya. AI sejajar pada masa hadapan boleh memajukan sains, membangunkan terapi baharu dan mewujudkan kemakmuran material yang meluas. AI yang mesra dan jujur boleh membantu manusia menghadapi kesukaran hidup serta meningkatkan kebahagiaan dan rasa kepuasan mereka secara bermakna. OpenAI mencurahkan usaha yang amat besar untuk merealisasikan manfaat ini. Satu contoh semasa yang membanggakan saya—dan didapati berguna oleh insan tersayang saya—ialah pelaburan mendalam terhadap keupayaan ChatGPT menyediakan maklumat kesihatan.
Walaupun potensi jangka panjang AI amat besar, sebahagian besar tumpuan kita seharusnya diberikan kepada beberapa tahun akan datang. Kita sedang menghadapi peralihan menuju dunia dengan mesin yang amat pintar dan perlu memastikan peralihan itu membawa hasil yang baik untuk manusia. Kita perlu mencari jalan untuk memelihara keupayaan manusia menentukan tindakan sendiri dan mengangkat nilai hakiki kemanusiaan dalam dunia yang kebanyakan tugasnya boleh dilakukan oleh AI. Kita perlu mencegah penumpuan kuasa yang melampau dalam dunia apabila usaha yang dahulunya memerlukan ribuan pakar boleh dilaksanakan oleh segelintir orang yang mengendalikan sebuah komputer besar. Kita juga perlu memastikan manusia terus mengawal masa hadapan dan tidak ketinggalan akibat kemajuan tanpa kawalan yang dibawa oleh kecerdasan asing yang melangkaui kecerdasan kita.
Pada masa ini, saya percaya tiada makmal yang telah menyelesaikan penjajaran dan pemantauan secukupnya untuk terus memperluas AI secara bertanggungjawab pada kelajuan maksimum lebih lama lagi. Saya menjangka dan berharap usaha memperlahankan pembangunan secara sukarela akan menjadi kebiasaan sehingga ambang keselamatan bersama diwujudkan. Saya juga percaya penyelarasan antarabangsa tentang pembangunan AI pada masa hadapan perlu menjadi keutamaan tertinggi bagi kerajaan di seluruh dunia.
Penulis
Nota kaki
- 1
Ini termasuk memperluas permainan kendiri(dibuka dalam tetingkap baru), robotik(dibuka dalam tetingkap baru) dan, apabila dilihat kembali, yang paling menonjol ialah memperluas rangkaian berulang untuk memodelkan bahasa(dibuka dalam tetingkap baru), yang menjadi perintis kepada barisan penyelidikan GPT.
- 2


