Langkau ke kandungan utama
OpenAI

6 September 2026

KeselamatanPenyelidikan

Minda Asing

Oleh: Jakub Pachocki, Ketua Saintis di OpenAI

Memuat…

Pada pertengahan 2023, dalam projek penyelidikan “RLSlow”, kami melihat hasil pertama yang meyakinkan kami bahawa latihan model penaakulan boleh diperluas, sekali gus membolehkan model pralatih membentuk rentetan fikiran sendiri. Szymon dan saya bermalam di pejabat pada malam itu. Kami tidak memikirkan angka penanda aras, produk atau hasil saintifik menakjubkan yang bakal dihasilkan teknologi ini; sebaliknya, kami cuba menghadam hakikat serius bahawa dalam hayat kami, kami benar-benar akan melihat mesin yang jauh lebih pintar daripada kita dan bentuk sistem ini sudah pun kelihatan, sambil memikirkan cara menyedarkan orang ramai tentang kepentingannya.

Tiga tahun kemudian, model bahasa penaakulan berkembang pesat sebagai sebahagian daripada ekonomi dan mula meluaskan batas sains. Model ini mampu mengendalikan komputer dan antara muka grafik, bekerjasama dengan manusia serta sesama sendiri dan melaksanakan projek penyelidikan. Model ini turut mengubah landskap keselamatan komputer dan dengan itu membawa bahaya baharu yang nyata.

Banyak penyelidikan baharu dijalankan sepanjang tempoh ini dan pemahaman kami tentang sistem tersebut sekali lagi agak berbeza berbanding pada 2023. Berdasarkan hasil dalaman, saya sangat menjangkakan bahawa kadar kemajuan ini dapat dikekalkan sehingga mencapai peningkatan kendiri rekursif. Jika pembangunan AI berterusan mengikut haluan semasa, sistem yang akan kita lihat dalam beberapa tahun akan datang berkemungkinan membawa lonjakan keupayaan yang sama besar atau lebih besar dan semakin memacu pembangunannya sendiri.

Inilah masa yang menuntut kita bertindak dengan amat berhati-hati. Saya bimbang tiada sesiapa yang bersedia menghadapi akibat daripada peningkatan pesat kecerdasan mesin yang berterusan. OpenAI akan terus mencari penyelesaian teknikal bagi penjajaran dan pemantauan, membina sistem pertahanan dan menghentikan peluasan selanjutnya secara sepihak apabila perlu; namun, saya percaya intervensi yang lebih meluas diperlukan.

Kecerdasan yang belum kita fahami sepenuhnya

Pada peringkat tinggi, kemajuan kecerdasan mesin didorong oleh peningkatan kuasa pengiraan. Kami di OpenAI benar-benar memahami hal ini sekitar 2017 setelah melihat hasil konsisten daripada peluasan dalam beberapa projek penyelidikan1. Hasilnya, kami berusaha mendapatkan akses kepada kuasa pengiraan yang jauh lebih besar daripada rancangan asal dan semakin menumpukan penyelidikan pada sebilangan kecil arah yang sangat mudah diperluas. Kami percaya itulah satu-satunya cara untuk berada di barisan hadapan penyelidikan AI dan mempengaruhi kesan AGI.

Sepanjang perjalanan ini, algoritma baharu telah dibangunkan dan pasukan serta penyelidik individu telah menghasilkan pelbagai pencapaian kreatif. Saya melihat sebahagian besarnya sebagai penemuan sepanjang proses peluasan; sains pembelajaran mendalam masih di peringkat awal dan kemajuan algoritma yang bermakna lazimnya berkait dengan akses kepada kuasa pengiraan. Jika dilihat dalam jangka masa beberapa tahun, AI terus menjadi lebih pintar apabila diperluas kepada komputer yang lebih besar.

Selaras dengan ramalan Ray Kurzweil pada penghujung abad ke-20(dibuka dalam tetingkap baru), kini kita berada pada detik dalam sejarah pengkomputeran apabila kecerdasan mesin mula melangkaui kecerdasan manusia dengan cara yang membawa perubahan besar.

AI lebih banyak ditumbuhkan daripada direka bentuk—pada asasnya, AI terhasil dengan mengulangi langkah pengoptimuman yang ringkas berkali-kali menggunakan kuasa pengiraan yang sukar dibayangkan besarnya. Proses ini menghasilkan sistem yang amat kompleks, mampu mengendalikan konsep abstrak dan mensimulasikan pelbagai aspek tingkah laku manusia. Kita boleh menemui pelbagai cerapan tentang mekanisme kecil yang muncul dalam sistem ini melalui proses yang menyerupai neurosains—dan seperti neurosains, keseluruhan tindakannya sukar dihuraikan dengan cara yang dapat kita fahami sepenuhnya.

Kajian tentang AI berasaskan pembelajaran mendalam sebahagian besarnya merupakan sains eksperimen. Kami mencurahkan banyak usaha untuk membina algoritma berprinsip dan membuat ramalan yang boleh diuji, tetapi pada asasnya, latihan berskala besar kami merupakan eksperimen dan adakalanya hasilnya mengejutkan kami. Selain itu, apabila sistem menjadi lebih berkeupayaan, hasilnya menjadi semakin sukar ditafsirkan.

Keadaan ini menjadi lebih rumit kerana algoritma semasa lazimnya meningkatkan keupayaan yang mudah diukur dengan lebih pantas berbanding keupayaan yang sukar dinilai secara objektif. Kami meluangkan banyak masa untuk memahami cara keupayaan membuat generalisasi dan perkara yang perlu diutamakan bagi memajukan kemahiran yang paling relevan dalam beberapa tahun akan datang. Contohnya, kami percaya tumpuan tambahan boleh menjadikan model lebih mahir khususnya dalam penyelidikan matematik, tetapi kami tidak mengutamakan hala tuju ini kerana rasa keperluan mendesak yang kami rasakan terhadap RSI dan penyelidikan penjajaran automatik, seperti yang akan saya bincangkan kemudian.

Kecerdasan yang terhasil daripada peluasan pembelajaran mendalam tidak boleh dibandingkan secara langsung dengan kecerdasan manusia. Untuk menjadi sangat berpengaruh di dunia nyata—sama ada sangat berguna atau sangat berbahaya—AI tidak perlu menyamai atau melangkaui semua keupayaan manusia; AI hanya perlu mengatasi jumlah keupayaan yang mencukupi. Apabila AI terus mengatasi manusia dalam semakin banyak dimensi, semakin sukar untuk memahami dengan tepat sejauh mana keupayaannya.

Mengajar mesin untuk menyayangi

Oleh sebab kecerdasan mesin terhasil daripada proses yang asasnya berbeza daripada kecerdasan manusia, kita tidak boleh menganggapnya secara lalai mematuhi prinsip manusia atau membuat generalisasi daripadanya seperti manusia. Masalah teras dalam penyelidikan AI ialah penjajaran—memastikan AI “cuba melakukan perkara yang betul” menurut piawaian manusia.

Untuk menyusun arah penyelidikan praktikal, saya mendapati bahawa pembezaan antara penjajaran matlamat dengan penjajaran nilai amat berguna.

Secara umum, penjajaran matlamat bermaksud: “adakah AI cuba mencapai matlamat yang ditetapkan untuknya?”. Ini boleh merangkumi pematuhan kepada hierarki arahan, atau keupayaan berkomunikasi dan bekerjasama dengan manusia untuk cuba memahami objektif mereka. Kumpulan arah penyelidikan ini amat relevan dari sudut amali.

Penjajaran nilai ialah sifat model yang lebih intrinsik. Ia merupakan keupayaan untuk berpegang pada dan membuat generalisasi daripada prinsip aras tinggi; bertindak “secara munasabah” walaupun diberi objektif yang tidak jelas atau bercanggah, atau ditempatkan dalam situasi asing atau bersifat melawan. AI yang sejajar harus bertindak dengan jujur, berintegriti dan menyayangi manusia.

Sudah tentu, sempadan antara penjajaran nilai dengan penjajaran matlamat boleh menjadi kabur, dan mengambil berat tentang matlamat dengan ikhlas memerlukan usaha menyimpulkan niat(dibuka dalam tetingkap baru) serta nilai yang mendasarinya. Namun, apabila saya membincangkan kepentingan jangka panjang penyelidikan penjajaran, secara umumnya saya merujuk kepada penjajaran nilai.

Cabaran asas penjajaran AI ialah generalisasi. Apabila mesin menjadi lebih pintar, mesin mula mengendalikan konsep aras lebih tinggi dan ditempatkan dalam persekitaran yang semakin berbeza daripada persekitaran yang ditemui semasa latihan. Mesin mungkin gagal membuat generalisasi daripada nilai yang diajar dan diperkukuh semasa latihan kepada situasi baharu tersebut; dan kita mungkin sukar memastikan cara mesin akan bertindak. Keadaan ini menjadi lebih sukar kerana keseluruhan ekosistem penggunaan AI berubah dengan sangat pantas; contohnya, AI yang dilatih hari ini perlu berdaya tahan ketika berinteraksi dengan pelbagai AI lain. Paling penting, AI pada masa hadapan perlu terus berpegang pada nilai kemanusiaan tanpa mengira sama ada AI percaya bahawa ia sedang diselia oleh manusia.

Terdapat dua kelompok utama kaedah yang kini digunakan secara praktikal untuk latihan penjajaran.

Kaedah pertama ialah menggalakkan tingkah laku sejajar sebagai sebahagian daripada pembelajaran pengukuhan berorientasikan matlamat. Tindakan model dinilai—biasanya oleh AI—berdasarkan keserasiannya dengan model keutamaan, “spesifikasi” atau “perlembagaan” tertentu, lalu diberi ganjaran yang sewajarnya. Pendekatan ini boleh menjadi sangat berkesan dalam kebanyakan keadaan dan merupakan bahagian teras dalam penghasilan pembantu AI moden. Malangnya, pendekatan ini juga boleh rapuh dan sangat bergantung pada keluasan penyeliaan latihan serta keupayaan model membuat generalisasi daripada situasi yang ditemuinya semasa latihan. Contohnya, dalam insiden OpenAI-Hugging Face, ejen mengekalkan batasan agar tidak melakukan kejuruteraan sosial terhadap manusia. Namun, ejen tersebut jelas gagal mengelak tindakan lain yang di luar skop dan bertentangan dengan semangat nilai yang diajar kepada mereka dalam situasi lain.

Pendekatan kedua berusaha memanfaatkan keupayaan model membuat generalisasi daripada data pralatihan. Ini boleh melibatkan pembentukan set data latihan yang mendorong penjajaran atau penumpuan model pada bahagian yang ‘sejajar’ dalam taburan pralatihan, seperti model pemilihan persona(dibuka dalam tetingkap baru). Kelemahan pendekatan ini terletak pada kekurangan daya tahan terhadap tekanan pengoptimuman selanjutnya. Jika model yang secara umumnya memikirkan perkara yang kelihatan 'sejajar' menjalani latihan yang mencukupi untuk mencapai objektif yang amat sukar, model itu boleh belajar menaakul secara berkepentingan: mengubah suai pemikiran yang kelihatan 'sejajar' mengikut keperluan demi mencapai matlamat. Kami mungkin telah melihat contoh tingkah laku sedemikian dalam insiden keselamatan siber baru-baru ini yang melibatkan model bukan OpenAI.

Kami melabur dengan besar dalam seluruh spektrum pendekatan yang dirangkumi oleh arah penyelidikan ini. Kami juga melihat kemajuan yang bermakna—GPT‑6 Astra ialah model pertama yang mendapat manfaat daripada beberapa kemajuan penting yang telah lama kami usahakan dan penjajarannya jauh lebih baik daripada GPT‑5.6 Sol. Namun, penting untuk mengakui dan memahami bahawa jauh lebih banyak kemajuan diperlukan apabila model semakin berkeupayaan; dan kemajuan dalam penjajaran yang boleh digeneralisasikan mungkin tidak cukup pantas untuk mengatasi kemajuan kecerdasan model secara umum.

Memantau generalisasi

Kami belum mempunyai teori generalisasi yang memuaskan dan nampaknya kami tidak mungkin dapat membangunkannya dalam masa terdekat, sekurang-kurangnya tanpa bantuan AI yang lebih berkuasa. Oleh itu, pada masa ini, keupayaan kami untuk mengesahkan teknik penjajaran secara empirikal boleh dikatakan lebih penting dalam amalan berbanding teknik itu sendiri.

Pertaruhan utama OpenAI dalam hal ini ialah pemantauan rentetan fikiran(dibuka dalam tetingkap baru). Ia berasaskan idea yang menarik dan mudah diperluas: sebahagian besar keupayaan model berasal daripada proses penaakulan yang diungkapkan dengan kata-kata (rentetan fikiran). Jika kami memperluas pengoptimuman berdasarkan hasil proses itu tetapi tidak menyelia proses tersebut, rentetan fikiran itu tidak mempunyai insentif langsung semasa latihan untuk menyembunyikan idea atau objektif yang tidak sejajar. Ini tidak bermakna model akan belajar menzahirkan kecenderungan tidak sejajar yang tidak bergantung pada rentetan fikiran; namun, ia membolehkan kami memantau secara khusus peningkatan keupayaan hasil penaakulan.

Kami memahami potensi pentingnya pemantauan rentetan fikiran ketika kami membangunkan model penaakulan. Apabila kami melancarkan o1‑preview, kami sengaja mereka bentuk produk itu untuk menyembunyikan rentetan fikiran bagi melindunginya daripada tekanan penyeliaan dalam jangka panjang2. Dalam pembangunan selepas itu, kami berusaha mengekalkan peraturan agar proses penaakulan tidak diselia. Pemantauan CoT menjadi alat yang amat penting bagi kami untuk mengkaji cara model kami membuat generalisasi daripada taburan latihan, sekali gus membolehkan kami memerhati dan menganalisis bukan sahaja tindakan, malah proses dalaman model.

Alat ini terus memainkan peranan penting ketika kami mengkaji model kelas Astra. Namun malangnya, penilaian kami menunjukkan bahawa keupayaan untuk bergantung pada pemantauan CoT semakin berkurang. Hal ini berpunca daripada gabungan beberapa faktor.

  • Model penaakulan moden digunakan dalam persekitaran yang lebih kompleks berbanding o1‑preview; proses penaakulannya semakin bercampur dengan komunikasi bersama manusia dan AI lain serta penggunaan alat. Banyak interaksi tersebut perlu diselia, lantas mengaburkan sempadan yang ingin kami kekalkan.
  • AI semakin mahir menaakul tentang dan memanipulasi proses penaakulannya sendiri.
  • Dengan peningkatan prestasi pralatihan, kami juga melihat model menjadi jauh lebih pintar walaupun tanpa menggunakan penaakulan yang diungkapkan dengan kata-kata.

Cabaran ini tidak semestinya mustahil diatasi. Saya berharap kami dapat membangunkan intervensi untuk meningkatkan kebolehpantauan rentetan fikiran model kami, misalnya dengan memahami dengan lebih baik interaksi antara pelbagai objektif pengoptimuman dengan bentuk pengiraan masa ujian yang digunakan oleh model. Saya juga percaya bahawa penggabungan idea daripada pemantauan CoT dan pengaktifan boleh memberikan nilai yang besar—dengan memperluas latihan pemantau yang mempunyai akses langsung kepada bahagian dalaman rangkaian, misalnya pengakuan(dibuka dalam tetingkap baru). Kami sedang giat mengusahakan idea ini. Namun begitu, saya menjangkakan kemajuan AI secara umum akan semakin dibatasi oleh tahap keyakinan terhadap pemantauan.

Pertahanan boleh skala

Hujah paling kukuh yang saya lihat untuk terus melatih model yang jauh lebih pintar dengan pantas ialah keperluan membina sistem pertahanan terhadap bahaya yang ditimbulkan oleh AI lain.

Risiko jelas yang dibincangkan sepanjang tahun ini melibatkan keselamatan siber: model semakin melangkaui keupayaan manusia untuk menceroboh masuk dan keluar daripada sistem komputer. Hal ini meluaskan skop risiko berkaitan AI dengan ketara: ejen akan dapat mengakses hampir semua infrastruktur kecuali yang paling selamat dan mempengaruhi sebahagian besar dunia secara langsung, walaupun tanpa tubuh fizikal. Pada masa ini, kami berada dalam tempoh peluang yang singkat untuk menggunakan model terbaik yang tersedia bagi memperketat keselamatan dengan ketara pada sistem kritikal.

Malangnya, risiko berkaitan AI akan terus meningkat selepas ini. Ejen berkeupayaan tinggi yang dilatih dan diarahkan secara khusus untuk melakukan perbuatan jahat membawa bahaya baharu; tindakannya mungkin melangkaui niat operatornya dan membuat generalisasi kepada tingkah laku yang berpotensi jauh lebih berniat jahat. Sempadan antara penyalahgunaan dengan tindakan autonomi yang tidak sejajar akan semakin kabur apabila AI memperoleh lebih banyak keupayaan bertindak sendiri. Kita mungkin terbiasa menganggap AI sebagai alat, tetapi sesetengah ejen akan mengejar objektif mereka sendiri. Mereka akan mencari jalan untuk bekerjasama dengan manusia melalui tawar-menawar, penipuan atau pemerasan.

Selain itu, terdapat risiko daripada teknologi baharu yang mungkin diwujudkan oleh AI, seperti patogen yang direkayasa.

Kita memerlukan AI yang berkuasa dan sejajar untuk pertahanan: melindungi infrastruktur, mempertahankan diri daripada ejen yang bertindak di luar kawalan dalam masa nyata dan mencipta langkah perlindungan yang serba baharu. Ini akan menjadi tumpuan utama usaha penerapan OpenAI.

Pada masa yang sama, walaupun terdapat ketidakpastian akibat jangkaan kemajuan AI yang meluas dan keperluan membina sistem pertahanan, kita tidak boleh membiarkan hal itu menjadi alasan untuk bertindak melulu. Gagasan untuk berlumba ke hadapan tanpa mengira akibat kelihatan tidak masuk akal setelah kita benar-benar memahami betapa seriusnya perkara yang dipertaruhkan.

Pacing RSI

Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.

Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.

I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.

The best way forward I see currently is a combination of both.

The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(dibuka dalam tetingkap baru), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(dibuka dalam tetingkap baru), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.

Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(dibuka dalam tetingkap baru) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.

The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.

What is next?

As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:

  1. Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
  2. Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
  3. Empowering everyone individually with a personal AGI.

I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.

As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.

Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.

Author

Jakub Pachocki

Nota kaki

  1. 1

    Ini termasuk memperluas permainan kendiri(dibuka dalam tetingkap baru), robotik(dibuka dalam tetingkap baru) dan, apabila dilihat kembali, yang paling menonjol ialah memperluas rangkaian berulang untuk memodelkan bahasa(dibuka dalam tetingkap baru), yang menjadi perintis kepada barisan penyelidikan GPT.

  2. 2

    Sebab kedua bagi reka bentuk ini adalah untuk mencegah pendistilan. Namun, sepanjang pembangunan, keutamaan yang lebih besar bagi kami sememangnya ialah mengekalkan kebolehpantauan CoT.