Langsung ke konten utama
OpenAI

6 September 2026

KeselamatanRiset

Pikiran Asing

Oleh: Jakub Pachocki, Kepala Ilmuwan di OpenAI

Memuat…

Pada pertengahan 2023, dalam proyek riset “RLSlow”, kami melihat hasil pertama yang meyakinkan kami bahwa pelatihan model penalaran dapat diskalakan, sehingga membuka kemampuan model pralatih untuk membentuk rantai pemikirannya sendiri. Szymon dan saya menghabiskan malam itu di kantor, bukan untuk memikirkan angka tolok ukur yang luar biasa, produk, atau hasil ilmiah yang akan dihasilkan teknologi ini, melainkan untuk mencoba mencerna kenyataan serius bahwa semasa hidup, kita benar-benar akan melihat mesin yang jauh lebih cerdas daripada kita; bentuk sistem tersebut pun sudah mulai terlihat. Kami bertanya-tanya bagaimana cara menyadarkan orang akan pentingnya hal ini.

Tiga tahun kemudian, model bahasa penalaran menjadi bagian ekonomi yang berkembang pesat dan mulai mendorong batas-batas ilmu pengetahuan. Model-model ini mampu mengoperasikan komputer dan antarmuka grafis, bekerja sama dengan manusia maupun sesamanya, serta menjalankan proyek riset. Model-model ini juga mengubah lanskap keamanan komputer dan dengan demikian menghadirkan bahaya baru yang nyata.

Banyak riset baru dilakukan selama periode ini, dan pemahaman kami tentang sistem tersebut kembali sedikit berubah dibandingkan pada 2023. Berdasarkan hasil internal, saya sangat memperkirakan bahwa laju kemajuan ini dapat berlanjut hingga mencapai peningkatan diri rekursif. Jika pengembangan AI terus mengikuti jalurnya saat ini, sistem yang akan kita lihat dalam beberapa tahun mendatang kemungkinan akan menunjukkan lompatan kemampuan lebih lanjut dengan skala yang sama atau lebih besar, dan makin mendorong pengembangannya sendiri.

Saat ini diperlukan kehati-hatian yang luar biasa. Saya khawatir belum ada yang siap menghadapi konsekuensi dari kecerdasan mesin yang terus meningkat pesat. OpenAI akan terus mencari solusi teknis untuk penyelarasan dan pemantauan, membangun sistem pertahanan, serta secara sepihak menahan penskalaan lebih lanjut jika diperlukan; namun, saya meyakini intervensi yang lebih luas diperlukan.

Kecerdasan yang belum sepenuhnya kita pahami

Secara garis besar, kemajuan kecerdasan mesin didorong oleh peningkatan daya komputasi. Kami di OpenAI benar-benar memahami hal ini sekitar 2017, setelah melihat manfaat penskalaan yang konsisten di berbagai proyek riset1. Karena itu, kami berupaya memperoleh akses ke komputasi yang jauh lebih besar daripada rencana awal dan makin memusatkan riset pada sejumlah kecil arah yang sangat mudah diskalakan. Kami meyakini bahwa itulah satu-satunya cara untuk berada di garis terdepan riset AI dan memengaruhi dampak AGI.

Sepanjang perjalanan, algoritme baru telah dikembangkan dan berbagai terobosan cerdas dicapai oleh tim maupun peneliti perorangan. Saya melihatnya terutama sebagai penemuan di sepanjang jalur penskalaan; ilmu deep learning masih dalam tahap awal, dan kemajuan algoritmik yang berarti cenderung berkorelasi dengan akses ke komputasi. Jika melihat cakrawala beberapa tahun, AI terus menjadi lebih cerdas seiring diskalakan pada komputer yang lebih besar.

Selaras dengan prediksi Ray Kurzweil dari akhir abad ke-20⁠(terbuka di jendela baru), kini kita berada pada momen dalam sejarah komputasi ketika kecerdasan mesin mulai melampaui kecerdasan manusia dengan cara yang transformatif.

AI lebih banyak ditumbuhkan daripada dirancang—pada dasarnya, AI merupakan hasil pengulangan langkah pengoptimalan sederhana berkali-kali dengan jumlah komputasi yang sulit dibayangkan. Proses ini menghasilkan sistem yang luar biasa kompleks, mampu mengolah konsep abstrak, dan dapat menyimulasikan berbagai aspek perilaku manusia. Kita dapat menemukan berbagai wawasan tentang mekanisme kecil yang muncul dalam sistem ini melalui proses yang mirip ilmu saraf—dan seperti ilmu saraf, keseluruhan cara kerjanya sulit dijelaskan dengan cara yang dapat kita pahami sepenuhnya.

Kajian AI berbasis deep learning sebagian besar merupakan ilmu eksperimental. Kami mencurahkan banyak upaya⁠ untuk membangun algoritme berlandaskan prinsip dan membuat prediksi yang dapat diuji, tetapi pada dasarnya, pelatihan skala besar kami adalah eksperimen, dan terkadang hasilnya mengejutkan kami. Selain itu, seiring meningkatnya kemampuan sistem, hasilnya makin sulit ditafsirkan.

Keadaan ini makin rumit karena algoritme saat ini umumnya meningkatkan kemampuan yang mudah diukur dengan lebih cepat daripada kemampuan yang sulit dikuantifikasi secara objektif. Kami mencurahkan banyak waktu untuk memahami bagaimana kemampuan melakukan generalisasi dan apa yang harus diprioritaskan guna mengembangkan keterampilan yang paling relevan dalam beberapa tahun mendatang. Misalnya, kami yakin dapat membuat model lebih baik khususnya dalam riset matematika dengan fokus tambahan, tetapi kami tidak memprioritaskan arah ini karena urgensi yang kami rasakan terkait RSI dan riset penyelarasan otomatis, seperti yang akan saya bahas nanti.

Kecerdasan yang dihasilkan melalui penskalaan deep learning tidak dapat dibandingkan secara langsung dengan kecerdasan manusia. Untuk menjadi sangat relevan di dunia nyata—baik sangat berguna maupun sangat berbahaya—AI tidak perlu menyamai atau melampaui seluruh kemampuan manusia; AI hanya perlu melampaui cukup banyak di antaranya. Seiring AI terus melampaui manusia dalam makin banyak aspek, makin sulit pula memahami secara tepat seberapa besar kemampuannya.

Mengajari mesin untuk mencintai

Karena kecerdasan mesin berasal dari proses yang secara mendasar berbeda dari kecerdasan manusia, kita tidak dapat berasumsi bahwa kecerdasan tersebut secara otomatis mengikuti prinsip manusia atau melakukan generalisasi darinya seperti manusia. Masalah utama dalam riset AI adalah penyelarasan—membuat AI “berusaha melakukan hal yang benar” menurut standar manusia.

Untuk menata arah riset praktis, saya merasa berguna untuk membedakan penyelarasan tujuan dan penyelarasan nilai.

Secara umum, penyelarasan tujuan berarti: “apakah AI berusaha mencapai tujuan yang diberikan kepadanya?”. Hal ini dapat mencakup kepatuhan terhadap hierarki instruksi⁠, atau kemampuan berkomunikasi dan bekerja sama dengan manusia untuk mencoba memahami tujuan mereka. Rangkaian arah ini memiliki relevansi praktis yang sangat besar.

Penyelarasan nilai merupakan sifat model yang lebih intrinsik. Ini adalah kemampuan untuk memegang dan melakukan generalisasi dari serangkaian prinsip tingkat tinggi; untuk bertindak “secara wajar” bahkan ketika diberi tujuan yang tidak jelas atau saling bertentangan, maupun ditempatkan dalam situasi asing atau penuh perlawanan. AI yang selaras seharusnya bertindak dengan jujur, berintegritas, dan mencintai umat manusia.

Tentu saja, batas antara penyelarasan nilai dan tujuan dapat kabur, dan kepedulian sejati terhadap tujuan mengharuskan upaya untuk menyimpulkan niat⁠(terbuka di jendela baru) dan nilai yang mendasarinya. Namun, ketika membahas pentingnya riset penyelarasan dalam jangka panjang, saya umumnya merujuk pada penyelarasan nilai.

Tantangan mendasar dalam penyelarasan AI adalah generalisasi. Seiring mesin menjadi lebih cerdas, mesin menangani konsep yang lebih tinggi dan ditempatkan dalam lingkungan yang makin berbeda dari lingkungan yang ditemuinya selama pelatihan. Mesin dapat gagal menggeneralisasi nilai-nilai yang diajarkan dan diperkuat selama pelatihan ke situasi baru tersebut; kita pun mungkin kesulitan memastikan bagaimana mesin akan bertindak. Masalah ini makin sulit karena keseluruhan ekosistem tempat AI digunakan berubah sangat cepat; misalnya, AI yang dilatih saat ini harus tangguh saat berinteraksi dengan beragam AI lain. Yang terpenting, kita memerlukan AI masa depan yang terus memegang nilai-nilai manusia, terlepas dari apakah AI itu merasa sedang diawasi manusia.

Saat ini terdapat dua kelompok utama metode pelatihan penyelarasan yang digunakan dalam praktik.

Metode pertama mendorong perilaku selaras sebagai bagian dari reinforcement learning yang berorientasi pada tujuan. Tindakan model dievaluasi—biasanya oleh AI—berdasarkan kesesuaiannya dengan model preferensi, “spesifikasi”, atau “konstitusi” tertentu, lalu diberi imbalan yang sesuai. Pendekatan ini dapat sangat efektif dalam kasus umum dan menjadi bagian utama dari cara pembuatan asisten AI modern. Sayangnya, pendekatan ini juga dapat rapuh dan sangat bergantung pada cakupan pengawasan pelatihan serta kemampuan model untuk melakukan generalisasi dari situasi yang ditemuinya selama pelatihan. Sebagai contoh, dalam insiden OpenAI–Hugging Face, para agen mempertahankan batasan untuk tidak merekayasa manusia secara sosial. Namun, mereka jelas gagal menahan diri dari tindakan lain yang berada di luar cakupan dan bertentangan dengan semangat nilai-nilai yang diajarkan kepada mereka dalam situasi lain.

Pendekatan kedua berupaya memanfaatkan kemampuan model untuk melakukan generalisasi dari data prapelatihan. Hal ini dapat mencakup penyusunan set data pelatihan yang mendorong penyelarasan, atau memusatkan model pada bagian “selaras” dari distribusi prapelatihan, seperti dalam model pemilihan persona⁠(terbuka di jendela baru). Kelemahan pendekatan ini terletak pada kurangnya ketangguhan terhadap tekanan pengoptimalan lebih lanjut. Jika model yang umumnya memiliki pemikiran 'selaras' diberi cukup banyak pelatihan untuk mencapai tujuan yang sangat sulit, model itu dapat belajar menalar secara termotivasi: membengkokkan pemikiran yang tampak 'selaras' sesuai kebutuhan demi mencapai tujuan. Kita mungkin telah melihat contoh perilaku semacam itu dalam insiden keamanan siber baru-baru ini yang melibatkan model bukan milik OpenAI.

Kami berinvestasi besar pada seluruh spektrum pendekatan yang mencakup arah-arah ini. Kami juga melihat kemajuan yang bermakna—GPT‑6 Astra adalah model pertama yang mendapat manfaat dari sejumlah kemajuan penting yang telah lama kami kembangkan, dan penyelarasannya jauh lebih baik daripada GPT‑5.6 Sol. Meski demikian, penting untuk mengakui dan memahami bahwa kemajuan yang jauh lebih besar diperlukan seiring meningkatnya kemampuan model; dan kemajuan penyelarasan yang dapat digeneralisasi mungkin tidak cukup melampaui kemajuan kecerdasan model secara umum.

Memantau generalisasi

Kami belum memiliki teori generalisasi yang memuaskan, dan tampaknya kecil kemungkinannya kami dapat segera mengembangkan teori semacam itu, setidaknya tanpa bantuan AI yang lebih canggih. Karena itu, saat ini kemampuan kami untuk memvalidasi teknik penyelarasan secara empiris bisa dibilang bahkan lebih penting dalam praktiknya daripada teknik penyelarasan itu sendiri.

Andalan utama OpenAI dalam hal ini adalah pemantauan rantai pemikiran⁠(terbuka di jendela baru). Pendekatan ini didasarkan pada gagasan yang menarik dan mudah diskalakan: sebagian besar kemampuan model berasal dari proses penalaran yang diungkapkan secara verbal (rantai pemikiran). Jika kita meningkatkan skala pengoptimalan hasil proses tersebut, tetapi tidak mengawasi prosesnya sendiri, rantai pemikiran itu tidak memiliki insentif langsung selama pelatihan untuk menyembunyikan gagasan atau tujuan yang tidak selaras. Ini tidak berarti model akan belajar mengungkapkan kecenderungan tidak selaras yang tidak bergantung pada penggunaan rantai pemikiran; tetapi, hal ini memungkinkan kita memantau secara tepat peningkatan kemampuan yang berasal dari penalaran.

Kami memahami potensi pentingnya pemantauan rantai pemikiran ketika kami mengembangkan model penalaran. Saat meluncurkan o1‑preview, kami sengaja merancang produk untuk menyembunyikan rantai pemikiran⁠ guna melindunginya dari tekanan pengawasan dalam jangka panjang2. Dalam pengembangan sejak saat itu, kami berupaya mempertahankan aturan untuk tidak mengawasi proses penalaran. Pemantauan CoT menjadi alat yang sangat penting bagi kami untuk mempelajari cara model kami melakukan generalisasi dari distribusi pelatihannya, sehingga kami dapat mengamati dan menganalisis bukan hanya tindakannya, tetapi juga proses internalnya.

Alat ini tetap sangat penting saat kami mempelajari kelas model Astra. Namun sayangnya, evaluasi kami menunjukkan bahwa kemampuan kami untuk mengandalkan pemantauan CoT terus berkurang. Hal ini disebabkan oleh gabungan sejumlah faktor.

  • Model penalaran modern digunakan dalam lingkungan yang lebih kompleks daripada o1‑preview; proses penalarannya makin menyatu dengan komunikasi bersama manusia dan AI lain, serta penggunaan alat. Banyak interaksi tersebut harus diawasi, sehingga mengaburkan batas yang ingin kami pertahankan.

  • AI makin mahir menalar dan memanipulasi proses penalarannya sendiri.

  • Seiring meningkatnya kinerja prapelatihan, kami juga melihat model menjadi jauh lebih cerdas bahkan tanpa menggunakan penalaran verbal sama sekali.

Tantangan ini belum tentu tidak dapat diatasi. Saya berharap kami dapat mengembangkan intervensi untuk meningkatkan keterpantauan rantai pemikiran model kami, misalnya dengan memahami secara lebih baik interaksi antara beragam tujuan pengoptimalan dan bentuk komputasi saat pengujian yang digunakan model. Saya juga meyakini bahwa menggabungkan gagasan dari pemantauan CoT dan aktivasi dapat sangat bermanfaat—dengan meningkatkan skala pelatihan pemantau yang memiliki akses langsung ke bagian internal jaringan, misalnya pengakuan⁠(terbuka di jendela baru). Kami sedang aktif mengembangkan gagasan-gagasan ini. Meski begitu, saya memperkirakan kemajuan AI secara umum akan makin terhambat oleh tingkat keyakinan terhadap pemantauan.

Pertahanan yang dapat diskalakan

Argumen terkuat yang saya lihat untuk terus melatih model yang jauh lebih cerdas dengan cepat adalah kebutuhan membangun sistem pertahanan terhadap bahaya yang ditimbulkan AI lain.

Risiko nyata yang dibahas sepanjang tahun ini berkaitan dengan keamanan siber: model makin melampaui kemampuan manusia dalam membobol dan keluar dari sistem komputer. Hal ini memperluas cakupan risiko terkait AI secara drastis: para agen akan dapat mengakses hampir semua infrastruktur kecuali yang paling aman, serta memengaruhi banyak bagian dunia secara langsung, bahkan tanpa tubuh fisik. Saat ini, kita berada dalam rentang waktu yang sempit⁠ untuk menggunakan model terbaik yang tersedia guna memperketat keamanan secara signifikan⁠ pada sistem-sistem kritis.

Sayangnya, risiko terkait AI akan terus meningkat dari sini. Agen berkemampuan tinggi yang secara khusus dilatih dan diperintahkan untuk melakukan tindakan jahat menghadirkan jenis bahaya baru; tindakannya kemungkinan akan melampaui cakupan niat operatornya dan berkembang menjadi perilaku yang mungkin jauh lebih berbahaya. Batas antara penyalahgunaan dan tindakan otonom yang tidak selaras akan mengabur seiring AI memperoleh lebih banyak keleluasaan untuk bertindak. Kita mungkin terbiasa menganggap AI sebagai alat, tetapi sebagian agen akan mengejar tujuan mereka sendiri. Mereka akan mencari cara untuk bekerja sama dengan manusia melalui tawar-menawar, penipuan, atau pemerasan.

Selain itu, terdapat risiko dari teknologi baru yang mungkin dimungkinkan oleh AI, seperti patogen hasil rekayasa.

Kita akan membutuhkan AI yang canggih dan selaras untuk pertahanan: mengamankan infrastruktur, melindungi dari agen liar secara waktu nyata, dan menciptakan langkah perlindungan yang sepenuhnya baru. Hal ini akan menjadi fokus utama upaya penerapan OpenAI.

Pada saat yang sama, meski ada ketidakpastian akibat perkiraan kemajuan AI yang luas dan kebutuhan membangun sistem pertahanan, kita tidak boleh menjadikannya alasan untuk bertindak gegabah. Gagasan untuk berlomba maju dengan segala cara terasa tidak masuk akal setelah kita benar-benar memahami betapa seriusnya hal yang dipertaruhkan.

Mengatur laju RSI

Meningkatnya peran kecerdasan mesin dalam proses pengembangannya sendiri merupakan konsekuensi alami dari kemajuan teknologi yang berkelanjutan. Jika kemajuan AI berlanjut, peningkatan diri rekursif mesin (RSI) akan menjadi inti penemuan ilmiah pada masa depan.

Riset AI otomatis merupakan bentuk yang lebih dramatis dari penskalaan kecerdasan melalui komputasi; dan tentu saja, sebagai bagian darinya, AI akan meningkatkan substrat komputasinya sendiri⁠. Seperti halnya penskalaan, kami mengarahkan riset OpenAI pada RSI karena meyakini bahwa inilah satu-satunya cara untuk tetap berada di garis terdepan riset AI ke depan.

Saya ingin menekankan bahwa pernyataan di atas tidak berarti saya menganggap percepatan besar-besaran riset deep learning—terutama dalam jangka pendek—sebagai langkah kolektif yang tepat bagi komunitas riset. Namun, saya memang berpikir bahwa arah saat ini akan membawa kita ke sana, dan kita semua perlu secara sadar memilih cara melanjutkannya. Pilihan utama yang kita miliki adalah mengarahkan proses tersebut untuk memperkuat penyelarasan dan pemantauan seiring kemajuan AI serta mencari cara agar manusia tetap terlibat; atau berkoordinasi untuk memperlambat pengembangan mendatang sesuai kebutuhan hingga kita yakin terhadap langkah-langkah ini.

Menurut saya, jalan terbaik saat ini adalah menggabungkan keduanya.

Kemajuan konkret yang kami capai dalam penyelarasan dan pemantauan umumnya sangat terkait dengan kemajuan AI secara keseluruhan. Contoh yang sangat baik adalah RL dari umpan balik manusia⁠(terbuka di jendela baru), yang sangat penting dalam pelatihan asisten AI awal, dan pemantauan rantai pemikiran⁠(terbuka di jendela baru) yang telah disebutkan, yang dimungkinkan oleh kemajuan model penalaran. Kita harus memusatkan proses riset yang makin otomatis pada pengembangan wawasan, algoritme, dan teori baru semacam itu, serta secara bertahap membangun dasar pembuktian keamanan bagi AI yang lebih canggih.

Penskalaan sistem AI harus dibatasi oleh tingkat keyakinan kita terhadap keamanannya. Kita perlu mengembangkan komitmen seperti Kerangka Kerja Kesiapan⁠ atau Kebijakan Penskalaan yang Bertanggung Jawab⁠(terbuka di jendela baru) menjadi standar keamanan yang diwajibkan secara luas untuk melanjutkan pengembangan. Standar ini dapat ditegakkan oleh jaringan auditor pihak ketiga, lembaga pemerintah, atau badan internasional.

Tantangan utama dalam mengotomatiskan riset AI bukanlah “mencapai tujuan”—melainkan mencapainya dengan cara yang membuat manusia tetap menjadi bagian dari proses peningkatan berkelanjutan dan memastikan masa depan tetap berada di tangan umat manusia.

Apa selanjutnya?

Seperti yang baru-baru ini kami uraikan bersama Sam⁠, OpenAI memprioritaskan pekerjaan yang mendukung tiga pedoman utama:

  1. Mengarungi periode kemajuan AI berikutnya dengan membangun peneliti AI otomatis, menggunakannya untuk menyempurnakan solusi masalah penyelarasan secara bertahap, dan mencari cara agar manusia tetap menjadi bagian dari siklus peningkatan diri.

  2. Menghadirkan manfaat kemajuan ilmiah dan pertumbuhan ekonomi yang dimungkinkan oleh mesin-mesin sangat cerdas.

  3. Memberdayakan setiap orang dengan AGI pribadi.

Dalam esai ini, saya hanya berfokus pada poin pertama karena saya meyakininya sebagai hal yang paling mendesak. Namun, saya menyimpan harapan besar dan penghargaan mendalam terhadap manfaat yang akan dibawa oleh kemajuan teknologi selanjutnya. AI masa depan yang selaras dapat memajukan ilmu pengetahuan, mengembangkan terapi baru, dan menghadirkan kemakmuran material secara luas. AI yang bersahabat dan jujur dapat membantu orang menghadapi kesulitan dalam hidup serta meningkatkan kebahagiaan dan rasa kepuasan mereka secara bermakna. OpenAI mencurahkan upaya yang sangat besar untuk mewujudkan manfaat-manfaat ini. Salah satu contoh saat ini yang saya banggakan—dan dirasakan bermanfaat oleh orang-orang terdekat saya—adalah investasi besar pada kemampuan ChatGPT untuk memberikan informasi kesehatan.

Betapapun besarnya potensi jangka panjang AI, sebagian besar fokus kita seharusnya tertuju pada beberapa tahun mendatang. Kita menghadapi peralihan menuju dunia dengan mesin yang luar biasa cerdas, dan kita harus memastikan peralihan itu berjalan baik bagi umat manusia. Kita perlu mencari cara untuk mempertahankan kendali manusia atas tindakannya sendiri dan mengukuhkan nilai hakiki kemanusiaan di dunia tempat sebagian besar tugas dapat dilakukan oleh AI. Kita perlu mencegah pemusatan kekuasaan yang ekstrem di dunia tempat pekerjaan yang dahulu membutuhkan ribuan pakar kini dapat dilakukan oleh segelintir orang yang mengoperasikan komputer besar. Kita juga perlu memastikan manusia tetap mengendalikan masa depan dan tidak tertinggal oleh kemajuan tak terkendali yang dihasilkan oleh kecerdasan asing yang melampaui kecerdasan kita.

Saat ini, saya meyakini belum ada laboratorium yang memecahkan masalah penyelarasan dan pemantauan secara memadai untuk terus melakukan penskalaan secara bertanggung jawab dengan kecepatan maksimum lebih lama lagi. Saya memperkirakan dan berharap perlambatan sukarela akan menjadi hal yang lazim hingga standar keamanan bersama ditetapkan. Saya juga meyakini bahwa koordinasi internasional terkait pengembangan AI pada masa depan perlu menjadi prioritas utama pemerintah di seluruh dunia.

Penulis

Jakub Pachocki

Catatan kaki

  1. 1

    Ini mencakup penskalaan permainan mandiri⁠(terbuka di jendela baru), robotika⁠(terbuka di jendela baru), dan—yang jika ditinjau kembali paling menonjol—penskalaan jaringan berulang untuk memodelkan bahasa⁠(terbuka di jendela baru), yang menjadi pendahulu rangkaian riset GPT.

  2. 2

    Alasan sekunder di balik desain ini adalah mencegah distilasi. Namun, mempertahankan keterpantauan CoT secara eksplisit menjadi prioritas yang lebih besar bagi kami selama pengembangan.