Langsung ke konten utama
OpenAI

Percepatan riset: Perspektif dari dalam OpenAI

Memuat…

Agar AGI bermanfaat bagi seluruh umat manusia, kami yakin tata kelolanya harus demokratis. Ini hanya mungkin melalui debat publik berbasis informasi tentang kapabilitas, risiko, dan pengamanan sistem AI yang sangat cakap. Masyarakat di mana pun perlu memahami kemungkinan arah AI terdepan agar dapat ikut menentukan perkembangannya secara bermakna.

Transparansi tentang risiko, insiden, dan pengamanan tertentu perlu, tetapi belum cukup. Publik juga perlu memahami perkembangan sistem tercanggih dan perannya dalam memajukan riset di laboratorium AI terdepan.

Kami ingin membangun peneliti AI otomatis secara aman, yang bekerja di bawah pengawasan manusia untuk memajukan deep learning dan keselarasan melalui perbaikan iteratif. Menurut pengukuran kami, target memiliki peneliti magang otomatis pada September tahun ini, yang diumumkan⁠(terbuka di jendela baru) musim gugur lalu, kini tercapai. “Peneliti magang” berarti sistem yang menjalankan tugas riset terdefinisi jelas di bawah arahan manusia, termasuk tugas yang memerlukan beberapa hari bagi peneliti terampil. Kami membuat kemajuan besar menuju peneliti AI otomatis pada Maret 2028.

Sepanjang tahun ini, pekerjaan sehari-hari peneliti OpenAI berubah drastis. Peneliti menggunakan agen pengodean sepanjang hari, sering dalam sesi bersamaan. Total penggunaannya melonjak, melampaui pertumbuhan di tim OpenAI lain. Peneliti menyumbangkan kode lebih cepat dan menjalankan lebih banyak eksperimen. Cara penggunaan agen juga berubah: agen menangani tugas yang makin kompleks dan lebih sering berhasil. Riset AI adalah proses kompleks dengan banyak potensi hambatan, sehingga laju kemajuan keseluruhan mungkin tidak secepat metrik-metrik ini. Namun, temuan ini secara umum sejalan dengan kesan banyak rekan internal bahwa alat agentik mempercepat kemajuan riset secara berarti. Manusia tetap menetapkan prioritas riset, memilih ide dan hasil yang akan ditindaklanjuti, serta memutuskan untuk memperbesar skala, menjeda, atau menerapkan sistem.

Jika dilakukan secara bertanggung jawab, riset AI otomatis dapat menghasilkan model yang langsung meningkatkan kesejahteraan manusia dan memajukan misi OpenAI. Ini dapat menekan biaya kecerdasan canggih agar masyarakat di seluruh dunia memperoleh manfaatnya. Salah satu alasan kami mengupayakan ini adalah potensi riset otomatis untuk memecahkan masalah keselarasan dan membangun pertahanan terhadap AI yang makin cakap. Peneliti AI otomatis juga dapat menjadi peneliti keselamatan atau keselarasan otomatis. Sistem yang lebih cakap dan selaras dapat membantu mengamankan infrastruktur kritis, melawan agen AI berbahaya, dan mengembangkan perlindungan baru.

Inilah alasan mengembangkan kapabilitas riset otomatis yang berguna, tetapi bukan berarti RSI cepat pasti merupakan hasil yang perlu dikejar. Keputusan untuk melanjutkan dan caranya harus bergantung pada kemampuan menjaga kendali manusia serta pilihan demokratis berbasis informasi tentang manfaat dan risikonya.

Kami belum tahu cara aman mencapai RSI penuh yang selaras. Kami berupaya meningkatkan skala langkah keselarasan dan keselamatan seiring kapabilitas. Namun, kemajuan keselarasan dan keselamatan belum tentu mengimbangi kapabilitas, dan sistem yang lebih cakap bisa lebih sulit dipantau. Upaya keselarasan dan keselamatan yang cermat menjadi inti pekerjaan ini, dimulai dengan mengukur dan memitigasi masalah keselamatan pada sistem pengodean agentik saat ini. Jika melanjutkan pekerjaan menimbulkan risiko keselamatan yang tak dapat diterima, kami akan merespons sewajarnya, termasuk memperlambat atau menghentikan pengembangan atau penerapan sistem yang belum dapat kami amankan secara memadai.

Setelah insiden Hugging Face baru-baru ini, kami mewujudkan komitmen ini⁠ dengan menjeda pelatihan reinforcement learning (RL) pada model terbaru yang akan diterapkan, sambil memperketat keamanan dan menguji lingkungan riset lewat red teaming serta memperluas cakupan pemantauan. Tidak semua riset berhenti: sebagian beban kerja dilanjutkan dengan kontrol lebih kuat, sementara lainnya tetap dijeda. Kami menaikkan standar keselamatan dan keselarasan serta mengintegrasikan keselamatan lebih jauh ke siklus hidup model, dengan bukti perilaku selaras yang lebih kuat sepanjang pelatihan.

Hari ini kami memaparkan secara terperinci kontribusi sistem agentik pada kemajuan menuju RSI dalam beberapa bulan terakhir. Sistem agentik masih baru dan cepat berubah; pengukuran kami pun masih tahap awal. Dengan membagikan hasil awal dan metodenya, kami ingin menginformasikan publik, mendorong norma keterbukaan, dan membantu bidang ini menuju standar pengukuran bersama.

Seperti dalam cetak biru kebijakan AI terdepan⁠ kami, kami yakin perusahaan seperti kami harus diwajibkan melacak kemajuan menuju RSI secara terbuka. Tanpa kewajiban itu pun, kami berencana tetap transparan tentang kemajuan RSI. Pendekatan transparansi akan berkembang seiring perbaikan pengukuran dan pemahaman, dengan tetap menjaga keamanan serta informasi milik perusahaan.

1. Agen pengodean mengubah pekerjaan sehari-hari peneliti OpenAI

Pada awal tahun, peneliti OpenAI pada median penggunaan agen hanya sedikit menggunakan agen pengodean. Pada pertengahan Agustus, peneliti pada median sudah memakai agen setiap hari, dengan inferensi senilai lebih dari $600 per hari berdasarkan harga API. Pengguna pada persentil ke-90 di organisasi riset kini memakai token senilai lebih dari $7.000 per hari.

Sebelum Juni 2026, total waktu kerja agen di organisasi riset masih di bawah total waktu kerja manusia. Kini hal itu berubah. Dengan standar 8 jam per hari kerja, pada pertengahan Agustus organisasi riset menggunakan total 3,1 hari kerja agen untuk setiap hari kerja manusia.

Cara lain melihatnya adalah menghitung peneliti yang menggunakan banyak alur kerja bersamaan, misalnya 4 agen atau lebih sekaligus. Seperti terlihat di bawah, jumlah ini meningkat. Angka ini mencakup puncak harian agen yang dimulai langsung oleh pengguna maupun subagen yang kemudian dibuat oleh agen tersebut.

2. Peneliti menulis lebih banyak kode dan menjalankan lebih banyak eksperimen

Sebagian besar riset AI merupakan proses padat karya untuk mengintegrasikan peningkatan kecerdasan atau kinerja ke salah satu model inti kami. Kapabilitas meningkat ketika semua tahap berjalan baik: peneliti merancang peningkatan, menulis evaluasi kinerja, membangun infrastruktur pengujian berskala besar, mendeteksi bug serta perilaku tidak aman atau tidak selaras selama pelatihan, lalu memasukkan ide terbaik ke pelatihan inti. Kegagalan di satu bagian riset dapat menghambat seluruh siklus.

Menulis kode dan menjalankan eksperimen adalah dua kegiatan utama peneliti, dan bukti menunjukkan keduanya makin cepat.

Data ini relatif mudah diukur, tetapi bisa sulit ditafsirkan. Seiring otomatisasi, tugas yang paling sulit diotomatisasi akan menyerap lebih banyak upaya peneliti dan menjadi hambatan utama kemajuan. Komputasi juga membatasi kemajuan, dan perannya mungkin membesar saat hambatan lain berkurang.

Sepanjang 2026, eksperimen per pelaksana aktif meningkat. Agustus 2026 mencapai rekor sejak pencatatan dimulai Januari 2025. Ini berkorelasi dengan adopsi Codex, meski komputasi yang tersedia juga tumbuh pesat sejak 2025.

3. Pekerjaan yang didelegasikan peneliti kepada agen berubah

Kesan kualitatif dan data internal menunjukkan perubahan tugas yang didelegasikan ke agen pengodean: tugas tingkat tinggi dan berjangka lebih panjang makin umum.

Untuk memperjelas tren ini, kami menganalisis penggunaan terbaru di organisasi riset dengan taksonomi yang baru diterbitkan⁠(terbuka di jendela baru) oleh Epoch AI tentang jenis pekerjaan dalam siklus litbang AI. Terinspirasi sistem klasifikasi pekerjaan O*NET yang telah lama digunakan, taksonomi khusus litbang AI terdepan ini membagi proses menjadi enam tahap:

  1. Putuskan: apa yang dikerjakan, dilanjutkan, dan mendapat alokasi

  2. Rancang: ide riset dan spesifikasi teknis

  3. Bangun: kode dan dataset

  4. Jalankan: pelatihan/evaluasi, perangkat keras, layanan

  5. Analisis: eksperimen, model, penerapan, pekerjaan eksternal

  6. Komunikasikan: temuan, masukan, status, keputusan

Di bawah, kami mengelompokkan token agen pengodean menurut taksonomi ini.

Semua kategori kegiatan riset meningkat antara Januari dan Agustus 2026. Pada Januari, kode riset dan infrastruktur mendominasi. Kategori ini berkembang, begitu pula kategori lain, terutama bantuan teknis dan pemantauan proses. Perencanaan tingkat tinggi masih merupakan bagian sangat kecil dari token keluaran agen.

Secara anekdotal, rekan melaporkan keunggulan agen pengodean dalam mengatasi masalah infrastruktur riset internal, salah satu hambatan penting kemajuan riset. Beberapa tim yang mengadakan konsultasi pemecahan masalah eksperimen mencatat penurunan peserta pada 2026. Satu tim bahkan menghentikannya untuk berfokus pada perbaikan sistem lain.

Di sini kami memetakan jumlah postingan utama harian di salah satu kanal internal utama tempat peneliti meminta dukungan teknis tim lain. Setahu kami, penurunan aktivitas itu tidak diimbangi perpindahan pertanyaan ke kanal dukungan teknis lain yang dikelola manusia. Penurunan aktivitas ini sejalan dengan pergeseran yang lebih luas.

Kami juga dapat meneliti keberhasilan agen pengodean mengerjakan tugas dari peneliti. Dengan pengklasifikasi agentik, kami menemukan peningkatan umum tingkat keberhasilan dari Januari hingga Juli pada sejumlah kelompok kesulitan (berdasarkan estimasi waktu manusia), untuk tugas yang hasil aktualnya dapat diketahui. Namun, agen masih memerlukan banyak arahan manusia agar berhasil, terutama saat tugas makin kompleks. Dalam 6 bulan terakhir, lebih dari separuh tugas 4–8 jam yang berhasil melibatkan setidaknya 1 intervensi.

Tingkat keberhasilan pada tugas peneliti meningkat seiring waktu. Grafik tidak mencakup klasifikasi dengan hasil tidak pasti dan titik dengan <50 sesi atau <50 pengguna unik.

Tingkat keberhasilan tugas dan intervensi dari Januari hingga Juli, menurut horizon waktu. Tidak mencakup klasifikasi dengan hasil yang tidak pasti.

4. Mengatur laju pengembangan model

Kemajuan menuju sistem yang lebih cakap demi AGI yang aman dan bermanfaat juga akan bergantung pada langkah pengamanan yang diperlukan untuk pekerjaan tersebut. Penilaian kami tentang langkah pengamanan yang dibutuhkan dapat berubah seiring bertambahnya pemahaman kami tentang risikonya.

Seperti yang telah kami jelaskan,⁠ kami baru-baru ini memperbarui standar pemantauan, keselarasan, dan keamanan. Di sini, kami menunjukkan dampak pembatasan terbaru terhadap salah satu aspek kegiatan riset.

*Sebagian besar komputasi Astra yang ditampilkan di sini antara 20 Juli dan 6 Agustus ditujukan untuk menguji penerapan peningkatan keselamatan dan keamanan.

Pada 20 Juli, setelah mengetahui bahwa agen telah membobol infrastruktur riset kami, kami menonaktifkan sementara layanan kontainer untuk pelatihan, lalu memulihkannya dengan pembatasan tambahan yang signifikan.

Hal ini menyebabkan penurunan tajam komputasi pelatihan RL sementara tim menyesuaikan alur kerja agar dapat beroperasi dalam lingkungan riset yang diperketat keamanannya. Grafik di atas mencakup jeda reinforcement learning selama dua minggu pada model terbaru kami yang akan diterapkan. Sebagian besar proses eksperimen RL kelas Astra antara 20 Juli dan 6 Agustus (berdasarkan alokasi GPU) ditujukan untuk menguji penerapan peningkatan keselamatan dan keamanan.

Pada 7 Agustus, bukti awal bahwa Astra mungkin memiliki kapabilitas siber kritis⁠ menurut Kerangka Kerja Kesiapan⁠(terbuka di jendela baru) kami mendorong pembatasan keamanan tambahan khusus model, yang mengharuskan model Astra dijalankan di lingkungan riset dengan keamanan lebih tinggi. Pada minggu berikutnya, alokasi GPU kelas Astra turun lagi sebesar 59,2 persen, tetapi alokasi untuk kelas model lain naik 17,2 persen. Kenaikan itu mengimbangi sekitar 85 persen penurunan kelas Astra, sehingga total alokasi pada beban kerja RL yang dianalisis relatif tidak berubah. Pola ini konsisten dengan pengalihan sebagian pelatihan dan eksperimen ke model non-Astra saat pekerjaan yang melibatkan Astra dibatasi. Hal ini juga sejalan dengan laporan anekdotal tentang peneliti yang menemukan penggunaan lain untuk komputasi yang tidak lagi dapat digunakan bagi beban kerja yang terkena pembatasan baru.

Data ini memberi petunjuk berguna bagi diskusi tentang pelatihan dan keselamatan: Saat kontrol baru diterapkan, komputasi tetap bernilai dan fleksibel, dan secara alami akan dialihkan ke penggunaan alternatif dalam kegiatan riset. Dalam jangka panjang, diskusi tentang laju kemajuan AI juga perlu membahas cara terbaik menggunakan komputasi yang terkena kontrol baru atau yang diusulkan.

5. Langkah ke depan

Mencapai dan memahami kemajuan menuju RSI yang selaras penting bagi misi kami. Kami akan terus menyempurnakan metode, melaporkan perkembangan pemahaman, serta mengupayakan debat publik berbasis informasi dan tata kelola demokratis yang bermakna bagi sistem terdepan.

Lampiran: Metode yang digunakan dalam artikel ini

Riset AI berbantuan agen masih baru, dan kami masih mempelajari cara mengukurnya. Beberapa indikator, seperti jumlah kode yang dihasilkan tim riset kami, relatif mudah dikumpulkan, tetapi sulit ditafsirkan karena kaitannya dengan kemajuan riset belum pasti. Metrik yang lebih langsung berfokus pada kemajuan riset—seperti seberapa sering agen berhasil mengerjakan tugas dari peneliti—bisa lebih berguna, tetapi rumit untuk dikembangkan dan divalidasi. Kesulitan ini bertambah karena alat dan sistem yang diandalkan peneliti berkembang pesat. Memperdalam pemahaman tentang percepatan riset merupakan salah satu fokus utama di seluruh OpenAI.

Dalam seluruh analisis ini, kecuali dinyatakan lain:

  • “Peneliti” adalah istilah luas untuk setiap anggota organisasi riset kami, termasuk mereka yang membangun infrastruktur riset, mengelola proyek riset, atau mendukung kegiatan ini dengan cara lain.

  • Metrik penggunaan agen pengodean mencakup sebagian besar, tetapi tidak seluruh, penggunaan karena alat dan sistem yang diandalkan peneliti berkembang pesat.

Penulis

OpenAI