Nyepetake riset: Pandhangan saka njero OpenAI
Supaya AGI migunani kanggo kabeh manungsa, kita yakin AGI kudu diatur kanthi demokratis. Iki mbutuhake debat publik adhedhasar kawruh babagan kapabilitas, risiko, lan pangayoman sistem AI sing mumpuni. Wong ing ngendi wae kudu ngerti arah AI tercanggih ing tembe, supaya bisa melu nemtokake pangembangane.
Transparansi babagan risiko, kedadeyan, lan pangayoman tartamtu perlu, nanging durung cukup. Publik uga kudu ngerti kepiye sistem paling mumpuni dikembangake lan nyengkuyung kemajuan riset ing laboratorium tercanggih.
Kita ngupaya mbangun panaliti AI otomatis kanthi aman, sing diawasi manungsa kanggo majokake sinau jero lan panyelarasan, saengga bisa terus didandani. Miturut pangukuran kita, target nduweni panaliti magang otomatis ing September taun iki, sing diumumake(mbukak ing jendhela anyar) mangsa gugur kepungkur, wis kagayuh. “Panaliti magang” tegese sistem sing nindakake tugas riset sing cetha miturut arahan manungsa, kalebu tugas sing butuh pirang-pirang dina kanggo panaliti trampil. Kita maju kanthi pesat kanggo nggawe panaliti AI otomatis ing Maret 2028.
Sajrone taun iki, gaweyan saben dinane panaliti OpenAI wis owah akeh. Panaliti nggunakake agen pamrograman sedina muput, kerep ing sesi bebarengan. Total panggunaane mundhak pesat, ngluwihi paningkatan ing tim OpenAI liyane. Panaliti nyumbang kode luwih cepet lan nindakake luwih akeh eksperimen. Cara nggunakake agen uga owah: agen nangani tugas saya rumit lan saya kerep kasil. Riset AI iku rumit lan akeh potensi alangan, mula laju kemajuan sakabehe mbokmenawa ora bakal madhani metrik tartamtu iki. Nanging, temuan iki cocog karo kesan umum ing internal kita yen piranti berbasis agen pancen nyepetake kemajuan riset. Manungsa tetep nemtokake prioritas riset, milih gagasan lan asil sing diterusake, sarta mutusake nggedhekake, mandhegake sauntara, utawa ngluncurake sistem.
Yen ditindakake kanthi tanggung jawab, kita yakin riset AI otomatis bakal ngasilake model sing langsung ningkatake karaharjan manungsa lan majokake misi OpenAI. Iki bisa nyuda biaya kecerdasan canggih supaya migunani kanggo wong saindenging donya. Salah siji alesane kita nindakake iki yaiku riset otomatis bisa mbantu ngrampungake panyelarasan lan mbangun pertahanan marang AI sing saya mumpuni. Panaliti AI otomatis uga bisa dadi panaliti kaslametan utawa panyelarasan otomatis. Sistem luwih mumpuni lan selaras bisa mbantu ngamanake infrastruktur kritis, nglawan agen AI mbebayani, lan nggawe pangayoman anyar.
Iki alesan kanggo ngembangake kapabilitas riset otomatis sing migunani, nanging ora ateges RSI kanthi cepet mesthi kudu diupayakake. Apa lan kepiye nerusake kudu gumantung marang kemampuan njaga kendhali manungsa lan pilihan demokratis adhedhasar kawruh babagan manfaat lan risiko.
Kita durung ngerti carane nggayuh RSI lengkap sing selaras kanthi aman. Kita ngupaya nggedhekake upaya panyelarasan lan kaslametan bebarengan karo kapabilitas. Nanging kemajuan panyelarasan lan kaslametan durung mesthi bisa nututi, lan sistem luwih mumpuni bisa saya angel diawasi. Panyelarasan lan kaslametan sing tliti dadi inti upaya iki, diwiwiti saka ngukur lan nyuda masalah kaslametan ing sistem pamrograman berbasis agen saiki. Yen nerusake gaweyan nuwuhake risiko kaslametan sing ora bisa ditampa, kita bakal nanggapi kanthi trep, kalebu ngalonake utawa mandhegake pangembangan utawa peluncuran sistem sing durung bisa kita ayomi kanthi cukup.
Sawise kedadeyan Hugging Face bubar iki, kita ngetrapake komitmen iki: ngaso latihan sinau penguatan (RL) model paling anyar sing arep diluncurake, nguwatake lan nguji serangan ing lingkungan riset, sarta nggedhekake cakupan pamantauan. Ora kabeh riset mandheg: sawetara beban kerja diterusake kanthi kontrol luwih kuwat, liyane tetep diasoake. Kita ngunggahake standar kaslametan lan panyelarasan, sarta nggabungake luwih jero ing siklus urip model, kanthi mbutuhake bukti prilaku selaras sing luwih kuwat sajrone kabeh latihan.
Dina iki kita menehi gambaran rinci babagan sumbangan sistem berbasis agen tumrap kemajuan kita menyang RSI ing sasi-sasi pungkasan. Sistem berbasis agen isih anyar lan cepet owah; pangukuran kita uga isih tahap awal. Kanthi nuduhake asil awal lan metodene, kita ngupaya menehi kawruh marang publik, mbudayakake keterbukaan, lan nyengkuyung standar pangukuran bebarengan.
Kaya sing kita tulis ing cithak biru kabijakan AI tercanggih, kita yakin perusahaan kita lan liyane kudu diwajibake nglaporake kemajuan RSI marang publik. Sanajan ora diwajibake, kita bakal tetep transparan babagan kemajuan RSI. Pendekatan transparansi bakal kita owahi manut teknik pangukuran lan pangerten sing saya apik, kanthi tetep njaga keamanan lan informasi duweke perusahaan.
Ing awal taun, panaliti OpenAI ing peringkat median panggunaan agen mung nggunakake agen pamrograman sethithik. Ing tengah Agustus, panaliti median wis nggunakake agen saben dina, kanthi inferensi luwih saka $600 saben dina miturut rega API. Pangguna persentil kaping 90 ing organisasi riset saiki nggunakake token luwih saka $7.000 saben dina.
Sadurunge Juni 2026, total wektu kerja agen ing organisasi riset isih kurang saka total wektu kerja manungsa. Saiki kahanane wis owah. Kanthi standar dina kerja 8 jam, ing tengah Agustus organisasi riset nggunakake total 3,1 dina kerja agen kanggo saben dina kerja manungsa.
Cara liya yaiku ndeleng pira panaliti sing nggunakake akeh alur kerja bebarengan, kayata nglakokake 4 agen utawa luwih bebarengan. Kaya ing ngisor iki, cacahe saya mundhak. Angka iki nyakup puncak saben dina saka agen sing diwiwiti langsung dening pangguna lan subagen sing digawe saka agen kasebut.
Umume riset AI bisa dianggep proses padhet karya kanggo nggabungake paningkatan kecerdasan utawa kinerja anyar menyang salah siji model inti kita. Kapabilitas maju yen kabeh tataran kasil: ngrancang paningkatan, nulis evaluasi kinerja model, nggawe infrastruktur uji skala gedhe, nemokake bug lan prilaku ora aman utawa ora selaras sajrone latihan, banjur nggabungake gagasan unggul menyang latihan inti. Gagal ing salah siji tataran riset bisa ngalangi kabeh siklus.
Nulis kode lan nindakake eksperimen iku rong kegiatan utama panaliti, lan kita weruh bukti yen loro-lorone saya cepet.
Data iki cukup gampang diukur, nanging bisa angel ditegesi. Nalika otomatisasi maju, tugas sing paling angel diotomatisasi bakal ngentekake luwih akeh tenaga panaliti lan dadi alangan utama kemajuan sabanjure. Komputasi uga mbatesi kemajuan, lan bisa saya penting nalika alangan liyane suda.
Sajrone 2026, eksperimen saben pelaksana aktif mundhak. Agustus 2026 paling dhuwur wiwit pencathetan Januari 2025. Iki gegayutan karo mundhake adopsi Codex, sanajan komputasi sing kasedhiya uga mundhak akeh wiwit 2025.
Kesan kualitatif lan data internal nuduhake owah-owahan tugas sing dipasrahake marang agen pamrograman: tugas tingkat luwih dhuwur lan durasi luwih dawa saya lumrah.
Kanggo mangerteni tren iki, kita nganalisis panggunaan anyar ing organisasi riset nganggo taksonomi sing bubar diterbitake(mbukak ing jendhela anyar) dening Epoch AI, babagan jinis gaweyan ing siklus riset lan pangembangan AI. Taksonomi iki diilhami sistem klasifikasi gaweyan O*NET sing wis suwe, dicocogake kanggo riset lan pangembangan AI tercanggih, lan dipérang dadi enem fase:
Mutusake: apa sing digarap, diterusake, lan diwenehi alokasi
Ngrancang: gagasan riset lan spesifikasi rekayasa
Mbangun: kode lan dataset
Nglakokake: latihan/evaluasi, piranti keras, layanan
Nganalisis: eksperimen, model, peluncuran, gaweyan eksternal
Ngandharake: temuan, tanggapan, status, keputusan
Ing ngisor iki, token agen pamrograman kita klasifikasikake miturut taksonomi iki.
Kabeh kategori kegiatan riset mundhak antarane Januari lan Agustus 2026. Ing Januari, kode riset lan infrastruktur dadi kategori dominan. Kategori iki saya gedhe, nanging kategori liyane uga mundhak akeh, utamane pitulungan teknis lan pamantauan proses. Perencanaan tingkat dhuwur isih mung bagean cilik banget saka token output agen.
Miturut laporan anekdot kolega, agen pamrograman unggul ngrampungake masalah infrastruktur riset internal, saengga ngatasi salah siji alangan penting kemajuan riset. Sawetara tim sing biyen mbukak konsultasi masalah eksperimen nyathet rawuhe panaliti mudhun ing 2026. Salah sijine malah mandheg kabeh sesi supaya fokus ndandani sistem liyane.
Ing kene, kita nggambarake cacah kiriman utama saben dina ing salah siji kanal internal utama kanggo panaliti njaluk pitulungan teknis saka tim liyane. Sangertene kita, mudhune kegiatan kanal iki ora diimbangi pamindhahan pitakon menyang kanal pitulungan teknis liyane sing dilayani manungsa. Mudhun iki cocog karo owah-owahan sing luwih amba mau.
Kita uga bisa nyinaoni apa agen pamrograman kasil nindakake tugas saka panaliti. Kanthi klasifikator berbasis agen, saka Januari nganti Juli kita nemokake tingkat kasil umume mundhak ing sawetara golongan kangelan (diwakili prakiraan wektu manungsa ngrampungake tugas), kanggo tugas sing asile bisa dipesthekake. Nanging, agen isih butuh akeh arahan manungsa supaya kasil, utamane nalika tugas saya rumit. Ing 6 sasi pungkasan, luwih saka separo tugas 4–8 jam sing kasil mbutuhake intervensi siji utawa luwih.
Tingkat kasil tugas panaliti saya mundhak. Grafik ora nyakup klasifikasi sing asile durung mesthi lan titik kanthi <50 sesi utawa <50 pangguna unik.
Tingkat kasil tugas lan intervensi saka Januari nganti Juli, dipérang miturut durasi. Ora nyakup klasifikasi sing asile durung mesthi.
Kemajuan tumuju sistem sing luwih mumpuni kanggo AGI sing aman lan migunani uga bakal gumantung marang pangayoman sing dibutuhake kanggo gaweyan iki. Pambiji kita babagan pangayoman sing dibutuhake bisa owah nalika pangerten kita babagan risikone saya jero.
Kaya sing wis kita jlentrehake, bubar iki kita nganyari standar pamantauan, panyelarasan, lan keamanan. Ing kene, kita nuduhake kepiye watesan anyar mengaruhi salah siji aspek kegiatan riset.
*Umume komputasi Astra sing dituduhake ing kene antarane 20 Juli lan 6 Agustus ditujokake kanggo nguji implementasi paningkatan kaslametan lan keamanan.
Tanggal 20 Juli, sawise ketemu yen agen wis nembus infrastruktur riset kita, kita mandhegake sauntara layanan kontainer kanggo latihan, banjur nguripake maneh kanthi tambahan watesan sing ketat.
Iki ndadekake komputasi latihan RL mudhun banget nalika tim nyetel maneh alur kerjane supaya bisa mlaku ing lingkungan riset sing keamanane wis dikuwatake. Grafik ing ndhuwur nyakup mandhege sinau penguatan suwene rong minggu kanggo model paling anyar kita sing arep diluncurake. Ing eksperimen RL kelas Astra antarane 20 Juli lan 6 Agustus, mayoritas proses (miturut alokasi GPU) ditujokake kanggo nguji implementasi paningkatan kaslametan lan keamanan.
Tanggal 7 Agustus, bukti awal yen Astra bisa uga nduweni kapabilitas siber kritis miturut Kerangka Kesiapan(mbukak ing jendhela anyar) kita njalari tambahan watesan keamanan khusus model, sing mbutuhake model Astra dilakokake ing lingkungan riset kanthi keamanan luwih dhuwur. Ing minggu sabanjure, alokasi GPU kelas Astra mudhun maneh 59,2 persen, nanging alokasi kanggo kelas model liyane mundhak 17,2 persen. Paningkatan iki ngimbangi watara 85 persen saka mudhune kelas Astra, saengga total alokasi kanggo beban kerja RL sing dianalisis meh ora owah. Pola iki cocog karo pamindhahan sebagian latihan lan eksperimen menyang model non-Astra nalika gaweyan sing nganggo Astra diwatesi. Iki uga cocog karo laporan anekdot yen panaliti nemokake panggunaan liyane kanggo komputasi sing ora bisa digunakake maneh kanggo beban kerja sing kena watesan anyar.
Data iki menehi pratandha migunani kanggo rembugan babagan latihan lan kaslametan: Nalika kontrol anyar ditrapake, komputasi tetep aji lan luwes, lan kanthi lumrah bakal dialihake menyang panggunaan liya ing kegiatan riset. Kanggo jangka dawa, rembugan babagan laju kemajuan AI uga kudu nyakup pitakon babagan cara paling apik nggunakake komputasi sing kena kontrol anyar utawa sing diusulake.
Nggawe lan mangerteni kemajuan tumuju RSI sing selaras iku penting kanggo misi kita. Kita bakal terus nyempurnakake metode, nglaporake pangerten sing saya ngrembaka, lan ngupaya debat publik adhedhasar kawruh sarta tata kelola demokratis sing migunani kanggo sistem tercanggih.
Riset AI kanthi pitulungan agen isih anyar, lan kita isih sinau carane ngukur. Sawetara indikator, kayata cacah kode sing digawe tim riset kita, cukup gampang diklumpukake nanging angel ditegesi amarga gegayutane karo kemajuan riset durung mesthi. Metrik sing luwih langsung ngukur kemajuan riset—kayata sepira kerepe agen kasil nindakake tugas saka panaliti—bisa luwih migunani, nanging rumit kanggo dikembangake lan divalidasi. Sing saya nambah kangelan, piranti lan sistem andelane panaliti ngrembaka kanthi cepet. Ngjerokake pangerten babagan percepatan riset dadi fokus penting ing saindenging OpenAI.
Ing kabeh analisis iki, kajaba ana katrangan liya:
“Panaliti” iku istilah amba kanggo kabeh anggota organisasi riset kita, kalebu sing mbangun infrastruktur riset, ngatur proyek riset, utawa nyengkuyung kegiatan kasebut kanthi cara liyane.
Metrik panggunaan agen pamrograman nyakup umume, nanging ora kabeh, panggunaan amarga piranti lan sistem andelane panaliti cepet ngrembaka.


