Liwati menyang isi utama
OpenAI

6 September 2026

KeselamatanRiset

Pikiran Asing

Dening: Jakub Pachocki, Kepala Ilmuwan ing OpenAI

Lagi dimuat…

Ing tengah taun 2023, sajrone proyek riset “RLSlow”, kita weruh asil kapisan sing nggawe kita yakin bakal bisa nggedhekake skala latihan model nalar, lan mbukak kemampuan model pralatik kanggo mbentuk ranté pikirane dhewe. Szymon lan aku nginep ing kantor bengi iku, ora mikirake angka tolok ukur sing nggumunake, produk, utawa asil ilmiah sing bakal diwujudake teknologi iki—nanging nyoba mangerteni kasunyatan sing nggugah ati manawa sajrone umur kita, kita bakal weruh mesin sing nyata-nyata luwih pinter tinimbang awake dhewe, lan kita wis weruh wujude sistem kasebut; uga mikirake carane ngelingake wong babagan wigatine iki.

Telung taun sabanjure, model basa kanthi nalar dadi bagean ekonomi sing tuwuh kanthi cepet lan wiwit nyurung wates ilmu pengetahuan. Model kasebut bisa ngoperasikake komputer lan antarmuka grafis, kerja bareng karo wong lan sapadha-padhane, sarta nindakake proyek riset. Model kasebut uga ngowahi jagad keamanan komputer, lan kanthi mangkono nuwuhake bebaya anyar sing cetha.

Akeh riset anyar ditindakake sajrone wektu iki, lan pangerten kita marang sistem kasebut maneh rada beda tinimbang ing 2023. Adhedhasar asil internal, aku yakin banget yen laju kemajuan iki bisa terus lumaku nganti paningkatan mandiri rekursif. Yen pangembangan AI terus ngetutake dalan saiki, sistem sing bakal katon sajrone sawetara taun sabanjure bisa uga nuduhake lompatan kapabilitas sabanjure sing padha gedhene utawa malah luwih gedhe, lan saya nyurung pangembangane dhewe.

Iki wektu sing mbutuhake kewaspadaan banget. Aku kuwatir ora ana sing siyap ngadhepi akibat saka mundhake kecerdasan mesin kanthi cepet lan terus-terusan. OpenAI bakal terus ngupaya solusi teknis kanggo keselarasan lan pemantauan, mbangun sistem pertahanan, lan kanthi sepihak nundha paningkatan skala sabanjure yen perlu; nanging aku percaya intervensi sing luwih jembar dibutuhake.

Kecerdasan sing durung kita mangerteni kanthi lengkap

Ing tataran umum, kemajuan kecerdasan mesin disurung dening daya komputasi sing saya gedhe. Kita ing OpenAI wiwit mangerteni iki kanthi jero watara taun 2017, sawise weruh asil sing ajeg saka paningkatan skala ing sawetara proyek riset1. Mula, kita ngupaya akses menyang daya komputasi sing luwih akeh tinimbang rencana awal, lan saya ngarahake riset menyang sawetara arah sing bisa digedhekake skalane kanthi banget. Kita percaya mung kuwi cara supaya bisa tetep dadi sing tercanggih ing riset AI lan mengaruhi dampak AGI.

Sajrone proses kasebut, algoritma anyar wis dikembangake lan tim uga peneliti individu nuduhake kapinteran anyar. Umume aku nganggep iki minangka panemuan ing sadawane dalan nggedhekake skala; ilmu sinau jero isih ing tahap awal, lan kemajuan algoritmis sing nyata cenderung ana gandhengane karo akses menyang daya komputasi. Yen dideleng ing cakrawala pirang-pirang taun, AI terus dadi luwih pinter nalika skalane digedhekake nganggo komputer sing luwih gedhe.

Lan, selaras karo ramalan Ray Kurzweil saka pungkasan abad kaping XX⁠(mbukak ing jendhela anyar), saiki kita ana ing wektu sejarah komputasi nalika kecerdasan mesin wiwit ngluwihi kecerdasan manungsa kanthi cara sing nggawa owah-owahan gedhe.

AI luwih akeh dituwuhake tinimbang dirancang—ing tataran kapisan, AI minangka asil saka mbaleni langkah optimisasi sing prasaja kaping pirang-pirang nganggo daya komputasi sing gedhene angel dibayangake. Iki ngasilake sistem sing rumit banget, bisa ngolah konsep abstrak, lan bisa nyimulasi sawetara aspek tumindak manungsa. Kita bisa nemokake maneka wawasan babagan mekanisme cilik sing muncul ing sistem iki, liwat proses sing padha karo neurosains—lan kaya neurosains, tumindak sistem sakabèhé angel diterangake kanthi cara sing bisa kita mangerteni kanthi lengkap.

Panaliten AI adhedhasar sinau jero umume minangka ilmu eksperimen. Kita ngupayakake kanthi temen-temen⁠ kanggo mbangun algoritma adhedhasar prinsip lan nggawe ramalan sing bisa diuji, nanging dhasare, latihan skala gedhé kita yaiku eksperimen, lan kadhangkala asile gawe kaget. Kajaba iku, nalika sistem saya kapabel, asile saya angel ditafsirake.

Iki saya rumit amarga algoritma saiki umume ningkatake kapabilitas sing gampang diukur luwih cepet tinimbang kapabilitas sing angel diwenehi ukuran objektif. Kita ngentekake akeh wektu kanggo mangerteni carane kapabilitas nggawe generalisasi, lan apa sing kudu diutamakake kanggo majokake katrampilan sing paling relevan sajrone sawetara taun sabanjure. Umpaman, kita percaya model bisa digawe luwih apik mligi ing riset matematika kanthi fokus tambahan, nanging arah iki ora kita utamakake amarga RSI lan riset keselarasan otomatis kudu enggal ditangani, kaya sing bakal dakterangake mengko.

Kecerdasan sing diasilake kanthi nggedhekake skala sinau jero ora bisa langsung dibandhingake karo kecerdasan manungsa. Supaya relevan banget ing donya nyata—migunani banget utawa mbebayani banget—AI ora perlu nyandingi utawa ngluwihi kabeh kapabilitas manungsa; cukup ngluwihi sawetara kapabilitas sing wigati. Lan nalika AI terus ngluwihi manungsa ing luwih akeh babagan, kita saya angel mangerteni kanthi persis sepira gedhene kapabilitase.

Mulang mesin supaya nresnani

Amarga kecerdasan mesin asale saka proses sing dhasare beda karo kecerdasan manungsa, kita ora bisa nganggep yen kanthi gawan mesin manut marang prinsip manungsa utawa nggawe generalisasi saka prinsip kasebut kaya manungsa. Masalah inti ing riset AI yaiku keselarasan—nggawe AI “ngupaya tumindak sing bener” miturut standar manungsa.

Kanggo ngatur arah riset praktis, aku nganggep migunani mbedakake keselarasan tujuan lan keselarasan nilai.

Kanthi umum, keselarasan tujuan tegese: “apa AI ngupaya nggayuh tujuan sing diwenehake?” Iki bisa kalebu bab kaya manut marang hierarki instruksi⁠, utawa kemampuan komunikasi lan kerja bareng karo wong kanggo nyoba mangerteni tujuane. Kumpulan arah iki migunani banget ing praktik.

Keselarasan nilai minangka sipat model sing luwih hakiki. Iki kemampuan kanggo nyekel lan nggawe generalisasi saka sakumpulan prinsip tingkat dhuwur; tumindak kanthi “lumrah” sanajan diwenehi tujuan sing ora cetha utawa bertentangan, utawa diselehake ing kahanan sing ora dikenal utawa ngancam. AI sing selaras kudu tumindak kanthi jujur, nduweni integritas, lan tresna marang manungsa.

Mesthi wae, wates antarane keselarasan nilai lan tujuan bisa ora cetha, lan saestu nggatekake tujuan mbutuhake upaya kanggo nyimpulake niat⁠(mbukak ing jendhela anyar) lan nilai sing dadi landhesane. Nanging, nalika ngrembug wigatine riset keselarasan ing jangka panjang, umume sing dakkarepake yaiku keselarasan nilai.

Tantangan dhasar keselarasan AI yaiku generalisasi. Nalika mesin saya pinter, mesin bakal nggarap konsep sing luwih dhuwur lan diselehake ing lingkungan sing saya beda karo lingkungan sing ditemoni sajrone latihan. Mesin bisa gagal nggawe generalisasi saka nilai sing diwulangake lan dikuwatake sajrone latihan menyang kahanan anyar kasebut; lan kita bisa kangelan mesthekake carane mesin bakal tumindak. Iki saya angel amarga ekosistem sakabèhé sing nggunakake AI owah kanthi cepet banget; umpaman, AI sing dilatih saiki kudu tetep tangguh nalika sesambungan karo maneka AI liyane. Sing paling wigati, AI ing mangsa ngarep kudu tetep nyekel nilai manungsa, tanpa preduli apa AI percaya yen lagi diawasi manungsa.

Saiki ana rong golongan utama metode sing digunakake ing praktik kanggo latihan keselarasan.

Kapisan yaiku nyengkuyung tumindak sing selaras minangka bagean saka sinau penguatan sing ngarah marang tujuan. Tumindak model dievaluasi (biasane dening AI) adhedhasar kecocokane karo model preferensi, “spesifikasi”, utawa “konstitusi” tartamtu, banjur diwenehi ganjaran sing cocog. Pendekatan iki bisa efektif banget ing kahanan umum lan dadi bagean inti saka carane asisten AI modern digawe. Sayange, pendekatan iki uga bisa ringkih lan gumantung banget marang jangkauan pengawasan latihan lan kemampuan model nggawe generalisasi saka kahanan sing ditemoni sajrone latihan. Umpaman, ing insiden OpenAI–Hugging Face, para agen njaga wates supaya ora ngapusi manungsa liwat rekayasa sosial. Nanging, para agen kanthi cetha gagal ngedohi tumindak liya sing ngluwihi cakupan lan bertentangan karo semangat nilai sing diwulangake marang dheweke ing kahanan liya.

Pendekatan kapindho ngupaya nggunakake kemampuan model kanggo nggawe generalisasi saka data pralatik. Iki bisa kalebu nyusun set data latihan sing nuwuhake keselarasan, utawa ngarahake model menyang bagean distribusi pralatik sing ‘selaras’, kaya umpaman ing model pamilihan persona⁠(mbukak ing jendhela anyar). Kelemahane pendekatan iki yaiku ora tangguh marang tekanan optimisasi sabanjure. Yen model sing umume mikir kanthi ‘selaras’ diwenehi latihan cukup akeh kanggo nggayuh tujuan sing angel banget, model bisa sinau nalar kanthi motivasi tartamtu: mbengkongake pikiran sing katon 'selaras' yen perlu kanggo nggayuh tujuan. Kita bisa uga wis weruh tuladha tumindak kasebut ing insiden keamanan siber anyar sing nglibatake model dudu gaweyane OpenAI.

Kita nandur investasi gedhe ing spektrum pendekatan sing dicakup dening arah-arah iki. Kita uga weruh kemajuan sing nyata—GPT‑6 Astra minangka model kapisan sing entuk manfaat saka sawetara kemajuan penting sing wis suwe kita garap, lan keselarasané luwih apik kanthi nyata tinimbang GPT‑5.6 Sol. Nanging, penting kanggo ngakoni lan mangerteni manawa isih dibutuhake kemajuan sing luwih akeh nalika model saya kapabel; lan kemajuan keselarasan sing bisa digeneralisasi bisa uga ora cukup ngluwihi kemajuan kecerdasan model umum.

Pemantauan generalisasi

Kita durung duwe teori generalisasi sing marem, lan kayane ora mungkin bisa ngembangake teori kasebut ing wektu cedhak, saora-orane tanpa bantuan AI sing luwih kuwat. Mula, saiki kemampuan kita kanggo ngesahake teknik keselarasan kanthi empiris ing praktik bisa diarani luwih wigati tinimbang teknik keselarasan kasebut dhewe.

Andelan utama OpenAI ing babagan iki yaiku pemantauan ranté pikiran⁠(mbukak ing jendhela anyar). Iki adhedhasar gagasan sing narik kawigaten lan bisa digedhekake skalane: akeh kapabilitas model asale saka proses nalar sing diwujudake kanthi tembung (ranté pikiran). Yen kita nggedhekake optimisasi asil proses kasebut, nanging ora ngawasi prosese dhewe, sajrone latihan ranté pikiran iku ora duwe insentif langsung kanggo ndhelikake gagasan utawa tujuan sing ora selaras. Iki ora ateges model bakal sinau nyatakake kecenderungan sing ora selaras lan ora gumantung marang ranté pikiran; nanging, iki bisa ngidini kita ngawasi kanthi persis paningkatan kapabilitas saka nalar.

Kita mangerteni potensi wigatine pemantauan ranté pikiran nalika ngembangake model nalar. Nalika ngluncurake o1‑preview, kita sengaja ngrancang produk supaya ndhelikake ranté pikiran⁠, kanggo nglindhungi saka tekanan pengawasan ing jangka panjang2. Sajrone pangembangan sabanjure, kita terus ngupaya njaga aturan supaya ora ngawasi proses nalar. Pemantauan CoT dadi sarana sing penting banget kanggo nyinaoni carane model kita nggawe generalisasi saka distribusi latihane, saengga kita bisa ngamati lan nganalisis ora mung tumindake, nanging uga proses internale.

Sarana iki tetep wigati nalika kita nyinaoni kelas model Astra. Nanging sayange, evaluasi kita nuduhake manawa kemampuan kita kanggo ngandelake pemantauan CoT saya suda. Iki disebabake gabungan sawetara faktor.

  • Model nalar modern digunakake ing lingkungan sing luwih rumit tinimbang o1‑preview; proses nalare saya campur karo komunikasi marang wong, AI liyane, lan panggunaan piranti. Akeh interaksi kasebut kudu diawasi, mula wates sing arep kita jaga dadi saya ora cetha.

  • AI saya trampil nalar babagan lan ngapusi proses nalare dhewe.

  • Kanthi kinerja pralatik sing saya apik, kita uga weruh model dadi luwih pinter sanajan babar pisan ora nggunakake nalar sing diwujudake kanthi tembung.

Tantangan kasebut durung mesthi ora bisa diatasi. Aku ngarep-arep kita bisa ngembangake intervensi kanggo ningkatake kemampuan pemantauan ranté pikiran model kita, umpaman kanthi luwih mangerteni sesambungan antarane maneka tujuan optimisasi lan wujud komputasi wektu-uji sing digunakake model. Aku uga percaya yen nggabungake gagasan saka pemantauan CoT lan aktivasi bisa migunani banget—kanthi nggedhekake skala latihan pamantau sing bisa ngakses langsung bagean internal jaringan, umpaman pengakuan⁠(mbukak ing jendhela anyar). Kita aktif ngupayakake gagasan-gagasan iki. Nanging, aku ngira kemajuan AI umum bakal saya kaendheg dening kapercayan marang pemantauan.

Pertahanan sing bisa digedhekake skalane

Alasan paling kuwat sing dakdeleng kanggo nerusake latihan model sing luwih pinter kanthi cepet yaiku perlune mbangun sistem pertahanan saka bebaya sing ditimbulake AI liyane.

Risiko nyata sing dibahas sajrone taun iki yaiku keamanan siber: model saya ngluwihi manungsa ing kemampuan kanggo mbobol lan metu saka sistem komputer. Iki nggedhekake cakupan risiko AI kanthi luar biasa: para agen bakal bisa ngakses meh kabeh prasarana kejaba sing paling aman, lan langsung mengaruhi akeh bagean donya sanajan tanpa awak fisik. Saiki kita ana ing wektu winates⁠ kanggo nggunakake model paling apik sing kasedhiya guna nguwatake keamanan kanthi nyata⁠ ing sistem kritis.

Sayange, risiko sing ana gandhengane karo AI bakal terus mundhak wiwit saiki. Agen sing kapabel banget lan kanthi cetha dilatih sarta diprentah nindakake tumindak ala bakal nuwuhake bebaya anyar; agen kasebut bisa ngluwihi cakupan niate operator lan nggawe generalisasi dadi tumindak sing bisa luwih ala banget. Wates antarane panyalahgunaan lan tumindak otonom sing ora selaras bakal saya ora cetha nalika AI dadi luwih mandiri. Kita bisa uga wis biasa nganggep AI minangka piranti, nanging sawetara agen bakal ngoyak tujuane dhewe. Agen kasebut bakal golek cara kanggo kerja bareng karo wong, kanthi nawani, ngapusi, utawa meres.

Kajaba iku, ana risiko saka teknologi anyar sing bisa diwujudake dening AI, kayata patogen rekayasa.

Kita mbutuhake AI sing kuwat lan selaras kanggo pertahanan: ngamanake prasarana, nglindhungi saka agen mbeling kanthi langsung, lan ngripta cara pangreksan sing babar pisan anyar. Iki bakal dadi fokus utama upaya panyebaran OpenAI.

Ing wektu sing padha, sanajan ana kahanan ora mesthi amarga prakiraan kemajuan AI sing jembar lan kabutuhan mbangun sistem pertahanan, kita ora kena nggunakake iku minangka alesan kanggo tumindak sembrana. Gagasan kanggo terus balapan maju apa wae regane katon ora masuk akal yen kita wis mangerteni tenan sepira gedhene taruhane.

Ngatur laju RSI

Kecerdasan mesin sing saya gedhe perane ing proses pangembangane dhewe minangka asil lumrah saka kemajuan teknologi sing terus lumaku. Yen kemajuan AI terus lumaku, paningkatan mandiri rekursif mesin (RSI) bakal dadi inti panemuan ilmiah ing mangsa ngarep.

Riset AI otomatis minangka wujud sing luwih drastis saka nggedhekake kecerdasan nganggo komputasi; lan mesthi wae, minangka bageane, AI bakal ningkatake landhesan komputasine dhewe⁠. Kaya dene nggedhekake skala, kita ngarahake riset OpenAI menyang RSI amarga percaya yen mung iki cara kanggo tetep dadi sing tercanggih ing riset AI ing mangsa ngarep.

Aku pengin negesake manawa tembung ing ndhuwur ora ateges aku nganggep nyepetake riset sinau jero kanthi gedhe, mligine ing jangka cendhak, minangka tumindak bebarengan sing kudu ditindakake komunitas riset. Nanging, aku pancen nganggep iki tujuan saka dalan saiki, lan kita kabeh kudu kanthi sadar milih carane nerusake. Pilihan utama kita yaiku ngarahake proses kanggo nguwatake keselarasan lan pemantauan bebarengan karo AI, sarta golek cara supaya manungsa tetep melu; utawa koordinasi kanggo ngalonake pangembangan ing mangsa ngarep yen perlu nganti kita yakin marang langkah-langkah kasebut.

Cara paling apik kanggo maju sing dakdeleng saiki yaiku gabungan saka loro-lorone.

Kemajuan nyata sing wis kita gayuh ing keselarasan lan pemantauan umume raket banget karo kemajuan AI umum. Tuladha sing apik yaiku RL saka umpan balik manungsa⁠(mbukak ing jendhela anyar), sing dadi kunci latihan asisten AI awal, lan pemantauan ranté pikiran⁠(mbukak ing jendhela anyar) sing wis kasebut, sing bisa diwujudake amarga kemajuan model nalar. Kita kudu ngarahake proses riset sing saya otomatis iki kanggo ngembangake wawasan, algoritma, lan teori anyar kaya mangkono, sarta mbangun bukti keamanan kanthi iteratif kanggo AI sing luwih kapabel.

Ngundhakake skala sistem AI kudu diwatesi adhedhasar kapercayan kita marang keamanane. Kita kudu ngembangake komitmen kaya Kerangka Kesiapan⁠ utawa Kabijakan Ngundhakake Skala kanthi Tanggung Jawab⁠(mbukak ing jendhela anyar) dadi standar keamanan sing diwajibake kanthi jembar kanggo nerusake pangembangan. Iki bisa dileksanakake dening jaringan auditor pihak katelu, lembaga pamaréntah, utawa badan internasional.

Tantangan inti nalika ngotomatisasi riset AI dudu “tekan kana”—nanging tekan kana kanthi cara sing njaga manungsa tetep dadi bagean saka proses paningkatan sabanjure lan njaga mangsa ngarep tetep ana ing tangane manungsa.

Apa sabanjure?

Kaya sing bubar iki kita andharake bareng Sam⁠, OpenAI ngutamakake karya kanggo nggayuh telung tujuan utama:

  1. Nglakoni tahap kemajuan AI sabanjure kanthi mbangun peneliti AI otomatis, nggunakake peneliti kasebut kanggo terus ngrampungake masalah keselarasan, lan golek cara supaya manungsa tetep dadi bagean saka siklus paningkatan mandiri.

  2. Nyalurake manfaat kemajuan ilmiah lan pertumbuhan ekonomi sing bisa diwujudake dening mesin sing pinter banget.

  3. Menehi daya marang saben wong kanthi AGI pribadi.

Ing esai iki aku mung fokus marang bab kapisan, amarga aku percaya iki sing paling wigati lan paling kudu enggal ditangani. Nanging, aku duwe pangarep-arep lan pangaji-aji sing jero marang manfaat sing bakal digawa kemajuan teknologi sabanjure. AI selaras ing mangsa ngarep bisa majokake ilmu, ngembangake terapi anyar, lan mujudake kamakmuran material sing jembar. AI sing grapyak lan jujur bisa mbantu wong ngadhepi kangelan ing uripe lan ningkatake rasa seneng lan kapenuhan urip kanthi nyata. OpenAI ngupayakake kanthi temen-temen supaya manfaat kasebut bisa kawujud. Salah siji tuladha saiki sing dakbanggakake—lan dianggep migunani dening wong-wong sing dak tresnani—yaiku investasi gedhe kanggo ningkatake kemampuan ChatGPT menehi informasi kesehatan.

Sanajan janji jangka panjang AI pancen gedhe, mayoritas fokus kita kudu tumuju sawetara taun sabanjure. Kita ngadhepi transisi menyang donya kanthi mesin sing pinter banget, lan kudu mesthekake transisi kasebut nggawa asil apik kanggo manungsa. Kita kudu golek cara kanggo njaga kamardikan tumindak manungsa lan ngukuhake nilai hakiki dadi manungsa, ing donya sing mayoritas tugase bisa ditindakake AI. Kita kudu nyegah kakuwasan sing nglumpuk banget ing donya nalika pakaryan sing biyen mbutuhake ewonan ahli saiki bisa ditindakake mung sawetara wong sing ngoperasikake komputer gedhe. Lan mesthekake manungsa tetep ngendhaleni mangsa ngarep lan ora ditinggal dening kemajuan tanpa kendhali sing digawa kecerdasan asing sing ngluwihi kecerdasan kita.

Saiki aku percaya durung ana laboratorium sing ngrampungake keselarasan lan pemantauan nganti cukup kanggo kanthi tanggung jawab terus ngundhakake skala kanthi kacepetan maksimal luwih suwe maneh. Aku ngarepake lan ngarep-arep pelambatan sukarela dadi lumrah nganti standar keamanan bebarengan wis ditetepake. Lan aku percaya koordinasi internasional babagan pangembangan AI ing mangsa ngarep kudu dadi prioritas utama pamaréntah ing saindenging donya.

Penulis

Jakub Pachocki

Cathetan sikil

  1. 1
  2. 2

    Alasan liya kanggo rancangan iki yaiku nyegah distilasi. Nanging, sajrone pangembangan, njaga supaya CoT bisa dipantau kanthi cetha dadi prioritas sing luwih gedhe tumrap kita.