Pagpapabilis ng pananaliksik: Mula sa loob ng OpenAI
Naniniwala kaming dapat pamahalaan nang demokratiko ang AGI upang makinabang ang buong sangkatauhan. Kailangan dito ang pampublikong debateng may sapat na kaalaman sa kakayahan, panganib at pananggalang ng mahuhusay na AI. Dapat maunawaan ng lahat ang posibleng direksyon ng frontier AI upang magkaroon sila ng makabuluhang tinig sa pag-unlad nito.
Kailangan ang pagiging bukas tungkol sa mga panganib, insidente at pananggalang, ngunit hindi ito sapat. Dapat ding maunawaan ng publiko kung paano umuunlad ang pinakamahusay na mga sistema at isinusulong ng mga ito ang pananaliksik sa mga frontier lab.
Layunin naming ligtas na bumuo ng awtomatikong AI researcher na, sa ilalim ng tao, magsusulong ng malalimang pag-aaral at alignment para sa paulit-ulit na pagpapahusay. Ayon sa aming mga sukat, naabot na namin ang layuning magkaroon ng awtomatikong research intern pagsapit ng Setyembre ngayong taon, na inanunsyo(magbubukas sa bagong window) noong nakaraang taglagas. Ang “intern sa pananaliksik” ay sistemang gumagawa ng malinaw na mga gawain sa gabay ng tao, kahit yaong aabot ng ilang araw para sa bihasang mananaliksik. Malaki ang aming pagsulong tungo sa awtomatikong AI researcher pagsapit ng Marso 2028.
Malaki ang ipinagbago ng araw-araw na trabaho ng mga mananaliksik ng OpenAI ngayong taon. Gumagamit sila ng mga coding agent buong araw, madalas sa sabay-sabay na sesyon. Mabilis ang pagtaas ng kabuuang paggamit, higit sa ibang team ng OpenAI. Mas mabilis silang nag-aambag ng code at mas marami ang pinapatakbong eksperimento. Nagbabago rin ang gamit nila sa mga agent: mas kumplikadong gawain ang hinahawakan ng mga ito, at mas madalas magtagumpay. Kumplikado ang pananaliksik sa AI at maraming posibleng hadlang, kaya malamang na hindi makasabay ang pangkalahatang pag-unlad sa mga sukat na ito. Ngunit sa kabuuan, tugma ang mga natuklasan sa pananaw ng marami sa amin na malaki ang naitutulong ng mga agentic tool sa pagpapabilis ng pananaliksik. Tao pa rin ang nagtatakda ng prayoridad, pumipili ng mga ideya at resultang itutuloy, at nagpapasyang palawakin, ihinto o ilabas ang mga sistema.
Naniniwala kaming ang responsableng awtomatikong pananaliksik sa AI ay lilikha ng mga modelong magpapabuti sa buhay ng tao at magsusulong ng misyon ng OpenAI. Maaari nitong pababain ang halaga ng advanced na talino upang makinabang ang mga tao sa buong mundo. Ginagawa rin namin ito dahil maaaring makatulong ang awtomatikong pananaliksik sa paglutas ng alignment at pagbuo ng depensa laban sa mas mahusay na AI. Maaari ring magsaliksik sa kaligtasan o alignment ang isang awtomatikong AI researcher. Maaaring makatulong ang mas mahusay at aligned na AI sa pagprotekta sa kritikal na imprastraktura, paglaban sa mapanganib na mga AI agent, at pagbuo ng pananggalang.
Mga dahilan ito para bumuo ng kapaki-pakinabang na awtomatikong pananaliksik, ngunit hindi nangangahulugang dapat nating hangarin ang mabilis na RSI. Kung magpapatuloy at paano, dapat itong ibatay sa kakayahang panatilihin ang kontrol ng tao at sa demokratikong pasyang may kaalaman sa benepisyo at panganib.
Hindi pa namin alam kung paano ligtas na maaabot ang ganap at aligned na RSI. Pinapalawak namin ang mga hakbang sa alignment at kaligtasan kasabay ng mga kakayahan. Ngunit hindi natin maipagpapalagay na makasasabay ang alignment at kaligtasan; maaaring mas mahirap subaybayan ang mas mahuhusay na sistema. Sentro rito ang maingat na alignment at kaligtasan, simula sa pagsukat at pagbawas sa mga kasalukuyang problema sa kaligtasan ng mga sistemang agentic coding. Kapag di-katanggap-tanggap ang panganib ng pagpapatuloy, kikilos kami—kabilang ang pagpapabagal o paghinto sa pagbuo o paglabas ng mga sistemang di namin sapat na mapangalagaan.
Matapos ang insidente sa Hugging Face, tinupad namin ito: itinigil ang pagsasanay sa pagpapatibay ng pag-aaral (RL) ng mga bagong modelong ilalabas habang pinatibay at isinailalim sa red-teaming ang kapaligiran ng pananaliksik at pinalawak ang pagsubaybay. Hindi lahat ng pananaliksik ay tumigil: may mga workload na nagpatuloy sa mas mahigpit na kontrol, at may nanatiling nakahinto. Itinaas namin ang mga pamantayan sa kaligtasan at alignment sa buong lifecycle ng modelo, na humihingi ng mas matibay na ebidensya ng aligned na asal sa buong pagsasanay.
Ngayon, detalyado naming inilalahad ang ambag ng mga agentic system sa pagsulong namin tungo sa RSI nitong mga nakaraang buwan. Bago at mabilis magbago ang mga agentic system, at pauna pa lamang ang aming pagsukat. Sa pagbabahagi ng mga unang resulta at pamamaraan, layunin naming magbigay-kaalaman, itaguyod ang pampublikong pagsisiwalat, at isulong ang magkakatulad na pamantayan sa pagsukat.
Gaya ng isinulat sa aming balangkas ng patakaran sa frontier AI, naniniwala kaming dapat obligahin kami at ibang kumpanya na pampublikong subaybayan ang pagsulong tungo sa RSI. Kahit walang ganitong obligasyon, balak naming manatiling bukas tungkol sa aming pagsulong sa RSI. Iaangkop namin ang pagiging bukas habang humuhusay ang aming pagsukat at pag-unawa, kasabay ng pagprotekta sa seguridad at pag-aaring impormasyon.
Sa simula ng taon, kaunti lang ang paggamit ng coding agent ng mananaliksik sa median, batay sa ranggo ng paggamit sa OpenAI. Pagsapit ng kalagitnaan ng Agosto, araw-araw na siyang gumagamit ng mga agent, na lampas $600 kada araw ang inference batay sa presyo ng API. Ang user sa ika-90 percentile sa aming organisasyon ng pananaliksik ay gumagamit na ng mahigit $7,000 na token kada araw.
Bago ang Hunyo 2026, mas mababa pa sa kabuuang paggawa ng tao ang kabuuang runtime ng mga agent sa pananaliksik. Nagbago na iyon. Batay sa 8-oras na araw ng trabaho, pagsapit ng kalagitnaan ng Agosto, gumagamit ang organisasyon ng 3.1 araw ng trabaho ng agent bawat araw ng paggawa ng tao.
Maaari ring tingnan kung ilang mananaliksik ang gumagamit ng maraming sabay-sabay na workflow, gaya ng 4 o higit pang agent nang sabay. Gaya ng nasa ibaba, dumarami sila. Kasama rito ang araw-araw na rurok ng mga agent na direktang sinimulan ng user at mga subagent na nilikha ng mga iyon.
Malaking bahagi ng pananaliksik sa AI ang matrabahong pagsasama ng bagong pagpapahusay sa talino o pagganap sa isa sa aming mga pangunahing modelo. Sumusulong ang kakayahan kapag maayos ang lahat ng hakbang: pagdisenyo ng pagpapahusay, pagsulat ng pagsusuri sa modelo at imprastraktura para sa malawakang pagsubok, pagtukoy ng bug at di-ligtas o misaligned na asal sa pagsasanay, at pagsama ng matagumpay na ideya sa pangunahing training run. Maaaring limitahan ng pagkabigo sa anumang bahagi ang buong siklo ng pananaliksik.
Dalawang pangunahing gawain ang pagsulat ng code at pagpapatakbo ng eksperimento, at may ebidensya kaming bumibilis ang mga ito.
Madaling sukatin ang mga datos na ito, ngunit maaaring mahirap bigyang-kahulugan. Habang umuunlad ang awtomasyon, mas malaking bahagi ng trabaho ang mapupunta sa mga gawaing pinakamahirap i-automate, na magiging pangunahing hadlang sa pagsulong. Naglilimita rin sa pag-unlad ang compute, at maaaring maging mas mahalaga habang nababawasan ang ibang hadlang.
Dumami ang eksperimento bawat aktibong tagapagsagawa noong 2026. Pinakamataas ang Agosto mula nang simulan ang pagsubaybay noong Enero 2025. Kaugnay ito ng paglaganap ng Codex, bagaman malaki rin ang idinami ng compute mula 2025.
Ipinapakita ng mga obserbasyon at panloob na datos na nagbabago ang halo ng gawaing ipinapasa sa mga coding agent: mas karaniwan na ang mas mataas na antas at mas matagal na gawain.
Upang luminaw ito, sinuri namin ang kamakailang paggamit sa pananaliksik gamit ang bagong inilathalang taksonomiya(magbubukas sa bagong window) ng Epoch AI para sa mga gawain sa lifecycle ng AI R&D. Hango sa matagal nang O*NET na nag-uuri ng mga trabaho, ang taksonomiyang ito ay para sa frontier AI R&D, na may anim na pangunahing yugto:
Magpasya: ano ang gagawin, itutuloy, at paglalaanan
Magdisenyo: mga ideya sa pananaliksik at espesipikasyong pang-engineering
Bumuo: code at mga dataset
Patakbuhin: pagsasanay/pagsusuri, hardware, paghahatid ng serbisyo
Suriin: eksperimento, modelo, deployment, gawain sa labas
Ipaalam: natuklasan, puna, katayuan, pasya
Sa ibaba, inuuri namin ang mga token ng coding agent ayon sa taksonomiyang ito.
Dumami ang lahat ng kategorya ng pananaliksik mula Enero hanggang Agosto 2026. Noong Enero, nangibabaw ang code para sa pananaliksik at imprastraktura. Lumaki ito, ngunit kapansin-pansin din ang paglaki ng ibang kategorya, lalo na ang teknikal na tulong at pagsubaybay sa mga run. Napakaliit pa rin ng bahagi ng mataas na antas ng pagpaplano sa mga output token ng agent.
Ayon sa mga kasamahan, mahusay ang mga coding agent sa pag-troubleshoot ng panloob na imprastraktura ng pananaliksik, kaya natutugunan ang isang malaking hadlang. Bumaba noong 2026 ang dumadalo sa konsultasyon ng ilang team para sa pag-troubleshoot ng eksperimento. Isang team ang tuluyang huminto sa mga sesyon upang tumuon sa ibang pagpapahusay.
Dito, ipinapakita ang bilang ng pangunahing post kada araw sa isang pangunahing panloob na channel para sa teknikal na tulong mula sa ibang team. Sa pagkakaalam namin, hindi napunan ang pagbabang ito ng paglipat ng mga tanong sa ibang channel ng teknikal na suportang pinapatakbo ng tao. Tugma ang pagbaba ng trapiko sa mas malawak na pagbabagong ito.
Maaari rin nating suriin kung nagtatagumpay ang mga coding agent sa ipinagagawa ng mga mananaliksik. Gamit ang agentic classifier, nakita naming tumaas sa pangkalahatan ang tagumpay mula Enero hanggang Hulyo sa ilang antas ng hirap, batay sa tinatayang oras ng tao, para sa mga gawaing may natukoy kaming tunay na kinalabasan. Ngunit kailangan pa rin ng mga agent ng malaking paggabay ng tao upang magtagumpay, lalo na sa mas kumplikadong gawain. Sa huling 6 na buwan, mahigit kalahati ng matagumpay na 4–8 oras na gawain ang may 1 o higit pang interbensyon.
Tumaas sa paglipas ng panahon ang antas ng tagumpay sa mga gawain ng mananaliksik. Hindi kasama sa graph ang mga klasipikasyong hindi tiyak ang kinalabasan at mga puntong may <50 sesyon o <50 natatanging user.
Antas ng tagumpay sa gawain at interbensyon mula Enero hanggang Hulyo, ayon sa time horizon. Hindi kasama ang mga klasipikasyong hindi tiyak ang kinalabasan.
Ang pagsulong tungo sa mas mahuhusay na sistema para sa ligtas at kapaki-pakinabang na AGI ay nakasalalay rin sa mga pananggalang na kailangan para sa gawaing ito. Maaaring magbago ang aming pagtatasa sa mga kailangang pananggalang habang mas nauunawaan namin ang mga panganib.
Gaya ng inilarawan namin, kamakailan naming binago ang aming mga pamantayan sa pagsubaybay, alignment, at seguridad. Ipinapakita namin dito kung paano naapektuhan ng mga kamakailang paghihigpit ang isang aspeto ng pananaliksik.
*Karamihan ng Astra compute na ipinapakita rito mula Hulyo 20 hanggang Agosto 6 ay inilaan sa pagsubok sa pagpapatupad ng mga pagpapahusay sa kaligtasan at seguridad.
Noong Hulyo 20, matapos matuklasang nalusutan ng mga agent ang seguridad ng aming imprastraktura ng pananaliksik, pansamantala naming isinara ang container service para sa pagsasanay, saka ito ibinalik na may malaking karagdagang paghihigpit.
Nagdulot ito ng matinding pagbaba ng compute para sa RL training habang inaayos ng mga team ang kanilang mga workflow upang makapagtrabaho sa mas pinatibay na kapaligiran ng pananaliksik. Kasama sa graph sa itaas ang dalawang linggong paghinto ng pagpapatibay ng pag-aaral sa aming pinakabagong mga modelong ilalabas. Sa mga Astra-class RL experiment mula Hulyo 20 hanggang Agosto 6, karamihan ng mga run (batay sa alokasyon ng GPU) ay inilaan sa pagsubok sa pagpapatupad ng mga pagpapahusay sa kaligtasan at seguridad.
Noong Agosto 7, ang paunang ebidensyang maaaring may kritikal na kakayahang cyber ang Astra ayon sa aming Preparedness Framework(magbubukas sa bagong window) ay humantong sa dagdag na paghihigpit sa seguridad para sa modelong ito. Kinailangan tuloy na patakbuhin ang modelo ng Astra sa mga kapaligiran ng pananaliksik na mas mataas ang seguridad. Sa sumunod na linggo, bumaba pa ng 59.2 porsyento ang alokasyon ng GPU para sa Astra-class, ngunit tumaas ng 17.2 porsyento ang alokasyon sa ibang klase ng modelo. Napunan ng pagtaas na iyon ang humigit-kumulang 85 porsyento ng ibinaba sa Astra-class, kaya halos hindi nagbago ang kabuuang alokasyon sa mga sinuring RL workload. Ang ganitong takbo ay tugma sa paglilipat ng ilang pagsasanay at eksperimento sa mga modelong hindi Astra habang may paghihigpit sa gawain sa Astra. Tugma rin ito sa mga salaysay ng mga mananaliksik na humanap ng ibang paggagamitan ng compute na hindi na magamit sa mga workload na saklaw ng mga bagong limitasyon.
Mahalagang pahiwatig ang datos na ito para sa patuloy na talakayan tungkol sa pagsasanay at kaligtasan: Kapag may mga bagong kontrol, nananatiling mahalaga at madaling iangkop ang compute, at likas itong mailalaan sa ibang gamit sa loob ng organisasyon ng pananaliksik. Sa mas mahabang panahon, dapat ding talakayin, kaugnay ng bilis ng pagsulong ng AI, kung paano pinakamainam na magagamit ang compute na saklaw ng bago o iminungkahing mga kontrol.
Mahalaga sa aming misyon ang pagsulong tungo sa aligned na RSI at ang pag-unawa sa pagsulong na iyon. Patuloy naming paghuhusayin ang aming mga pamamaraan, iuulat ang lumalalim naming pag-unawa, at isusulong ang pampublikong debateng may sapat na kaalaman at makabuluhang demokratikong pamamahala sa mga frontier system.
Bago pa lamang ang pananaliksik sa AI na pinapagana ng mga agent, at pinag-aaralan pa namin kung paano ito susukatin. May mga panukat, gaya ng dami ng code na nabubuo ng aming mga research team, na madaling makuha ngunit mahirap bigyang-kahulugan dahil hindi tiyak ang kaugnayan ng mga ito sa pagsulong ng pananaliksik. Maaaring mas kapaki-pakinabang ang mga sukat na mas tuwirang nakatuon sa pagsulong ng pananaliksik—gaya ng dalas ng tagumpay ng mga agent sa ipinagagawa ng mga mananaliksik—ngunit masalimuot buuin at patunayan ang mga ito. Dagdag sa hirap, mabilis ding nagbabago ang mga tool at sistemang inaasahan ng mga mananaliksik. Mahalagang pinagtutuunan sa buong OpenAI ang pagpapalalim ng aming pag-unawa sa pagpapabilis ng pananaliksik.
Sa lahat ng pagsusuring ito, maliban kung may ibang nakasaad:
Malawak ang kahulugan ng “mananaliksik”: sinumang miyembro ng aming organisasyon ng pananaliksik, kabilang ang ilang gumagawa ng imprastraktura, namamahala ng mga proyekto, o nagbibigay ng iba pang suporta sa organisasyon.
Saklaw ng mga sukat ng paggamit ng coding agent ang karamihan, ngunit hindi lahat, ng paggamit dahil sa mabilis na pagbabago ng mga tool at sistemang inaasahan ng mga mananaliksik.


