Tyrimų spartinimas: žvilgsnis į „OpenAI“ iš vidaus
Mūsų įsitikinimu, kad AGI neštų naudą visai žmonijai, jis turi būti valdomas demokratiškai. Tai įmanoma tik skatinant viešas, faktais grįstas diskusijas apie itin pajėgių DI sistemų galimybes, rizikos veiksnius ir apsaugos priemones. Žmonės visame pasaulyje turi suprasti tikėtiną priešakinio DI raidos kryptį, kad galėtų prasmingai dalyvauti priimant sprendimus dėl jo plėtros.
Skaidrumas kalbant apie konkrečius rizikos veiksnius, incidentus ir apsaugos priemones yra būtinas, tačiau vien jo nepakanka. Manome, kad visuomenė taip pat turi žinoti, kaip pažangiausiose laboratorijose kuriamos pačios pajėgiausios sistemos ir kaip jos skatina mokslinių tyrimų pažangą.
Siekiame saugiai sukurti automatizuotą DI tyrėją, kuris galėtų dirbti prižiūrimas žmonių ir padėtų siekti pažangos giliojo mokymosi bei suderinimo srityse, taip atverdamas kelią nuolatiniams patobulinimams. Mūsų duomenimis, jau pasiekėme praėjusį rudenį paskelbtą(atsidaro naujame lange) tikslą iki šių metų rugsėjo sukurti automatizuotą tyrimų praktikantą. Sąvoka „tyrimų praktikantas“ reiškia sistemą, gebančią vykdyti aiškiai apibrėžtas tyrimų užduotis prižiūrint žmogui. Tai apima ir užduotis, kurioms atlikti patyręs tyrėjas sugaištų kelias dienas. Darome sparčią pažangą siekdami iki 2028 m. kovo sukurti automatizuotą DI tyrėją.
Per šiuos metus „OpenAI“ tyrėjų kasdienis darbas iš esmės pasikeitė. Tyrėjai programavimo agentus naudoja visą dieną (dažnai vienu metu veikiančiose sesijose). Bendras jų naudojimas sparčiai auga ir lenkia augimo tempus kitose „OpenAI“ komandose. Tyrėjai greičiau rašo kodą ir atlieka daugiau eksperimentų. Keičiasi ir agentų pritaikymas: jie atlieka vis sudėtingesnes užduotis ir vis dažniau jas įvykdo sėkmingai. DI tyrimai – sudėtingas procesas, turintis daug galimų kliūčių, todėl bendras pažangos tempas greičiausiai nebus toks pat spartus kaip šie konkretūs rodikliai. Vis dėlto šios išvados iš esmės atitinka bendrą daugelio mūsų nuomonę organizacijos viduje – agentiniai įrankiai reikšmingai spartina tyrimų pažangą. Žmonės ir toliau nustato tyrimų prioritetus, atrenka perspektyviausias idėjas bei rezultatus ir sprendžia, ar sistemas plėsti, pristabdyti, ar diegti.
Tikime, kad atsakingai atliekami automatizuoti DI tyrimai leis sukurti modelius, kurie tiesiogiai pagerins žmonių gerovę ir padės įgyvendinti „OpenAI“ misiją. Tai gali sumažinti pažangaus intelekto kainą, kad juo galėtų naudotis žmonės visame pasaulyje. Šio darbo imamės ir dėl to, jog automatizuoti tyrimai gali padėti išspręsti suderinimo problemas ir sukurti apsaugą nuo vis pajėgesnio DI. Automatizuotas DI tyrėjas taip pat gali atlikti automatizuoto saugos arba suderinimo tyrėjo funkcijas. Pajėgesnės, suderintos sistemos galėtų padėti apsaugoti ypatingos svarbos infrastruktūrą, apsiginti nuo pavojingų DI agentų ir kurti naujas apsaugos priemones.
Dėl šių priežasčių verta kurti naudingus automatizuotų tyrimų pajėgumus, tačiau tai nereiškia, kad spartus RSI yra rezultatas, kurio neabejotinai turėtume siekti. Tolesni sprendimai priklausys nuo mūsų gebėjimo išlaikyti žmogaus kontrolę ir nuo pagrįstų demokratinių sprendimų dėl naudos bei rizikos veiksnių.
Dar nežinome, kaip saugiai pasiekti suderintą ir visavertį RSI. Stengiamės, kad suderinimo ir saugos priemonių mastas augtų kartu su modelių pajėgumais. Tačiau negalime aklai pasikliauti, kad pažanga suderinimo ir saugos srityse neatsiliks, o pajėgesnes sistemas gali tapti sunkiau stebėti. Šių pastangų pagrindas – kruopštus suderinimo ir saugos darbas, kuris prasideda nuo šiandien agentinio programavimo sistemose matomų saugos problemų vertinimo ir švelninimo. Kaskart nustatę, kad tolesnė veikla keltų nepriimtiną pavojų saugai, imsimės atitinkamų veiksmų – pavyzdžiui, sulėtinsime arba sustabdysime sistemų, kurių negalime tinkamai apsaugoti, kūrimą ar diegimą.
Po neseniai įvykusio „Hugging Face“ incidento laikėmės šio įsipareigojimo – pristabdėme naujausių, diegimui ruošiamų modelių skatinamąjį mokymą (RL), kol papildomai stiprinome savo tyrimų aplinkas, testavome jas spragoms nustatyti ir plėtėme stebėsenos sistemų aprėptį. Tai nesustabdė visų tyrimų: kai kurios užduotys buvo atnaujintos taikant griežtesnes kontrolės priemones, o kitos liko sustabdytos. Griežčiau apibrėžėme saugos ir suderinimo standartus bei labiau integravome saugos procesus į modelio gyvavimo ciklą, todėl dabar per visą mokymo procesą reikalaujame svaresnių suderinto elgesio įrodymų.
Šiandien pateikiame išsamią apžvalgą, kaip agentinės sistemos pastaraisiais mėnesiais prisidėjo prie mūsų pažangos siekiant rekursyvaus savęs tobulinimo (RSI). Agentinės sistemos yra naujos ir sparčiai keičiasi, todėl mūsų vertinimo pastangos vis dar preliminarios. Dalydamiesi šiais ankstyvaisiais rezultatais ir jų vertinimo metodais, siekiame informuoti visuomenę, formuoti viešo informacijos atskleidimo normą ir paskatinti visą sektorių pereiti prie bendrų matavimo standartų.
Galiausiai, kaip rašėme savo priešakinės politikos gairėse, tikime, kad mums ir kitoms įmonėms turėtų būti privaloma viešai stebėti pažangą siekiant RSI. Net ir nesant tokio reikalavimo, planuojame ir toliau skaidriai informuoti apie savo pažangą siekiant RSI. Tobulėjant matavimo metodams ir supratimui, toliau plėtosime savo skaidrumo politiką, kartu išlaikydami pusiausvyrą tarp skaidrumo ir poreikio užtikrinti saugumą bei apsaugoti komercinę paslaptį sudarančią informaciją.
Šių metų pradžioje, vertinant pagal agentų naudojimą „OpenAI“, vidutinis tyrėjas programavimo agentus naudojo tik labai ribotai. Iki rugpjūčio vidurio vidutinis tyrėjas agentus į savo darbą įtraukdavo kasdien – remiantis API įkainiais, modelio vykdymui jis per dieną išleisdavo per 600 JAV dolerių. Dabar mūsų tyrimų padalinyje 90-ojo procentilio naudotojas per dieną sunaudoja žetonų už daugiau nei 7 000 JAV dolerių.
Iki 2026 m. birželio bendra agentų veikimo trukmė tyrimų padalinyje vis dar buvo trumpesnė nei bendras žmonių darbo laikas. Vėliau situacija pasikeitė. Skaičiuojant standartinėmis 8 valandų darbo dienomis, nuo rugpjūčio vidurio vienai žmogaus darbo dienai tyrimų padalinyje tenka 3,1 agento darbo dienos.
Kitas būdas tai įvertinti – pažiūrėti, kiek tyrėjų naudoja lygiagrečius darbo procesus (pvz., vienu metu paleidžia 4 ar daugiau agentų). Kaip parodyta toliau, šis skaičius nuolat auga. Šie skaičiai apima tiesiogiai naudotojo paleistų agentų ir jų vėliau sukurtų antrinių agentų dienos piką.
Didelę dalį DI tyrimų galima laikyti imliu darbui procesu, kurio tikslas – integruoti naujus modelio intelekto ar našumo patobulinimus į vieną iš mūsų pagrindinių modelių. Šis procesas susideda iš daugelio etapų, o modelio galimybės auga tik tada, kai viskas sklandžiai dera tarpusavyje: tyrėjai turi projektuoti naujus patobulinimus, ruošti vertinimus modelio našumui išbandyti, kurti infrastruktūrą, skirtą testuoti šiuos patobulinimus dideliu mastu, mokymo metu identifikuoti klaidas ir nesaugų ar nesuderintą elgesį bei integruoti pasiteisinusias idėjas į pagrindinį mokymo procesą. Nesėkmė bet kuriame tyrimo etape gali tapti kliūtimi visam ciklui.
Kodo rašymas ir eksperimentų vykdymas – tai du pagrindiniai tyrėjų darbai, ir, kaip rodo duomenys, šie procesai vis spartėja.
Šiuos duomenis palyginti lengva išmatuoti, tačiau interpretuoti gali būti gana sudėtinga. Žengiant į priekį, sunkiausiai automatizuojamos užduotys pareikalaus vis daugiau tyrėjų pastangų ir taps pagrindiniu iššūkiu tolesnei pažangai. Skaičiavimo resursai – dar vienas pažangą ribojantis veiksnys, kuris, mažėjant kitų kliūčių, ilgainiui gali tapti vis svarbesnis.
Per 2026 m. vienam aktyviam tyrėjui tenkančių eksperimentų skaičius išaugo, o 2026 m. rugpjūtį pasiekė visų laikų rekordą nuo pat stebėjimo pradžios 2025 m. sausį. Tai koreliuoja su aktyvesniu „Codex“ naudojimu, nors verta paminėti, kad nuo 2025 m. gerokai išaugo ir mūsų turimi skaičiavimo resursai.
Tiek kokybiniai vertinimai, tiek vidiniai duomenys rodo, kad keičiasi užduočių, kurias tyrėjai deleguoja programavimo agentams, pobūdis: ilgainiui vis dažniau patikimos aukštesnio lygio užduotys, kurioms atlikti reikia daugiau laiko.
Norėdami susidaryti aiškesnį šios tendencijos vaizdą, išanalizavome pastarojo meto agentų naudojimą tyrimų padalinyje, pasitelkę „Epoch AI“ sukurtą ir neseniai paskelbtą taksonomiją(atsidaro naujame lange), kuri apima įvairių rūšių darbus, įeinančius į DI tyrimų ir plėtros gyvavimo ciklą. Ši taksonomija, įkvėpta jau seniai gyvuojančios ir įvairias darbo rūšis klasifikuojančios O*NET sistemos, specialiai pritaikyta priešakinio DI tyrimams bei plėtrai ir padalija šį procesą į šešis pagrindinius etapus:
Sprendimas: su kuo dirbti, kokius darbus tęsti, kur paskirstyti resursus
Projektavimas: tyrimų idėjos ir inžinerinės specifikacijos
Kūrimas: kodas ir duomenų rinkiniai
Vykdymas: mokymo ir vertinimo užduotys, aparatinė įranga, paslaugų teikimas
Analizė: eksperimentai, modeliai, diegimas, išoriniai darbai
Komunikacija: atradimai, grįžtamasis ryšys, būsena, sprendimai
Toliau pagal šią taksonomiją klasifikuojame programavimo agento žetonus.
Matome, kad nuo 2026 m. sausio iki rugpjūčio padidėjo visų kategorijų tyrimų veiklos apimtys. Sausį vyraujanti kategorija buvo tyrimų ir infrastruktūros kodas. Ši kategorija išsiplėtė, tačiau ryškus augimas pastebimas ir kitose, ypač – techninės pagalbos ir vykdymų stebėjimo. Aukšto lygio planavimas vis dar sudaro tik labai mažą agentų išvesties žetonų dalį.
Remiantis atskirais kolegų atsiliepimais, programavimo agentams puikiai sekasi šalinti vidinės tyrimų infrastruktūros gedimus, o tai pašalina vieną reikšmingą tyrimų pažangos kliūtį. Kelios komandos, anksčiau rengdavusios konsultacijas ir padėdavusios tyrėjams šalinti eksperimentų nesklandumus, pastebėjo, kad 2026 m. besikreipiančiųjų skaičius sumažėjo. Viena komanda tokius susitikimus apskritai nutraukė ir dėmesį sutelkė į kitus sistemos patobulinimus.
Šioje diagramoje pavaizduotas pagrindinių įrašų skaičius per dieną viename iš pagrindinių vidinių kanalų, kuriame tyrėjai kreipiasi į kitas komandas techninės pagalbos. Kiek mums žinoma, šio kanalo aktyvumo sumažėjimo nekompensavo užklausų perkėlimas į kitą žmonių prižiūrimą techninės pagalbos kanalą. Šis srauto sumažėjimas atitinka platesnę tendenciją.
Taip pat galime įvertinti, ar programavimo agentams pavyksta atlikti tyrėjų pavestas užduotis. Pasitelkę agentinį klasifikatorių nustatėme, kad nuo sausio iki liepos užduočių, kurioms galime nustatyti etaloninį rezultatą, sėkmės rodikliai iš esmės augo keliose sudėtingumo grupėse (kaip apytikslis rodiklis čia naudojamas numatomas žmogaus darbo laikas užduočiai atlikti). Vis dėlto, norint sėkmingų rezultatų, agentams vis dar reikia nemažai žmogaus įsikišimo, ypač kai atliekamos sudėtingesnės užduotys. Per pastaruosius šešis mėnesius daugiau nei pusė sėkmingai atliktų 4–8 valandų trukmės užduočių pareikalavo bent vienos žmogaus intervencijos.
Tyrėjų užduočių sėkmės rodikliai ilgainiui išaugo. Į grafiką neįtrauktos klasifikacijos, kurių rezultatas buvo neaiškus, bei taškai, apimantys mažiau nei 50 sesijų ar 50 unikalių naudotojų.
Užduočių sėkmės ir intervencijų rodikliai nuo sausio iki liepos, suskirstyti pagal laiko perspektyvą. Neįtrauktos klasifikacijos, kurių rezultatas buvo neaiškus.
Pažanga kuriant pajėgesnes sistemas, skirtas saugiam ir naudingam AGI, taip pat priklausys nuo šiam darbui būtinų apsaugos priemonių. Daugiau sužinojus apie rizikos veiksnius, mūsų vertinimas, kokių apsaugos priemonių reikia, gali keistis.
Kaip jau rašėme, neseniai atnaujinome stebėsenos, suderinimo ir saugumo standartus. Čia parodome, kaip pastarieji apribojimai paveikė vieną tyrimų veiklos aspektą.
* Didžioji dalis čia rodomų „Astra“ skaičiavimo resursų, naudotų nuo liepos 20 d. iki rugpjūčio 6 d., buvo skirta saugos ir saugumo patobulinimų įgyvendinimui išbandyti.
Liepos 20 d., paaiškėjus, kad agentai pažeidė tyrimų infrastruktūrą, laikinai sustabdėme mokymui naudotą programinės vykdymo aplinkos paslaugą, o vėliau ją atkūrėme taikydami griežtus papildomus apribojimus.
Dėl to smarkiai sumažėjo RL mokymo skaičiavimo resursų naudojimas, kol komandos pritaikė savo darbo procesus veiklai griežčiau apsaugotoje tyrimų aplinkoje. Pateiktame grafike atsispindi dviejų savaičių skatinamojo mokymosi (RL) pertrauka, taikyta naujausiems diegti skirtiems modeliams. Didžioji dalis „Astra“ klasės RL eksperimentų vykdymų (pagal paskirstytus GPU resursus) nuo liepos 20 d. iki rugpjūčio 6 d. buvo skirta saugos ir saugumo patobulinimų įgyvendinimui išbandyti.
Rugpjūčio 7 d. pasirodžius preliminarių įrodymų, kad pagal mūsų Pasirengimo sistemą(atsidaro naujame lange) „Astra“ gali turėti kritinių kibernetinių pajėgumų, pritaikyti papildomi saugumo apribojimai šiam modeliui. Dėl jų „Astra“ modelis turėjo būti vykdomas aukštesnio saugumo tyrimų aplinkoje. Kitą savaitę „Astra“ klasės modeliams paskirstytų GPU resursų dalis sumažėjo dar 59,2 proc., tačiau kitų klasių modeliams skirtų resursų dalis išaugo 17,2 proc. Šis augimas kompensavo apie 85 proc. „Astra“ klasės resursų sumažėjimo, todėl bendras resursų paskirstymas analizuotoms RL užduotims beveik nepakito. Ši tendencija rodo, kad apribojus su „Astra“ susijusį darbą, dalis mokymų ir eksperimentų buvo perkelta į kitus modelius. Tai atitinka ir pavienius tyrėjų pranešimus, kad jie rado naujų būdų panaudoti skaičiavimo resursus, kurių nebebuvo galima skirti naujų apribojimų veikiamoms užduotims.
Šie duomenys yra naudingas orientyras vykstančiose diskusijose apie mokymą ir saugą: net įvedus naujas kontrolės priemones, skaičiavimo resursai išlieka vertingi bei lankstūs ir natūraliai pritaikomi kitoms tyrimų užduotims. Žvelgiant į ateitį, diskusijose apie DI pažangos tempą taip pat turėtų būti keliamas klausimas, kaip geriausiai panaudoti skaičiavimo resursus, kuriems taikomos naujos arba siūlomos kontrolės priemonės.
Mūsų misijai svarbu daryti pažangą siekiant suderinto RSI ir gerai ją suprasti. Toliau tobulinsime savo metodus, informuosime visuomenę apie besiplečiantį mūsų supratimą bei skatinsime faktais grįstas viešas diskusijas ir prasmingą demokratinį priešakinių sistemų valdymą.
Agentais pagrįsti DI tyrimai – dar nauja sritis, todėl tebesimokome, kaip juos vertinti. Kai kuriuos rodiklius, pavyzdžiui, mūsų tyrimų komandų sugeneruoto kodo kiekį, surinkti palyginti lengva, tačiau interpretuoti sunku, nes jų ryšys su tyrimų pažanga nėra aiškus. Rodikliai, tiesiogiau atspindintys tyrimų pažangą – pavyzdžiui, kaip dažnai agentai sėkmingai atlieka tyrėjų pavestas užduotis, – būtų naudingesni, tačiau juos sudėtinga sukurti ir patvirtinti. Vertinimą dar labiau sunkina tai, jog įrankiai ir sistemos, kuriais naudojasi tyrėjai, itin sparčiai keičiasi. Geresnis tyrimų spartinimo proceso supratimas – viena iš prioritetinių visos „OpenAI“ organizacijos sričių.
Visose šiose analizėse, jei nenurodyta kitaip:
Sąvoka „tyrėjas“ plačiąja prasme reiškia bet kurį mūsų tyrimų padalinio darbuotoją, įskaitant kuriančius tyrimų infrastruktūrą, valdančius tyrimų projektus ar kitaip prisidedančius prie organizacijos veiklos.
Programavimo agentų naudojimo rodikliai atspindi didžiąją dalį, tačiau ne visą jų naudojimą, nes įrankiai ir sistemos, kuriais naudojasi tyrėjai, sparčiai tobulėja.


