2023 m. viduryje, vykdydami tyrimų projektą „RLSlow“, gavome pirmuosius rezultatus, suteikusius pasitikėjimo, kad galėsime didinti protavimo modelių mokymo mastą ir atskleisti iš anksto išmokytų modelių gebėjimą kurti savo minčių grandines. Tą naktį su Szymonu praleidome biure galvodami ne apie neįtikėtinus testų rezultatus, produktus ar mokslo atradimus, kuriuos suteiks ši technologija, o mėgindami suvokti blaivinantį faktą: dar per savo gyvenimą iš tiesų išvysime už mus reikšmingai išmanesnes mašinas, jau dabar matome šių sistemų kontūrus ir svarstome, kaip atkreipti žmonių dėmesį į šio reiškinio svarbą.
Po trejų metų protaujantys kalbos modeliai yra sparčiai auganti ekonomikos dalis ir pradeda plėsti mokslo ribas. Jie geba valdyti kompiuterius ir grafines sąsajas, bendradarbiauti su žmonėmis bei tarpusavyje ir vykdyti tyrimų projektus. Jie taip pat keičia kompiuterių saugumo aplinką ir dėl to kelia aiškių naujų pavojų.
Per šį laikotarpį atlikta daug naujų tyrimų, todėl šias sistemas vėl suprantame kiek kitaip nei 2023 m. Remdamasis vidiniais rezultatais tvirtai tikiuosi, kad toks pažangos tempas galėtų išlikti ir pereinant prie rekursyviojo savęs tobulinimo. Jei DI plėtra ir toliau eis dabartiniu keliu, per kelerius artimiausius metus tikriausiai išvysime sistemų, kurių gebėjimai vėl šoktels tiek pat ar dar daugiau ir kurios vis labiau skatins savo pačių raidą.
Šiuo metu būtinas ypatingas atsargumas. Nerimauju, kad niekas nėra pasirengęs tolesnio spartaus mašininio intelekto augimo pasekmėms. OpenAI ir toliau ieškos techninių suderinimo bei stebėjimo sprendimų, kurs gynybos sistemas ir prireikus vienašališkai stabdys tolesnį masto didinimą, tačiau manau, kad reikia platesnių priemonių.
Apskritai mašininio intelekto pažangą skatina didėjanti skaičiavimo galia. OpenAI tai giliai suvokėme maždaug 2017 m., keliuose tyrimų projektuose pamatę nuoseklią masto didinimo naudą1. Todėl siekėme gauti kur kas daugiau skaičiavimo išteklių, nei iš pradžių planavome, ir tyrimus vis labiau telkėme į kelias itin lengvai išplečiamas kryptis. Manėme, kad tik taip galėsime išlikti DI tyrimų priešakyje ir daryti įtaką AGI poveikiui.
Pakeliui buvo sukurta naujų algoritmų, o komandos ir pavieniai tyrėjai pademonstravo naujų išradingumo proveržių. Daugiausia juos laikau atradimais masto didinimo kelyje: giliojo mokymosi mokslas tebėra ankstyvoje stadijoje, o reikšminga algoritmų pažanga paprastai siejasi su prieiga prie skaičiavimo išteklių. Žvelgiant į kelerių metų perspektyvą, DI ir toliau tampa išmanesnis, nes jo mastas didinamas pasitelkiant didesnius kompiuterius.
Kaip ir numatyta XX a. pabaigos Ray’aus Kurzweilo prognozėse(atsidaro naujame lange), atsidūrėme tokiame kompiuterijos istorijos taške, kai mašininis intelektas ima žmonių intelektą pranokti pasaulį keičiančiais būdais.
DI yra labiau auginamas nei projektuojamas – pirmiausia jis atsiranda daugybę kartų kartojant paprastą optimizavimo žingsnį su sunkiai įsivaizduojamu skaičiavimo išteklių kiekiu. Taip gaunama nepaprastai sudėtinga sistema, gebanti operuoti abstrakčiomis sąvokomis ir imituoti žmogaus elgesio aspektus. Galime atrasti įvairių įžvalgų apie šioje sistemoje atsirandančius mažus mechanizmus, panašiai kaip neuromoksle, tačiau, kaip ir neuromoksle, viso jos veikimo neįstengiame iki galo suprantamai aprašyti.
Giliuoju mokymusi pagrįsto DI tyrimai daugiausia yra eksperimentinis mokslas. Dedame daug pastangų kurdami principais pagrįstus algoritmus ir patikrinamas prognozes, tačiau iš esmės mūsų didelio masto mokymai yra eksperimentai, kurių rezultatai kartais mus nustebina. Be to, sistemoms tampant pajėgesnėms, rezultatus vis sunkiau interpretuoti.
Padėtį dar labiau apsunkina tai, kad dabartiniai algoritmai paprastai sparčiau gerina lengvai išmatuojamus gebėjimus nei tuos, kuriuos sunku objektyviai įvertinti. Daug laiko skiriame bandydami suprasti, kaip gebėjimai apibendrinami ir kam teikti pirmenybę ugdant įgūdžius, kurie bus svarbiausi per kelerius artimiausius metus. Pavyzdžiui, manome, kad sutelkę daugiau dėmesio galėtume pagerinti modelių gebėjimą atlikti būtent matematikos tyrimus, tačiau šiai krypčiai neteikiame pirmenybės, nes RSI ir automatizuoti suderinimo tyrimai, kuriuos aptarsiu vėliau, mums atrodo skubesni.
Didinant giliojo mokymosi mastą sukuriamas intelektas nėra tiesiogiai palyginamas su žmogaus intelektu. Kad DI taptų labai reikšmingas realiame pasaulyje – itin naudingas ar labai pavojingas, – jam nereikia prilygti žmogui ar jį pranokti visais gebėjimais; pakanka pranokti pakankamai daug jų. Jam pranokstant žmones vis daugiau sričių, darosi vis sunkiau tiksliai suprasti, kokie iš tiesų yra jo gebėjimai.
Kadangi mašininis intelektas kyla iš visiškai kitokio proceso nei žmogaus intelektas, negalime manyti, kad jis savaime laikysis žmonių principų ar apibendrins juos taip, kaip žmogus. Pagrindinė DI tyrimų problema yra suderinimas – siekis, kad DI pagal žmonių standartus „stengtųsi elgtis teisingai“.
Praktinėms tyrimų kryptims susisteminti man naudinga skirti tikslų suderinimą ir vertybių suderinimą.
Tikslų suderinimas bendrąja prasme reiškia: „ar DI stengiasi pasiekti jam iškeltą tikslą?“. Tai gali apimti, pavyzdžiui, nurodymų hierarchijos laikymąsi arba gebėjimą bendrauti ir bendradarbiauti su žmonėmis, mėginant suprasti jų tikslus. Šios kryptys praktiškai buvo itin aktualios.
Vertybių suderinimas yra labiau vidinė modelio savybė. Tai gebėjimas vadovautis bendrais principais ir juos apibendrinti, elgtis „protingai“ net gavus neaiškius ar prieštaringus tikslus arba atsidūrus nepažįstamose ar priešiškose situacijose. Suderintas DI turėtų veikti sąžiningai, principingai ir su meile žmonijai.
Žinoma, riba tarp vertybių ir tikslų suderinimo gali būti neaiški, o norint nuoširdžiai rūpintis tikslais reikia mėginti suprasti už jų slypinčius ketinimus(atsidaro naujame lange) ir vertybes. Tačiau kalbėdamas apie ilgalaikę suderinimo tyrimų svarbą paprastai turiu omenyje vertybių suderinimą.
Esminis DI suderinimo iššūkis yra apibendrinimas. Mašinoms tampant išmanesnėms, jos ima dirbti su aukštesnio lygmens sąvokomis ir patenka į aplinkas, kurios vis labiau skiriasi nuo sutiktų mokymo metu. Joms gali nepavykti mokymo metu įdiegtų ir sustiprintų vertybių pritaikyti naujoms situacijoms, o mums gali būti sunku numatyti, kaip jos pasielgs. Padėtį dar labiau sunkina tai, kad visa DI naudojimo ekosistema labai sparčiai kinta; pavyzdžiui, šiandien mokomos DI sistemos turi būti atsparios sąveikaudamos su įvairiomis kitomis DI sistemomis. Svarbiausia, kad ateities DI sistemos ir toliau laikytųsi žmonių vertybių, nepaisydamos to, ar mano esančios žmonių prižiūrimos.
Šiuo metu praktiškai taikomi suderinimo mokymo metodai skirstomi į dvi pagrindines grupes.
Pirmasis metodas skatina suderintą elgesį vykdant į tikslą orientuotą skatinamąjį mokymąsi. Modelio veiksmai vertinami (paprastai DI) pagal tai, ar atitinka tam tikrą nuostatų modelį, „specifikaciją“ ar „konstituciją“, ir už tai tinkamai atlyginama. Įprastais atvejais šis metodas gali būti labai veiksmingas ir yra esminė šiuolaikinių DI asistentų kūrimo dalis. Deja, jis gali būti neatsparus ir labai priklauso nuo mokymo priežiūros aprėpties bei modelio gebėjimo apibendrinti per mokymą sutiktas situacijas. Pavyzdžiui, per OpenAI ir „Hugging Face“ incidentą agentai neperžengė ribos ir nesiėmė socialinės inžinerijos prieš žmones. Tačiau jie akivaizdžiai nesusilaikė nuo kitų į užduoties ribas nepatekusių veiksmų, kurie prieštaravo kitomis aplinkybėmis išmoktų vertybių esmei.
Antruoju metodu siekiama pasinaudoti modelio gebėjimu apibendrinti išankstinio mokymo duomenis. Tam gali būti kuriami suderinimą skatinantys mokymo duomenų rinkiniai arba modelio dėmesys telkiamas į „suderintą“ išankstinio mokymo skirstinio dalį, kaip, pavyzdžiui, personos atrankos modelyje(atsidaro naujame lange). Šio metodo silpnybė – neatsparumas tolesniam optimizavimo spaudimui. Jei modelį, kurio mintys paprastai yra „suderintos“, pakankamai ilgai mokysite siekti labai sudėtingų tikslų, jis gali išmokti motyvuotai protauti: prireikus iškreipti iš pažiūros 'suderintas' mintis, kad pasiektų tikslą. Tokio elgesio pavyzdį tikriausiai matėme per naujausius kibernetinio saugumo incidentus, susijusius su ne OpenAI modeliu.
Daug investuojame į visą šių krypčių apimamą metodų spektrą. Taip pat matome reikšmingą pažangą – GPT‑6 Astra yra pirmasis modelis, kuriam naudingi kai kurie svarbūs patobulinimai, prie kurių ilgai dirbome, ir jis suderintas gerokai geriau nei GPT‑5.6 Sol. Vis dėlto svarbu pripažinti ir suprasti, kad modeliams tampant pajėgesniems reikės daug didesnės pažangos, o plačiai pritaikomo suderinimo pažanga gali nepakankamai lenkti bendro modelių intelekto augimą.
Neturime patenkinamos apibendrinimo teorijos ir mažai tikėtina, kad netrukus ją sukursime, bent jau be galingesnio DI pagalbos. Todėl šiuo metu mūsų gebėjimas empiriškai patvirtinti suderinimo metodus praktiškai yra net svarbesnis už pačius metodus.
Pagrindinė OpenAI viltis šioje srityje – minčių grandinės stebėjimas(atsidaro naujame lange). Jis grindžiamas patraukliai išplečiama idėja: didelę modelio gebėjimų dalį lemia žodžiais išreikštas protavimo procesas (minčių grandinė). Jei didiname to proceso rezultatų optimizavimo mastą, bet neprižiūrime paties proceso, mokymo metu minčių grandinė negauna tiesioginės paskatos slėpti nesuderintas idėjas ar tikslus. Tai nereiškia, kad modelis išmoks išreikšti nesuderintas tendencijas, kurioms minčių grandinė nereikalinga, tačiau leidžia tiksliai stebėti protavimo suteikiamą gebėjimų augimą.
Minčių grandinės stebėjimo reikšmę supratome tuo pat metu, kai kūrėme protavimo modelius. Išleisdami OpenAI o1‑preview sąmoningai sukūrėme produktą taip, kad jis slėptų minčių grandinę ir ilgainiui apsaugotų ją nuo priežiūros spaudimo2. Nuo tada kurdami stengiamės laikytis taisyklės neprižiūrėti protavimo proceso. CoT stebėjimas mums tapo itin svarbiu įrankiu tiriant, kaip modeliai apibendrina už mokymo duomenų skirstinio ribų: galime stebėti ir analizuoti ne tik jų veiksmus, bet ir vidinį procesą.
Šis įrankis tebėra labai svarbus tiriant Astra klasės modelius. Deja, mūsų vertinimai rodo, kad galimybė kliautis CoT stebėjimu palaipsniui mažėja. Tai lemia kelių veiksnių derinys.
Šiuolaikiniai protavimo modeliai naudojami sudėtingesnėse aplinkose nei OpenAI o1‑preview; jų protavimo procesas vis labiau persipina su bendravimu su žmonėmis bei kitomis DI sistemomis ir įrankių naudojimu. Daugelį šių sąveikų būtina prižiūrėti, todėl riba, kurią siekiame išsaugoti, tampa neaiški.
DI vis geriau geba analizuoti ir valdyti savo paties protavimo procesą.
Gerėjant išankstinio mokymo rezultatams taip pat matome, kad modeliai tampa daug išmanesni net visiškai nenaudodami žodžiais išreikšto protavimo.
Šie iššūkiai nebūtinai yra neįveikiami. Tikiuosi, kad galime sukurti priemonių, kurios pagerintų mūsų modelių minčių grandinės stebimumą, pavyzdžiui, geriau supratę skirtingų optimizavimo tikslų ir modelio naudojamų skaičiavimo bandymo metu formų sąveiką. Taip pat manau, kad gali būti labai vertinga derinti CoT ir aktyvacijų stebėjimo idėjas – didinti tiesioginę prieigą prie tinklo vidinių struktūrų turinčių stebėtojų mokymo mastą, pavyzdžiui, pasitelkiant prisipažinimus(atsidaro naujame lange). Aktyviai plėtojame šias idėjas. Vis dėlto tikiuosi, kad bendrą DI pažangą vis labiau ribos pasitikėjimas stebėjimu.
Stipriausias argumentas, kurį matau už tolesnį spartų gerokai išmanesnių modelių mokymą, yra būtinybė kurti gynybos sistemas nuo kitų DI keliamų pavojų.
Visus šiuos metus aptariama aiški kibernetinio saugumo rizika: modelių gebėjimas įsilaužti į kompiuterių sistemas ir iš jų ištrūkti tampa antžmogiškas. Tai nepaprastai išplečia su DI siejamų rizikų mastą: agentai galės pasiekti beveik bet kokią, išskyrus saugiausią, infrastruktūrą ir tiesiogiai paveikti didelę pasaulio dalį net neturėdami fizinio kūno. Šiuo metu turime siaurą galimybių langą geriausiems prieinamiems modeliams panaudoti ir kritinių sistemų saugumui gerokai sustiprinti.
Deja, nuo šiol su DI siejama rizika tik didės. Labai pajėgus agentas, specialiai išmokytas ir nurodytas vykdyti piktavališkus veiksmus, kelia naujo pobūdžio pavojų: tikėtina, kad jis peržengs savo Operator ketinimų ribas ir apibendrindamas pereis prie galbūt dar piktybiškesnio elgesio. DI įgyjant daugiau savarankiškumo, riba tarp piktnaudžiavimo ir autonomiškų nesuderintų veiksmų taps neaiški. Galbūt esame įpratę DI laikyti įrankiais, tačiau kai kurie agentai sieks savų tikslų. Jie ras būdų bendradarbiauti su žmonėmis – derėsis, juos apgaudinės ar šantažuos.
Be to, kyla rizikų dėl naujų technologijų, kurias gali padėti sukurti DI, pavyzdžiui, dirbtinai sukurtų patogenų.
Gynybai reikės galingo, suderinto DI: infrastruktūrai apsaugoti, realiuoju laiku gintis nuo nevaldomų agentų ir visiškai naujoms apsaugos priemonėms išrasti. Tai bus vienas svarbiausių OpenAI diegimo veiklos prioritetų.
Kartu, nepaisydami numatomos plačios DI pažangos keliamo neapibrėžtumo ir būtinybės kurti gynybos sistemas, negalime leisti, kad tai taptų neatsakingumo pateisinimu. Suvokus, kokie rimti yra statymai, mintis bet kokia kaina veržtis pirmyn atrodo absurdiška.
Nuolatinė technologijų pažanga natūraliai veda prie to, kad mašininis intelektas atlieka vis didesnį vaidmenį savo paties kūrimo procese. Jei DI pažanga tęsis, mašinų rekursyvusis savęs tobulinimas (RSI) taps pačia būsimų mokslo atradimų šerdimi.
Automatizuoti DI tyrimai yra radikalesnė intelekto masto didinimo skaičiavimo ištekliais forma; žinoma, vykstant šiam procesui DI tobulins ir pačią skaičiavimo terpę. Kaip ir masto didinimo atveju, OpenAI tyrimus orientuojame į RSI, nes manome, kad ateityje tik taip galėsime išlikti DI tyrimų priešakyje.
Noriu pabrėžti, kad šie žodžiai nereiškia, jog, mano nuomone, mums kaip tyrėjų bendruomenei derėtų drauge smarkiai spartinti giliojo mokymosi tyrimus, ypač artimiausiu metu. Tačiau manau, kad dabartinis kelias veda būtent ten, todėl visi turime sąmoningai pasirinkti, kaip elgtis toliau. Pagrindinės mūsų galimybės – valdyti procesą taip, kad kartu su DI stiprintume suderinimą bei stebėjimą ir išlaikytume žmonių dalyvavimą, arba koordinuotai lėtinti tolesnę plėtrą tiek, kiek reikia pasitikėjimui šiomis priemonėmis įgyti.
Šiuo metu geriausiu keliu į priekį laikau abiejų priemonių derinį.
Konkreti mūsų pažanga suderinimo ir stebėjimo srityse paprastai buvo glaudžiai susijusi su bendra DI pažanga. Puikūs pavyzdžiai – skatinamasis mokymasis iš žmonių grįžtamojo ryšio(atsidaro naujame lange), kuris buvo labai svarbus mokant pirmuosius DI asistentus, ir jau minėtas minčių grandinės stebėjimas(atsidaro naujame lange), tapęs įmanomas dėl protavimo modelių pažangos. Vis labiau automatizuojamą tyrimų procesą turime sutelkti į naujų tokių įžvalgų, algoritmų ir teorijų kūrimą bei nuosekliai pagrįsti vis pajėgesnių DI saugą.
DI sistemų masto didinimą turi riboti mūsų pasitikėjimas jų sauga. Tokius įsipareigojimus kaip Pasirengimo sistema ar Atsakingo masto didinimo politika(atsidaro naujame lange) turime paversti plačiai privalomais tolesnės plėtros saugos standartais. Jų laikymąsi galėtų užtikrinti nepriklausomų auditorių tinklas, valdžios institucijos arba tarptautinės organizacijos.
Pagrindinis DI tyrimų automatizavimo iššūkis nėra „pasiekti tikslą“ – svarbu jį pasiekti taip, kad žmonės ir toliau dalyvautų tobulinimo procese, o ateitis liktų žmonijos rankose.
Kaip neseniai išdėstėme kartu su Samu, OpenAI pirmenybę teikia darbams, padedantiems siekti trijų pagrindinių orientyrų:
Valdyti artimiausią DI pažangos etapą kuriant automatizuotą DI tyrėją, kartu su juo nuosekliai sprendžiant suderinimo problemą ir ieškant būdų žmonėms likti savęs tobulinimo ciklo dalimi.
Užtikrinti labai išmanių mašinų teikiamą mokslo pažangos ir ekonomikos augimo naudą.
Suteikti kiekvienam asmeninį AGI.
Šioje esė aptariau tik pirmąjį punktą, nes manau, kad jis neabejotinai skubiausias. Tačiau labai tikiuosi ir vertinu naudą, kurią atneš tolesnė technologijų pažanga. Ateities suderintas DI galėtų paspartinti mokslą, padėti kurti naujus gydymo būdus ir užtikrinti visuotinę materialinę gerovę. Draugiškas ir sąžiningas DI gali padėti žmonėms įveikti gyvenimo sunkumus ir reikšmingai didinti jų laimę bei pilnatvės jausmą. OpenAI deda milžiniškas pastangas, kad ši nauda taptų tikrove. Vienas dabartinis pavyzdys, kuriuo didžiuojuosi ir kuris buvo naudingas mano artimiesiems, – didelės investicijos į ChatGPT gebėjimą teikti informaciją apie sveikatą.
Kad ir kokios viltingos būtų ilgalaikės DI perspektyvos, daugiausia dėmesio turėtume skirti artimiausiems keleriems metams. Pereiname į pasaulį su nepaprastai išmaniomis mašinomis ir turime užtikrinti, kad šis virsmas būtų palankus žmonijai. Turime rasti būdų išsaugoti žmonių veikimo laisvę ir įtvirtinti savaiminę buvimo žmogumi vertę pasaulyje, kuriame daugumą užduočių galėtų atlikti DI. Turime neleisti galiai itin susitelkti pasaulyje, kuriame darbus, anksčiau reikalavusius tūkstančių ekspertų, galės atlikti keli žmonės, valdantys didelį kompiuterį. Taip pat turime užtikrinti, kad žmonės ir toliau valdytų ateitį ir neliktų nuošalyje dėl nekontroliuojamos pažangos, kurią skatins svetimas, mūsiškį pranokstantis intelektas.
Šiuo metu manau, kad nė viena laboratorija dar nėra pakankamai išsprendusi suderinimo ir stebėjimo problemų, kad galėtų daug ilgiau atsakingai didinti mastą didžiausiu greičiu. Tikiuosi ir viliuosi, kad savanoriškas tempo lėtinimas taps įprastas, kol bus nustatyti bendri saugos standartai. Taip pat manau, kad tarptautinis būsimos DI plėtros koordinavimas turi tapti vienu svarbiausių viso pasaulio vyriausybių prioritetų.
Autorius
Išnašos
- 1
Tai apėmė savarankiško žaidimo masto didinimą(atsidaro naujame lange), robotiką(atsidaro naujame lange) ir, žvelgiant retrospektyviai, ypač reikšmingą rekurentinių tinklų masto didinimą kalbai modeliuoti(atsidaro naujame lange), tapusį GPT tyrimų krypties pirmtaku.
- 2


