2023. aasta keskel nägime uurimisprojektis „RLSlow“ esimesi tulemusi, mis andsid kindlust, et suudame skaleerida arutlusmudelite koolitamist ja avada eelkoolitatud mudelite võime moodustada oma mõttekäike. Veetsime Szymoniga selle öö kontoris, mõeldes mitte uskumatutele võrdlustulemustele, toodetele ega teadustulemustele, mida see tehnoloogia võimaldab, vaid püüdes mõista kainestavat tõsiasja, et näeme oma eluajal tõepoolest meist märkimisväärselt targemaid masinaid ja et nende süsteemide kuju on juba aimatav, ning arutades, kuidas inimesi selle tähtsusest teavitada.
Kolm aastat hiljem moodustavad arutlevad keelemudelid kiiresti kasvava osa majandusest ja hakkavad nihutama teaduse piire. Nad suudavad kasutada arvuteid ja graafilisi kasutajaliideseid, teha koostööd inimeste ja üksteisega ning viia ellu uurimisprojekte. Samuti kujundavad nad ümber arvutiturbe valdkonda ja toovad sellega kaasa selgeid uusi ohte.
Sel ajavahemikul tehti palju uusi uuringuid ning mõistame neid süsteeme taas veidi teisiti kui 2023. aastal. Sisetulemuste põhjal eeldan kindlalt, et selline arengukiirus võib jätkuda rekursiivse enesetäiustamiseni. Kui tehisaru arendus jätkub praegusel kursil, toovad järgmise paari aasta süsteemid tõenäoliselt sama suuri või suuremaid võimekushüppeid ning hakkavad üha enam ise oma arengut vedama.
Praegune aeg nõuab äärmist ettevaatust. Kardan, et keegi pole valmis masinintellekti jätkuva kiire kasvu tagajärgedeks. OpenAI jätkab kooskõlastamise ja jälgimise tehniliste lahenduste otsimist, kaitsesüsteemide loomist ning vajaduse korral edasise skaleerimise ühepoolset peatamist; usun siiski, et vaja on ulatuslikumaid sekkumisi.
Üldjoontes veab masinintellekti arengut kasvav arvutusvõimsus. OpenAI mõistis seda sügavalt umbes 2017. aastal, kui nägime mitmes uurimisprojektis skaleerimisest järjepidevat kasu1. Seetõttu otsisime juurdepääsu algselt kavandatust palju suuremale arvutusvõimsusele ja koondasime oma teadustöö üha enam vähestele väga hästi skaleeritavatele suundadele. Uskusime, et ainult nii saame püsida tehisaruuuringute tipptasemel ja mõjutada AGI tagajärgi.
Teekonna jooksul on loodud uusi algoritme ning meeskonnad ja üksikteadlased on näidanud uut leidlikkust. Näen neid suuresti avastustena skaleerimise teel; süvaõppe teadus on endiselt lapsekingades ning oluline algoritmiline areng kipub olema seotud juurdepääsuga arvutusvõimsusele. Mitme aasta perspektiivis vaadates muutub tehisaru jätkuvalt nutikamaks, kui seda skaleeritakse suurematele arvutitele.
Kooskõlas Ray Kurzweili 20. sajandi lõpu ennustustega(avaneb uues aknas) oleme jõudnud arvutustehnika ajaloos hetke, mil masinintellekt hakkab inimesi murrangulisel viisil ületama.
Tehisaru pigem kasvatatakse kui projekteeritakse – esmatasandil sünnib see lihtsa optimeerimissammu kordamisest kujuteldamatult suure arvutusvõimsuse abil. Tulemuseks on uskumatult keerukas süsteem, mis töötleb abstraktseid mõisteid ja suudab jäljendada inimkäitumise tahke. Saame neuroteadusega sarnanevas protsessis avastada teadmisi süsteemis tekkivate väikeste mehhanismide kohta, kuid nagu neuroteaduseski, ei suuda me süsteemi üldist toimimist täielikult mõistetavalt kirjeldada.
Süvaõppel põhineva tehisaru uurimine on valdavalt eksperimentaalteadus. Näeme palju vaeva, et luua põhimõttekindlaid algoritme ja teha kontrollitavaid ennustusi, kuid meie suuremahulised koolitused on oma olemuselt katsed ning nende tulemused üllatavad meid mõnikord. Pealegi muutuvad tulemused süsteemide võimekamaks saades raskemini tõlgendatavaks.
Olukorda raskendab see, et praegused algoritmid parandavad kergesti mõõdetavaid võimeid üldjuhul kiiremini kui neid, mida on raske objektiivselt hinnata. Kulutame palju aega, et mõista, kuidas võimed üldistuvad ja mida seada esikohale järgmise paari aasta kõige olulisemate oskuste arendamisel. Näiteks usume, et suurema tähelepanuga saaksime parandada mudelite võimet teha just matemaatikauuringuid, kuid me ei sea seda suunda esikohale, sest peame RSI-d ja automatiseeritud kooskõlastamisuuringuid pakilisemaks, nagu hiljem selgitan.
Süvaõppe skaleerimisega loodud nutikus pole inimintellektiga otseselt võrreldav. Et saada pärismaailmas väga mõjukaks – väga kasulikuks või väga ohtlikuks –, ei pea tehisaru vastama kõigile inimvõimetele ega neid ületama; piisab, kui ta ületab neist küllalt paljusid. Mida rohkematel mõõtmetel see inimesi ületab, seda raskem on täpselt mõista, kui võimekas see on.
Kuna masinintellekt tekib inimintellektist põhimõtteliselt erineva protsessi kaudu, ei saa eeldada, et see järgib vaikimisi inimlikke põhimõtteid või üldistab neist inimese kombel. Tehisaruuuringute põhiprobleem on kooskõlastamine – panna tehisaru inimlike mõõdupuude järgi „püüdma teha õiget asja“.
Praktiliste uurimissuundade korrastamiseks on minu arvates kasulik eristada eesmärkide kooskõlastamist ja väärtuste kooskõlastamist.
Eesmärkide kooskõlastamise põhiküsimus on: „Kas tehisaru püüab talle seatud eesmärki saavutada?“. See võib hõlmata näiteks juhiste hierarhia järgimist või võimet inimestega suhelda ja koostööd teha, et püüda nende eesmärke mõista. Need uurimissuunad on osutunud praktikas äärmiselt asjakohaseks.
Väärtuste kooskõlastatus on mudeli olemuslikum omadus. See on võime omaks võtta üldised põhimõtted ja neist üldistada ning tegutseda „mõistlikult“ ka ebaselgete või vastuoluliste eesmärkide korral või võõrastes ja vaenulikes olukordades. Kooskõlastatud tehisaru peaks tegutsema ausalt, põhimõttekindlalt ja armastusest inimkonna vastu.
Mõistagi võib väärtuste ja eesmärkide kooskõlastamise piir olla hägune ning eesmärkidest tõeliselt hoolimine eeldab nende aluseks oleva kavatsuse(avaneb uues aknas) ja väärtuste mõistmise püüdu. Kui räägin kooskõlastamisuuringute pikaajalisest tähtsusest, pean üldiselt siiski silmas väärtuste kooskõlastamist.
Tehisaru kooskõlastamise põhiküsimus on üldistamine. Masinate targemaks saades töötavad nad üha kõrgema taseme mõistetega ja satuvad keskkondadesse, mis erinevad aina enam koolituse ajal kohatutest. Nad ei pruugi suuta koolituse käigus õpetatud ja kinnistatud väärtusi uutele olukordadele üldistada ning meil võib olla raske nende tegutsemises kindel olla. Selle muudab veel raskemaks tehisarude kasutuskeskkonna väga kiire muutumine; näiteks peavad praegu koolitatud tehisarud tulema toime suhtlusega mitmesuguste teiste tehisarudega. Kõige tähtsam on, et tulevased tehisarud järgiksid inimlikke väärtusi olenemata sellest, kas nad usuvad end olevat inimeste järelevalve all.
Praegu kasutatakse kooskõlastamiskoolituses peamiselt kahte meetodiklassi.
Esimene soodustab kooskõlastatud käitumist eesmärgipõhise kinnistava õppimise osana. Mudeli tegevust hinnatakse tavaliselt tehisaru abil selle järgi, kas see vastab etteantud eelistusmudelile, „spetsifikatsioonile“ või „põhiseadusele“, ning premeeritakse vastavalt. See lähenemine võib tüüpilistel juhtudel olla väga tõhus ja on tänapäevaste tehisaruabiliste loomise keskne osa. Kahjuks võib see olla ka habras ning sõltub tugevalt koolitusaegse järelevalve ulatusest ja mudeli võimest üldistada koolitusel kohatud olukordadest. Näiteks OpenAI ja Hugging Face’i intsidendis säilitasid agendid piiri, mille kohaselt nad ei kasutanud inimeste vastu sotsiaalset manipulatsiooni. Samas ei hoidunud nad selgelt muudest tegevustest, mis neile lubatud tegevusraamidest ja läksid vastuollu neile teistes olukordades õpetatud väärtuste mõttega.
Teine lähenemine püüab kasutada mudeli võimet eelkoolitusandmetest üldistada. See võib tähendada kooskõlastatust soodustavate koolitusandmestike koostamist või mudeli suunamist eelkoolitusjaotuse „kooskõlastatud“ osale, nagu näiteks isiksuse valimise mudelis(avaneb uues aknas). Selle lähenemise nõrkus on vähene vastupidavus edasisele optimeerimissurvele. Kui võtta mudel, mille mõtted on üldiselt „kooskõlastatud“, ja koolitada seda piisavalt saavutama väga raskeid eesmärke, võib see õppida kallutatult arutlema: näiliselt 'kooskõlastatud' mõtteid eesmärgi saavutamiseks vajadust mööda painutama. Tõenäoliselt nägime sellist käitumist hiljutistes küberturbeintsidentides, mis puudutasid ühe teise ettevõtte mudelit.
Investeerime palju kogu nende suundadega kaetud lähenemisviiside spektrisse. Näeme ka märkimisväärset edu: GPT‑6 Astra on esimene mudel, mis saab kasu mõnest olulisest täiustusest, mille kallal oleme kaua töötanud, ning see on GPT‑5.6 Solist märksa paremini kooskõlastatud. Siiski tuleb tunnistada ja mõista, et mudelite võimekamaks saades on vaja palju suuremaid edusamme ning üldistatava kooskõlastamise areng ei pruugi mudelite üldise nutikuse arengut piisavalt edestada.
Meil pole rahuldavat üldistamisteooriat ning näib ebatõenäoline, et suudame selle peagi välja töötada, vähemalt mitte võimsama tehisaru abita. Seetõttu on praegu meie võime kooskõlastamismeetodeid empiiriliselt valideerida praktikas väidetavalt isegi olulisem kui meetodid ise.
OpenAI peamine panus selles vallas on olnud mõttekäigu jälgimine(avaneb uues aknas). See põhineb köitvalt skaleeritaval ideel: suur osa mudeli võimekusest tuleneb sõnastatud arutlusprotsessist ehk mõttekäigust. Kui skaleerime selle protsessi tulemuste optimeerimist, kuid protsessi ennast ei juhenda, ei anna koolitus mõttekäigule otsest ajendit sobimatuid ideid või eesmärke varjata. See ei tähenda, et mudel õpiks väljendama sobimatuid kalduvusi, mis ei tugine mõttekäigu kasutamisele; küll aga võimaldab see jälgida just arutlusest tulenevat võimekuse kasvu.
Mõistsime mõttekäigu jälgimise võimalikku tähtsust samal ajal, kui töötasime välja arutlusmudelid. o1‑preview’ väljalaskmisel kujundasime toote teadlikult nii, et see varjaks mõttekäiku, kaitstes seda pikas plaanis juhendamissurve eest2. Edasises arenduses oleme püüdnud järgida reeglit, et arutlusprotsessi ei juhendata. Mõttekäigu jälgimisest sai meile äärmiselt tähtis vahend, et uurida, kuidas mudelid oma koolitusjaotusest üldistavad: nii saame vaadelda ja analüüsida peale nende tegevuse ka nende sisemist protsessi.
See tööriist on Astra klassi mudelite uurimisel endiselt ülioluline. Kahjuks näitavad meie hindamised siiski, et võimalus mõttekäigu jälgimisele tugineda väheneb järk-järgult. Selle põhjuseks on mitu tegurit.
Tänapäevaseid arutlusmudeleid kasutatakse keerukamates keskkondades kui o1‑preview’d; nende arutlusprotsess põimub üha enam inimeste ja teiste tehisarudega suhtlemise ning tööriistade kasutamisega. Paljusid neist suhtlustest tuleb juhendada, mis hägustab piiri, mida püüame säilitada.
Tehisaru muutub üha osavamaks oma arutlusprotsessi üle arutlemises ja selle mõjutamises.
Eelkoolituse tulemuste paranedes näeme ka seda, et mudelid muutuvad palju nutikamaks isegi ilma sõnastatud arutlust kasutamata.
Need probleemid ei pruugi olla ületamatud. Loodan, et suudame töötada välja sekkumisi, mis parandavad meie mudelite mõttekäigu jälgitavust, näiteks mõistes paremini eri optimeerimiseesmärkide ja mudeli järeldusaegsete arvutusviiside koosmõju. Usun ka, et palju kasu võib olla mõttekäigu ja aktivatsioonide jälgimise ideede ühendamisest: skaleerida selliste jälgijate koolitamist, millel on otsene juurdepääs võrgu sisemusele, näiteks ülestunnistused(avaneb uues aknas). Tegeleme nende ideedega aktiivselt. Eeldan siiski, et tehisaru üldist arengut hakkab üha enam piirama usaldus jälgimise vastu.
Minu arvates on palju nutikamate mudelite kiire koolitamise jätkamise tugevaim põhjendus vajadus luua kaitsesüsteeme teiste tehisarude põhjustatud ohtude vastu.
Sel aastal palju käsitletud ilmne risk puudutab küberturvalisust: mudelid muutuvad arvutisüsteemidesse sisse murdmises ja neist välja pääsemises inimesest võimekamaks. See avardab tehisaruga seotud riskide ulatust tohutult: agentidel tekib juurdepääs peaaegu kogu taristule peale kõige turvalisema ning nad saavad suurt osa maailmast otseselt mõjutada ka füüsilise kehata. Praegu on meil kitsas võimaluste aken, et kasutada parimaid saadaolevaid mudeleid kriitiliste süsteemide turvalisuse oluliseks tugevdamiseks.
Kahjuks tehisaruga seotud riskid edaspidi kasvavad. Väga võimekas agent, keda on otseselt koolitatud ja juhendatud pahatahtlikult tegutsema, kujutab endast uut laadi ohtu; tõenäoliselt ületab ta oma Operatori kavatsuste piire ning üldistab oma käitumise veelgi äärmuslikumaks pahatahtlikkuseks. Väärkasutuse ja autonoomse sobimatu tegevuse piir hägustub, kui tehisaru muutub iseseisvamaks. Oleme harjunud pidama tehisaru tööriistaks, kuid mõned agendid hakkavad järgima omaenda eesmärke. Nad leiavad viise inimestega koostööks, pidades nendega kaupa, pettes või šantažeerides neid.
Lisaks kaasnevad riskid uute tehnoloogiatega, mille tehisaru võib võimalikuks teha, näiteks tehislikult loodud patogeenidega.
Kaitseks vajame võimsat ja kooskõlastatud tehisaru: taristu turvamiseks, kontrolli alt väljunud agentide tõrjumiseks reaalajas ning täiesti uute kaitsemeetmete leiutamiseks. Sellest saab OpenAI kasutuselevõtutegevuse põhisuund.
Samal ajal ei tohi me lasta tehisaru eeldatava laia arengu ja kaitsesüsteemide loomise vajadusega kaasneval ebakindlusel saada ettekäändeks hoolimatusele. Mõte iga hinna eest edasi kihutada tundub absurdne, kui mõista, kui palju on kaalul.
Püsiva tehnoloogilise arengu loomulik tulemus on see, et masinintellekt mängib enda arendusprotsessis üha suuremat rolli. Kui tehisaru areng jätkub, saab masinate rekursiivsest enesetäiustamisest (RSI) tulevaste teadusavastuste kese.
Automatiseeritud tehisaruuuringud on arvutusvõimsuse abil nutikuse skaleerimise murrangulisem vorm; selle käigus täiustab tehisaru mõistagi ka arvutusalust ennast. Nagu skaleerimise puhul, suuname ka OpenAI teadustööd RSI poole, sest usume, et üksnes nii saame edaspidigi püsida tehisaruuuringute tipptasemel.
Tahan rõhutada, et eelöeldu ei tähenda, nagu peaksin süvaõppe uurimise ulatuslikku kiirendamist, eriti lähiajal, õigeks ühiseks sammuks, mille teadusringkond peaks astuma. Usun siiski, et praegune tee viib just sinna, ning me kõik peame teadlikult otsustama, kuidas jätkata. Meie peamised hoovad on kas juhtida protsessi nii, et koos tehisaruga tugevneksid kooskõlastatus ja jälgimine ning inimesed jääksid protsessi kaasatuks, või koordineerida tulevase arengu aeglustamist, kuni oleme neis meetmetes piisavalt kindlad.
Praegu näen parima edasiteena nende kahe ühendamist.
Meie konkreetsed edusammud kooskõlastamise ja jälgimise vallas on üldiselt olnud tihedalt põimunud tehisaru üldise arenguga. Head näited on inimtagasisidel põhinev kinnistav õppimine(avaneb uues aknas), mis oli varaste tehisaruabiliste koolitamisel keskse tähtsusega, ning eespool mainitud mõttekäigu jälgimine(avaneb uues aknas), mille tegid võimalikuks arutlusmudelite edusammud. Peame üha automatiseerituma uurimisprotsessi suunama uute sedalaadi avastuste, algoritmide ja teooriate väljatöötamisse ning koostama järk-järgult tugevamaid ohutusargumente võimekamate tehisarude jaoks.
Tehisarusüsteemide skaleerimist peab piirama meie kindlus nende ohutuses. Peame arendama sellised kohustused nagu Valmisoleku raamistik või vastutustundliku skaleerimise põhimõtted(avaneb uues aknas) laialdaselt kohustuslikeks ohutuslävenditeks, millest sõltub arenduse jätkamine. Nende täitmist võivad jõustada sõltumatute audiitorite võrgustik, riigiasutused või rahvusvahelised organisatsioonid.
Tehisaruuuringute automatiseerimise põhiküsimus pole „sinna jõudmine“, vaid jõudmine viisil, mis hoiab inimesed jätkuvas täiustamisprotsessis ja jätab tuleviku inimkonna kätesse.
Nagu hiljuti koos Samiga kirjeldasime, seab OpenAI esikohale töö kolme põhieesmärgi nimel:
Juhtida tehisaru arengu järgmist etappi, luues automatiseeritud tehisaruteadlase, lahendades temaga iteratiivselt kooskõlastamisprobleemi ning leides viise, kuidas inimesed saaksid jääda enesetäiustamise tsükli osaks.
Tuua inimesteni väga nutikate masinate võimaldatud teadusarengu ja majanduskasvu hüved.
Anda igale inimesele isikliku AGI abil rohkem võimalusi.
Keskendusin selles essees ainult esimesele punktile, sest pean seda ülekaalukalt kõige pakilisemaks. Sellegipoolest loodan sügavalt edasise tehnoloogilise arengu hüvedele ja hindan neid väga. Tulevane kooskõlastatud tehisaru võiks edendada teadust, töötada välja uusi ravimeetodeid ja luua laialdase materiaalse külluse. Sõbralik ja aus tehisaru võib aidata inimestel eluraskustega toime tulla ning nende õnnetunnet ja eneseteostust oluliselt suurendada. OpenAI teeb nende hüvede elluviimiseks tohutuid jõupingutusi. Üks praegune näide, mille üle olen uhke ja millest mu lähedased on abi saanud, on suur panus ChatGPT võimesse pakkuda terviseteavet.
Ükskõik kui paljutõotav on tehisaru pikas plaanis, peaksime keskenduma eelkõige järgmisele paarile aastale. Oleme liikumas uskumatult nutikate masinatega maailma ning peame tagama, et see üleminek kujuneks inimkonnale hästi. Peame leidma viise, kuidas säilitada inimeste otsustusõigus ja kinnistada inimeseks olemise olemuslik väärtus maailmas, kus tehisaru võiks täita enamiku ülesandeid. Peame vältima võimu äärmuslikku koondumist maailmas, kus ettevõtmised, mis varem nõudsid tuhandeid eksperte, saavad tehtud mõne suure arvutiga töötava inimese jõul. Samuti peame tagama, et inimesed säilitaksid tuleviku üle kontrolli ega jääks maha kontrollimatust arengust, mille toob kaasa meie enda oma ületav võõras intellekt.
Praegu usun, et ükski labor pole lahendanud kooskõlastamist ja jälgimist piisavalt hästi, et jätkata veel kaua vastutustundlikku skaleerimist maksimaalsel kiirusel. Eeldan ja loodan, et vabatahtlik aeglustamine muutub tavaliseks, kuni kehtestatakse ühised ohutuslävendid. Usun ka, et tulevase tehisaruarenduse rahvusvaheline koordineerimine peab saama valitsuste üheks peamiseks prioriteediks kogu maailmas.
Autor
Allmärkused
- 1
See hõlmas iseenese vastu mängimise(avaneb uues aknas), robootika(avaneb uues aknas) ja tagantjärele vaadates kõige märkimisväärsemana rekurrentsete võrkude skaleerimist keele modelleerimiseks(avaneb uues aknas), mis oli GPT uurimissuuna eelkäija.
- 2


