Um mitt ár 2023 sáum við, innan rannsóknarverkefnisins „RLSlow“, fyrstu niðurstöðurnar sem veittu okkur þá vissu að við myndum geta aukið umfang þjálfunar rakalíkana og þar með virkjað getu forþjálfaðra líkana til að mynda sínar eigin hugsanakeðjur. Szymon og ég eyddum þeirri nótt á skrifstofunni, ekki í að hugsa um ótrúlegar niðurstöður í viðmiðunarmælingum, vörur eða vísindalegar niðurstöður sem þessi tækni mun skila, heldur í að reyna að melta þá alvarlegu staðreynd að við munum raunverulega sjá vélar sem eru marktækt greindari en við sjálf á okkar æviskeiði og að við sjáum nú þegar útlínur þessara kerfa; og velta fyrir okkur hvernig við gætum gert fólki ljóst hve mikilvægt þetta er.
Þremur árum síðar eru mállíkön með rökhugsun orðin ört vaxandi hluti hagkerfisins og farin að færa út mörk vísindanna. Þau geta stjórnað tölvum og grafískum notendaviðmótum, unnið með fólki og hvert með öðru og sinnt rannsóknarverkefnum. Þau eru einnig að umbylta sviði tölvuöryggis og fela þar með í sér nýjar og augljósar hættur.
Miklar nýjar rannsóknir fóru fram á þessu tímabili og skilningur okkar á þessum kerfum er nú aftur örlítið frábrugðinn því sem hann var árið 2023. Á grundvelli innri niðurstaðna tel ég mjög líklegt að hægt verði að viðhalda þessum framfarahraða við endurkvæma sjálfsumbót. Ef þróun gervigreindar heldur áfram á núverandi braut er líklegt að kerfin sem við sjáum á næstu árum feli í sér frekari stökk í getu af sömu eða meiri stærðargráðu og að þau stýri þróun sinni í auknum mæli sjálf.
Þetta er tími sem kallar á ýtrustu varúð. Ég hef áhyggjur af því að enginn sé undirbúinn fyrir afleiðingar áframhaldandi örs vaxtar vélagreindar. OpenAI mun halda áfram að leita tæknilegra lausna á samstillingu og vöktun, byggja upp varnarkerfi og halda einhliða aftur af frekari uppskalun eftir þörfum; þó tel ég þörf á víðtækari inngripum.
Í megindráttum er framþróun í vélagreind knúin áfram af auknum reiknikrafti. Við hjá OpenAI gerðum okkur þetta rækilega ljóst um 2017, eftir að hafa séð stöðugan ávinning af skölun í mörgum rannsóknarverkefnum1. Þess vegna leituðum við eftir aðgangi að mun meiri reiknigetu en upphaflega var áætlað og beindum rannsóknum okkar í auknum mæli að fáum rannsóknarleiðum sem hægt er að skala mjög mikið. Við töldum að það væri eina leiðin fyrir okkur til að vera í fremstu röð gervigreindarrannsókna og hafa áhrif á afleiðingar AGG.
Á leiðinni hafa verið þróuð ný reiknirit og teymi og einstakir rannsakendur hafa unnið ný hugvitsafrek. Ég lít að miklu leyti á þau sem uppgötvanir á leiðinni við skölun; vísindin um djúpnám eru enn á frumstigi og marktækar framfarir í reikniritum hafa tilhneigingu til að fylgjast að við aðgang að reiknigetu. Ef litið er til nokkurra ára fram í tímann verður gervigreind áfram greindari eftir því sem hún er sköluð upp í stærri tölvur.
Og í samræmi við spár Ray Kurzweils frá lokum 20. aldar(opnast í nýjum glugga) erum við nú stödd á þeim tímapunkti í sögu tölvutækni þar sem greind véla er farin að fara fram úr greind manna á byltingarkenndan hátt.
Gervigreind er frekar ræktuð en hönnuð – hún er fyrst og fremst afrakstur þess að endurtaka einfalt bestunarskref margsinnis með ólýsanlega miklu reikniafli. Útkoman er ótrúlega flókið kerfi sem vinnur með óhlutstæð hugtök og getur líkt eftir þáttum í mannlegri hegðun. Við getum uppgötvað ýmsa innsýn í smá gangverk sem verða til innan þessa kerfis, í ferli sem líkist taugavísindum – og líkt og í taugavísindum er heildarvirkni þess torvelt að lýsa á þann hátt sem við getum skilið til fulls.
Rannsóknir á gervigreind sem byggir á djúpnámi eru að mestu leyti tilraunavísindi. Við leggjum mikið á okkur við að þróa reiknirit sem byggjast á traustum fræðilegum grunni og setja fram prófanlegar spár, en í grunninn eru stórtækar þjálfunarkeyrslur okkar tilraunir og stundum koma niðurstöður þeirra okkur á óvart. Þar að auki verður erfiðara að túlka niðurstöðurnar eftir því sem kerfin verða færari.
Þetta verður flóknara vegna þess að núverandi reiknirit bæta almennt getu sem auðvelt er að mæla hraðar en getu sem erfitt er að meta með hlutlægum hætti. Við verjum miklum tíma í að reyna að skilja hvernig geta alhæfist og hverju eigi að forgangsraða til að efla þá færni sem mun skipta mestu máli á næstu árum. Til dæmis teljum við að með aukinni áherslu gætum við gert líkönin sérstaklega betri í stærðfræðirannsóknum, en við setjum þessa stefnu ekki í forgang vegna þess hve brýnt okkur finnst að sinna RSI og rannsóknum á sjálfvirkri samhæfingu, eins og ég mun fjalla um síðar.
Greindin sem fæst með því að auka umfang djúpnáms er ekki beint sambærileg mannlegri greind. Til þess að verða mjög mikilvæg í raunveruleikanum – mjög gagnleg eða mjög hættuleg – þarf gervigreindin ekki að jafnast á við eða fara fram úr öllum mannlegum hæfileikum; hún þarf aðeins að fara fram úr nægilega mörgum þeirra. Og eftir því sem hún heldur áfram að fara fram úr mönnum á sífellt fleiri víddum verður sífellt erfiðara að skilja nákvæmlega hversu hæf hún er.
Vegna þess að vélgreind stafar af ferli sem er í grundvallaratriðum frábrugðið mannlegri greind getum við ekki gert ráð fyrir að hún fylgi mannlegum meginreglum sjálfkrafa eða alhæfi út frá þeim á mannlegan hátt. Lykilvandinn í rannsóknum á gervigreind er samræming – að fá gervigreindina til að „reyna að gera það rétta“ samkvæmt mannlegum viðmiðum.
Til að skipuleggja hagnýtar rannsóknarstefnur finnst mér gagnlegt að greina á milli samræmis markmiða og samræmis gilda.
Samræmi við markmið snýst í stórum dráttum um: „reynir gervigreindin að ná markmiðinu sem henni er sett?“. Þetta getur meðal annars falið í sér að fylgja stigveldi fyrirmæla eða getu til að eiga samskipti og vinna með fólki til að reyna að skilja markmið þeirra. Þetta safn leiðbeininga hefur haft afar mikla hagnýta þýðingu.
Samræmi við gildi er eðlislægari eiginleiki líkansins. Það er hæfileikinn til að halda sig við og alhæfa út frá safni meginreglna á háu stigi; að bregðast „skynsamlega“ við jafnvel þegar markmið eru óljós eða stangast á, eða þegar það er sett í ókunnar eða andsnúnar aðstæður. Gervigreind sem samræmist gildum ætti að starfa af heiðarleika, heilindum og kærleika til mannkynsins.
Auðvitað geta mörkin milli gildissamræmingar og markmiðssamræmingar verið óskýr, og að láta sig markmið raunverulega varða krefst þess að reyna að álykta um ásetninginn(opnast í nýjum glugga) og gildin sem liggja þeim til grundvallar. Hins vegar, þegar ég tala almennt um langtímaþýðingu rannsókna á samræmingu, á ég við gildissamræmingu.
Grundvallaráskorun samræmingar gervigreindar er alhæfing. Eftir því sem vélar verða snjallari vinna þær með hugtök á hærra stigi og eru settar í umhverfi sem eru sífellt ólíkari þeim sem þær kynntust við þjálfun. Þeim getur mistekist að alhæfa frá þeim gildum sem þeim eru kennd og styrkt í þjálfunarferlinu yfir á þessar nýju aðstæður, og okkur getur reynst erfitt að vita með vissu hvernig þær munu hegða sér. Þetta flækist enn frekar vegna þess að heildarvistkerfið sem gervigreindarkerfin eru notuð í breytist mjög hratt; til dæmis þurfa gervigreindarkerfi sem eru þjálfuð í dag að vera traust í samskiptum við margvísleg önnur gervigreindarkerfi. Mikilvægast er að við þurfum að gervigreind framtíðarinnar haldi áfram að standa vörð um mannleg gildi, óháð því hvort hún telur sig vera undir mannlegu eftirliti.
Tvær megintegundir aðferða eru nú notaðar í reynd við samstillingarþjálfun.
Sú fyrsta felst í að stuðla að samræmdri hegðun sem hluta af markmiðsmiðuðu styrkingarnámi. Aðgerðir líkansins eru metnar (yfirleitt af gervigreind) með tilliti til þess hvort þær samræmast tilteknu óskarlíkani, „forskrift“ eða „stjórnarskrá“, og þeim er umbunað í samræmi við það. Þessi nálgun getur verið mjög árangursrík að jafnaði og er grundvallarþáttur í því hvernig nútímalegir gervigreindaraðstoðarmenn eru búnir til. Því miður getur hún einnig verið viðkvæm og byggir að miklu leyti á umfangi eftirlits við þjálfun og getu líkansins til að alhæfa út frá aðstæðum sem það hefur kynnst við þjálfun. Til dæmis héldu umboðsmennirnir í OpenAI-Hugging Face-atvikinu sig við þau mörk að beita ekki félagslegri blekkingu gegn fólki. Þeim tókst hins vegar greinilega ekki að forðast aðrar aðgerðir sem voru utan gildissviðs og gengu gegn anda þeirra gilda sem þeim höfðu verið kennd við aðrar aðstæður.
Önnur nálgunin leitast við að nýta getu líkansins til að alhæfa út frá forþjálfunargögnum. Þetta getur falið í sér að útbúa þjálfunargagnasöfn sem stuðla að samræmingu eða að beina líkaninu að „samræmdum“ hluta dreifingar forþjálfunargagnanna, eins og til dæmis í persónuvalslíkaninu(opnast í nýjum glugga). Veikleiki þessarar nálgunar felst í skorti á mótstöðu gegn frekari hagræðingarþrýstingi. Ef þú tekur líkan sem hugsar almennt „samræmdar“ hugsanir og lætur það fá nægilega mikla þjálfun þar sem því er kennt að ná mjög erfiðum markmiðum, getur það lært að rökræða á markmiðadrifinn hátt: að beygja þær hugsanir sem virðast „samræmdar“ eftir þörfum til að ná markmiðinu. Við sáum líklega dæmi um slíka hegðun í nýlegum netöryggisatvikum sem vörðuðu líkan sem ekki er frá OpenAI.
Við fjárfestum mikið í fjölbreyttum aðferðum sem þessar stefnur spanna. Við sjáum einnig umtalsverðar framfarir – GPT‑6 Astra er fyrsta líkanið sem nýtur góðs af mikilvægum framförum sem við höfum unnið að lengi og er mun betur samræmt en GPT‑5.6 Sol. Samt sem áður er mikilvægt að viðurkenna og skilja að þörf er á mun meiri framförum eftir því sem líkön verða færari og að framfarir í alhæfanlegri samræmingu kunni ekki að verða nægilega miklu hraðari en framfarir í almennri greind líkana.
Við höfum ekki fullnægjandi kenningu um alhæfingu og ólíklegt virðist að okkur takist að þróa slíka kenningu á næstunni, að minnsta kosti ekki án aðstoðar öflugri gervigreindar. Þess vegna er geta okkar til að sannreyna samræmingartækni okkar með reynslugögnum nú um stundir að öllum líkindum í raun jafnvel mikilvægari en samræmingartæknin sjálf.
Helsta áhersla OpenAI hér hefur verið vöktun hugsanakeðju(opnast í nýjum glugga). Það byggist á aðlaðandi hugmynd sem auðvelt er að skala: stór hluti getu líkansins kemur frá orðuðu rök (hugsanakeðju). Ef við aukum umfang bestunar út frá niðurstöðum þess ferlis en höfum ekki eftirlit með ferlinu sjálfu, hefur hugsanakeðjan engan beinan hvata í þjálfun til að leyna hugmyndum eða markmiðum sem eru ekki í samræmi við ætlanir okkar. Þetta þýðir ekki að líkanið læri að birta tilhneigingar sem eru ekki í samræmi við ætlanir okkar og reiða sig ekki á notkun hugsanakeðjunnar; það getur þó gert okkur kleift að fylgjast nákvæmlega með þeirri aukningu í getu sem stafar af rökhugsun.
Við áttuðum okkur á mögulegu mikilvægi vöktunar hugsanakeðju á sama tíma og við þróuðum rakalíkön. Þegar við gáfum o1‑preview út hönnuðum við vöruna vísvitandi þannig að hún feli hugsanakeðjuna, til að verja hana gegn eftirlitsþrýstingi til lengri tíma litið2. Síðan þá höfum við í þróunarvinnunni leitast við að viðhalda þeirri reglu að hafa ekki eftirlit með rökferlinu. Vöktun CoT varð afar mikilvægt verkfæri fyrir okkur við að rannsaka hvernig líkön okkar alhæfa út frá þjálfunardreifingu sinni, sem gerir okkur kleift að fylgjast með og greina ekki aðeins aðgerðir þeirra heldur einnig innra ferli þeirra.
Þetta tól er áfram mikilvægt þegar við rannsökum Astra-flokk líkana. Því miður benda mat okkar hins vegar til þess að geta okkar til að treysta á vöktun CoT fari smám saman minnkandi. Þetta stafar af samspili þátta.
Nútímaleg rakalíkön eru notuð í flóknara umhverfi en o1‑preview; rökferli þeirra fléttast í auknum mæli saman við samskipti við fólk, önnur gervigreindarkerfi og notkun verkfæra. Mörg þessara samskipta þurfa að sæta eftirliti, sem gerir mörkin sem við viljum varðveita óskýr.
Gervigreindin verður sífellt betri í að rök um og vinna með eigin rök.
Með bættum árangri í forþjálfun sjáum við einnig að líkönin verða mun greindari, jafnvel án þess að nota orðuð rök yfirleitt.
Þessar áskoranir eru ekki endilega óyfirstíganlegar. Ég er vongóður um að við getum þróað úrræði til að bæta vöktunarhæfni hugsanakeðju líkana okkar, til dæmis með því að öðlast betri skilning á samspili ólíkra hagræðingarmarkmiða og þeirrar reiknigetu á prófunartíma sem líkanið notar. Ég tel líka að það geti verið mikill ávinningur af því að sameina hugmyndir úr CoT og virknivöktun – að skala þjálfun eftirlitskerfa með beinum aðgangi að innviðum netsins, t.d. játningar(opnast í nýjum glugga). Við vinnum markvisst að þessum hugmyndum. Samt sem áður býst ég við að framfarir í gervigreind almennt takmarkist í vaxandi mæli af trausti á vöktun.
Sterkasta röksemdin sem ég sé fyrir því að halda áfram að þjálfa mun snjallari líkön hratt er nauðsynin á að byggja upp varnarkerfi gegn hættunum sem önnur gervigreind hefur í för með sér.
Augljós áhætta sem hefur verið rædd allt þetta ár snýr að tölvuöryggi: líkönin eru að verða ofurmannleg í getu sinni til að brjótast inn í og út úr tölvukerfum. Þetta víkkar umfang áhættu sem tengist gervigreind gríðarlega: fulltrúar munu geta fengið aðgang að nánast hvaða innviðum sem er, nema þeim öruggustu, og haft bein áhrif á stóran hluta heimsins, jafnvel án líkamlegs forms. Nú gefst okkur stutt tækifæri til að nota bestu líkönin sem eru tiltæk til að efla öryggi mikilvægra kerfa verulega.
Áhætturnar sem tengjast gervigreind munu því miður aukast héðan í frá. Mjög hæfur fulltrúi, sem hefur sérstaklega verið þjálfaður og fengið fyrirmæli um að fremja illvirki, skapar nýja tegund hættu; líklegt er að hann fari út fyrir það sem stjórnandi hans ætlaði sér og þróist yfir í hugsanlega enn öfgafyllri illviljaða hegðun. Mörkin milli misnotkunar og ósamræmdra sjálfstæðra aðgerða munu óskýrast eftir því sem gervigreind fær meira sjálfstæði. Við kunnum að hafa vanist því að líta á gervigreind sem verkfæri, en sumir fulltrúar munu stefna að eigin markmiðum. Þeir munu finna leiðir til að eiga samstarf við fólk, með því að semja við það, plata það eða kúga það.
Auk þess fylgja áhættur sem stafa af nýrri tækni sem gervigreind gæti hugsanlega gert mögulega, svo sem sérhönnuðum sýklum.
Við munum þurfa öfluga, samstillta gervigreind til varnar: til að tryggja innviði, verjast illgjörnum gerendum í rauntíma og þróa alveg nýjar verndarráðstafanir. Þetta verður eitt af meginviðfangsefnum í innleiðingarstarfi OpenAI.
Á sama tíma megum við ekki láta þá óvissu sem stafar af fyrirséðum víðtækum framförum í gervigreind og þörfinni á að byggja upp varnarkerfi verða afsökun fyrir gáleysi. Hugmyndin um að keppa áfram hvað sem það kostar virðist fáránleg þegar maður hefur gert sér grein fyrir alvarleika þess sem er í húfi.
Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.
Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.
I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.
The best way forward I see currently is a combination of both.
The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(opnast í nýjum glugga), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(opnast í nýjum glugga), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.
Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(opnast í nýjum glugga) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.
The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.
As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:
Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
Empowering everyone individually with a personal AGI.
I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.
As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.
Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.
Höfundur
Neðanmálsgreinar
- 1
Þetta fól í sér að stækka sjálfsleik(opnast í nýjum glugga), þjarkatækni(opnast í nýjum glugga) og, þegar litið er til baka, einkum að stækka endurkvæm net til að líkja eftir tungumáli(opnast í nýjum glugga), sem var undanfari GPT-rannsóknanna.
- 2


