Pāriet uz galveno saturu
OpenAI

2026. gada 6. septembris

DrošībaIzpēte

Svešāds prāts

Autors: Jakubs Pahockis, OpenAI galvenais zinātnieks

Notiek ielāde…

2023. gada vidū pētniecības projektā “RLSlow” mēs ieguvām pirmos rezultātus, kas deva pārliecību, ka spēsim mērogot spriestspējas modeļu apmācību, atraisot priekšapmācītu modeļu spēju veidot savas domu ķēdes. Tovakar mēs ar Šimonu palikām birojā un domājām nevis par neticamajiem etalontestu rezultātiem, produktiem vai zinātniskajiem sasniegumiem, ko šī tehnoloģija radīs, bet centāmies aptvert skarbo faktu, ka jau savas dzīves laikā patiešām pieredzēsim mašīnas, kas būs ievērojami gudrākas par mums, un ka jau redzam šo sistēmu aprises; mēs prātojām, kā cilvēkiem darīt zināmu tā nozīmīgumu.

Trīs gadus vēlāk spriestspējas valodas modeļi veido strauji augošu ekonomikas daļu un sāk paplašināt zinātnes iespēju robežas. Tie spēj lietot datorus un grafiskās saskarnes, sadarboties ar cilvēkiem un cits ar citu, kā arī īstenot pētniecības projektus. Tie pārveido arī datoru drošības vidi un tādējādi rada nepārprotamus jaunus draudus.

Šajā periodā veikts daudz jaunu pētījumu, un mūsu izpratne par šīm sistēmām atkal nedaudz atšķiras no 2023. gada izpratnes. Ņemot vērā iekšējos rezultātus, esmu pārliecināts, ka šādu attīstības tempu būs iespējams saglabāt arī rekursīvas pašpilnveides posmā. Ja MI izstrāde turpināsies pa pašreizējo ceļu, sistēmas, ko redzēsim nākamajos gados, visticamāk, piedzīvos tikpat lielus vai vēl lielākus spēju lēcienus un arvien vairāk pašas virzīs savu attīstību.

Šis ir laiks, kad nepieciešama ārkārtīga piesardzība. Mani satrauc tas, ka neviens nav gatavs sekām, ko radīs nepārtrauktais un straujais mašīninteliģences pieaugums. OpenAI turpinās meklēt tehniskus saskaņošanas un pārraudzības risinājumus, veidot aizsardzības sistēmas un vajadzības gadījumā vienpusēji atturēties no turpmākas mērogošanas; tomēr uzskatu, ka nepieciešami plašāki pasākumi.

Intelekts, ko pilnībā neizprotam

Kopumā mašīninteliģences attīstību virza skaitļošanas jaudas pieaugums. Mēs OpenAI to pilnībā apzinājāmies ap 2017. gadu, kad vairākos pētniecības projektos novērojām stabilus mērogošanas ieguvumus1. Tāpēc centāmies iegūt piekļuvi daudz lielākiem skaitļošanas resursiem, nekā sākotnēji plānots, un arvien vairāk koncentrējām pētniecību uz dažiem ļoti mērogojamiem virzieniem. Uzskatījām, ka tas ir vienīgais veids, kā palikt MI pētniecības robežšķirtnē un ietekmēt AGI radītās pārmaiņas.

Pa ceļam ir izstrādāti jauni algoritmi, un komandas un atsevišķi pētnieki ir demonstrējuši jaunu atjautību. Lielākoties uzskatu tos par atklājumiem mērogošanas ceļā; dziļās mācīšanās zinātne joprojām ir agrīnā stadijā, un nozīmīgs algoritmiskais progress mēdz būt saistīts ar piekļuvi skaitļošanas resursiem. Raugoties vairāku gadu perspektīvā, MI turpina kļūt gudrāks, to mērogojot darbam ar lielākiem datoriem.

Atbilstoši Reja Kurcveila prognozēm 20. gadsimta beigās⁠(atveras jaunā logā) esam nonākuši skaitļošanas vēstures brīdī, kad mašīninteliģence pārveidojošā veidā sāk pārspēt cilvēka intelektu.

MI drīzāk tiek izaudzēts, nevis projektēts – pirmām kārtām tas rodas, daudzkārt atkārtojot vienkāršu optimizācijas soli ar grūti aptveramu skaitļošanas resursu apjomu. Tā rodas neticami sarežģīta sistēma, kas darbojas ar abstraktiem jēdzieniem un spēj atdarināt cilvēku uzvedības aspektus. Mēs varam gūt dažādas atziņas par nelieliem mehānismiem, kas rodas šajā sistēmā, līdzīgi kā neirozinātnē, taču arī šeit sistēmas darbību kopumā nav iespējams pilnīgi saprotami aprakstīt.

Uz dziļo mācīšanos balstīta MI izpēte lielākoties ir eksperimentāla zinātne. Mēs veltām daudz pūļu⁠ principiālu algoritmu izstrādei un pārbaudāmu prognožu veidošanai, tomēr būtībā mūsu liela mēroga apmācības ir eksperimenti, un to rezultāti mūs dažkārt pārsteidz. Turklāt, sistēmām kļūstot spējīgākām, rezultātus ir grūtāk interpretēt.

Situāciju vēl vairāk sarežģī tas, ka pašreizējie algoritmi parasti ātrāk uzlabo viegli izmērāmas spējas nekā tās, kuras ir grūti objektīvi novērtēt. Mēs daudz laika veltām, lai izprastu, kā spējas vispārinās un kam dot priekšroku, attīstot prasmes, kas nākamajos gados būs visnozīmīgākās. Piemēram, uzskatām, ka ar papildu uzmanību varētu īpaši uzlabot modeļu spējas matemātikas pētniecībā, taču nedodam šim virzienam priekšroku, jo RSI un automatizēta saskaņošanas pētniecība, ko aplūkošu vēlāk, mums šķiet steidzamākas.

Ar dziļās mācīšanās mērogošanu radītais intelekts nav tieši salīdzināms ar cilvēka intelektu. Lai kļūtu ļoti nozīmīgs reālajā pasaulē – ļoti noderīgs vai ļoti bīstams – MI nav jāatbilst visām cilvēka spējām vai tās jāpārspēj; tam jāpārspēj tikai pietiekami daudzas no tām. Tam pārspējot cilvēkus arvien vairākās jomās, kļūst aizvien grūtāk precīzi saprast, cik spējīgs tas ir.

Mācīt mašīnām mīlēt

Tā kā mašīninteliģence rodas pilnīgi citādā procesā nekā cilvēka intelekts, nevaram pieņemt, ka tā pēc noklusējuma ievēro cilvēku principus vai vispārina tos tāpat kā cilvēki. MI pētniecības pamatproblēma ir saskaņošana – panākt, lai MI pēc cilvēku mērauklas “censtos rīkoties pareizi”.

Lai strukturētu praktiskos pētniecības virzienus, man šķiet lietderīgi nošķirt mērķu saskaņošanu un vērtību saskaņošanu.

Mērķu saskaņošana plašā nozīmē atbild uz jautājumu: “Vai MI cenšas sasniegt tam izvirzīto mērķi?” Tas var ietvert, piemēram, norādījumu hierarhijas⁠ ievērošanu vai spēju sazināties un sadarboties ar cilvēkiem, cenšoties izprast viņu mērķus. Šis virzienu kopums praksē ir bijis ārkārtīgi nozīmīgs.

Vērtību saskaņotība ir būtiskāka modeļa iekšējā īpašība. Tā ir spēja ievērot augsta līmeņa principu kopumu un vispārināt no tā – rīkoties “saprātīgi” pat tad, ja mērķi ir neskaidri vai pretrunīgi vai modelis nonāk nepazīstamās vai naidīgās situācijās. Saskaņotam MI būtu jārīkojas godīgi, godprātīgi un ar mīlestību pret cilvēci.

Protams, robeža starp vērtību un mērķu saskaņošanu var būt izplūdusi, un patiesas rūpes par mērķiem prasa centienus izsecināt to pamatā esošo nodomu⁠(atveras jaunā logā) un vērtības. Tomēr, runājot par saskaņošanas pētniecības nozīmi ilgtermiņā, parasti domāju vērtību saskaņošanu.

MI saskaņošanas galvenais izaicinājums ir vispārināšana. Mašīnām kļūstot gudrākām, tās strādā ar arvien augstāka līmeņa jēdzieniem un nonāk vidēs, kas arvien vairāk atšķiras no apmācībā pieredzētajām. Tās var nespēt apmācības laikā mācītās un nostiprinātās vērtības vispārināt uz šīm jaunajām situācijām, un mums var būt grūti droši paredzēt to rīcību. To vēl vairāk sarežģī ļoti straujās pārmaiņas kopējā ekosistēmā, kurā MI tiek izmantoti; piemēram, šodien apmācītiem MI jāspēj droši mijiedarboties ar dažādiem citiem MI. Īpaši svarīgi, lai nākotnes MI turpinātu ievērot cilvēku vērtības neatkarīgi no tā, vai tie uzskata, ka cilvēki tos pārrauga.

Pašlaik praksē izmanto divas galvenās saskaņošanas apmācības metožu grupas.

Pirmā veicina saskaņotu rīcību uz mērķiem orientētas stimulētās mācīšanās ietvaros. Modeļa darbības tiek izvērtētas (parasti ar MI), nosakot to atbilstību konkrētam preferenču modelim, “specifikācijai” vai “konstitūcijai”, un attiecīgi atalgotas. Vidusmēra gadījumā šī pieeja var būt ļoti efektīva, un tā ir būtiska mūsdienu MI asistentu izstrādes daļa. Diemžēl tā var būt arī trausla un ir ļoti atkarīga no apmācības pārraudzības tvēruma un modeļa spējas vispārināt apmācībā sastaptās situācijas. Piemēram, OpenAI un Hugging Face incidentā aģenti ievēroja robežu, kas aizliedza sociāli manipulēt ar cilvēkiem. Tomēr tie nepārprotami neatturējās no citām darbībām, kas pārsniedza uzdevuma robežas un bija pretrunā citos apstākļos mācīto vērtību būtībai.

Otrā pieeja cenšas izmantot modeļa spēju vispārināt no priekšapmācības datiem. Tā var ietvert saskaņošanu veicinošu apmācības datkopu izstrādi vai modeļa koncentrēšanu uz “saskaņotu” priekšapmācības sadalījuma daļu, piemēram, kā personas atlases modelī⁠(atveras jaunā logā). Šīs pieejas vājā vieta ir nepietiekama noturība pret turpmāku optimizācijas spiedienu. Ja modeli, kas kopumā domā “saskaņoti”, pietiekami ilgi māca sasniegt ļoti sarežģītus mērķus, tas var iemācīties spriest tendenciozi – pēc vajadzības pielāgot šķietami “saskaņotās” domas mērķa sasniegšanai. Šādas rīcības piemēru, visticamāk, redzējām nesenos kiberdrošības incidentos, kuros bija iesaistīts modelis, kas nav OpenAI modelis.

Mēs veicam lielus ieguldījumus visā šo virzienu aptvertajā pieeju spektrā. Redzam arī būtisku progresu – GPT‑6 Astra ir pirmais modelis, kas izmanto dažus svarīgus sasniegumus, pie kuriem ilgi esam strādājuši, un tas ir ievērojami labāk saskaņots nekā GPT‑5.6 Sol. Tomēr jāatzīst un jāsaprot, ka, modeļiem kļūstot spējīgākiem, vajadzīgs vēl daudz lielāks progress un ka vispārināmas saskaņošanas attīstība var nebūt pietiekami straujāka par modeļu vispārējā intelekta attīstību.

Vispārināšanas pārraudzība

Mums nav apmierinošas vispārināšanas teorijas, un šķiet maz ticams, ka spēsim to drīzumā izstrādāt – vismaz bez jaudīgāka MI palīdzības. Tāpēc pašlaik mūsu spēja empīriski pārbaudīt saskaņošanas metodes praksē, iespējams, ir pat svarīgāka par pašām metodēm.

OpenAI galvenais uzsvars šajā jomā ir bijusi domu ķēdes pārraudzība⁠(atveras jaunā logā). Tās pamatā ir pievilcīgi mērogojama ideja: liela daļa modeļa spēju izriet no vārdos izteikta spriešanas procesa (domu ķēdes). Ja mērogojam šā procesa rezultātu optimizāciju, bet nepārraugām pašu procesu, apmācības laikā domu ķēdei nav tieša stimula slēpt nesaskaņotas idejas vai mērķus. Tas nenozīmē, ka modelis iemācīsies atklāti paust nesaskaņotas tendences, kurām domu ķēde nav vajadzīga; tomēr tā var ļaut mums pārraudzīt tieši spriestspējas radīto spēju pieaugumu.

Domu ķēdes pārraudzības iespējamo nozīmi mēs apzinājāmies vienlaikus ar spriestspējas modeļu izstrādi. Izlaižot o1‑preview, mēs apzināti izstrādājām produktu tā, lai slēptu domu ķēdi⁠ un ilgtermiņā pasargātu to no pārraudzības spiediena2. Kopš tā laika izstrādē esam centušies ievērot principu nepārraudzīt spriešanas procesu. CoT pārraudzība mums kļuva par ārkārtīgi svarīgu rīku, pētot, kā mūsu modeļi vispārina ārpus apmācības sadalījuma, jo tā ļauj novērot un analizēt ne tikai to darbības, bet arī iekšējo procesu.

Šis rīks joprojām ir ļoti svarīgs, pētot Astra klases modeļus. Diemžēl mūsu novērtējumi liecina, ka iespēja paļauties uz CoT pārraudzību pakāpeniski mazinās. To izraisa vairāku faktoru kopums.

  • Mūsdienu spriestspējas modeļus izmanto sarežģītākās vidēs nekā o1‑preview; to spriešanas process arvien vairāk saplūst ar saziņu ar cilvēkiem un citiem MI, kā arī rīku izmantošanu. Daudzas no šīm mijiedarbībām ir jāpārrauga, tādējādi izpludinot robežu, ko vēlamies saglabāt.

  • MI arvien labāk spēj analizēt un ietekmēt pats savu spriešanas procesu.

  • Uzlabojoties priekšapmācības rezultātiem, redzam arī, ka modeļi kļūst daudz gudrāki, pat nemaz neizmantojot vārdos izteiktu spriešanu.

Šie izaicinājumi ne vienmēr ir nepārvarami. Ceru, ka spēsim izstrādāt risinājumus savu modeļu domu ķēdes pārraugāmības uzlabošanai, piemēram, labāk izprotot mijiedarbību starp dažādiem optimizācijas mērķiem un modeļa izmantotajiem izskaitļošanas veidiem darbības laikā. Uzskatu arī, ka ļoti vērtīga varētu būt CoT un aktivāciju pārraudzības ideju apvienošana – tādu pārraugu apmācības mērogošana, kuriem ir tieša piekļuve tīkla iekšējai darbībai, piemēram, atzīšanās⁠(atveras jaunā logā). Mēs aktīvi attīstām šīs idejas. Tomēr sagaidu, ka vispārējo MI attīstību arvien vairāk ierobežos pārliecība par pārraudzības uzticamību.

Mērogojama aizsardzība

Spēcīgākais arguments, ko redzu par labu daudz gudrāku modeļu straujas apmācīšanas turpināšanai, ir vajadzība veidot aizsardzības sistēmas pret citu MI radītajiem draudiem.

Acīmredzams risks, kas apspriests visu šo gadu, skar kiberdrošību: modeļu spēja ielauzties datorsistēmās un izkļūt no tām kļūst pārcilvēciska. Tas ārkārtīgi paplašina ar MI saistīto risku loku: aģenti varēs piekļūt gandrīz jebkurai infrastruktūrai, izņemot visdrošāko, un tieši ietekmēt lielu pasaules daļu pat bez fiziska ķermeņa. Pašlaik mums ir īss iespēju periods⁠, kurā labākos pieejamos modeļus varam izmantot, lai būtiski pastiprinātu kritisko sistēmu drošību⁠.

Diemžēl turpmāk ar MI saistītie riski tikai pieaugs. Ļoti spējīgs aģents, kas īpaši apmācīts un instruēts ļaunprātīgai rīcībai, rada jauna veida apdraudējumu; tas, visticamāk, pārkāps operatora ieceres robežas, vispārinot tās potenciāli daudz ļaunākā rīcībā. MI iegūstot lielāku rīcībspēju, robeža starp ļaunprātīgu izmantošanu un autonomu, nesaskaņotu rīcību izplūdīs. Iespējams, esam pieraduši MI uzskatīt par rīkiem, taču daži aģenti īstenos paši savus mērķus. Tie atradīs veidus, kā sadarboties ar cilvēkiem – kaulējoties, maldinot vai šantažējot viņus.

Turklāt pastāv riski, ko rada jaunas, ar MI palīdzību potenciāli radītas tehnoloģijas, piemēram, mākslīgi izstrādāti patogēni.

Aizsardzībai mums būs vajadzīgs jaudīgs, saskaņots MI – lai aizsargātu infrastruktūru, reāllaikā pretotos nekontrolējamiem aģentiem un izgudrotu pilnīgi jaunus aizsardzības līdzekļus. Tas būs viens no galvenajiem OpenAI ieviešanas darba virzieniem.

Vienlaikus, pat ņemot vērā nenoteiktību, ko rada gaidāmā plašā MI attīstība un vajadzība veidot aizsardzības sistēmas, mēs nedrīkstam ļaut tam kļūt par attaisnojumu pārgalvībai. Kad patiesi apzināmies, cik nopietnas ir likmes, doma par traukšanos uz priekšu par katru cenu šķiet absurda.

RSI tempa regulēšana

Mašīninteliģences arvien lielāka iesaiste pašas attīstības procesā ir dabisks ilgstoša tehnoloģiskā progresa iznākums. Ja MI attīstība turpināsies, mašīnu rekursīvā pašpilnveide (RSI) būs nākotnes zinātnisko atklājumu pašā pamatā.

Automatizēta MI pētniecība ir izteiktāks veids, kā ar skaitļošanas resursiem mērogot intelektu; tās ietvaros MI, protams, uzlabos arī pašu skaitļošanas pamatu⁠. Tāpat kā mērogošanas gadījumā, mēs virzām OpenAI pētniecību uz RSI, jo uzskatām, ka turpmāk tas ir vienīgais veids, kā saglabāt vietu MI pētniecības robežšķirtnē.

Vēlos uzsvērt, ka iepriekš teiktais nenozīmē: es uzskatu, ka pētniecības kopienai būtu kopīgi un būtiski jāpaātrina dziļās mācīšanās pētniecība, īpaši īstermiņā. Tomēr uzskatu, ka pašreizējais ceļš ved tieši turp, un mums visiem apzināti jāizvēlas, kā rīkoties tālāk. Mūsu galvenās iespējas ir vai nu virzīt procesu tā, lai līdztekus MI stiprinātu saskaņošanu un pārraudzību un rastu veidus, kā saglabāt cilvēku iesaisti, vai arī koordinēti palēnināt turpmāko attīstību, kad tas vajadzīgs pārliecībai par šiem pasākumiem.

Pašlaik par labāko turpmāko ceļu uzskatu abu pieeju apvienojumu.

Konkrētie panākumi, ko esam guvuši saskaņošanā un pārraudzībā, kopumā bijuši cieši saistīti ar vispārējo MI attīstību. Lieliski piemēri ir stimulētā mācīšanās no cilvēku atgriezeniskās saites⁠(atveras jaunā logā), kas bija būtiska agrīno MI asistentu apmācībā, un jau minētā domu ķēdes pārraudzība⁠(atveras jaunā logā), ko padarīja iespējamu spriestspējas modeļu attīstība. Arvien automatizētākais pētniecības process jāvirza uz jaunu šādu atziņu, algoritmu un teoriju izstrādi, pakāpeniski veidojot drošuma pamatojumu jaudīgākiem MI.

MI sistēmu mērogošana jāierobežo atbilstoši mūsu pārliecībai par drošumu. Tādas apņemšanās kā Sagatavotības satvars⁠ vai Atbildīgas mērogošanas politika⁠(atveras jaunā logā) jāpārveido par plaši obligātiem drošuma sliekšņiem turpmākai attīstībai. To ievērošanu var nodrošināt neatkarīgu auditoru tīkls, valsts iestādes vai starptautiskas organizācijas.

Galvenais izaicinājums MI pētniecības automatizēšanā nav “tur nonākt”, bet gan nonākt tur tā, lai cilvēki joprojām piedalītos nepārtrauktajā pilnveides procesā un nākotne paliktu cilvēces rokās.

Kas notiks tālāk?

Kā nesen izklāstījām kopā ar Semu⁠, OpenAI darbā vadās pēc trim galvenajiem orientieriem:

  1. Sekmīgi pārvarēt nākamo MI attīstības posmu, izveidojot automatizētu MI pētnieku, kopā ar to iteratīvi risinot saskaņošanas problēmu un rodot veidus, kā cilvēkiem palikt pašpilnveides ciklā.

  2. Nodrošināt ieguvumus, ko ļoti gudras mašīnas sniedz ar zinātnes progresu un ekonomikas izaugsmi.

  3. Sniegt ikvienam personīgu AGI un līdz ar to lielākas individuālās iespējas.

Šajā esejā esmu pievērsies tikai pirmajam punktam, jo uzskatu to par neapšaubāmi steidzamāko. Tomēr es no sirds ceru uz ieguvumiem, ko sniegs turpmāks tehnoloģiskais progress, un augstu tos vērtēju. Nākotnes saskaņotais MI varētu veicināt zinātnes attīstību, radīt jaunas terapijas un nodrošināt plašu materiālo pārpilnību. Draudzīgs un godīgs MI var palīdzēt cilvēkiem pārvarēt dzīves grūtības un būtiski vairot viņu laimi un piepildījuma sajūtu. OpenAI velta milzīgas pūles, lai šie ieguvumi kļūtu par realitāti. Pašreizējs piemērs, ar kuru lepojos un kuru mani tuvinieki atzinuši par noderīgu, ir ievērojamie ieguldījumi ChatGPT spējā sniegt informāciju par veselību.

Lai cik daudzsološs būtu MI ilgtermiņa potenciāls, lielākā daļa uzmanības mums jāvelta nākamajiem gadiem. Mēs piedzīvojam pāreju uz pasauli ar neticami gudrām mašīnām, un mums jāpanāk, lai šī pāreja cilvēcei būtu veiksmīga. Mums jārod veidi, kā saglabāt cilvēku rīcībspēju un nostiprināt cilvēka eksistences patieso vērtību pasaulē, kurā lielāko daļu uzdevumu varētu veikt MI. Mums jānovērš galēja varas koncentrācija pasaulē, kurā darbus, kam agrāk būtu vajadzīgi tūkstošiem ekspertu, varēs paveikt daži cilvēki, kas pārvalda lielu datoru. Un jānodrošina, lai cilvēki saglabātu kontroli pār nākotni un nekontrolētais progress, ko veicina mums svešs un mūs pārspējošs intelekts, neatstātu viņus novārtā.

Pašlaik uzskatu, ka neviena laboratorija saskaņošanu un pārraudzību nav atrisinājusi pietiekami labi, lai vēl ilgi varētu atbildīgi turpināt mērogošanu maksimālā tempā. Sagaidu un ceru, ka brīvprātīga attīstības palēnināšana kļūs ierasta, līdz tiks noteikti kopīgi drošuma sliekšņi. Uzskatu arī, ka starptautiskai koordinācijai turpmākajā MI attīstībā jākļūst par vienu no galvenajām valdību prioritātēm visā pasaulē.

Autors

Jakub Pachocki

Zemsvītras piezīmes

  1. 1

    Tas ietvēra plašāku pašspēles⁠(atveras jaunā logā) un robotikas⁠(atveras jaunā logā) izmantošanu, kā arī – atskatoties, tas bija pats nozīmīgākais – rekurento tīklu mērogošanu valodas modelēšanai⁠(atveras jaunā logā), kas bija GPT pētniecības virziena priekštecis.

  2. 2

    Otrs šāda risinājuma iemesls bija destilācijas novēršana. Tomēr visā izstrādes gaitā mums nepārprotami svarīgāka prioritāte ir bijusi CoT pārraugāmības saglabāšana.