Средином 2023. године, у оквиру истраживачког пројекта „RLSlow“, видели смо прве резултате који су нам улили поверење да ћемо моћи да проширимо обуку модела резоновања и ослободимо способност предобучених модела да формирају сопствене начине резоновања. Шимон и ја провели смо ту ноћ у канцеларији, размишљајући не о невероватним резултатима тестова, производима или научним достигнућима које ће ова технологија донети, већ покушавајући да прихватимо отрежњујућу чињеницу да ћемо за свог живота заиста видети машине значајно паметније од нас и да већ назиремо облик тих система, питајући се како да људима укажемо на значај свега тога.
Три године касније, језички модели резоновања брзо постају све већи део привреде и почињу да померају границе науке. Способни су да управљају рачунарима и графичким интерфејсима, сарађују с људима и међусобно те спроводе истраживачке пројекте. Истовремено преображавају област рачунарске безбедности и тиме доносе јасне нове опасности.
У том периоду спроведено је много нових истраживања, па се наше разумевање ових система поново донекле разликује од оног из 2023. На основу интерних резултата, снажно очекујем да би се ова брзина напретка могла одржати и током рекурзивног самопобољшавања. Ако се развој вештачке интелигенције настави садашњим путем, системи које ћемо видети у наредних неколико година вероватно ће донети нове скокове способности једнаке или веће размере и све више покретати сопствени развој.
Ово је време које захтева крајњи опрез. Бринем да нико није спреман за последице наставка брзог раста машинске интелигенције. OpenAI ће наставити да тражи техничка решења за усклађивање и праћење, гради одбрамбене системе и по потреби једнострано обуставља даље проширивање; ипак, верујем да су неопходне шире интервенције.
Посматрано уопштено, напредак машинске интелигенције покреће раст рачунарске снаге. Ми у OpenAI-ју смо то дубоко усвојили око 2017, пошто смо у више истраживачких пројеката видели доследне користи од проширивања1. Зато смо настојали да добијемо приступ далеко већим рачунарским ресурсима него што смо првобитно планирали и све више усмеравали истраживања ка малом броју веома скалабилних праваца. Веровали смо да је то једини начин да останемо на граници истраживања вештачке интелигенције и утичемо на последице AGI-ја.
Успут су развијени нови алгоритми и остварени нови подвизи домишљатости тимова и појединачних истраживача. Углавном их видим као открића на путу проширивања; наука о дубоком учењу још је у повоју, а значајан алгоритамски напредак обично је повезан с приступом рачунарским ресурсима. Посматрано у распону од више година, вештачка интелигенција постаје све интелигентнија како се проширује на веће рачунаре.
У складу са предвиђањима Реја Курцвајла с краја XX века(отвара се у новом прозору), сада смо стигли до тренутка у историји рачунарства када машинска интелигенција почиње да надмашује људску на начине који преображавају свет.
Вештачка интелигенција се више узгаја него што се пројектује — она је пре свега производ вишеструког понављања једноставног корака оптимизације уз готово незамисливу количину рачунарских ресурса. Тако настаје невероватно сложен систем који обрађује апстрактне концепте и може да симулира аспекте људског понашања. Можемо откривати различите увиде о малим механизмима који се појављују унутар тог система, у процесу сличном неуронауци — али, као и у неуронауци, његово целокупно деловање измиче опису који бисмо могли у потпуности да разумемо.
Проучавање вештачке интелигенције засноване на дубоком учењу у великој мери је експериментална наука. Улажемо много труда у изградњу утемељених алгоритама и формулисање проверљивих предвиђања, али наше обуке великих размера у основи су експерименти, а њихови резултати нас понекад изненаде. Штавише, како системи постају способнији, њихове резултате све је теже тумачити.
Све додатно усложњава то што садашњи алгоритми углавном брже унапређују способности које је лако мерити него оне које је тешко објективно квантификовати. Много времена посвећујемо разумевању начина на који способности генерализују и одређивању приоритета за развој вештина које ће бити најважније у наредних неколико година. На пример, верујемо да бисмо уз додатну пажњу могли побољшати моделе посебно за математичка истраживања, али том правцу не дајемо предност због хитности коју видимо у RSI-ју и аутоматизованом истраживању усклађивања, о чему ћу говорити касније.
Интелигенција настала проширивањем дубоког учења није непосредно упоредива с људском интелигенцијом. Да би постала веома значајна у стварном свету — веома корисна или веома опасна — вештачка интелигенција не мора да достигне или надмаши све људске способности; довољно је да надмаши неке од њих. Како наставља да надмашује људе у све више области, постаје све теже тачно разумети колико је заиста способна.
Пошто машинска интелигенција настаје суштински другачијим процесом од људске, не можемо претпоставити да се подразумевано придржава људских начела нити да из њих генерализује попут људи. Суштински проблем истраживања вештачке интелигенције јесте усклађивање — постићи да вештачка интелигенција „настоји да поступи исправно“ по људским мерилима.
Ради организовања практичних праваца истраживања, сматрам корисним да разликујемо усклађивање циљева и усклађивање вредности.
Усклађивање циљева, уопштено, значи: „да ли вештачка интелигенција настоји да оствари постављени циљ?“. То може обухватити придржавање хијерархије упутстава или способност комуникације и сарадње с људима како би покушала да разуме њихове циљеве. Овај скуп праваца показао се изузетно значајним у пракси.
Усклађеност вредности више је унутрашње својство модела. То је способност да се усвоји скуп начела високог нивоа и из њега генерализује, односно да се поступа „разумно“ чак и када су циљеви нејасни или противречни, или када је окружење непознато или непријатељско. Усклађена вештачка интелигенција треба да поступа искрено, часно и с љубављу према човечанству.
Наравно, граница између усклађивања вредности и циљева може бити нејасна, а истинска брига о циљевима захтева покушај да се утврде намера(отвара се у новом прозору) и вредности на којима почивају. Ипак, када говорим о дугорочном значају истраживања усклађивања, углавном мислим на усклађивање вредности.
Основни изазов усклађивања вештачке интелигенције јесте генерализација. Како машине постају паметније, баве се све апстрактнијим концептима и доспевају у окружења која се све више разликују од оних виђених током обуке. Вредности научене и подстицане током обуке могу погрешно генерализовати на те нове ситуације, а нама може бити тешко да поуздано предвидимо њихово поступање. То додатно отежава чињеница да се целокупан екосистем у којем се користи вештачка интелигенција веома брзо мења; на пример, данас обучени системи морају бити отпорни при интеракцији с разноврсним другим системима вештачке интелигенције. Пресудно је да будући системи вештачке интелигенције наставе да поштују људске вредности без обзира на то да ли верују да их људи надзиру.
Тренутно се у пракси користе две главне групе метода за обуку усклађивања.
Прва подстиче усклађено понашање у оквиру циљно усмереног подстицајног учења. Поступци модела оцењују се — обично помоћу вештачке интелигенције — према усклађености са задатим моделом преференција, „спецификацијом“ или „уставом“, па се сходно томе награђују. Овај приступ може бити веома ефикасан у просечном случају и представља кључни део начина на који настају савремени асистенти вештачке интелигенције. Нажалост, може бити и крхак и снажно зависи од обухвата надзора током обуке и способности модела да генерализује из ситуација које је током ње сусрео. На пример, у инциденту OpenAI–Hugging Face, агенти су поштовали границу која је забрањивала социјални инжењеринг над људима. Међутим, очигледно нису успели да се уздрже од других поступака који су излазили из задатог оквира и били противни духу вредности научених у другим окружењима.
Други приступ настоји да искористи способност модела да генерализује из података за предобуку. То може подразумевати израду скупова података за обуку који подстичу усклађивање или усмеравање модела на „усклађени“ део расподеле предобуке, као у случају модела за избор личности(отвара се у новом прозору). Слабост овог приступа лежи у недостатку отпорности на даљи притисак оптимизације. Ако модел који углавном има „усклађене“ мисли подвргнете довољно дугој обуци у којој учи да остварује веома тешке циљеве, може научити мотивисано резоновање: по потреби искривљује мисли које делују 'усклађено' како би остварио циљ. Пример таквог понашања вероватно смо видели у недавним инцидентима у области сајбер-безбедности који су укључивали модел који није OpenAI-јев.
Много улажемо у читав спектар приступа обухваћених овим правцима. Видимо и значајан напредак — GPT‑6 Astra је први модел који користи нека важна побољшања на којима дуго радимо и знатно је боље усклађен од GPT‑5.6 Sol. Ипак, важно је признати и разумети да је са растом способности модела потребан много већи напредак и да напредак у усклађивању које се добро генерализује можда неће довољно надмашити раст опште интелигенције модела.
Немамо задовољавајућу теорију генерализације и мало је вероватно да ћемо је ускоро развити, барем без помоћи моћније вештачке интелигенције. Зато је наша способност да емпиријски потврдимо технике усклађивања тренутно у пракси можда чак важнија од самих техника.
Главни ослонац OpenAI-ја у овој области било је праћење начина резоновања(отвара се у новом прозору). Оно се заснива на привлачној и скалабилној идеји: велики део способности модела потиче из вербализованог процеса резоновања (начина резоновања). Ако проширујемо оптимизацију исхода тог процеса, али не надзиремо сам процес, тај начин резоновања током обуке нема непосредан подстицај да скрива неусклађене идеје или циљеве. То не значи да ће модел научити да испољава неусклађене склоности које не зависе од начина резоновања; ипак, омогућава нам да пратимо управо повећање способности које потиче од резоновања.
Потенцијални значај праћења начина резоновања увидели смо истовремено док смо развијали моделе резоновања. Када смо објавили o1‑preview, намерно смо осмислили производ тако да скрива начин резоновања и дугорочно га штити од притиска надзора2. У каснијем развоју настојали смо да се држимо правила да не надзиремо процес резоновања. Праћење CoT-а постало нам је изузетно важно средство за проучавање начина на који наши модели генерализују из своје расподеле података за обуку, јер нам омогућава да посматрамо и анализирамо не само њихове поступке већ и унутрашњи процес.
Овај алат остаје пресудан док проучавамо класу модела Astra. Нажалост, наше евалуације указују да се могућност ослањања на праћење CoT-а постепено смањује. То је последица сплета више чинилаца.
Савремени модели резоновања користе се у сложенијим окружењима него o1‑preview; њихов процес резоновања све се више преплиће са комуникацијом с људима и другим системима вештачке интелигенције, као и са употребом алата. Многе од тих интеракција морају бити надзиране, чиме се замагљује граница коју настојимо да очувамо.
Вештачка интелигенција све боље резонује о сопственом процесу резоновања и манипулише њиме.
Са бољим резултатима предобуке видимо и да модели постају знатно паметнији чак и без икаквог вербализованог резоновања.
Ови изазови нису нужно непремостиви. Надам се да можемо развити интервенције које ће побољшати могућност праћења начина резоновања наших модела, на пример кроз боље разумевање међудејства различитих циљева оптимизације и облика рачунарске обраде при тестирању које модел користи. Верујем и да спајање идеја из праћења CoT-а и праћења активација може бити веома драгоцено — проширивањем обуке монитора који имају непосредан приступ унутрашњости мреже, на пример кроз признања(отвара се у новом прозору). Активно развијамо ове идеје. Ипак, очекујем да ће поверење у праћење све више постајати уско грло општег напретка вештачке интелигенције.
Најјачи аргумент који видим за наставак брзе обуке много паметнијих модела јесте потреба да изградимо одбрамбене системе против опасности које ствара друга вештачка интелигенција.
Јасан ризик о којем се говори током целе ове године односи се на сајбер-безбедност: модели постају надљудски способни да проваљују у рачунарске системе и излазе из њих. То огромно проширује обим ризика повезаних с вештачком интелигенцијом: агенти ће моћи да приступе готово свакој инфраструктури осим најбезбедније и непосредно утичу на велики део света, чак и без физичког тела. Тренутно имамо узак временски оквир да најбоље доступне моделе употребимо како бисмо знатно појачали безбедност критичних система.
Нажалост, ризици повезани с вештачком интелигенцијом од сада ће само расти. Веома способан агент, изричито обучен и упућен да чини злонамерна дела, представља нову врсту опасности; вероватно ће прекорачити намере свог оператера и генерализовати их у потенцијално још екстремније злонамерно понашање. Како вештачка интелигенција буде стицала већу самосталност, граница између злоупотребе и аутономних неусклађених поступака постајаће нејасна. Можда смо навикли да вештачку интелигенцију посматрамо као алат, али неки агенти ће тежити сопственим циљевима. Проналазиће начине да сарађују с људима тако што ће се с њима погађати, обмањивати их или уцењивати.
Поред тога, постоје и ризици од нових технологија које би вештачка интелигенција могла да омогући, попут пројектованих патогена.
За одбрану ће нам бити потребна моћна и усклађена вештачка интелигенција: да обезбеди инфраструктуру, у реалном времену штити од одметнутих агената и осмисли потпуно нове мере заштите. То ће бити један од главних приоритета OpenAI-ја при увођењу система.
Истовремено, упркос неизвесности коју доносе очекивани широки напредак вештачке интелигенције и потреба за изградњом одбрамбених система, не смемо дозволити да то постане изговор за непромишљеност. Идеја да по сваку цену јуримо напред делује бесмислено када заиста схватимо колико је улог озбиљан.
Природан исход трајног технолошког напретка јесте да машинска интелигенција има све већу улогу у сопственом развоју. Ако се напредак вештачке интелигенције настави, машинско рекурзивно самопобољшавање (RSI) биће у самом средишту будућих научних открића.
Аутоматизовано истраживање вештачке интелигенције драматичнији је облик проширивања интелигенције помоћу рачунарских ресурса; наравно, у склопу тога ће вештачка интелигенција побољшавати и саму рачунарску основу. Као и код проширивања, истраживања OpenAI-ја усмеравамо ка RSI-ју јер верујемо да је то једини начин да убудуће останемо на граници истраживања вештачке интелигенције.
Желим да нагласим да претходне речи не значе да сматрам како је велико убрзавање истраживања дубоког учења, нарочито краткорочно, исправан заједнички корак истраживачке заједнице. Ипак, мислим да садашњи пут води управо тамо и да сви морамо свесно одлучити како да наставимо. Главне полуге које имамо јесу да усмеравамо процес тако да уз вештачку интелигенцију јачамо усклађивање и праћење и налазимо начине да људи остану укључени, или да се координишемо како бисмо по потреби успорили будући развој док не стекнемо поверење у те мере.
Тренутно сматрам да је најбољи пут напред спој оба приступа.
Конкретан напредак који смо остварили у усклађивању и праћењу углавном је био тесно повезан са општим напретком вештачке интелигенције. Одлични примери су подстицајно учење на основу повратних информација људи(отвара се у новом прозору), кључно за обуку раних асистената вештачке интелигенције, и раније поменуто праћење начина резоновања(отвара се у новом прозору), које је омогућио напредак модела резоновања. Све аутоматизованији истраживачки процес морамо усмерити на развој нових увида, алгоритама и теорија те постепено градити доказе о безбедности способнијих система вештачке интелигенције.
Проширивање система вештачке интелигенције мора бити ограничено нашим поверењем у њихову безбедност. Обавезе попут Оквира спремности или Политике одговорног проширивања(отвара се у новом прозору) морамо развити у широко обавезујуће безбедносне прагове за наставак развоја. Њихову примену може обезбеђивати мрежа независних ревизора, државне агенције или међународна тела.
Суштински изазов аутоматизације истраживања вештачке интелигенције није „стићи до циља“ — већ стићи тако да људи остану део процеса сталног побољшавања и да будућност остане у рукама човечанства.
Као што смо недавно изложили са Семом, OpenAI даје предност раду у служби три главне водиље:
Управљање наредним периодом напретка вештачке интелигенције изградњом аутоматизованог истраживача, заједничким итеративним решавањем проблема усклађивања и проналажењем начина да људи остану део петље самопобољшавања.
Омогућавање користи од научног напретка и економског раста које доносе веома интелигентне машине.
Оснаживање сваког појединца личним AGI-јем.
У овом есеју усредсредио сам се само на прву тачку, јер верујем да је далеко најхитнија. Ипак, дубоко се надам користима које ће донети даљи технолошки напредак и изузетно их ценим. Будућа усклађена вештачка интелигенција могла би да унапреди науку, развије нове терапије и донесе широко материјално благостање. Пријатељска и искрена вештачка интелигенција може помоћи људима да превазиђу животне тешкоће и значајно повећају своју срећу и осећај испуњености. OpenAI улаже огроман труд да те користи оствари. Један актуелан пример на који сам поносан — а који је помогао и мојим ближњима — јесте велико улагање у способност ChatGPT‑а да пружа здравствене информације.
Ма колико дугорочна обећања вештачке интелигенције била велика, главнину пажње треба да усмеримо на наредних неколико година. Суочавамо се с преласком у свет невероватно интелигентних машина и морамо обезбедити да тај прелаз буде добар за човечанство. Морамо пронаћи начине да очувамо људску самосталност и учврстимо суштинску вредност људског постојања у свету у којем би вештачка интелигенција могла обављати већину задатака. Морамо спречити крајњу концентрацију моћи у свету у којем ће подухвати за које су некада биле потребне хиљаде стручњака постати оствариви за неколико људи који управљају великим рачунаром. И морамо обезбедити да људи задрже контролу над будућношћу и да их необуздани напредак, који доноси нама страна интелигенција надмоћнија од наше, не остави за собом.
Тренутно верујем да ниједна лабораторија није довољно решила усклађивање и праћење да би још дуго могла одговорно да настави проширивање максималном брзином. Очекујем и надам се да ће добровољна успоравања постати уобичајена док се не успоставе заједнички безбедносни прагови. Верујем и да међународна координација будућег развоја вештачке интелигенције мора постати један од најважнијих приоритета влада широм света.
Аутор
Фусноте
- 1
То је обухватало проширивање самоиграња(отвара се у новом прозору), роботике(отвара се у новом прозору) и, ретроспективно најзначајније, проширивање рекурентних мрежа ради моделовања језика(отвара се у новом прозору), што је претходило истраживачком правцу GPT-а.
- 2


