Негізгі мазмұнға өту
OpenAI

2026 ж. 6 қыркүйек

ҚауіпсіздікЗерттеу

Бөгде сана

Автор: Якуб Пахоцки, OpenAI бас ғалымы

Жүктелуде…

2023 жылдың ортасында «RLSlow» зерттеу жобасы аясында ойлайтын модельдерді оқытуды масштабтай алатынымызға, соның арқасында алдын ала оқытылған модельдердің өз ойлау тізбектерін құру қабілетін аша алатынымызға сенім берген алғашқы нәтижелерді көрдік. Шимон екеуіміз сол түнді кеңседе өткіздік. Біз бұл технология әкелетін таңғаларлық эталондық көрсеткіштер, өнімдер немесе ғылыми нәтижелер туралы емес, керісінше, өз ғұмырымызда өзімізден айтарлықтай ақылды машиналарды шынымен көретініміз және бұл жүйелердің сұлбасы қазірдің өзінде байқалып тұрғаны туралы байыппен ойлануға мәжбүр ететін шындықты ұғынуға тырыстық; мұның маңызын адамдарға қалай жеткізуге болатынын ойладық.

Үш жылдан кейін ой қорытуға қабілетті тілдік модельдер экономиканың жылдам өсіп келе жатқан бөлігіне айналып, ғылымның шекарасын кеңейте бастады. Олар компьютерлер мен графикалық интерфейстерді басқара алады, адамдармен және бір-бірімен ынтымақтасып, зерттеу жобаларын орындайды. Олар компьютерлік қауіпсіздік саласын да өзгертіп, айқын жаңа қауіптер төндіріп отыр.

Осы кезеңде көптеген жаңа зерттеу жүргізілді және бұл жүйелер туралы түсінігіміз 2023 жылмен салыстырғанда тағы да біршама өзгерді. Ішкі нәтижелерге сүйеніп, мұндай ілгерілеу қарқыны рекурсивті өзін-өзі жетілдіруге дейін сақталуы мүмкін деп нық сенемін. ЖИ дамуы қазіргі бағытымен жалғасса, алдағы бірнеше жылда көретін жүйелеріміздің мүмкіндіктері дәл сондай немесе одан да үлкен серпіліс жасап, өз дамуын барған сайын өздері алға жылжытуы ықтимал.

Бұл кезең аса сақ болуды талап етеді. Машиналық интеллектінің жылдам өсуі жалғаса берсе, оның салдарына ешкім дайын емес деп алаңдаймын. OpenAI сәйкестендіру мен бақылаудың техникалық шешімдерін іздеуді, қорғаныс жүйелерін құруды және қажет болса одан әрі масштабтауды біржақты тоқтатуды жалғастырады. Дегенмен ауқымдырақ шаралар қажет деп есептеймін.

Біз толық түсінбейтін интеллект

Жалпы алғанда, машиналық интеллектідегі ілгерілеуге есептеу қуатының артуы қозғау салады. Бірнеше зерттеу жобасында масштабтаудың тұрақты нәтиже беретінін көргеннен кейін, OpenAI-де біз мұны шамамен 2017 жылы терең түсіндік1. Соның нәтижесінде бастапқыда жоспарлағанымыздан әлдеқайда көп есептеу ресурсына қол жеткізуге ұмтылып, зерттеулерімізді оңай масштабталатын санаулы бағыттарға көбірек бағдарладық. Біз мұны ЖИ зерттеулерінің озық шебінде болып, AGI ықпалына әсер етудің жалғыз жолы деп санадық.

Осы жолда жаңа алгоритмдер жасалып, командалар мен жекелеген зерттеушілер тың тапқырлық танытты. Мен оларды негізінен масштабтау жолындағы жаңалықтар деп көремін. Терең оқыту ғылымы әлі бастапқы кезеңде, ал алгоритмдердегі елеулі ілгерілеу көбіне есептеу ресурстарына қол жеткізумен байланысты. Бірнеше жылдық келешек тұрғысынан қарасақ, ЖИ үлкенірек компьютерлерге масштабталған сайын ақылды бола береді.

Рэй Курцвейлдің XX ғасыр соңындағы болжамдарына(жаңа терезеде ашылады) сай, қазір есептеу техникасы тарихындағы машиналық интеллект адам интеллектісінен әлемді өзгертетін тұрғыда аса бастаған сәтке келдік.

ЖИ көбіне жобаланбайды, өсіріледі— ол, ең алдымен, елестету қиын көлемдегі есептеу қуатын пайдаланып, қарапайым оңтайландыру қадамын сан мәрте қайталаудың өнімі. Нәтижесінде абстрактілі ұғымдармен жұмыс істеп, адам мінез-құлқының кейбір қырларын модельдей алатын керемет күрделі жүйе пайда болады. Нейроғылымдағыдай үдеріс арқылы осы жүйеде пайда болатын шағын механизмдер туралы түрлі түсініктерге қол жеткізе аламыз. Бірақ нейроғылымдағы секілді, оның жалпы әрекетін біз толық түсіне алатындай сипаттау мүмкін болмай отыр.

Терең оқытуға негізделген ЖИ-ді зерттеу — негізінен эксперименттік ғылым. Біз қағидалы алгоритмдер құрып, тексерілетін болжамдар жасауға көп күш жұмсаймыз. Бірақ түптеп келгенде, ауқымды дайындық үдерістеріміз — эксперименттер, сондықтан олардың нәтижесі кейде бізді таңғалдырады. Оның үстіне, жүйелер қабілетті болған сайын нәтижелерді түсіндіру қиындай түседі.

Қазіргі алгоритмдердің объективті өлшеу қиын қабілеттерге қарағанда оңай өлшенетін қабілеттерді жылдамырақ жетілдіруі жағдайды одан әрі күрделендіреді. Біз қабілеттердің қалай жалпыланатынын және алдағы бірнеше жылда ең маңызды болатын дағдыларды дамыту үшін неге басымдық беру керегін түсінуге көп уақыт жұмсаймыз. Мысалы, арнайы көбірек көңіл бөлсек, модельдердің математикалық зерттеулердегі қабілетін арттыра аламыз деп ойлаймыз. Бірақ кейінірек түсіндіретінімдей, RSI мен автоматтандырылған сәйкестендіру зерттеулерін шұғыл деп санайтындықтан, бұл бағытқа басымдық бермейміз.

Терең оқытуды масштабтау арқылы пайда болатын интеллектіні адам интеллектісімен тікелей салыстыруға болмайды. Нақты әлемде өте маңызды, яғни аса пайдалы немесе аса қауіпті болу үшін ЖИ адамның барлық қабілетіне теңесуі не олардан асуы қажет емес; олардың жеткілікті бөлігін басып озса болғаны. Ол барған сайын көбірек өлшем бойынша адамнан озған сайын, оның нақты қаншалық қабілетті екенін түсіну қиындай береді.

Машиналарға сүюді үйрету

Машиналық интеллект адам интеллектісінен түбегейлі өзгеше үдерістен туындайтындықтан, ол әуел бастан адами қағидаларды ұстанады немесе оларды адам секілді жалпылайды деп есептей алмаймыз. ЖИ зерттеулерінің өзекті мәселесі — сәйкестендіру, яғни ЖИ-ге адами өлшем бойынша «дұрыс әрекет етуге тырысуды» үйрету.

Практикалық зерттеу бағыттарын жүйелеу үшін мақсаттарды сәйкестендіру мен құндылықтарды сәйкестендіруді ажыратқан пайдалы деп санаймын.

Мақсаттарды сәйкестендірудің жалпы мәні: «ЖИ алдына қойылған мақсатқа жетуге тырыса ма?». Бұған нұсқаулар иерархиясын сақтау немесе адамдардың мақсаттарын түсінуге тырысып, олармен байланысып, ынтымақтаса білу жатады. Бұл бағыттар жиынтығы іс жүзінде аса маңызды болды.

Құндылықтарды сәйкестендіру — модельдің ішкі қасиеті. Бұл — жоғары деңгейлі қағидалар жиынтығын ұстану және солардан жалпылау, сондай-ақ түсініксіз не қайшы мақсаттар берілгенде немесе бейтаныс не қарсылас ортаға түскенде де «парасатты» әрекет ету қабілеті. Сәйкестендірілген ЖИ адалдықпен, ар-ұятпен және адамзатқа деген сүйіспеншілікпен әрекет етуге тиіс.

Әрине, құндылықтар мен мақсаттарды сәйкестендіру арасындағы шекара бұлдыр болуы мүмкін. Мақсаттарға шын мәнінде мән беру олардың астарындағы ниет(жаңа терезеде ашылады) пен құндылықтарды анықтауға тырысуды талап етеді. Дегенмен сәйкестендіру зерттеулерінің ұзақ мерзімді маңызы туралы айтқанда, әдетте құндылықтарды сәйкестендіруді меңзеймін.

ЖИ-ді сәйкестендірудегі түбегейлі мәселе — жалпылау. Машиналар ақылды болған сайын, жоғары деңгейлі ұғымдармен жұмыс істеп, оқытуда кездескен орталардан барған сайын өзгеше жағдайларға тап болады. Олар оқыту барысында үйретіліп, бекітілген құндылықтарды жаңа жағдайларға дұрыс жалпылай алмауы мүмкін, ал бізге олардың қалай әрекет ететініне сенімді болу қиын. ЖИ қолданылатын жалпы экожүйенің өте жылдам өзгеруі бұл мәселені одан әрі қиындатады. Мысалы, бүгін оқытылған ЖИ түрлі басқа ЖИ жүйелерімен әрекеттесуге төзімді болуы керек. Ең бастысы, болашақ ЖИ жүйелері адам бақылауында екеніне сенсе де, сенбесе де, адами құндылықтарды ұстануы қажет.

Қазір сәйкестендіруге оқытуда іс жүзінде қолданылатын әдістердің екі негізгі санаты бар.

Біріншісі — мақсатқа бағытталған күшейтпелі оқыту аясында сәйкестендірілген мінез-құлықты ынталандыру. Модель әрекеттерінің белгілі бір қалау моделіне, «спецификацияға» немесе «конституцияға» сәйкестігі бағаланып (әдетте ЖИ арқылы), тиісті сыйақы беріледі. Бұл тәсіл қалыпты жағдайларда өте тиімді болуы мүмкін және қазіргі ЖИ көмекшілерін жасаудың негізгі бөлігі саналады. Өкінішке қарай, ол осал болуы мүмкін әрі оқыту кезіндегі қадағалаудың қаншалық толық болғанына және модельдің оқытуда кездескен жағдайлардан жалпылау қабілетіне қатты тәуелді. Мысалы, OpenAI мен Hugging Face арасындағы оқиғада агенттер адамдарға әлеуметтік инженерия қолданбау шегін сақтады. Алайда олар өкілеттік аясынан тыс әрі басқа жағдайларда үйретілген құндылықтардың рухына қайшы келетін өзге әрекеттерден анық бас тарта алмады.

Екінші тәсіл модельдің алдын ала оқыту деректерінен жалпылау қабілетін пайдалануға бағытталған. Бұл сәйкестендіруге ықпал ететін оқыту деректер жиындарын құрастыруды немесе, мысалы, тұлға таңдау моделіндегідей(жаңа терезеде ашылады), модельді алдын ала оқыту үлестірімінің «сәйкестендірілген» бөлігіне бағыттауды қамтуы мүмкін. Бұл тәсілдің әлсіздігі — кейінгі оңтайландыру қысымына төзімді болмауы. Жалпы «сәйкестендірілген» ойлары бар модельге өте күрделі мақсаттарға жетуді үйрететін жеткілікті көлемде оқыту жүргізілсе, ол уәжді түрде ой қорытуды үйренуі мүмкін: мақсатқа жету үшін «сәйкестендірілген» болып көрінетін ойларды қажетіне қарай бұрмалайды. Мұндай мінез-құлықтың мысалын OpenAI-ға тиесілі емес модель қатысқан жуырдағы киберқауіпсіздік оқиғаларынан көрген болуымыз мүмкін.

Біз осы бағыттар қамтитын тәсілдердің бүкіл ауқымына қомақты инвестиция саламыз. Айтарлықтай ілгерілеуді де көріп отырмыз: GPT‑6 Astra — ұзақ уақыттан бері әзірлеп келе жатқан бірнеше маңызды жетістігімізді пайдаланған алғашқы модель және ол GPT‑5.6 Sol-ға қарағанда әлдеқайда жақсы сәйкестендірілген. Дегенмен модельдер қабілетті болған сайын әлдеқайда көп ілгерілеу қажет екенін, сондай-ақ жалпыланатын сәйкестендірудегі прогресс модель интеллектісінің жалпы дамуынан жеткілікті дәрежеде оза алмауы мүмкін екенін мойындап, түсіну маңызды.

Жалпылауды бақылау

Бізде жалпылаудың қанағаттанарлық теориясы жоқ және қуаттырақ ЖИ көмегінсіз оны жақын арада жасай алуымыз екіталай. Сондықтан қазір сәйкестендіру әдістерімізді эмпирикалық тұрғыдан тексеру қабілетіміз іс жүзінде сол әдістердің өзінен де маңызды деуге болады.

OpenAI бұл бағытта ең алдымен ойлау тізбегін бақылауға(жаңа терезеде ашылады) сенім артты. Оның негізінде тартымды әрі оңай масштабталатын идея жатыр: модель мүмкіндіктерінің елеулі бөлігі сөзбен өрнектелген ой қорыту үдерісінен (ойлау тізбегінен) туындайды. Егер сол үдерістің нәтижелерін оңтайландыруды масштабтап, үдерістің өзін қадағаламасақ, оқыту кезінде ойлау тізбегінде сәйкестендірілмеген идеялар мен мақсаттарды жасыруға тікелей ынта болмайды. Бұл модель ойлау тізбегіне сүйенбейтін сәйкестендірілмеген бейімділіктерін сыртқа шығаруды үйренеді деген сөз емес. Дегенмен бұл ой қорыту нәтижесінде мүмкіндіктердің нақты қаншалық өскенін бақылауға мүмкіндік береді.

Ойлайтын модельдерді әзірлеген кезде-ақ ойлау тізбегін бақылаудың ықтимал маңызын түсіндік. o1‑preview нұсқасын шығарғанда, оны ұзақ мерзімде қадағалау қысымынан қорғау үшін өнімді әдейі ойлау тізбегін жасыратын етіп жасадық2. Содан бергі әзірлеу барысында ой қорыту үдерісін қадағаламау қағидасын сақтауға тырысып келеміз. CoT мониторингі модельдеріміздің оқыту үлестірімінен тыс жағдайларға қалай жалпылайтынын зерттеудегі аса маңызды құралға айналды. Бұл бізге олардың әрекеттерін ғана емес, ішкі үдерісін де бақылап, талдауға мүмкіндік берді.

Astra класындағы модельдерді зерттегенде де бұл құрал шешуші рөл атқарады. Алайда, өкінішке қарай, бағалауларымыз CoT мониторингіне сүйену мүмкіндігіміздің біртіндеп азайып бара жатқанын көрсетеді. Бұған бірнеше фактордың үйлесуі себеп.

  • Қазіргі ойлайтын модельдер o1‑preview нұсқасына қарағанда күрделірек орталарда қолданылады. Олардың ой қорыту үдерісі адамдармен және басқа ЖИ жүйелерімен қарым-қатынас жасауға, сондай-ақ құралдарды пайдалануға барған сайын көбірек араласып барады. Мұндай өзара әрекеттердің көбін қадағалау қажет, сондықтан біз сақтағымыз келетін шекара бұлдырайды.
  • ЖИ өз ой қорыту үдерісін түсініп, оны басқаруға барған сайын шебер болып келеді.
  • Алдын ала оқыту нәтижелері жақсарған сайын, модельдердің сөзбен өрнектелген ой қорытуды мүлде қолданбай-ақ әлдеқайда ақылды бола түскенін де көріп отырмыз.

Бұл қиындықтарды еңсеру мүмкін емес деуге болмайды. Модельдеріміздің ойлау тізбегін бақылау мүмкіндігін жақсартатын тәсілдер жасай аламыз деп үміттенемін. Мысалы, әртүрлі оңтайландыру мақсаттары мен модельдің сынақ кезінде қолданатын есептеу түрлерінің өзара ықпалын тереңірек түсінуге болады. Сондай-ақ CoT пен активацияларды бақылау идеяларын ұштастырудың пайдасы зор болуы мүмкін деп ойлаймын: желінің ішкі күйіне тікелей қол жеткізе алатын мониторларды оқытуды масштабтау, мысалы, мойындаулар(жаңа терезеде ашылады). Біз бұл идеяларды белсенді түрде зерттеп жатырмыз. Соған қарамастан, жалпы ЖИ ілгерілеуінің қарқыны бақылауға деген сенімділік деңгейімен барған сайын көбірек шектеледі деп күтемін.

Масштабталатын қорғаныс

Әлдеқайда ақылды модельдерді жылдам оқытуды жалғастырудың ең салмақты себебі — басқа ЖИ төндіретін қауіптерге қарсы қорғаныс жүйелерін құру қажеттігі.

Биыл кеңінен талқыланған айқын қауіптердің бірі киберқауіпсіздікке қатысты: модельдердің компьютерлік жүйелерге бұзып кіріп, олардан бұзып шыға алу қабілеті адам мүмкіндігінен асып барады. Бұл ЖИ-ге байланысты қауіптердің ауқымын орасан кеңейтеді: агенттер аса қатаң қорғалған инфрақұрылымнан басқасының бәріне қол жеткізіп, тіпті физикалық денесіз-ақ әлемнің көп бөлігіне тікелей ықпал ете алады. Қазір қолда бар үздік модельдерді пайдаланып, аса маңызды жүйелердің қауіпсіздігін айтарлықтай күшейтуге арналған тар мүмкіндік кезеңінде тұрмыз.

Өкінішке қарай, бұдан былай ЖИ-ге байланысты қауіптер арта береді. Зиянды әрекеттер жасауға арнайы оқытылып, нұсқау берілген аса қабілетті агент жаңа сипаттағы қауіп төндіреді. Ол оператор ниетінің шегінен шығып, мінез-құлқын одан да қатерлі әрекеттерге жалпылауы ықтимал. ЖИ дербестігі артқан сайын, теріс пайдалану мен автономды сәйкестендірілмеген әрекеттер арасындағы шекара бұлдырайды. Біз ЖИ-ді құрал деп қабылдауға үйренген шығармыз, бірақ кейбір агенттер өз мақсаттарына ұмтылады. Олар адамдармен саудаласып, оларды алдап не бопсалап, ынтымақтасудың жолдарын табады.

Бұған қоса, ЖИ мүмкіндік беруі ықтимал жасанды патогендер секілді жаңа технологиялардан туындайтын қауіптер бар.

Қорғаныс үшін қуатты әрі сәйкестендірілген ЖИ қажет болады: инфрақұрылымды қорғау, бақылаудан шыққан агенттерге нақты уақытта тойтарыс беру және мүлде жаңа қорғаныс шараларын ойлап табу үшін. Бұл OpenAI енгізу жұмыстарының басты бағыттарының бірі болады.

Сонымен бірге ЖИ-дің кең ауқымды ілгерілеуінен туатын белгісіздік пен қорғаныс жүйелерін құру қажеттігін жауапсыздыққа сылтау етпеуіміз керек. Тәуекелдің қаншалық жоғары екенін терең түсінгенде, қандай бағамен болса да алға жарысу идеясы қисынсыз көрінеді.

Pacing RSI

Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.

Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.

I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.

The best way forward I see currently is a combination of both.

The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(жаңа терезеде ашылады), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(жаңа терезеде ашылады), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.

Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(жаңа терезеде ашылады) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.

The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.

What is next?

As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:

  1. Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
  2. Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
  3. Empowering everyone individually with a personal AGI.

I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.

As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.

Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.

Author

Jakub Pachocki

Ескертпелер

  1. 1

    Бұған өздігінен ойнау(жаңа терезеде ашылады), роботтехниканы(жаңа терезеде ашылады) және кейін ой елегінен өткізгенде ең маңыздысы болған тілді модельдеу үшін рекуррентті желілерді масштабтауды(жаңа терезеде ашылады) кеңейту кірді. Соңғысы GPT зерттеулер желісіне негіз болды.

  2. 2

    Бұл шешімнің тағы бір себебі дистилляцияға жол бермеу еді. Алайда бүкіл әзірлеу барысында CoT-ті бақылау мүмкіндігін сақтау біз үшін маңыздырақ басымдық болды.