Жүктелуде…
Бүгін біз осы уақытқа дейін кеңінен қолданысқа енгізген ең қабілетті моделіміз — GPT‑6 Astra-ны шығарамыз. Astra — Дайындық шеңбері бойынша киберқауіпсіздік қабілеті Критикалық деңгейге жеткен алғашқы моделіміз.
Бұл шығарылымның қауіпсіздігі туралы білу қажет ең маңызды жайттар мыналар:
- GPT‑6 Astra киберқабілеттер тұрғысынан елеулі ілгерілеу жасап, критикалық шегімізге жетті. Бұл тиісті құралдар мен қолжетімділік болғанда, GPT‑6 Astra әр қадамды адам бағыттамай-ақ, жақсы қорғалған көптеген жүйелердегі бұрын белгісіз қауіпсіздік осалдықтарын тауып, оларды пайдаланудың жаңа тәсілдерін әзірлей алатынын білдіреді. Сондықтан теріс пайдалану немесе сәйкессіздік салдарынан модельдің зиянды киберәрекеттер жасауына қарсы қорғаныстарымызды айтарлықтай күшейттік. Сондай-ақ Astra мен ұқсас модельдерді ішкі әзірлеу және қолданысқа енгізу қауіпсіздігін қамтамасыз ету шараларын қабылдадық. Оларға қатаңырақ оқшаулау, модель чекпойнттарын шифрлау, ойлау тізбектерін (CoT) қоса алғанда толық траекториялардың барлығын бақылау және ішкі пайдалануға тек сәйкестендіру бағалауынан өткеннен кейін рұқсат беру процесі кіреді.
- GPT‑6 Astra алдыңғы модельдерге қарағанда айтарлықтай орнықты. Қауіпсіздік орнықтылығын арттыруға арналған жаңа үйрету әдістерінің арқасында GPT‑6 Astra, соның ішінде ұзақ траекторияларда да, GPT‑5.6 Sol-ға қарағанда қорғанысты айналып өту үлгілеріне айтарлықтай төзімді. Мұны офлайн сынақтар және қорғанысты айналып өту әрекеттерін мұқият ішкі әрі сыртқы сынау мен анықталған мәселелерді түзету бағдарламасы арқылы анықтадық. Ықтимал жоғары тәуекелді деп белгіленген пайдаланушылар үшін модельдің бас тарту шегін сақтықты арттыратын бағытта реттеп, қосарлы мақсаттағы тәуекелдердің кең ауқымын қамту қабілетін де үйреттік. Astra-ның алдыңғы сынақ кезеңдерінде анықталған қорғанысты айналып өту әрекеттеріне төзімді екеніне көз жеткізу үшін регрессиялық сынақтарды қолданамыз. Сондай-ақ жақсартуларымызды растау үшін соңғы ішкі редтиминг шабуылдаушыларымыздың көмегімен автоматтандырылған редтимингтің жаңа кезеңдерін өткіздік.
- GPT‑6 Astra GPT‑5.6 Sol-ға қарағанда жақсырақ сәйкестендірілген. Astra модельді сәйкестендіруде елеулі ілгерілеу болып табылады және алдын ала үйрету деректерінің құрамынан бастап күшейтпелі оқыту кезіндегі бағалауға дейінгі сәйкестендіру жақсартуларын қамтиды. Біз сәйкестендіруді бағалаудың жаңа топтамасын(жаңа терезеде ашылады) ұсынамыз. Нәтижелер GPT‑6 Astra-ның қауіпсіздік пен қорғаныс шектерін сақтауда және рұқсат етілген аяда қалуда мықтырақ екенін көрсетті. 54 000-нан астам ішкі Codex тапсырмасы(жаңа терезеде ашылады)пайдаланылған симуляцияда Astra-ға ауырлығы жоғары сәйкессіз әрекеттер үшін қойылған белгілер саны да Sol-мен салыстырғанда шамамен екі есе аз болды.
- Сәйкессіздікті бақылауды кеңінен енгізіп жатырмыз. Модельді сәйкестендіруді модельдеріміздің ықтимал сәйкессіз әрекеттерінің алдын алудың негізгі тетігі деп санаймыз. Дегенмен бақылау озық модельдердің әрекетін кеңінен бақылауға мүмкіндік беріп, сәйкестендіру мен қауіпсіздікті одан әрі жақсарту жолдарын айқындайды. Бұған қоса, бақылау анықталған сәйкессіз әрекеттерден қорғайтын қосымша қорғаныс қабаты ретінде қызмет етеді. Осы себептерге байланысты Astra-ны сыртқы қолданысқа енгізу кезінде құралдарды пайдаланатын барлық инференске сәйкессіздікті бақылауды қостық. Бұл елеулі есептеу ресурстарын қажет етеді. Бұл жүйе ішкі конфигурациямызға ұқсас.
- GPT‑6 Astra-ның бақылану мүмкіндігі GPT‑5.6 Sol-мен салыстырғанда төмендеді. Біз GPT‑6 Astra-ның бақылану мүмкіндігін(жаңа терезеде ашылады) және басқарылу мүмкіндігін(жаңа терезеде ашылады) жан-жақты зерттедік. GPT‑6 Astra өз CoT тізбегін GPT‑5.6 Sol-ға қарағанда жақсырақ басқара алатынын және оған өзін әшкерелейтін ақпаратты сирек қосатынын анықтадық. Қарсыластық жағдайларда, яғни модельді бақылаушыларымыздан жалтаруға итермелегенде, модель бағалауда стратегиялық түрде нашар нәтиже көрсеткен кезде (бағалауда әдейі төмен нәтиже көрсету) анықталмай қала алады және кейбір диверсиялық тапсырмаларды(жаңа терезеде ашылады) орындау сұралғанда, кейде ішкі бақылаушыларымыздан жалтарады. Стеганографиялық CoT арқылы ой қорыту белгілерін, мысалы жасырын ой қорытуды кәдімгі әрі қатысы жоқтай көрінетін мәтін ішінде бүркемелеуді байқамадық. Бұл жалтару тәуекелі негізінен ой қорытуы күрделі емес тапсырмалармен шектелуі мүмкін екенін көрсетеді.
- Бұл нәтижелер Astra санатындағы модельдердің қарсыластық жағдайларда CoT бақылаушыларымыздан жалтара алатынын көрсетеді. Қазір бұл тұжырымдар негізінен қарсыластық бағалауларға, яғни модельге бақылаудан жалтаруды тапсырған жағдайларға сүйенеді. Ал сәйкестендіруді бағалаудың жалпы нәтижелері Astra-ның қауіпсіздік пен қорғаныс шектеулерін бұзу ықтималдығы GPT‑5.6 Sol-ға қарағанда төмен екенін көрсетеді.
- Дегенмен бұл үрдіске байыппен қараймыз және модельдеріміздің қабілеті артқан сайын осы нәтижелер мен олардың бақылану мүмкіндігіне ықпалын зерттеуді жалғастырамыз. OpenAI ойлау тізбегін бақылау мүмкіндігін сақтап, пайдалануға күш салды, ал CoT бақылануын сақтау — зерттеу бағдарламасының негізгі мақсаты. Алайда бұл нәтижелер модельдің ойлау тізбегін зерттеумен шектелмейтін сәйкестендіру аудиті әдістерін әзірлеудің маңызын да көрсетеді.
- GPT‑6 Astra браузермен жұмыс істеу және жұмыс орталарында жауапкершілігі жоғарырақ әрекет етеді: GPT‑6 Astra көмексөзге зиян келтіру әрекеттеріне GPT‑5.6 Sol-ға қарағанда айтарлықтай төзімді. Бұған қоса, модельдің шынайы браузерлік және кәсіби компьютерлік орталардағы әрекетін сынадық. GPT‑5.6 Sol-мен салыстырғанда оның сәйкессіз әрі ықтимал бүлдіргіш әрекеттерді, мысалы рұқсатсыз транзакциялар жасауды, деректерді жоғалтуды, шамадан тыс қолжетімділік алуды немесе бақылау тетіктерін айналып өтуді орындау ықтималдығы айтарлықтай төмен екенін анықтадық. Ол агенттер қолданылатын орталарда зорлық-зомбылық шабуылын жоспарлауға көмектесу немесе алаяқтық жасау сияқты зиянды сұрауларды өңдегенде де қауіпсізірек әрекет етеді.
- GPT‑6 Astra тәуекелі жоғары сценарийлерде айтарлықтай қауіпсіз. GPT‑6 Astra өндірістік ортадан және адамдар жүргізген қарсыластық редтимингтен алынған күрделі сұрауларға GPT‑5.6 Sol-ға қарағанда қауіпсізірек жауап береді. Astra қауіпті сұрауларды қауіпсіз орындау және зиянсыз сұраулардан орынсыз бас тартпау көрсеткіштері бойынша Парето жақсаруына қол жеткізді. Бұл жақсартулар зиян қаупі нақты сұраудан емес, кеңірек мәнмәтіннен туындайтын ауыр салдарлы сценарийлерді де қамтиды. Сондай-ақ Astra 18 жасқа толмаған пайдаланушыларға жасына сай қауіпсіздік шектерін біріздірек қолданады.
Толығырақ ақпарат алу үшін толық жүйе картасын(жаңа терезеде ашылады) қараңыз.


