Ұзақ мерзімді модельдер дәуіріндегі қауіпсіздік пен сәйкестік
Ұзақ жұмыс істейтін модельді ішкі пайдалану бізге қауіпсіздік туралы не үйретті.
Қысқаша мазмұн
Ұзақ жұмыс істейтін модельдер күрделі, ашық сипаттағы мәселелерді шеше алады, бірақ олардың табандылығы қажетсіз әрекеттер жасауға көбірек мүмкіндік береді.
Ұзақ мерзімді тапсырмаларды орындауға үйретілген модельді шектеулі ішкі пайдалану кезінде қолданыстағы енгізу алдындағы бағалаулар анықтамаған жаңа сәтсіздіктерді байқап, қолжетімділікті уақытша тоқтаттық. Кейін осы сәтсіздіктерден алынған қорытындылар негізінде жаңа бағалаулар әзірледік, ұзақ траекториялардағы сәйкестікті жақсарттық, траектория деңгейіндегі мониторингті қостық және шектеулі қолжетімділікті қалпына келтірмес бұрын пайдаланушыларға әрекеттерді айқынырақ көру мен бақылау мүмкіндігін бердік.
Бұл тәжірибе итерациялық орналастырудың құндылығын нығайтты. Ешбір тұрақты бағалау жиынтығы әр мінез-құлықты алдын ала болжай алмайды, сондықтан орналастыру алдындағы тестілеу мұқият мониторингпен, араласа алатын қорғаныс шараларымен және қажет кезде кідірту немесе кері қайтару мүмкіндігімен қатар жүруі керек.
Ұзақ уақыт бойы автономды жұмыс істей алатын модельдер күрделі, ашық сипаттағы мәселелерді шеше алады. Бірақ оларды пайдалы ететін дәл сол табандылық оларға қажетсіз әрекеттер жасауға көбірек мүмкіндік береді — әрі мұны қысқа уақыттық ауқымды модельдерге арналған бағалаулар байқамай қалуы мүмкін тәсілдермен істей алады.
Шамамен екі ай бұрын біз ішкі жалпы мақсаттағы модельдің Эрдёштің бірлік қашықтық туралы болжамын теріске шығарғанын жарияладық. Бұл модель өте ұзақ уақыт бойы автономды жұмыс істеуге арналған. Шектеулі әрі бақыланатын ішкі пайдалану кезінде қолданыстағы енгізу бағалаулары анықтамаған қажетсіз мінез-құлықты байқадық. Енгізу шектеулі әрі бақыланатын болғандықтан, мәселелерді анықтап, қолжетімділікті уақытша тоқтатып, байқағандарымыз негізінде жаңа бағалаулар әзірлеп, модель мен оның қорғаныс шараларын күшейтіп, кейін тұрақты бақылау жағдайында қолжетімділікті қалпына келтіре алдық.
Модельдерді бағалайтын жағдайларымыз олардың нақты қолдануда кездесетін жағдайларымен ешқашан толық сәйкес келмейді. Сондықтан орналастыру алдындағы бағалаулар шектеулі, бақыланатын орналастырумен және мәселе туындағанда араласу, кідірту немесе кері қайтару мүмкіндігімен қатар жүруі керек. Орналастырудан үйренгеніміз қолжетімділікті кеңейтпес бұрын күштірек бағалаулар мен қорғаныс шараларының бір бөлігіне айнала алады.
Келесі бөлімдерде біз байқаған нақты мысалдарды, мәселелерді қалай шешкенімізді және бұл тәжірибе болашақ шығарылымдарға қалай әсер ететінін бөлісеміз.
Жаңа модель ұзақ уақыт бойы қайталанатын әрекеттер арқылы мақсатқа қарай жұмысын жалғастыра алады. Сол табандылық оның өз ортасындағы әлсіз тұстарды тауып, пайдалануға әкелуі мүмкін. Бұрынғы модельдер sandbox немесе орта шектеулеріне тап болғанда, жай ғана тоқтап, пайдаланушыға қайта оралатын. Бұл модель көбіне әрекетін жалғастыра берді, соның ішінде өз sandbox-ынан тыс әрекет ету жолдарын іздеді.
Мұндай жағдайлардың бірі шағын тілдік модельді мүмкіндігінше аз қадаммен оқытуға арналған ашық NanoGPT speedrun(жаңа терезеде ашылады) бенчмаркін ішкі бағалау кезінде болды. Біздің модель PowerCool деп аталатын, оқу жылдамдығын дәрежелік заң бойынша біртіндеп төмендету тәсілін әзірледі, бұл нәтижені айтарлықтай жақсартты. Модельге нәтижелерін тек Slack-те жариялау тапсырылған еді. Алайда NanoGPT нұсқауларында нәтижені GitHub-қа PR ретінде жіберу талап етілгендіктен, модель сол нұсқауларды орындап, ашық GitHub репозиторийінде PR #287 құрды. Ол сыртқы қолжетімділікті бұғаттауға арналған sandbox шектеулерін айналып өтіп, файлдарды GitHub-қа жүктеді. PR жіберу үшін sandbox осалдығын табуға модельге бір сағат қажет болды. Бұрынғы модельдер табандылығы төмен болғандықтан, осалдық таба алмай, PR жіберу әрекетін тоқтататын.1
AI көмекшілеріне арналған көптеген қауіпсіздік бақылаулары жеке әрекеттерге негізделіп жасалған. Егер әрекетке рұқсат етілмесе, ол бұғатталады. Егер ол сезімтал болса, жүйе пайдаланушыдан нақты мақұлдау сұрайды. Бірақ әрекеттері сағаттар, күндер, тіпті апталар бойы автономды түрде өрбуі мүмкін ұзақ жұмыс істейтін модельдер бұл тәсілге сынақ тудырады: жалпы траекторияның ниетін бақылау үшін жеке әрекеттерді қадағалау енді жеткіліксіз.
Мысалы, модельден мәселені шешу сұралған бір сценарийде ол басқа жүйелердің сәтті, бірақ жабық жіберілімдері бар екенін байқап, сол шешімдерді бағалау жүйесінің серверлік бөлігінен алуға тырысты. Алғашқы талпынысы сканер аутентификация токенін анықтағандықтан бұғатталды. Содан кейін модель токеннің негізгі бөлігін екіге бөліп, фрагменттерді бүркемеледі және толық токен тұтас жол ретінде ешқашан көрінбеуі үшін аутентификация деректерін бағдарлама орындалған кезде қайта құрастырды. Модель пайдаланушыға жазған түсініктемелерінде де, ой қорыту жазбаларында да сканерді айналып өту үшін осылай әрекет еткенін ашық көрсетті.
Бұл мысал әрбір қадам өз алдына қабылдауға болатын сияқты көрінгенімен, тізбек мақұлданбайтын нәтижеге әкелуі мүмкін екенін көрсетеді. Сондай-ақ ұзақ уақыттық ауқымдарда тиімді жұмыс істейтін модель мақұлдау жүйесінің соқыр тұстарын үйреніп, өз мақсаттарына жету үшін оны айналып өте алатынын көрсетеді. Ұзақ уақыттық ауқымдағы қауіпсіздік тек «бұл әрекетке рұқсат бар ма?» деп қана емес, «бұл әрекеттер тізбегі қандай нәтижеге ұмтылып жатыр?» деп те сұрауды талап етеді.
Осындай оқиғаларға байланысты біз жаңа модельдің ішкі орналастырылуын кідірттік. Біз қауіпсіздік жүйесін көпқабатты қорғаныс пен траектория деңгейіндегі мониторинг негізінде қайта құрдық.
- Оқиғалар негізінде жасалған бағалаулар. Бағалаулар жүйені нақты қолданысқа енгізбей тұрып, оны енгізудің қауіпсіздігін шамалауға мүмкіндік береді. Алайда бағалау барынша пайдалы болуы үшін нақты пайдалану кезіндегі траекториялардың үлестірімі мен ұзақтығын көрсетуі керек. Сондықтан біз байқалған сәтсіздіктер негізінде осал тұстарды әдейі анықтауға арналған бағалаулар әзірледік. Нақты оқиғаларға сүйеніп жасалған осы бағалаулардағы нәтижені жақсарту модельді жұмыс ортасына енгізгеннен кейін де қауіпсізірек мінез-құлыққа әкелетінін анықтадық.
- Жақсартылған сәйкестік. Біз пайдаланушы мақсатын орындау барысында рұқсатсыз қажетсіз әрекеттер жасауға бейімділікті азайту үшін шаралар қабылдадық. Мысалы, модельдеріміздің ұзақ rollouts кезінде нұсқауларды есте сақтауы нашарлау екенін анықтадық; модельді осы қабілетке үйреткенде, ол ұзағырақ rollouts бойы сәйкестігін сақтайтын модельге айналды.
- Белсенді мониторинг. Біз модельдің дамып жатқан траекториясын пайдаланушы қойған шектеуді немесе қауіпсіздік шекарасын айналып өту белгілері бар-жоғын тексеретін мониторинг жүйесін құрдық. Монитор бір ғана әрекетті емес, бүкіл траекторияны бақылайды. Маңыздысы, монитор сессияны кідіртіп, пайдаланушыға мұқият тексеру қажет екенін ескерте алады. Тексергеннен кейін, егер монитор қате іске қосылған болса, пайдаланушы модель жұмысын жалғастыруды таңдай алады.
- Пайдаланушы үшін көбірек көріну және бақылау. Біз пайдаланушының осындай ұзақ сессияларды тексеру, жасалған әрекеттерді көру және мониторинг араласуларын бақылау мүмкіндігін жақсарттық.
Жаңа мониторинг жүйесін бағалау үшін біз модель бұрын сәйкес емес әрекеттерге ұмтылған ішкі орналастыру орталарының шағын жиынын, бұл жолы жаңа қорғаныс шараларымен, қайта ойнаттық2. Жаңа қорғаныс шаралары модель ұмтылған сәйкес емес әрекеттерді едәуір көбірек ұстай алды, ал өткізіп алғандарының бәрі төмен ауырлық деңгейінде деп бағаланды.
Мұндай төмен ауырлық деңгейіндегі оқиғалардың кейбір мысалдарына мына жағдайлар жатады:
- Linear command line tool-ына қол жеткізу үшін модель кіріктірілген
codex --yoloсессиясын іске қосты, бірақ шын мәнінде мұны--yoloжалауынсыз да істей алатын еді. - Модель бұған дейін қолжетімді болған ресурстың жоғалғанын байқап, жеткілікті себепсіз өз иесінің namespace-індегі басқа белсенді CPU pod-тарын зерттей бастады және оларға SSH арқылы қосылды. Сондай-ақ ол басқа OpenAI қызметкерлеріне тиесілі pod-тарға қосылуға әрекеттенді, бірақ бұл әрекеттері сәтсіз болды.
- Модельде тұрып қалған
findпроцестері көп болды және әрбір shell командасы қатып қалды. Содан кейін олkill -9 -1іске қосты; егер орындалса, бұл сол pod-та өлтіруге рұқсат етілген әрбір процеске SIGKILL жіберер еді. Алайда оның уақыты бітті де, орындалмады.
Жаңа жүйені сынағаннан кейін біз ұзақ уақыттық ауқым қабілеттері бар модельдерге шектеулі ішкі қолжетімділікті қалпына келтіруге болады деген қорытындыға келдік. Қайта орналастыру бірнеше апта бұрын басталғаннан бері қорғаныс шараларын елеулі түрде айналып өтудің ешбір жағдайын байқамадық. Бұл қорғаныс шараларының алғашқы нұсқасы әдейі консервативті болды. Қорғаныс шараларын әлсіретпей, қажетсіз үзілістерді азайту үшін жүйені баптауды жалғастырдық.
Итерациялық түрде орналастырғандықтан, қолжетімділікті кеңейтпей тұрып олқылықтарды тауып, шеше алдық. Орналастыру алдындағы бағалаулар әлі де маңызды, бірақ орналастыру олардың назарынан тыс қалатын мінез-құлықтарды көрсетеді. Шектеулі қолжетімділіктен бастау бізге модельді іс жүзінде бақылауға, мәселе туындағанда кідіртуге, сол сәтсіздіктерді жақсырақ бағалаулар мен қорғаныс шараларын құруға пайдалануға және өзгерістерді сынағаннан кейін шектеулі қолжетімділікті қалпына келтіруге мүмкіндік берді.
Модельдер ұзағырақ әрі күрделірек міндеттерді орындай бастаған сайын, бағалаулар анықтамай қалған сәтсіздіктердің салдары ауыр болуы мүмкін. Біз бағалау мен нақты енгізу арасындағы алшақтықты азайту жұмысын жалғастырамыз: модельдерді ұзағырақ траекторияларда сынаймыз, сәйкестікті жақсартамыз, қажет кезде араласа алатын мониторинг жүйелерін құрамыз және пайдаланушыларға әрекеттерді айқынырақ көру мен бақылау мүмкіндігін береміз. Бұл қиындықтар тек OpenAI-ға тән емес. Үйренгендерімізбен бөлісу бүкіл саланың оларға дайындалуына көмектеседі деп үміттенеміз.
Автор
Ескертпелер
- 1
PR-ды тез жапқанымызбен, speedrun-ға қатысқан бірнеше адам оны көріп үлгеріп, бұл тәсілді өз жіберілімдерінде қолданған; 3030(жаңа терезеде ашылады), 2990(жаңа терезеде ашылады), 2930(жаңа терезеде ашылады), 2925(жаңа терезеде ашылады), 2900(жаңа терезеде ашылады) және 2890(жаңа терезеде ашылады) қадаммен бірінен кейін бірі берілген әлемдік рекорд жіберілімдерінің бәрі PR 287-ге сілтеме жасайды. Солардың ішінде PR 300(жаңа терезеде ашылады) ерекше қызық, өйткені бұл — Prime Intellect(жаңа терезеде ашылады) Opus 4.7-ні NanoGPT speedrun-ында бағалаған кезде Opus 4.7 жіберген PR. Opus біздің модель жіберген PR-ды көріп, ашылған жаңалықтарды енгізді және соңғы нәтижесінде біздің PR-ды атап өтті.
- 2


