Критикалық кибермүмкіндіктер дәуіріндегі модель әзірлеу қарқыны
Соңғы бірнеше аптада барған сайын қуатты бола түскен ЖИ жүйелеріне байланысты тәуекелдердің артып келе жатқанын екі жағдай айқын көрсетті: OpenAI мен Hugging Face арасындағы оқиға және бөлек алғанда, алдағы модельдеріміздің бірі — Astra критикалық киберқауіпсіздік мүмкіндігі бойынша Дайындық шеңберінде белгіленген шекке жетуі мүмкін деген бастапқы деректер. Бұл жағдайлар ішкі зерттеулеріміздегі жедел ілгерілеумен бірге оқытудың барлық кезеңінде бақылау, сәйкестендіру және оқшаулау шараларын күшейту жұмысын жеделдетті.
Модельдер қуатты болған сайын, оларды іште әзірлеу мен сынауға байланысты тәуекелдер де артады. Бақылау, сәйкестендіру және қауіпсіздік стандарттарымыз осы тәуекелдерден озық тұруы керек. Осы стандарттарға сай болуға қажетті уақытты бөлу үшін біз модельдерді ауқымдау қарқыны уақытша баяулаттық. Зерттеу орталарымызды қарсылас тәсілмен жан-жақты сынап және бақылау жүйелеріміздің қамту аясын кеңейту барысында, енгізуге арналған ең жаңа модельдерімізді күшейтпелі оқыту (RL) үдерісін екі аптаға тоқтаттық. жоспарланған ең ірі озық модельді RL арқылы оқыту үдерісі. Жалғастырмас бұрын модельдің мінез-құлқын бағалау, қорғаныс шараларын тексеру және сәйкестік туралы көбірек дәлел жинау үшін шағын ауқымда оқыту мен бағалау жүргізіп жатырмыз.
ЖИ жүйелерінің көзделгендей әрекет етіп, адамның бақылауына бағынуын қамтамасыз ету жұмысы — сәйкестендіру— зерттеу бағдарламамыздың ежелден негізгі өзегі болып келеді. Қазір жүргізіліп жатқан зерттеулер мен бағалауларға сүйене отырып, оқытудың барлық кезеңінде мақсатқа сай мінез-құлықтың сенімдірек дәлелдерін талап етеміз. Барған сайын қуатты жүйелерді мақсатқа сай ұстау — бүкіл сала шешуге тиіс мәселе. Алдағы модельдердің ілгерілеуінен байқалған белгілер бізге қазіргі Дайындық шеңберіне сүйенетін әрі оның аясынан шығатын кеңірек тәсіл қажет екенін анық көрсетеді.
Тәсіліміздің қалай өзгеріп жатқаны туралы ашық айту маңызды деп санаймыз. Төменде зерттеу үдерістеріміз бен инфрақұрылымымызға енгізілген өзгерістерді және әлі де атқарылып жатқан жұмыстарды сипаттаймыз.
Қуаттырақ модельдер әзірлеу тәсіліміз бірін-бірі толықтыратын үш қорғаныс шарасына негізделген:
- Бақылау алаңдатарлық мінез-құлықты анықтап, оған әрекет етуге мүмкіндік береді.
- Сәйкестендіру зиянды немесе рұқсатсыз әрекеттердің ықтималдығын азайтады.
- Қауіпсіздік шаралары ЖИ жүйелерінің неге қол жеткізе немесе неге ықпал ете алатынын шектейді.
Жақын арада қауіпсіздік жұмыстарының басым бөлігін, соның ішінде басқа модельдерден қорғануды да модельдер атқарады деп күтеміз. Бұл үш қорғаныс шарасын да модель мүмкіндіктерімен қатар кеңейтуге жол ашады, ал біз мұны аса маңызды деп санаймыз.
Бұл шараларды зерттеу мен енгізудің барлық кезеңінде қолданып, әр модельдің мүмкіндіктеріне, жұмыс ортасына және тәуекел деңгейіне бейімдейміз.
Озық модельдердің киберқауіпсіздік мүмкіндіктері артқан сайын, оларды оқытып, бағалайтын орталарымызға қойылатын қауіпсіздік стандарттарын күшейтіп жатырмыз. Бұл стандарттарға сай болу елеулі инженерлік жұмысты талап етіп, озық зерттеулердің айтарлықтай қымбаттауына және кешігуіне әкелді. OpenAI мен Hugging Face арасындағы оқиғадан* кейін бірден зерттеу кластерлерінде код орындауы немесе интернетке қол жеткізе алатын құралдарды пайдалануы мүмкін іске қосылымдар үшін зерттеу кластерлеріндегі озық модельдердің инференсін тоқтаттық. Код орындаудың шектеулірек әрі қауіпсіз жолын тез қалпына келтірдік, содан кейін әр жүктемені жеке қарап, оны қауіпсіз жалғастыруға болатынын анықтадық. Кейбір зерттеу жүктемелері жаңа бақылау шараларымен қайта іске қосылды, ал басқаларына қосымша өзгерістер қажет болды.
Кейінгі апталарда озық зерттеу жүктемелеріне арналған қатаңырақ қауіпсіздік талаптарын белгілеп, оларды енгізе бастадық. Мысалы:
- Жүктемені оқшаулау: модель жасаған немесе өзге де сенімсіз кодты орындайтын жүктемелерді енді қатаңырақ оқшаулауды («құмсалғыштарды») талап етеміз. Бұл модель нәтижелерін өңдеу кезінде бұзылуы мүмкін бағдарламалық жасақтамаға да қатысты.
- Желіні оқшаулау: тәуекелі жоғары және сенімсіз жүктемелерді интернеттен оқшаулау үшін қосымша бақылау шараларын енгіздік. Бұл шараларды бір жүктеме не көмекші қызмет бұзылған жағдайда, соның өзі интернетке немесе басқа ішкі желілерге рұқсатсыз кіруге мүмкіндік бермейтіндей етіп әзірледік.
- Қауіпсіздікті үздіксіз сынау: ықтимал осал ортақ қызметтерді жою, тұрақты берілген қолжетімділік құқықтарын азайту және қауіпсіздік пен сенім шекараларын жақсарту үшін ортамызды қайта баптадық. Қауіпсіздік журналдарын жинау және бақылау мүмкіндігімізді де жетілдіріп жатырмыз. Соңында, осы шекараларды имитациялық шабуылдармен үздіксіз сынау үшін модельдерімізге негізделген автоматтандыруға инвестиция салып жатырмыз.
Бұл бақылау шаралары біріге отырып, көпдеңгейлі қорғаныс құрып, зерттеу ортамызды шабуылдардан қорғауға көмектеседі. Astra модельдерінің кибермүмкіндігі критикалық деңгейге жетуі ықтимал екенін анықтағандықтан, қазір Astra немесе кибермодельдер қатысатын жүктемелерге ең қатаң қауіпсіздік шараларын қолдануды талап етеміз. Бұл қорғаныс шаралары киберсалаға қатысты барлық басқа жүктемелерге де қолданылады.
Astra модельдерін оқыту мен бағалаудың кейбірі осы талаптарға сай болғанымен, жүктемелердің едәуір бөлігі жаңа қауіпсіздік деңгейіне сай толық көшіріліп, жетілдірілгенше тоқтатылған күйде қалады. Жаңа орталарға көшіру кезінде қауіпсіздік пен сәйкестендіруге қатысты жүктемелерге басымдық беріп отырмыз.
Бақылау көптен бері модель әзірлеу үдерісіміздің маңызды бөлігі болып келеді. Оған ішкі бағдарламалаушы агенттерді бақылау және ұзаққа созылатын сеанстарды бақылау кіреді. Бақылау жұмысымыз әсіресе озық модельдерді ішкі ортаға енгізуге және озық RL оқыту үдерістеріне бағытталды. Біз оларды тәуекелі ең жоғары жүктемелер деп санадық, өйткені олар модельдің жетілдірілген мүмкіндіктерін құралдарға, сезімтал жүйелерге, сондай-ақ ішкі не сыртқы желілерге қолжетімділікпен ұштастыра алады. Олар құралдар қолданылған барлық инференс пен оқыту үдерісіне қолданылған жоқ. Жаңа бақылау жүйесі аясында тәсілімізді қайта қарап, кеңейттік.
Бұл жаңа көпсатылы бақылау жүйесі әрбір іріктелген токенде іске қосылатын активация жіктеуіштерінен (модельдің ішкі белсенділігін тексеретін детекторлардан) басталып, ықтимал мәселелерді біртіндеп күрделірек әрі есептеу ресурсын көбірек қажет ететін автоматтандырылған тексеру жүйелеріне жібереді. Бұл жүйелер рұқсатсыз кіруді, дерек ұрлауды, бүлдіруші әрекеттерді және қорғаныс шараларын айналып өту талпыныстарын анықтау үшін құрал әрекеттерін, қолжетімді ой қорыту барысын және бүкіл әрекеттер тізбегін тексереді. Бақылау жүйеміз алаңдатарлық әрекетті анықтағаннан кейін 30 минут ішінде ескерту беруді көздейміз. Бақылау жүйесі қауіпсіздіктің критикалық шекарасы бұзылған болуы ықтимал екенін анықтаса, ең жоғары басымдықтағы ескерту жасайды. Қазіргі іске асыру нұсқасында қауіпсіздік, қорғаныс және зерттеу топтарына шұғыл хабарлама жіберіледі. Егер олар 30 минут ішінде дабылдың жалған екенін нақты анықтай алмаса, бұл топтар әрекетті тоқтатуға тиіс.
Бұл бақылау Sol деңгейіндегі немесе одан қуатты модельдерге арналған құралдар қатысатын барлық RL оқытуы мен бағалауында міндетті. 7 тамызда Astra моделінің критикалық кибермүмкіндіктері болуы ықтимал екенін анықтағаннан кейін, құралдар пайдаланылатын Astra моделінің барлық инференсіне қосымша бақылау талабын енгіздік. Бұл тек RL оқытуы мен бағалауына ғана қатысты емес.
Бұл қорғаныс шаралары елеулі есептеу қуатын қажет етеді. Қазіргі бағалауымыз бойынша, бақылауға кететін қосымша есептеу шығыны бақыланатын инференс қуатының шамамен 20%-ын құрайды, бірақ оқыту және бағалау жүктемелеріне қарай шығын айтарлықтай өзгереді. Жақында шығатын блог жазбасында бұл жүйе туралы толығырақ бөлісеміз.
Сәйкестендіру зерттеулері миссиямыздың өзегінде тұр. Миссиямыз — жалпы жасанды интеллектінің бүкіл адамзатқа пайдасын тигізуін қамтамасыз ету. Модельдер кибершабуыл жасау сияқты жетілдірілген мүмкіндіктерге ие болып, күрделірек орталарда жұмыс істеген сайын, марапат жүйесін бұрмалауды пайдалану (көзделген нәтижеге іс жүзінде жетпей-ақ, оқыту кезінде жоғары марапат алудың жолын табу), алдау немесе рұқсатсыз кіру секілді мақсатқа сай емес әрекеттер барған сайын елеулі тәуекел туғызады.
Ең қуатты модельдерді RL арқылы оқытуда енді негізгі сәйкестендіру әдістерімізді оқыту үдерісінің көбірек кезеңінде қолданып жатырмыз. Оған әртүрлі тапсырмалар мен орталардағы қауіпті әрекеттерді жақсырақ анықтап, тежеу үшін марапат модельдерін жетілдіру; модельдерді өз әрекеттері, мүмкіндіктері мен шектеулері туралы шынайырақ айтуға үйрету; сондай-ақ марапаттардағы, бағалау жүйелеріндегі, құралдардағы немесе бақылаудағы әлсіздіктерді пайдаланатын әрекеттерді азайту кіреді. Модельдер сыртқы жүйелермен немесе ресурстармен әрекеттескенде зиян келтіруі мүмкін мінез-құлықтарды қамтитын оқыту аясын да кеңейтіп жатырмыз.
Сәйкестендіру зерттеулеріне белсенді инвестиция салуды, бағалау аясын кеңейтуді және алған білімімізді оқыту мен қорғаныс шараларында қолдануды жалғастырамыз. Жақын арада сәйкестендіру зерттеулеріміз, соның ішінде модель мінез-құлқы туралы білгеніміз және анықталған жаңа мәселелер жайында әлдеқайда көбірек ақпарат беруді жоспарлап отырмыз.
Оқыту мен енгізудегі осы қорғаныс шараларын біріктіру және болашақ модельдердің мүмкіндіктері мен жұмыс орталарын дәлірек көрсету үшін Дайындық шеңберін жетілдіреміз. Осы мүмкіндіктермен бірге ауқымын кеңейте алатын әдістерді әзірлеу үшін модельдер көмегімен қамтамасыз етілетін қауіпсіздікке, тиімдірек бақылауға және сәйкестендіру зерттеулерін үздіксіз ілгерілетуге тұрақты инвестиция қажет. Тәсіліміз дамыған сайын сыртқы ұйымдарды қатыстырып, алған білімімізбен көбірек бөлісуді көздейміз.
Озық модельдердің мүмкіндіктері қарқынды дамып келеді. Оларды түсіну, сәйкестендіру және қорғау қабілетіміз осы дамудан озық тұруы керек.
*Алдағы апталарда алған сабақтарымыз туралы техникалық есеп жариялаймыз.

