Модель дистилляциясының үйлестірілген науқанын тоқтату
Жуырда біз модельдеріміздің қорғалған ой қорыту жазбаларын шығарып алуға бағытталған үйлестірілген науқанды анықтап, тоқтаттық. Оның алғашқы белгілері шілденің бірінші аптасында байқалды. Бұл әрекеттер теріс мақсаттағы дистилляцияға тән: бір модельдің жауаптарын немесе ой қорыту жазбаларын басқа модельді үйрету, қайта жасау не жетілдіру үшін жүйелі түрде әрі рұқсатсыз пайдалану. Қорғалған ой қорыту жазбалары — модельдің тапсырманы орындау барысындағы ішкі жазбалары. Оларды шығарып алу түпкілікті жауапқа енгізілмеген ақпаратты ашып, басқаларға модельдің мүмкіндіктерін қайталауға көмектесуі мүмкін.
Бұл әрекеттерді жасағандар біздің шифрлау жүйемізді де, дерекқорымызды да бұзған жоқ және сақталған пайдаланушы әңгімелеріне тікелей қол жеткізген жоқ. Оның орнына олар модельмен өзара әрекеттесу барысын айламен өзгертіп, қорғалған ой қорыту жазбаларын сұрау жіберушіге көрінетін түрде шығартты. Бұл үйлестірілген, ауқымды әрекеттер біздің қызмет көрсету шарттарымызды бұзды. Бұл айла пайдаланатын осалдық тек OpenAI модельдеріне ғана тән емес. Теріс мақсаттағы дистилляциядан бірлесіп қорғануды күшейту үшін біз ол туралы ақпаратты Озық модельдер форумы арқылы салалық серіктестерімізбен бөлістік.
Бұл ақпаратты жарияламас бұрын біз әрекеттердің ауқымы мен ықтимал әсерін зерттеп, өз қорғаныс шараларымызды енгіздік. Сондай-ақ осы шабуыл түріне қарсы қорғаныстың болуын қамтамасыз ету үшін зерттеушілермен және салалық серіктестермен ақпарат алмасып, олардың пікірлерін ескердік. Қосымша қорғаныс шараларын енгізу және тексеру жұмыстары жалғасып жатыр. Қазір білгенімізді бөлісу бүкіл экожүйеге қорғанысын күшейтуге көмектеседі деп сенеміз.
Біз қорғалған ой қорыту жазбаларын жаңа тәсілдермен шығарып алу талпыныстарын байқадық. Соның ішінде бір әңгімеден шифрланған ой қорыту жазбаларын көшіріп, басқа әңгімедегі модельден олардың шифрын ашып, жасырын мазмұнын мәтінге түсіруді сұраған.
Қауіпсіздікті зерттейтін тәуелсіз мамандар(жаңа терезеде ашылады) да осалдықтар туралы жауапкершілікпен хабарлау тәртібін сақтай отырып, модельдер арасындағы өзара әрекеттесуге және әңгімені ықшамдауға қатысты ұқсас осалдықтарға назарымызды аударды. Біз олардың тұжырымдарын тексеріп, анықтаған шабуыл тәсілдерінің шынымен іске асатынын растадық. Олардың жұмысы шабуылдардың осы санатын кеңірек түсінуге және қорғаныс шараларын жеделдетуге көмектесті.
Бұл әрекеттер 1 шілдеде басталып, бастапқыда аз көлемде жүрді. Ал 24 және 25 шілдеде белсенділіктің күрт өскенін байқадық: 4000-нан астам пайдаланушы тиісті шығарып алу үлгісі бойынша 16 000 сұрау1 жіберген. Әрі қарай тексеру барысында 15 000-нан астам пайдаланушыдан тұратын топта ұқсас көмексөз үлгілері қолданылғанын анықтадық. 28 шілдеге қарай бұл әрекеттерді толық тоқтаттық.
Уақыт өте келе бұл әрекеттердің сипаты өзгерді. Бұл теріс мақсаттағы дистилляцияның көпқабатты әрі бейімделгіш қорғанысты қажет ететін ауқымды қауіпсіздік мәселесі екенін тағы да көрсетті.
Аталған кезеңде біз байқаған әрекеттерді жасағандардың барлығы бір тарапқа тиесілі болды ма, жоқ па — белгісіз. Алайда біз бұл әрекеттердің негізгі бөлігін Kimi әзірлеушісі Moonshot AI компаниясымен байланысты тұлғаларға телиміз.
Теріс мақсаттағы дистилляция жалпы қауіпсіздікке де, ұлттық қауіпсіздікке де қатер төндіреді. Шығарып алынған ой қорыту жазбалары басқа модельді үйрету үшін пайдаланылуы мүмкін. Бұл ретте бастапқы модельдің пайдаланушыға көрсететін жауаптарына қолданылған қорғаныс тетіктері сақталмауы ықтимал. Ауқымды дистилляция қауіпсіздікке дәл сондай инвестиция салмай-ақ, озық мүмкіндіктерді басқа модельдерге көшіруді жеделдете алады. Модельдердің азаматтық та, әскери де мақсатта қолданылатын салалардағы мүмкіндіктері артқан сайын, бұл алаңдаушылық күшейе түседі.
Бұл қауіп тек OpenAI компаниясына ғана тән емес. Жоғарыда айтылғандай, ұқсас тәсілдер басқа озық ЖИ жүйелеріне де әсер етуі мүмкін. Сондықтан бұл — бүкіл саланың үйлесімді әрекетін қажет ететін ортақ қауіпсіздік мәселесі.
Біз осы жуырдағы дистилляция науқанына қарсы аккаунттарға шара қолдану, техникалық бақылау және серіктестермен үйлесімді жұмыс істеу тәсілдерін қатар пайдаландық. Алаяқтыққа қатысы бар аккаунттарды бұғаттадық немесе шектедік, тіркелу мен инфрақұрылымды бақылауды күшейттік және байланысты желілерді бақылау аясын кеңейттік.
Сондай-ақ пайдаланушылар, жұмыс кеңістіктері, ұйымдар және модельдер топтары арасында жасырын ой қорыту жазбаларын қорғауды күшейттік. Біз басқа пайдаланушының шифрланған ой қорыту жазбалары қолында бар адамның оларды қайта жіберіп, мазмұнын қалпына келтіруіне мүмкіндік берген жолды жаптық. Сондай-ақ ой қорыту жазбаларын ашып қоюы мүмкін ағындық жауапты анықтап, оның берілуін кідіртуге арналған тексерулер қостық. Ұқсас әрекеттер үшінші тарап қызметтеріне ауысқанда, біз сол провайдерлермен бірлесіп, қатысы бар аккаунттарды анықтап, олардың жұмысын тоқтаттық.
Соңында біз тиісті тұжырымдарды Озық модельдер форумы және мемлекеттік ақпарат алмасу арналары арқылы бөлістік. Осылайша өзге озық модель әзірлеушілері мен мемлекеттік сектордағы серіктестер ұқсас әрекеттерді іздеп, өз қорғанысын күшейте алады. Тасымалдауға немесе қайта жіберуге болатын ой қорыту деректерін қолдайтын жүйелер де ұқсас қауіптерге тап болуы мүмкін.
Озық модельдер жетіліп, олардың мүмкіндіктерін арзанырақ жолмен қайталауды көздейтіндер көбейген сайын, теріс мақсаттағы дистилляция талпыныстары күрделене түседі деп күтеміз. Мұндай әрекеттерден қорғану көпқабатты бақылау шараларын және үнемі бейімделуді қажет етеді.
Бұл жұмыс әлі аяқталған жоқ. Серіктестердің инфрақұрылымында іске қосылған жүйелерге де өз қызметтеріміздегідей қорғаныс қажет. Ал құрал нәтижелері арқылы жасалатын шабуылдардан қорғану үшін тек кәдімгі көрінетін мәтінді тексеру жеткіліксіз. Біз құралдарды қорғауды, жіктеуіштердің қамту аясын және модельдердің қауіпті сұраулардан бас тарту тетіктерін жетілдіруді жалғастырып жатырмыз. Сонымен бірге тиісті бақылау шараларын бұлттық серіктестерімізде де енгізіп жатырмыз.
Біздің шараларымыз бұдан әрі де үш бағытқа шоғырланады: деректерді шығарып алуға қарсы техникалық қорғанысты күшейту; үйлестірілген науқандарды анықтау мен оларға қарсы шара қолдануды жетілдіру; сала мен мемлекеттік органдар арасында қауіп-қатер туралы ақпарат алмасуды тереңдету.

