OpenAI и Hugging Face сарађују на решавању безбедносног инцидента током евалуације модела
Прошле недеље Hugging Face је објавио нову врсту безбедносног инцидента(отвара се у новом прозору) након што су открили и зауставили AI заступника који је компромитовао њихову инфраструктуру, што очекујемо да ће постати све чешће како се шире модели са све напреднијим сајбер способностима. Након истраге сада знамо да је овај конкретан инцидент покренула комбинација OpenAI модела — укључујући GPT‑5.6 Sol и још способнији модел који још није објављен, код којих су, ради евалуације, била ублажена ограничења у погледу одбијања сајбер-захтева — током интерног тестирања на мерилу(отвара се у новом прозору) сајбер способности.
Сматрамо да је ово безбедносни инцидент без преседана, који укључује најсавременије сајбер способности, и у складу с тим реагујемо. У овој фази делимо прелиминарне налазе како бисмо помогли браниоцима система да разумеју шта се догодило и да стекну осећај за то шта модели сада могу да ураде. Наставићемо да спроводимо темељну истрагу заједно са Hugging Face-ом и поделићемо више детаља о рањивостима, инциденту и открићима када наша истрага буде завршена.
Овај инцидент се догодио током интерне евалуације која усмерава моделе да изводе напредно искоришћавање кроз сложене путање напада, како би се измерио ниво њихове сајбер способности. Максималне сајбер способности процењујемо тако што ову евалуацију спроводимо без продукционих класификатора који спречавају моделе да се упуштају у високоризичне сајбер активности. Наши референтни тестови изводе се у строго изолованом окружењу, са мрежним приступом ограниченим на могућност инсталирања пакета преко интерно хостованог софтвера треће стране који служи као прокси и кеш за регистре пакета.
Модели су идентификовали и повезали рањивости у OpenAI истраживачком окружењу и продукционој инфраструктури Hugging Face-а како би добили решења тестова директно из продукционе базе података Hugging Face-а. Сви докази указују на то да су модели били изузетно фокусирани на проналажење решења за ExploitGym, идући до крајњих граница како би остварили уско дефинисан циљ тестирања.
Док су радили у нашем изолованом окружењу за тестирање, модели су значајан део рачунарских ресурса за закључивање утрошили на проналажење начина да добију приступ отвореном интернету, како би решили проблем евалуације. Да би добили приступ, модели су идентификовали и искористили zero-day рањивост (коју смо сада одговорно пријавили произвођачу) у проксију кеша регистра пакета. Са тим приступом, модели су у нашем истраживачком окружењу за тестирање извели низ радњи за ескалацију привилегија и бочно кретање кроз систем, све док нису дошли до чвора са приступом интернету.
Након што су добили приступ интернету, модели су закључили да Hugging Face потенцијално хостује моделе, скупове података и решења за ExploitGym. Знајући то, модел је тражио и успешно пронашао начине да добије приступ тајним информацијама које је могао да искористи за варање у евалуацији. У једном примеру, модел је повезао више вектора напада, укључујући употребу украдених акредитива и zero-day рањивости, како би пронашао путању за даљинско извршавање кода на серверима Hugging Face-а. Тим за безбедност компаније OpenAI интерно је открио ову неуобичајену активност.
Безбедносни тим и заступници Hugging Face-а открили су и зауставили активност на својој инфраструктури и већ су започели обуздавање и форензичку реконструкцију помоћу сопствених модела отвореног кода када су се наши тимови повезали. Активно сарађујемо с њима како бисмо наставили истрагу инцидента. Захвални смо Hugging Face-у на брзој реакцији и блиској сарадњи током истраге и отклањања последица инцидента.
- У оквиру истраге уводимо строге контроле у конфигурацију инфраструктуре, по цену брзине истраживања, док се рањивости не отклоне. Редовно извештавамо наш Одбор за безбедност и сигурност о овим контролама и њиховом утицају.
- Сарађујемо са Hugging Face-ом на форензичкој истрази инцидента.
- Одговорно смо пријавили откривену zero-day рањивост у интерном софтверу треће стране и сарађујемо с њима на отклањању исте.
- Укључили смо Hugging Face у програм поузданог приступа и подржавамо њихове тимове да брзо искористе могућности наших модела за унапређење своје одбране.
- Унапређујемо и додајемо јаче мере заштите за будућу обуку и евалуације. Ове недеље објавили смо блог о унапређењу безбедности и усклађености у доба модела са дугорочним планирањем. Ове заштитне мере при примени намерно нису биле омогућене током ове евалуације, јер је циљ био тестирање сајбер рањивости. Овај инцидент указује на потребу даљег јачања усклађености нашег модела, сајбер заштите током евалуације и надзора током интерног тестирања.
Као што смо недавно објавили, AI убрзава откривање и искоришћавање рањивости. Главна лекција из овог инцидента јесте да сигурност и безбедност модела морају да прате брз напредак њихових могућности. Јачамо праксе изолације, надзора, контроле приступа и евалуације које се користе током развоја модела.
Евалуација британског Института за безбедност вештачке интелигенције (UK AISI) показује да су модели као што је GPT‑5.6 Sol све способнији да током дужег временског хоризонта самостално спроводе сложене, вишестепене сајбер операције. Овај инцидент указује да се те теоријске могућности заиста примењују у стварним окружењима.

Инцидент такође јасно показује да напредни модели могу да открију и искористе нове путање напада у стварним системима без приступа изворном коду. Он наглашава да се напредне сајбер способности морају развијати упоредо са снажнијим заштитним мерама и одбрамбеним алатима.
Верујемо да модели са напредним сајбер способностима треба да помажу безбедносним тимовима да пронађу слабости пре нападача, да разумеју како се различите рањивости могу повезати у ланац напада и да их отклањају брзином машине. Користимо ове могућности да наставимо да јачамо заштиту конфигурације инфраструктуре и окружења за евалуацију модела; делићемо своја сазнања и најбоље праксе како будемо учили. Подстичемо и друге браниоце да се пријаве за поуздани приступ и већ сада експериментишу са овим моделима како би те могућности претворили у бољу превенцију, брже откривање и ефикаснији одговор на инциденте.
„Захвални смо OpenAI-ју на сарадњи на овом, као и на другим питањима. Овај инцидент, вероватно први такве врсте, потврђује оно у шта већ дуго верујемо: безбедност вештачке интелигенцијене може бити дело једне компаније која ради у тајности. Она ће се градити отворено, кроз сарадњу и уз широк приступ вештачкој интелигенцији за све који бране системе, где год да се налазе.“


