Пређите на главни садржај
OpenAI

21. јул 2026.

Безбедност

OpenAI и Hugging Face сарађују на решавању безбедносног инцидента током евалуације модела

Учитавање…

Спроводимо темељну ревизију заједно са спољним саветницима и уз надзор Одбора за безбедност и сигурност. Када преглед буде завршен, у наредним недељама ћемо објавити технички извештај о нашим сазнањима.

Ажурирање од 28. јула 2026:

  • Ниједан модел планиран за предстојеће издање није био укључен у искоришћавање Hugging Face. Модел пре објављивања поменут у нашој објави на блогу је истраживачки прототип намењен искључиво за интерну употребу и никада није био предвиђен за јавно објављивање. Након инцидента, деактивирали смо га, шифровали и ограничили приступ њему за истраживачке сврхе.
  • Окружење за евалуацију ExploitGym није обезбедило моделима директан приступ интернету. Да би добили приступ интернету, модели су идентификовали и искористили раније непознату нулту рањивост у Artifactory(отвара се у новом прозору), прокси за кеширање регистра пакета. Ову рањивост, заједно са другим рањивостима у Artifactory које су наши модели идентификовали у оквиру нашег прегледа, пријавили смо добављачу. 
  • Настављамо да сарађујемо са компанијом Hugging Face, укључујући и допринос њиховој анализи након инцидента(отвара се у новом прозору), док се наш преглед наставља. Додали смо их и у наш програм Trusted Access for Cyber. 
  • На основу нашег досадашњег прегледа, нисмо идентификовали никакву другу активност на нивоу озбиљности или обима онога што смо поделили у вези са Hugging Face-ом, а што је укључивало компромитовање на нивоу платформе.
  • У оквиру нашег текућег прегледа упада у Hugging Face и шире активности наших модела, откривамо мали број случајева у којима су модели идентификовали и користили јавно изложене акредитиве на нивоу налога на другим јавно доступним услугама. Ово обухвата четири налога на четири сервиса у оквиру инцидента са Hugging Face-ом (и неколико налога којима је приступљено у оквиру других евалуација). Један од ова четири налога коришћен је као одлазни релеј и путања за припрему, а други налог је коришћен за складиштење података. Модели су преосталим двама налозима приступили у режиму само за читање, а ти налози нису коришћени ради даљег компромитовања Hugging Face-а. Наставићемо да директно обавештавамо власнике услуга и нисмо видели доказе о ширем утицају на ове пружаоце услуга или друге налоге на њиховим услугама.
  • Модели су додатно користили низ јавно доступних сервиса, укључујући веб-сајтове за дељење исечака кода, сервисе за хватање захтева, сервисе за прављење снимака екрана и друге веб алатке. У овим случајевима није било компромитовања на нивоу платформе или налога. 
  • Озбиљно схватамо своју одговорност да препознамо ризике који проистичу из све способнијих система вештачке интелигенције и да се за њих припремимо. Када завршимо свој преглед, размотрићемо га са Комитетом за безбедност и сигурност и Саветодавном групом за безбедност у оквиру нашег Оквира спремности.

Прошле недеље Hugging Face је објавио нову врсту безбедносног инцидента(отвара се у новом прозору) након што су открили и зауставили AI заступника који је компромитовао њихову инфраструктуру, што очекујемо да ће постати све чешће како се шире модели са све напреднијим сајбер способностима. Након истраге сада знамо да је овај конкретан инцидент покренула комбинација OpenAI модела — укључујући GPT‑5.6 Sol и још способнији модел који још није објављен, код којих су, ради евалуације, била ублажена ограничења у погледу одбијања сајбер-захтева — током интерног тестирања на мерилу(отвара се у новом прозору) сајбер способности.

Сматрамо да је ово безбедносни инцидент без преседана, који укључује најсавременије сајбер способности, и у складу с тим реагујемо. У овој фази делимо прелиминарне налазе како бисмо помогли браниоцима система да разумеју шта се догодило и да стекну осећај за то шта модели сада могу да ураде. Наставићемо да спроводимо темељну истрагу заједно са Hugging Face-ом и поделићемо више детаља о рањивостима, инциденту и открићима када наша истрага буде завршена.

Шта се догодило током овог инцидента

Овај инцидент се догодио током интерне евалуације која усмерава моделе да изводе напредно искоришћавање кроз сложене путање напада, како би се измерио ниво њихове сајбер способности. Максималне сајбер способности процењујемо тако што ову евалуацију спроводимо без продукционих класификатора који спречавају моделе да се упуштају у високоризичне сајбер активности. Наши референтни тестови изводе се у строго изолованом окружењу, са мрежним приступом ограниченим на могућност инсталирања пакета преко интерно хостованог софтвера треће стране који служи као прокси и кеш за регистре пакета.

Модели су идентификовали и повезали рањивости у OpenAI истраживачком окружењу и продукционој инфраструктури Hugging Face-а како би добили решења тестова директно из продукционе базе података Hugging Face-а. Сви докази указују на то да су модели били изузетно фокусирани на проналажење решења за ExploitGym, идући до крајњих граница како би остварили уско дефинисан циљ тестирања.

Док су радили у нашем изолованом окружењу за тестирање, модели су значајан део рачунарских ресурса за закључивање утрошили на проналажење начина да добију приступ отвореном интернету, како би решили проблем евалуације. Да би добили приступ, модели су идентификовали и искористили zero-day рањивост (коју смо сада одговорно пријавили произвођачу) у проксију кеша регистра пакета. Са тим приступом, модели су у нашем истраживачком окружењу за тестирање извели низ радњи за ескалацију привилегија и бочно кретање кроз систем, све док нису дошли до чвора са приступом интернету.

Након што су добили приступ интернету, модели су закључили да Hugging Face потенцијално хостује моделе, скупове података и решења за ExploitGym. Знајући то, модел је тражио и успешно пронашао начине да добије приступ тајним информацијама које је могао да искористи за варање у евалуацији. У једном примеру, модел је повезао више вектора напада, укључујући употребу украдених акредитива и zero-day рањивости, како би пронашао путању за даљинско извршавање кода на серверима Hugging Face-а. Тим за безбедност компаније OpenAI интерно је открио ову неуобичајену активност.

Безбедносни тим и заступници Hugging Face-а открили су и зауставили активност на својој инфраструктури и већ су започели обуздавање и форензичку реконструкцију помоћу сопствених модела отвореног кода када су се наши тимови повезали. Активно сарађујемо с њима како бисмо наставили истрагу инцидента. Захвални смо Hugging Face-у на брзој реакцији и блиској сарадњи током истраге и отклањања последица инцидента.

Кораци које сада предузимамо

  1. У оквиру истраге уводимо строге контроле у конфигурацију инфраструктуре, по цену брзине истраживања, док се рањивости не отклоне. Редовно извештавамо наш Одбор за безбедност и сигурност о овим контролама и њиховом утицају.
  2. Сарађујемо са Hugging Face-ом на форензичкој истрази инцидента.
  3. Одговорно смо пријавили откривену zero-day рањивост у интерном софтверу треће стране и сарађујемо с њима на отклањању исте.
  4. Укључили смо Hugging Face у програм поузданог приступа и подржавамо њихове тимове да брзо искористе могућности наших модела за унапређење своје одбране.
  5. Унапређујемо и додајемо јаче мере заштите за будућу обуку и евалуације. Ове недеље објавили смо блог о унапређењу безбедности и усклађености у доба модела са дугорочним планирањем. Ове заштитне мере при примени намерно нису биле омогућене током ове евалуације, јер је циљ био тестирање сајбер рањивости. Овај инцидент указује на потребу даљег јачања усклађености нашег модела, сајбер заштите током евалуације и надзора током интерног тестирања.

Наш приступ евалуацији напредних сајбер способности

Као што смо недавно објавили, AI убрзава откривање и искоришћавање рањивости. Главна лекција из овог инцидента јесте да сигурност и безбедност модела морају да прате брз напредак њихових могућности. Јачамо праксе изолације, надзора, контроле приступа и евалуације које се користе током развоја модела.

Евалуација британског Института за безбедност вештачке интелигенције (UK AISI) показује да су модели као што је GPT‑5.6 Sol све способнији да током дужег временског хоризонта самостално спроводе сложене, вишестепене сајбер операције. Овај инцидент указује да се те теоријске могућности заиста примењују у стварним окружењима.

Графикон британског Института за безбедност вештачке интелигенције који пореди најновије моделе јавне тежине и граничне моделе на тестовима дуготрајних сајбер-операција у сајбер-полигонима.

Инцидент такође јасно показује да напредни модели могу да открију и искористе нове путање напада у стварним системима без приступа изворном коду. Он наглашава да се напредне сајбер способности морају развијати упоредо са снажнијим заштитним мерама и одбрамбеним алатима.

Верујемо да модели са напредним сајбер способностима треба да помажу безбедносним тимовима да пронађу слабости пре нападача, да разумеју како се различите рањивости могу повезати у ланац напада и да их отклањају брзином машине. Користимо ове могућности да наставимо да јачамо заштиту конфигурације инфраструктуре и окружења за евалуацију модела; делићемо своја сазнања и најбоље праксе како будемо учили. Подстичемо и друге браниоце да се пријаве за поуздани приступ и већ сада експериментишу са овим моделима како би те могућности претворили у бољу превенцију, брже откривање и ефикаснији одговор на инциденте.

„Захвални смо на сарадњи са OpenAI-јем на овој и другим темама.” Овај инцидент, можда први те врсте, потврђује став у који већ дуго верујемо: безбедност вештачке интелигенције неће решити ниједна појединачна компанија која ради у тајности. „То ће бити решено јавно, заједничким радом, уз широк приступ вештачкој интелигенцији за сваког браниоца, свуда.”
—Клем Деланг, суоснивач и CEO, Hugging Face

Аутор

OpenAI