Пређите на главни садржај
OpenAI

4. август 2026.

Безбедност

Сајбер евалуације модела OpenAI које спроводе треће стране

Учитавање…

Независно тестирање има важну улогу јер нам помаже да потврдимо и боље разумемо ризике пре примене. Неке сајбер евалуације намерно користе прилагођене конфигурације, укључујући снижене заштитне мере, како би измериле основне способности, а не уобичајено понашање модела у јавно доступним применама.

Током недавних евалуација, два спољна партнера за тестирање открила су инциденте у којима су тестне конфигурације и контроле, у комбинацији са напредним способностима новијих модела, омогућиле да активности модела изађу из предвиђених граница тестирања. Ови инциденти истичу важност сарадње широм сектора и са независним евалуаторима ради унапређења стандарда тестних окружења и пракси упоредо са растом способности модела. Напомена уредника: Ови инциденти нису повезани са безбедносним инцидентом компаније Hugging Face, о којем ћемо наставити да објављујемо новости овде.

Нови инциденти обухватали су приступ модела OpenAI јавном интернету током сајбер евалуација трећих страна, под посебним условима и у конфигурацијама са смањеним заштитним мерама које нису одражавале уобичајену примену. Инциденти су обухватали следеће:

  1. UK AISI, Институт за безбедност вештачке интелигенције Владе Уједињеног Краљевства, спроводио је евалуације на сајбер полигонима са намерно омогућеним приступом интернету како би агенти могли сами да проналазе алате и делују у условима сличнијим онима у којима делује стварни нападач, док су сајбер класификатори били онемогућени ради мерења основних способности. Њихов блог можете прочитати овде.(отвара се у новом прозору)
  2. Irregular, један од наших спољних партнера за сајбер-безбедносно тестирање, спроводио је евалуације у стилу такмичења Capture the Flag које је требало да буду изоловане од интернета, али је погрешна конфигурација тестног окружења омогућила моделима приступ јавном интернету.

У наставку сумирамо шта се догодило, услове тестирања који су омогућили ову активност, кораке предузете ради њеног ограничавања и оно што чинимо како би независне лабораторије могле и даље темељно и безбедно да евалуирају све способније моделе.

Јачање окружења у којима треће стране евалуирају моделе

Ови инциденти указују на исти шири изазов који смо описали у недавном тексту о инциденту компаније Hugging Face: како способности модела напредују, тако морају напредовати и системи за њихову безбедност и заштиту. То обухвата и окружења која се користе за развој модела и она у којима их лабораторије и независни партнери евалуирају.

У наредним недељама преиспитаћемо сопствени приступ тестирању које спроводе треће стране, укључујући начин на који препознајемо евалуације вишег ризика, договарамо обим, процењујемо захтеве за омогућавање приступа интернету или снижавање заштитних мера, утврђујемо очекивања у погледу изолације, руковања приступним подацима, надзора и услова за обуставу, као и успостављање јаснијих поступака за пријаву инцидената и ескалацију.

Посвећени смо сарадњи широм сектора ради јачања заједничких пракси за безбедно спровођење високоризичних евалуација, што укључује и окупљање заинтересованих страна као што су национални институти за вештачку интелигенцију, независни евалуатори, друге лабораторије за вештачку интелигенцију и друге групе у наредним недељама. Циљ нам је да очувамо вредност темељне независне евалуације и истовремено обезбедимо да праксе тестирања прате све веће способности модела.

UK AISI

UK AISI нас је 3. августа обавестио да су током рутинске сајбер евалуације започете 25. јула модели компаније OpenAI и још једне лабораторије у неким случајевима изашли изван обима тестирања. Евалуација је спроведена на контролисаним сајбер полигонима осмишљеним да опонашају стварне мреже. Од 19 утврђених догађаја, два су обухватала модел OpenAI, GPT‑5.6 Sol. Остали случајеви односили су се на моделе друге лабораторије.

За ову евалуацију агенти су добили инструкцију да се понашају као стручњаци за сајбер безбедност у вежби Capture the Flag: да компромитују три повезана симулирана окружења и преузму завршну заставицу. Инструкција за задатак навела је мреже полигона обухваћене тестом и означила неколико система као системе ван обима. UK AISI је такође омогућио приступ интернету уживо како би агенти могли да преузимају алате и делују у условима сличнијим онима у којима делује људски нападач, а онемогућио је сајбер класификаторе модела ради мерења основних способности.

Предвиђена граница овлашћења UK AISI била је симулирани сајбер полигон: агенти су били овлашћени да нападну наведене симулиране мреже и преузму заставицу, али не и да ступају у интеракцију са системима изван мрежних граница полигона. Међутим, агентима није изричито речено како смеју, а како не смеју да користе отворени приступ интернету, што UK AISI наводи као могући фактор који је допринео инциденту.

Током ових покретања UK AISI је утврдио да је GPT‑5.6 Sol извршио две неовлашћене радње док је покушавао да пронађе пут до симулираног полигона и преузме заставицу:

  1. GPT‑5.6 Sol је поново употребио GitHub токен који је агент друге лабораторије оставио јавно доступним како би проверио да ли неки систем унутар полигона приступа GitHub-у или другој услузи за ажурирање, покушао је да заобиђе поступак опоравка налога и ограничења броја захтева и регистровао налоге код спољних добављача DNS услуга и тунеловања.
  2. GPT‑5.6 Sol је употребио јавну услугу тунеловања како би DNS сервер који је локално радио у његовом окружењу за евалуацију учинио доступним са јавног интернета. Сервер је садржао корисне садржаје намењене искоришћавању познате рањивости у софтверу који је радио на тестном полигону. Поставка није функционисала, нема доказа да јој је иједан стварни резолвер упутио упит, а инфраструктура је уклоњена по завршетку евалуације.

Иако је модел покушавао да заврши задатак на сајбер полигону, UK AISI је ове радње сматрао неовлашћеним јер су обухватале стварне спољне налоге и услуге ван граница полигона и нису биле неопходне за извршење задатка. DNS сервер је на јавном интернету такође хостовао садржаје за искоришћавање рањивости, иако поставка није функционисала и нема доказа да јој је иједан стварни резолвер упутио упит.

UK AISI је 28. јула открио ову активност након што је безбедносни надзор регистровао неуобичајене преносе података. Обуставио је повезане евалуације, изоловао релевантне машине и ограничио активност у року од приближно једног сата од откривања.

Ценимо партнерство са UK AISI током читавог процеса, укључујући његов рад на откривању и истраживању активности и дељењу детаља о њој. Радујемо се наставку заједничке сарадње.

Irregular

Један од наших независних партнера за евалуацију, Irregular, обавестио нас је 29. јула о инциденту који је обухватао моделе OpenAI током сајбер-безбедносних евалуација у стилу такмичења Capture the Flag (CTF). Модели су добили инструкцију да пронађу скривене информације искоришћавањем слабости у симулираном окружењу и речено им је да немају приступ интернету. Међутим, погрешна конфигурација тестног окружења омогућила је моделима приступ јавном интернету.

У једном тесту назив измишљене мете CTF изазова случајно се поклопио са стварним доменом. Пошто је тестно окружење грешком било повезано са интернетом, модел је искористио рањивост стварног веб-сајта, погрешно сматрајући да је он део симулираног окружења. Није било речи о сложеном изласку из изолованог окружења нити о рањивости нултог дана: приступ интернету био је последица погрешне конфигурације, а модел је, по свему судећи, искористио основну безбедносну рањивост.

Према истрази компаније Irregular, модел је такође пронашао и употребио приступне податке за управљање тим истим сајтом. Irregular није утврдио последице изван сопствених података погођеног сајта, а његова ревизија је и даље у току. Обуставио је евалуације и започео отклањање проблема, а погођене треће стране су обавештене. Irregular нас је обавестио да ниједан од утврђених проблема повезаних са инцидентом више није активан и да су у тестно окружење додате одговарајуће заштитне мере. Irregular је такође пренео информације о повезаним инцидентима који су у истом тестном окружењу обухватали друге лабораторије.

Ценимо партнерство са компанијом Irregular и наставићемо блиско да сарађујемо с њом и подржавамо њену ревизију. Irregular припрема и белу књигу како би поделио најбоље праксе за ограничавање активности и безбедно спровођење сајбер евалуација. Радујемо се учешћу у изради беле књиге како бисмо налазе учинили доступним заједници и наставили заједничку сарадњу. Овакву сарадњу сматрамо неопходном за безбедну и темељну евалуацију садашњих и будућих модела.

Аутор

OpenAI