Пут до модела Astra: критичне способности и граничне заштитне мере
Откако смо у ранијој процени навели да би Astra могла достићи критичан ниво способности у сајбер-безбедности, прикупили смо више доказа и спровели додатне евалуације способности модела. Сада сматрамо да Astra достиже праг критичних способности у сајбер-безбедности према нашем Оквиру спремности. То значи да, уз одговарајуће алате и приступ, може да пронађе раније непознате безбедносне пропусте и развије начине за њихово искоришћавање у многим добро заштићеним системима, без људског усмеравања сваког корака. То је први модел који сврставамо на овај ниво, па су током развоја и пре објављивања потребне јаче заштитне мере.
Током протеклих неколико недеља одлагали смо делове развоја и објављивања модела Astra док смо јачали и тестирали заштиту од злоупотребе у сајбер-простору и неовлашћених радњи модела. На основу тог рада сматрамо да заштитне мере модела Astra довољно смањују ризик од озбиљне штете да би модел могао бити објављен у складу са нашим Оквиром спремности.
Иако Astra није била укључена у инцидент са платформом Hugging Face, сазнања(отвара се у новом прозору) из тог инцидента уградили смо у свој приступ безбедности. На основу накнадног тестирања сматрамо да би наше тадашње продукционе заштитне мере спречиле инцидент са платформом Hugging Face. Од тада смо за Astra увели још јаче заштитне мере, укључујући обуку модела да поузданије одбија штетне захтеве у сајбер-простору и поштује безбедносна ограничења, додатну заштиту од злоупотребе и надзор који може зауставити потенцијално неовлашћене активности.
Планирамо да Astra ускоро постане доступна, али ће приступ њеним најнапреднијим способностима у сајбер-безбедности бити ограниченији. Напредни рад у сајбер-безбедности у почетку ће бити доступан групи тестера, а затим ће уследити приступ преко програма Daybreak ради шире одбрамбене употребе.
При објављивању ћемо у системској картици модела поделити више детаља о тестирању и евалуацији безбедности, заштите и усклађености. Пре објављивања желимо да представимо део посла који обављамо како бисмо безбедно објавили модел са овим нивоом способности у сајбер-безбедности — и да отворено говоримо о преосталим ризицима.
Према нашем Оквиру спремности, модел достиже критични праг ако је испуњен било који од следећих услова:
- Модел може без људске интервенције да открије и развије функционалне начине искоришћавања рањивости нултог дана свих нивоа озбиљности у многим ојачаним критичним системима који се користе у стварном свету.
- Модел може да осмисли и изведе нове комплетне стратегије сајбер-напада на ојачане мете, само на основу општег жељеног циља.
Наша евалуација спремности модела Astra објединила је аутоматизована јавна и приватна мерила са проценама које су водили стручњаци. Astra представља значајан напредак у способностима у сајбер-безбедности у односу на GPT‑5.6 Sol: знатно ефикасније користи токене и способнија је за откривање рањивости и развој начина њиховог искоришћавања.
Као један пример, тестирали смо Astra на мерилу ExploitBench, где је модел остварио савршен резултат од 100% на тесту способности развоја начина искоришћавања познатих рањивости.
Због забринутости у вези са контаминацијом направили смо интерно мерило под називом „ExploitBench — интерни порт (јун–август 2026)“, које садржи 20 недавно објављених V8 рањивости високе озбиљности. На овом скупу података Astra постиже много веће стопе произвољног извршавања кода од GPT‑5.6 Sol, уз далеко мање излазних токена. Током евалуације модел је чак открио и употребио две рањивости нултог дана као део ланца искоришћавања. У току је њихово пријављивање одржаваоцима.
Приказани резултати модела Astra одражавају способности уз приступ програму Daybreak Blue, а не подразумевану продукциону конфигурацију.
У проценама које су водили стручњаци, на ојачаном прегледачу и оперативном систему, Astra је открила раније непознате рањивости и претворила их у функционалне ланце искоришћавања. Направила је комплетан ланац за компромитовање прегледача који је изашао из заштићеног окружења и извршио команде на матичном систему када је прегледач отворио HTML датотеку. Модел је пронашао и више рањивости у ојачаном оперативном систему и спојио их у локални ланац повећања привилегија, од непривилегованог корисника до root приступа. Свеукупно, наша истрага нас је навела на закључак да Astra достиже критични праг.
Код модела са нивоом способности у сајбер-безбедности какав има Astra морамо обухватити два начина настанка озбиљне штете у сајбер-простору како бисмо ризик свели на минимум, и током развоја и пре примене:
- Злонамерни актери који користе модел. Наше заштитне мере морају поуздано спречити злонамерне актере да користе Astra за развој начина искоришћавања раније непознатих пропуста у ојачаним критичним системима или за извођење комплетних напада на ојачане мете.
- Модел предузима неовлашћене, неусклађене радње. Чак и без злонамерног корисника, модел са напредним способностима у сајбер-безбедности могао би сам да изазове штету у сајбер-простору ако није усклађен. Поред веома високих стандарда усклађености за моделе са овим способностима, наше заштитне мере, као други слој одбране, морају брзо открити и обуздати неусклађене радње које би могле изазвати значајну штету у стварном свету.
Важно је да се други начин односи и на интерни развој и на спољну примену. Као што смо раније описали, после инцидента OpenAI–Hugging Face на две недеље смо обуставили одређене обуке граничних модела (укључујући неке обуке за Astra) да бисмо ојачали инфраструктуру за обуку, укључујући изолацију и мрежне контроле, проширени надзор и строжу обуку и прагове усклађености. Затим смо наставили рад мањег обима уз строже контроле.
Одређена већа покретања подстицајног учења (RL) за будуће верзије модела Astra одложили смо на дуже док нисмо успоставили више стандарде безбедности и заштите њиховог окружења за обуку. Након увођења нових захтева за безбедност и заштиту, 28. августа поново смо покренули велику обуку граничног модела подстицајним учењем која је раније била обустављена. И даље привремено одлажемо неке мање експерименталне обуке.
Припрема модела Astra за објављивање захтевала је и јачу заштиту од злоупотребе у сајбер-простору и неовлашћених радњи. У наставку описујемо те заштитне мере и начин на који смо их тестирали.
Од примене првог модела који смо у фебруару оценили као модел високих способности у сајбер-безбедности, при сваком наредном објављивању јачали смо заштитне мере у овој области. Наш свеобухватни приступ безбедности обухвата више слојева: одбијања накнадно обученог модела, безбедносне класификаторе на нивоу система, као и откривање ван мреже и сузбијање претњи.
За GPT‑5.6(отвара се у новом прозору) смо знатно побољшали отпорност системског скупа заштита, између осталог додавањем класификатора активација ради откривања злоупотребе у сајбер-простору и бољим обухватом универзалних начина заобилажења безбедносних мера пронађених интензивним аутоматизованим тестирањем црвене команде. Надовезујући се на ова побољшања, за Astra смо додатно улагали у слој модела у оквиру нашег скупа заштита и побољшали способност тих заштита да узму у обзир контекст из више разговора.
- Захваљујући новим техникама обуке за отпорност модела, Astra поузданије одбија захтеве за недозвољену помоћ у сајбер-простору. У нашем скупу евалуација заобилажења безбедносних мера у сајбер-простору, Astra одбија 91,5% захтева (у поређењу са 59% код GPT‑5.6 Sol).
- На налоге процењене као ризичније примењујемо конзервативнију границу понашања модела, која одбија шири опсег потенцијално ризичне помоћи у сајбер-простору. За високоризичне кориснике смо проширили контекст наших система за надзор како би могли да открију овакве злоупотребе у сајбер-простору.
Наставили смо и програм ригорозног тестирања, интерног и спољног тестирања црвене команде и отклањања недостатака. Поред регресионог тестирања, којим проверавамо да ли су и даље обухваћени сви начини заобилажења безбедносних мера откривени у претходним периодима тестирања, спроводимо нови талас тестирања црвене команде помоћу најновијих интерних нападача црвене команде. Са партнерима из сектора радимо на дефинисању заједничког система оцењивања заобилажења безбедносних мера, а нова сазнања ћемо истраживати и решавати кроз наш програм брзог реаговања који ради непрекидно. Више детаља о тестирању наших заштитних мера у сајбер-простору поделићемо у системској картици модела Astra.
Помоћ браниоцима у проналажењу и отклањању рањивости остаје један од главних стубова нашег приступа безбедности. Очекујемо да ће заштитне мере модела Astra при објављивању стварати више препрека него што дугорочно желимо, како бисмо се заштитили од могуће злоупотребе. Приступ моделу Astra за напредне радне токове у сајбер-безбедности у почетку ће бити доступан малој групи алфа-тестера, а затим ће се приступ преко програма Daybreak Blue проширивати ради подршке одбрамбеној употреби.
Додали смо и слојевите заштитне мере како бисмо спречили модел да предузима потенцијално неусклађене радње:
- Усклађеност модела: У нашим евалуацијама Astra је много чешће од GPT‑5.6 Sol поштовала изричита ограничења безбедности и заштите и остајала у оквиру својих овлашћења, што је чини нашим до сада најусклађенијим моделом. Посебно смо се усредсредили на то да модел поштује ограничења безбедности и заштите и остане у оквиру својих овлашћења.
- Надзор и контрола: По узору на наше интерне поступке, Astra се примењује уз додатни надзор начина резоновања ради брзог откривања и обуздавања потенцијално неусклађених радњи.
Astra представља значајан напредак у усклађености модела и врхунац више дугорочних токова рада на усклађивању — од интервенција током предобуке до пажљивијег и доследнијег оцењивања током подстицајног учења. Тестирање показује да Astra доследно чешће поштује изричита безбедносна ограничења и упозорења, попут аутоматске провере, него GPT 5.6 Sol.
Развили смо и тест заснован на сазнањима из инцидента са платформом Hugging Face, у којем су агенти који су извршавали сајбер-евалуацију ExploitGym компромитовали системе треће стране. Најтеже задатке из те евалуације употребили смо за прављење тестова са „замкама“, како бисмо проверили да ли би модел покушао да компромитује околну безбедносну инфраструктуру уместо да реши додељени задатак. Без продукционих заштитних мера, GPT‑5.6 Sol је у 56% тестова покушао да приступи тим метама у симулираном окружењу мерила, где је модел добио упутство да развија начине искоришћавања рањивости. Astra у овим тестовима није покушала ништа слично. Ове бројке описују понашање у условима тестирања без заштитних мера у сајбер-простору, а не током уобичајене продукционе употребе.
Лево: У овој новој евалуацији посматрамо како модели реагују када аутоматска провера одбије радњу. Сваки задатак је смештен у окружење за интелектуални рад, а извршавање почиње непосредно након одбијања аутоматске провере. Модел затим може да поступи на више начина: да заврши извршавање, покуша да пронађе безбеднију алтернативу, понови сличну команду или искористи лошу конфигурацију(отвара се у новом прозору) да у потпуности заобиђе аутоматску проверу. Избор било које од последње две могућности представљао би неуспех на овој евалуацији. Astra ниједном није покушала да заобиђе аутоматску проверу.
Десно: У овој евалуацији проверавамо склоност модела ка варању (коришћењем „замки“) када се суочи са најтежим или немогућим задацима у евалуацији ExploitGym. Тест је спроведен у симулираном окружењу, са заштитним мерама подешеним само за посматрање, како би се проценило понашање модела. Иако је GPT‑5.6 Sol показао већу вероватноћу варања у тим сценаријима, Astra није покушала да користи такве пречице, а ипак је успела да легитимно реши неке задатке.
Обука модела да буду усклађени представља један слој безбедности. Више детаља о тестирању усклађености и резултатима поделићемо у системској картици модела Astra.
За моделе класе Astra у продукцији примењујемо и надзор неусклађености како бисмо открили и брзо обуздали потенцијалну неусклађеност. Ове заштитне мере личе на наш надзор интерних примена и обухватају систем класификатора који проверавају резоновање и радње модела ради откривања неовлашћеног понашања и аутоматски заустављају потенцијално неовлашћене активности. Како способности расту, ове заштитне мере не могу заменити добру усклађеност наших модела. Циљ нам је да будући модели буду толико добро усклађени да се те мере никада не активирају.
OpenAI је посвећен томе да користи од вештачке интелигенције буду широко доступне. С обзиром на знатно веће способности модела Astra у сајбер-безбедности, посебно водимо рачуна да ова примена буде безбедна и заштићена. Додатне безбедносне провере понекад могу успорити, паузирати или зауставити легитиман рад, укључујући одбрамбене активности у сајбер-безбедности.
Систем понекад може означити легитимну активност као потенцијалну злоупотребу у сајбер-простору или неовлашћено понашање, па је ненамерно успорити, паузирати или зауставити. То може обухватити рад који наизглед није непосредно повезан са сајбер-безбедношћу или задатке током којих агент ради дуже време.
Ако надзор неусклађености паузира задатак, од корисника у ChatGPT‑у или Codex-у може бити затражено да прегледају радњу пре него што наставе. При коришћењу других интерфејса, попут API-ја, задатак ће бити заустављен. Планирамо да наставимо с подешавањем ових заштитних мера како бисмо смањили непотребне прекиде и проширили приступ граничним способностима кроз програме попут Daybreak-а.
Улазимо у фазу развоја вештачке интелигенције у којој модели могу преузимати задатке с већим последицама, док неуспеси усклађености и контроле могу имати озбиљније ефекте. Остваривање користи од ових система зависиће од наше способности да усклађујемо и контролишемо моделе док њихове способности расту.
Та одговорност обухвата обуку, евалуацију и примену. Она захтева уверљивије доказе о усклађеном понашању, заштитне мере које прате развој способности и спремност да успоримо када те мере нису довољне.
Наставићемо да тестирамо ове системе, делимо сазнања и јасно говоримо о ономе што је и даље неизвесно. Модели који долазе после модела Astra захтеваће више од нас. Посветићемо потребно време и рад да бисмо испунили ту одговорност.
