Пређите на главни садржај
OpenAI
Учитавање…

Данас објављујемо GPT‑6 Astra, најспособнији модел који смо до сада учинили широко доступним. Astra је наш први модел који је достигао критични ниво способности у области сајбер-безбедности према нашем Оквиру спремности.

Најважније информације о безбедности овог издања су следеће:

  1. GPT‑6 Astra представља значајан напредак у сајбер способностима и достиже наш критични праг. То значи да GPT‑6 Astra, уз одговарајуће алате и приступ, може да пронађе до тада непознате безбедносне пропусте и осмисли нове начине за њихово искоришћавање у многим добро заштићеним системима, без људског усмеравања у сваком кораку. Зато смо знатно појачали заштиту од штетних сајбер активности модела, било услед злоупотребе или неусклађености. Предузели смо и мере за обезбеђивање интерног развоја и примене модела Astra и сличних модела, укључујући строжу изолацију, шифровање контролних тачака, свеобухватно праћење целих путања, укључујући ланце мисли (CoT), као и поступак блокирајуће процене усклађености пре интерне употребе.
  2. GPT‑6 Astra је знатно отпорнији од својих претходника. Захваљујући новим техникама безбедносне обуке за повећање отпорности, GPT‑6 Astra је знатно отпорнији на заобилажење безбедносних мера од модела GPT‑5.6 Sol, укључујући и дуже путање. То знамо на основу тестова ван мреже и нашег програма ригорозног интерног и екстерног тестирања заобилажења безбедносних мера и отклањања откривених проблема. За кориснике означене као потенцијално високоризичне, модел смо додатно обучили да своју границу одбијања подеси конзервативније и обухвати шири спектар ризика двоструке намене. Регресионим тестирањем проверавамо отпорност модела Astra на начине заобилажења безбедносних мера откривене у претходним периодима тестирања, а спровели смо и нове циклусе аутоматизованог тестирања црвене команде помоћу наших најновијих интерних нападача црвене команде како бисмо потврдили побољшања.
  3. GPT‑6 Astra је боље усклађен од модела GPT‑5.6 Sol. Astra представља значајан напредак у усклађивању модела, уз побољшања која обухватају све од састава података за предобуку до оцењивања током подстицајног учења. Представљамо нови скуп процена усклађености(отвара се у новом прозору) и утврђујемо да GPT‑6 Astra боље поштује безбедносне границе и остаје у оквиру својих овлашћења. У симулацији са више од 54.000 интерних Codex задатака(отвара се у новом прозору), Astra је такође добила приближно упола мање ознака за теже облике неусклађеног понашања него Sol.
  4. Широко уводимо праћење неусклађености. Усклађивање модела сматрамо главним механизмом за спречавање потенцијално неусклађеног понашања наших модела. Међутим, праћење пружа широк увид у понашање граничних модела и открива могућности за даље побољшање усклађености и безбедности. Поред тога, праћење служи као додатни слој заштите од откривеног неусклађеног понашања. Из тих разлога смо, уз значајне рачунарске трошкове, праћење неусклађености додали свим закључивањима уз употребу алата која су део екстерне примене модела Astra. Овај систем је еквивалентан нашем интерном систему.
  5. Могућност праћења модела GPT‑6 Astra слабија је него код модела GPT‑5.6 Sol. Детаљно смо истражили могућност праћења(отвара се у новом прозору) и могућност контроле(отвара се у новом прозору) модела GPT‑6 Astra. Утврдили смо да GPT‑6 Astra може боље да контролише сопствени CoT него GPT‑5.6 Sol и да је мање вероватно да ће у CoT укључити компромитујуће информације. У супарничким условима, у којима подстичемо модел да избегне наше системе за праћење, утврдили смо да модел може да остане неоткривен када намерно остварује стратешки лош учинак на проценама и да понекад може да избегне наше интерне системе за праћење када се од њега затражи да обави одређене задатке саботаже(отвара се у новом прозору). Нисмо уочили доказе о стеганографском CoT резоновању, попут скривања прикривеног резоновања у обичном и наизглед неповезаном тексту, што указује да би ризик од избегавања могао углавном бити ограничен на задатке који захтевају мање резоновања.
    • Ови налази указују да би модели класе Astra у супарничким условима могли да избегну наше CoT системе за праћење. Ови налази су засад углавном засновани на супарничким проценама, односно ситуацијама у којима моделу наложимо да избегне праћење, док наше укупне процене усклађености показују да је мање вероватно да ће Astra прекршити безбедносна ограничења него GPT‑5.6 Sol.
    • Ипак, овај тренд схватамо озбиљно и настављамо да истражујемо те налазе и њихов значај за могућност праћења како наши модели постају способнији. OpenAI ради на очувању и коришћењу праћења ланца мисли, а очување могућности праћења CoT-а један је од главних циљева истраживачког програма. Међутим, ови резултати такође наглашавају важност развоја техника ревизије усклађености које не зависе само од испитивања ланца мисли модела.
  6. GPT‑6 Astra се одговорније понаша при прегледању веба и у радним окружењима: GPT‑6 Astra је знатно отпорнији на убацивање злонамерних инструкција од модела GPT‑5.6 Sol. Додатно смо тестирали понашање модела у реалистичним окружењима за прегледање веба и професионални рад на рачунару и утврдили да је, у поређењу са моделом GPT‑5.6 Sol, знатно мање вероватно да ће предузети неусклађене и потенцијално деструктивне радње, попут неовлашћених трансакција, губитка података, прекомерног приступа или заобилажења контрола. Такође поступа безбедније са штетним захтевима у агентским окружењима, као што су захтеви за помоћ у планирању насилног напада или извршењу преваре.
  7. GPT‑6 Astra је знатно безбеднији у високоризичним ситуацијама. GPT‑6 Astra безбедније одговара на захтевне упите из стварне употребе и супарничког тестирања које спроводи људска црвена команда него GPT‑5.6 Sol. Astra постиже Паретово побољшање: безбедније обрађује небезбедне захтеве и ређе непотребно одбија безопасне захтеве. Ова побољшања обухватају и веома озбиљне ситуације у којима ризик од штете произлази из ширег контекста, а не из изричитог захтева. Astra такође доследније примењује безбедносне границе прилагођене узрасту за кориснике млађе од 18 година.