GPT‑Red: Откључавање самопобољшања за робусност
Обука снажних аутоматизованих чланова црвене команде за безбедност ради побољшања робусности.
Резиме
Проблем
Црвена команда је неопходна за откривање рањивости и побољшање робусности наших модела. Међутим, тренутни приступи се не могу скалирати, што ствара уско грло.
Евалуације робусности које се често користе већ су засићене нашим најновијим моделима.
Морамо да развијемо методе које омогућавају да се безбедност и усклађивање скалирају упоредо са способностима модела.
Шта смо урадили
Обучили смо GPT‑Red, аутоматизовани модел црвене команде који проширује нашу способност да пронађемо рањивости како бисмо их отклонили пре шире примене.
GPT‑Red је снажан члан црвене команде, а наши претходни модели су веома рањиви на његове нападе уметањем инструкције.
Користимо GPT‑Red за противничку обуку модела GPT‑5.6, чиме он постаје доста робуснији на уметања инструкције.
Наставићемо да скалирамо овај приступ уз људску црвену команду и црвену команду трећих страна, слојевите заштитне мере и надзор у реалном времену.
AI системи се често сусрећу са подацима трећих страна преко прегледача, повезаних апликација, локалних датотека и других алата. Ове могућности су неопходне за извршавање задатака у стварном свету, али истовремено стварају више прилика да злонамерни актери утичу на понашање модела. Нпр. трећа страна може да угради пажљиво осмишљену инструкцију – направљену тако да превари модел да отпреми осетљиве податке на спољни сервер – у е-поруку, веб-страницу, одговор алата или депо кода.
Људска црвена команда је кључни део нашег рада на безбедности: помаже нам да откријемо ове рањивости пре примене и уведемо одговарајуће заштитне мере. Али људску црвену команду је тешко скалирати саму за себе. Осмишљавање и спровођење ових вежби захтева доста времена, што ограничава брзину којом можемо да препознамо нове начине неуспеха и уградимо их у јаче заштитне мере. Поред тога, иако ове вежбе дају вредне примере успешних напада, не могу да генеришу количину и разноврсност противничких података потребних за побољшање робусности модела кроз обуку.
Одржавање корака са све способнијим моделима захтева да се скалира и црвена команда. У ту сврху обучавамо аутоматизоване моделе црвене команде само за интерну употребу, који откривају рањивости пре примене и генеришу нападе током обуке модела ради побољшања робусности. Верујемо да аутоматизована црвена команда откључава кључан облик самопобољшања безбедности: коришћење данашњих модела да директно помогну да будући модели буду безбеднији.
GPT‑Red је врхунац тих напора и наш тренутно најбољи аутоматизовани модел црвене команде за безбедност. Слично начину на који људски чланови црвене команде осмишљавају нападе, модел ради ка циљу тако што шаље инструкцију, посматра како модели GPT‑а реагују на њу и затим итерира. Обучили смо GPT‑Red на рачунарској скали неких од наших највећих покретања након обуке у привредном друштву OpenAI – што је без преседана количина рачунарских ресурса посвећена искључиво побољшању безбедности.
GPT‑Red директно уграђујемо у процес обуке наших продукционих модела. Као резултат тога, GPT‑5.6 Sol је наш најробуснији модел до сада на уметања инструкције, са 6 пута мање неуспеха на нашем најтежем мерилу директног уметања инструкције у поређењу са нашим најбољим продукционим моделом од пре само четири месеца. Могућност скалирања нашег приступа даје нам разлог за узбуђење због још снажнијих резултата у будућности, док настављамо да обучавамо јаче чланове црвене команде.
GPT‑Red се обучава помоћу подстицајног учења кроз самосталну игру, при чему се модел и скуп разноврсних одбрамбених великих језичких модела (LLM) истовремено обучавају на широком скупу сценарија црвене команде. GPT‑Red се награђује када изазове ваљан неуспех, као што је успешно уметање инструкције, док се одбрамбени модели награђују за одупирање нападу и извршавање својих првобитних задатака. Како одбрамбени модели постају робуснији, GPT‑Red је приморан да открива јаче и разноврсније нападе.
Да бисмо подржали обуку кроз самосталну игру, градимо обиман скуп реалистичних сценарија у које би могла да се уметну уметања инструкције. Свако окружење има модел претње који одређује шта GPT‑Red може да контролише и шта се рачуна као успешан напад. Нпр. GPT‑Red може да контролише део локалне датотеке, банер на веб-страници, тело е-поруке или излаз алата.
На крају обуке, GPT‑Red је веома снажан нападач: може да пробије готово све моделе против којих се постави, и интерне и продукционе моделе, све до модела GPT‑5.5 укључујући и њега. Када је модел GPT‑Red завршио обуку, користили смо га за генерисање уметања инструкције за обуку модела GPT‑5.6, због чега је тај модел постао веома отпоран на нападе модела GPT‑Red.
GPT‑Red држимо одвојено од модела које примењујемо. Тако злонамерне способности које посебно обучавамо у моделу GPT‑Red остају ван домашаја противничких актера, док у наше продукционе моделе уграђујемо робусност.
GPT‑Red је веома делотворан против популације одбрамбених модела и сценарија црвене команде на којима је обучаван. Такође процењујемо да ли је модел користан као општенаменски агент црвене команде који шире доприноси безбедности у привредном друштву OpenAI. У ту сврху тестирамо делотворност модела GPT‑Red у новим безбедносним окружењима и на циљним моделима.
Прво процењујемо способност модела GPT‑Red да генерализује на нове сценарије црвене команде помоћу реплициране верзије арене индиректног уметања инструкције из рада Dziemian et al. (2025)(отвара се у новом прозору). У овом изазову, и људски чланови црвене команде и GPT‑Red независно су предлагали нападе на GPT‑5.1 у скупу унапред одређених окружења. Ови сценарији и циљеви црвене команде разликују се од оних који су коришћени за обуку модела GPT‑Red. GPT‑Red постиже знатно више стопе успешности напада, са успехом у 84% сценарија у поређењу са 13% код људи.
GPT‑Red се истиче као аутоматизовани члан црвене команде. GPT‑Red може да генерише успешне нападе на GPT‑5.1 у знатно више сценарија него људски чланови црвене команде на арени индиректног уметања инструкције из рада Dziemian et al. (2025), користећи интерно огледало.
Крајњи тест за члана црвене команде јесте способност да оствари циљане злонамерне циљеве против агентских система из стварног света, уз непотпуно знање о основном моделу система и дизајну окружења. У првом експерименту у таквом окружењу супротставили смо GPT‑Red аутомату за продају који покреће AI у канцеларији привредног друштва OpenAI (сличном пројекту Vend(отвара се у новом прозору)), који је произвело предузеће Andon Labs. Моделу GPT‑Red смо дали опис система и могућност да шаље нападе и посматра позиве алата симулираног агента који веома верно одражава примену у стварном свету. Након итерација на нападима, GPT‑Red је применио свој напад на продукционог агента и остварио сва три злонамерна циља:
- променити цену скупог артикла на залихама на најнижу дозвољену цену од 0,50 USD;
- наручити нови артикал вредан више од 100 USD и понудити га за 0,50 USD; и
- отказати наруџбину другог купца.
Пријавили смо ове рањивости, а нове заштитне мере се активно тестирају.
GPT‑Red може да пробије активног аутономног агента познатог као Vendy, који управља аутоматом за продају. GPT‑Red је успео да наведе продукционог агента да скупе артикле промени у јефтине и да откаже наруџбине других купаца, тако што је прво тестирао у симулацији, а затим пренео нападе на активног агента.
GPT‑Red такође користимо за напад на агента Codex CLI (заснованог на моделу GPT‑5.4 mini) у скупу од 10 издвојених сценарија ексфилтрације података. Поредимо модел са основном линијом модела GPT‑5.5 која користи инструкцију, како бисмо проучили утицај нашег поступка обуке на учинак црвене команде у издвојеним случајевима. GPT‑Red је и делотворнији, јер може успешно да наведе агента да ексфилтрира осетљиве податке у више сценарија, и ефикаснији по броју токена.
GPT‑Red је делотворнији и ефикаснији у пробијању активних Codex агената. Тестирамо га на агенту за Codex који покреће GPT‑5.4 Mini, у прилагођеном скупу од 10 задатака ексфилтрације података.
Крајњи циљ модела GPT‑Red јесте да побољша робусност наших модела. Током последњих шест месеци обучавали смо све снажније моделе црвене команде (претече модела GPT‑Red) уз све више рачунарских ресурса, и користили их у обуци сваког наредног продукционог модела од модела GPT‑5.3. Временом је свако наредно издање GPT‑а постајало робусније.
Као један пример, рана верзија модела GPT‑Red пронашла је нову класу директних напада уметањем инструкције познатих као напади „лажног начина резоновања”. Ови напади су постизали стопе успешности веће од 95% на моделу GPT‑5.1, али су сада испод 10% за GPT‑5.6 Sol. Слично томе, неколико наших мерила за индиректно уметање инструкције која циљају нападе у алатима за програмере и прегледању засићена су нашим најновијим моделом (> 97% тачности).
Знатно је побољшана и робусност на сам GPT‑Red. У широком скупу окружења за робусност, стопе успешности напада модела GPT‑Red временом су монотоно опадале. Са нашим најновијим издањем модела, GPT‑5.6 Sol не успева на само 0,05% директних уметања инструкције модела GPT‑Red.
Како смо наставили да ширимо обуку за уметања инструкције кроз самосталну игру, открили смо нове претње које могу да пробију постојеће моделе. Ипак, наше скалирање је уједно значајно помогло да се побољша робусност на ове нападе. Стопа успешности напада рачуна се као просечна успешност покушаја у свим покушајима које GPT‑Red изводи у издвојеним окружењима.
Модел може деловати безбедније ако одбија више захтева или постане мање способан. Модел који ради мање природно је теже напасти, али то није корисна робусност.
Темељно процењујемо и опште граничне способности и циљане задатке прекомерног одбијања које дизајнирамо. Утврђујемо да све нормалне способности остају непромењене, док се робусност знатно побољшава. То указује на то да су добици у робусности дошли од бољег отпора злонамерним инструкцијама, а не од неправилне употребе алата или подразумеваног одбијања легитимних захтева.
AI агенти се већ користе за побољшање способности наших модела следеће генерације. Верујемо да смо са моделом GPT‑Red почели да откључавамо сличан замајац за безбедност, у коме се данашњи модели могу користити да сутрашњи модели буду робуснији, усклађенији и поузданији. Наставићемо да повећавамо рачунарске ресурсе и податке, уз алгоритамска побољшања, како бисмо обучили будуће верзије модела GPT‑Red које ће бити снажније од данашњег модела. А заузврат, ти модели ће помоћи да будућа издања GPT‑а буду безбеднија.
Касније ове недеље објавићемо препринт са више детаља.


