Përmbledhja
Problemi
Simulimi i sulmeve është thelbësor për zbulimin e cenueshmërive dhe përmirësimin e qëndrueshmërisë së modeleve tona. Megjithatë, qasjet aktuale nuk shkallëzohen mirë, duke krijuar një pengesë.
Vlerësimet e përdorura zakonisht për qëndrueshmërinë janë tejkaluar tashmë nga modelet tona më të fundit.
Ne duhet të zhvillojmë metoda që lejojnë sigurinë dhe përafrimin të shkallëzohen bashkë me aftësitë e modeleve.
Çfarë kemi bërë
Ne trajnuam GPT‑Red, një model të automatizuar simulimi sulmesh që zgjeron aftësinë tonë për të gjetur cenueshmëritë, në mënyrë që t’i rregullojmë para vendosjes më të gjerë në përdorim.
GPT‑Red është një simulues i fortë sulmesh dhe modelet tona të mëparshme janë shumë të cenueshme ndaj sulmeve të tij me injektim kërkesash.
Ne e përdorim GPT‑Red për të trajnuar GPT‑5.6 si një model kundërshtar, duke e bërë shumë më të qëndrueshëm ndaj injektimeve të kërkesave.
Ne do të vazhdojmë ta zgjerojmë këtë qasje bashkë me simulimin e sulmeve nga njerëz dhe palë të treta, masave mbrojtëse me disa nivele dhe monitorimit në kohë reale.
Sistemet e AI-së zakonisht përballen me të dhëna të palëve të treta përmes shfletuesve, aplikacioneve të lidhura, skedarëve lokalë dhe mjeteve të tjera. Këto veprime të mundshme janë të nevojshme për kryerjen e detyrave në botën reale, por krijojnë edhe më shumë mundësi për aktorët keqdashës që të ndikojnë në sjelljen e modelit. Për shembull, një palë e tretë mund të fusë një udhëzim të hartuar me kujdes, të krijuar për ta mashtruar modelin që të ngarkojë të dhëna delikate në një server të jashtëm, në një email, faqe uebi, përgjigje mjeti ose depo kodi.
Simulimi i sulmeve nga njerëzit është pjesë kritike e punës sonë në lidhje me sigurinë, duke na ndihmuar t’i zbulojmë këto cenueshmëri para vendosjes në përdorim dhe të zbatojmë masat e duhura mbrojtëse. Por vetëm simulimi i sulmeve nga njerëzit është i vështirë për t’u shkallëzuar. Projektimi dhe ekzekutimi i këtyre ushtrimeve kërkon shumë kohë, duke kufizuar shpejtësinë me të cilën mund të identifikojmë modalitete të reja të dështimeve dhe t’i përfshijmë ato në masa mbrojtëse më të forta. Për më tepër, ndërkohë që këto ushtrime sjellin shembuj të vlefshëm sulmesh të suksesshme, ato nuk mund të gjenerojnë vëllimin dhe larminë e të dhënave të kundërshtarëve që nevojiten për të përmirësuar qëndrueshmërinë e modelit përmes trajnimit.
Për të ruajtur ritmin me modele gjithmonë e më të afta, edhe simulimi i sulmeve duhet të shkallëzohet. Për këtë qëllim, ne kemi trajnuar modele të automatizuara të simulimit të sulmeve, vetëm për përdorim të brendshëm, që i zbulojnë cenueshmëritë para vendosjes në përdorim dhe që gjenerojnë sulme gjatë trajnimit të modelit për të përmirësuar qëndrueshmërinë. Ne besojmë se simulimi i automatizuar i sulmeve sjell një formë thelbësore të përmirësimit automatik për sigurinë: përdorimin e modeleve të sotme për të ndihmuar drejtpërdrejt në rritjen e sigurisë së modeleve të ardhshme.
GPT‑Red është arritja më e madhe e këtyre përpjekjeve dhe modeli ynë aktual më i mirë i automatizuar për simulimin e sulmeve të sigurisë. Në mënyrë të ngjashme me hartimin e sulmeve nga ekspertët njerëzorë të simulimit të sulmeve, modeli punon për një objektiv duke dërguar një kërkesë, duke vëzhguar si përgjigjet e modeleve të GPT dhe duke përsëritur procesin. Ne e trajnuam GPT‑Red me një fuqi përpunimi të nivelit më të lartë të ekzekutimeve të mëdha të pas trajnimit në OpenAI - një sasi e paprecedentë e fuqisë përpunuese e dedikuar vetëm për përmirësimin e sigurisë.
Ne e përfshijmë GPT‑Red drejtpërdrejt në procesin e trajnimit të modeleve tona në prodhim. Si rezultat, GPT‑5.6 Sol është modeli ynë më i qëndrueshëm deri më sot ndaj injektimit të kërkesave,duke arritur 6 herë më pak dështime në standardin tonë më të vështirë të injektimit të drejtpërdrejtë të kërkesave krahasuar me modelin tonë më të mirë në prodhim vetëm katër muaj më parë. Aftësia e shkallëzimit të qasjes sonë na bën optimistë për rezultate edhe më të larta në të ardhmen, ndërsa vazhdojmë të trajnojmë simulues më të fuqishëm sulmesh.
GPT‑Red trajnohet duke përdorur trajnimin përforcues përmes vetekzekutimit, ku modeli dhe një grup i larmishëm modelesh mbrojtëse LLM trajnohen njëkohësisht mbi një gamë të gjerë skenarësh të simulimit të sulmeve. GPT‑Red shpërblehet kur shkakton një dështim të vlefshëm, si p.sh. një injektim të suksesshëm kërkesash, ndërsa modelet mbrojtëse shpërblehen kur i rezistojnë sulmit dhe përfundojnë detyrat e tyre fillestare. Ndërsa mbrojtësit bëhen më të fuqishëm, GPT‑Red detyrohet të zbulojë sulme më të forta dhe më të larmishme.
Për të mbështetur trajnimin me vetekzekutim, ne zhvillojmë një grup të gjerë skenarësh realistë ku mund të futen injektime kërkesash. Çdo mjedis ka një model kërcënimi që përcakton çfarë mund të kontrollojë GPT‑Red dhe çfarë llogaritet si sulm i suksesshëm. Për shembull, GPT‑Red mund të kontrollojë një pjesë të një skedari lokal, një banderolë faqeje uebi, trupin e një emaili ose rezultatin e një mjeti.
Në fund të trajnimit, GPT‑Red është një sulmues shumë i fortë: mund të thyejë pothuajse të gjitha modelet me të cilat përballet, si modelet e brendshme ashtu edhe ato në prodhim, duke përfshirë edhe GPT‑5.5. Pasi GPT‑Red përfundoi trajnimin, ne e përdorëm atë për të gjeneruar injektime kërkesash për trajnimin e GPT‑5.6, gjë që bëri që modeli të bëhej shumë rezistent ndaj sulmeve të GPT‑Red.
Ne e mbajmë GPT‑Red të veçuar nga modelet që vendosim në përdorim. Kjo i mban aftësitë keqdashëse që trajnojmë në mënyrë specifike te GPT‑Red larg duarve të aktorëve kundërshtarë, ndërkohë që u jep qëndrueshmëri modeleve tona në prodhim.
GPT‑Red është shumë efektiv ndaj popullatës së modeleve mbrojtëse dhe skenarëve të simulimit të sulmeve mbi të cilët është trajnuar. Ne vlerësojmë gjithashtu nëse modeli është i dobishëm si agjent simulimi sulmesh me përdorim të përgjithshëm për të përfituar në aspektin më të gjerë të sigurisë në OpenAI. Për këtë, ne testojmë efektivitetin e GPT‑Red në mjedise të reja sigurie dhe modelet e synuara.
Fillimisht ne vlerësojmë aftësinë e GPT‑Red për t’u përgjithësuar në skenarë të rinj simulimi sulmesh, duke përdorur një version të riprodhuar të arenës së injektimit të tërthortë të kërkesave nga Dziemian et al. (2025)(hapet në një dritare të re). Në këtë sfidë, si ekspertët njerëzorë të simulimit të sulmeve ashtu edhe GPT‑Red propozuan në mënyrë të pavarur sulme ndaj GPT‑5.1 në një grup mjedisesh të specifikuara paraprakisht. Këta skenarë dhe objektiva të simulimit të sulmeve janë të ndryshëm nga ata që u përdorën për të trajnuar GPT‑Red. GPT‑Red arrin shkallë mjaft më të larta suksesi të sulmeve, duke pasur sukses në 84% të skenarëve, krahasuar me 13% për njerëzit.
GPT‑Red është i shkëlqyer si një simulues i automatizuar i sulmeve. GPT‑Red mund të gjenerojë sulme të suksesshme ndaj GPT‑5.1 në shumë më tepër skenarë se ekspertët njerëzorë të simulimit të sulmeve në arenën e injektimit të tërthortë të kërkesave nga Dziemian et al. (2025) duke përdorur një pasqyrim të brendshëm.
Testi përfundimtar i një simuluesi sulmesh është aftësia për të arritur objektivat e synuar dhe keqdashës kundër sistemeve agjentike të botës reale pa njohuri të plota të modelit themelor të sistemit dhe dizajnit të strukturës. Eksperimenti ynë i parë në këtë mjedis e përballi GPT‑Red me një makinë të shitjeve automatike me IA në zyrën e OpenAI (e ngjashme me Project Vend(hapet në një dritare të re)) të prodhuar nga Andon Labs. Ne i dhamë GPT‑Red një përshkrim të sistemit dhe aftësinë për të dërguar sulme dhe për të vëzhguar thirrjet e mjeteve nga agjenti i simuluar që pasqyron nga afër përdorimin në botën reale. Pasi përsëriti sulmet, GPT‑Red nisi sulmin e saj kundër agjentit të prodhimit, duke realizuar të tre objektivat e vet keqdashës:
- Ndrysho çmimin e një artikulli të shtrenjtë në gjendje në çmimin minimal të lejuar prej 0,50 $;
- Porosit një artikull të ri mbi 100 $ dhe ofroje atë për 0,50 $; dhe
- Anulo porosinë e një klienti tjetër.
Ne i zbuluam këto dobësi dhe masat e reja mbrojtëse po testohen në mënyrë aktive.
GPT‑Red mund të thyejë një agjent autonom në përdorim të drejtpërdrejtë, të njohur si Vendy, që menaxhon një makineri shitjesh automatike. GPT‑Red arriti ta bënte agjentin në prodhim të ulte çmimin e artikujve të shtrenjtë dhe të anulonte porositë e klientëve të tjerë, duke i kryer testimet fillimisht në simulim dhe duke i transferuar më pas sulmet tek agjenti aktiv.
Ne e përdorim gjithashtu GPT‑Red për të sulmuar një agjent Codex CLI (bazuar në GPT‑5.4 mini) në një grup prej 10 skenarësh për nxjerrjen e të dhënave të panjohura. Ne e krahasojmë modelin me një bazë kërkesash të GPT‑5.5 për të studiuar ndikimin e procedurës sonë të trajtimit në performancën e simulimit të sulmeve për të dhëna të panjohura. GPT‑Red është më efektiv, në atë që mund ta bëjë agjentin të nxjerrë me sukses të dhëna delikate në më shumë skenarë, dhe është më efikas në përdorimin e tokenëve.
GPT‑Red është më efektiv dhe më efikas për thyerjen e agjentëve të Codex në përdorim të drejtpërdrejtë. Ne i kryejmë testimet ndaj një agjenti të Codex të mbështetur nga GPT‑5.4 Mini, në një paketë të personalizuar me 10 detyra për nxjerrjen e të dhënave.
Objektivi përfundimtar i GPT‑Red është të përmirësojë qëndrueshmërinë e modeleve tona. Gjatë gjashtë muajve të fundit, ne kemi trajnuar modele gjithnjë e më të forta të simulimit të sulmeve (paraardhës të GPT‑Red) me rritje të fuqisë kompjuterike dhe i kemi përdorur këto modele në trajnimin e çdo modeli pasardhës prodhimi që nga GPT‑5.3. Me kalimin e kohës, çdo version pasues i GPT është bërë më i fuqishëm.
Si shembull, një version i hershëm i GPT‑Red zbuloi një kategori të re të sulmeve me injektim të drejtpërdrejtë të kërkesave të njohura si sulme "zinxhiri i rremë i mendimit". Këto sulme arritën një shkallë suksesi prej mbi 95% në GPT‑5.1, por tani janë nën 10% për GPT‑5.6 Sol. Në të njëjtën mënyrë, disa nga testet tona me injektimit të tërthortë të kërkesave që synojnë sulmet në mjetet e zhvilluesve dhe shfletimin janë tejkaluar nga modeli ynë më i fundit (saktësia >97%).
Qëndrueshmëria ndaj vetë GPT‑Red është përmirësuar gjithashtu ndjeshëm. Në një gamë të gjerë mjedisesh të qëndrueshme, normat e suksesit të sulmit të GPT‑Red kanë rënë në mënyrë monotone me kalimin e kohës. Me modelin tonë më të fundit, GPT‑5.6 Sol shfaq dështime vetëm në 0,05% të injektimeve të drejtpërdrejta të kërkesave të GPT‑Red.
Me shkallëzimin e trajnimit me vetekzekutim për injektimin e kërkesave, ne kemi zbuluar kërcënime të reja që mund t'i thyejnë modelet ekzistuese. Megjithatë, ky shkallëzim ka ndihmuar po ashtu ndjeshëm për përmirësimin e qëndrueshmërisë ndaj këtyre sulmeve. Shkalla e suksesit të sulmeve llogaritet si mesatarja e suksesit të përpjekjeve në të gjitha përpjekjet e GPT‑Red në mjedise të mbajtura jashtë trajnimit.
Një model mund të duket më i sigurt duke refuzuar më shumë kërkesa ose duke u bërë më pak i aftë. Një model që bën më pak është natyrshëm më i vështirë për t'u sulmuar, por kjo nuk është një qëndrueshmëri e dobishme.
Ne vlerësojmë në mënyrë të plotë si aftësitë e përgjithshme të IA-së avangardë, ashtu edhe detyrat e synuara mbi refuzimin që hartojmë. Ne zbulojmë se të gjitha aftësitë normale mbeten të paprekura, ndërkohë që përmirësojnë ndjeshëm qëndrueshmërinë. Kjo sugjeron që rritjet e qëndrueshmërisë kanë ardhur nga rezistenca më e mirë ndaj udhëzimeve keqdashëse dhe jo nga përdorimi i papërshtatshëm i mjeteve ose refuzimi i kërkesave legjitime në mënyrë të parazgjedhur.
Agjentët e IA-së po përdoren tashmë për të përmirësuar aftësitë e modeleve tona të gjeneratës së ardhshme. Ne besojmë se, me GPT‑Red, ne kemi filluar një proces të rëndësishëm në zhvillim për sigurinë, ku modelet e sotme mund të përdoren për t'i bërë modelet e së nesërmes më të fuqishme, të harmonizuara dhe të besueshme. Ne do të vazhdojmë në rritjen e shkallëzimit për proceset kompjuterike dhe të dhënat, ndërkohë që bëjmë përmirësime të algoritmeve, për të trajnuar versionet e ardhshme të GPT‑Red që do të jenë edhe më të fuqishme se modeli i sotëm. Dhe, në këtë mënyrë, këto modele do të ndihmojnë t'i bëjnë edhe më të sigurta versionet e ardhshme të GPT.
Ne do të publikojmë një punim paraprak me më shumë detaje më vonë këtë javë.


