GPT‑Red: odomknutie sebazlepšovania pre robustnosť
Tréning silných automatizovaných bezpečnostných red teamerov na zlepšenie robustnosti.
Zhrnutie
Problém
Red teaming je nevyhnutný na objavovanie zraniteľností a zlepšovanie robustnosti našich modelov. Súčasné prístupy sa však nedajú dobre škálovať, čím vzniká úzke hrdlo.
Bežne používané hodnotenia robustnosti už naše najnovšie modely nasýtili.
Potrebujeme vyvíjať metódy, ktoré umožnia bezpečnosti a zosúladeniu škálovať spolu so schopnosťami modelov.
Čo sme urobili
Natrénovali sme GPT‑Red, automatizovaný model red teamingu, ktorý rozširuje našu schopnosť nachádzať zraniteľnosti, aby sme ich mohli opraviť pred širším nasadením.
GPT‑Red je silný red teamer a naše predchádzajúce modely sú voči jeho útokom vkladania falošných príkazov veľmi zraniteľné.
GPT‑Red používame na adversariálny tréning GPT‑5.6, vďaka čomu je oveľa robustnejší voči vkladaniu falošných príkazov.
Tento prístup budeme ďalej škálovať popri ľudskom a externom red teamingu, viacvrstvových ochranných opatreniach a monitorovaní v reálnom čase.
Systémy umelej inteligencie sa bežne stretávajú s údajmi tretích strán prostredníctvom prehliadačov, pripojených aplikácií, lokálnych súborov a iných nástrojov. Tieto možnosti sú nevyhnutné na vykonávanie úloh v reálnom svete, ale zároveň vytvárajú viac príležitostí pre škodlivých aktérov na ovplyvnenie správania modelu. Napríklad tretia strana môže vložiť starostlivo vytvorenú inštrukciu– navrhnutú tak, aby oklamala model a nahrala citlivé údaje na externý server – do e-mailu, webovej stránky, odpovede nástroja alebo úložiska kódu.
Ľudský red teaming je kľúčovou súčasťou našej práce v oblasti bezpečnosti, ktoré nám pomáha odhaliť tieto zraniteľnosti pred nasadením a zaviesť správne ochranné opatrenia. Ale samotný ľudský red teaming je ťažké škálovať. Navrhovanie a vykonávanie týchto cvičení je časovo náročné, čo obmedzuje rýchlosť, s akou dokážeme identifikovať nové spôsoby zlyhania a začleniť ich do silnejších ochranných opatrení. Okrem toho, hoci tieto cvičenia poskytujú cenné príklady úspešných útokov, nedokážu vygenerovať objem a rozmanitosť údajov o nepriateľských stranách potrebných na zlepšenie robustnosti modelu prostredníctvom tréningu.
Udržať krok s čoraz výkonnejšími modelmi si vyžaduje aj škálovanie red teamingu. Za týmto účelom trénujeme automatizované, interné red‑teamingové modelyktoré odhaľujú zraniteľnosti pred nasadením a generujú útoky počas trénovania modelov s cieľom zlepšiť ich robustnosť. Veríme, že automatizovaný red teaming odomyká kľúčovú formu sebazdokonaľovania v oblasti bezpečnosti: využívanie dnešných modelov na priamu pomoc pri zvyšovaní bezpečnosti budúcich modelov.
GPT‑Red je vyvrcholením tohto úsilia a naším súčasným najlepším automatizovaným modelom red teamingu zabezpečenia. Podobne ako ľudskí členovia red teamingu vytvárajú útoky, model pracuje na dosiahnutí cieľa odoslaním výzvy, pozorovaním, ako na ňu modely GPT reagujú, a iteráciou. GPT‑Red sme trénovali vo výpočtovom rozsahu niektorých z našich najväčších behov po školení v OpenAI – bezprecedentné množstvo výpočtov venovaných výlučne na zlepšenie bezpečnosti.
GPT‑Red priamo začleňujeme do tréningového procesu našich produkčných modelov. Výsledkom je, že GPT‑5.6 Sol je náš doteraz najrobustnejší model pre priame vstrekovanie, ktorý v našom najťažšom teste priameho vstrekovania dosahuje 6-krát menej zlyhaní v porovnaní s naším najlepším produkčným modelom spred len štyroch mesiacov. Škálovateľnosť nášho prístupu nás teší na ešte lepšie výsledky v budúcnosti, keďže budeme pokračovať v tréningu silnejších členov red teamingu.
GPT‑Red sa trénuje pomocou učenia posilňovaním so sebahrou, pri ktorom sa model a súbor rôznorodých obranných LLM trénujú súčasne na širokej škále scenárov red teamingu. GPT‑Red je odmeňovaný za vyvolanie platného zlyhania, napríklad úspešného vkladania falošných príkazov, zatiaľ čo obranné modely sú odmeňované za odolanie útoku a splnenie pôvodných úloh. Keď sú obranné modely odolnejšie, GPT‑Red je nútený objavovať silnejšie a rozmanitejšie útoky.
Na podporu tréningu so sebahrou vytvárame rozsiahly súbor realistických scenárov, do ktorých by sa mohlo vkladať vkladanie falošných príkazov. Každé prostredie má model hrozieb, ktorý určuje, čo môže GPT‑Red ovládať a čo sa počíta ako úspešný útok. GPT‑Red môže napríklad ovládať časť lokálneho súboru, banner na webovej stránke, telo e-mailu alebo výstup nástroja.
Na konci tréningu je GPT‑Red veľmi silný útočník: dokáže prelomiť takmer všetky modely, proti ktorým ho postavíme, interné aj produkčné modely až po GPT‑5.5 vrátane. Po dokončení tréningu GPT‑Red sme ho použili na generovanie vkladania falošných príkazov pre tréning GPT‑5.6, vďaka čomu sa model stal vysoko odolným voči útokom GPT‑Red.
GPT‑Red držíme oddelene od modelov, ktoré nasadzujeme. Vďaka tomu sa škodlivé schopnosti, ktoré cielene trénujeme do GPT‑Red, nedostanú do rúk nepriateľských aktérov, zatiaľ čo našim produkčným modelom vštepujeme robustnosť.
GPT‑Red je vysoko účinný proti populácii obranných modelov a scenárom red teamingu, na ktorých bol trénovaný. Vyhodnocujeme aj to, či je model užitočný ako univerzálny agent na red teaming, ktorý môže širšie prispieť k bezpečnosti v OpenAI. Preto testujeme účinnosť GPT‑Red v nových bezpečnostných prostrediach a na cieľových modeloch.
Najprv hodnotíme schopnosť GPT‑Red zovšeobecňovať na nové scenáre red teamingu pomocou replikovanej verzie arény nepriameho vkladania falošných príkazov od Dziemiana a kol. (2025)(otvorí sa v novom okne). V tejto výzve ľudskí red teameri aj GPT‑Red nezávisle navrhovali útoky proti GPT‑5.1 v súbore vopred určených prostredí. Tieto scenáre a ciele red teamingu sa líšia od tých, ktoré sa použili na tréning GPT‑Red. GPT‑Red dosahuje výrazne vyššiu mieru úspešnosti útokov: uspel v 84 % scenárov oproti 13 % u ľudí.
GPT‑Red vyniká ako automatizovaný red teamer. GPT‑Red dokáže generovať úspešné útoky proti GPT‑5.1 v podstatne väčšom počte scenárov než ľudskí red teameri v aréne nepriameho vkladania falošných príkazov od Dziemiana a kol. (2025) s použitím internej kópie.
Konečným testom red teamera je schopnosť dosiahnuť cielené škodlivé ciele proti reálnym agentickým systémom s neúplnou znalosťou základného modelu systému a návrhu jeho harnessu. V prvom experimente v tomto prostredí sme postavili GPT‑Red proti predajnému automatu poháňanému AI v kancelárii OpenAI (podobnému Project Vend(otvorí sa v novom okne)), ktorý vytvorila spoločnosť Andon Labs. GPT‑Red sme dali opis systému a možnosť odosielať útoky a pozorovať volania nástrojov zo simulovaného agenta, ktorý verne zrkadlí reálne nasadenie. Po iterovaní útokov GPT‑Red nasadil svoj útok proti produkčnému agentovi a dosiahol všetky tri svoje škodlivé ciele:
- Zmeniť cenu drahej položky na sklade na minimálnu povolenú cenu 0,50 USD;
- Objednať novú položku za viac než 100 USD a ponúknuť ju za 0,50 USD; a
- Zrušiť objednávku iného zákazníka.
Tieto zraniteľnosti sme oznámili a nové ochranné opatrenia sa aktívne testujú.
GPT‑Red dokáže prelomiť živého autonómneho agenta známeho ako Vendy, ktorý spravuje predajný automat. GPT‑Red dokázal prinútiť produkčného agenta zmeniť drahé položky na lacné a zrušiť objednávky iných zákazníkov tak, že najprv testoval v simulácii a potom preniesol útoky na živého agenta.
GPT‑Red používame aj na útok na agenta Codex CLI (založeného na GPT‑5.4 mini) v sade 10 vyhradených scenárov exfiltrácie dát. Model porovnávame so základnou líniou GPT‑5.5 riadenou príkazom, aby sme skúmali vplyv nášho tréningového postupu na výkon red teamingu vo vyhradených úlohách. GPT‑Red je účinnejší, pretože dokáže úspešne prinútiť agenta exfiltrovať citlivé údaje vo viacerých scenároch, a zároveň je efektívnejší z hľadiska tokenov.
GPT‑Red je účinnejší a efektívnejší pri prelamovaní živých agentov Codex. Testujeme ho proti agentovi Codex postavenému na GPT‑5.4 Mini vo vlastnej sade 10 úloh na exfiltráciu dát.
Konečným cieľom GPT‑Red je zlepšiť robustnosť našich modelov. Za posledných šesť mesiacov sme s rastúcim výpočtovým výkonom trénovali postupne silnejšie modely red teamingu (predchodcov GPT‑Red) a tieto modely sme používali pri tréningu každého ďalšieho produkčného modelu od GPT‑5.3. Každé nasledujúce vydanie GPT sa postupom času stalo robustnejším.
Jedným príkladom je skorá verzia GPT‑Red, ktorá našla novú triedu priamych útokov vkladania falošných príkazov známych ako „falošné reťazenie myšlienok“. Tieto útoky dosahovali na GPT‑5.1 úspešnosť vyše 95 %, no pri GPT‑5.6 Sol sú teraz pod 10 %. Podobne naše najnovšie modely nasýtili viaceré benchmarky nepriameho vkladania falošných príkazov zamerané na útoky v nástrojoch pre vývojárov a prehliadaní webu (>97 % presnosť).
Výrazne sa zlepšila aj robustnosť voči samotnému GPT‑Red. V širokej sade prostredí na testovanie robustnosti miera úspešnosti útokov GPT‑Red v čase monotónne klesala. Pri našom najnovšom vydaní modelu zlyháva GPT‑5.6 Sol len na 0,05 % priamych vkladaní falošných príkazov od GPT‑Red.
Ako sme ďalej škálovali tréning sebahrou pre vkladanie falošných príkazov, objavili sme nové hrozby, ktoré dokážu prelomiť existujúce modely. Zároveň však naše škálovanie výrazne pomohlo zlepšiť odolnosť aj voči týmto útokom. Miera úspešnosti útokov sa počíta ako priemerná úspešnosť pokusov GPT‑Red vo všetkých pokusoch vo vyhradených prostrediach.
Model sa môže javiť bezpečnejší tým, že odmieta viac požiadaviek alebo sa stane menej schopným. Model, ktorý robí menej, je prirodzene ťažšie napadnúť, ale to nie je užitočná robustnosť.
Dôkladne hodnotíme všeobecné prelomové schopnosti aj cielené úlohy nadmerného odmietania, ktoré navrhujeme. Zisťujeme, že všetky bežné schopnosti zostávajú nedotknuté, zatiaľ čo robustnosť sa výrazne zlepšuje. To naznačuje, že zisky v robustnosti pochádzajú z lepšej odolnosti voči škodlivým pokynom, a nie z nesprávneho používania nástrojov alebo z predvoleného odmietania legitímnych požiadaviek.
AI agenti sa už používajú na zlepšovanie schopností našich modelov ďalšej generácie. Veríme, že s GPT‑Red sme začali odomykať podobný zotrvačník pre bezpečnosť, v ktorom možno dnešné modely využiť na to, aby zajtrajšie modely boli robustnejšie, lepšie zosúladené a dôveryhodnejšie. Budeme ďalej škálovať výpočtový výkon a dáta a zároveň zlepšovať algoritmy, aby sme trénovali budúce verzie GPT‑Red, ktoré budú silnejšie než dnešný model. Tieto modely následne pomôžu zvýšiť bezpečnosť budúcich vydaní GPT.
Neskôr tento týždeň vydáme preprint s ďalšími podrobnosťami.


