GPT‑Red: Sebezlepšování pro robustnost
Trénování silných automatizovaných bezpečnostních red-teamerů ke zlepšení odolnosti.
Shrnutí
Problém
Red-teaming je nezbytný pro odhalování zranitelností a zlepšování odolnosti našich modelů. Současné přístupy však nelze dobře škálovat, což vytváří úzké hrdlo.
Běžně používaná hodnocení odolnosti už naše nejnovější modely saturovaly.
Potřebujeme vyvíjet metody, které umožní škálování bezpečnosti a sladění spolu se schopnostmi modelů.
Co jsme udělali
Natrénovali jsme GPT‑Red, automatizovaný model pro red-teaming, který škáluje naši schopnost nacházet zranitelnosti, abychom je mohli opravit před širším nasazením.
GPT‑Red je silný red-teamer a naše předchozí modely jsou vůči jeho útokům injektáží promptů velmi zranitelné.
GPT‑Red používáme k adversariálnímu tréninku GPT‑5.6, díky čemuž je mnohem odolnější vůči injektážím promptů.
Tento přístup budeme dál škálovat spolu s lidským a externím red-teamingem, vrstvenými ochrannými opatřeními a monitorováním v reálném čase.
Systémy AI běžně narážejí na data třetích stran prostřednictvím prohlížečů, propojených aplikací, místních souborů a dalších nástrojů. Tyto možnosti jsou nezbytné pro plnění úloh v reálném světě, ale zároveň vytvářejí více příležitostí pro škodlivé aktéry, aby ovlivňovali chování modelu. Třetí strana může například vložit pečlivě vytvořenou instrukci – navrženou tak, aby model oklamala a přiměla ho nahrát citlivá data na externí server – do e-mailu, webové stránky, odpovědi nástroje nebo úložiště kódu.
Lidský red-teaming je zásadní součástí naší práce na bezpečnosti: pomáhá nám odhalovat tyto zranitelnosti před nasazením a zavádět správná ochranná opatření. Samotný lidský red-teaming se však obtížně škáluje. Navrhování a provádění těchto cvičení je časově náročné, což omezuje, jak rychle dokážeme identifikovat nové režimy selhání a zapracovat je do silnějších ochranných opatření. Ačkoli tato cvičení přinášejí cenné příklady úspěšných útoků, nedokážou vytvořit objem a rozmanitost adversariálních dat potřebných ke zlepšení odolnosti modelů prostřednictvím tréninku.
Udržet krok se stále schopnějšími modely vyžaduje, aby se škáloval i red-teaming. Za tímto účelem trénujeme automatizované modely pro red-teaming určené pouze pro interní použití, které odhalují zranitelnosti před nasazením a během tréninku modelů generují útoky ke zlepšení odolnosti. Věříme, že automatizovaný red-teaming odemyká klíčovou formu sebezlepšování bezpečnosti: využití dnešních modelů k přímé pomoci při zvyšování bezpečnosti budoucích modelů.
GPT‑Red je vyvrcholením těchto snah a v současnosti náš nejlepší automatizovaný model pro bezpečnostní red-teaming. Podobně jako útoky vytvářejí lidští red-teameři, i model postupuje k cíli tím, že odešle prompt, sleduje, jak na něj modely GPT reagují, a iteruje. GPT‑Red jsme trénovali ve výpočetním měřítku některých z našich největších post-tréninkových běhů v OpenAI – šlo o bezprecedentní množství výpočetního výkonu věnovaného čistě zlepšování bezpečnosti.
GPT‑Red začleňujeme přímo do procesu tréninku našich produkčních modelů. Díky tomu je GPT‑5.6 Sol naším dosud nejodolnějším modelem vůči injektážím promptů: na našem nejtěžším benchmarku přímé injektáže promptů dosahuje 6× méně selhání než náš nejlepší produkční model z doby před pouhými čtyřmi měsíci. Škálovatelnost našeho přístupu nás naplňuje očekáváním ještě silnějších výsledků v budoucnu, jak budeme dál trénovat silnější red-teamery.
GPT‑Red trénujeme pomocí self-play učení posilováním, při němž se model a soubor různorodých obranných LLM trénují současně na široké škále scénářů red-teamingu. GPT‑Red je odměňován za vyvolání platného selhání, například úspěšné injektáže promptů, zatímco obranné modely jsou odměňovány za odolání útoku a dokončení původních úloh. Čím jsou obránci odolnější, tím víc je GPT‑Red nucen objevovat silnější a rozmanitější útoky.
Na podporu tréninku self-play vytváříme rozsáhlý soubor realistických scénářů, do nichž by bylo možné vložit injektáž promptů. Každé prostředí má model hrozeb, který určuje, co může GPT‑Red ovládat a co se počítá jako úspěšný útok. GPT‑Red může například ovládat část místního souboru, banner na webové stránce, tělo e-mailu nebo výstup nástroje.
Na konci tréninku je GPT‑Red velmi silným útočníkem: dokáže prolomit téměř všechny modely, proti nimž je nasazen, interní i produkční, až po GPT‑5.5 (včetně). Po dokončení tréninku GPT‑Red jsme ho použili ke generování injektáží promptů pro trénink GPT‑5.6, díky čemuž se model stal vysoce odolným vůči útokům GPT‑Red.
GPT‑Red držíme odděleně od modelů, které nasazujeme. Tím udržujeme škodlivé schopnosti, které v GPT‑Red cíleně trénujeme, mimo dosah protivníků a zároveň vnášíme odolnost do našich produkčních modelů.
GPT‑Red je vysoce účinný proti populaci obranných modelů a scénářů red-teamingu, na nichž byl trénován. Vyhodnocujeme také, zda je model užitečný jako univerzální agent pro red-teaming na obecnou podporu bezpečnosti v OpenAI. Za tímto účelem testujeme účinnost GPT‑Red v nových bezpečnostních prostředích a na cílových modelech.
Nejprve hodnotíme schopnost GPT‑Red zobecňovat na nové scénáře red-teamingu pomocí replikované verze arény nepřímé injektáže promptů od Dziemiana et al. (2025)(otevře se v novém okně). V této výzvě lidští red-teameři i GPT‑Red nezávisle navrhovali útoky proti GPT‑5.1 v sadě předem definovaných prostředí. Tyto scénáře a cíle red-teamingu se liší od těch, které byly použity k tréninku GPT‑Red. GPT‑Red dosahuje výrazně vyšší míry úspěšnosti útoků: uspěl v 84 % scénářů oproti 13 % u lidí.
GPT‑Red je jako automatizovaný red-teamer vynikající. GPT‑Red dokáže pomocí interní zrcadlené verze arény nepřímé injektáže promptů od Dziemiana et al. (2025) generovat úspěšné útoky proti GPT‑5.1 ve výrazně více scénářích než lidští red-teameři.
Konečným testem red-teamera je schopnost dosahovat cílených škodlivých cílů proti reálným agentním systémům s neúplnou znalostí jejich základního modelu a designu jejich harnessu. V prvním experimentu v tomto prostředí jsme postavili GPT‑Red proti prodejnímu automatu poháněnému AI v kanceláři OpenAI (podobnému Project Vend(otevře se v novém okně)), který vytvořila společnost Andon Labs. GPT‑Red jsme poskytli popis systému a možnost posílat útoky a pozorovat volání nástrojů simulovaného agenta, který věrně napodobuje reálné nasazení. Po iteracích útoků GPT‑Red nasadil svůj útok proti produkčnímu agentovi a dosáhl všech tří škodlivých cílů:
- změnit cenu drahé položky, která byla skladem, na minimální povolenou cenu 0,50 USD;
- objednat novou položku za více než 100 USD a nabízet ji za 0,50 USD; a
- zrušit objednávku jiného zákazníka.
Tyto zranitelnosti jsme nahlásili a aktivně se testují nová ochranná opatření.
GPT‑Red dokáže prolomit živého autonomního agenta známého jako Vendy, který spravuje prodejní automat. GPT‑Red dokázal přimět produkčního agenta, aby změnil drahé položky cenu na nízkou a zrušil objednávky jiných zákazníků: nejprve to otestoval v simulaci, poté přenesl útoky na živého agenta.
GPT‑Red také používáme k útoku na agenta Codex CLI (založeného na GPT‑5.4 mini) na sadě 10 vyhrazených scénářů exfiltrace dat. Model porovnáváme s výchozí variantou GPT‑5.5 řízenou promptem, abychom zkoumali dopad našeho tréninkového postupu na výkon v red-teamingu na vyhrazených scénářích. GPT‑Red je účinnější, protože dokáže úspěšně přimět agenta k exfiltraci citlivých dat ve více scénářích, a zároveň je efektivnější z hlediska tokenů.
GPT‑Red je účinnější a efektivnější při prolomení živých agentů Codexu. Testujeme ho proti agentovi Codexu s GPT‑5.4 Mini na vlastní sadě 10 úloh exfiltrace dat.
Konečným cílem GPT‑Red je zlepšit odolnost našich modelů. Za posledních šest měsíců jsme s rostoucím výpočetním výkonem trénovali postupně silnější modely pro red-teaming (předchůdce GPT‑Red) a používali je při tréninku každého následujícího produkčního modelu od GPT‑5.3. Postupem času se každá další verze GPT stala odolnější.
Jedním příkladem je raná verze GPT‑Red, která našla novou třídu přímých útoků injektáží promptů typu „falešný myšlenkový řetězec“. Tyto útoky dosahovaly na GPT‑5.1 úspěšnosti přes 95 %, ale u GPT‑5.6 Sol jsou nyní pod 10 %. Podobně několik našich benchmarků nepřímé injektáže promptů, které cílí na útoky ve vývojářských nástrojích a procházení webu, už náš nejnovější model saturoval (>97% přesnost).
Výrazně se zlepšila také odolnost vůči samotnému GPT‑Red. Na široké sadě prostředí pro odolnost míra úspěšnosti útoků GPT‑Red v čase monotonně klesala. S naším nejnovějším modelem GPT‑5.6 Sol selhává jen u 0,05 % přímých injektáží promptů od GPT‑Red.
Jak jsme dál škálovali trénink self-play pro injektáž promptů, objevili jsme nové hrozby, které dokážou prolomit stávající modely. Naše škálování však zároveň výrazně pomohlo zlepšit odolnost vůči těmto útokům. Míra úspěšnosti útoků se počítá jako průměrná úspěšnost pokusů GPT‑Red ze všech pokusů ve vyhrazených prostředích.
Model může působit bezpečněji tím, že odmítá více požadavků nebo je méně schopný. Model, který dělá méně, je přirozeně těžší napadnout, ale taková odolnost není užitečná.
Důkladně vyhodnocujeme obecné průkopnické schopnosti i cílené úlohy zaměřené na nadměrné odmítání, které navrhujeme. Zjišťujeme, že všechny běžné schopnosti zůstávají nedotčeny, zatímco odolnost se výrazně zlepšuje. To naznačuje, že zisky v odolnosti plynou spíše z lepšího odporu vůči škodlivým instrukcím než z nesprávného používání nástrojů nebo výchozího odmítání legitimních požadavků.
Agenti AI se už používají ke zlepšování schopností našich modelů příští generace. Věříme, že s GPT‑Red jsme začali otevírat dveře pro podobný setrvačník v oblasti bezpečnosti – v jeho rámci lze dnešní modely používat k tomu, aby zítřejší modely byly odolnější, lépe sladěné a důvěryhodnější. Budeme dál škálovat výpočetní výkon a data a zároveň zlepšovat algoritmy, abychom natrénovali budoucí verze GPT‑Red tak, aby byly silnější než dnešní model. Tyto modely pak pomohou zvýšit bezpečnost budoucích vydání GPT.
Později tento týden vydáme preprint s dalšími podrobnostmi.


