GPT‑Red: Självförbättring för robusthet
Tränar starka automatiserade red teamers för säkerhet som förbättrar robustheten.
Sammanfattning
Problem
Red teaming är avgörande för att upptäcka sårbarheter och förbättra våra modellers robusthet. Dagens metoder är dock inte skalbara, vilket skapar en flaskhals.
Vanliga robusthetsutvärderingar har redan mättats av våra senaste modeller.
Vi behöver utveckla metoder som låter säkerhet och anpassning skala i takt med modellernas förmågor.
Vad vi gjorde
Vi tränade GPT‑Red, en automatiserad red teaming-modell som skalar upp vår förmåga att hitta sårbarheter så att vi kan åtgärda dem före bredare lansering.
GPT‑Red är en stark red teamer, och våra tidigare modeller är mycket sårbara för dess promptinjektionsattacker.
Vi använder GPT‑Red för att träna GPT‑5.6 med fientliga exempel, vilket gör den mycket mer robust mot promptinjektioner.
Vi kommer att fortsätta skala den här metoden tillsammans med mänsklig och extern red teaming, lager av skyddsåtgärder och realtidsövervakning.
AI-system möter ofta tredjepartsdata via webbläsare, anslutna appar, lokala filer och andra verktyg. Dessa funktioner behövs för att utföra uppgifter i verkligheten, men de skapar också fler möjligheter för skadliga aktörer att påverka modellens beteende. En tredje part kan till exempel bädda in en noggrant utformad instruktion – utformad för att lura modellen att ladda upp känsliga data till en extern server – i ett e-postmeddelande, på en webbsida, i ett verktygssvar eller i ett kodförvar.
Mänsklig red teaming är en kritisk del av vårt säkerhetsarbete och hjälper oss att upptäcka dessa sårbarheter före lansering och införa rätt skyddsåtgärder. Men mänsklig red teaming är svår att skala på egen hand. Att utforma och genomföra dessa övningar tar mycket tid, vilket begränsar hur snabbt vi kan identifiera nya fellägen och bygga in dem i starkare skyddsåtgärder. Även om övningarna ger värdefulla exempel på lyckade attacker kan de inte skapa den volym och mångfald av fientliga data som behövs för att förbättra modellrobusthet genom träning.
För att hålla jämna steg med allt mer kapabla modeller måste även red teaming skalas upp. Därför har vi tränat automatiserade red teaming-modeller för internt bruk som upptäcker sårbarheter före lansering och genererar attacker under modellträning för att förbättra robustheten. Vi tror att automatiserad red teaming låser upp en avgörande form av självförbättring för säkerhet: att använda dagens modeller för att direkt bidra till att göra framtida modeller säkrare.
GPT‑Red är kulmen på dessa insatser och vår bästa nuvarande automatiserade red teaming-modell för säkerhet. På liknande sätt som mänskliga red teamers utformar attacker arbetar modellen mot ett mål genom att skicka en prompt, observera hur GPT‑modeller svarar på den och iterera. Vi tränade GPT‑Red i samma beräkningsskala som några av våra största efterträningskörningar på OpenAI – en aldrig tidigare skådad mängd beräkningskraft avsatt enbart för att förbättra säkerheten.
Vi införlivar GPT‑Red direkt i träningsprocessen för våra produktionsmodeller. Som resultat är GPT‑5.6 Sol vår hittills mest robusta modell mot promptinjektioner, med 6 gånger färre fel på vårt svåraste riktmärke för direkta promptinjektioner jämfört med vår bästa produktionsmodell från bara fyra månader tidigare. Skalbarheten i vår metod gör oss entusiastiska inför ännu starkare resultat i framtiden, när vi fortsätter att träna starkare red teamers.
GPT‑Red tränas med förstärkningsinlärning via självspel, där modellen och en uppsättning olika försvarande LLM:er tränas samtidigt på en bred uppsättning red teaming-scenarier. GPT‑Red belönas för att framkalla ett giltigt fel, till exempel en lyckad promptinjektion, medan försvararmodellerna belönas för att stå emot attacken och slutföra sina ursprungliga uppgifter. När försvararna blir mer robusta tvingas GPT‑Red upptäcka starkare och mer varierade attacker.
För att stödja träning genom självspel bygger vi upp en omfattande uppsättning realistiska scenarier där promptinjektioner kan föras in. Varje miljö har en hotmodell som anger vad GPT‑Red kan kontrollera och vad som räknas som en lyckad attack. GPT‑Red kan till exempel styra en del av en lokal fil, en webbsidesbanner, brödtexten i ett e-postmeddelande eller utdata från ett verktyg.
I slutet av träningen är GPT‑Red en mycket stark angripare: det kan knäcka nästan alla modeller det ställs mot, både interna modeller och produktionsmodeller upp till och med GPT‑5.5. Efter att GPT‑Red hade slutfört träningen använde vi det för att generera promptinjektioner för träningen av GPT‑5.6, vilket gjorde modellen mycket motståndskraftig mot GPT‑Reds attacker.
Vi håller GPT‑Red åtskilt från de modeller vi lanserar. Detta håller de skadliga förmågor vi specifikt tränar in i GPT‑Red borta från fientliga aktörer, samtidigt som våra produktionsmodeller får ökad robusthet.
GPT‑Red är mycket effektivt mot den population av försvararmodeller och red teaming-scenarier som det tränades på. Vi utvärderar också om modellen är användbar som en generell red teaming-Agent för att gynna säkerhet brett inom OpenAI. För att göra det testar vi GPT‑Reds effektivitet i nya säkerhetsmiljöer och mot målmodeller.
Vi utvärderar först GPT‑Reds förmåga att generalisera till nya red teaming-scenarier med hjälp av en replikerad version av arenan för indirekta promptinjektioner från Dziemian et al. (2025)(öppnas i ett nytt fönster). I denna utmaning föreslog både mänskliga red teamers och GPT‑Red oberoende attacker mot GPT‑5.1 i en uppsättning fördefinierade miljöer. Dessa red teaming-scenarier och mål skiljer sig från dem som användes för att träna GPT‑Red. GPT‑Red uppnår betydligt högre framgångsfrekvenser för attacker, med lyckade resultat i 84 % av scenarierna jämfört med 13 % för människor.
GPT‑Red utmärker sig som automatiserad red teamer. GPT‑Red kan generera lyckade attacker mot GPT‑5.1 i betydligt fler scenarier än mänskliga red teamers på arenan för indirekta promptinjektioner från Dziemian et al. (2025), med hjälp av en intern spegling.
Det yttersta testet för en red teamer är förmågan att uppnå riktade skadliga mål mot agentiska system i verkliga miljöer, med ofullständig kunskap om systemets underliggande modell och körmiljödesign. Vårt första experiment i den här miljön ställde GPT‑Red mot en AI-driven varuautomat på OpenAI-kontoret (liknande Project Vend(öppnas i ett nytt fönster)) som tagits fram av Andon Labs. Vi gav GPT‑Red en beskrivning av systemet och möjlighet att skicka attacker och observera verktygsanrop från den simulerade agenten, som nära speglar den verkliga driftsättningen. Efter att ha itererat på attackerna satte GPT‑Red in sin attack mot produktionsagenten och uppnådde alla tre skadliga mål:
- Ändra priset på en dyr vara i lager till det lägsta tillåtna priset, 0,50 USD;
- Beställa en ny vara för över 100 USD och erbjuda den för 0,50 USD; och
- Avbryta en annan kunds beställning.
Vi rapporterade dessa sårbarheter, och nya skyddsåtgärder testas aktivt.
GPT‑Red kan knäcka en aktiv autonom Agent kallad Vendy som hanterar en varuautomat. GPT‑Red kunde få produktionsagenten att ändra dyra varor så att de blev billiga och avbryta andra kunders beställningar, genom att först testa i simulering och sedan överföra attackerna till den aktiva agenten.
Vi använder också GPT‑Red för att attackera en Codex CLI-Agent (baserad på GPT‑5.4 mini) i en svit med 10 undanhållna scenarier för dataexfiltrering. Vi jämför modellen med en promptad GPT‑5.5‑baslinje för att studera hur vår träningsprocedur påverkar red teaming-prestanda i undanhållna miljöer. GPT‑Red är både mer effektivt, eftersom det lyckas få agenten att exfiltrera känsliga data i fler scenarier, och mer tokeneffektivt.
GPT‑Red är mer effektivt och resurseffektivt på att knäcka aktiva Codex-agenter. Vi testar mot en Codex-Agent som stöds av GPT‑5.4 Mini i en anpassad svit med 10 uppgifter för dataexfiltrering.
Det yttersta målet med GPT‑Red är att förbättra våra modellers robusthet. Under de senaste sex månaderna har vi tränat gradvis starkare red teaming-modeller (föregångare till GPT‑Red) med ökande beräkningskraft och använt dessa modeller i träningen av varje efterföljande produktionsmodell sedan GPT‑5.3. Med tiden har varje ny GPT‑version blivit mer robust.
Som ett exempel hittade en tidig version av GPT‑Red en ny klass av direkta promptinjektionsattacker kallade ”falsk tankekedja”-attacker. Dessa attacker nådde framgångsfrekvenser på över 95 % mot GPT‑5.1 men ligger nu under 10 % för GPT‑5.6 Sol. På liknande sätt har flera av våra riktmärken för indirekta promptinjektioner, som riktar sig mot attacker i utvecklarverktyg och surfning, mättats av vår senaste modell (>97 % noggrannhet).
Robustheten mot GPT‑Red självt har också förbättrats avsevärt. I en bred uppsättning robusthetsmiljöer har GPT‑Reds framgångsfrekvenser för attacker sjunkit monotont över tid. Med vår senaste modellrelease misslyckas GPT‑5.6 Sol på bara 0,05 % av GPT‑Reds direkta promptinjektioner.
När vi har fortsatt att skala upp självspelsträning för promptinjektioner har vi hittat nya hot som kan knäcka befintliga modeller. Samtidigt har vår skalning också bidragit till att avsevärt förbättra robustheten mot dessa attacker. Attackernas framgångsfrekvens beräknas som genomsnittlig andel lyckade försök över alla GPT‑Reds försök i undanhållna miljöer.
En modell kan verka säkrare genom att vägra fler förfrågningar eller bli mindre kapabel. En modell som gör mindre är naturligt svårare att attackera, men det är inte användbar robusthet.
Vi utvärderar noggrant både allmänna banbrytande förmågor och riktade uppgifter som mäter överdrivna avslag och som vi själva utformar. Vi ser att alla normala förmågor förblir opåverkade samtidigt som robustheten förbättras avsevärt. Det tyder på att robusthetsvinsterna kom från bättre motstånd mot skadliga instruktioner, snarare än felaktig verktygsanvändning eller att legitima förfrågningar vägras som standard.
AI-agenter används redan för att förbättra förmågorna hos våra nästa generations modeller. Vi tror att vi med GPT‑Red har börjat låsa upp ett liknande svänghjul för säkerhet, där dagens modeller kan användas för att göra morgondagens modeller mer robusta, anpassade och tillförlitliga. Vi kommer att fortsätta skala beräkningskraft och data samtidigt som vi gör algoritmiska förbättringar, för att träna framtida versioner av GPT‑Red som är starkare än dagens modell. Dessa modeller kommer i sin tur att bidra till att göra framtida GPT‑versioner säkrare.
Vi kommer att publicera ett preprint med mer information senare den här veckan.


