Laddar …
I dag lanserar vi GPT‑6 Astra, den mest kapabla modell vi hittills har gjort allmänt tillgänglig. Astra är vår första modell som når den kritiska nivån för cybersäkerhetsförmåga enligt vårt Preparedness Framework.
Det här är det viktigaste att känna till om säkerheten kring lanseringen:
- GPT‑6 Astra innebär ett stort kliv framåt inom cyberförmåga och når vårt kritiska tröskelvärde. Det innebär att GPT‑6 Astra, med rätt verktyg och åtkomst, kan hitta tidigare okända säkerhetsbrister och utveckla nya sätt att utnyttja dem i många väl skyddade system utan att en person vägleder varje steg. Därför har vi avsevärt stärkt skydden mot att modellen vidtar skadliga cyberåtgärder, oavsett om orsaken är missbruk eller bristande anpassning. Vi har också vidtagit åtgärder för att säkra vår interna utveckling och driftsättning av Astra och liknande modeller, bland annat genom striktare isolering, kryptering av kontrollpunkter, heltäckande övervakning av fullständiga förlopp inklusive tankekedjor (CoT) samt en spärrande process för anpassningsutvärdering före intern användning.
- GPT‑6 Astra är betydligt robustare än sina föregångare. Tack vare nya säkerhetsträningsmetoder för ökad robusthet är GPT‑6 Astra betydligt mer motståndskraftig mot jailbreaks än GPT‑5.6 Sol, även under längre förlopp. Det vet vi genom offline-tester och vårt program för rigorösa interna och externa tester samt åtgärder mot jailbreaks. För användare som flaggats som potentiellt högriskbenägna har vi dessutom tränat modellen att justera sin gräns för avvisanden så att den blir mer försiktig och omfattar fler risker med dubbla användningsområden. Vi använder regressionstestning för att säkerställa att Astra är robust mot jailbreaks som hittats under tidigare testperioder. Vi genomförde också nya omgångar av automatiserad red teaming med våra senaste interna red teaming-angripare för att validera förbättringarna.
- GPT‑6 Astra är bättre anpassad än GPT‑5.6 Sol. Astra innebär ett stort framsteg inom modellanpassning och omfattar förbättringar från sammansättningen av våra förträningsdata till bedömningen under förstärkningsinlärning. Vi redovisar en ny uppsättning anpassningsutvärderingar(öppnas i ett nytt fönster) och konstaterar att GPT‑6 Astra är bättre på att respektera säkerhetsgränser och hålla sig inom sitt behörighetsområde. I en simulering med fler än 54 000 interna Codex-uppgifter(öppnas i ett nytt fönster) fick Astra dessutom ungefär hälften så många flaggningar för allvarligare felanpassat beteende som Sol.
- Vi inför bred övervakning av bristande anpassning. Vi ser modellanpassning som det främsta verktyget för att förhindra potentiellt felanpassat beteende hos våra modeller. Övervakning ger dock bred insyn i hur banbrytande modeller beter sig och synliggör möjligheter att ytterligare förbättra anpassning och säkerhet. Dessutom fungerar övervakningen som ett extra skyddslager mot felanpassat beteende som upptäcks. Av dessa skäl har vi även infört övervakning av bristande anpassning för all verktygsanvändande inferens i vår externa driftsättning av Astra, till en betydande beräkningskostnad. Det här systemet motsvarar vår interna konfiguration.
- GPT‑6 Astras övervakningsbarhet har försämrats jämfört med GPT‑5.6 Sol. Vi har gjort omfattande undersökningar av GPT‑6 Astras övervakningsbarhet(öppnas i ett nytt fönster) och styrbarhet(öppnas i ett nytt fönster). Vi har funnit att GPT‑6 Astra har större förmåga att styra sin egen CoT än GPT‑5.6 Sol och mer sällan tar med komprometterande information i sin CoT. I kontradiktoriska miljöer, där vi försöker få modellen att kringgå våra övervakningssystem, ser vi att modellen kan undgå upptäckt när den strategiskt underpresterar i utvärderingar (avsiktlig underprestation) och ibland kan undvika våra interna övervakningssystem när den ombeds att utföra vissa sabotageuppgifter(öppnas i ett nytt fönster). Vi har inte sett några tecken på steganografiskt CoT-resonemang, exempelvis att dolda resonemang kamoufleras i vanlig och till synes orelaterad text. Det tyder på att risken för kringgående till stor del kan vara begränsad till uppgifter med lägre resonemangskrav.
- Resultaten tyder på att modeller i Astra-klassen skulle kunna kringgå våra CoT-övervakningssystem under kontradiktoriska förhållanden. Just nu bygger resultaten till stor del på kontradiktoriska utvärderingar, det vill säga när vi instruerar modellen att kringgå övervakningen. Sammantaget visar våra anpassningsutvärderingar att Astra mer sällan än GPT‑5.6 Sol bryter mot säkerhetsbegränsningar.
- Vi tar dock utvecklingen på allvar och fortsätter att undersöka resultaten och deras konsekvenser för övervakningsbarheten i takt med att våra modeller blir mer kapabla. OpenAI har arbetat för att bevara och använda övervakning av tankekedjor, och att bibehålla CoT-övervakningsbarheten är ett centralt mål för forskningsprogrammet. Resultaten understryker dock också vikten av att utveckla metoder för granskning av anpassning som går längre än att undersöka modellens tankekedja.
- GPT‑6 Astra hanterar surfning och arbetsmiljöer på ett mer ansvarsfullt sätt: GPT‑6 Astra är betydligt mer motståndskraftig mot promptinjektioner än GPT‑5.6 Sol. Vi har också testat modellens beteende i realistiska surf- och professionella datormiljöer och konstaterar att den är betydligt mindre benägen än GPT‑5.6 Sol att utföra felanpassade och potentiellt destruktiva handlingar, exempelvis obehöriga transaktioner, dataförlust, överdriven åtkomst eller kringgående av kontroller. Den agerar också säkrare när den hanterar skadliga förfrågningar i agentbaserade miljöer, till exempel önskemål om hjälp med att planera våldsamma attacker eller begå bedrägerier.
- GPT‑6 Astra är betydligt säkrare i scenarier med högre risk. GPT‑6 Astra svarar säkrare än GPT‑5.6 Sol på svåra förfrågningar från produktionsmiljöer och kontradiktorisk mänsklig red teaming. Astra uppnår en Paretoförbättring genom att hantera osäkra förfrågningar på ett säkert sätt och samtidigt undvika onödiga avvisanden av ofarliga förfrågningar. Förbättringarna omfattar även mycket allvarliga scenarier där risken för skada uppstår genom det bredare sammanhanget snarare än genom en uttrycklig begäran. Astra tillämpar också åldersanpassade säkerhetsgränser mer konsekvent för användare under 18 år.
Mer information finns i det fullständiga systemkortet(öppnas i ett nytt fönster).
Författare
OpenAI


