Indlæser ...
I dag lancerer vi GPT‑6 Astra, den mest avancerede model, vi nogensinde har udrullet bredt. Astra er vores første model, der når det kritiske niveau for cybersikkerhedskapacitet i vores Preparedness Framework.
Her er de vigtigste oplysninger om sikkerheden ved denne lancering:
- GPT‑6 Astra udgør et markant fremskridt inden for cyberkapaciteter og når vores kritiske tærskel. Det betyder, at GPT‑6 Astra med de rette værktøjer og den rette adgang kan finde hidtil ukendte sikkerhedssvagheder og udvikle nye metoder til at udnytte dem på tværs af mange godt beskyttede systemer, uden at en person vejleder modellen ved hvert trin. Derfor har vi styrket vores beskyttelse markant mod, at modellen udfører skadelige cyberhandlinger, uanset om det skyldes misbrug eller manglende tilpasning. Vi har også truffet foranstaltninger til at sikre vores interne udvikling og udrulning af Astra og lignende modeller, herunder strengere isolation, kryptering af kontrolpunkter, generel overvågning af hele handlingsforløb inklusive tankekæder (CoT) samt en evalueringsproces for tilpasning, der kan blokere intern brug.
- GPT‑6 Astra er væsentligt mere robust end sine forgængere. Med nye sikkerhedstræningsteknikker, der øger robustheden, er GPT‑6 Astra væsentligt mere modstandsdygtig over for jailbreaks end GPT‑5.6 Sol, også i længere handlingsforløb. Det ved vi fra offline-tests og vores omfattende program for intern og ekstern test og afhjælpning af jailbreaks. For brugere, der er markeret som potentielt højrisikable, har vi desuden trænet modellen i at justere sin afvisningsgrænse, så den er mere forsigtig og dækker en bredere vifte af risici ved dobbelt anvendelse. Vi bruger regressionstest til at sikre, at Astra er robust over for jailbreaks, der blev fundet i tidligere testperioder, og har gennemført nye runder af automatiseret red-teaming med vores nyeste interne red-teaming-angribere for at validere forbedringerne.
- GPT‑6 Astra er bedre tilpasset end GPT‑5.6 Sol. Astra er et markant fremskridt inden for modeltilpasning og omfatter forbedringer lige fra sammensætningen af vores data til fortræning til vores bedømmelse under forstærkende læring. Vi præsenterer en ny serie evalueringer af tilpasningen(åbner i et nyt vindue) og konstaterer, at GPT‑6 Astra er bedre til at respektere sikkerhedsgrænser og holde sig inden for sit godkendte virkefelt. I en simulering med mere end 54.000 interne Codex-opgaver(åbner i et nyt vindue) fik Astra desuden omtrent halvt så mange markeringer for mere alvorlig utilpasset adfærd som Sol.
- Vi udruller bred overvågning af manglende tilpasning. Vi betragter modeltilpasning som det vigtigste middel til at forhindre potentiel utilpasset adfærd fra vores modeller. Overvågning giver dog bred indsigt i banebrydende modellers adfærd og afdækker muligheder for at forbedre tilpasningen og sikkerheden yderligere. Derudover fungerer overvågning som et ekstra beskyttelseslag mod utilpasset adfærd, der bliver registreret. Derfor har vi også føjet overvågning af manglende tilpasning til al værktøjsbrugende inferens i vores eksterne udrulning af Astra, hvilket medfører betydelige beregningsomkostninger. Dette system svarer til vores interne opsætning.
- GPT‑6 Astra er mindre overvågelig end GPT‑5.6 Sol. Vi har foretaget omfattende undersøgelser af GPT‑6 Astras overvågelighed(åbner i et nyt vindue) og styrbarhed(åbner i et nyt vindue). Vi har konstateret, at GPT‑6 Astra er bedre til at styre sin egen CoT end GPT‑5.6 Sol og mindre tilbøjelig til at medtage belastende oplysninger i sin CoT. Under kontradiktoriske forhold, hvor vi presser modellen til at undgå vores overvågning, kan modellen forblive uopdaget, når den strategisk underpræsterer i evalueringer (sandbagging), og den kan undertiden undgå vores interne overvågning, når den bliver bedt om at udføre bestemte sabotageopgaver(åbner i et nyt vindue). Vi har ikke set tegn på steganografisk CoT-ræsonnering, f.eks. at skjult ræsonnering gemmes i almindelig og tilsyneladende uvedkommende tekst. Det tyder på, at risikoen for omgåelse i vid udstrækning kan være begrænset til opgaver med mindre krav til ræsonnering.
- Disse resultater tyder på, at modeller i Astra-klassen kan undgå vores CoT-overvågning under kontradiktoriske forhold. På nuværende tidspunkt bygger resultaterne hovedsageligt på kontradiktoriske evalueringer, dvs. når vi instruerer modellen i at undgå overvågning. Samlet set viser vores evalueringer af tilpasningen dog, at Astra er mindre tilbøjelig end GPT‑5.6 Sol til at overtræde sikkerhedsrestriktioner.
- Vi tager dog udviklingen alvorligt og fortsætter med at undersøge resultaterne og deres betydning for overvågeligheden, efterhånden som vores modeller bliver mere avancerede. OpenAI har arbejdet på at bevare og anvende overvågning af tankekæder, og det er et centralt mål for forskningsprogrammet at bevare CoT-overvågeligheden. Resultaterne understreger dog også vigtigheden af at udvikle metoder til revision af tilpasningen, der rækker ud over en undersøgelse af modellens tankekæde.
- GPT‑6 Astra håndterer browsing og arbejdsmiljøer mere ansvarligt: GPT‑6 Astra er væsentligt mere robust over for promptinjektioner end GPT‑5.6 Sol. Vi har desuden testet modellens adfærd i realistiske browsingmiljøer og professionelle computermiljøer og konstateret, at modellen er væsentligt mindre tilbøjelig end GPT‑5.6 Sol til at udføre utilpassede og potentielt ødelæggende handlinger, f.eks. uautoriserede transaktioner, datatab, overdreven adgang eller omgåelse af kontrolforanstaltninger. Den handler også mere sikkert ved håndtering af skadelige anmodninger i agentbaserede miljøer, f.eks. anmodninger om hjælp til at planlægge voldelige angreb eller begå bedrageri.
- GPT‑6 Astra er væsentligt sikrere i scenarier med højere risiko. GPT‑6 Astra reagerer mere sikkert end GPT‑5.6 Sol på udfordrende anmodninger fra produktionen og fra kontradiktorisk red-teaming udført af mennesker. Astra opnår en Pareto-forbedring ved både at håndtere risikable anmodninger sikkert og undgå unødvendige afvisninger af harmløse anmodninger. Forbedringerne omfatter også meget alvorlige scenarier, hvor risikoen for skade udspringer af den bredere kontekst frem for en udtrykkelig anmodning. Astra anvender også alderssvarende sikkerhedsgrænser mere konsekvent for brugere under 18 år.
Du kan få flere oplysninger i det fulde systemkort(åbner i et nyt vindue).
Skrevet af
OpenAI


