I dag lanserer vi en forskningsforhåndsvisning av gpt-oss-safeguard, våre open-weight-resonneringsmodeller for sikkerhetsklassifiseringsoppgaver, tilgjengelige i to størrelser: gpt-oss-safeguard-120b og gpt-oss-safeguard-20b. Disse modellene er finjusterte versjoner av våre gpt-oss open models og er tilgjengelige under den samme tillatende Apache 2.0-lisensen, som lar hvem som helst bruke, endre og distribuere dem fritt. Begge modellene kan lastes ned i dag fra Hugging Face(åpnes i et nytt vindu).
Modellene gpt-oss-safeguard bruker resonnement til å direkte tolke utviklerleverte retningslinjer ved inferenstidspunktet – noe som klassifiserer brukermeldinger, fullførelser og fullstendige chatter i henhold til utviklerens behov. Utvikleren bestemmer alltid hvilke retningslinjer som skal brukes, slik at svar er mer relevante og tilpasset utviklerens bruksområde. Modellen bruker tankerekke, som utvikleren kan se gjennom for å forstå hvordan modellen når avgjørelsene sine. I tillegg blir retningslinjene gitt under inferens i stedet for å bli trent inn i modellen, slik at det er enkelt for utviklere å iterativt revidere retningslinjer for å øke ytelsen. Denne tilnærmingen, som vi først utviklet for intern bruk, er betydelig mer fleksibel enn den tradisjonelle metoden med å trene en klassifikator til å indirekte utlede en avgjørelsesgrense fra et stort antall merkede eksempler.
Med gpt-oss-safeguard kan utviklere angi grensene for retningslinjer som passer best til bruksområdet deres. Et diskusjonsforum for videospill vil kanskje utvikle retningslinjer for å klassifisere innlegg som diskuterer juks i spillet, eller et nettsted for produktanmeldelser vil kanskje bruke sine egne retningslinjer for å sile ut anmeldelser som sannsynligvis er falske.
Modellen tar to inndata samtidig – en retningslinje og innholdet som skal klassifiseres i henhold til den retningslinjen – og gir en konklusjon om hvor innholdet hører hjemme, samt resonneringen. Utviklere bestemmer hvordan, om i det hele tatt, disse konklusjonene skal brukes i sine egne sikkerhetsprosesser. Vi har sett at denne resonneringsbaserte tilnærmingen presterer spesielt godt i situasjoner der:
- Den potensielle skaden er fremvoksende eller under utvikling, og retningslinjene må tilpasses raskt.
- Domenet er veldig nyansert og vanskelig å håndtere for mindre klassifikatorer.
- Utviklere har ikke nok eksempler til å lære opp en klassifikator av høy kvalitet for hver risiko på plattformen sin.
- Forsinkelse er mindre viktig enn å produsere etiketter av høy kvalitet som kan forklares.
Vi gir ut denne forhåndsvisningen av gpt-oss-safeguard for å få tilbakemeldinger fra forsknings- og sikkerhetsfellesskapet og iterere videre på modellens ytelse. Vi brukte flere måneder på denne utgivelsen med åpen vektutgivelse med ROOST(åpnes i et nytt vindu) for å identifisere utvikleres kritiske behov, teste modellen og produsere utviklerdokumentasjon. Som en del av denne lanseringen kommer ROOST til å etablere et modellfellesskap(åpnes i et nytt vindu), som også lanseres i dag, for å utforske åpne AI-modeller for å beskytte områder på nettet. Sammen med denne utgivelsen publiserer vi en kort teknisk rapport som forklarer sikkerhetsytelsen til denne utprøvingsmodellen.
Når det gjelder sikkerhet, tror vi på forsvar i dybde. Vi lærer opp modellene våre til å svare trygt, og vi implementerer ytterligere beskyttelseslag for å oppdage og håndtere potensielt usikre inndata og utdata i henhold til retningslinjene våre. Sikkerhetsklassifikatorer, som skiller sikkert fra usikkert innhold i et bestemt risikoområde, har lenge vært et primært forsvarslag for våre egne og andre store språkmodeller.
Tradisjonelle sikkerhetsklassifikatorer, som for eksempel de som er tilgjengelige via vårt Moderation API(åpnes i et nytt vindu), er utviklet ved å manuelt kuratere tusenvis av eksempler på sikkert og usikkert innhold, under forhåndsdefinerte sikkerhetspolicyer. Fra disse opplæringsdataene lærer klassifikatoren å skille sikre fra usikre utdata. I denne tradisjonelle tilnærmingen ser klassifikatoren aldri sikkerhetspolicyen. I stedet forsøker den å utlede den underliggende policyen som ble brukt til å merke eksemplene, ved å finne likheter i innholdet merket som usikkert og forskjeller mellom det usikre og sikre innholdet.
Tradisjonelle klassifikatorer kan ha høy ytelse, med lav latenstid og lave driftskostnader. Men innhenting av en tilstrekkelig mengde opplæringseksempler kan være tidskrevende og dyrt, og oppdatering eller endring av retningslinjene krever ny opplæring av klassifikatoren.
gpt-oss-safeguard skiller seg ut fordi resonneringsfunksjonene lar utviklere bruke hvilke som helst retningslinjer, inkludert retningslinjer de skriver selv eller henter fra andre kilder, og resonnering hjelper modellene med å generalisere basert på nylig skrevne retningslinjer. I tillegg til sikkerhetsretningslinjer kan gpt-oss-safeguard brukes til å merke innhold på andre måter som er viktige for spesifikke produkter og plattformer.
Nå lærer de primære resonneringsmodellene våre sikkerhetspolicyene direkte, og bruker resonneringsevnen sin til å vurdere hva som er trygt. Denne tilnærmingen, som vi kaller deliberativ tilpasning, forbedrer tidligere metoder for sikkerhetsopplæring betydelig og gjør resonneringsmodellene våre tryggere på flere akser enn forgjengerne uten resonnering, selv etter hvert som funksjonene deres øker. Men resonnering er ikke bare nyttig for å lære opp selve modellene. Det skaper også nye muligheter for forsvar i dybden. Resonneringsbaserte tilnærminger er mer fleksible og mindre begrenset av detaljene i den tidligere opplæringen sin, fordeler som noen ganger mer enn rettferdiggjør den ekstra datakraftkostnaden og forsinkelsen de medfører.
gpt-oss-safeguard er en implementering med åpen vekting av en tilnærming vi utviklet internt, i et verktøy vi kaller Safety Reasoner. Vi begynte med forsterkende finjustering av merkeoppgaver for retningslinjer, med belønning av modellen for å speile riktig dømmekraft fra menneskelige eksperter. Dette lærte modellen å resonnere om hvordan retningslinjen fører til bedømmelsen. I dag lar Safety Reasoner oss oppdatere sikkerhetsretningslinjene dynamisk i produksjon på mindre tid enn det hadde tatt å lære opp en klassifikator på nytt. Dette gjør Safety Reasoner til et viktig verktøy for iterativ utrulling: når vi ruller ut nye modeller til produksjon, starter vi ofte med strengere retningslinjer og bruker relativt store mengder datakraft der det er nødvendig for å la Safety Reasoner ta disse retningslinjene i bruk på en grundig måte. Så justerer vi retningslinjene når forståelsen vår av risikoene i produksjonen forbedres. I noen av de nylige lanseringene våre har andelen av total datakraft viet til sikkerhetsresonnering beveget seg så høyt som 16 %.
Safety Reasoner har blitt en kjernekomponent av sikkerhetsstrukturen vår. For bildegenerering og Sora 2 utfører den dynamiske, trinnvise evalueringen av utdata for å identifisere og blokkere usikre genereringer i sanntid. I domener som biologi og selvskading kjører vi modeller som de som brukes i Moderation API, som små, raske og høy-gjenfinning-klassifikatorer for å avgjøre hvilket innhold som er innen et interesseområde, og så bruker vi Safety Reasoner til å gjennomgå det innholdet. Safety Reasoner klassifiserer modellutdata mot en detaljert taksonomi for å fastslå hvordan man best skal respondere, og utgjør en del av vår flersjiktsbeskyttelse i systemer som GPT‑5 og ChatGPT Agent. Og nå gjør gpt-oss-safeguard-modellene denne samme tilnærmingen tilgjengelig for alle.
Vi evaluerte gpt-oss-safeguard-modellene på både interne og eksterne evalueringssett.
I den interne evalueringen ga vi flere retningslinjer samtidig til gpt-oss-safeguard på inferenstidspunktet. For alle testinndata evaluerer vi hvorvidt gpt-oss-safeguard klassifiserer teksten riktig i henhold til alle de inkluderte retningslinjene. Dette er en utfordrende oppgave. Modellen anses bare som nøyaktig hvis den stemmer nøyaktig overens med gullsettetikettene for alle de inkluderte retningslinjene.
Våre gpt-oss-safeguard-modeller og interne Safety Reasoner overgår gpt-5-thinking og open model-ene gpt-oss for nøyaktighet ved flere retningslinjer. Det at gpt-oss-safeguard-modellene overgår gpt-5-thinking, er spesielt overraskende med tanke på den beskjedne størrelsen til de førnevnte modellene.
Vi evaluerte disse modellene videre på modereringsdatasettet(åpnes i et nytt vindu) vi lanserte med forskningsartikkelen vår fra 2022(åpnes i et nytt vindu), og på ToxicChat(åpnes i et nytt vindu), en offentlig referanse basert på brukerspørringer til en chatbot med åpen kildekode.
På evalueringssettet for moderering fra 2022 evaluerte vi ved hjelp av våre interne sikkerhetsretningslinjer (med én retningslinje tilpasset for å ta høyde for senere endringer). gpt-oss-safeguard presterte litt bedre enn alle andre testede modeller, inkludert vår interne Safety Reasoner og gpt-5-thinking, selv om denne forskjellen mellom Safety Reasoner og gpt-oss-safeguard ikke er statistisk signifikant.
For ToxicChat evaluerte vi med en kort håndskrevet prompt tilpasset noen av de interne retningslinjene våre. Den interne Safety Reasoner overgikk igjen gpt-5-thinking, mens både gpt-5-thinking og Safety Reasoner marginalt overgår gpt-oss-safeguard-120b og gpt-oss-safeguard-20b. Vi forventer at den relativt beskjedne størrelsen til gpt-oss-safeguard fremdeles gjør at den foretrekkes for denne typen oppgave.
Det er to spesifikke begrensninger for gpt-oss-safeguard. Først har vi observert at klassifikatorer som er opplært på titusener merkede eksempler av høy kvalitet fremdeles kan prestere bedre for klassifisering av innhold enn gpt-oss-safeguard ved resonnement direkte fra retningslinjene. Det kan foretrekkes å bruke tid til å lære opp en dedikert klassifikator for høyere ytelse på mer komplekse risikoer.
For det andre kan gpt-oss-safeguard bruke mye tid og datakraft, noe som gjør det utfordrende å skalere for alt plattforminnhold. Internt håndterer vi dette på flere måter med Safety Reasoner: (1) vi bruker mindre og raskere klassifikatorer for å fastslå hvilket innhold som skal vurderes, og (2) i noen omstendigheter bruker vi Safety Reasoner asynkront for å gi en brukeropplevelse med lav forsinkelse, samtidig som vi opprettholder evnen til å gripe inn hvis vi oppdager utrygt innhold.
gpt-oss-safeguard er OpenAIs første sett med åpne sikkerhetsmodeller bygget med fellesskapet. Vi har iterert på gpt-oss-safeguard med spesialister innen tillit og sikkerhet hos SafetyKit, ROOST, Tomoro og Discord som en del av tidlig testing. ROOST CTO Vinay Rao sier «gpt-oss-safeguard er den første resonneringsmodellen med åpen kildekode som innbefatter “bruk dine egne retningslinjer og definisjoner på skade”. Organisasjoner fortjener å fritt studere, modifisere og bruke kritisk sikkerhetsteknologi og være i stand til å innovere. I testingen vår var den dyktig til å forstå forskjellige retningslinjer, forklare resonnementet sitt og vise nyanser ved bruk av retningslinjer, noe vi mener blir nyttig for byggere og sikkerhetsteam.»
Vi kommer til å fortsette å iterere med fellesskapet for å forbedre åpne sikkerhetsverktøy, inkludert via ROOST Model Community (RMC). RMC samler sikkerhetspraktikere og forskere for å dele god praksis for implementering av AI-modeller med åpen kildekode inn i sikkerhetsarbeidsflyter, inkludert evalueringsresultater og modelltilbakemeldinger. Gå til RMC GitHub-repo(åpnes i et nytt vindu) for å finne ut mer om dette partnerskapet og hvordan du kan bli involvert.
For å starte å bygge med disse modellene kan du laste dem ned fra Hugging Face(åpnes i et nytt vindu).

