Vandaag brengen we een onderzoekspreview uit van gpt-oss-safeguard, onze open-weight redenerende modellen voor veiligheidsclassificatietaken, die beschikbaar zijn in twee groottes: gpt-oss-safeguard-120b en gpt-oss-safeguard-20b. Deze modellen zijn fijngetunede versies van onze gpt-oss-open modellen en zijn beschikbaar onder dezelfde permissieve Apache 2.0-licentie, waardoor iedereen ze vrij kan gebruiken, wijzigen en implementeren. Beide modellen kunnen vandaag worden gedownload van Hugging Face(opent in een nieuw venster).
De gpt-oss-safeguard-modellen gebruiken redenering om tijdens inferentie rechtstreeks een door de ontwikkelaar verstrekt beleid te interpreteren. Daarbij classificeren ze gebruikersberichten, voltooiingen en volledige chats volgens de behoeften van de ontwikkelaar. De ontwikkelaar bepaalt altijd welk beleid wordt gebruikt, zodat de reacties relevanter zijn en beter aansluiten bij de usecase van de ontwikkelaar. Het model gebruikt een redeneerketen, die de ontwikkelaar kan bekijken om te begrijpen hoe het model tot zijn beslissingen komt. Bovendien wordt het beleid tijdens inferentie verstrekt in plaats van in het model te worden getraind, zodat ontwikkelaars het beleid eenvoudig iteratief kunnen herzien om de prestaties te verbeteren. Deze aanpak, die we aanvankelijk voor intern gebruik hebben ontwikkeld, is aanzienlijk flexibeler dan de traditionele methode waarbij een classifier wordt getraind om uit een groot aantal gelabelde voorbeelden indirect een beslissingsgrens af te leiden.
Met gpt-oss-safeguard kunnen ontwikkelaars de beleidsgrenzen bepalen die het beste bij hun usecase passen. Een discussieforum over videogames kan bijvoorbeeld beleid ontwikkelen om berichten te classificeren waarin valsspelen in de game wordt besproken, terwijl een website met productrecensies eigen beleid kan gebruiken om recensies te screenen die waarschijnlijk nep zijn.
Het model verwerkt twee soorten invoer tegelijk: een beleid en de inhoud die volgens dat beleid moet worden geclassificeerd. Vervolgens geeft het een conclusie over de categorie waarin de inhoud valt, samen met de achterliggende redenering. Ontwikkelaars beslissen zelf of en hoe ze die conclusies in hun eigen veiligheidspijplijnen gebruiken. We hebben gezien dat deze op redenering gebaseerde aanpak bijzonder goed werkt in situaties waarin:
- De potentiële schade is nieuw of verandert voortdurend, en het beleid moet zich snel kunnen aanpassen.
- Het domein is zeer genuanceerd en moeilijk te hanteren voor kleinere classificatoren.
- Ontwikkelaars hebben onvoldoende voorbeelden om voor elk risico op hun platform een hoogwaardige classifier te trainen.
- Latentie is minder belangrijk dan het produceren van hoogwaardige, verklaarbare labels.
We brengen deze preview van gpt-oss-safeguard uit om feedback te ontvangen van de onderzoeks- en veiligheidsgemeenschap en de prestaties van het model verder te verbeteren. Maandenlang hebben we samen met ROOST(opent in een nieuw venster) aan deze open-weight release gewerkt om de belangrijkste behoeften van ontwikkelaars in kaart te brengen, het model te testen en documentatie voor ontwikkelaars op te stellen. Als onderdeel van deze lancering richt ROOST een modelcommunity(opent in een nieuw venster) op, die eveneens vandaag van start gaat, om open AI-modellen te onderzoeken waarmee online omgevingen kunnen worden beschermd. Naast deze release publiceren we een kort technisch rapport met gedetailleerde informatie over de veiligheidsprestaties van dit previewmodel.
Als het om veiligheid gaat, geloven wij in gelaagde beveiliging. We trainen onze modellen om veilig te reageren en implementeren aanvullende beschermingslagen om potentieel onveilige invoer en uitvoer te detecteren en aan te pakken in overeenstemming met onze beleidsregels. Veiligheidsclassifiers, die binnen een bepaald risicogebied onderscheid maken tussen veilige en onveilige inhoud, vormen al lange tijd een primaire verdedigingslaag voor onze eigen grote taalmodellen en die van anderen.
Traditionele veiligheidsclassificatoren, zoals die beschikbaar zijn via onze Moderation API(opent in een nieuw venster), worden ontwikkeld door handmatig duizenden voorbeelden van veilige en onveilige inhoud te selecteren, op basis van vooraf gedefinieerde veiligheidsbeleidsregels. Aan de hand van deze trainingsgegevens leert de classifier onderscheid te maken tussen veilige en onveilige uitvoer. Bij deze traditionele aanpak krijgt de classifier het veiligheidsbeleid nooit daadwerkelijk te zien. In plaats daarvan probeert de classifier het onderliggende beleid af te leiden dat is gebruikt om de voorbeelden te labelen, door te zoeken naar overeenkomsten tussen de als onveilig gelabelde inhoud en naar verschillen tussen de onveilige en veilige inhoud.
Traditionele classifiers kunnen zeer goed presteren, met een lage latentie en lage operationele kosten. Het verzamelen van voldoende trainingsvoorbeelden kan echter tijdrovend en kostbaar zijn, en als het beleid wordt bijgewerkt of gewijzigd, moet de classifier opnieuw worden getraind.
gpt-oss-safeguard is anders, omdat ontwikkelaars dankzij de redeneercapaciteiten van het model elk beleid kunnen toepassen, waaronder beleid dat ze zelf schrijven of uit andere bronnen halen. Dankzij redenering kunnen de modellen bovendien generaliseren op basis van nieuw geschreven beleidsregels. Naast veiligheidsbeleid kan gpt-oss-safeguard worden gebruikt om inhoud op andere manieren te labelen die belangrijk zijn voor specifieke producten en platforms.
Onze primaire redenerende modellen leren ons veiligheidsbeleid nu rechtstreeks en gebruiken hun redeneercapaciteiten om te bepalen wat veilig is. Deze aanpak, die we deliberative alignment noemen, is een aanzienlijke verbetering ten opzichte van eerdere veiligheidstrainingsmethoden en maakt onze redernerende modellen op meerdere vlakken veiliger dan hun niet-redenerende voorgangers, zelfs naarmate hun capaciteiten toenemen. Maar redeneren is niet alleen nuttig voor het trainen van de modellen zelf. Het creëert ook nieuwe mogelijkheden voor diepgaande verdediging. Benaderingen op basis van redenering zijn flexibeler en minder beperkt door de details van hun eerdere training, voordelen die de extra rekenkosten en latentie die ermee gepaard gaan soms meer dan rechtvaardigen.
gpt-oss-safeguard is een open-weight implementatie van een aanpak die we intern hebben ontwikkeld, in een tool die we Safety Reasoner noemen. We zijn begonnen met fine-tunen met reinforcement learning op taken voor beleidslabeling, waarbij het model werd beloond voor het spiegelen van correcte beoordelingen van menselijke experts. Hierdoor leerde het model te redeneren over hoe het beleid tot het oordeel heeft geleid. Tegenwoordig stelt Safety Reasoner ons in staat om ons veiligheidsbeleid in productie dynamisch bij te werken in minder tijd dan nodig zou zijn om een classifier opnieuw te trainen. Dit maakt Safety Reasoner een belangrijke tool voor iteratieve implementatie: wanneer we nieuwe modellen in productie nemen, beginnen we vaak met strenger beleid en gebruiken we waar nodig relatief veel rekenkracht, zodat Safety Reasoner dat beleid zorgvuldig kan toepassen. Vervolgens passen we onze beleidsregels aan naarmate ons inzicht in de risico's in productie toeneemt. Bij sommige van onze recente lanceringen werd maar liefst 16% van de totale compute besteed aan veiligheidsredenering.
Safety Reasoner is een kernonderdeel geworden van onze veiligheidsstack. Voor beeldgeneratie en Sora 2 voert het dynamische, stapsgewijze evaluaties van uitvoer uit om onveilige generaties in realtime te identificeren en blokkeren. Op gebieden zoals biologie en zelfbeschadiging voeren we vergelijkbare modellen als in de Moderation API uit als kleine, snelle en zeer nauwkeurige classifiers om te bepalen welke inhoud binnen een bepaald domein valt. Vervolgens gebruiken we Safety Reasoner om die inhoud te beoordelen. Safety Reasoner classificeert modeluitvoer aan de hand van een gedetailleerde taxonomie om te bepalen hoe het beste kan worden gereageerd. Dit maakt deel uit van onze meerlaagse beschermingsmaatregelen voor systemen zoals GPT‑5 en ChatGPT‑agent. En met de gpt-oss-safeguard-modellen komt deze aanpak nu voor iedereen beschikbaar.
We hebben de gpt-oss-safeguard-modellen geëvalueerd op zowel interne als externe evaluatiesets.
Bij de interne evaluatie hebben we tijdens de inferentie meerdere beleidsregels tegelijk aan gpt-oss-safeguard aangeboden. Voor elke testinvoer beoordelen we of gpt-oss-safeguard de tekst correct classificeert volgens alle opgenomen beleidsregels. Dit is een uitdagende taak: het model wordt alleen als nauwkeurig beschouwd als het exact overeenkomt met de gouden labels uit de referentieset voor alle opgenomen beleidsregels.
Onze gpt-oss-safeguard-modellen en interne Safety Reasoner presteren beter dan gpt-5-thinking en de gpt-oss-open modellen op nauwkeurigheid over meerdere beleidsregels. Het feit dat de gpt-oss-safeguard-modellen beter presteren dan gpt-5-thinking is vooral verrassend gezien de kleine omvang van de eerstgenoemde modellen.
We hebben deze modellen verder geëvalueerd op de moderatiedataset(opent in een nieuw venster) die we hebben gepubliceerd in ons onderzoeksrapport uit 2022(opent in een nieuw venster) en op ToxicChat(opent in een nieuw venster), een openbare benchmark gebaseerd op query's van gebruikers aan een opensourcechatbot.
Op basis van de moderatie-evaluatieset van 2022 hebben we een evaluatie uitgevoerd aan de hand van onze interne veiligheidsbeleidsregels (waarbij we één beleidsregel hebben aangepast om rekening te houden met latere wijzigingen). gpt-oss-safeguard presteerde iets beter dan alle andere geteste modellen, waaronder onze interne Safety Reasoner en gpt-5-thinking, met als kanttekening dat het verschil tussen Safety Reasoner en gpt-oss-safeguard statistisch niet significant is.
Voor ToxicChat hebben we een korte, handgeschreven prompt geëvalueerd die is aangepast op basis van een aantal van onze interne beleidsregels. Onze interne Safety Reasoner presteerde opnieuw beter dan gpt-5-thinking, terwijl gpt-5-thinking en Safety Reasoner beide marginaal beter presteerden dan gpt-oss-safeguard-120b en gpt-oss-safeguard-20b. We verwachten dat gpt-oss-safeguard vanwege zijn relatief kleine omvang nog steeds de voorkeur geniet voor dit soort taken.
Er zijn twee specifieke beperkingen van gpt-oss-safeguard. Ten eerste hebben we geconstateerd dat classifiers die zijn getraind op tienduizenden hoogwaardige gelabelde voorbeelden nog steeds beter presteren bij het classificeren van inhoud dan gpt-oss-safeguard wanneer redenering rechtstreeks vanuit het beleid plaatsvindt. Voor betere prestaties bij complexere risico's heeft het de voorkeur om de tijd te nemen om een speciale classifier te trainen.
Ten tweede kan gpt-oss-safeguard tijdrovend zijn en veel rekenkracht kosten, waardoor het lastig is om het op alle platforminhoud toe te passen. Intern pakken we dit met Safety Reasoner op verschillende manieren aan: (1) we gebruiken kleinere en snellere classifiers om te bepalen welke inhoud moet worden beoordeeld en (2) in sommige gevallen gebruiken we Safety Reasoner asynchroon om een gebruikerservaring met lage latentie te bieden, terwijl we kunnen blijven ingrijpen als we onveilige inhoud detecteren.
gpt-oss-safeguard is de eerste set open veiligheidsmodellen van OpenAI die samen met de community is ontwikkeld. We hebben gpt-oss-safeguard iteratief aangepast met vertrouwens- en veiligheidsspecialisten bij SafetyKit, ROOST, Tomoro en Discord als onderdeel van vroege tests. Vinay Rao, CTO van ROOST, zegt: "gpt-oss-safeguard is het eerste open source-redenerend model met een 'bring your own policies and definitions of harm'-ontwerp." Organisaties verdienen het om kritieke veiligheidstechnologieën vrij te bestuderen, aan te passen en te gebruiken en om te kunnen innoveren. In onze tests bleek het systeem goed in staat om verschillende beleidsregels te begrijpen, zijn redenering uit te leggen en nuances te tonen bij het toepassen van de beleidsregels, wat naar onze mening gunstig zal zijn voor bouwers en veiligheidsteams."
We blijven samenwerken met de community om open veiligheidstools te verbeteren, onder meer via de ROOST Model Community (RMC). De RMC brengt veiligheidsdeskundigen en onderzoekers samen om best practices te delen voor de implementatie van open source AI-modellen in veiligheidsworkflows, inclusief evaluatieresultaten en feedback over het model. Ga naar de GitHub-repository van de RMC(opent in een nieuw venster) voor meer informatie over deze samenwerking en hoe je kunt deelnemen.
Download de modellen via Hugging Face(opent in een nieuw venster) om ermee aan de slag te gaan.

