Presentem gpt-oss-safeguard
Nous models oberts de raonament de seguretat (120b i 20b) que admeten polítiques de seguretat personalitzades.
Avui publiquem una vista prèvia de recerca de gpt-oss-safeguard, els nostres models de raonament de pes obert per a tasques de classificació de seguretat, disponibles en dues mides: gpt-oss-safeguard-120b i gpt-oss-safeguard-20b. Aquests models són versions amb ajustament fi dels nostres models oberts gpt-oss i estan disponibles amb la mateixa llicència permissiva Apache 2.0, cosa que permet a tothom utilitzar-los, modificar-los i desplegar-los lliurement. Tots dos models es poden descarregar avui des de Hugging Face(s'obre en una finestra nova).
Els models gpt-oss-safeguard utilitzen el raonament per interpretar directament una política proporcionada per un desenvolupador en el moment de la inferència, classificant els missatges dels usuaris, les complecions i els xats complets segons les necessitats del desenvolupador. El desenvolupador sempre decideix quina política s’ha d’utilitzar, de manera que les respostes són més rellevants i adaptades al cas d’ús del desenvolupador. El model utilitza cadena de pensament, que el desenvolupador pot revisar per entendre com el model arriba a les seves decisions. A més, la política es proporciona durant la inferència, en lloc d'entrenar-se en el model, de manera que és fàcil per als desenvolupadors revisar iterativament les polítiques per augmentar el rendiment. Aquest enfocament, que vam desenvolupar inicialment per a ús intern, és significativament més flexible que el mètode tradicional d’entrenar un classificador perquè infereixi indirectament una frontera de decisió a partir d’un gran nombre d’exemples etiquetats.
gpt-oss-safeguard permet als desenvolupadors definir els límits de la política que millor s’ajusten al seu cas d’ús. Per exemple, un fòrum de debat sobre videojocs podria voler que desenvolupessis una política per classificar les publicacions que parlen de fer trampes al joc, o un lloc de ressenyes de productes podria voler que utilitzessis la seva pròpia política per filtrar les ressenyes que semblen susceptibles de ser falses.
El model pren dues entrades alhora —una política i el contingut que s’ha de classificar segons aquesta política— i genera una conclusió sobre on s’emmarca el contingut, juntament amb el seu raonament. Els desenvolupadors decideixen com utilitzar aquestes conclusions, si és que ho fan, en els seus propis fluxos de treball de seguretat. Hem vist que aquest enfocament basat en el raonament funciona especialment bé en situacions en què:
- El dany potencial està sorgint o evolucionant, i les polítiques s’han d’adaptar ràpidament.
- El domini presenta molts matisos i és difícil de tractar per als classificadors més petits.
- Els desenvolupadors no tenen prou mostres per entrenar un classificador d’alta qualitat per a cada risc a la seva plataforma.
- La latència és menys important que produir etiquetes d’alta qualitat i explicables.
Llancem aquesta versió preliminar de gpt-oss-safeguard per rebre comentaris de la comunitat de recerca i seguretat i continuar iterant sobre el rendiment del model. Durant mesos, hem treballat en aquest llançament de pes obert amb ROOST(s'obre en una finestra nova) per identificar les necessitats crítiques dels desenvolupadors, provar el model i elaborar documentació per a desenvolupadors. Com a part d’aquest llançament, ROOST establirà una comunitat de models(s'obre en una finestra nova), que també es llança avui, per explorar models d’IA oberts per protegir els espais en línia. Juntament amb aquest llançament, publiquem un breu informe tècnic que detalla el rendiment de seguretat d’aquest model en versió preliminar.
Pel que fa a la seguretat, creiem en la defensa en profunditat. Entrenem els nostres models perquè responguin de manera segura, i implementem capes addicionals de protecció per detectar i abordar entrades i sortides potencialment insegures d'acord amb les nostres polítiques. Els classificadors de seguretat, que distingeixen el contingut segur del no segur en una àrea de risc concreta, han estat durant molt de temps una capa principal de defensa per als nostres models de llenguatge gran i els d'altres.
Els classificadors de seguretat tradicionals, com els disponibles a través de la nostra API de moderació(s'obre en una finestra nova), es desenvolupen seleccionant i revisant manualment milers d’exemples de contingut segur i insegur, d’acord amb polítiques de seguretat predefinides. A partir d’aquestes dades d’entrenament, el classificador aprèn a distingir les sortides segures de les insegures. En aquest enfocament tradicional, el classificador mai no arriba a veure realment la política de seguretat. En canvi, intenta inferir la política subjacent que es va utilitzar per etiquetar els exemples trobant similituds en el contingut etiquetat com a no segur i diferències entre el contingut no segur i el contingut segur.
Els classificadors tradicionals poden tenir un rendiment alt, amb baixa latència i cost operatiu. Però reunir una quantitat suficient d’exemples d’entrenament pot requerir molt de temps i ser costós, i actualitzar o canviar la política requereix tornar a entrenar el classificador.
gpt-oss-safeguard és diferent perquè les seves capacitats de raonament permeten als desenvolupadors aplicar qualsevol política, incloses les que escriuen ells mateixos o extreuen d'altres fonts, i el raonament ajuda els models a generalitzar sobre polítiques acabades d'escriure. Més enllà de les polítiques de seguretat, gpt-oss-safeguard es pot utilitzar per etiquetar contingut d’altres maneres que són importants per a productes i plataformes concrets.
Els nostres principals models de raonament ara aprenen directament les nostres polítiques de seguretat i fan servir les seves capacitats de raonament per raonar sobre què és segur. Aquest enfocament, que anomenem alineació deliberativa, millora significativament els mètodes anteriors d’entrenament en seguretat i fa que els nostres models de raonament siguin més segurs en diversos eixos que els seus predecessors sense raonament, fins i tot a mesura que augmenten les seves capacitats. Però el raonament no només és útil per entrenar els mateixos models. També obre noves possibilitats per a la defensa en profunditat. Els enfocaments basats en el raonament són més flexibles i estan menys limitats pels detalls del seu entrenament anterior, avantatges que de vegades justifiquen amb escreix el cost addicional de còmput i la latència que impliquen.
gpt-oss-safeguard és una implementació amb pesos oberts d’un enfocament que vam desenvolupar internament en una eina que anomenem Safety Reasoner. Vam començar amb afinament per reforç en tasques d’etiquetatge de polítiques, recompensant el model per reflectir els judicis correctes d’experts humans. Això va ensenyar al model a raonar sobre com la política porta al seu judici. Actualment, Safety Reasoner ens permet actualitzar dinàmicament les nostres polítiques de seguretat en producció en menys temps del que caldria per tornar a entrenar un classificador. Això fa que Safety Reasoner sigui una eina clau per al desplegament iteratiu: quan despleguem nous models en producció, sovint comencem amb polítiques més estrictes i utilitzem quantitats relativament grans de còmput on cal per permetre que Safety Reasoner apliqui aquestes polítiques amb cura. Aleshores ajustem les nostres polítiques a mesura que millora la nostra comprensió dels riscos en producció. En alguns dels nostres llançaments recents, la fracció del còmput total dedicada al raonament de seguretat ha arribat fins al 16 %.
Safety Reasoner s’ha convertit en un component fonamental de la nostra pila de seguretat. Per a la generació d'imatges i Sora 2, fa avaluacions dinàmiques i pas a pas dels resultats per identificar i bloquejar generacions no segures en temps real. En àmbits com la biologia i les autolesions, fem servir models com els que s'utilitzen a l'API de moderació com a classificadors petits, ràpids i d'alta recuperació per determinar quin contingut es troba dins d'un àmbit d'interès, i després fem servir Safety Reasoner per revisar aquest contingut. Safety Reasoner classifica els resultats del model segons una taxonomia detallada per determinar la millor manera de respondre, i forma part de les nostres salvaguardes multicapa en sistemes com GPT‑5 i ChatGPT Agent. I, ara, els models gpt-oss-safeguard posen aquest mateix enfocament a disposició de tothom.
Vam avaluar els models gpt-oss-safeguard en conjunts d’avaluació tant interns com externs.
En l’avaluació interna, vam proporcionar diverses polítiques simultàniament a gpt-oss-safeguard en el moment de la inferència. Per a cada entrada de prova, avaluem si gpt-oss-safeguard classifica correctament el text segons totes les polítiques incloses. Aquesta és una tasca difícil: el model només es considera precís si coincideix exactament amb les etiquetes del conjunt d’etiquetes d’or per a totes les polítiques incloses.
Els nostres models gpt-oss-safeguard i el Safety Reasoner intern superen gpt-5-thinking i els models oberts de gpt-oss en precisió multipolítica. Que els models gpt-oss-safeguard superin gpt-5-thinking és especialment sorprenent donada la mida petita dels primers models.
A més, vam avaluar aquests models amb el conjunt de dades de moderació(s'obre en una finestra nova) que vam publicar amb el nostre article de recerca de 2022(s'obre en una finestra nova) i amb ToxicChat(s'obre en una finestra nova), un punt de referència públic basat en consultes d’usuaris a un xatbot de codi obert.
En el conjunt d’avaluació de moderació de 2022, vam fer l’avaluació utilitzant les nostres polítiques internes de seguretat (adaptant una política per tenir en compte els canvis posteriors). gpt-oss-safeguard va superar lleugerament tots els altres models provats, inclosos el nostre Safety Reasoner intern i gpt-5-thinking, tot i que aquesta diferència entre Safety Reasoner i gpt-oss-safeguard no és estadísticament significativa.
Pel que fa a ToxicChat, vam avaluar utilitzant una indicació curta escrita a mà adaptada d'algunes de les nostres polítiques internes. El nostre Safety Reasoner intern va tornar a superar gpt-5-thinking, mentre que gpt-5-thinking i Safety Reasoner superen tots dos lleugerament gpt-oss-safeguard-120b i gpt-oss-safeguard-20b. Preveiem que la mida relativament reduïda de gpt-oss-safeguard encara el fa preferible per a aquest tipus de tasques.
Hi ha dues limitacions específiques de gpt-oss-safeguard. En primer lloc, hem observat que els classificadors entrenats amb desenes de milers de mostres etiquetades d'alta qualitat encara poden tenir un millor rendiment a l'hora de classificar contingut que gpt-oss-safeguard quan fa raonament directament a partir de la política. Pot ser preferible dedicar temps a entrenar un classificador dedicat per obtenir un rendiment més alt en riscos més complexos.
En segon lloc, gpt-oss-safeguard pot requerir molt de temps i molts recursos computacionals, cosa que dificulta escalar-lo a tot el contingut de la plataforma. Internament, gestionem això de diverses maneres amb Safety Reasoner: (1) utilitzem classificadors més petits i més ràpids per determinar quin contingut cal avaluar i (2) en algunes circumstàncies, utilitzem Safety Reasoner de manera asíncrona per oferir una experiència d’usuari de baixa latència, tot mantenint la capacitat d’intervenir si detectem contingut no segur.
gpt-oss-safeguard és el primer conjunt de models de seguretat oberts d'OpenAI desenvolupat amb la comunitat. Hem fet diverses iteracions de gpt-oss-safeguard amb especialistes en confiança i seguretat de SafetyKit, ROOST, Tomoro i Discord com a part de les proves inicials. El CTO de ROOST, Vinay Rao, diu: "gpt-oss-safeguard és el primer model de raonament de codi obert amb un disseny de 'porta les teves pròpies polítiques i definicions de dany'. Les organitzacions mereixen poder estudiar, modificar i utilitzar lliurement tecnologies crítiques per a la seguretat, i poder innovar. En les nostres proves, va demostrar habilitat a l’hora d’entendre diferents polítiques, explicar el seu raonament i mostrar matisos en aplicar les polítiques, cosa que creiem que serà beneficiosa per als desenvolupadors i els equips de seguretat".
Continuarem iterant amb la comunitat per millorar les eines de seguretat obertes, inclòs a través de la ROOST Model Community (RMC). La RMC reuneix professionals i investigadors de seguretat per compartir les millors pràctiques per implementar models d'IA de codi obert en fluxos de treball de seguretat, inclosos els resultats de les avaluacions i els comentaris sobre els models. Visita el repositori de GitHub de RMC(s'obre en una finestra nova) per obtenir més informació sobre aquesta col·laboració i com participar-hi.
Per començar a crear amb aquests models, descarrega'ls des de Hugging Face(s'obre en una finestra nova).

