Presentamos gpt-oss-safeguard
Nuevos modelos abiertos de razonamiento de seguridad (120b y 20b) compatibles con políticas de seguridad personalizadas.
Hoy lanzamos una versión preliminar de investigación de gpt-oss-safeguard, nuestros modelos de razonamiento con pesos abiertos para tareas de clasificación de seguridad, disponibles en dos tamaños: gpt-oss-safeguard-120b y gpt-oss-safeguard-20b. Estos modelos son versiones perfeccionadas de nuestros modelos abiertos gpt-oss y están disponibles bajo la misma licencia permisiva Apache 2.0, que permite que cualquier persona pueda usarlos, modificarlos e implementarlos libremente. Ambos modelos pueden descargarse hoy desde Hugging Face(se abre en una ventana nueva).
Los modelos gpt-oss-safeguard utilizan el razonamiento para interpretar directamente una política provista por el desarrollador en el momento de la inferencia, clasificando mensajes de usuario, resultados generados y chats completos en función de las necesidades del desarrollador. El desarrollador siempre decide qué política usar. Por eso, las respuestas son más relevantes y están adaptadas al caso de uso del desarrollador. El desarrollador puede revisar la cadena de pensamiento que utiliza el modelo para comprender cómo el modelo llega a sus decisiones. Además, durante la inferencia, se proporciona la política en lugar de entrenar al modelo en ella. Por esto, es fácil que los desarrolladores revisen las políticas de manera iterativa para aumentar el rendimiento. Este enfoque, que desarrollamos inicialmente para uso interno, es significativamente más flexible que el método tradicional de entrenar un clasificador para inferir indirectamente un límite de decisión a partir de una gran cantidad de ejemplos etiquetados.
gpt-oss-safeguard permite a los desarrolladores establecer los límites de la política que mejor se adapten a su caso de uso. Por ejemplo, un foro de debate sobre videojuegos podría querer desarrollar una política para clasificar publicaciones que hablen sobre hacer trampa en el juego, o un sitio de reseñas de productos podría querer usar su propia política para filtrar reseñas que parezcan falsas.
El modelo toma dos entradas a la vez —una política y el contenido que debe clasificarse según esa política— y produce una conclusión sobre dónde se ubica el contenido, junto con su razonamiento. Los desarrolladores deciden cómo utilizar esas conclusiones en sus propios procesos de seguridad, si es que las utilizan. Hemos visto que este enfoque basado en el razonamiento funciona especialmente bien en situaciones en las que:
- El daño potencial está surgiendo o evolucionando y las políticas deben adaptarse rápidamente.
- El ámbito presenta muchos matices y es difícil de manejar para clasificadores más pequeños.
- Los desarrolladores no tienen suficientes muestras para entrenar un clasificador de alta calidad para cada riesgo en su plataforma.
- La latencia es menos importante que producir etiquetas de alta calidad que sean explicables.
Vamos a lanzar esta versión preliminar de gpt-oss-safeguard para recibir comentarios por parte de la comunidad de investigación y seguridad, y para seguir mejorando el rendimiento del modelo de manera iterativa. Durante meses, trabajamos con ROOST(se abre en una ventana nueva) en este lanzamiento de modelos con pesos abiertos para identificar las necesidades críticas de los desarrolladores, probar el modelo y elaborar documentación para desarrolladores. Como parte de este lanzamiento, ROOST establecerá una comunidad de modelos de IA(se abre en una ventana nueva), que también se lanza hoy mismo, para explorar los modelos de IA abiertos con el fin de proteger los espacios en línea. Junto con este lanzamiento, vamos a publicar un breve informe técnico que detalla el rendimiento de seguridad de este modelo de versión preliminar.
Cuando se trata de seguridad, creemos en la defensa en profundidad. Entrenamos a nuestros modelos para responder con seguridad e implementamos capas adicionales de protección para detectar y abordar entradas y salidas potencialmente inseguras de acuerdo con nuestras políticas. Los clasificadores de seguridad, que distinguen el contenido seguro del inseguro en un área de riesgo en particular, han sido durante mucho tiempo la primera línea de defensa para los grandes modelos de lenguaje, tanto los nuestros como los de otras empresas.
Los clasificadores de seguridad tradicionales, como aquellos disponibles mediante nuestra API de moderación(se abre en una ventana nueva), se desarrollan al seleccionar manualmente miles de ejemplos de contenido seguro e inseguro, de acuerdo con políticas de seguridad predefinidas. A partir de estos datos de entrenamiento, el clasificador aprende a distinguir las salidas seguras de las inseguras. En este enfoque tradicional, el clasificador nunca llega a ver la política de seguridad. En su lugar, intenta inferir la política subyacente que se utilizó para etiquetar los ejemplos mediante la búsqueda de similitudes en el contenido etiquetado como inseguro y las diferencias entre el contenido seguro y el no seguro.
Los clasificadores tradicionales pueden tener un alto rendimiento, con baja latencia y bajo coste operativo. Sin embargo, recopilar una cantidad suficiente de ejemplos de entrenamiento puede llevar mucho tiempo y ser costoso, y actualizar o cambiar la política requiere volver a entrenar el clasificador.
gpt-oss-safeguard es diferente porque sus capacidades de razonamiento les permiten a los desarrolladores aplicar cualquier política, incluidas algunas que elaboran ellos mismos o que toman de otras fuentes, y el razonamiento ayuda a los modelos a generalizar con respecto a nuevas políticas escritas. Más allá de las políticas de seguridad, se puede utilizar gpt-oss-safeguard para etiquetar contenido de otras maneras que son importantes para productos y plataformas específicos.
Nuestros principales modelos de razonamiento ahora aprenden nuestras políticas de seguridad directamente y usan sus capacidades de razonamiento para determinar qué es seguro. Este enfoque, que llamamos alineación deliberativa, mejora significativamente los métodos de entrenamiento de seguridad anteriores y hace que nuestros modelos de razonamiento sean más seguros en varios aspectos que sus predecesores sin razonamiento, incluso a medida que sus capacidades aumentan. Pero el razonamiento no solo es útil para entrenar los modelos. También crea nuevas posibilidades para la defensa en profundidad. Los enfoques basados en el razonamiento son más flexibles y menos limitados por los detalles de su entrenamiento previo, lo que ofrece ventajas que a veces justifican con creces el coste informático y la latencia adicionales que implican.
gpt-oss-safeguard es una implementación con pesos abiertos de un enfoque que desarrollamos internamente, en una herramienta que llamamos Safety Reasoner. Comenzamos con ajuste fino por refuerzo en tareas de etiquetado de políticas, recompensando al modelo por reflejar los juicios correctos de expertos humanos. Esto enseñó al modelo a razonar sobre cómo la política conduce a su juicio. A día de hoy, Safety Reasoner nos permite actualizar nuestras políticas de seguridad en producción de forma dinámica en menos tiempo del que tardaría volver a entrenar un clasificador. Esto convierte a Safety Reasoner en una herramienta clave para la implementación iterativa: cuando implementamos nuevos modelos en producción, a menudo comenzamos con políticas más estrictas y usamos cantidades relativamente grandes de cómputo cuando es necesario para permitir que Safety Reasoner aplique cuidadosamente esas políticas. Luego ajustamos nuestras políticas a medida que mejora nuestra comprensión de los riesgos en producción. En algunos de nuestros lanzamientos recientes, la fracción del total de recursos informáticos destinados al razonamiento de seguridad ha alcanzado hasta un 16 %.
Safety Reasoner se ha convertido en un componente clave de nuestra pila de seguridad. Para la generación de imágenes y Sora 2, realiza evaluaciones dinámicas y paso a paso de las salidas para identificar y bloquear generaciones inseguras en tiempo real. En dominios como biología y autolesiones, utilizamos modelos similares a los de la API de moderación como clasificadores pequeños, rápidos y de alta sensibilidad para determinar qué contenido está dentro del dominio de interés, y luego usamos Safety Reasoner para revisar ese contenido. Safety Reasoner clasifica las salidas del modelo según una taxonomía detallada para determinar la mejor forma de responder, formando parte de nuestras medidas de protección multicapa en sistemas como GPT‑5 y el agente ChatGPT. Y ahora, los modelos gpt-oss-safeguard permiten que este mismo enfoque esté disponible para cualquier persona.
Evaluamos los modelos gpt-oss-safeguard en conjuntos de evaluación tanto internos como externos.
En la evaluación interna, proporcionamos a gpt-oss-safeguard varias políticas simultáneamente en el momento de la inferencia. Para cada entrada de prueba, evaluamos si gpt-oss-safeguard clasifica correctamente el texto siguiendo todas las políticas incluidas. Esta es una tarea desafiante: el modelo solo se considera preciso si coincide exactamente con las etiquetas del conjunto de referencia para todas las políticas incluidas.
Nuestros modelos gpt-oss-safeguard y el Safety Reasoner interno superan a gpt-5-thinking y a los modelos abiertos gpt-oss en precisión multipolítica. Sorprende especialmente el rendimiento superior de los modelos gpt-oss-safeguard on respecto a gpt-5-thinking, teniendo en cuenta lo pequeños que son los primeros.
Evaluamos con más profundidad estos modelos en el conjunto de datos de moderación(se abre en una ventana nueva) que lanzamos con nuestro trabajo de investigación de 2022(se abre en una ventana nueva) y en ToxicChat(se abre en una ventana nueva), unas pruebas de referencia públicas que se basan en consultas de usuarios a un chatbot de código abierto.
En el conjunto de evaluación de moderación de 2022, realizamos la evaluación basándonos en nuestras políticas internas de seguridad (adaptando una de las políticas para tener en cuenta cambios posteriores). gpt-oss-safeguard superó ligeramente a todos los demás modelos evaluados, incluso nuestro Safety Reasoner interno y gpt-5-thinking, aunque esta diferencia entre Safety Reasoner y gpt-oss-safeguard no es estadísticamente significativa.
En el caso de ToxicChat, realizamos la evaluación con un prompt breve redactado manualmente y adaptado de algunas de nuestras políticas internas. Nuestro Safety Reasoner interno nuevamente superó a gpt-5-thinking, mientras que tanto gpt-5-thinking como Safety Reasoner superaron por un margen reducido a gpt-oss-safeguard-120b y a gpt-oss-safeguard-20b. Esperamos que el tamaño relativamente pequeño de gpt-oss-safeguard lo siga haciendo preferible para este tipo de tareas.
Hay dos limitaciones específicas de gpt-oss-safeguard. En primer lugar, hemos observado que los clasificadores entrenados con decenas de miles de muestras etiquetadas de alta calidad pueden clasificar contenido mejor que gpt-oss-safeguard cuando este razona directamente a partir de la política. Para obtener un mejor rendimiento en riesgos más complejos, puede ser preferible dedicar tiempo a entrenar a un clasificador específico.
En segundo lugar, gpt-oss-safeguard puede requerir mucho tiempo y recursos informáticos, lo que dificulta su escalabilidad en todo el contenido de la plataforma. Internamente, gestionamos esto de varias formas con Safety Reasoner: (1) utilizamos clasificadores más pequeños y rápidos para determinar qué contenido evaluar y (2) en algunas circunstancias, utilizamos Safety Reasoner de forma asíncrona para proporcionar una experiencia de usuario de baja latencia, al tiempo que mantenemos la capacidad de intervenir si detectamos contenido inseguro.
gpt-oss-safeguard es el primer conjunto de modelos de seguridad abiertos de OpenAI desarrollados con la comunidad. Hemos realizado iteraciones en gpt-oss-safeguard con especialistas en confianza y seguridad en SafetyKit, ROOST, Tomoro y Discord como parte de las pruebas iniciales. Vinay Rao, director de tecnología de ROOST, asegura que «gpt-oss-safeguard es el primer modelo de razonamiento de código abierto con un diseño que permite incorporar tus propias políticas y definiciones de daño. Las organizaciones merecen poder estudiar, modificar y utilizar libremente las tecnologías críticas para la seguridad, además de poder innovar. En nuestras pruebas, demostró su habilidad para comprender diferentes políticas, explicar su razonamiento y mostrar matices en la aplicación de las políticas. Creemos que esto será beneficioso para los desarrolladores y los equipos de seguridad».
Seguiremos colaborando con la comunidad para mejorar las herramientas abiertas de seguridad, incluso por medio de la Comunidad de Modelos de ROOST (RMC). La RMC reúne investigadores y profesionales de seguridad para compartir las buenas prácticas para implementar modelos de IA de código abierto en flujos de trabajo de seguridad, incluidos los resultados de la evaluación y los comentarios sobre el modelo. Visita el repositorio de GitHub de RMC(se abre en una ventana nueva) para obtener más información sobre esta asociación y cómo participar.
Para empezar a desarrollar con estos modelos, descárgalos de Hugging Face(se abre en una ventana nueva).

