Pular para o conteúdo principal
OpenAI

29 de outubro de 2025

ProdutoLançamento

Apresentamos o gpt-oss-safeguard

Novos modelos abertos de raciocínio para segurança (120b e 20b), compatíveis com políticas de segurança personalizadas.

Carregando…

Hoje, lançamos uma prévia de pesquisa do gpt-oss-safeguard, nossos modelos de raciocínio com pesos abertos para tarefas de classificação de segurança, disponíveis em dois tamanhos: gpt-oss-safeguard-120b e gpt-oss-safeguard-20b. Esses modelos são versões com ajuste fino dos nossos modelos abertos gpt-oss e estão disponíveis sob a mesma licença permissiva Apache 2.0, que permite a qualquer pessoa usá-los, modificá-los e implantá-los livremente. Os dois modelos já estão disponíveis para download no Hugging Face(abre em uma nova janela).

Os modelos gpt-oss-safeguard usam raciocínio para interpretar diretamente, no momento da inferência, uma política fornecida pelo desenvolvedor, classificando mensagens de usuários, respostas geradas e conversas completas de acordo com as necessidades do desenvolvedor. O desenvolvedor sempre decide qual política usar, para que as respostas sejam mais relevantes e adaptadas ao seu caso de uso. O modelo usa uma cadeia de pensamento, que o desenvolvedor pode analisar para entender como ele chega às decisões. Além disso, como a política é fornecida durante a inferência, e não incorporada ao modelo durante o treinamento, os desenvolvedores podem revisá-la iterativamente com facilidade para melhorar o desempenho. Essa abordagem, que desenvolvemos inicialmente para uso interno, é muito mais flexível do que o método tradicional de treinar um classificador para inferir indiretamente um limite de decisão a partir de um grande número de exemplos rotulados.

O gpt-oss-safeguard permite que os desenvolvedores estabeleçam os limites de política que melhor atendam ao seu caso de uso. Por exemplo, um fórum de discussão sobre videogames pode criar uma política para classificar publicações sobre trapaças no jogo, ou um site de avaliações de produtos pode usar sua própria política para filtrar avaliações que provavelmente sejam falsas.

O modelo recebe duas entradas ao mesmo tempo — uma política e o conteúdo a ser classificado segundo ela — e gera uma conclusão sobre a categoria em que o conteúdo se enquadra, acompanhada de seu raciocínio. Os desenvolvedores decidem como usar essas conclusões em seus próprios pipelines de segurança — ou mesmo se devem usá-las. Essa abordagem baseada em raciocínio mostrou desempenho especialmente bom em situações em que:

  • O dano potencial é emergente ou está em evolução, e as políticas precisam se adaptar rapidamente.
  • O domínio apresenta muitas nuances, o que dificulta sua análise por classificadores menores.
  • Os desenvolvedores não têm amostras suficientes para treinar um classificador de alta qualidade para cada risco presente na plataforma.
  • A latência é menos importante do que produzir rótulos explicáveis e de alta qualidade.

Estamos lançando esta prévia do gpt-oss-safeguard para receber feedback da comunidade de pesquisa e segurança e continuar aprimorando o desempenho do modelo. Ao longo de vários meses, trabalhamos com a ROOST(abre em uma nova janela) neste lançamento de modelos com pesos abertos para identificar necessidades essenciais dos desenvolvedores, testar o modelo e produzir documentação para desenvolvedores. Como parte deste lançamento, a ROOST criará uma comunidade de modelos(abre em uma nova janela), também lançada hoje, para explorar modelos abertos de IA destinados a proteger ambientes online. Junto com este lançamento, publicamos um breve relatório técnico que detalha o desempenho de segurança deste modelo em versão preliminar.

Segurança no nível do sistema: o papel dos classificadores de segurança

Quando se trata de segurança, acreditamos na defesa em profundidade. Treinamos nossos modelos para responder com segurança e implementamos camadas adicionais de proteção para detectar e tratar entradas e saídas potencialmente inseguras de acordo com nossas políticas. Os classificadores de segurança, que distinguem conteúdo seguro de conteúdo inseguro em determinada área de risco, há muito são uma das principais camadas de defesa tanto para nossos modelos de linguagem de grande porte quanto para outros modelos desse tipo.

Os classificadores de segurança tradicionais, como os disponíveis por meio da Moderation API(abre em uma nova janela), são desenvolvidos com a curadoria manual de milhares de exemplos de conteúdo seguro e inseguro, com base em políticas de segurança predefinidas. Com esses dados de treinamento, o classificador aprende a distinguir saídas seguras de saídas inseguras. Nessa abordagem tradicional, o classificador nunca vê a política de segurança propriamente dita. Em vez disso, ele tenta inferir a política subjacente usada para rotular os exemplos, identificando semelhanças entre conteúdos rotulados como inseguros e diferenças entre os conteúdos inseguros e seguros.

Os classificadores tradicionais podem oferecer alto desempenho, com baixa latência e baixo custo operacional. No entanto, reunir exemplos de treinamento em quantidade suficiente pode ser demorado e dispendioso, e atualizar ou alterar a política requer treinar o classificador novamente.

O gpt-oss-safeguard é diferente porque sua capacidade de raciocínio permite que os desenvolvedores apliquem qualquer política, inclusive políticas que eles próprios escrevam ou obtenham de outras fontes, e o raciocínio ajuda os modelos a generalizar a partir de políticas recém-criadas. Além das políticas de segurança, o gpt-oss-safeguard pode ser usado para rotular conteúdo de outras formas relevantes para produtos e plataformas específicos.

Diagrama de fluxo intitulado “Raciocínio baseado em políticas com o gpt-oss-safeguard”. As políticas fornecidas pelos desenvolvedores e o conteúdo fornecido pelos usuários alimentam o GPT-OSS-Safeguard. O modelo gera uma cadeia de pensamento e depois uma decisão com base na política, com um ciclo identificado como “iteração de políticas” que retroalimenta o processo para refinar as políticas. Uma legenda identifica a entrada do desenvolvedor, a entrada do usuário e a saída do modelo.

Como usamos o raciocínio de segurança internamente

Nossos principais modelos de raciocínio agora aprendem diretamente nossas políticas de segurança e usam sua capacidade de raciocínio para avaliar o que é seguro. Essa abordagem, que chamamos de alinhamento deliberativo, representa uma melhora significativa em relação aos métodos anteriores de treinamento em segurança e torna nossos modelos de raciocínio mais seguros em várias dimensões quando comparados aos seus antecessores sem raciocínio, mesmo com o aumento de suas capacidades. Mas o raciocínio não é útil apenas para treinar os próprios modelos. Ele também cria novas possibilidades de defesa em profundidade. Abordagens baseadas em raciocínio são mais flexíveis e menos limitadas pelos detalhes de treinamentos anteriores, vantagens que, às vezes, mais do que justificam o custo computacional e a latência adicionais envolvidos.

O gpt-oss-safeguard é uma implementação com pesos abertos de uma abordagem que desenvolvemos internamente em uma ferramenta chamada Safety Reasoner. Começamos com ajuste fino por reforço em tarefas de rotulagem de políticas, recompensando o modelo por reproduzir as decisões corretas de especialistas humanos. Isso ensinou o modelo a raciocinar sobre como a política fundamenta sua decisão. Hoje, o Safety Reasoner nos permite atualizar dinamicamente nossas políticas de segurança em produção em menos tempo do que levaria para treinar um classificador novamente. Isso torna o Safety Reasoner uma ferramenta essencial para a implantação iterativa: quando implantamos novos modelos em produção, muitas vezes começamos com políticas mais restritivas e usamos uma quantidade relativamente grande de recursos computacionais quando necessário, para que o Safety Reasoner aplique essas políticas com cuidado. Depois, ajustamos nossas políticas à medida que ampliamos nosso entendimento dos riscos em produção. Em alguns dos nossos lançamentos recentes, a parcela do total de recursos computacionais dedicada ao raciocínio de segurança chegou a 16%.

O Safety Reasoner tornou-se um componente central da nossa infraestrutura de segurança. Na geração de imagens e no Sora 2, ele faz avaliações dinâmicas e passo a passo das saídas para identificar e bloquear gerações inseguras em tempo real. Em domínios como biologia e autoagressão, executamos modelos como os usados na Moderation API na forma de classificadores pequenos, rápidos e com alto recall para determinar quais conteúdos se enquadram em um domínio de interesse; depois, usamos o Safety Reasoner para analisar esses conteúdos. O Safety Reasoner classifica as saídas dos modelos de acordo com uma taxonomia detalhada para determinar a melhor forma de responder, fazendo parte das nossas proteções em várias camadas em sistemas como GPT‑5 e ChatGPT Agent. Agora, os modelos gpt-oss-safeguard disponibilizam essa mesma abordagem para qualquer pessoa.

Desempenho do gpt-oss-safeguard

Avaliamos os modelos gpt-oss-safeguard em conjuntos de avaliação internos e externos.

Na avaliação interna, fornecemos várias políticas simultaneamente ao gpt-oss-safeguard no momento da inferência. Para cada entrada de teste, avaliamos se o gpt-oss-safeguard classifica corretamente o texto de acordo com todas as políticas incluídas. Essa é uma tarefa desafiadora: o modelo só é considerado correto quando coincide exatamente com os rótulos do conjunto de referência em todas as políticas incluídas.

Nossos modelos gpt-oss-safeguard e o Safety Reasoner interno superam o gpt-5-thinking e os modelos abertos gpt-oss em acurácia com múltiplas políticas. O fato de os modelos gpt-oss-safeguard superarem o gpt-5-thinking é especialmente surpreendente, considerando o tamanho reduzido desses modelos.

Também avaliamos esses modelos no conjunto de dados de moderação(abre em uma nova janela) que publicamos com nosso artigo de pesquisa de 2022(abre em uma nova janela) e no ToxicChat(abre em uma nova janela), um benchmark público baseado em consultas de usuários a um chatbot de código aberto.

No conjunto de avaliação de moderação de 2022, usamos nossas políticas internas de segurança (com uma política adaptada para considerar mudanças posteriores). O gpt-oss-safeguard superou ligeiramente todos os outros modelos testados, inclusive nosso Safety Reasoner interno e o gpt-5-thinking, embora a diferença entre o Safety Reasoner e o gpt-oss-safeguard não seja estatisticamente significativa.

No ToxicChat, fizemos a avaliação usando um prompt curto, elaborado manualmente e adaptado de algumas de nossas políticas internas. Nosso Safety Reasoner interno novamente superou o gpt-5-thinking, enquanto o gpt-5-thinking e o Safety Reasoner tiveram desempenho ligeiramente superior ao gpt-oss-safeguard-120b e ao gpt-oss-safeguard-20b. Esperamos que o tamanho relativamente reduzido do gpt-oss-safeguard ainda o torne a opção preferível para esse tipo de tarefa.

Limitações

O gpt-oss-safeguard tem duas limitações específicas. Primeiro, observamos que classificadores treinados com dezenas de milhares de amostras rotuladas de alta qualidade ainda podem classificar conteúdo melhor do que o gpt-oss-safeguard quando este raciocina diretamente com base na política. Dedicar tempo ao treinamento de um classificador específico pode ser a melhor opção para obter maior desempenho em riscos mais complexos.

Segundo, o gpt-oss-safeguard pode exigir muito tempo e recursos computacionais, o que dificulta sua aplicação em escala a todo o conteúdo de uma plataforma. Internamente, lidamos com isso de várias formas com o Safety Reasoner: (1) usamos classificadores menores e mais rápidos para determinar quais conteúdos devem ser avaliados e (2), em algumas circunstâncias, usamos o Safety Reasoner de forma assíncrona para oferecer uma experiência de baixa latência ao usuário, sem perder a capacidade de intervir quando detectamos conteúdo inseguro.

Próximos passos: continuar desenvolvendo com a comunidade

O gpt-oss-safeguard é o primeiro conjunto de modelos abertos de segurança da OpenAI desenvolvido com a comunidade. Como parte dos testes iniciais, aprimoramos o gpt-oss-safeguard em conjunto com especialistas em confiança e segurança da SafetyKit, ROOST, Tomoro e Discord. Vinay Rao, CTO da ROOST, afirma: “O gpt-oss-safeguard é o primeiro modelo de raciocínio de código aberto com um design do tipo ‘traga suas próprias políticas e definições de dano’. As organizações merecem ter liberdade para estudar, modificar e usar tecnologias de segurança essenciais e para inovar. Em nossos testes, ele demonstrou capacidade de compreender diferentes políticas, explicar seu raciocínio e aplicar essas políticas com nuances, o que acreditamos ser benéfico para desenvolvedores e equipes de segurança.”

Continuaremos aprimorando, em conjunto com a comunidade, as ferramentas abertas de segurança, inclusive por meio da ROOST Model Community (RMC). A RMC reúne profissionais e pesquisadores de segurança para compartilhar práticas recomendadas de implementação de modelos de IA de código aberto em fluxos de trabalho de segurança, incluindo resultados de avaliações e feedback sobre os modelos. Acesse o repositório da RMC no GitHub(abre em uma nova janela) para saber mais sobre essa parceria e como participar.

Para começar a criar com esses modelos, baixe-os no Hugging Face(abre em uma nova janela).

Autoria

OpenAI