Saltar para o conteúdo principal
OpenAI

3 de setembro de 2026

Segurança

Vista geral de segurança: GPT‑6 Astra

A carregar…

Hoje, lançamos o GPT‑6 Astra, o modelo mais capaz que alguma vez disponibilizámos em larga escala. O Astra é o nosso primeiro modelo a atingir o nível Crítico de capacidade de cibersegurança no âmbito do Preparedness Framework.

Os aspetos mais importantes sobre a segurança deste lançamento são os seguintes:

  1. O GPT‑6 Astra representa um avanço significativo nas capacidades cibernéticas e atinge o nosso limiar Crítico. Isto significa que, com as ferramentas e o acesso adequados, o GPT‑6 Astra consegue encontrar falhas de segurança até então desconhecidas e desenvolver novas formas de as explorar em muitos sistemas bem protegidos, sem que uma pessoa tenha de orientar cada passo. Por conseguinte, reforçámos significativamente as proteções contra ações cibernéticas prejudiciais por parte do modelo, quer resultem de utilização indevida, quer de desalinhamento. Também tomámos medidas para proteger o desenvolvimento e a disponibilização internos do Astra e de modelos semelhantes, incluindo isolamento mais rigoroso, encriptação de pontos de controlo, monitorização universal de trajetórias completas — incluindo cadeias de pensamento (CoT) — e um processo de avaliação de alinhamento com bloqueio antes da utilização interna.
  2. O GPT‑6 Astra é significativamente mais robusto do que os seus antecessores. Graças a novas técnicas de treino de segurança para reforçar a robustez, o GPT‑6 Astra é significativamente mais resistente a jailbreaks do que o GPT‑5.6 Sol, inclusive em trajetórias mais longas. Sabemo-lo com base em testes offline e no nosso rigoroso programa interno e externo de testes e correção de jailbreaks. Para utilizadores sinalizados como potencialmente de alto risco, treinámos ainda o modelo para ajustar o limite de recusa de forma mais conservadora e abranger uma gama mais ampla de riscos de dupla utilização. Utilizamos testes de regressão para garantir que o Astra é robusto contra jailbreaks encontrados em períodos de teste anteriores e realizámos novas rondas automatizadas de red teaming com os nossos mais recentes sistemas internos de ataque para validar as melhorias.
  3. O GPT‑6 Astra está melhor alinhado do que o GPT‑5.6 Sol. O Astra representa um avanço significativo no alinhamento de modelos e inclui melhorias que vão da composição dos dados de pré-treinamento à avaliação durante a aprendizagem por reforço. Apresentamos um novo conjunto de avaliações de alinhamento(abre numa nova janela) e concluímos que o GPT‑6 Astra respeita melhor os limites de segurança e permanece dentro do âmbito autorizado. Numa simulação com mais de 54 000 tarefas internas do Codex(abre numa nova janela), o Astra também recebeu cerca de metade das sinalizações por comportamentos desalinhados de maior gravidade registadas pelo Sol.
  4. Estamos a implementar amplamente a monitorização de desalinhamentos. Consideramos o alinhamento de modelos o principal meio de prevenir potenciais comportamentos desalinhados dos nossos modelos. No entanto, a monitorização proporciona uma visão abrangente do comportamento dos modelos de fronteira, revelando oportunidades para melhorar ainda mais o alinhamento e a segurança. Além disso, a monitorização constitui uma camada adicional de proteção contra comportamentos desalinhados que sejam detetados. Por estes motivos, acrescentámos também a monitorização de desalinhamentos a toda a inferência com utilização de ferramentas na disponibilização externa do Astra, apesar do elevado custo computacional. Este sistema é semelhante à nossa configuração interna.
  5. A capacidade de monitorização do GPT‑6 Astra diminuiu em relação à do GPT‑5.6 Sol. Realizámos investigações aprofundadas sobre a capacidade de monitorização(abre numa nova janela) e a capacidade de controlo(abre numa nova janela) do GPT‑6 Astra. Concluímos que o GPT‑6 Astra consegue controlar melhor a sua própria CoT do que o GPT‑5.6 Sol e tem menor probabilidade de incluir informações incriminatórias na mesma. Em contextos adversariais, nos quais incentivamos o modelo a escapar aos nossos monitores, verificámos que o modelo consegue não ser detetado quando reduz estrategicamente o desempenho nas avaliações (sandbagging) e que, por vezes, consegue escapar aos nossos monitores internos quando lhe é pedido que execute determinadas tarefas de sabotagem(abre numa nova janela). Não encontrámos indícios de raciocínio esteganográfico na CoT — por exemplo, ocultação de raciocínio secreto em texto comum e aparentemente não relacionado —, o que indica que o risco de evasão poderá estar, em grande medida, limitado a tarefas de raciocínio menos exigentes.
    • Estas conclusões indicam que os modelos da classe Astra podem escapar aos nossos monitores de CoT em condições adversariais. Atualmente, estas conclusões baseiam-se sobretudo em avaliações adversariais, isto é, quando instruímos o modelo a escapar à monitorização, e as nossas avaliações de alinhamento mostram, de modo geral, que o Astra tem menor probabilidade do que o GPT‑5.6 Sol de violar restrições de segurança.
    • No entanto, levamos esta tendência a sério e continuamos a investigar estas conclusões e as suas implicações para a capacidade de monitorização à medida que os nossos modelos se tornam mais capazes. A OpenAI tem procurado preservar e utilizar a monitorização da cadeia de pensamento, e preservar a capacidade de monitorização da CoT é um objetivo central do programa de investigação. Contudo, estes resultados também salientam a importância de desenvolver técnicas de auditoria do alinhamento que não se limitem a examinar a cadeia de pensamento do modelo.
  6. O GPT‑6 Astra atua de forma mais responsável em contextos de navegação e de trabalho: o GPT‑6 Astra é significativamente mais robusto contra injeções de prompts do que o GPT‑5.6 Sol. Também testámos o comportamento do modelo em ambientes realistas de navegação e de utilização profissional de computadores e concluímos que, em comparação com o GPT‑5.6 Sol, o modelo tem uma probabilidade significativamente menor de realizar ações desalinhadas e potencialmente destrutivas, como transações não autorizadas, perda de dados, acesso excessivo ou contorno de controlos. Também atua de forma mais segura ao lidar com pedidos prejudiciais em contextos agênticos, como pedidos de ajuda para planear ataques violentos ou cometer fraude.
  7. O GPT‑6 Astra é significativamente mais seguro em cenários de maior risco. O GPT‑6 Astra responde de forma mais segura do que o GPT‑5.6 Sol a pedidos complexos provenientes da produção e do red teaming adversarial realizado por pessoas. O Astra obtém uma melhoria de Pareto ao responder com segurança a pedidos inseguros e evitar recusas desnecessárias de pedidos inofensivos. Estas melhorias abrangem cenários de elevada gravidade nos quais o risco de danos decorre do contexto mais amplo, e não de um pedido explícito. O Astra também aplica de forma mais consistente limites de segurança adequados à idade dos utilizadores menores de 18 anos.

Para mais informações, consulte o system card completo(abre numa nova janela).