Carregando…
Hoje, estamos lançando o GPT‑6 Astra, o modelo mais capaz que já disponibilizamos amplamente. O Astra é nosso primeiro modelo a atingir o nível Crítico de capacidade em cibersegurança segundo o Preparedness Framework.
Estes são os principais pontos sobre a segurança deste lançamento:
- O GPT‑6 Astra representa um avanço significativo em capacidades cibernéticas e atinge nosso limiar Crítico. Isso significa que, com as ferramentas e o acesso adequados, o GPT‑6 Astra consegue encontrar falhas de segurança até então desconhecidas e desenvolver novas formas de explorá-las em diversos sistemas bem protegidos, sem que uma pessoa precise orientar cada etapa. Por isso, reforçamos significativamente nossas proteções contra ações cibernéticas nocivas realizadas pelo modelo, sejam elas decorrentes de uso indevido ou desalinhamento. Também adotamos medidas para proteger o desenvolvimento e a implantação internos do Astra e de modelos semelhantes, incluindo isolamento mais rigoroso, criptografia de checkpoints, monitoramento universal de trajetórias completas — inclusive cadeias de pensamento (CoT) — e um processo de avaliação de alinhamento que bloqueia o uso interno até sua conclusão.
- O GPT‑6 Astra é significativamente mais robusto que seus antecessores. Ao incorporar novas técnicas de treinamento de segurança voltadas à robustez, o GPT‑6 Astra tornou-se significativamente mais resistente a jailbreaks que o GPT‑5.6 Sol, inclusive em trajetórias mais longas. Sabemos disso com base em testes offline e em nosso programa rigoroso de testes internos e externos de jailbreaks e correção das vulnerabilidades encontradas. Para usuários sinalizados como potencialmente de alto risco, também treinamos o modelo para ajustar seu limite de recusa de forma mais conservadora e abranger uma variedade maior de riscos de uso duplo. Usamos testes de regressão para garantir que o Astra seja resistente aos jailbreaks encontrados em ciclos anteriores de testes e realizamos novas rodadas automatizadas de red teaming com nossos mais recentes agentes internos de ataque para validar as melhorias.
- O GPT‑6 Astra está mais bem alinhado que o GPT‑5.6 Sol. O Astra representa um avanço significativo no alinhamento de modelos e incorpora melhorias que vão da composição dos dados de pré-treinamento aos critérios de avaliação usados durante o aprendizado por reforço. Apresentamos um novo conjunto de avaliações de alinhamento(abre em uma nova janela) e constatamos que o GPT‑6 Astra respeita melhor os limites de proteção e segurança e se mantém dentro do escopo autorizado. Em uma simulação com mais de 54 mil tarefas internas do Codex(abre em uma nova janela), o Astra também recebeu cerca de metade das sinalizações por comportamentos desalinhados de maior gravidade registradas pelo Sol.
- Estamos implantando amplamente o monitoramento de desalinhamento. Consideramos o alinhamento de modelos o principal recurso para evitar possíveis comportamentos desalinhados de nossos modelos. No entanto, o monitoramento oferece ampla visibilidade do comportamento de modelos de fronteira e revela oportunidades para aprimorar ainda mais o alinhamento e a segurança. Além disso, o monitoramento funciona como uma camada adicional de proteção contra comportamentos desalinhados detectados. Por esses motivos, também adicionamos o monitoramento de desalinhamento a toda inferência com uso de ferramentas envolvida na implantação externa do Astra, apesar do custo computacional significativo. Esse sistema é semelhante à nossa configuração interna.
- A monitorabilidade do GPT‑6 Astra diminuiu em relação à do GPT‑5.6 Sol. Realizamos investigações aprofundadas sobre a monitorabilidade(abre em uma nova janela) e a controlabilidade(abre em uma nova janela) do GPT‑6 Astra. Constatamos que ele é mais capaz de controlar a própria CoT que o GPT‑5.6 Sol e tem menor probabilidade de incluir informações incriminadoras nela. Em contextos adversariais, nos quais induzimos o modelo a evitar nossos monitores, constatamos que ele consegue permanecer sem ser detectado ao apresentar deliberadamente um desempenho inferior nas avaliações (sandbagging) e, às vezes, consegue escapar de nossos monitores internos quando solicitado a realizar determinadas tarefas de sabotagem(abre em uma nova janela). Não observamos indícios de raciocínio esteganográfico na CoT — por exemplo, a ocultação de raciocínio secreto em textos comuns e aparentemente não relacionados —, o que indica que o risco de evasão pode estar, em grande parte, restrito a tarefas que exigem menos raciocínio.
- Essas constatações indicam que os modelos da classe Astra podem escapar de nossos monitores de CoT em condições adversariais. No momento, essas constatações se baseiam principalmente em avaliações adversariais — isto é, quando instruímos o modelo a evitar o monitoramento —, e nossas avaliações de alinhamento indicam, de modo geral, que o Astra tem menor probabilidade que o GPT‑5.6 Sol de violar restrições de proteção e segurança.
- Ainda assim, levamos essa tendência a sério e continuamos investigando essas constatações e suas implicações para a monitorabilidade à medida que nossos modelos se tornam mais capazes. A OpenAI tem trabalhado para preservar e utilizar o monitoramento da cadeia de pensamento, e manter a monitorabilidade da CoT é um objetivo central do programa de pesquisa. No entanto, esses resultados também reforçam a importância de desenvolver técnicas de auditoria de alinhamento que vão além do exame da cadeia de pensamento do modelo.
- O GPT‑6 Astra atua com mais responsabilidade em contextos de navegação e trabalho: ele é significativamente mais resistente a injeções de prompt que o GPT‑5.6 Sol. Também testamos o comportamento do modelo em ambientes realistas de navegação e de uso profissional do computador e constatamos que ele tem uma probabilidade significativamente menor que o GPT‑5.6 Sol de realizar ações desalinhadas e potencialmente destrutivas, como transações não autorizadas, perda de dados, acesso excessivo ou burla de controles. Ele também age com mais segurança ao lidar com solicitações nocivas em contextos com agentes de IA, como pedidos de ajuda para planejar ataques violentos ou cometer fraudes.
- O GPT‑6 Astra é significativamente mais seguro em cenários de maior risco. O GPT‑6 Astra responde com mais segurança que o GPT‑5.6 Sol a solicitações desafiadoras extraídas do ambiente de produção e de exercícios adversariais de red teaming conduzidos por pessoas. O Astra alcança uma melhoria de Pareto ao atender com segurança a solicitações inseguras e evitar recusas desnecessárias a solicitações inofensivas. Essas melhorias se estendem a cenários de alta gravidade em que o risco de dano decorre do contexto mais amplo, e não de uma solicitação explícita. O Astra também aplica limites de segurança adequados à idade de forma mais consistente para usuários menores de 18 anos.
Para mais informações, consulte o system card completo(abre em uma nova janela).
Autoria
OpenAI


