Uma nova geração de inteligência
Atualização de 22 de setembro de 2026: Estamos ampliando nossa família GPT‑6 com o GPT‑6 Sol e o GPT‑6 Luna. Saiba mais.
Apresentamos o GPT‑6 Astra, o modelo mais inteligente e alinhado do mundo.
O GPT‑6 Astra reúne anos de pesquisa e grandes apostas em pré-treinamento, aprendizado por reforço e alinhamento. O Astra está na vanguarda do uso do computador, da navegação na web, da engenharia de software, da cibersegurança, da ciência e do trabalho profissional. O Astra atinge praticamente o limite do FrontierMath Tier 4, com pontuação de 98%, e já ajudou a resolver problemas matemáticos que permaneciam em aberto há muito tempo. Ele também atinge praticamente o limite do ARC-AGI-3, com pontuação de 99,9%, e o limite do ExploitBench, com 100%. Além disso, estabelece um novo patamar no uso do computador e do navegador, realizando os trabalhos profissionais mais exigentes com velocidade, precisão e discernimento sem precedentes.
O GPT‑6 Astra começa a ser disponibilizado hoje para um grupo limitado de organizações e, nos próximos dias, estará disponível para todos os usuários do ChatGPT Plus, Pro, Business e Enterprise, além de ser oferecido pela API da OpenAI, pelo Microsoft Azure e pelo AWS Bedrock.
O Astra é nosso modelo mais alinhado, com melhorias significativas na compreensão da intenção do usuário e no comportamento do modelo. Isso permite delegar tarefas com mais confiança no discernimento do Astra. Uma das formas de testar isso foi criar uma nova avaliação com base no incidente da Hugging Face para verificar se um modelo diante de uma tarefa difícil ou impossível ultrapassa o escopo previsto. Sem as salvaguardas de produção, o GPT‑5.6 Sol foi além do alvo autorizado em 48% dos casos; já o GPT‑6 Astra fez isso em 0% dos casos.
O melhor modelo do mundo para uso do computador
O GPT‑6 Astra representa uma nova fronteira em velocidade, precisão e segurança no uso do computador. Ele pode cuidar de tarefas tediosas, como preencher formulários online, atualizar registros de clientes em um CRM e organizar seu calendário. Pode realizar pesquisas online e redigir resumos no seu e-mail ou editor de documentos. Pode analisar dados científicos, gerar gráficos, criar um site e executar verificações de QA no frontend para garantir que todos os recursos do site funcionem. Pode ajudar você a instalar e testar software de forma autônoma e a solucionar problemas exibidos na tela. Essas melhorias também se refletem nos resultados de ponta que o modelo alcança em nossas avaliações.
Essas melhorias também resultam em ganhos significativos de eficiência em tarefas reais de trabalho intelectual. Em simulações de latência no OSWorld 2.0, o Astra alcança um desempenho maior no uso do computador em cerca de 47% menos tempo por tarefa que o GPT‑5.6 Sol: 72,6% em aproximadamente 40 minutos por tarefa, em comparação com 65,7% em cerca de 75 minutos.3
As capacidades de uso do computador do GPT‑6 Astra aparecem em resultados de várias áreas, incluindo desenvolvimento de jogos, engenharia elétrica e trabalho intelectual do dia a dia:
Junto com o Astra, também estamos atualizando o ambiente de execução do Codex para aumentar significativamente a velocidade de uso do computador. Combinada à eficiência do Astra, essa atualização resulta na conclusão de tarefas 1,9 vez mais rápida no benchmark Mind2Web, em comparação com a experiência atual do GPT‑5.6 Sol. Os ganhos de velocidade do modelo permitem que ele realize muitas tarefas demoradas do dia a dia por você, mais rápido do que você conseguiria.4
Um novo patamar para o trabalho profissional
O GPT‑6 Astra combina avanços no uso do computador com treinamento direcionado a ambientes profissionais para ajudar a realizar tarefas complexas de trabalho. Ele reúne a inteligência necessária para resolver problemas complexos e a capacidade de executar fluxos de trabalho com várias etapas e produzir documentos, planilhas e apresentações bem-acabados.
O GPT‑6 Astra é o que melhor segue modelos predefinidos e produz slides bem diagramados que transmitem os pontos principais com concisão e uma narrativa estruturada. Ele cria documentos, apresentações, planilhas e análises com clareza e boa estrutura, seguindo os modelos fornecidos e reproduzindo seu estilo visual e de escrita. O Astra também é treinado especificamente para incorporar aos resultados apenas o contexto relevante, em vez de repetir informações desnecessárias para o trabalho em questão. Com tudo isso, ele gera materiais prontos para uso e alinhados ao contexto e aos padrões da sua empresa.
O GPT‑6 Astra também demonstra maior discernimento visual nos sites, jogos, aplicativos e renderizações que cria. Com o Sites(abre em uma nova janela) no ChatGPT, o Astra pode criar, hospedar e compartilhar sites, aplicativos web e jogos diretamente a partir de um prompt.
Quando as instruções deixam margem para interpretação, o GPT‑6 Astra toma decisões melhores que os modelos anteriores. Ele usa o contexto para preencher lacunas corriqueiras e faz perguntas específicas quando a resposta pode mudar o resultado. No Codex, pode fazer perguntas de forma assíncrona enquanto continua o trabalho que não depende da sua resposta. Se você não responder, ele prossegue com suposições sensatas quando isso é adequado, mas espera sua contribuição para decisões de maior impacto.
Os exemplos abaixo mostram como o Astra colabora em tarefas do dia a dia nas quais a falta de informações pode mudar significativamente a resposta.
O Astra também mantém melhor o rumo conforme uma tarefa evolui. Modelos anteriores às vezes tratavam mensagens de orientação como um novo objetivo, perdendo de vista a solicitação original ou as restrições anteriores. O Astra incorpora novos requisitos, muda de direção quando solicitado e responde a perguntas paralelas sem abandonar a tarefa mais ampla.
Programação
O GPT‑6 Astra é o melhor modelo até hoje para engenharia de software.
"O GPT‑6 Astra oferece desempenho de ponta em nossos benchmarks internos de programação e apresenta um avanço claro nas avaliações de intuição para operações de mercado em relação ao GPT‑5.6 Sol. Quando usado para programação com agentes, o GPT‑6 Astra se comunica de uma forma mais fácil de acompanhar para os desenvolvedores e produz código que exige menos iterações para atingir qualidade de produção."
“Testamos o Astra com níveis de esforço baixo, médio e alto em uma de nossas avaliações de primeira geração, e ele ficou significativamente à frente do GPT‑5.6 Sol. Um nível de esforço mais alto permite mais iterações em uma criação do zero, mais verificações por meio de testes no navegador e maior preferência pela execução de código em vez do apply-patch. Entender como um modelo emprega seu esforço é o que nos permite oferecer a milhões de criadores um caminho mais rápido e confiável da ideia ao aplicativo funcional.”
Com o Astra, apresentamos uma nova maneira de o Codex preservar e recuperar o contexto quando a janela de contexto fica cheia. Historicamente, os modelos usam a compactação para resumir o trabalho durante sessões longas, como ao depurar problemas complexos ou realizar grandes refatorações. Cada compactação pode omitir detalhes sobre por que uma correção falhou ou como um componente se comporta. No Codex, o Astra pode manter anotações entre janelas de contexto, preservando os detalhes acumulados sem comprimi-los repetidamente em um único resumo. As janelas de contexto anteriores continuam disponíveis para busca, de modo que o Astra pode encontrar requisitos ou resultados de testes em mensagens anteriores e saídas de ferramentas, mesmo que essas informações não estejam nas anotações. Você pode ativar esse recurso experimental no config.toml do Codex,(abre em uma nova janela) e ele se tornará o padrão para o Astra nas próximas semanas.
Impulsionando descobertas científicas
O Astra pode ajudar no trabalho prático por trás das descobertas científicas. Ao combinar raciocínio científico com uso do computador, ele pode trabalhar diretamente em softwares especializados para examinar dados e explorar resultados, ajudando pesquisadores a avaliar as evidências e decidir o que investigar a seguir.
Segurança cibernética
Como discutimos em nossa atualização sobre segurança, o Astra representa um salto significativo nas capacidades cibernéticas e atinge o limiar Crítico em cibersegurança segundo nosso Preparedness Framework. Sua capacidade de identificar e desenvolver exploits de dia zero pode ajudar profissionais de defesa cibernética a encontrar e corrigir falhas, mas também exige proteções mais robustas. Para entender o alcance dessas capacidades, submetemos o Astra a avaliações internas e a avaliações de especialistas externos.
Primeiro, testamos o modelo sem as salvaguardas de produção no ExploitBench e no ExploitGym, que avaliam se os modelos conseguem transformar vulnerabilidades conhecidas de software em exploits funcionais. No ExploitBench, o Astra alcançou a pontuação máxima de 100%, em comparação com 78,5% do GPT‑5.6 Sol, nosso modelo anterior de ponta com capacidades cibernéticas. No ExploitGym, o Astra alcançou uma taxa de sucesso de 42,4%, em comparação com 30,3% do GPT‑5.6 Sol, usando significativamente menos tokens de saída.13
Diante da preocupação de que a exposição a vulnerabilidades de software já conhecidas pudesse ter afetado os resultados dos benchmarks, também avaliamos o Astra em dois novos benchmarks. Para um deles, criamos a avaliação interna "ExploitBench (junho–agosto de 2026)" para testar o desenvolvimento de exploits com vulnerabilidades dos três meses anteriores.14 Nesse conjunto de dados, o Astra alcançou taxas de execução de código arbitrário significativamente maiores que as do GPT‑5.6 Sol, usando muito menos tokens de saída. Durante a avaliação, o Astra chegou a descobrir e usar duas vulnerabilidades de dia zero até então desconhecidas. Estamos comunicando ambas aos responsáveis pela manutenção dos softwares.
Também testamos o Astra no SRE-Bench15, um benchmark que mede se os modelos conseguem fazer engenharia reversa de binários de software para compreender sua lógica central sem acesso ao código-fonte. O Astra resolveu 88,0% das tarefas em uma única tentativa e 99,2% em até quatro tentativas, em comparação com 55,9% e 68,7% do GPT‑5.6 Sol, respectivamente.
Além dos benchmarks, avaliações conduzidas por especialistas constataram que o Astra, quando executado sem as salvaguardas de produção, conseguia usar vulnerabilidades até então desconhecidas para obter execução de código arbitrário em navegadores com proteção reforçada e criar exploits de elevação de privilégios para sistemas operacionais com proteção reforçada.
Como discutimos em A janela de oportunidade dos defensores, capacidades cibernéticas de ponta podem ajudar os defensores a encontrar falhas mais rapidamente, mas também facilitam a exploração dessas falhas, tornando ainda mais urgente a adaptação dos defensores. Com a versão do Astra lançada hoje, os defensores podem realizar tarefas como revisão de código com foco em segurança e aplicação de correções.
No entanto, o Astra se recusará a realizar tarefas mais avançadas de cibersegurança, como criar exploits de prova de conceito para vulnerabilidades. Por meio do OpenAI Daybreak, planejamos ampliar o acesso e disponibilizar salvaguardas menos restritivas nas próximas semanas. Isso permitirá mais fluxos de trabalho defensivos, incluindo validação de vulnerabilidades e provas de conceito, análise de malware e engenharia de detecção.
Também reforçamos nossas proteções contra possíveis usos indevidos em atividades cibernéticas, partindo do conjunto de proteções para o GPT‑5.6 Sol. Essas melhorias incluem maior robustez do modelo para resistir melhor a possíveis jailbreaks e mais contexto para nossos sistemas de monitoramento. Continuamos realizando testes internos e externos rigorosos, incluindo avaliações automatizadas com nossos agentes internos de ataque em testes de red teaming. Mais detalhes sobre nossas proteções e nossos testes de cibersegurança estão disponíveis na visão geral de segurança e no system card(abre em uma nova janela) do Astra.
Alinhamento e implantação responsáveis do GPT‑6 Astra
O Astra é nosso modelo mais alinhado. Ele se destaca por agir com cuidado, respeitar os limites das tarefas e se comunicar com transparência. Esse trabalho é o resultado mais recente de nosso programa de pesquisa de longa data, voltado ao treinamento de modelos que se mantêm alinhados à intenção humana do início ao fim.
Em ambientes sensíveis, o Astra age com um cuidado proporcional ao risco. Em uma avaliação de tarefas de uso do computador selecionadas de forma adversarial para induzir comportamentos inadequados, o Astra foi mais bem-sucedido em evitar consequências indesejadas. A execução com as medidas adicionais de segurança oferecidas por padrão produziu um desempenho ainda melhor.
O Astra gera menos resultados desalinhados que qualquer outro modelo de ponta testado. Para uma comparação justa, usamos um ambiente de execução genérico para agentes que usam o computador (baseado nas ferramentas nativas de uso do computador disponíveis tanto na API Responses da OpenAI(abre em uma nova janela) quanto na API Messages da Anthropic(abre em uma nova janela)), sem as proteções adicionais normalmente disponibilizadas aos usuários do Codex e do ChatGPT Work (auto-review e política de confirmação).
O Astra também tem maior probabilidade de operar dentro dos limites definidos pelo usuário e implícitos no ambiente. Em uma avaliação interna, o Astra nunca tentou contornar uma negativa do Codex Auto-Review. Isso se manteve mesmo quando o Auto-review foi deliberadamente configurado para poder ser contornado e não havia outra forma de concluir a tarefa. Esse respeito às restrições do ambiente é consistente com os resultados de nossa avaliação de tarefas cibernéticas impossíveis, compartilhados na introdução deste post, e com outras constatações documentadas em nosso system card(abre em uma nova janela).
O Astra também alcança novos patamares de transparência na comunicação com os usuários. Em uma avaliação, o Astra tem uma probabilidade três vezes menor que a do GPT‑5.6 Sol de fazer afirmações imprecisas sobre suas capacidades e possibilidades de uso.
Em nossa avaliação de alucinações sobre capacidades, o Astra apresenta uma melhoria substancial em relação ao GPT‑5.6 Sol, fazendo menos afirmações enganosas sobre as próprias capacidades.
Nossas avaliações constataram que o raciocínio escrito do Astra é mais difícil de monitorar que o do GPT‑5.6 Sol, com base em testes que pediam explicitamente que ele burlasse o monitoramento. Atribuímos isso ao maior controle do Astra sobre o raciocínio escrito em tarefas mais simples e à sua capacidade de resolver problemas com menos etapas escritas. O Astra ainda parece ter dificuldade para ocultar o raciocínio necessário para tarefas complexas, mas levamos essa queda na capacidade de monitoramento a sério. Melhorar essa capacidade continua sendo uma prioridade de pesquisa, e o system card(abre em uma nova janela) que acompanha o lançamento detalha nossas constatações e o trabalho em andamento.
O treinamento de alinhamento é central à nossa abordagem de implantação. Como camada adicional de defesa, também desenvolvemos proteções no sistema, como o Auto-review(abre em uma nova janela) do Codex e o monitoramento do raciocínio e das ações dos agentes, para ajudar a detectar e conter comportamentos inseguros. Como descrito em nossa atualização sobre segurança, também estamos implantando o monitoramento de desalinhamento em produção para modelos da categoria do Astra, a fim de identificar o desalinhamento e ajudar a conter suas manifestações mais graves. Essas proteções se assemelham ao nosso monitoramento de implantações internas e envolvem um sistema de classificadores que verifica o raciocínio e as ações do modelo em busca de comportamentos não autorizados e interrompe automaticamente atividades potencialmente não autorizadas.
Diante do aumento significativo das capacidades de cibersegurança do Astra, estamos redobrando o cuidado para que essa implantação seja segura e protegida. Verificações adicionais de segurança podem, às vezes, tornar mais lento, pausar ou interromper um trabalho legítimo, inclusive de cibersegurança defensiva. Se uma tarefa for pausada no ChatGPT ou no Codex, você poderá precisar revisar a ação antes de continuar. Na API, a tarefa será interrompida. Essas verificações podem, às vezes, interromper trabalhos legítimos, e continuamos aprimorando o sistema para reduzir interrupções desnecessárias. O monitoramento de desalinhamento não substitui o alinhamento: nosso objetivo é criar modelos que se mantenham de forma confiável dentro do escopo autorizado, para que essas proteções não precisem intervir.
Disponibilidade
O GPT‑6 Astra começa a ser disponibilizado hoje para um grupo limitado de organizações e, nos próximos dias, estará disponível para todos os usuários do ChatGPT Plus, Pro, Business e Enterprise, além de ser oferecido pela API da OpenAI, pelo Microsoft Azure e pelo AWS Bedrock. O uso do Astra está incluído nos limites das assinaturas atuais. Usuários e empresas também poderão comprar créditos para uso adicional. Usuários dos planos Pro, Business e Enterprise também terão acesso ao GPT‑6 Astra Pro. Administradores do Enterprise podem ativar o Astra para seu espaço de trabalho; no lançamento, o acesso fica desativado por padrão.
O Astra oferece suporte à retenção zero de dados para clientes elegíveis da API e, como anunciamos no mês passado, estamos testando o Processamento Privado de Segurança para reforçar o monitoramento de segurança e, ao mesmo tempo, preservar a privacidade dos clientes.
Para desenvolvedores, o GPT‑6 Astra estará disponível na API da OpenAI como gpt-6-astra e por meio do Microsoft Azure e do Amazon Bedrock.
Na modalidade Standard da API da OpenAI, os preços são de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. Leituras e gravações de cache têm tarifas específicas. O modo Fast está disponível para o GPT‑6 Astra na API e oferece até o dobro da velocidade do processamento Standard pelo dobro do preço.
Profissional
Profissional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83.3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0,19 | - | - | - | - |
Tarefas internas de design | 50.0% | 47,4% | - | 35,8% | - | - |
Tarefas internas de ciência de dados | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Programação
| Programação | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Extended (pontuação) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main (pontuação) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Tarefas internas de migração de bancos de dados | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Acadêmico
Acadêmico | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21.4% | 30,0% | - |
FrontierMath Tier 4 (v2) | 97,6% | 83.00% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,6% | 93.7% | 92.6% | 93.7% | 95,3% |
Humanity's Last Exam (com ferramentas) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Ciência e saúde
Alinhamento
Alinhamento | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Benchmark interno de segurança no uso do computador (quanto menor, melhor) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Benchmark interno de segurança no uso do computador, com AutoReview (quanto menor, melhor) | 1,8% | 4,3% | - | - | - | - |
Benchmark interno de evasão de controles (quanto menor, melhor) | 0,00% | 0,29% | - | - | - | - |
Honeypot do ExploitGym (quanto menor, melhor) | 0,0% | 48,2% | - | - | - | - |
ExploitGym impossível | 100% | - | - | - | - | - |
Benchmark interno de alucinação (quanto menor, melhor) | 4,2% | 12,2% | - | - | - | - |
Contexto longo
Contexto longo | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3% | 73,8% | - | - | - | - |
Raciocínio abstrato
| Raciocínio abstrato | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
As pontuações das avaliações são as máximas alcançadas em qualquer nível de esforço. As avaliações dos modelos GPT foram realizadas em nosso ambiente de pesquisa ou por meio de nossa API, que podem produzir resultados ligeiramente diferentes dos do ChatGPT em produção devido a diferenças nos prompts de sistema, nas ferramentas disponíveis etc.
NOTAS DE RODAPÉ
- 1
No ARC-AGI-3, o GPT-6 Astra foi executado com nosso ambiente de execução da API Responses, que altera duas configurações para refletir melhor o desempenho no mundo real. As mudanças não são direcionadas especificamente ao ARC-AGI-3.
- 2
GPT-5.6 Sol se refere à versão disponível em nossa API, no ChatGPT Codex e no ChatGPT Work. A versão no ChatGPT Chat é ligeiramente diferente.
- 3
O OSWorld V2-Offline é um subconjunto do OSWorld V2 original que funciona sem acesso à internet. O desempenho dos modelos Claude no OSWorld-V2 Offline foi reproduzido pelos autores no ranking oficial(abre em uma nova janela). No OSWorld 2.0, as pontuações do Claude usam as configurações oficiais, e não as tarefas e os critérios de avaliação modificados do system card do Fable 5.1.
- 4
- 5
No BenchCAD, as pontuações do Claude refletem três modificações na avaliação, detalhadas no system card do Fable 5.1(abre em uma nova janela).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon e Noah A. Smith. "LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(abre em uma nova janela)." arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower e Peter Jonas. "The OpenScore String Quartet Corpus(abre em uma nova janela)." Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
No FrontierCode, o GPT-6 Astra foi executado com uma mensagem de desenvolvedor semelhante a um trecho de sua mensagem de desenvolvedor no Codex(abre em uma nova janela): "Evite criar arquivos de teste em excesso. Crie um novo arquivo de teste somente quando as convenções do repositório exigirem ou quando não houver um arquivo existente adequado. Evite limpezas sem relação com a tarefa e complexidade desnecessária. Reutilize utilitários existentes adequados. Leia as instruções relevantes do repositório e examine o código relacionado, os testes, a documentação e a CI. Siga as convenções estabelecidas. O objetivo é produzir código limpo e pronto para integração." O prompt não foi otimizado para a avaliação.
- 9
O primeiro resultado trata de quão próximos os números primos podem estar, por mais que se avance na reta numérica. Por mais de uma década, o melhor resultado conhecido estabelecia que há infinitos pares de primos com distância de, no máximo, 246 entre eles. Julia Stadlmann(abre em uma nova janela) reduziu recentemente esse limite para 240. O Astra ajudou a estabelecer um limite mais restrito, de 186, demonstrando que existem infinitos pares dentro dessa distância menor. Pequenas distâncias entre primos: demonstração(abre em uma nova janela) e pesquisa de apoio(abre em uma nova janela).
- 10
O segundo resultado trata de distâncias excepcionalmente grandes entre primos. O Astra aprimorou um termo em um limite para essas distâncias que permanecia inalterado havia mais de 80 anos. Estamos compartilhando as demonstrações, as cadeias de pensamento resumidas e os materiais de verificação de ambos os resultados. Grandes distâncias entre primos: demonstração(abre em uma nova janela) e pesquisa de apoio(abre em uma nova janela).
- 11
Avaliamos de forma independente todos os modelos Claude seguindo o procedimento previsto para o HealthBench Professional, usando o GPT‑5.4 para a avaliação e pontuações ajustadas pela extensão da resposta, sem truncamento. Para o Fable 5.1, usamos o Opus 5 como alternativa em caso de recusas do provedor.
- 12
- 13
- 14
O ExploitBench (junho a agosto de 2026) reúne 20 vulnerabilidades de alta gravidade do V8 em 13 versões estáveis do Chrome. O benchmark testa se os agentes conseguem executar código arbitrário no V8 e em versões oficiais do Chrome para Linux ao explorar cada vulnerabilidade especificada. Algumas das vulnerabilidades incluídas podem não permitir a execução de código arbitrário sob as restrições da avaliação, de modo que uma taxa de sucesso de 100% pode não ser alcançável. Observação: a pontuação de 5,5% do GPT-5.6 Sol decorre do limite de 300 turnos do benchmark, que não se aplica a clientes reais que usam max. Com configurações semelhantes, o modelo atingiu uma pontuação de 11,5% quando foi afetado por menos limites.
- 15
Jeremy Spence et al. "The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(abre em uma nova janela)." arXiv:2608.11469v1, 2026.
- 16
Ao testar modelos de terceiros, usamos uma configuração de pesquisa mais simples. O Codex tem uma configuração de produção mais complexa, o que pode resultar em taxas de erro diferentes para os modelos sem camadas adicionais. As salvaguardas dos provedores e as implementações das ferramentas de uso do computador também diferem. Os usuários não vivenciam o cenário sem confirmação no Codex, pois essa é uma configuração interna de pesquisa.
- 17
