Uma nova geração de inteligência
Atualização de 22 de setembro de 2026: Estamos a expandir a nossa família GPT‑6 com o GPT‑6 Sol e o GPT‑6 Luna. Saber mais.
Apresentamos o GPT‑6 Astra, o modelo mais inteligente e alinhado do mundo.
O GPT‑6 Astra reúne anos de investigação e grandes apostas no pré-treinamento, na aprendizagem por reforço e no alinhamento. O Astra é de vanguarda na utilização do computador, navegação, engenharia de software, cibersegurança, ciência e trabalho profissional. O Astra atinge o limite do FrontierMath Tier 4, com uma pontuação de 98%, tendo já ajudado a resolver problemas em aberto de longa data na matemática. O Astra também atinge o limite do ARC-AGI-3, com uma pontuação de 99,9%, e do ExploitBench, com uma pontuação de 100%. Estabelece também uma nova fronteira na utilização do computador e do browser, realizando o trabalho profissional mais exigente com uma velocidade, precisão e discernimento sem igual.
O GPT‑6 Astra começa hoje a ser disponibilizado a um conjunto limitado de organizações e, nos próximos dias, ficará disponível para todos os utilizadores do ChatGPT Plus, Pro, Business e Enterprise, bem como através da API da OpenAI, do Microsoft Azure e do AWS Bedrock.
O Astra é o nosso modelo mais alinhado, com melhorias substanciais na compreensão da intenção do utilizador e no comportamento do modelo, permitindo delegar tarefas com maior confiança no discernimento do Astra. Para testar este aspeto, entre outros, criámos uma nova avaliação inspirada no incidente do Hugging Face, que analisa se um modelo, perante uma tarefa difícil ou impossível, ultrapassa o âmbito previsto. Face ao GPT‑5.6 Sol, que, sem salvaguardas de produção, ultrapassou o alvo autorizado em 48% das situações, o GPT‑6 Astra fê-lo em 0% dos casos.
O melhor modelo do mundo para utilização do computador
O GPT‑6 Astra estabelece uma nova fronteira na velocidade, precisão e segurança da utilização do computador. Consegue tratar de tarefas fastidiosas, como preencher formulários online, atualizar registos de clientes num CRM e organizar o calendário. Consegue realizar investigação online e redigir resumos no email ou no editor de documentos. Consegue analisar dados científicos, gerar gráficos, criar um site e executar verificações de QA do frontend para garantir que todas as funcionalidades desse site funcionam. Pode ajudar a instalar e testar software de forma autónoma e a resolver problemas apresentados no ecrã. Estas melhorias refletem-se também nos resultados de vanguarda das nossas avaliações.
Estas melhorias também resultam em ganhos significativos de eficiência em tarefas reais de trabalho intelectual. Em simulações de latência no OSWorld 2.0, o Astra alcança um desempenho superior na utilização do computador, em cerca de 47% menos tempo por tarefa do que o GPT‑5.6 Sol, com uma pontuação de 72,6% em aproximadamente 40 minutos por tarefa, face a 65,7% em aproximadamente 75 minutos.3
As capacidades de utilização do computador do GPT‑6 Astra podem ser observadas em resultados de vários domínios, incluindo desenvolvimento de jogos, engenharia eletrotécnica e trabalho intelectual do dia a dia:
A par do Astra, estamos também a atualizar o harness do Codex para melhorar significativamente a velocidade de utilização do computador. Em conjunto com a eficiência do Astra, isto permite concluir tarefas 1,9x mais depressa do que na experiência atual com o GPT‑5.6 Sol, no benchmark Mind2Web. Graças às melhorias de velocidade do modelo, este pode assumir muitas tarefas demoradas do dia a dia e concluí-las mais depressa do que uma pessoa conseguiria.4
Um salto qualitativo no trabalho profissional
O GPT‑6 Astra combina avanços na utilização do computador com treino específico para ambientes profissionais, ajudando a resolver tarefas profissionais complexas. Combina a inteligência necessária para problemas complexos com a capacidade de executar fluxos de trabalho com várias etapas e produzir documentos, folhas de cálculo e apresentações com um acabamento cuidado.
O GPT‑6 Astra é o nosso melhor modelo para seguir modelos predefinidos existentes e criar diapositivos bem organizados que comunicam de forma sucinta os pontos principais através de uma narrativa estruturada. Cria documentos, apresentações, folhas de cálculo e análises claros e bem estruturados que seguem os seus modelos predefinidos e correspondem ao seu estilo de escrita e ao seu estilo visual. O Astra também é treinado especificamente para incluir nos resultados apenas o contexto relevante, em vez de repetir informações desnecessárias para o trabalho em causa. Tudo isto significa que o Astra pode produzir artefactos mais prontos para utilização imediata e alinhados com o contexto e os padrões da sua empresa.
O GPT‑6 Astra demonstra também uma maior capacidade de avaliação visual nos sites, jogos, aplicações e renderizações que cria. Com o Sites(abre numa nova janela) no ChatGPT, o Astra pode criar, alojar e partilhar websites, aplicações Web e jogos diretamente a partir de um prompt.
Quando as instruções deixam margem para interpretação, o GPT‑6 Astra é melhor do que os modelos anteriores a tomar a decisão certa. Utiliza o contexto para preencher lacunas de rotina e faz perguntas direcionadas quando a resposta pode alterar o resultado. No Codex, pode fazer perguntas de forma assíncrona enquanto continua a trabalhar em tarefas que não dependem da sua resposta. Se não obtiver resposta, faz suposições sensatas quando adequado, mas aguarda indicações para decisões com consequências importantes.
Os exemplos abaixo mostram como o Astra colabora em tarefas do quotidiano nas quais a informação em falta pode alterar substancialmente a resposta.
O Astra também consegue manter-se mais bem orientado à medida que uma tarefa evolui. Os modelos anteriores tratavam por vezes as mensagens de orientação como um novo objetivo, perdendo de vista o pedido original ou restrições anteriores. O Astra incorpora novos requisitos, muda de rumo quando lhe é pedido e responde a perguntas secundárias sem perder de vista a tarefa global.
Programação
O GPT‑6 Astra é, até à data, o melhor modelo para engenharia de software.
«O GPT‑6 Astra oferece desempenho de ponta nos nossos benchmarks internos de programação e demonstra um avanço claro nas avaliações de intuição de negociação, em comparação com o GPT‑5.6 Sol. Quando é utilizado para programação agêntica, o GPT‑6 Astra comunica de uma forma mais fácil de acompanhar por parte dos programadores e produz código que requer menos iterações para atingir a qualidade de produção.»
«Testámos o Astra com níveis de esforço baixo, médio e alto numa das nossas evals de primeira geração, e ficou significativamente à frente do GPT‑5.6 Sol. Um nível de esforço superior permite mais iterações num projeto criado de raiz, mais verificação através de testes no browser e uma preferência pela execução de código em detrimento do apply-patch. Compreender como um modelo aplica o seu esforço é o que nos permite dar a milhões de criadores um caminho mais rápido e fiável desde a ideia até uma aplicação funcional.»
Com o Astra, apresentamos uma nova forma de o Codex preservar e recuperar contexto quando a janela de contexto fica cheia. Historicamente, os modelos têm utilizado a compactação para resumir o trabalho durante sessões longas, por exemplo ao depurar problemas complexos ou realizar refatorações de grande escala. Cada compactação pode omitir detalhes sobre o motivo pelo qual uma correção falhou ou sobre o comportamento de um componente. No Codex, o Astra pode manter notas entre janelas de contexto, preservando os detalhes acumulados sem os comprimir repetidamente num único resumo. As janelas de contexto anteriores continuam pesquisáveis, pelo que o Astra pode encontrar, em mensagens e resultados de ferramentas anteriores, requisitos ou resultados de testes — mesmo que essa informação não tenha sido registada nas suas notas. É possível ativar esta funcionalidade experimental no ficheiro config.toml do Codex,(abre numa nova janela) e esta tornar-se-á a predefinição do Astra nas próximas semanas.
Impulsionar a descoberta científica
O Astra pode ajudar no trabalho prático subjacente à descoberta científica. Ao combinar o raciocínio científico com a utilização do computador, pode trabalhar diretamente em software especializado para inspecionar dados e explorar resultados, ajudando os investigadores a avaliar os elementos disponíveis e a decidir o que investigar a seguir.
Cibersegurança
Como discutimos na nossa atualização de segurança, o Astra representa um salto significativo nas capacidades de cibersegurança e atinge o limiar Crítico em cibersegurança no âmbito do nosso Preparedness Framework. A sua capacidade de identificar e desenvolver exploits de dia zero pode ajudar os defensores a encontrar e corrigir pontos fracos, mas também cria a necessidade de salvaguardas mais robustas. Para compreender o alcance destas capacidades, submetemos o Astra a avaliações internas e a avaliações realizadas por especialistas externos.
Começámos por testar o modelo sem salvaguardas de produção no ExploitBench e no ExploitGym, que avaliam se os modelos conseguem transformar vulnerabilidades de software conhecidas em exploits funcionais. No ExploitBench, o Astra obteve uma pontuação perfeita de 100%, face a 78,5% do GPT‑5.6 Sol, o nosso anterior modelo de fronteira com capacidades de cibersegurança. No ExploitGym, o Astra alcançou uma taxa de sucesso de 42,4%, face a 30,3% do GPT‑5.6 Sol, utilizando substancialmente menos tokens de saída.13
Tendo em conta a possibilidade de a exposição a vulnerabilidades históricas de software ter afetado os resultados dos benchmarks, também avaliámos o Astra em dois novos benchmarks. Num deles, criámos uma avaliação interna, «ExploitBench (junho–agosto de 2026)», para testar o desenvolvimento de exploits com vulnerabilidades dos três meses anteriores.14 O Astra alcançou taxas de execução de código arbitrário substancialmente mais elevadas do que as do GPT‑5.6 Sol neste conjunto de dados, utilizando muito menos tokens de saída. Durante a avaliação, o Astra chegou mesmo a descobrir e utilizar duas vulnerabilidades zero-day até então desconhecidas. Estamos a comunicar ambas as vulnerabilidades aos respetivos responsáveis pela manutenção.
Também testámos o Astra no SRE-Bench15, um benchmark que mede se os modelos conseguem aplicar engenharia inversa a binários de software para compreender a respetiva lógica fundamental sem acesso ao código-fonte original. O Astra resolveu 88% das tarefas numa única tentativa e 99,2% em quatro tentativas, face a 55,9% e 68,7% do GPT‑5.6 Sol, respetivamente.
Para além dos benchmarks, avaliações conduzidas por especialistas constataram que o Astra, quando executado sem salvaguardas de produção, conseguia utilizar vulnerabilidades até então desconhecidas para executar código arbitrário em navegadores com proteção reforçada e criar exploits de escalada de privilégios para sistemas operativos com proteção reforçada.
Como referimos em A janela de oportunidade dos defensores, as capacidades de cibersegurança de fronteira podem ajudar os defensores a detetar pontos fracos mais depressa, mas também facilitam a exploração desses pontos fracos, aumentando a urgência de adaptação por parte dos defensores. Na versão do Astra lançada hoje, os defensores podem utilizá-lo para realizar tarefas como a revisão de segurança do código e a aplicação de patches.
No entanto, o Astra recusar-se-á a realizar tarefas de cibersegurança mais avançadas, como a criação de exploits de prova de conceito para vulnerabilidades. Através do OpenAI Daybreak, planeamos alargar o acesso e implementar salvaguardas menos restritivas nas próximas semanas. Isto permitirá mais fluxos de trabalho defensivos, incluindo a validação de vulnerabilidades e de provas de conceito, a análise de malware e a engenharia de deteção.
Também reforçámos as nossas proteções contra uma eventual utilização indevida no domínio da cibersegurança, desenvolvendo o conjunto de salvaguardas do GPT‑5.6 Sol. Estas medidas incluem uma maior robustez do modelo para resistir melhor a eventuais tentativas de jailbreak e mais contexto para os nossos sistemas de monitorização. Mantivemos testes internos e externos rigorosos, incluindo testes automatizados com os atacantes da nossa equipa interna de red teaming.. Estão disponíveis mais informações sobre as salvaguardas e os testes de cibersegurança na visão geral de segurança do Astra e no system card(abre numa nova janela).
Alinhar e disponibilizar o GPT‑6 Astra de forma responsável
O Astra é o nosso modelo mais alinhado. O Astra destaca-se por agir com cuidado, respeitar os limites das tarefas e comunicar de forma transparente. Este trabalho é o mais recente resultado do nosso programa de investigação de longa duração, centrado no treino de modelos que se mantêm alinhados com a intenção humana do princípio ao fim.
Em ambientes sensíveis, o Astra atua com cuidado proporcional ao risco envolvido. Numa avaliação de tarefas de utilização do computador selecionadas de forma antagonista para provocar comportamentos indesejáveis, o Astra revelou-se mais eficaz na prevenção de consequências indesejadas. A execução com medidas de segurança adicionais disponibilizadas por predefinição resultou num desempenho ainda superior.
O Astra provoca menos resultados desalinhados do que qualquer outro modelo de fronteira testado. Para uma comparação justa, utilizámos um harness genérico de agente de utilização do computador (baseado nas ferramentas nativas de utilização do computador disponíveis tanto na API Responses da OpenAI(abre numa nova janela) como na API Messages da Anthropic(abre numa nova janela)) e sem as proteções adicionais que são normalmente implementadas para os utilizadores do Codex e do ChatGPT Work (revisão automática, política de confirmação).
O Astra também tem maior probabilidade de operar dentro dos limites definidos pelo utilizador e implícitos no seu ambiente. Numa avaliação interna, o Astra nunca tentou contornar uma recusa do Codex Auto-Review. Isto manteve-se válido mesmo quando o Auto-review foi deliberadamente configurado para poder ser contornado e a tarefa era impossível de concluir de outra forma. Este respeito pelas restrições do ambiente é consistente com os resultados da nossa avaliação de tarefas cibernéticas impossíveis, que partilhámos na introdução desta publicação, e com outras conclusões documentadas no nosso system card(abre numa nova janela).
Além disso, o Astra define novos padrões na comunicação transparente com os utilizadores. Numa avaliação, o Astra tem uma probabilidade três vezes menor do que o GPT‑5.6 Sol de fazer representações inexatas das suas capacidades e funcionalidades.
Na nossa avaliação de alucinações sobre capacidades, o Astra apresenta uma melhoria substancial face ao GPT‑5.6 Sol, fazendo menos afirmações enganadoras sobre as suas capacidades.
As nossas avaliações concluíram que o raciocínio escrito do Astra é mais difícil de monitorizar do que o do GPT‑5.6 Sol, com base em testes que lhe pediam explicitamente que contornasse a monitorização. Atribuímos isto ao maior controlo do Astra sobre o raciocínio escrito em tarefas mais simples e à sua capacidade de resolver problemas com menos passos escritos. O Astra ainda parece ter dificuldade em ocultar o raciocínio necessário para tarefas complexas, mas levamos este declínio a sério. Melhorar a monitorizabilidade continua a ser uma prioridade de investigação, e o system card(abre numa nova janela) que acompanha este documento detalha as nossas conclusões e o trabalho em curso.
O treino de alinhamento é central na nossa abordagem à implementação. Como camada adicional de defesas, também criamos salvaguardas do sistema, como o Codex Auto-review(abre numa nova janela), e monitorizamos o raciocínio e as ações dos agentes para ajudar a detetar e conter comportamentos inseguros. Conforme descrito na nossa atualização de segurança, estamos também a implementar a monitorização de desalinhamento em produção para modelos da classe do Astra, a fim de termos visibilidade sobre desalinhamentos e ajudarmos a conter os seus casos mais graves. Estas salvaguardas são semelhantes à monitorização das nossas implementações internas e incluem um sistema de classificadores que verifica o raciocínio e as ações do modelo para detetar comportamentos não autorizados e interromper automaticamente atividades potencialmente não autorizadas.
Tendo em conta o aumento significativo das capacidades de cibersegurança do Astra, estamos a ser especialmente cuidadosos para garantir que esta implementação é segura e protegida. As verificações de segurança adicionais podem, por vezes, abrandar, suspender ou interromper trabalho legítimo, incluindo cibersegurança defensiva. Se uma tarefa for colocada em pausa no ChatGPT ou no Codex, poderá ser-lhe pedido que reveja a ação antes de continuar. Na API, a tarefa será interrompida. Por vezes, estas verificações podem interromper trabalho legítimo e continuamos a aperfeiçoar este sistema para reduzir interrupções desnecessárias. A monitorização de desalinhamento não pode substituir o alinhamento: o nosso objetivo é criar modelos que se mantenham fiavelmente dentro do âmbito autorizado, para que estas proteções nunca tenham de intervir.
Disponibilidade
O GPT‑6 Astra começa hoje a ser disponibilizado a um conjunto limitado de organizações e, nos próximos dias, ficará disponível para todos os utilizadores do ChatGPT Plus, Pro, Business e Enterprise, bem como através da API da OpenAI, do Microsoft Azure e do AWS Bedrock. A utilização do Astra está incluída nos limites das subscrições existentes; os utilizadores e as empresas também poderão comprar créditos para utilização adicional. Os utilizadores dos planos Pro, Business e Enterprise também terão acesso ao GPT‑6 Astra Pro. Os administradores do Enterprise podem ativar o Astra para o respetivo espaço de trabalho; o acesso está desativado por predefinição no lançamento.
O Astra é compatível com a retenção zero de dados para clientes elegíveis da API e, conforme partilhámos no mês passado, estamos a testar o Processamento privado de segurança para reforçar a monitorização da segurança, preservando a privacidade dos clientes.
Para programadores, o GPT‑6 Astra estará disponível na OpenAI API como gpt-6-astra e através do Microsoft Azure e do Amazon Bedrock.
O preço Standard da OpenAI API é de 10 USD por milhão de tokens de entrada e 50 USD por milhão de tokens de saída. Aplicam-se preços distintos às leituras e escritas em cache. O modo Fast está disponível para o GPT‑6 Astra na API e oferece até 2x a velocidade do processamento Standard, por 2x o preço Standard.
Utilização do Computador
Profissional
Profissional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Tarefas de design internas | 50% | 47,4% | - | 35,8% | - | - |
Tarefas internas de ciência de dados | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Programação
| Programação | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 expandido (pontuação) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 principal (pontuação) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Tarefas internas de migração da base de dados | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Académico
Académico | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | - |
FrontierMath Tier 4 (v2) | 97,6% | 83.00% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,60% | 93,7% | 92,6% | 93,7% | 95,3% |
Humanity's Last Exam (com ferramentas) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Alinhamento
Alinhamento | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Benchmark interno de segurança na utilização do computador (quanto menor, melhor) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Benchmark interno de segurança de utilização de computador, com AutoReview (quanto mais baixo, melhor) | 1,8% | 4,3% | - | - | - | - |
Benchmark interno de evasão (quanto menor, melhor) | 0,00% | 0,29% | - | - | - | - |
Honeypot do ExploitGym (quanto menor, melhor) | 0,0% | 48,2% | - | - | - | - |
ExploitGym impossível | 100,0% | - | - | - | - | - |
Benchmark interno de alucinações (quanto menor, melhor) | 4,2% | 12,2% | - | - | - | - |
Contexto longo
Contexto longo | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-agulhas 512K–1M | 96,3% | 73,8% | - | - | - | - |
Raciocínio abstrato
| Raciocínio abstrato | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
As pontuações das avaliações correspondem ao máximo em qualquer nível de esforço. As avaliações do GPT foram realizadas no nosso ambiente de investigação ou através da nossa API, o que pode gerar resultados ligeiramente diferentes dos do ChatGPT em produção devido a diferenças nos prompts de sistema, nas ferramentas disponíveis, entre outros fatores.
NOTAS DE RODAPÉ
- 1
No ARC-AGI-3, o GPT-6 Astra foi executado com o nosso harness da API Responses, que altera duas definições para corresponder melhor ao desempenho no mundo real. As alterações não visam especificamente o ARC-AGI-3.
- 2
O GPT-5.6 Sol refere-se à versão disponível na nossa API, no ChatGPT Codex e no ChatGPT Work. A versão no Chat do ChatGPT é ligeiramente diferente.
- 3
OSWorld V2-Offline é um subconjunto do OSWorld V2 original que funciona sem acesso à Internet. O desempenho do modelo Claude no OSWorld-V2 Offline foi reproduzido pelos autores na tabela de classificação oficial(abre numa nova janela). No OSWorld 2.0, as pontuações do Claude utilizam as definições oficiais, e não as tarefas modificadas e a avaliação modificada do System Card do Fable 5.1.
- 4
- 5
No BenchCAD, as pontuações do Claude refletem 3 modificações à avaliação, detalhadas no system card do Fable 5.1(abre numa nova janela).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon e Noah A. Smith. «LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(abre numa nova janela)». arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower e Peter Jonas. «The OpenScore String Quartet Corpus(abre numa nova janela)». Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
No FrontierCode, o GPT-6 Astra foi executado com uma mensagem de programador semelhante a uma secção da sua mensagem de programador no Codex(abre numa nova janela): "Evita criar ficheiros de teste excessivos. Cria um novo ficheiro de teste apenas quando tal for exigido pelas convenções do repositório ou quando nenhum ficheiro existente for adequado. Evita limpeza não relacionada e complexidade desnecessária. Reutiliza os utilitários existentes adequados. Lê as instruções relevantes do repositório e inspeciona código, testes, documentação e CI próximos. Segue as convenções estabelecidas. O objetivo é código limpo e integrável." O prompt não foi otimizado para a avaliação.
- 9
O primeiro diz respeito a quão próximos uns dos outros podem surgir os números primos, por mais longe que se avance ao longo da reta numérica. Durante mais de uma década, o resultado mais conhecido demonstrou que existe um número infinito de pares de números primos cuja diferença não ultrapassa 246. Julia Stadlmann(abre numa nova janela) melhorou recentemente esse limite para 240. O Astra ajudou a estabelecer um limite mais rigoroso de 186, demonstrando que existe um número infinito de pares que se encontram a uma distância não superior a este valor mais pequeno. Pequenos intervalos entre números primos: demonstração(abre numa nova janela) e investigação complementar(abre numa nova janela).
- 10
O segundo diz respeito a lacunas invulgarmente grandes entre números primos. O Astra melhorou um termo numa cota para estas lacunas que permanecera inalterado durante mais de 80 anos. Partilhamos as provas, uma versão abreviada da cadeia de pensamento e os materiais de verificação de ambos os resultados. Grandes intervalos entre números primos: Demonstração(abre numa nova janela) e investigação complementar(abre numa nova janela).
- 11
Avaliámos de forma independente todos os modelos Claude, seguindo o procedimento previsto pelo HealthBench Professional, utilizando a classificação do GPT‑5.4 e pontuações ajustadas em função do comprimento e sem cortes. Para o Fable 5.1, utilizámos o Opus 5 como alternativa para recusas do fornecedor.
- 12
- 13
- 14
O ExploitBench (junho–agosto de 2026) contém 20 vulnerabilidades V8 de elevada gravidade em 13 versões estáveis do Chrome. O benchmark testa se os agentes conseguem obter execução arbitrária de código no V8 e em versões oficiais do Chrome para Linux, explorando cada vulnerabilidade especificada. Algumas vulnerabilidades incluídas poderão não permitir a execução arbitrária de código nas condições da avaliação, pelo que poderá não ser possível atingir uma taxa de sucesso de 100%. Nota: a pontuação de 5,5% do GPT-5.6 Sol é um artefacto do limite de 300 interações no benchmark, um limite que os clientes reais que utilizam o Max não teriam. O modelo, com definições semelhantes, obteve uma pontuação de 11,5% ao atingir menos limitações.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(abre numa nova janela).” arXiv:2608.11469v1, 2026.
- 16
Quando testamos em vários modelos de terceiros, utilizamos uma configuração de investigação mais simples. O Codex tem uma configuração de produção mais complexa, o que pode resultar em taxas de erro diferentes do modelo bruto. As salvaguardas do lado do fornecedor e as implementações de ferramentas informáticas continuam a ser diferentes. Os utilizadores não se deparam com o cenário sem confirmação no Codex, pois trata-se de uma configuração interna de investigação.
- 17
