GPT-6.1Sol
Near-Astra intelligence for a fifth of the price
Apresentamos o GPT‑6.1 Sol, uma atualização do GPT‑6 Sol com um desempenho excecional em programação agêntica, bem como na utilização do computador e no trabalho profissional. Aproxima o Sol do GPT‑6 Astra em tarefas exigentes, a um quinto do preço padrão dos tokens de entrada e saída do Astra, dando aos programadores mais margem para criar e executar agentes capazes com o mesmo orçamento.
O GPT‑6.1 Sol oferece um desempenho próximo do Astra ao preço do Sol, tornando-o no modelo com a melhor relação custo-desempenho disponível atualmente. A entrada em cache custa apenas 0,10 $ por milhão de tokens — um desconto de 95% face ao preço padrão de entrada —, tornando-o mais acessível para cargas de trabalho agênticas que precisam de reutilizar contexto em pedidos repetidos.
O GPT‑6 Astra continua a ser, no geral, o nosso modelo de fronteira mais capaz. O GPT‑6.1 Sol oferece um novo equilíbrio entre capacidade e custo para o trabalho importante que os utilizadores querem realizar com maior frequência e para os clientes da API que criam e executam aplicações em grande escala.

O GPT‑6.1 Sol apresenta melhorias substanciais face ao GPT‑6 Sol no trabalho profissional complexo, desde a escrita e depuração de código à compreensão de documentos e à execução de fluxos de trabalho empresariais com várias etapas. Em várias destas avaliações, aproxima-se do desempenho do GPT‑6 Astra a um custo substancialmente inferior.
No DeepSWE v1.1, que avalia tarefas complexas de engenharia de software em bases de código reais, o GPT‑6.1 Sol iguala o GPT‑6 Astra a cerca de um quinto do custo, superando o melhor resultado do GPT‑6 Sol em 6,4 pontos percentuais, com menor esforço de raciocínio e custo.
No DeepSWE 1.1(abre numa nova janela), os agentes de IA resolvem tarefas inéditas de engenharia de software de longa duração.
No GDP.pdf, que mede a precisão com que os modelos respondem a questões profissionais usando documentos PDF complexos, incluindo tabelas, gráficos, diagramas e detalhes em letra pequena, o GPT‑6.1 Sol supera o Opus 5.5 com alternativas de recurso, a menos de metade do custo por tarefa nas definições de raciocínio testadas. Aproxima-se também do desempenho de ponta do GPT‑6 Astra a cerca de um quinto do custo por tarefa.
No GDP.pdf(abre numa nova janela), os modelos têm de responder a pedidos reais sobre PDFs complexos provenientes de fluxos de trabalho profissionais nas áreas das finanças, da saúde, do direito e de outros sete domínios profissionais.
No AutomationBench, que mede se os agentes concluem corretamente fluxos de trabalho empresariais com várias etapas, o GPT‑6.1 Sol supera o Opus 5.5 em 2,2 pontos percentuais com esforço de raciocínio médio, a cerca de um terço do custo. Este resultado supera também o do GPT‑6 Sol em 4,8 pontos percentuais com a mesma definição.
In AutomationBench 1.0.6(abre numa nova janela), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
O GPT‑6.1 Sol também apresenta progressos substanciais em tarefas que exigem interação com aplicações informáticas. No conjunto offline do OSWorld 2.0, que avalia agentes em fluxos de trabalho exigentes de utilização do computador, o GPT‑6.1 Sol supera o GPT‑6 Sol em sete pontos percentuais com esforço de raciocínio máximo, a menos de metade do custo. Fica a apenas 2,1 pontos percentuais do resultado do Astra com esforço de raciocínio máximo, a cerca de um sétimo do custo por tarefa.
In OSWorld 2.0(abre numa nova janela), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
No Terminal-Bench Science 0.1, que avalia fluxos de trabalho científicos, incluindo análise de dados, simulação e demonstração de teoremas, o GPT‑6.1 Sol obtém mais do dobro da pontuação do GPT‑6 Sol com esforço de raciocínio máximo, a menos de metade do custo por tarefa. Com esforço máximo, o GPT‑6.1 Sol custa, em média, 5,47 $ por tarefa, face a 23,21 $ do Opus 5.5 e 23,80 $ do Astra, oferecendo uma capacidade científica substancial a um custo mais de 75% inferior ao de qualquer um destes modelos.
O GPT‑6 Astra continua a obter a pontuação mais elevada entre os modelos testados, com 68,1%, e deve ser usado nas tarefas de investigação científica mais difíceis.
No Terminal-Bench Science 0.1(abre numa nova janela), os agentes executam fluxos de trabalho de investigação científica com recurso a código e ferramentas de terminal, incluindo análise de dados, execução de simulações e ajuste de modelos.
O GPT‑6.1 Sol também melhora a exatidão factual em prompts difíceis. Com esforço de raciocínio muito elevado, a sua taxa de erros factuais é de 4,1%, abaixo dos 4,5% do GPT‑6 Sol e mais próxima dos 4,0% do Astra com a mesma definição, com um custo por tarefa cerca de 83% inferior ao do Astra.
Esta avaliação mede a proporção de respostas com pelo menos um erro factual em conversas sem dados identificativos, nas quais os utilizadores assinalaram um erro de um modelo anterior. Estes prompts deliberadamente difíceis não são representativos da utilização típica.
Avaliamos a exatidão factual em conversas do ChatGPT sem dados identificativos, nas quais os utilizadores assinalaram um erro factual de um modelo anterior. Estas conversas propícias a erros não são representativas da utilização típica, em que os erros factuais são mais raros.
O GPT‑6.1 Sol apresenta melhorias substanciais face ao GPT‑6 Sol nas nossas avaliações de alinhamento, aproximando-se do GPT‑6 Astra.
O GPT‑6.1 Sol é mais transparente quanto às suas limitações e mais fiável no respeito pela intenção do utilizador e pelas restrições de segurança. Em avaliações exigentes, apresenta taxas de falha inferiores às do GPT‑6 Sol na transparência sobre ferramentas de pesquisa que não funcionam, no respeito por restrições explícitas e na prevenção de resultados não autorizados durante tarefas agênticas. Não observámos tentativas de contornar um sistema automatizado de revisão de segurança, à semelhança do GPT‑6 Astra e o GPT‑6 Sol.
As avaliações abaixo testam deliberadamente situações exigentes e não medem as taxas de falha na utilização típica.
O GPT‑6.1 Sol está disponível a partir de hoje para todos os utilizadores Plus, Pro, Business, Enterprise e Edu no ChatGPT Work e no Codex. Estes modelos ainda não estão disponíveis no Chat. Os programadores também podem aceder ao modelo através da API da OpenAI como gpt-6.1-sol. Os preços padrão da API são de 2 $ por milhão de tokens de entrada, 0,10 $ por milhão de tokens de entrada em cache e 10 $ por milhão de tokens de saída.
Em simultâneo, lançamos o GPT‑6 Astra Ultrafast, o modelo de fronteira mais rápido do mundo, até 8 vezes mais rápido do que o GPT‑6 Astra, bem como o GPT‑6.1 Sol Ultrafast. Estes modelos estão disponíveis na API e também no ChatGPT Work e no Codex para os utilizadores do nosso novo nível Pro, com os limites de utilização mais elevados, por 500 $/mês. Com o GPT‑6.1 Sol Ultrafast, os programadores podem obter inteligência próxima da do Astra com até 8 vezes a velocidade, por um custo de API semelhante ao anterior custo do GPT‑6 Astra.
Autor
As avaliações do GPT foram realizadas no nosso ambiente de investigação ou através da nossa API, que podem produzir resultados ligeiramente diferentes dos do ChatGPT em produção devido a diferenças nos prompts de sistema, nas ferramentas disponíveis, nos níveis de esforço, etc. As avaliações dos modelos concorrentes foram retiradas de relatórios públicos.

