Saltar para o conteúdo principal
OpenAI

25 de agosto de 2026

EngenhariaEmpresa

Os primeiros resultados do Jalapeño mostram velocidade e eficiência líderes em inferência de IA

A carregar…
Grande plano do chip de inferência Jalapeño montado numa placa de circuito verde-azulada.

Desde o anúncio do Jalapeño, o primeiro chip de inferência personalizado da OpenAI, temos estado a testar o chip e o sistema desenvolvido em torno dele. Os resultados mostram um avanço significativo no desempenho: o Jalapeño consegue processar mais trabalho de IA por unidade de potência, ao mesmo tempo que devolve respostas mais rapidamente. O Jalapeño proporciona, simultaneamente, uma taxa de processamento mais elevada e menor latência com uma única arquitetura, enquanto os sistemas de hardware existentes têm muitas vezes de fazer um compromisso entre as duas.

Para os clientes, isso pode significar respostas mais rápidas, agentes com maior capacidade de resposta e um acesso mais fiável à medida que a procura aumenta. A nossa missão é garantir que a inteligência artificial geral beneficia toda a humanidade. Estes ganhos ajudarão a tornar a IA, cada vez mais capaz, mais acessível em termos de custos e mais amplamente disponível.

Os modelos da OpenAI também aceleraram o desenvolvimento do Jalapeño. As gerações anteriores ajudaram a equipa a conceber e a pôr o chip em funcionamento, enquanto os nossos modelos mais recentes estão a acelerar a forma como o otimizamos e programamos. O desempenho do Jalapeño abrange o GPT‑OSS 120B, o DeepSeek R1 e o Kimi K2.5 1T, mostrando que a arquitetura funciona em modelos desenvolvidos tanto dentro como fora da OpenAI. Em todos os três, o Jalapeño proporcionou 1,5 a 1,9 vezes mais trabalho de IA por watt à taxa de processamento máxima e uma latência de ponta a ponta 1,7 a 3,6 vezes inferior à dos sistemas de comparação. Para cargas de trabalho altamente interativas, apresentou um desempenho 2,1 a 4,1 vezes superior.

O Jalapeño é também prova de uma vantagem full stack mais ampla. A OpenAI pode conceber modelos, produtos, software de serviço, chips, memória, redes e sistemas em conjunto, utilizando o que aprendemos com cargas de trabalho reais para melhorar todas as camadas da pilha. O Jalapeño está a funcionar com silício próprio, com resultados medidos, e é o início de uma plataforma multigeracional. Nos próximos meses, iremos aumentar a produção do Jalapeño para disponibilizar produtos mais rápidos, mais capazes e mais eficientes aos nossos clientes.

Como medimos o desempenho do Jalapeño

Avaliamos o desempenho com uma experiência de utilizador equivalente, medindo quanto trabalho útil de IA cada sistema consegue concluir por unidade de potência, cumprindo simultaneamente a latência exigida pelos clientes e pelos agentes interativos. Isto é especialmente relevante para agentes, que têm de concluir muitas etapas em sequência, pelo que os atrasos podem acumular-se ao longo de uma tarefa inteira.

Para compreender o desempenho do Jalapeño na prática, testámo-lo no InferenceX, um benchmark público da SemiAnalysis que mede todo o processo de atendimento de um pedido de IA. Comparámos o Jalapeño com os principais sistemas de IA disponíveis comercialmente em toda a gama operacional testada, desde o serviço com elevada taxa de processamento até à utilização altamente interativa e de baixa latência. O Jalapeño ofereceu uma melhor combinação de taxa de processamento, eficiência energética e latência. Embora o desempenho seja por vezes apresentado por chip, acreditamos que a métrica mais útil é o desempenho por unidade de potência.

Jalapeño aumenta a vantagem face ao melhor TBT anterior

Jalapeño oferece mais tokens por utilizador

Jalapeño oferece maior taxa de processamento por quilowatt

Nos três modelos públicos, o Jalapeño apresentou uma melhor combinação de desempenho por watt e latência em toda a gama operacional testada, colocando-o na fronteira de Pareto. Para comparar os sistemas de forma consistente, normalizámos os resultados utilizando a potência nominal do chip publicada para cada acelerador. O Jalapeño tem uma potência nominal de 700 watts, embora a sua potência sustentada medida se tenha mantido igual ou inferior a 550 watts nas cargas de trabalho testadas.

O Jalapeño teve um desempenho robusto nos GPT‑OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. No Kimi, o maior modelo público que testámos, proporcionou aproximadamente 1,5 vezes mais elevado desempenho de pico por watt e uma latência ponta a ponta 3,4 vezes inferior à do sistema de comparação. Nos nossos testes internos, a vantagem do Jalapeño aumentou ainda mais nos modelos de fronteira da OpenAI, o que sugere que a arquitetura se torna mais valiosa à medida que as cargas de trabalho aumentam e se tornam mais exigentes.

Conceber uma arquitetura para velocidade e eficiência num único chip

O Jalapeño foi concebido desde o início partindo da seguinte questão: que hardware construiríamos se a sua principal função fosse servir modelos de linguagem modernos e futuros, especialmente agentes interativos? Os ganhos do Jalapeño resultam de conceber em conjunto o chip, a memória, a rede, o software e o sistema à escala de rack em torno de cargas de trabalho reais de modelos de linguagem. A inferência de modelos de linguagem passa por várias fases distintas, com diferentes gargalos. O pré-preenchimento, quando o sistema processa um prompt, exige muita capacidade de computação, enquanto a decodificação, quando o sistema gera a resposta token a token, é mais limitada pela largura de banda da memória. A comunicação também pode acrescentar latência quando os dados têm de se deslocar entre núcleos e chips, deixando algumas unidades de processamento inativas enquanto esperam. Um sistema que se destaca numa fase pode perder essa vantagem enquanto espera por dados ou transfere o estado do modelo entre recursos diferentes.

Concebemos o Jalapeño para minimizar a movimentação de dados e os atrasos de comunicação. Isto significa que o estado do modelo, incluindo a cache KV utilizada durante a geração de uma resposta, pode ser explicitamente alocado e mantido localmente, enquanto o sistema ativa a combinação certa de computação, memória e redes para cada fase de inferência. A rede é parte integrante da arquitetura. O seu amplo domínio permite que toda a carga de trabalho permaneça dentro de um único sistema interligado, minimizando a movimentação de dados e ajudando a manter o pedido rápido e eficiente do início ao fim. O resultado é um acelerador equilibrado e fungível, capaz de suportar arquiteturas de modelos em evolução, de se destacar tanto no prefill como no decode e de se adaptar à medida que o equilíbrio entre ambos muda, uma característica definidora das cargas de trabalho autónomas.

Usámos IA para conceber o chip, e concebemos o chip para que a IA o pudesse programar

A IA desempenhou um papel direto no desenvolvimento do Jalapeño, permitindo à equipa passar do desenho inicial ao tape-out em nove meses, explorando implementações, encurtando os ciclos de desenho, medição e verificação e iterando continuamente sobre cargas de trabalho de modelos. A IA também ajudou a otimizar os circuitos aritméticos do chip, permitindo à equipa integrar mais desempenho de computação no chip dentro do prazo.

Jalapeño foi concebido como um alvo de programação claro e previsível, tanto para humanos como para IA. Os engenheiros podem descrever o trabalho através de tensores locais, comunicação explícita e sincronização previsível. A IA pode então otimizar a forma como esse trabalho é mapeado, posicionado, agendado e coordenado em todo o sistema. Essa estrutura clara e previsível proporciona à IA uma forma tratável de abordar o problema tradicionalmente difícil da programação paralela.

O suporte a cada nova família de modelos continua a exigir novos kernels e otimizações específicas do modelo. Com o Codex e o GPT‑Astra, a equipa levou em dois meses três modelos de pesos abertos que não faziam parte do plano de produção original do Jalapeño a um elevado desempenho. Isto demonstrou tanto a flexibilidade da arquitetura como a rapidez com que a IA nos pode ajudar a programá-la. Para blocos selecionados de atenção e mistura de especialistas do GPT‑OSS, as implementações geradas por IA foram 1,5 a 1,8 vezes mais rápidas do que as implementações existentes escritas por especialistas humanos. Esses valores aplicam-se aos blocos selecionados, não ao modelo completo, mas apontam para um novo e poderoso ciclo de desenvolvimento.

O caminho a seguir para uma inferência eficiente e ultra-rápida

A infraestrutura de IA é valiosa pelo trabalho útil no mundo real que permite. Ao produzir mais trabalho útil com a mesma energia e o mesmo hardware, o Jalapeño pode ajudar-nos a dar resposta a uma maior procura e a reduzir o custo de fornecer um resultado bem-sucedido. Para a OpenAI, isto pode melhorar a alavancagem operacional, permitindo que o trabalho útil e as receitas cresçam mais depressa do que o custo de servir. Também pode apoiar uma adoção mais ampla e o investimento contínuo em melhores modelos, produtos e infraestrutura. Uma inferência mais rápida pode possibilitar iterações mais rápidas e novos casos de utilização.

Jalapeño alarga o que é possível para uma inferência eficiente e de baixa latência:

  • Inferência em modo ultra-rápido com eficiências anteriormente disponíveis apenas no modo rápido
  • Inferência no modo Fast com eficiências antes disponíveis apenas no modo em lote
  • Eficiência mais elevada para inferência em modo de processamento em lote

Pretendemos começar a desdobrar o Jalapeño na infraestrutura de computação da OpenAI até ao final do ano. É a primeira geração de um plano de desenvolvimento multigeracional: a Gen 2 está numa fase avançada de desenvolvimento e a Gen 3 está a ganhar forma. Cada geração basear-se-á no que aprendemos e avançará ainda mais tanto a eficiência como a velocidade.

Satisfazer a crescente procura por IA exigirá mais capacidade computacional de todas as fontes disponíveis. Continuaremos a implementar amplamente aceleradores da NVIDIA e de outros parceiros para cargas de trabalho de treino e inferência. A nossa missão é garantir que a inteligência artificial geral beneficia toda a humanidade.

À medida que nos preparamos para a implementação, continuamos a qualificação para produção, a aperfeiçoar o software, a preparar a operação do Jalapeño à escala e a validar o desempenho em mais modelos. Os resultados até agora mostram o que é possível quando concebemos todo o sistema em conjunto: IA mais responsiva, capaz e autónoma, disponibilizada de forma mais eficiente a mais pessoas.

Anexo

Jalapeño está na fronteira de Pareto no GPT‑OSS 120B

FRONTEIRA TAXA DE PROCESSAMENTO por kW

InferenceX · GPT‑OSS‑120B · 8k/1k nominal · STP · TDP do pacote: Jalapeño 700 W; GB200 1200 W

Jalapeño lidera em todos os pontos operacionais do GPT‑OSS

PICO E TAXA DE PROCESSAMENTO CORRESPONDENTE

InferenceX · GPT‑OSS‑120B · 8k/1k nominal · STP · TDP do pacote: Jalapeño 700 W; GB200 1200 W

Pico misto mais elevado de TPS/kW

≈1,9×

85 448 vs 44 960 misto/kW

Menor latência de ponta a ponta

≈1,7×

1,03 s vs 1,80 s

TBT mín. inferior

≈2,7×

0,69 vs 1,87 ms (1459 vs 535 tok/s/utilizador)

Maior taxa de processamento no TBT anterior

≈53,7×

22 935 vs 427 misto/kW (a 535,28 tok/s/utilizador)

Jalapeño está na fronteira de Pareto no DeepSeek R1 670B

FRONTEIRA TAXA DE PROCESSAMENTO por kW

InferenceX · DeepSeek R1 MXFP4 · 8k/1k nominal · STP · TDP do pacote: Jalapeño 700 W; GB300 1400 W

Jalapeño lidera nos diferentes pontos de operação do DeepSeek R1

PICO E TAXA DE PROCESSAMENTO CORRESPONDENTE

InferenceX · DeepSeek R1 MXFP4 · 8k/1k nominal · STP · TDP do pacote: Jalapeño 700 W; GB300 1400 W

Pico misto mais elevado de TPS/kW

≈1,7×

19 641 vs 11 781 misto/kW

Menor latência de ponta a ponta

≈3,6×

1,65 s vs 5,99 s

TBT mín. inferior

≈4,1×

1,43 vs 5,90 ms (700 vs 169 tok/s/utilizador)

Maior taxa de processamento no TBT anterior

≈104,3×

12 258 vs 118 mistos/kW (a 169,41 tok/s/utilizador)

Jalapeño está de fronteira de Pareto no Kimi K2.5 1T

FRONTEIRA TAXA DE PROCESSAMENTO por kW

InferenceX · Kimi K2.5 MXFP4 · 8k/1k nominal · STP · TDP do pacote: Jalapeño 700 W; GB300 1400 W

Jalapeño lidera em todos os pontos de operação do Kimi K2.5

PICO E TAXA DE PROCESSAMENTO CORRESPONDENTE

InferenceX · Kimi K2.5 MXFP4 · 8k/1k nominal · STP · TDP do pacote: Jalapeño 700 W; GB300 1400 W

Pico misto mais elevado de TPS/kW

≈1,5×

18 195 vs 11 862 mistura/kW

Menor latência de ponta a ponta

≈3,4×

1,56 s vs 5,31 s

TBT mín. inferior

≈3,8×

1,44 vs 5,48 ms (694 vs 182 tok/s/utilizador)

Maior taxa de processamento no TBT anterior

≈56,1×

6744 vs 120 misto/kW (a 182,46 tok/s/utilizador)

Autor

OpenAI