Jalapeño: resultados iniciais mostram velocidade e eficiência líderes do setor em inferência de IA

Desde que anunciamos o Jalapeño, o primeiro chip de inferência personalizado da OpenAI, temos testado o chip e o sistema construído em torno dele. Os resultados mostram um avanço significativo de desempenho: o Jalapeño consegue processar mais trabalho de IA por unidade de potência e, ao mesmo tempo, retornar respostas com mais rapidez. Com uma única arquitetura, o Jalapeño oferece maior taxa de processamento e menor latência, enquanto os sistemas de hardware atuais geralmente precisam fazer uma escolha entre as duas.
Para os clientes, isso pode significar respostas mais rápidas, agentes mais responsivos e acesso mais confiável à medida que a demanda aumenta. Nossa missão é garantir que a inteligência artificial geral beneficie toda a humanidade. Esses ganhos ajudarão a reduzir o custo de sistemas de IA cada vez mais capazes e a ampliar sua disponibilidade.
Os modelos da OpenAI também aceleraram o desenvolvimento do Jalapeño. As gerações anteriores ajudaram a equipe a projetar e colocar o chip em operação, enquanto nossos modelos mais recentes estão acelerando sua otimização e programação. O desempenho do Jalapeño abrange o GPT‑OSS 120B, o DeepSeek R1 e o Kimi K2.5 1T, mostrando que a arquitetura funciona com modelos desenvolvidos dentro e fora da OpenAI. Nos três modelos, o Jalapeño processou de 1,5 a 1,9 vezes mais trabalho de IA por watt no pico da taxa de processamento e apresentou latência de ponta a ponta de 1,7 a 3,6 vezes menor que a dos sistemas de comparação. Em cargas de trabalho altamente interativas, o desempenho foi de 2,1 a 4,1 vezes maior.
O Jalapeño também evidencia uma vantagem mais ampla decorrente da integração de toda a stack. A OpenAI pode projetar de forma integrada modelos, produtos, software de inferência, chips, memória, redes e sistemas, usando o que aprende com cargas de trabalho reais para melhorar cada camada da stack. O Jalapeño é um chip próprio em funcionamento, com resultados medidos, e marca o início de uma plataforma multigeracional. Nos próximos meses, ampliaremos a implantação do Jalapeño para oferecer produtos mais rápidos, capazes e eficientes aos nossos clientes.
Avaliamos o desempenho com uma experiência do usuário equivalente, medindo quanto trabalho útil de IA cada sistema consegue concluir por unidade de potência e mantendo a latência necessária para clientes e agentes interativos. Isso é especialmente importante para agentes, que precisam concluir muitas etapas em sequência, pois os atrasos podem se acumular ao longo de uma tarefa inteira.
Para entender o desempenho do Jalapeño na prática, nós o testamos no InferenceX, um benchmark público da SemiAnalysis que mede o processamento completo de uma solicitação de IA. Comparamos o Jalapeño a sistemas de IA líderes disponíveis comercialmente em toda a faixa de operação testada, desde a operação com alta taxa de processamento até o uso altamente interativo e de baixa latência. O Jalapeño apresentou uma combinação superior de taxa de processamento, eficiência energética e latência. Embora o desempenho às vezes seja informado por chip, acreditamos que a métrica mais útil seja o desempenho por unidade de potência.
Nos três modelos públicos, o Jalapeño apresentou uma combinação superior de desempenho por watt e latência em toda a faixa de operação testada, posicionando-se na fronteira de Pareto. Para comparar os sistemas de maneira consistente, normalizamos os resultados usando a potência nominal publicada para o chip de cada acelerador. A potência nominal do Jalapeño é de 700 watts, embora sua potência sustentada medida tenha permanecido igual ou inferior a 550 watts nas cargas de trabalho testadas.
O Jalapeño apresentou um desempenho sólido com o GPT‑OSS 120B, o DeepSeek R1 670B e o Kimi K2.5 1T. No Kimi, o maior modelo público que testamos, ele apresentou desempenho máximo por watt aproximadamente 1,5 vez maior e latência de ponta a ponta 3,4 vezes menor que o sistema de comparação. Em nossos testes internos, a vantagem do Jalapeño aumentou ainda mais nos modelos de ponta da OpenAI, o que sugere que a arquitetura se torna mais valiosa conforme as cargas de trabalho ficam maiores e mais exigentes.
O Jalapeño foi projetado desde o início a partir da seguinte pergunta: que hardware criaríamos se sua principal função fosse executar modelos de linguagem modernos e futuros, especialmente agentes interativos? Os ganhos do Jalapeño resultam do projeto integrado do chip, da memória, da rede, do software e do sistema em escala de rack, com base em cargas de trabalho reais de modelos de linguagem. A inferência de modelos de linguagem passa por várias fases distintas, cada uma com gargalos diferentes. O pré-preenchimento, quando o sistema processa um prompt, exige muita capacidade computacional; já a decodificação, quando o sistema gera a resposta token por token, é mais limitada pela largura de banda da memória. A comunicação também pode aumentar a latência quando os dados precisam transitar entre núcleos e chips, deixando algumas unidades de processamento ociosas durante a espera. Um sistema que se destaca em uma fase pode perder essa vantagem enquanto aguarda dados ou transfere o estado do modelo entre diferentes recursos.
Projetamos o Jalapeño para minimizar a movimentação de dados e os atrasos de comunicação. Isso permite posicionar explicitamente e manter local o estado do modelo, incluindo o cache KV usado durante a geração de uma resposta, enquanto o sistema ativa a combinação adequada de capacidade computacional, memória e rede para cada fase da inferência. A rede é parte integral da arquitetura. A ampla abrangência dessa rede permite que toda a carga de trabalho permaneça em um único sistema conectado, minimizando a movimentação de dados e ajudando a manter a solicitação completa rápida e eficiente do início ao fim. O resultado é um acelerador equilibrado e versátil, capaz de oferecer suporte a mudanças nas arquiteturas dos modelos, destacar-se tanto no pré-preenchimento quanto na decodificação e se adaptar à variação do equilíbrio entre essas fases — uma característica marcante das cargas de trabalho baseadas em agentes.
A IA teve participação direta no desenvolvimento do Jalapeño, permitindo que a equipe passasse do projeto inicial ao tapeout em nove meses por meio da exploração de implementações, do encurtamento dos ciclos de projeto, medição e verificação e da iteração contínua com cargas de trabalho de modelos. A IA também ajudou a otimizar os circuitos aritméticos do chip, permitindo que a equipe incorporasse mais desempenho computacional ao chip dentro do prazo.
O Jalapeño foi projetado como um alvo de programação claro e previsível para humanos e IA. Os engenheiros podem descrever o trabalho por meio de tensores locais, comunicação explícita e sincronização previsível. A IA pode então otimizar como esse trabalho é mapeado, alocado, escalonado e coordenado em todo o sistema. Essa estrutura clara e previsível oferece à IA uma forma viável de enfrentar o problema tradicionalmente difícil da programação paralela.
O suporte a cada nova família de modelos ainda exige novos kernels e otimizações específicas para cada modelo. Usando o Codex com o GPT‑Astra, a equipe levou três modelos com pesos abertos que não faziam parte do plano de produção original do Jalapeño a um alto nível de desempenho em dois meses. Isso demonstrou tanto a flexibilidade da arquitetura quanto a velocidade com que a IA pode nos ajudar a programá-la. Em blocos específicos de atenção e de mistura de especialistas do GPT‑OSS, as implementações geradas por IA foram de 1,5 a 1,8 vezes mais rápidas que as implementações existentes desenvolvidas por especialistas humanos. Esses números se aplicam aos blocos selecionados, não ao modelo completo, mas apontam para um novo e poderoso ciclo de desenvolvimento.
A infraestrutura de IA é valiosa pelo trabalho útil que viabiliza no mundo real. Ao produzir mais trabalho útil com a mesma potência e o mesmo hardware, o Jalapeño pode nos ajudar a atender a uma demanda maior e reduzir o custo de entregar um resultado bem-sucedido. Para a OpenAI, isso pode melhorar a alavancagem operacional ao permitir que o trabalho útil e a receita cresçam mais rápido que o custo operacional. Isso também pode favorecer uma adoção mais ampla e o investimento contínuo em modelos, produtos e infraestrutura melhores. Uma inferência mais rápida pode viabilizar iterações mais ágeis e novos casos de uso.
O Jalapeño amplia as possibilidades de inferência eficiente e de baixa latência:
- Inferência no modo ultrarrápido com níveis de eficiência antes disponíveis apenas no modo rápido
- Inferência no modo rápido com níveis de eficiência antes disponíveis apenas no modo em lote
- Maior eficiência para inferência no modo em lote
Planejamos começar a implantar o Jalapeño na infraestrutura computacional da OpenAI até o fim do ano. É a primeira geração de um plano multigeracional: a Gen 2 está em estágio avançado de desenvolvimento, e a Gen 3 começa a tomar forma. Cada geração aproveitará nossos aprendizados e promoverá novos avanços em eficiência e velocidade.
Atender à crescente demanda por IA exigirá mais capacidade computacional de todas as fontes disponíveis. Continuaremos implantando amplamente aceleradores da NVIDIA e de outros parceiros para cargas de trabalho de treinamento e inferência. Nossa missão é garantir que a inteligência artificial geral beneficie toda a humanidade.
Enquanto nos preparamos para a implantação, continuamos qualificando o sistema para produção, amadurecendo o software, preparando-nos para operar o Jalapeño em larga escala e validando o desempenho com mais modelos. Os resultados até agora mostram o que é possível quando projetamos o sistema completo de forma integrada: IA mais responsiva, capaz e baseada em agentes, oferecida com mais eficiência a mais pessoas.
Fronteira de taxa de processamento por kW
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP do encapsulamento: Jalapeño 700 W; GB200 1.200 W
Taxa de processamento no pico e em velocidade equivalente
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP do encapsulamento: Jalapeño 700 W; GB200 1.200 W
Maior pico de TPS mistos/kW
≈1,9×
85.448 vs. 44.960 tokens mistos/kW
Menor latência de ponta a ponta
≈1,7×
1,03 s vs. 1,80 s
TBT mínimo mais baixo
≈2,7×
0,69 vs. 1,87 ms (1.459 vs. 535 tok/s/user)
Maior taxa de processamento no TBT anterior
≈53,7×
22.935 vs. 427 tokens mistos/kW (a 535,28 tok/s/user)
Fronteira de taxa de processamento por kW
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP do encapsulamento: Jalapeño 700 W; GB300 1.400 W
Taxa de processamento no pico e em velocidade equivalente
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP do encapsulamento: Jalapeño 700 W; GB300 1.400 W
Maior pico de TPS mistos/kW
≈1,7×
19.641 vs. 11.781 tokens mistos/kW
Menor latência de ponta a ponta
≈3,6×
1,65 s vs. 5,99 s
TBT mínimo mais baixo
≈4,1×
1,43 vs. 5,90 ms (700 vs. 169 tok/s/user)
Maior taxa de processamento no TBT anterior
≈104,3×
12.258 vs. 118 tokens mistos/kW (a 169,41 tok/s/user)
Fronteira de taxa de processamento por kW
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP do encapsulamento: Jalapeño 700 W; GB300 1.400 W
Taxa de processamento no pico e em velocidade equivalente
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP do encapsulamento: Jalapeño 700 W; GB300 1.400 W
Maior pico de TPS mistos/kW
≈1,5×
18.195 vs. 11.862 tokens mistos/kW
Menor latência de ponta a ponta
≈3,4×
1,56 s vs. 5,31 s
TBT mínimo mais baixo
≈3,8×
1,44 vs. 5,48 ms (694 vs. 182 tok/s/user)
Maior taxa de processamento no TBT anterior
≈56,1×
6.744 vs. 120 tokens mistos/kW (a 182,46 tok/s/user)


