Chip de IA Personalizado da OpenAI 'Jalapeño' Supera Nvidia em Desempenho de Inferência
O Amanhecer de uma Nova Era em Chips de IA: OpenAI e o Poder do "Jalapeño"
O cenário da inteligência artificial acaba de ganhar um novo protagonista no domínio do hardware. Durante a recente conferência Hot Chips, a OpenAI, conhecida por seus avanços em modelos de linguagem, revelou os primeiros benchmarks para seu próprio chip de inferência, batizado de "Jalapeño". As notícias são impactantes: o Jalapeño, segundo relatos, supera os chips Blackwell e Rubin da Nvidia em termos de throughput por watt e latência de token.
É fundamental entender que este é um chip focado exclusivamente na inferência. Isso significa que ele é otimizado para executar modelos de IA, em vez de treiná-los, uma distinção crucial no universo da IA. O Jalapeño não é sequer ajustado especificamente para os modelos da própria OpenAI; ele é, de fato, um acelerador de inferência de LLM (Large Language Model) de propósito geral. Esta entrada no hardware sublinha uma ambição crescente da OpenAI de controlar mais aspectos de sua infraestrutura tecnológica.
Desempenho Que Impressiona: Os Números por Trás do "Jalapeño"
A OpenAI afirma que o Jalapeño entrega um trabalho de IA 1,5 a 1,9 vezes maior por watt no pico de throughput em todos os três modelos testados. Além disso, ele promete uma latência de ponta a ponta 1,7 a 3,6 vezes menor do que os melhores sistemas disponíveis comercialmente. Para cargas de trabalho interativas, a empresa indica um desempenho ainda mais notável, de 2,1 a 4,1 vezes superior.
Estes resultados foram obtidos a partir de testes utilizando o benchmark público InferenceX da SemiAnalysis, com os números sendo fornecidos pela OpenAI e algumas execuções verificadas in loco pela SemiAnalysis. Os modelos avaliados incluíram o GPT-OSS 120B, Deepseek R1 670B e Kimi K2.5 1T. No GPT-OSS, o Jalapeño atingiu aproximadamente 1.400 tokens por segundo por usuário. Já no Deepseek R1, ele superou 700 tokens por segundo em uma única requisição concorrente.
Em velocidade de decodificação correspondente, o Jalapeño alcança de 54 a 104 vezes o throughput de tokens por quilowatt em comparação com o melhor acelerador disponível, dependendo do modelo. O mais surpreendente é que o Jalapeño registrou esses números sem empregar técnicas como previsão multi-token ou decodificação especulativa, otimizações que alguns dos sistemas de comparação já utilizavam. Isso sugere um potencial ainda maior para melhorias futuras.
Em sua análise de desempenho por watt, a SemiAnalysis foi categórica: "Jalapeño supera todos os outros chips". Dylan Patel, CEO da SemiAnalysis, adicionou uma perspectiva crucial: "Normalmente, chips de primeira geração não são competitivos, mas a OpenAI está superando a Nvidia Blackwell e até mesmo o Rubin."
Uma Comparação Justa: Jalapeño vs. Nvidia Vera Rubin
A SemiAnalysis aponta que a comparação mais justa não é com o Blackwell, mas sim com a plataforma mais recente da Nvidia, o Vera Rubin, dado que ambos utilizam memória HBM4. Mesmo aqui, o Jalapeño consegue extrair mais tokens de saída por megawatt do que o Vera Rubin. E isso acontece mesmo com o acelerador da Nvidia utilizando a otimização de previsão multi-token, que o Jalapeño ainda não adotou. Em termos de custo total de propriedade por token, os dois se mostram aproximadamente equivalentes.
Os Primeiros Passos e os Desafios à Frente
Contudo, existem algumas ressalvas importantes. A Nvidia e a AMD já publicaram resultados com modelos maiores, como Deepseek V4 Pro e Kimi K3, que ainda não foram testados no Jalapeño. Além disso, enquanto os sistemas Rubin já estão sendo enviados aos clientes, o Jalapeño ainda estaria em fase de amostras de engenharia, sem ter avançado para a produção em massa.
A OpenAI construiu o chip em um período de nove meses, em colaboração com a Broadcom. O trabalho de design começou em meados de 2024, e o design final foi para fabricação em novembro de 2025. O ciclo completo levou cerca de 16 meses, mas a OpenAI destaca que apenas nove meses se passaram entre o primeiro design do chip e o projeto final enviado à fábrica. Curiosamente, a empresa utilizou seus próprios modelos de IA durante o desenvolvimento, com gerações mais antigas auxiliando no design do chip e as mais recentes acelerando a programação e otimização.
Implicações para o Cenário da IA: O "Fosso CUDA" em Xeque?
A SemiAnalysis interpreta esse rápido desenvolvimento como um possível sinal de que o tão discutido "fosso CUDA" da Nvidia pode não ser mais tão intransponível. O "fosso CUDA" refere-se à vasta e consolidada ecossistema de software de programação de GPUs da Nvidia, que historicamente tem sido uma barreira significativa para a concorrência. "O fosso CUDA está potencialmente morto, dada a rapidez com que a OpenAI consegue desenvolver novos modelos em seu silício", escreveu a empresa.
Colaboração ou Competição? A Estratégia da OpenAI
Sarah Friar, CFO da OpenAI, esclarece que o chip se encaixa em uma estratégia computacional mais ampla, onde data centers, chips, modelos, plataforma de desenvolvedores, produtos e dispositivos trabalham como um sistema integrado. Ela afirma que o Jalapeño complementa as parcerias existentes da OpenAI com empresas como Nvidia, AMD, AWS, Cerebras e CoreWeave, em vez de substituí-las.
A OpenAI possui laços profundos com muitas dessas empresas. Nvidia, AMD e AWS são investidores ou parceiros de computação, sendo a Nvidia um dos maiores. Cada uma delas também está construindo seus próprios chips de IA, o que torna o relacionamento tanto cooperativo quanto competitivo. Dito isso, todas essas empresas continuam afirmando que o mundo nunca terá poder computacional suficiente, uma alegação que convenientemente apoia seus próprios modelos de negócios.
O Próximo Passo
A entrada da OpenAI no desenvolvimento de hardware com o "Jalapeño" é um divisor de águas. Não apenas demonstra uma capacidade impressionante de inovação, mas também sinaliza uma possível descentralização no fornecimento de poder computacional para a IA, desafiando a hegemonia de players estabelecidos. Esta jogada pode redefinir a dinâmica de custo e desempenho para a inferência de IA em larga escala.
Com o "Jalapeño" desafiando os gigantes e a IA acelerando a própria inovação de hardware, qual você acredita que será o próximo grande salto na corrida pelo poder computacional?
Receba os próximos posts
IA, bastidores e casos reais — direto no seu e-mail. Sem spam.
