A OpenAI divulgou nesta segunda-feira (25) os primeiros resultados do Jalapeño, seu chip proprietário para inferência de IA. O hardware foi projetado para servir modelos de linguagem em escala, com foco em eficiência energética, baixa latência e integração vertical entre hardware e software.

Eficiência e velocidade à frente dos chips comerciais

Segundo a OpenAI, o Jalapeño supera os principais aceleradores do mercado em métricas de throughput e consumo de energia. Nos testes públicos realizados com três modelos — GPT‑OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T — o chip entregou de 1,5 a 1,9 vezes mais trabalho de IA por watt no pico de throughput, e de 1,7 a 3,6 vezes menor latência end-to-end em relação aos concorrentes. Em workloads altamente interativos, o ganho de desempenho chegou a 4,1 vezes.

A empresa afirma que a avaliação usou o benchmark InferenceX da SemiAnalysis, que mede o processo completo de servir uma requisição de IA, cobrindo desde o prompt até a entrega da resposta. Para garantir comparabilidade, os resultados foram normalizados pela potência publicada de cada acelerador — no caso do Jalapeño, classificado oficialmente em 700 watts, mas operando em testes abaixo de 550 watts.

No modelo Kimi K2.5 1T, o maior testado publicamente, o Jalapeño atingiu aproximadamente 1,5 vez mais eficiência por watt e 3,4 vezes menor latência do que o sistema de referência. Testes internos com modelos de fronteira da própria OpenAI sugerem vantagem ainda maior conforme a escala e complexidade das tarefas aumenta.

Arquitetura desenhada para LLMs e agentes interativos

O Jalapeño foi projetado considerando as demandas específicas de modelos de linguagem modernos — especialmente agentes que precisam de respostas rápidas e executam múltiplos passos em sequência. O chip e todo o sistema ao redor (memória, rede, racks) foram desenhados para minimizar movimentação de dados e latência de comunicação entre componentes.

O design permite que o estado do modelo, como o KV cache utilizado na geração de tokens, permaneça local e acessível rapidamente, reduzindo gargalos tanto na fase de prefill (cálculo do prompt) quanto na de decode (geração dos tokens de resposta). O sistema de rede integrado amplia o domínio de atuação do chip, mantendo a carga de trabalho conectada e eficiente do início ao fim da inferência.

IA acelerando o próprio hardware

A OpenAI destaca que modelos de IA participaram ativamente do projeto do Jalapeño, desde a fase de concepção até otimizações em circuitos aritméticos e verificação. Segundo a empresa, o tempo do design inicial ao tapeout foi de nove meses, ritmo viabilizado por loops acelerados de simulação e testes com apoio de modelos generativos.

Além disso, o chip foi pensado para ser programável por IA, facilitando a adaptação a arquiteturas e workloads que evoluem rapidamente.

Stack proprietário e planos futuros

O Jalapeño marca a entrada da OpenAI em uma estratégia de stack vertical: além de modelos, a empresa agora controla design de hardware, software de serving, memória, rede e integração de sistemas. Isso permite otimizar cada camada com feedbacks de workloads reais, segundo a companhia.

A OpenAI afirma que o Jalapeño é o início de uma plataforma multigeracional de silício próprio. Nos próximos meses, o chip será expandido para atender a uma base maior de clientes, com promessa de produtos mais rápidos, eficientes e escaláveis.

Por que importa

Com o Jalapeño, a OpenAI se posiciona para reduzir dependência de fornecedores como Nvidia e AMD, buscando ganhos de custo e controle sobre a cadeia produtiva. O movimento antecipa uma tendência de verticalização também vista em empresas como Google (TPU) e Amazon (Inferentia), mas com foco explícito em workloads de LLM e agentes. Para clientes, a promessa é de acesso mais estável, rápido e, potencialmente, mais barato a modelos de IA — um diferencial relevante diante da competição e da crescente demanda por aplicações generativas.

Fonte: OpenAI – Jalapeño’s first results

Tags
  • #openai
  • #jalapeno
  • #chip
  • #inferencia
  • #hardware
  • #ai-accelerator