OpenAI entra na disputa dos chips de IA com ganhos de velocidade e eficiência

Jalapeno-chip-final
Jalapeno-chip-final

Desde o anúncio do Jalapeño, o primeiro chip de inferência personalizado da OpenAI, temos testado o chip e o sistema construído em torno dele. Os resultados mostram um avanço significativo no desempenho: o Jalapeño consegue processar mais tarefas de IA por unidade de energia, além de retornar respostas mais rapidamente. O Jalapeño oferece maior taxa de transferência e menor latência em uma única arquitetura, enquanto os sistemas de hardware existentes geralmente precisam fazer uma concessão entre os dois.

Para os clientes, isso pode significar respostas mais rápidas, agentes mais ágeis e acesso mais confiável à medida que a demanda aumenta. Nossa missão é garantir que a inteligência artificial geral beneficie toda a humanidade. Esses avanços ajudarão a tornar a IA cada vez mais capaz mais acessível e amplamente disponível.

Os modelos da OpenAI também aceleraram o desenvolvimento do Jalapeño. As gerações anteriores ajudaram a equipe a projetar e desenvolver o chip, enquanto nossos modelos mais recentes estão acelerando a forma como o otimizamos e programamos. O desempenho do Jalapeño abrange o GPT-OSS 120B, o DeepSeek R1 e o Kimi K2.5 1T, demonstrando que a arquitetura funciona com modelos desenvolvidos tanto dentro quanto fora da OpenAI. Nos três casos, o Jalapeño apresentou um desempenho de IA por watt de 1,5 a 1,9 vezes maior em termos de taxa de transferência máxima e uma latência de ponta a ponta de 1,7 a 3,6 vezes menor do que os sistemas de comparação. Para cargas de trabalho altamente interativas, o desempenho foi de 2,1 a 4,1 vezes superior.

O Jalapeño também demonstra uma vantagem abrangente em toda a pilha de tecnologia. A OpenAI consegue projetar modelos, produtos, software de serviço, chips, memória, redes e sistemas em conjunto, usando o que aprendemos com cargas de trabalho reais para aprimorar cada camada da pilha. O Jalapeño utiliza silício próprio com resultados mensuráveis ​​e representa o início de uma plataforma multigeracional. Nos próximos meses, intensificaremos a produção do Jalapeño para oferecer produtos mais rápidos, mais capazes e mais eficientes para nossos clientes.

Como medimos o desempenho do Jalapeño

Avaliamos o desempenho com uma experiência de usuário equivalente, medindo a quantidade de trabalho útil de IA que cada sistema consegue realizar por unidade de poder computacional, atendendo à latência exigida por clientes e agentes interativos. Isso é especialmente importante para os agentes, que precisam concluir muitas etapas em sequência, de modo que os atrasos podem se acumular ao longo de toda a tarefa.

Para entender o desempenho prático do Jalapeño, testamos seu funcionamento no InferenceX, um benchmark público da SemiAnalysis que mede todo o processo de atendimento de uma requisição de IA. Comparamos o Jalapeño com os principais sistemas de IA disponíveis comercialmente em toda a faixa de operação testada, desde o atendimento de alto rendimento até o uso altamente interativo e de baixa latência. O Jalapeño apresentou uma melhor combinação de rendimento, eficiência energética e latência. Embora o desempenho às vezes seja relatado por chip, acreditamos que o padrão mais útil seja o desempenho por unidade de potência.

Jalapeño amplia a vantagem no TBT, que já foi o melhor resultado da história.

Jalapeño oferece mais tokens por usuário.

Jalapeño proporciona maior rendimento por quilowatt.

Em todos os três modelos públicos, o Jalapeño apresentou uma melhor combinação de desempenho por watt e latência em toda a faixa operacional testada, posicionando-o na fronteira de Pareto. Para comparar os sistemas de forma consistente, normalizamos os resultados usando a potência nominal de cada chip acelerador. O Jalapeño tem uma potência nominal de 700 watts, embora sua potência sustentada medida tenha permanecido em 550 watts ou menos nas cargas de trabalho testadas.

O Jalapeño apresentou um desempenho sólido nos conjuntos de dados GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. No Kimi, o maior modelo público que testamos, ele ofereceu um desempenho máximo por watt aproximadamente 1,5 vezes maior e uma latência de ponta a ponta 3,4 vezes menor do que o sistema de comparação. Em nossos testes internos, a vantagem do Jalapeño se ampliou ainda mais em modelos OpenAI de ponta, sugerindo que a arquitetura se torna mais valiosa à medida que as cargas de trabalho crescem e se tornam mais exigentes.

Projetando velocidade e eficiência em um único chip.

O Jalapeño foi projetado desde o início com a seguinte pergunta: que hardware construiríamos se sua função principal fosse atender modelos de linguagem modernos e futuros, especialmente agentes interativos? Os ganhos do Jalapeño vêm do projeto conjunto do chip, da memória, da rede, do software e do sistema em escala de rack, focados em cargas de trabalho reais de modelos de linguagem. A inferência de modelos de linguagem passa por diversas fases distintas, cada uma com seus próprios gargalos. O pré-preenchimento, quando o sistema processa uma solicitação, exige alto poder computacional, enquanto a decodificação, quando o sistema gera a resposta token por token, é mais limitada pela largura de banda da memória. A comunicação também pode adicionar latência quando os dados precisam ser transferidos entre núcleos e chips, deixando algumas unidades de processamento ociosas enquanto aguardam. Um sistema que se destaca em uma fase pode perder essa vantagem enquanto espera por dados ou enquanto transfere o estado do modelo entre diferentes recursos.

Projetamos o Jalapeño para minimizar a movimentação de dados e os atrasos na comunicação. Isso significa que o estado do modelo, incluindo o cache chave-valor usado durante a geração de uma resposta, pode ser explicitamente armazenado e mantido localmente, enquanto o sistema ativa a combinação ideal de computação, memória e rede para cada fase de inferência. A rede é parte integrante da arquitetura. Seu amplo domínio permite que toda a carga de trabalho permaneça dentro de um único sistema conectado, minimizando a movimentação de dados e ajudando a garantir que toda a solicitação seja rápida e eficiente do início ao fim. O resultado é um acelerador equilibrado e flexível que pode suportar arquiteturas de modelo variáveis, se destacar tanto no preenchimento quanto na decodificação e se adaptar conforme o equilíbrio entre eles muda, uma característica essencial das cargas de trabalho com agentes.

Usamos IA para projetar o chip e o projetamos de forma que a IA pudesse programá-lo.

A IA desempenhou um papel direto no desenvolvimento do Jalapeño, permitindo que a equipe passasse do projeto inicial à fabricação em nove meses, explorando implementações, encurtando os ciclos de projeto, medição e verificação e iterando continuamente nas cargas de trabalho do modelo. A IA também ajudou a otimizar os circuitos aritméticos do chip, permitindo que a equipe incluísse mais desempenho computacional no chip dentro do prazo.

O Jalapeño foi projetado como um alvo de programação claro e previsível, tanto para humanos quanto para IA. Os engenheiros podem descrever o trabalho por meio de tensores locais, comunicação explícita e sincronização previsível. A IA pode então otimizar como esse trabalho é mapeado, posicionado, agendado e coordenado em todo o sistema. Essa estrutura clara e previsível oferece à IA uma maneira viável de lidar com o problema tradicionalmente difícil da programação paralela.

O suporte a cada nova família de modelos ainda exige novos kernels e otimizações específicas para cada modelo. Usando o Codex com o GPT-Astra, a equipe conseguiu atingir alto desempenho em três modelos de peso aberto que não faziam parte do plano de produção original do Jalapeño em apenas dois meses. Isso demonstrou tanto a flexibilidade da arquitetura quanto a velocidade com que a IA pode nos ajudar a programá-la. Para blocos selecionados de atenção e mistura de especialistas do GPT-OSS, as implementações geradas por IA foram de 1,5 a 1,8 vezes mais rápidas do que as implementações existentes escritas por especialistas humanos. Esses números se aplicam aos blocos selecionados, não ao modelo completo, mas apontam para um novo e poderoso ciclo de desenvolvimento.

O caminho a seguir para uma inferência eficiente e ultrarrápida.

A infraestrutura de IA é valiosa devido ao trabalho útil e prático que possibilita. Ao gerar mais trabalho útil com a mesma capacidade de processamento e hardware, o Jalapeño pode nos ajudar a atender a uma demanda maior e reduzir o custo de obtenção de um resultado bem-sucedido. Para a OpenAI, isso pode melhorar a alavancagem operacional, permitindo que o trabalho útil e a receita cresçam mais rapidamente do que o custo de atendimento. Também pode impulsionar uma adoção mais ampla e o investimento contínuo em melhores modelos, produtos e infraestrutura. Uma inferência mais rápida pode possibilitar iterações mais ágeis e novos casos de uso.

Jalapeño amplia as possibilidades de inferência eficiente e de baixa latência:

  • Inferência em modo ultrarrápido com eficiências anteriormente disponíveis apenas no modo rápido.
  • Inferência em modo rápido com eficiências anteriormente disponíveis apenas em modo batch.
  • Maior eficiência para inferência em modo batch.

Planejamos começar a implementar o Jalapeño na infraestrutura de computação da OpenAI até o final do ano. Esta é a primeira geração de um roteiro multigeneracional: a Geração 2 está em fase avançada de desenvolvimento e a Geração 3 está tomando forma. Cada geração se baseará no que aprendermos e aprimorará ainda mais a eficiência e a velocidade.

Para atender à crescente demanda por IA, será necessário mais poder computacional de todas as fontes disponíveis. Continuaremos a implantar amplamente aceleradores da NVIDIA e de outros parceiros para cargas de trabalho de treinamento e inferência. Nossa missão é garantir que a inteligência artificial geral beneficie toda a humanidade.

Enquanto nos preparamos para a implementação, continuamos a qualificar a produção, aprimorando o software, preparando-nos para operar o Jalapeño em larga escala e validando o desempenho em mais modelos. Os resultados obtidos até agora demonstram o que é possível quando projetamos todo o sistema em conjunto: uma IA mais responsiva, capaz e proativa, entregue de forma mais eficiente a mais pessoas.

Fonte: OpenAI.

Foto: Reprodução

Notícias Relacionadas