Em março de 2026, a Nvidia anunciou o Nvidia Groq 3 LPX, um rack com 256 LPUs da Groq. Em agosto, o sistema havia entrado em produção plena. Dez anos antes, a Nvidia apresentava a Tesla P100 em torno de mais de 15 bilhões de transistores e 16GB de memória de alta largura de banda; agora, entregava um potencial substituto de GPU dentro de um rack da Nvidia.
Principais pontos
- Nvidia e Groq confirmaram um acordo não exclusivo de licenciamento de US$ 20 bilhões relacionado à inferência de IA.
- O rack Nvidia Groq 3 LPX contém 256 LPUs da Groq e as combina com 128GB de SRAM no chip.
- A Nvidia reportou 3.400 tokens por segundo para o Groq 3 LPX em um benchmark da Artificial Analysis usando Gemma 4 31B e uma sequência de entrada de 100.000 tokens.
- Materiais para investidores analisados pelo The Wall Street Journal mostraram que OpenAI e Anthropic reportavam custos de inferência acima da metade da receita.
- A Nvidia divulgou US$ 3,5 bilhões em garantias para empresas que arrendam terrenos, energia e instalações de data center — quatro vezes o nível do terceiro trimestre.
A Nvidia está construindo sua próxima vantagem competitiva em torno dos termos comerciais e da infraestrutura que cercam a computação heterogênea para IA: integração, entrega, financiamento e utilização. Está licenciando arquiteturas especializadas, transformando-as em sistemas com a marca Nvidia e bancando partes da implantação. À medida que a inferência se torna o centro recorrente de custos, o controle se desloca para o fornecedor capaz de empacotar o perfil certo de latência, throughput, memória e custo em capacidade que o cliente possa comprar e manter utilizada.
A Nvidia comprou valor de opção em vez de exigir exclusividade
Nvidia e Groq firmaram um acordo confirmado de licenciamento não exclusivo de US$ 20 bilhões relacionado à inferência de IA. O fundador da Groq, Jonathan Ross, que ajudou a criar a TPU do Google, juntou-se à Nvidia, assim como vários executivos seniores da Groq. A Nvidia garantiu acesso à arquitetura e às pessoas que sabiam como transformá-la em um sistema.
A Nvidia transformou o acordo em produto. O Groq 3 LPX combina suas LPUs com 128GB de SRAM no chip e fica ao lado do Vera Rubin NVL72 baseado em GPU. A Nebius tornou-se sua primeira cliente quando a produção plena começou em agosto.
A Groq reteve independência real. O acordo não exclusivo não dá à Nvidia nenhum direito estabelecido de impedir que tecnologia derivada da Groq atenda outros compradores. O Departamento de Justiça também está supostamente examinando se o arranjo contornou a fiscalização antitruste.
A Nvidia evitou uma aposta binária. Uma aquisição total teria concentrado risco regulatório e técnico; ignorar a Groq teria deixado a Nvidia exposta caso as LPUs vencessem em tarefas de serving economicamente importantes. Ao licenciar a tecnologia, contratar seus líderes e integrá-la a um produto, a Nvidia obteve uma opção de entrega sem assumir controle exclusivo. A Groq pode permanecer fora da Nvidia enquanto sua arquitetura fica dentro de um rack da Nvidia, tornando o pedido de compra mais relevante do que a fronteira corporativa.
Diferentes tarefas de inferência recompensam diferentes silícios
O próprio roadmap da Nvidia mostra por que a inferência resiste a uma única resposta arquitetural. A empresa projetou o Rubin CPX para a fase de prefill da inferência e enfatizou FLOPS de computação em vez de largura de banda de memória. O Groq 3 LPX segue outra rota, combinando 128GB de SRAM com 40 petabytes por segundo de largura de banda de SRAM.
A Nvidia reportou 3.400 tokens por segundo para o Groq 3 LPX em um benchmark da Artificial Analysis executando Gemma 4 31B com uma sequência de entrada de 100.000 tokens. O resultado mostra como uma arquitetura estreitamente especializada se comporta sob um perfil definido de modelo, contexto e latência.
A Nuance Labs mostra por que as aplicações dividem o mercado. A empresa levantou uma Série A de US$ 50 milhões, com participação da Nvidia, para criar avatares conversacionais de baixa latência. Em um avatar face a face, o atraso na resposta molda a experiência do produto. Um agente de segundo plano pode trocar velocidade por custo menor ou maior throughput agregado, porque nenhum ser humano espera por cada resposta.
As GPUs continuam formidáveis em inferência. Em uma comparação de hardware da Nvidia, Google e AMD, a Nvidia alcançou aproximadamente cinco vezes os tokens por dólar da TPU v6e do Google e o dobro da MI300X da AMD. A Nvidia também detinha uma participação estimada de 95% nas GPUs para aprendizado de máquina em 2023, o que lhe dá uma grande base instalada e profunda familiaridade entre desenvolvedores.
Um especialista precisa superar mais do que um benchmark de GPU. Precisa vencer a maturidade do software, os hábitos de implantação e o custo de introduzir outra arquitetura em produção. A Nvidia tratou a Groq como comercialmente útil para tarefas selecionadas, enquanto sua arquitetura principal ainda liderava as implantações amplas.
As margens dos modelos agora escolhem a pilha de serving
OpenAI e Anthropic levaram a decisão de serving diretamente para a demonstração de resultados. Materiais para investidores analisados pelo The Wall Street Journal mostraram que ambas as empresas reportavam custos de inferência superiores à metade da receita. Posteriormente, engenheiros da OpenAI teriam dito a colegas que encontraram uma forma de mais do que cortar pela metade o custo de inferência.
Para um provedor de modelos que gasta mais da metade da receita com inferência, melhorias na eficiência do modelo, no batching, no uso de memória, na utilização ou na seleção de hardware fluem diretamente para a margem bruta. O provedor precisa comprar com base no custo por resultado útil sob requisitos reais de serviço, tendo o desempenho de pico como apenas uma das variáveis.
Nesse nível de custo, o CFO e o engenheiro de infraestrutura estão escolhendo a mesma pilha de serving.
O Barclays projetou despesas de capital com inferência de US$ 208,2 bilhões em 2026 e espera que os gastos com inferência superem os de treinamento em dois anos. Em seguida, a General Compute obteve um empréstimo de US$ 400 milhões garantido por chips específicos para inferência, descrito como o primeiro financiamento desse tipo.
Ao aceitar chips específicos para inferência como garantia, a Upper90 teve de avaliar utilização, demanda de revenda, obsolescência técnica e os contratos vinculados às máquinas. Financiar infraestrutura de inferência de IA transforma a adequação arquitetural em uma questão de subscrição de risco. Um chip que tem bom desempenho, mas não consegue se manter ocupado, é uma garantia fraca.
Especialistas atraem dinheiro antes de os padrões se consolidarem
Os criadores do motor de inferência open source vLLM fundaram a Inferact para comercializar essa camada e levantaram uma rodada seed de US$ 150 milhões. Ao construir uma empresa em torno do software de serving, eles separaram a otimização de inferência do desenvolvimento de modelos.
A Euclyd, sediada nos Países Baixos, levantou mais de €200 milhões em uma Série A para chips de inferência. A Cerebras reportou receita de US$ 180 milhões no segundo trimestre, alta de 74% em relação ao ano anterior, e elevou suas projeções de receita anual e margem bruta. A DeepSeek estaria desenvolvendo um chip de inferência para reduzir sua dependência de hardware da Nvidia e da Huawei.
Os fundadores do vLLM, os investidores da Euclyd, os clientes da Cerebras e os engenheiros da DeepSeek enfrentavam, cada um, sua própria versão do custo recorrente de serving. Cada grupo isolou uma camada em que hardware ou software especializado poderia capturar a economia.
Foi reportado que o Gemma 3 do Google e o Command A da Cohere rodam em uma ou duas H100s, reduzindo o hardware necessário para uma implantação individual. Modelos mais eficientes podem reduzir a demanda por tarefa mesmo à medida que o uso cresce. À medida que cada implantação precisa de menos aceleradores, os fornecedores têm menos espaço para esconder uma arquitetura que se encaixa mal na carga de trabalho.
A Nvidia está precificando o risco de utilização no rack
A Nvidia também usa seu balanço patrimonial para reduzir o risco de implantação. A empresa divulgou US$ 3,5 bilhões em garantias a empresas que arrendam terrenos, energia e instalações de data center, quatro vezes seu nível do terceiro trimestre. Essas garantias podem ajudar empresas de infraestrutura sem classificações de crédito robustas a garantir os insumos necessários para instalar capacidade.
A CoreWeave foi pioneira no uso de dívida garantida por GPUs e veículos de propósito específico. A Nvidia teria se oferecido para alugar GPUs ociosas de provedores de nuvem jovens em troca de uma participação em sua receita. A empresa também buscou conectar detentores de GPUs a operadores de data center nórdicos que dispunham de capacidade de implantação.
Operadores de nuvem carregam a exposição à construção e à operação. Credores precificam a garantia, e clientes se comprometem com capacidade. A Nvidia usa garantias, mecanismos de suporte a aluguel e intermediação para reduzir a chance de que o hardware comprado fique ocioso. Ao oferecer US$ 3,5 bilhões em garantias, a Nvidia colocou parte de seu próprio crédito por trás da expansão.
Perguntas frequentes
O resultado reportado de 3.400 tokens por segundo pode ser comparado diretamente a alegações de desempenho de GPUs?
Não com base nas informações fornecidas. O número da Groq está vinculado ao Gemma 4 31B e a uma sequência de entrada de 100.000 tokens; uma comparação equivalente também exigiria o mesmo modelo, comprimento de contexto, meta de latência, configuração de batching e base de custo no hardware concorrente.
Quanta capacidade do Groq 3 LPX a Nebius se comprometeu a comprar?
O texto identifica a Nebius como a primeira cliente quando a produção plena começou, mas não divulga tamanho do pedido, valor do contrato, cronograma de implantação ou compromisso de utilização.
Quais empresas recebem os US$ 3,5 bilhões em garantias da Nvidia, e sob quais termos?
O texto diz que as garantias apoiam empresas que arrendam terrenos, energia e instalações de data center, mas não nomeia todos os beneficiários nem divulga prazos, taxas, exigências de garantia ou condições de inadimplência.
Quanto dos US$ 208,2 bilhões projetados pelo Barclays para capex de inferência em 2026 irá para sistemas da Nvidia ou baseados na Groq?
A projeção se refere ao total de despesas de capital com inferência. O texto não fornece uma alocação por fornecedor, portanto não pode estabelecer a participação da Nvidia ou do Groq LPX nesses gastos.
Caminho do Groq 3 LPX até a produção
- Março de 2026 — A Nvidia anunciou o Groq 3 LPX, um rack contendo 256 LPUs da Groq.
- Agosto de 2026 — O Groq 3 LPX entrou em produção plena, com a Nebius como sua primeira cliente.
Um comprador de nuvem agora compara capacidade de GPU e LPU ao lado de cronogramas de entrega, termos de financiamento, trabalho de integração e suporte à utilização. A Nvidia pode continuar sendo a contraparte quando um chip especializado melhor se ajusta à tarefa. As 256 LPUs da Groq dentro de seu rack mostram o acordo: a Groq pode vencer a carga de trabalho enquanto a Nvidia fica com o pedido de compra.