Em agosto de 2026, a Nvidia nomeou a Nebius como a primeira cliente de um rack com 256 chips de inferência da Groq. A Nvidia havia licenciado o projeto da Groq, mas a Groq permaneceu independente e planejava construir sua própria capacidade.
Principais pontos
- O rack Groq 3 LPX da Nvidia contém 256 LPUs Groq 3, 128GB de SRAM on-chip e 40 PBps de largura de banda de SRAM.
- A Nvidia nomeou a Nebius como a primeira cliente do LPX em agosto de 2026.
- A Groq levantou US$ 650 milhões após o acordo com a Nvidia e estabeleceu a meta de 200MW de capacidade até o fim de 2027.
- O acordo entre Nvidia e Groq, estimado em cerca de US$ 20 bilhões, era uma licença não exclusiva, não uma aquisição anunciada.
- A Nvidia informou 3.400 tokens por segundo para o LPX no Gemma 4 31B, com uma sequência de entrada de 100.000 tokens.
Diferentes tarefas de atendimento favorecem diferentes silícios
Em março de 2025, o Financial Times informou a projeção do Barclays de que os investimentos de capital em inferência chegariam a US$ 208,2 bilhões em 2026 e superariam os gastos com treinamento em dois anos. Era uma previsão, não um total medido para 2026. Isso ajuda a explicar por que fabricantes de chips passaram a projetar para tarefas específicas de atendimento, em vez de tratar cada solicitação de inferência como uma carga de trabalho de treinamento menor.
O prefill processa um prompt recebido; o decode produz a resposta. A SemiAnalysis descreveu o Rubin CPX da Nvidia como otimizado para prefill, priorizando throughput de computação em vez de largura de banda de memória. A abordagem da Groq, com forte uso de SRAM, faz uma escolha diferente. O projeto do modelo também altera a exigência de hardware: foi informado que o Gemma 3, do Google, e o Command A, da Cohere, rodavam em uma ou duas H100s. Um comprador que escolhe hardware para atendimento precisa especificar o modelo, o prompt e a meta de latência antes que uma alegação de velocidade de chip se torne útil.
A Nvidia licenciou o projeto e trouxe seus criadores
The Information informou um acordo de licenciamento entre Nvidia e Groq de cerca de US$ 20 bilhões em dezembro de 2025. A Groq descreveu o acordo como não exclusivo e disse que continuaria operando de forma independente. O CEO Jonathan Ross e outros executivos seniores se juntaram à Nvidia. Assim, a Nvidia ganhou acesso tanto a uma arquitetura de inferência quanto às pessoas que sabiam transformá-la em produto, sem anunciar a aquisição da Groq.
Em março de 2026, a Nvidia anunciou o Groq 3 LPX: um rack com 256 LPUs Groq 3, 128GB de SRAM on-chip e 40 PBps de largura de banda de SRAM. A Nvidia o posicionou ao lado de seu rack Vera Rubin NVL72, e não como substituto da plataforma de GPUs. A unidade que a Nvidia apresentou aos clientes era um sistema configurado com seu próprio nome.
Os atrasos da Groq colocaram a entrega à frente da velocidade
A Groq já havia enfrentado a diferença entre um projeto rápido e capacidade que pode ser entregue. Em julho de 2025, The Information informou que a Groq havia reduzido sua projeção de receita para aquele ano, de mais de US$ 2 bilhões para mais de US$ 500 milhões, citando atrasos na capacidade de data centers. Nenhuma das projeções era receita efetiva, mas a revisão identificou uma restrição que o desempenho do chip, por si só, não conseguia eliminar.
Em agosto de 2026, a Nvidia disse que o LPX havia entrado em produção plena e nomeou a Nebius como sua primeira cliente. A Nvidia também informou 3.400 tokens por segundo em um benchmark da Artificial Analysis que usava o Gemma 4 31B e uma sequência de entrada de 100.000 tokens. A Nvidia informou esse resultado para um modelo e um prompt, sem estabelecer o custo por token, o consumo de energia ou a utilização do LPX em comparação com uma implementação com GPUs. Tampouco o registro publicado estabelece quem define os preços do LPX, aloca racks ou qualifica clientes.
Outros desenvolvedores escolhem rotas diferentes para o atendimento
A AMD adquiriu a Taalas, cujo projeto integra os pesos do modelo diretamente ao silício; as primeiras demonstrações foram informadas em até 17.000 tokens por segundo. A OpenAI, em vez disso, apresentou uma prévia de uma camada de API Ultrafast alimentada por Cerebras, informando até 750 tokens de saída por segundo para o GPT-5.6 Sol. A AMD adquiriu um projeto, a OpenAI empacotou hardware especializado como serviço, e a Nvidia colocou LPUs licenciadas em um rack. Esses números de velocidade descrevem diferentes cargas de trabalho e não podem classificar as três ofertas pela economia entregue.
A especialização também tem um limite. Uma análise de cargas de trabalho totalmente agênticas argumentou que aplicações sem uma pessoa esperando cada resposta podem dar menos valor à latência ultrabaixa. Uma comparação separada de tokens por dólar favoreceu a Nvidia em relação à TPU v6e e à AMD MI300X na métrica de inferência escolhida. Nenhuma das conclusões exclui chips especializados; ambas tornam a carga de trabalho e o custo operacional do comprador mais relevantes que a taxa de saída publicada mais rápida.
“Não exclusivo” deixa aberta a fronteira de vendas
A Groq levantou US$ 650 milhões após o acordo com a Nvidia para expandir seu próprio negócio de data centers e disse que pretendia atingir 200MW de capacidade até o fim de 2027. Essa capacidade planejada dá à Groq uma rota potencial para clientes separada do LPX. É evidência contra tratar a licença como absorção comercial completa, embora uma rodada de financiamento e uma meta não estabeleçam quanta capacidade a Groq consegue entregar.
O Departamento de Justiça estaria examinando se a Nvidia buscou contornar a fiscalização antitruste na transação com a Groq. Uma investigação não é uma conclusão. Ela, porém, torna relevantes os termos comerciais não divulgados: clientes e concorrentes não podem inferir, a partir da palavra “não exclusivo”, quem controla o fornecimento, os preços ou o acesso à inferência baseada na Groq por meio de cada empresa.
Perguntas frequentes
Quando se esperava que o Nvidia Groq 3 LPX estivesse disponível?
A cobertura da CRN em março de 2026 dizia que o LPX estaria disponível no segundo semestre de 2026. Posteriormente, a Nvidia disse que ele havia entrado em produção plena em agosto de 2026.
O que mede a meta de 200MW da Groq?
É uma meta declarada de capacidade de energia de data centers, não uma contagem de chips nem uma estimativa garantida de throughput para clientes. A Groq disse que pretendia alcançar essa capacidade até o fim de 2027.
A Nvidia comprou a Groq integralmente?
Nenhuma aquisição foi anunciada no relato do texto. A Groq descreveu o acordo como não exclusivo, disse que permaneceria independente e afirmou que a GroqCloud continuaria operando.
O que continua desconhecido sobre comprar ou operar um sistema LPX?
O registro publicado não divulga preços do LPX, alocação de racks, qualificação de clientes, custo por token, consumo de energia ou utilização em relação a implementações com GPUs. Essas omissões impedem uma comparação da economia entregue apenas com base no benchmark de velocidade informado.
Principais marcos na rota de comercialização entre Groq e Nvidia
- Março de 2025 — O Financial Times informou a previsão do Barclays de que os investimentos de capital em inferência chegariam a US$ 208,2 bilhões em 2026.
- Julho de 2025 — The Information informou que a Groq reduziu sua projeção de receita para 2025, de mais de US$ 2 bilhões para mais de US$ 500 milhões, citando atrasos na capacidade de data centers.
- Dezembro de 2025 — The Information informou um acordo de licenciamento entre Nvidia e Groq de cerca de US$ 20 bilhões.
- Março de 2026 — A Nvidia anunciou o rack Groq 3 LPX com 256 LPUs Groq 3, 128GB de SRAM on-chip e 40 PBps de largura de banda de SRAM.
- Agosto de 2026 — A Nvidia disse que o LPX havia entrado em produção plena e nomeou a Nebius como sua primeira cliente.
- Fim de 2027 — A Groq disse que pretendia ter 200MW de sua própria capacidade de data centers.
Se a Groq conseguir financiar e vender sua própria capacidade de atendimento, a licença deixa aos clientes duas rotas para sua arquitetura. Se apenas a Nvidia conseguir fornecer e dar suporte ao LPX em escala, os clientes encontrarão essa arquitetura principalmente por meio da Nvidia. É o pedido de compra, e não o rótulo da licença, que marca a fronteira.