En agosto de 2026, Nvidia nombró a Nebius como el primer cliente de un rack que contiene 256 chips de inferencia Groq. Nvidia había obtenido bajo licencia el diseño de Groq, aunque Groq siguió siendo independiente y planeaba construir su propia capacidad.
Puntos clave
- El rack Groq 3 LPX de Nvidia contiene 256 LPU Groq 3, 128GB de SRAM integrada en el chip y 40 PBps de ancho de banda de SRAM.
- Nvidia nombró a Nebius como el primer cliente de LPX en agosto de 2026.
- Groq recaudó $650 millones después del acuerdo con Nvidia y fijó una meta de 200MW de capacidad para finales de 2027.
- El acuerdo Nvidia–Groq reportado fue una licencia no exclusiva de aproximadamente $20 mil millones, no una adquisición anunciada.
- Nvidia reportó 3,400 tokens por segundo para LPX en Gemma 4 31B con una secuencia de entrada de 100,000 tokens.
Distintas tareas de servicio favorecen distinto silicio
En marzo de 2025, el Financial Times reportó la proyección de Barclays de que el gasto de capital en inferencia alcanzaría $208.2 mil millones en 2026 y superaría el gasto en entrenamiento en un plazo de dos años. Era un pronóstico, no un total medido de 2026. Ayuda a explicar por qué los fabricantes de chips comenzaron a diseñar para tareas de servicio particulares, en lugar de tratar cada solicitud de inferencia como una carga de trabajo de entrenamiento más pequeña.
El prefill procesa un prompt entrante; el decode produce la respuesta. SemiAnalysis describió el Rubin CPX de Nvidia como optimizado para prefill, al favorecer el rendimiento de cómputo sobre el ancho de banda de memoria. El enfoque de Groq, cargado de SRAM, hace una concesión distinta. El diseño del modelo también cambia el requisito de hardware: se reportó que Gemma 3 de Google y Command A de Cohere funcionan en uno o dos H100. Un comprador que elige hardware para servicio debe especificar el modelo, el prompt y el objetivo de latencia antes de que una afirmación sobre la velocidad de un chip resulte útil.
Nvidia obtuvo el diseño bajo licencia e incorporó a sus creadores
The Information reportó un acuerdo de licencia Nvidia–Groq de aproximadamente $20 mil millones en diciembre de 2025. Groq describió el acuerdo como no exclusivo y dijo que seguiría operando de forma independiente. El CEO Jonathan Ross y otros altos ejecutivos se unieron a Nvidia. Así, Nvidia obtuvo acceso tanto a una arquitectura de inferencia como a personas que sabían convertirla en un producto, sin anunciar una adquisición de Groq.
En marzo de 2026, Nvidia anunció el Groq 3 LPX: un rack que contiene 256 LPU Groq 3, 128GB de SRAM integrada en el chip y 40 PBps de ancho de banda de SRAM. Nvidia lo posicionó junto a su rack Vera Rubin NVL72, no como reemplazo de la plataforma GPU. La unidad que Nvidia presentó a los clientes era un sistema configurado con su propio nombre.
Los retrasos de Groq pusieron la entrega por delante de la velocidad
Groq ya había encontrado la diferencia entre un diseño rápido y capacidad que puede entregarse. En julio de 2025, The Information reportó que Groq había recortado su proyección de ingresos para ese año de más de $2 mil millones a más de $500 millones, debido a retrasos en la capacidad de centros de datos. Ninguna de las dos proyecciones era ingreso real, pero la revisión identificó una restricción que el rendimiento del chip por sí solo no podía eliminar.
En agosto de 2026, Nvidia dijo que LPX había entrado en producción plena y nombró a Nebius como su primer cliente. Nvidia también reportó 3,400 tokens por segundo en un benchmark de Artificial Analysis que usó Gemma 4 31B y una secuencia de entrada de 100,000 tokens. Nvidia reportó ese resultado para un modelo y prompt, sin establecer el costo por token, consumo de energía o utilización de LPX frente a una implementación con GPU. El registro público tampoco establece quién fija los precios de LPX, asigna racks o califica a los clientes.
Otros fabricantes eligen rutas distintas para el servicio
AMD adquirió Taalas, cuyo diseño integra los pesos del modelo directamente en el silicio; se reportaron demostraciones tempranas de hasta 17,000 tokens por segundo. OpenAI, en cambio, presentó una vista previa de un nivel de API Ultrafast impulsado por Cerebras, con hasta 750 tokens de salida por segundo para GPT-5.6 Sol. AMD adquirió un diseño, OpenAI empaquetó hardware especializado como servicio y Nvidia puso LPU licenciadas en un rack. Esas cifras de velocidad describen distintas cargas de trabajo y no pueden ordenar las tres ofertas según la economía de entrega.
La especialización también tiene un límite. Un análisis de cargas de trabajo totalmente agénticas sostuvo que las aplicaciones sin una persona esperando cada respuesta pueden dar menos valor a una latencia ultrabaja. Una comparación separada de tokens por dólar favoreció a Nvidia sobre el TPU v6e y el AMD MI300X en su métrica de inferencia elegida. Ninguno de los dos hallazgos descarta los chips especializados; ambos vuelven la carga de trabajo y el costo operativo del comprador más determinantes que la tasa de salida publicada más rápida.
“No exclusiva” deja abierta la frontera de ventas
Groq recaudó $650 millones después del acuerdo con Nvidia para expandir su propio negocio de centros de datos y dijo que apuntaba a 200MW de capacidad para finales de 2027. Esa capacidad planeada le da a Groq una ruta potencial hacia los clientes separada de LPX. Es evidencia en contra de tratar la licencia como una absorción comercial completa, aunque una ronda de financiamiento y una meta no establecen cuánta capacidad puede entregar Groq.
Según reportes, el Departamento de Justicia estaba examinando si Nvidia buscó eludir el escrutinio antimonopolio en la transacción con Groq. Una investigación no es una determinación. Sí vuelve relevantes los términos comerciales no divulgados: clientes y competidores no pueden inferir de la palabra “no exclusiva” quién controla el suministro, los precios o el acceso a la inferencia basada en Groq a través de cada empresa.
Preguntas frecuentes
¿Cuándo se esperaba que estuviera disponible el Nvidia Groq 3 LPX?
La cobertura de CRN de marzo de 2026 dijo que el LPX estaría disponible en la segunda mitad de 2026. Posteriormente, Nvidia dijo que había entrado en producción plena en agosto de 2026.
¿Qué mide la meta de 200MW de Groq?
Es una meta declarada de capacidad eléctrica de centros de datos, no un conteo de chips ni una cifra garantizada de rendimiento para clientes. Groq dijo que buscaba alcanzar esa capacidad para finales de 2027.
¿Nvidia compró Groq por completo?
No se anunció ninguna adquisición en el relato de la pieza. Groq describió el acuerdo como no exclusivo, dijo que seguiría siendo independiente y que GroqCloud continuaría operando.
¿Qué sigue sin conocerse sobre comprar u operar un sistema LPX?
El registro público no divulga los precios de LPX, la asignación de racks, la calificación de clientes, el costo por token, el consumo de energía ni la utilización frente a implementaciones con GPU. Esas omisiones impiden una comparación de economía de entrega basada únicamente en el benchmark de velocidad reportado.
Hitos clave en la ruta de comercialización de Groq–Nvidia
- Marzo de 2025 — El Financial Times reportó el pronóstico de Barclays de que el gasto de capital en inferencia alcanzaría $208.2 mil millones en 2026.
- Julio de 2025 — The Information reportó que Groq recortó su proyección de ingresos para 2025 de más de $2 mil millones a más de $500 millones, debido a retrasos en la capacidad de centros de datos.
- Diciembre de 2025 — The Information reportó un acuerdo de licencia Nvidia–Groq de aproximadamente $20 mil millones.
- Marzo de 2026 — Nvidia anunció el rack Groq 3 LPX con 256 LPU Groq 3, 128GB de SRAM integrada en el chip y 40 PBps de ancho de banda de SRAM.
- Agosto de 2026 — Nvidia dijo que LPX había entrado en producción plena y nombró a Nebius como su primer cliente.
- Finales de 2027 — Groq dijo que apuntaba a 200MW de capacidad propia de centros de datos.
Si Groq puede financiar y vender su propia capacidad de servicio, la licencia deja a los clientes dos rutas hacia su arquitectura. Si solo Nvidia puede suministrar y respaldar LPX a escala, los clientes encontrarán esa arquitectura principalmente a través de Nvidia. La orden de compra, más que la etiqueta de la licencia, marca la frontera.