En marzo de 2026, Nvidia anunció el Nvidia Groq 3 LPX, un rack con 256 LPU de Groq. Para agosto, el sistema había entrado en producción plena. Diez años antes, Nvidia había presentado la Tesla P100 en torno a más de 15 mil millones de transistores y 16GB de memoria de alto ancho de banda; ahora enviaba un posible sustituto de GPU dentro de un rack de Nvidia.
Puntos clave
- Nvidia y Groq confirmaron un acuerdo de licencia no exclusiva por $20 mil millones relacionado con la inferencia de IA.
- El rack Nvidia Groq 3 LPX contiene 256 LPU de Groq y las combina con 128GB de SRAM integrada.
- Nvidia reportó 3,400 tokens por segundo para Groq 3 LPX en un benchmark de Artificial Analysis que utilizó Gemma 4 31B y una secuencia de entrada de 100,000 tokens.
- Materiales para inversionistas revisados por The Wall Street Journal mostraron que tanto OpenAI como Anthropic reportaban costos de inferencia superiores a la mitad de sus ingresos.
- Nvidia reveló $3.5 mil millones en garantías para empresas que arriendan terrenos, energía e instalaciones de centros de datos: cuatro veces su nivel del tercer trimestre.
Nvidia está construyendo su próxima ventaja competitiva en torno a los términos comerciales y la infraestructura que rodean la computación de IA heterogénea: integración, entrega, financiamiento y utilización. Está licenciando arquitecturas especializadas, convirtiéndolas en sistemas con la marca Nvidia y respaldando partes del despliegue. A medida que la inferencia se convierte en el centro recurrente de costos, el control se desplaza hacia el proveedor que puede empaquetar la combinación adecuada de latencia, rendimiento, memoria y costo en capacidad que un cliente pueda comprar y mantener utilizada.
Nvidia compró valor opcional en lugar de exigir exclusividad
Nvidia y Groq firmaron un acuerdo confirmado de licencia no exclusiva por $20 mil millones relacionado con la inferencia de IA. El fundador de Groq, Jonathan Ross, quien ayudó a crear la TPU de Google, se incorporó a Nvidia, junto con varios altos ejecutivos de Groq. Nvidia obtuvo acceso a la arquitectura y a las personas que sabían cómo convertirla en un sistema.
Nvidia convirtió el acuerdo en un producto. El Groq 3 LPX combina sus LPU con 128GB de SRAM integrada y se ubica junto al Vera Rubin NVL72 basado en GPU. Nebius se convirtió en su primer cliente cuando comenzó la producción plena en agosto.
Groq conservó una independencia real. El acuerdo no exclusivo no otorga a Nvidia un derecho establecido para impedir que tecnología derivada de Groq atienda a otros compradores. El Departamento de Justicia también estaría examinando si el acuerdo eludió el escrutinio antimonopolio.
Nvidia evitó una apuesta binaria. Una adquisición completa habría concentrado el riesgo regulatorio y técnico; ignorar a Groq habría dejado a Nvidia expuesta si las LPU ganaban trabajos de servicio económicamente importantes. Al licenciar la tecnología, contratar a sus líderes e integrarla en un producto, Nvidia obtuvo una opción de envío sin asumir control exclusivo. Groq puede mantenerse fuera de Nvidia mientras su arquitectura está dentro de un rack de Nvidia, lo que vuelve la orden de compra más relevante que la frontera corporativa.
Distintos trabajos de inferencia premian distinto silicio
La propia hoja de ruta de Nvidia muestra por qué la inferencia se resiste a una sola respuesta arquitectónica. La empresa diseñó Rubin CPX para la fase de prefill de la inferencia y priorizó los FLOPS de cómputo sobre el ancho de banda de memoria. Groq 3 LPX sigue otra ruta, al combinar 128GB de SRAM con 40 petabytes por segundo de ancho de banda de SRAM.
Nvidia reportó 3,400 tokens por segundo para Groq 3 LPX en un benchmark de Artificial Analysis que ejecutaba Gemma 4 31B con una secuencia de entrada de 100,000 tokens. El resultado muestra cómo se desempeña una arquitectura acotada bajo un modelo, contexto y perfil de latencia definidos.
Nuance Labs muestra por qué las aplicaciones dividen el mercado. La empresa levantó una Serie A de $50 millones, con participación de Nvidia, para crear avatares conversacionales de baja latencia. En un avatar cara a cara, el retraso de respuesta moldea la experiencia del producto. Un agente de segundo plano puede intercambiar velocidad por menor costo o mayor rendimiento agregado porque ninguna persona espera cada respuesta.
Las GPU siguen siendo formidables en inferencia. En una comparación de hardware de Nvidia, Google y AMD, Nvidia logró aproximadamente cinco veces los tokens por dólar de la TPU v6e de Google y el doble que la MI300X de AMD. Nvidia también tenía una participación estimada de 95% de las GPU para aprendizaje automático en 2023, lo que le da una gran base instalada y una profunda familiaridad entre los desarrolladores.
Un especialista debe superar más que un benchmark de GPU. Debe vencer la madurez del software, los hábitos de despliegue y el costo de introducir otra arquitectura en producción. Nvidia trató a Groq como comercialmente útil para trabajos seleccionados mientras su arquitectura insignia seguía liderando los despliegues amplios.
Los márgenes de los modelos ahora eligen el stack de servicio
OpenAI y Anthropic han llevado la decisión de servicio directamente al estado de resultados. Materiales para inversionistas revisados por The Wall Street Journal mostraron que ambas empresas reportaban costos de inferencia superiores a la mitad de sus ingresos. Posteriormente, ingenieros de OpenAI habrían dicho a colegas que habían encontrado una forma de reducir a más de la mitad el costo de inferencia.
Para un proveedor de modelos que destina más de la mitad de sus ingresos a la inferencia, las mejoras en eficiencia del modelo, agrupamiento, uso de memoria, utilización o selección de hardware fluyen directamente al margen bruto. El proveedor debe comprar con base en el costo por resultado útil bajo requisitos reales de servicio, con el desempeño máximo como solo un insumo.
Con ese nivel de costo, el CFO y el ingeniero de infraestructura están eligiendo el mismo stack de servicio.
Barclays proyectó un gasto de capital en inferencia de $208.2 mil millones para 2026 y esperaba que el gasto en inferencia superara al de entrenamiento en dos años. Después, General Compute obtuvo un préstamo de $400 millones respaldado por chips específicos para inferencia, descrito como el primero de su tipo.
Al aceptar chips específicos para inferencia como garantía, Upper90 tuvo que evaluar la utilización, la demanda de reventa, la obsolescencia técnica y los contratos vinculados a las máquinas. Financiar infraestructura de inferencia de IA convierte la adecuación arquitectónica en una cuestión de suscripción. Un chip que funciona bien pero no puede mantenerse ocupado es una garantía débil.
Los especialistas atraen dinero antes de que se definan los estándares
Los creadores del motor de inferencia de código abierto vLLM fundaron Inferact para comercializar esa capa y levantaron una ronda semilla de $150 millones. Al construir una empresa en torno al software de servicio, separaron la optimización de inferencia del desarrollo de modelos.
Euclyd, con sede en Países Bajos, levantó más de €200 millones en una Serie A para chips de inferencia. Cerebras reportó ingresos del segundo trimestre de $180 millones, un alza de 74% interanual, y elevó sus proyecciones anuales de ingresos y margen bruto. DeepSeek estaría desarrollando un chip de inferencia para reducir su dependencia del hardware de Nvidia y Huawei.
Los fundadores de vLLM, los inversionistas de Euclyd, los clientes de Cerebras y los ingenieros de DeepSeek enfrentaban cada uno su propia versión del costo recurrente de servicio. Cada uno aisló una capa donde hardware o software especializado podría capturar los ahorros.
Se reportó que Gemma 3 de Google y Command A de Cohere funcionan con una o dos H100, lo que reduce el hardware requerido para un despliegue individual. Los modelos más eficientes pueden reducir la demanda por tarea aun cuando crece el uso. A medida que cada despliegue requiere menos aceleradores, los proveedores tienen menos margen para ocultar una arquitectura que se ajusta mal a la carga de trabajo.
Nvidia incorpora el riesgo de utilización en el precio del rack
Nvidia también está usando su balance para reducir el riesgo de despliegue. La empresa reveló $3.5 mil millones en garantías a empresas que arriendan terrenos, energía e instalaciones de centros de datos, cuatro veces su nivel del tercer trimestre. Esas garantías pueden ayudar a empresas de infraestructura sin calificaciones crediticias sólidas a asegurar los insumos necesarios para instalar capacidad.
CoreWeave fue pionera en el uso de deuda respaldada por GPU y vehículos de propósito especial. Nvidia habría ofrecido rentar GPU no utilizadas de proveedores jóvenes de nube a cambio de una parte de sus ingresos. La empresa también buscó conectar a poseedores de GPU con operadores de centros de datos nórdicos que tenían capacidad disponible para despliegue.
Los operadores de nube asumen la exposición de construcción y operación. Los prestamistas fijan el precio de la garantía y los clientes se comprometen con capacidad. Nvidia utiliza garantías, respaldos de renta y conexiones entre partes para reducir la probabilidad de que el hardware comprado permanezca inactivo. Al otorgar $3.5 mil millones en garantías, Nvidia ha puesto parte de su propio crédito detrás de la expansión.
Preguntas frecuentes
¿El resultado reportado de 3,400 tokens por segundo puede compararse directamente con afirmaciones de desempeño de GPU?
No con la información proporcionada. La cifra de Groq está vinculada a Gemma 4 31B y a una secuencia de entrada de 100,000 tokens; una comparación equivalente también requeriría el mismo modelo, longitud de contexto, objetivo de latencia, configuración de agrupamiento y base de costos en hardware competidor.
¿Cuánta capacidad de Groq 3 LPX se ha comprometido a comprar Nebius?
El texto identifica a Nebius como el primer cliente cuando comenzó la producción plena, pero no revela el tamaño de la orden, el valor del contrato, el calendario de despliegue ni el compromiso de utilización.
¿Qué empresas reciben los $3.5 mil millones en garantías de Nvidia y bajo qué condiciones?
El texto dice que las garantías respaldan a empresas que arriendan terrenos, energía e instalaciones de centros de datos, pero no nombra a todos los beneficiarios ni revela plazos, comisiones, requisitos de garantía o condiciones de incumplimiento.
¿Qué parte de los $208.2 mil millones proyectados por Barclays para capex de inferencia en 2026 irá a sistemas basados en Nvidia o Groq?
La proyección corresponde al gasto de capital agregado en inferencia. El texto no proporciona una asignación por proveedor, por lo que no puede establecer la participación de Nvidia ni de Groq LPX en ese gasto.
Camino a producción de Groq 3 LPX
- Marzo de 2026 — Nvidia anunció el Groq 3 LPX, un rack que contiene 256 LPU de Groq.
- Agosto de 2026 — El Groq 3 LPX entró en producción plena, con Nebius como su primer cliente.
Un comprador de nube ahora compara capacidad de GPU y LPU junto con calendarios de entrega, condiciones de financiamiento, trabajo de integración y apoyo para la utilización. Nvidia puede seguir siendo la contraparte cuando un chip especializado se ajusta mejor al trabajo. Las 256 LPU de Groq dentro de su rack muestran el acuerdo: Groq puede ganar la carga de trabajo mientras Nvidia conserva la orden de compra.