Groq recortó su proyección de ingresos para 2025 de más de $2 billion a más de $500 million, al citar retrasos en la capacidad de los centros de datos. La empresa tenía un acelerador de inferencia rápido y clientes a quienes atender, pero no suficiente infraestructura desplegada para convertirlos en ingresos. Nvidia posteriormente celebró un acuerdo de licencia reportado de $20 billion e incorporó 256 LPU Groq 3 en un rack de producción. La ventaja de chip de Groq ahora dependía del financiamiento y el despliegue.

Aspectos clave

  • Barclays proyectó $208.2 billion de gasto de capital en inferencia para 2026.
  • Groq fijó una meta de capacidad de 200 megawatts para finales de 2027.
  • General Compute obtuvo un préstamo de $400 million respaldado por chips específicos para inferencia.
  • Google fijó el precio de Gemini 3.7 Flash en $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta 2026.
  • El nivel Ultrafast API de OpenAI impulsado por Cerebras afirmó alcanzar hasta 750 tokens de salida por segundo para GPT-5.6 Sol.

Los reporteros describieron por primera vez a Groq en 2017 como una startup en modo sigiloso fundada por ingenieros de Google Tensor Processing Unit que había recaudado $10.3 million. Entre esa ronda y el rack de Nvidia, la inferencia se dividió en tareas técnicas, compromisos de capacidad y rutas hacia los clientes.

Distintos trabajos de inferencia premian distinto silicio

Un servidor de modelos maneja varias tareas diferenciadas. El prefill, decode, procesamiento de contexto largo e interacción sensible a la latencia imponen restricciones distintas, por lo que los desarrolladores han empezado a asignar arquitecturas por fase en lugar de pedirle a un acelerador que gane cada benchmark.

El Rubin CPX de Nvidia ilustra esa descomposición. Nvidia diseñó el chip específicamente para prefill y priorizó los FLOPS de cómputo sobre el ancho de banda de memoria. Groq ataca otra parte de la carga de trabajo con grandes cantidades de SRAM en chip y un modelo de ejecución orientado a una generación rápida y predecible. OpenAI y Broadcom hicieron el mismo movimiento estructural desde el lado del comprador: desarrollaron el chip de inferencia Jalapeño optimizado para LLM, desde el diseño hasta el tape-out de fabricación, en nueve meses.

Al trabajar de forma independiente, operadores de modelos y diseñadores de chips encontraron distintos cuellos de botella dentro de la misma solicitud de inferencia, y luego optimizaron la fase donde el hardware de propósito general imponía la mayor penalización.

Nvidia posteriormente empaquetó la arquitectura de Groq como el rack Groq 3 LPX, que contiene 256 LPU Groq 3, 128 GB de SRAM en chip y 40 petabytes por segundo de ancho de banda de SRAM. Nvidia más tarde reportó 3,400 tokens por segundo en un benchmark de Artificial Analysis que ejecutaba Gemma 4 31B con una secuencia de entrada de 100,000 tokens.

Ese benchmark reportado respalda una ventaja para la carga de trabajo, pero deja sin responder la utilización del rack, precios al cliente, costos de energía, migración de software y cobertura de modelos. Los benchmarks muestran qué tan rápido se mueve el motor; la economía de infraestructura mide si un operador puede mantener llenos los asientos.

Los incumbentes pueden responder a la fragmentación de cargas de trabajo colocando un especialista junto a CPUs, GPUs, redes y software, y después enrutar cada fase al dispositivo apropiado. El especialista conserva su ventaja técnica dentro del sistema comercial del incumbente.

La capacidad convierte a las empresas de chips en operadores de infraestructura

El recorte de previsión de Groq expuso la brecha entre la oferta de aceleradores y la capacidad de serving. Sin racks desplegados, Groq no podía convertir la demanda de clientes en ingresos.

Groq posteriormente recaudó $650 million para expandir capacidad. Su meta de energía para finales de 2027 se ubicaba dentro de un cambio de gasto mucho mayor: Barclays proyectó que el gasto de capital en inferencia superaría al gasto en entrenamiento en dos años. Los inversionistas financiaban el procesador junto con los sitios, la energía y los sistemas necesarios para servir tokens.

Proyección de Barclays para el capex de inferencia en 2026
Meta de capacidad de Groq para finales de 2027

General Compute recibió un préstamo de $400 million respaldado por chips específicos para inferencia, un caso temprano de hardware especializado utilizado como garantía. Un mercado profundo de reventa para esos chips sigue sin comprobarse, pero los prestamistas han empezado a suscribir capacidad de inferencia como infraestructura, en lugar de inventario de venture con un cable de energía.

Los proveedores crean rezago de capacidad cuando comprometen dinero antes de que los sitios entren en operación, y luego esperan a que la calificación del cliente y la utilización revelen si dimensionaron correctamente el despliegue. Pagan por errores en cualquiera de las dos direcciones: los racks ociosos dañan los rendimientos, mientras que la capacidad faltante deja demanda varada y pospone los ingresos.

Los laboratorios de frontera complican la suscripción porque los grandes compradores obtienen cada vez más capacidad de proveedores que también aportan financiamiento. En el más amplio ciclo de financiamiento de los laboratorios de frontera, los fabricantes de chips y operadores de nube se convierten en socios de capital, al comprometerse a despliegues antes de que los clientes hayan generado los ingresos necesarios para absorber el hardware.

Nvidia absorbió la diferenciación sin comprar la empresa

Nvidia usó licencias, contratación y conversión en producto en lugar de una adquisición convencional. Bajo el acuerdo no exclusivo, Nvidia obtuvo derechos sobre la tecnología de inferencia de Groq, mientras el CEO Jonathan Ross y otros ejecutivos senior se unieron a Nvidia. Fuentes dijeron después que aproximadamente 90% de los empleados de Groq pasarían a Nvidia y que la mayoría de los accionistas recibiría pagos vinculados a la valuación de $20 billion.

Groq dijo que seguiría operando de manera independiente y posteriormente recaudó capital para su expansión planeada de nube. Nvidia obtuvo la arquitectura y gran parte de la organización capaz de desarrollarla. Los términos no exclusivos preservaron una entidad corporativa independiente, mientras que la integración de talento y producto permitió a Nvidia capturar la tecnología dentro de su propio portafolio de sistemas.

Nvidia luego convirtió la licencia en capacidad que los clientes podían comprar. La empresa llevó Groq 3 LPX a producción completa, y Nebius se convirtió en el primer cliente anunciado. El rack colocó la LPU dentro de la maquinaria más amplia de productos para centros de datos de Nvidia.

Nvidia y Groq no revelaron quién controlaría la calificación de clientes de LPX, la asignación, los precios o el acceso a la nube. Quien controle esa ruta hacia el despliegue puede capturar valor incluso cuando la arquitectura subyacente siga disponible en otros lugares.

Según reportes, el Department of Justice examina si Nvidia utilizó la estructura de licenciamiento para evitar el escrutinio antimonopolio. La investigación no establece conducta indebida, pero eleva el costo de transacción de utilizar licencias más contratación masiva como sustituto de una adquisición. Los reguladores pueden restringir cómo un incumbente internaliza a un retador incluso cuando no pueden borrar la lógica técnica de la integración.

Groq por sí solo no puede establecer que todo especialista será absorbido. Las conversaciones reportadas de Qualcomm para adquirir Tenstorrent por $8 billion a $10 billion muestran interés estratégico, no un patrón consumado. La ronda de capital de Groq posterior al acuerdo también preserva un experimento genuino de capacidad independiente. Especialistas e incumbentes prueban ambas estructuras a la vez: infraestructura operada por especialistas y tecnología especializada dentro de la distribución de los incumbentes.

La caída de los precios por token acorta el reloj de amortización

La capacidad dedicada de inferencia debe recuperar su costo mientras el precio del serving sigue moviéndose. OpenAI y Anthropic proyectaron que los costos de inferencia excedían la mitad de los ingresos, lo que da a ambas empresas un fuerte incentivo para reducir la cuenta mediante modelos, software, silicio y compras.

Según reportes, ingenieros de OpenAI encontraron un método que podría reducir a menos de la mitad los costos de inferencia. Google fijó el precio de Gemini 3.7 Flash en $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta 2026. El precio de Google no revela su costo subyacente, pero establece una referencia de mercado a la que los proveedores competidores deben responder.

Las mejoras de modelos y software pueden avanzar más rápido que la construcción de centros de datos. Un rack financiado con base en la economía actual de los tokens puede entrar en servicio después de que un proveedor reduzca el cómputo requerido por solicitud o recorte su precio para ganar volumen. El hardware dedicado puede seguir siendo técnicamente excelente mientras su dueño obtiene un mal rendimiento si la utilización no logra compensar esa caída.

Las cargas de trabajo agénticas complican aún más el caso de baja latencia. Las aplicaciones dirigidas a personas premian la salida inmediata porque una persona espera cada respuesta. Para cargas de trabajo autónomas, sin una persona esperando en cada paso intermedio, el throughput, la confiabilidad o el costo por tarea útil pueden importar más que el máximo de tokens por segundo.

Las aplicaciones interactivas pueden justificar una prima por la latencia al estilo Groq, mientras que la ejecución de agentes similar al procesamiento por lotes premia otra arquitectura o un nivel de serving más barato. Por tanto, quienes suscriben capacidad necesitan una mezcla de cargas de trabajo, no solo un benchmark, porque cada carga de trabajo asigna un precio distinto a la velocidad.

Los compradores mantienen vivos a los especialistas al rechazar una sola pila

Los desarrolladores de modelos todavía tienen motivos para mantener alternativas creíbles. Según reportes, OpenAI buscó chips de inferencia de AMD, Cerebras y Groq después de quedar insatisfecha con algunos productos de Nvidia. Luego la empresa introdujo un nivel Ultrafast API impulsado por Cerebras, al afirmar hasta 750 tokens de salida por segundo y un aumento de velocidad de hasta 14 veces para GPT-5.6 Sol. Al lanzar un nivel de API activo, OpenAI creó demanda independiente para infraestructura especializada.

Otros compradores y proveedores están desarrollando opciones adicionales. AMD adquirió Taalas, que integra los pesos del modelo directamente en silicio y produjo demostraciones tempranas de hasta 17,000 tokens por segundo. Según reportes, ByteDance e InnoStar comenzaron a desarrollar un chip de inferencia de bajo costo inspirado en las LPU de Groq.

Los compradores obtienen tres formas de valor de estas alternativas incluso cuando no desplazan al líder de mercado: desempeño específico para la carga de trabajo, resiliencia frente a suministro restringido y poder de negociación sobre el incumbente. Solo pueden preservar ese poder si logran mover modelos y cargas de trabajo sin costos prohibitivos de software u operación. Un chip técnicamente superior sin una ruta práctica de migración es una anécdota de negociación.

Los incumbentes pueden distribuir los costos de integración de racks, soporte de software y distribución entre una base instalada mayor. Los especialistas conservan espacio donde su arquitectura crea una ventaja de carga de trabajo suficientemente grande para superar ese descuento de integración. Ganan más espacio cuando los proveedores de capital financian capacidad independiente y los grandes compradores comprometen suficiente demanda para llenarla.

Preguntas frecuentes

¿Cuándo se anunció Nvidia Groq 3 LPX y cuándo se esperaba que estuviera disponible?

Nvidia anunció el rack Groq 3 LPX de 256 LPU el March 16–17, 2026. El anuncio indicó que estaría disponible en la segunda mitad de 2026.

¿Se pueden comparar directamente los 3,400 tokens por segundo reportados por Nvidia con la afirmación de 750 tokens por segundo de Cerebras de OpenAI?

No de manera confiable. La cifra de Nvidia fue reportada para Gemma 4 31B con una secuencia de entrada de 100,000 tokens, mientras que la afirmación de OpenAI se refería a GPT-5.6 Sol; el modelo, la longitud del prompt y las condiciones de serving difieren.

¿Cuánto financiamiento había recaudado Groq antes de su posterior ronda de expansión de capacidad?

Fuentes citadas en la evidencia dijeron que Groq había recaudado aproximadamente $1.8 billion hasta la fecha. La cifra se reporta, en lugar de detallarse de manera independiente en el texto.

¿Cuál es la transacción comparable de chips especializados que hay que seguir más allá de Groq?

Según reportes, Qualcomm estaba en conversaciones para adquirir Tenstorrent por $8 billion a $10 billion. Las discusiones fueron conversaciones reportadas, no una adquisición consumada.

De startup de Groq a metas de capacidad de racks

  • 2017 — Groq fue descrita como una startup en modo sigiloso fundada por ingenieros de Google TPU que había recaudado $10.3 million.
  • 2025 — Groq recortó su proyección de ingresos para 2025 de más de $2 billion a más de $500 million, al citar retrasos de capacidad en centros de datos.
  • March 16–17, 2026 — Nvidia anunció el rack de inferencia Groq 3 LPX con 256 LPU Groq 3, 128 GB de SRAM en chip y 40 PBps de ancho de banda de SRAM.
  • H2 2026 — La ventana de disponibilidad anunciada para Nvidia Groq 3 LPX.
  • End of 2027 — La meta de capacidad declarada de Groq es 200 MW.

El recorte de previsión de Groq para 2025 comenzó con racks que llegaron tarde. El rack de 256 LPU de Nvidia cierra ese ciclo: la LPU sobrevive, pero el nombre en el rack identifica quién controla el despliegue y quién debe convertir su ganancia de ingeniería en tokens más baratos.