El 11 de agosto de 2026, Nvidia lanzó Nemotron 3.5 Lightning, un modelo abierto de IA que, según afirma, puede generar resultados hasta cuatro veces más rápido, y NeMo Switchyard, software que elige qué modelo atiende cada solicitud. Al mismo tiempo, reportes vincularon a Nvidia, Apollo, BlackRock y otros con un paquete de infraestructura de $500 mil millones. El proveedor de chips buscaba abarcar tanto el enrutamiento de solicitudes como el financiamiento que determina qué capacidad se construye.
Puntos clave
- Nvidia lanzó Nemotron 3.5 Lightning y NeMo Switchyard el 11 de agosto de 2026.
- Nemotron 3.5 Lightning es un modelo de mezcla de expertos de 30 mil millones de parámetros.
- IBM y Together AI firmaron un acuerdo confirmado de $240 millones a varios años para un clúster de inferencia de IBM Cloud que usa sistemas Nvidia HGX B300.
- El paquete de infraestructura de IA reportado por $500 mil millones que involucraba a Nvidia, Apollo, BlackRock y otros seguía en discusión, sin compromisos ni despliegue anunciados.
- Las empresas de infraestructura de IA pidieron prestados más de $100 mil millones en 2025.
CUDA le da a Nvidia el punto de anclaje técnico para esa expansión. Los modelos abiertos, el software de enrutamiento, los clústeres de referencia y las alianzas de capital responden al mismo cambio: la inferencia sensible a costos, heterogénea, vuelve más valioso elegir entre recursos que añadir ejecución indiferenciada.
El lanzamiento combinó un modelo de mezcla de expertos de 30 mil millones de parámetros con un enrutador agéntico. Nemotron le da a Switchyard un destino que Nvidia controla; el enrutador puede enviar trabajo a otro lugar cuando la latencia, la calidad o el costo lo exijan.
En el período de comparación de 2024, 15.2% de los artículos sobre Nvidia usaban un enfoque empresarial; en 2026, 23.5% lo hacía. El enfoque de consumo cayó de 18.3% a 10.9%. La cobertura siguió a Nvidia hacia capas más altas, de dispositivos y chips hacia el despliegue y la asignación de capital.
CUDA convirtió la compatibilidad en ventaja acumulada
Nvidia pasó años atrayendo cargas de trabajo hacia su hardware mediante software. En 2018, la empresa añadió soporte para GPU a Kubernetes y aportó sus mejoras a la comunidad de orquestación de código abierto. Nvidia también lanzó Rapids con IBM, HPE y otros socios, vinculando la aceleración por GPU con flujos de trabajo de ciencia de datos y aprendizaje automático. En 2019, Nvidia dijo que llevaría la aceleración CUDA a las CPU Arm y compartiría con Arm su software de IA y computación de alto rendimiento.
Esas integraciones ampliaron el rango de cargas de trabajo que los desarrolladores podían llevar a sistemas Nvidia. Las organizaciones acumularon entonces código, herramientas y prácticas operativas alrededor de CUDA, haciendo más barato quedarse que reescribir.
Los laboratorios chinos de IA muestran cómo luce esa acumulación tras años de uso. Fuentes dicen que esos laboratorios aún entrenan modelos de lenguaje líderes en chips Nvidia porque migrar de CUDA a CANN de Huawei requiere cambios importantes de código. La compra de hardware creó la relación inicial; el software la preservó en decisiones de compra posteriores.
Esos laboratorios siguen vinculados a CUDA, pero los costos de migración no le dan a Nvidia autoridad sobre sus modelos, políticas de enrutamiento o umbrales de calidad de servicio. Nvidia entra a la siguiente competencia con una ventaja poderosa, no con una victoria garantizada.
La decisión costosa ahora ocurre antes de la ejecución
Documentos mostrados a inversionistas indican, según reportes, que OpenAI y Anthropic gastan más de la mitad de sus ingresos en inferencia. A esa escala, cada solicitud obliga a decidir cuánta calidad, latencia y cómputo puede permitirse el servicio.
Nemotron le da a Switchyard un candidato dentro de esa decisión. Un operador puede dirigir distintas tareas hacia diferentes modelos, en lugar de asignar cada solicitud al mismo sistema y perfil de costos. La ganancia de rendimiento de cuatro veces que Nvidia afirma fortalecería esa propuesta, aunque pruebas independientes no han establecido la cifra.
Los operadores deben equilibrar portabilidad, latencia, costo, resiliencia y gobernanza, mientras el enrutador añade otro servicio cuyas políticas pueden fallar. Un error de enrutamiento puede borrar los ahorros; una política opaca puede complicar las compras y la rendición de cuentas. El rendimiento bruto captura solo una parte del costo para el comprador.
Otros desarrolladores se han dirigido hacia el mismo punto de presión. Inferact, fundada por los creadores del motor de inferencia vLLM, recaudó una ronda semilla de $150 millones con una valuación de $800 millones para comercializar el servicio de inferencia. Mientras tanto, ingenieros de OpenAI, según reportes, encontraron un método interno que podría reducir a más de la mitad el costo de inferencia, lo que permitiría a OpenAI capturar esa ganancia sin adoptar el enrutador de Nvidia.
Nvidia, OpenAI e Inferact convergieron en los costos de servicio desde direcciones distintas. Sus enfoques establecen el valor de la optimización, mientras dejan sin resolver quién es dueño de ese valor.
Los modelos abiertos hacen más valiosos los sistemas de referencia
Los operadores pueden estandarizar la infraestructura incluso mientras cambian modelos. IBM y Together AI firmaron un acuerdo confirmado de $240 millones a varios años para construir un clúster de inferencia en IBM Cloud con sistemas Nvidia HGX B300 para modelos de código abierto. Together AI puede respaldar un catálogo cambiante de modelos mientras IBM estandariza el entorno que está debajo.
Nvidia ha cultivado esta vía de implementación durante años. Su HGX-2 de 2018 combinaba 16 GPU en una plataforma para IA y computación de alto rendimiento. La Tesla T4 apuntaba a la inferencia en centros de datos, y Nvidia afirmaba un rendimiento de hasta doce veces el de la Tesla P4 anterior con el mismo consumo energético. Los sistemas HGX B300 extienden esa lógica de plataforma a un mercado donde los operadores se preocupan cada vez más por el sistema completo de servicio.
Los operadores de nube pueden reemplazar o añadir modelos abiertos sin reconstruir cada vez la arquitectura del clúster. Nvidia puede prosperar incluso si ningún proveedor de modelos domina, siempre que muchos proveedores converjan en sus sistemas de referencia, bibliotecas de software y prácticas operativas.
El acuerdo IBM–Together AI ofrece a los operadores una ruta concreta de adquisición. Pueden comprar un servicio multianual para inferencia abierta sin ensamblar de forma independiente cada componente de hardware y software. Los modelos abiertos permiten a los compradores cambiar entradas del catálogo, mientras una implementación estandarizada preserva por debajo el entorno Nvidia.
El financiamiento decide qué capacidad existe
Nvidia, Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs, KKR y otros trabajaban, según reportes, en un paquete de financiamiento de $500 mil millones, llevando la asignación más arriba en la cadena mediante el financiamiento de infraestructura de IA. El paquete seguía en discusión, antes de compromisos o despliegue. Sus participantes apuntaban a la restricción de financiamiento para nueva capacidad.
Otras transacciones revelan el mecanismo a menor escala. Lambda comercializaba, según reportes, un préstamo apalancado de $917 millones para financiar GPU bajo un contrato con Nvidia. Nvidia acordó, según reportes, invertir $2 mil millones en el desarrollador de infraestructura eléctrica Lancium, con otros $1 mil millones vinculados a umbrales de desempeño en un campus Stargate. El pedido de chips, el sitio de energía, el contrato con el cliente y el préstamo llegan cada vez más como un solo objeto financiero.
Las empresas de infraestructura de IA pidieron prestados más de $100 mil millones en 2025, mientras los inversionistas de deuda cobraban tasas de interés más altas a las empresas pequeñas porque cuestionaban negocios de IA no probados. Los prestamistas pueden acelerar la construcción, pero sus costos financieros deben ser respaldados por ingresos de inferencia. Un clúster financiado con intereses aún tiene que sostener un modelo de negocio.
Los prestamistas y propietarios de activos asignan capacidad al decidir qué contratos son financiables, qué proyectos de energía reciben capital y qué configuraciones de hardware respaldan las garantías. Si prefieren despliegues respaldados por Nvidia porque clientes, software y mercados de reventa ya los reconocen, el financiamiento puede reforzar la base instalada sin coordinación formal entre compradores.
Nvidia se beneficia cuando los inversionistas institucionales financian sistemas que consumen sus productos, mientras prestamistas y propietarios de activos asumen más exposición si los ingresos de IA no cubren la expansión. Esos inversionistas crean demanda solo mientras acepten los supuestos de utilización que la sustentan; la evaluación crediticia, más que la cifra del titular, decide cuánta capacidad se construye.
El poder de enrutamiento debe ganarse en cada solicitud
Los fabricantes rivales de chips pueden atacar el mismo problema de asignación desde un límite distinto. AMD, el principal rival de Nvidia en procesadores de IA, adquirió Taalas, una startup que integra los pesos de los modelos directamente en silicio con la promesa de mejorar el rendimiento de inferencia. Taalas reduce la distancia entre el modelo y el hardware, en vez de insertar sobre ellos una capa de enrutamiento más amplia.
Los clientes también pueden mantener la optimización dentro de sus propios sistemas, como demuestra la reducción de costos reportada de OpenAI. Los proveedores de nube, hosts de modelos y empresas evaluarán un enrutador según el costo operativo total, la latencia, la confiabilidad, la portabilidad y el control de políticas. Pueden mantener las cargas de trabajo en sistemas internos donde Switchyard pierda esa comparación.
El dinero prestado endurece la prueba porque los faltantes de utilización dejan a la capacidad financiada cargando intereses. Una capa de enrutamiento que mejore el uso del hardware puede sostener la economía. Si principalmente preserva la dependencia del hardware, se convierte en otro centro de costos dentro de un sistema ya apalancado.
Preguntas frecuentes
¿Qué evidencia respaldaría la afirmación de Nvidia de una generación de resultados hasta 4× más rápida con Nemotron 3.5 Lightning?
El artículo dice que pruebas independientes no han establecido la mejora afirmada. No proporciona metodología de referencia, cargas de trabajo, modelos base ni un calendario para evaluación de terceros.
¿A qué modelos o plataformas de hardware que no son de Nvidia puede NeMo Switchyard enrutar trabajo?
El artículo dice que Switchyard puede enviar trabajo a otro lugar cuando la latencia, la calidad o el costo lo requieran, pero no identifica modelos externos, nubes o plataformas de hardware compatibles.
¿Qué empresas han comprometido realmente capital al paquete de infraestructura reportado de $500 mil millones?
No se identifican compromisos. El reporte describe a Nvidia, Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs, KKR y otros como participantes en un paquete que seguía en discusión.
¿Qué umbrales de desempeño liberarían los $1 mil millones adicionales de la inversión reportada de Nvidia en Lancium?
El artículo señala que $1 mil millones estaban vinculados a umbrales de desempeño en un campus Stargate, pero no revela los umbrales, criterios de medición ni el calendario de pagos.
Montos reportados de financiamiento de infraestructura de IA
| Acuerdo | Monto | Estado o condición |
|---|---|---|
| Paquete de infraestructura que involucra a Nvidia, Apollo, BlackRock y otros | $500 mil millones | Según reportes, en discusión; sin compromisos ni despliegue anunciados |
| Préstamo apalancado de Lambda para GPU bajo un contrato con Nvidia | $917 millones | Según reportes, en comercialización |
| Inversión de Nvidia en el desarrollador de infraestructura eléctrica Lancium | $2 mil millones | Según reportes, acordada |
| Inversión adicional de Nvidia en Lancium | $1 mil millones | Vinculada a umbrales de desempeño en un campus Stargate |
| Préstamos de empresas de infraestructura de IA en 2025 | Más de $100 mil millones | Préstamos agregados reportados |
Nvidia conserva el puesto de despacho solo mientras los clientes puedan verificar que Switchyard reduce el costo del trabajo útil y les deja el control sobre modelos y políticas. CUDA hizo que fuera costoso dejar a Nvidia en tiempo de compilación; cada solicitud le da al cliente otra oportunidad de dejarla en tiempo de ejecución. Los $500 mil millones pueden financiar los destinos, pero no pueden decidir adónde va la siguiente solicitud.