Anthropic se comprometió a comprar hasta 2GW de capacidad AMD MI450 a partir de 2027. Los materiales para inversionistas indican que los costos de inferencia superan la mitad de los ingresos tanto en Anthropic como en OpenAI. Cuanto más crece su negocio de API, más dinero fluye hacia la maquinaria que lo sostiene.
Puntos clave
- La inferencia es el principal foco de presión económica: según los reportes, sus costos superan la mitad de los ingresos en Anthropic y OpenAI, por lo que cualquier reducción en los precios de la API debe acompañarse de mejoras de eficiencia, menores márgenes o ambas cosas.
- El compromiso de Anthropic de comprar hasta 2GW de capacidad AMD MI450 a partir de 2027 es una apuesta a que la escala, el poder de negociación con proveedores y el diseño conjunto de sistemas reduzcan su costo marginal por token.
- La solicitud a SK Hynix muestra que no basta con tener acceso a aceleradores; la memoria de alto ancho de banda, el encapsulado, las redes y el software de operación determinan en conjunto la capacidad realmente utilizable.
- Las mejoras de hardware solo se convierten en margen para la API cuando los modelos, el uso de caché, el procesamiento por lotes, la distribución de solicitudes, la programación de recursos y la recuperación ante fallas generan más trabajo terminado y confiable por cada dólar invertido.
- Descender hacia las capas de infraestructura crea un nuevo riesgo: las inversiones en capacidad de largo plazo y chips a medida pueden destruir rendimientos si la demanda, la arquitectura de los modelos o los tiempos de despliegue no cumplen las expectativas.
Cada cliente de la API genera ingresos, pero también un flujo continuo de gastos de inferencia. Si esos gastos crecen demasiado rápido, un modelo superior puede traducirse en peores resultados económicos. Anthropic necesita mejorar tanto el servicio que ofrece como la maquinaria que lo hace posible.
Al abaratarse las capacidades, la infraestructura de operación se convierte en el nuevo frente competitivo
Claude Opus 5 ilustra este mecanismo. Anthropic afirma que el modelo se acerca al desempeño de Fable 5 por la mitad del precio y lo convirtió en la opción predeterminada de Claude Max. Un modelo cercano a la vanguardia puede cobrar menos que uno de punta sin sacrificar gran parte de las capacidades que valoran los clientes.
Anthropic cobra por Opus 5 $5 por millón de tokens de entrada y $25 por millón de tokens de salida, igual que Opus 4.8, aunque asegura que el nuevo modelo usa menos tokens para realizar tareas comparables. Un menor consumo de tokens, el uso de caché para instrucciones y un mejor manejo de herramientas reducen la infraestructura necesaria para completar una tarea.
La inferencia crece en función del uso, en lugar de mantenerse como un gasto fijo de investigación. Los materiales para inversionistas señalaron que los costos de inferencia superaban la mitad de los ingresos tanto en Anthropic como en OpenAI. Cuando un costo variable rebasa la mitad de los ingresos, una reducción de precios exige una mejora equivalente de eficiencia, un menor margen o ambas cosas.
Modelos abiertos como Gemma 3 de Google y Command A de Cohere han intensificado esta presión al devolver la atención al costo marginal y al costo de los servicios vendidos. Una alternativa suficientemente capaz puede obligar a un servicio de precio elevado a justificarlo mediante confiabilidad, integración, gobernanza o una mejor economía total por tarea.
Al principio, los compradores aprovechan las predicciones más baratas para obtener la misma respuesta por menos dinero. Después rediseñan sus aplicaciones en torno al menor precio: amplían el contexto, consultan los modelos con mayor frecuencia y les delegan procesos más largos. La reducción del precio por token amplía el mercado de la infraestructura eficiente porque vuelve viables más aplicaciones.
La caída de los precios unitarios puede expandir la demanda y, al mismo tiempo, dejar al descubierto márgenes débiles en la operación. Un proveedor que transfiere cada mejora a sus clientes se convierte en un canal de alto crecimiento para los ingresos de los fabricantes de hardware; uno que mantiene sus precios pierde cargas de trabajo frente a alternativas más baratas. Los compradores empresariales responden enviando las tareas rutinarias a modelos de menor costo, reservando los servicios de mayor precio para fallas y trabajos críticos, y negociando con base en el costo por tarea terminada, no en el precio de lista.
Anthropic está abriendo alternativas para controlar su estructura de costos
La solicitud de Anthropic para que SK Hynix suministre memoria destinada al desarrollo de sus propios chips forma parte de un sistema de abastecimiento más amplio. Se suma al compromiso de comprar hasta 2GW de capacidad AMD MI450 a partir del primer semestre de 2027, mientras AMD se comprometió por separado a invertir hasta $5 billion en Anthropic.
Ambas decisiones cubren riesgos distintos. Anthropic puede explorar el desarrollo de chips a medida mientras asegura capacidad futura, diversifica proveedores y gana poder de negociación. El acuerdo con AMD mantiene a la empresa en una dependencia considerable de aceleradores externos, pero a una escala suficiente para influir en las condiciones comerciales.
Anthropic también está ampliando sus vías de acceso a instalaciones. Fluidstack recaudó $830 million con una valuación de $7.5 billion después de asociarse con el laboratorio para ayudar a construir centros de datos de IA. La inversión total de Amazon en Anthropic llegó a $8 billion en 2024. El capital de los grandes proveedores de nube, el desarrollo de nuevas empresas especializadas en cómputo en la nube, los compromisos de aceleradores y las conversaciones sobre memoria le dan a Anthropic varias rutas hacia la infraestructura que sostiene su API.
Anthropic está utilizando contratos, especificaciones, derechos de asignación y competencia entre socios para influir en su estructura de costos antes de poseer partes importantes de ella. La pregunta es si podrá moldear el costo, la disponibilidad y la configuración de los componentes que determinan su costo marginal por token.
La HBM puede limitar a un proveedor de modelos incluso cuando el suministro de aceleradores parece asegurado. SK Hynix controlaba más de 52% del mercado frente a la competencia de Samsung y Micron, y un acelerador sin suficiente memoria de alto ancho de banda representa capacidad inutilizable. Una relación con el proveedor dominante ofrece a Anthropic mayor visibilidad sobre el suministro y más influencia en el diseño, se concrete o no un acelerador propio.
Un chip de Anthropic todavía enfrentaría riesgos de diseño, software, encapsulado, fabricación y despliegue. La empresa podría utilizar la relación con el proveedor de memoria para respaldar sistemas diseñados por terceros o fortalecer su posición ante sus socios de aceleradores. Esa alternativa tiene valor cuando, de otro modo, unos cuantos proveedores concentrados determinan la configuración disponible y el margen.
Los laboratorios de modelos se integran mediante un diseño conjunto guiado por las cargas de trabajo
Los laboratorios de modelos se integran verticalmente al aportar conocimiento sobre las cargas de trabajo: patrones de contexto, comportamiento de la atención, tolerancias de cuantización, reutilización de caché, estructura de las llamadas a herramientas y requisitos de procesamiento. Los socios de semiconductores convierten esos requisitos en aceleradores, sistemas de memoria, encapsulado, redes y gabinetes de servidores.
OpenAI y Broadcom ofrecen el ejemplo más claro en un ámbito cercano. Desarrollaron Jalapeño, un chip de inferencia optimizado para modelos extensos de lenguaje, desde el diseño hasta su cierre para fabricación en nueve meses. Según los reportes, las primeras pruebas mostraron un mejor desempeño por watt que la tecnología de punta disponible. Su activo estratégico fue la capacidad de convertir el conocimiento de una carga de trabajo específica en silicio antes de que ese conocimiento perdiera vigencia.
Los chips a medida aún deben superar la participación estimada de 70% que Nvidia tiene en las ventas de chips para IA. Un ecosistema de software maduro, una amplia compatibilidad, la familiaridad de los desarrolladores y la capacidad ya desplegada pueden pesar más que una ventaja teórica en el chip. Un acelerador especializado difícil de programar o mal respaldado por el software de operación se convierte en una costosa demostración de por qué importan los sistemas completos.
Anthropic puede concentrar el diseño conjunto en cargas de trabajo con suficiente volumen y previsibilidad para justificar la especialización. Los ahorros deben superar el costo de ingeniería, el riesgo de ejecución y la flexibilidad perdida. Por debajo de ese umbral ganan los componentes comerciales; por encima, Anthropic paga de forma recurrente por una versatilidad que ya no necesita.
El software de operación determina si el silicio se convierte en margen para la API
Un negocio de API solo captura los ahorros del hardware cuando estos sobreviven a su paso por la arquitectura del modelo, los núcleos de ejecución, la cuantización, el uso de caché, el procesamiento por lotes, la distribución de solicitudes, la programación de recursos y la recuperación ante fallas. Los chips más rápidos tienen poco valor económico si cae su utilización, las solicitudes se acumulan de forma impredecible o el modelo consume más tokens para completar el mismo trabajo.
El énfasis de Opus 5 en usar menos tokens y en aprovechar herramientas compatibles con el caché de instrucciones apunta directamente a esta capa. La unidad útil es la tarea terminada. Un modelo que completa un trabajo comparable con menos tokens generados puede resultar más barato sin cambiar el precio de lista, mientras el contexto almacenado en caché y los lotes de solicitudes compatibles reducen la infraestructura que consumen esos tokens.
Inferact, fundada por los creadores de vLLM para comercializar el motor de inferencia de código abierto, recaudó una ronda inicial de $150 million con una valuación de $800 million. Según reportes, ingenieros de OpenAI encontraron una forma de reducir los costos de inferencia a menos de la mitad. Una ronda de financiamiento importante para un motor de inferencia y una reducción de costos superior a 50% dentro de un laboratorio colocan al software de operación en el mismo plano estratégico que el diseño de modelos.
Las cargas de trabajo basadas en agentes refuerzan este incentivo. La latencia interactiva domina cuando una persona espera cada respuesta. Los procesos autónomos más largos dan mayor peso a la capacidad de procesamiento, la flexibilidad para programar recursos, el comportamiento de los reintentos y el costo total de la tarea. La infraestructura puede sacrificar algo de inmediatez a cambio de una mayor utilización cuando el sistema sabe qué trabajos permiten ese intercambio.
Los proveedores deberían optimizar el costo por tarea útil. Los modelos, aceleradores y centros de datos son insumos; el resultado comercial es una tarea completada de forma confiable, como una modificación de código, una investigación integrada, una secuencia de herramientas ejecutada o un proceso empresarial avanzado. Un proveedor que solo mide tokens optimiza el contador. Uno que controla el sistema puede optimizar el trabajo.
Controlar la infraestructura puede mejorar los márgenes o destruir los rendimientos
Al descender hacia las capas de infraestructura, Anthropic acepta riesgos de capital y utilización a cambio de reducir su exposición a los proveedores. Los contratos de capacidad de largo plazo pueden asegurar el suministro y reducir los costos unitarios si la demanda llega conforme a lo previsto. También pueden convertir una estimación equivocada de demanda en años de obligaciones fijas.
Los programas de chips a medida implican la misma disyuntiva. La especialización puede mejorar el desempeño por watt y reducir la dependencia de un proveedor dominante. También puede volver inútil el trabajo de ingeniería si cambian las arquitecturas de los modelos, se retrasa la fabricación o el software no ofrece soporte adecuado para el dispositivo. La memoria comprometida aún necesita aceleradores, redes, energía y demanda de clientes a su alrededor.
Anthropic debe sobresalir en coordinación. El laboratorio tiene que alinear los lanzamientos de modelos, la eficiencia en el uso de tokens, la disponibilidad de hardware, el suministro de HBM, la entrega de centros de datos y la demanda de clientes con suficiente precisión para mantener productiva una capacidad costosa. La capacidad debe llegar cuando los modelos y los clientes puedan utilizarla, y el sistema de operación debe mantenerla ocupada sin deteriorar la calidad del trabajo terminado.
El compromiso de 2GW con AMD convierte la utilización en una cuestión operativa central: ¿cuánto trabajo pagado podrá dirigir Anthropic hacia la capacidad asegurada conforme entre en operación? Mejores condiciones de compra solo mejoran la economía unitaria si la empresa puede ajustar la oferta de infraestructura a la demanda de sus clientes.
Restringir la oferta de modelos no elimina la sustitución
Los proveedores de modelos cerrados también pueden defender los precios de sus servicios al limitar la disponibilidad o reproducción de alternativas. Según reportes, Anthropic y OpenAI han presionado a Washington para imponer restricciones a modelos chinos de código abierto, mientras se enfrentan con otras empresas tecnológicas por la propuesta. OpenAI, Anthropic y Google también han compartido información mediante Frontier Model Forum para detectar intentos de destilación adversaria que infrinjan sus condiciones.
Esas medidas pueden afectar el acceso, los costos de cumplimiento y la facilidad para copiar un modelo específico. La competencia por los costos de operación continúa bajo esas reglas. DeepInfra ya admite más de 190 modelos abiertos, lo que convierte a la infraestructura de inferencia en un canal de distribución para una amplia oferta de modelos. Según los reportes, Gemma 3 de Google y Command A de Cohere podían ejecutarse en uno o dos Nvidia H100s, lo que reduce el umbral de hardware necesario para ofrecer alternativas creíbles.
La política pública puede reducir el número de participantes mientras los clientes siguen comparando precio y desempeño entre los que permanecen. Un proveedor cerrado todavía debe justificar su precio superior mediante una mejor economía, confiabilidad, integración o gobernanza. Las medidas contra la destilación protegen un producto específico; la producción eficiente protege su viabilidad económica.
El compromiso de 2GW de Anthropic se desprende directamente del hecho de que la inferencia consume más de la mitad de los ingresos. La API puede conquistar al cliente; la asignación de memoria, las condiciones de compra de aceleradores y el software de operación determinan cuánto vale ese cliente. La ventaja duradera pertenece al sistema que convierte modelos cambiantes en trabajo confiable con un menor costo marginal, incluso después de que el propio modelo deja de ser escaso.
De la rápida iteración de modelos al abastecimiento de infraestructura
- 2026-07-25 — Anthropic lanzó Opus 5, su cuarto modelo en menos de dos meses, y afirmó que costaba la mitad que Fable 5.
- 2026-07-25 — Anthropic indicó que se esperaba que los clasificadores de Opus 5 intervinieran alrededor de 85% menos que los de Fable 5 y convirtió Opus 5 en la opción predeterminada de Claude Max.
- 2026-07-26 — Se confirmó la solicitud de Anthropic para que SK Hynix suministrara chips de memoria destinados al desarrollo de sus propios chips, lo que extendió sus esfuerzos de optimización por debajo de la capa del modelo.
Preguntas frecuentes
¿Por qué Anthropic está comprometiendo tanta capacidad de AMD?
El acuerdo asegura hasta 2GW de capacidad MI450 a partir del primer semestre de 2027. Puede ayudar a Anthropic a diversificarse más allá de los proveedores dominantes de aceleradores y mejorar su poder de negociación, pero solo si la demanda de los clientes mantiene productiva esa capacidad.
¿Por qué Anthropic quiere memoria de SK Hynix?
La memoria de alto ancho de banda puede limitar el despliegue incluso cuando hay aceleradores disponibles. Trabajar con SK Hynix podría dar a Anthropic mayor visibilidad sobre el suministro y más influencia en el diseño, ya sea para desarrollar sus propios chips o para utilizar sistemas diseñados por terceros.
¿Cómo puede el software de operación reducir los costos de inferencia de Anthropic?
El uso de caché, el procesamiento por lotes, la cuantización, la distribución de solicitudes, la programación de recursos y una mejor recuperación ante fallas pueden elevar la utilización y reducir la infraestructura necesaria para cada tarea terminada. El argumento es que las mejoras en el silicio solo importan si esta capa de software las convierte en resultados confiables mediante la API.
¿Controlar la infraestructura significa que Anthropic debe fabricar sus propios chips?
No. Anthropic puede influir en su estructura de costos mediante especificaciones, derechos de asignación, contratos de compra, competencia entre socios y diseño conjunto guiado por las cargas de trabajo, sin poseer fábricas ni siquiera lanzar un acelerador propio.
¿Cuál es el mayor riesgo financiero de la estrategia de 2GW?
El riesgo de utilización. Los contratos de capacidad reducen los costos unitarios cuando la demanda llega a tiempo, pero una mala proyección puede dejar a Anthropic pagando durante años por infraestructura subutilizada.