A Anthropic se comprometeu a comprar até 2GW de capacidade baseada no AMD MI450 a partir de 2027. Materiais para investidores indicam que os custos de inferência superam metade da receita tanto da Anthropic quanto da OpenAI. Quanto mais cresce o negócio de API, mais dinheiro precisa ser direcionado à infraestrutura que o sustenta.

Principais conclusões

  • A inferência é o principal foco de pressão econômica: segundo informações divulgadas, seus custos superam metade da receita da Anthropic e da OpenAI. Portanto, preços menores de API precisam vir acompanhados de ganhos de eficiência, margens mais estreitas ou ambos.
  • O compromisso da Anthropic de comprar até 2GW de capacidade baseada no AMD MI450 a partir de 2027 é uma aposta de que escala, poder de negociação com fornecedores e desenvolvimento conjunto de sistemas podem reduzir seu custo marginal por token.
  • O pedido à SK Hynix mostra que o acesso a aceleradores, por si só, não basta; memória de alta largura de banda, encapsulamento, redes e programas de execução determinam em conjunto a capacidade realmente utilizável.
  • Os ganhos de equipamento só se transformam em margem da API quando modelos, armazenamento temporário, agrupamento de requisições, roteamento, escalonamento e recuperação de falhas geram mais trabalho concluído com confiabilidade por dólar gasto.
  • Avançar para as camadas de infraestrutura cria um novo risco: compromissos de capacidade de longo prazo e investimentos em circuitos integrados próprios podem destruir retornos caso a demanda, a arquitetura dos modelos ou o cronograma de implantação fiquem aquém das expectativas.

Cada cliente da API traz receita, mas também um fluxo contínuo de despesas de inferência. Se essas despesas crescerem rápido demais, até um modelo melhor pode gerar resultados econômicos piores. A Anthropic precisa aprimorar tanto o serviço oferecido ao cliente quanto a infraestrutura que o executa.

Com recursos avançados mais baratos, a disputa migra para a infraestrutura de execução

Claude Opus 5 ilustra esse mecanismo. A Anthropic afirma que o modelo se aproxima do desempenho do Fable 5 pela metade do preço e o tornou a opção padrão no Claude Max. Um modelo próximo da fronteira tecnológica pode cobrar menos sem abrir mão de grande parte dos recursos valorizados pelos clientes.

A Anthropic cobra pelo Opus 5 $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída, os mesmos valores do Opus 4.8, mas afirma que o modelo mais recente usa menos tokens para realizar trabalhos comparáveis. Menos tokens, reaproveitamento de instruções já processadas e melhor uso de ferramentas reduzem a infraestrutura paga necessária para concluir uma tarefa.

Os custos de inferência crescem com o uso, em vez de permanecerem como uma despesa fixa de pesquisa. Materiais para investidores indicaram que os custos de inferência superavam metade da receita tanto na Anthropic quanto na OpenAI. Quando um custo variável representa mais da metade da receita, qualquer redução de preço exige um ganho equivalente de eficiência, uma margem menor ou ambos.

Modelos abertos como Gemma 3, do Google, e Command A, da Cohere, intensificaram essa pressão ao recolocar o custo marginal e o custo dos serviços prestados no centro da discussão. Uma alternativa suficientemente competente pode obrigar um serviço mais caro a justificar seu preço com confiabilidade, integração, governança ou menor custo total por tarefa.

Num primeiro momento, os compradores usam previsões mais baratas para obter a mesma resposta gastando menos. Depois, redesenham suas aplicações em torno do novo preço: ampliam o contexto, acionam os modelos com maior frequência e delegam fluxos de trabalho mais longos. A queda no preço dos tokens amplia o mercado para infraestrutura eficiente, pois torna viáveis mais aplicações.

A redução dos preços unitários pode expandir a demanda e, ao mesmo tempo, expor margens frágeis na execução dos modelos. Um fornecedor que repassa todos os ganhos aos clientes vira um canal de alto crescimento para a receita dos fabricantes de equipamentos; quem mantém os preços perde cargas de trabalho para alternativas mais baratas. As empresas compradoras reagem encaminhando tarefas rotineiras para modelos mais econômicos, reservando os serviços mais caros para falhas e atividades críticas e negociando com base no custo da tarefa concluída, não no preço de tabela.

A Anthropic está criando alternativas para administrar sua estrutura de custos

O pedido da Anthropic para que a SK Hynix forneça memória destinada ao desenvolvimento de seu próprio circuito integrado faz parte de uma estratégia mais ampla de suprimentos. A iniciativa acompanha o compromisso de comprar até 2GW de capacidade baseada no AMD MI450 a partir do primeiro semestre de 2027, enquanto a AMD assumiu separadamente o compromisso de investir até $5 bilhões na Anthropic.

Compromisso de até 2GW de capacidade baseada no AMD MI450 a partir de 2027
Participação da SK Hynix no concentrado mercado de HBM

As duas iniciativas protegem a Anthropic contra riscos diferentes. A empresa pode explorar circuitos integrados próprios enquanto garante capacidade futura, diversifica fornecedores e aumenta seu poder de negociação. O acordo com a AMD ainda deixa a Anthropic substancialmente dependente de aceleradores externos, mas em uma escala grande o suficiente para influenciar as condições comerciais.

A Anthropic também está ampliando suas rotas de acesso a instalações. A Fluidstack captou $830 milhões, com uma avaliação de $7.5 bilhões, depois de firmar uma parceria com o laboratório para ajudar a construir centros de dados de IA. O investimento total da Amazon na Anthropic chegou a $8 bilhões em 2024. Capital dos grandes provedores de computação em nuvem, desenvolvimento por novos operadores de infraestrutura, compromissos com aceleradores e negociações sobre memória oferecem à Anthropic vários caminhos até a infraestrutura que sustenta sua API.

A Anthropic usa contratos, especificações, direitos de alocação e concorrência entre parceiros para influenciar sua estrutura de custos antes mesmo de controlar diretamente partes importantes dela. A questão é se conseguirá moldar o custo, a disponibilidade e a configuração dos componentes que determinam seu custo marginal por token.

A HBM pode limitar um fornecedor de modelos mesmo quando o abastecimento de aceleradores parece garantido. A SK Hynix detinha mais de 52% do mercado, em meio à concorrência de Samsung e Micron, e um acelerador sem memória de alta largura de banda suficiente representa capacidade inutilizável. Um relacionamento com o fornecedor dominante dá à Anthropic maior visibilidade sobre o abastecimento e influência sobre o projeto, independentemente de ela lançar ou não um acelerador próprio.

Um circuito integrado da Anthropic ainda enfrentaria riscos de projeto, programas, encapsulamento, fabricação e implantação. A empresa também pode usar a relação com a fornecedora de memória para apoiar sistemas projetados por terceiros ou melhorar sua posição diante de parceiros de aceleradores. Essa alternativa tem valor quando fornecedores concentrados determinam a configuração disponível e a margem.

Laboratórios de modelos se integram à infraestrutura por meio de projetos orientados pela carga de trabalho

Os laboratórios de modelos avançam verticalmente ao fornecer conhecimento sobre suas cargas de trabalho: padrões de contexto, comportamento da atenção, tolerâncias de quantização, reaproveitamento de informações armazenadas temporariamente, estrutura das chamadas de ferramentas e requisitos de vazão. Os parceiros de semicondutores convertem essas necessidades em aceleradores, sistemas de memória, encapsulamento, redes e bastidores.

OpenAI e Broadcom oferecem o exemplo mais claro em uma área adjacente. As empresas desenvolveram o Jalapeño, um circuito integrado de inferência otimizado para LLMs, desde o projeto até o envio do desenho final para fabricação em nove meses. Segundo informações divulgadas, os primeiros testes mostraram desempenho por watt superior ao que havia de mais avançado. O ativo estratégico das empresas foi a capacidade de converter o conhecimento sobre uma carga de trabalho específica em circuitos físicos antes que esse conhecimento ficasse obsoleto.

Circuitos integrados próprios ainda precisam superar a participação estimada de 70% da Nvidia nas vendas de circuitos integrados para IA. Programas consolidados, ampla compatibilidade, familiaridade dos desenvolvedores e capacidade já instalada podem pesar mais do que um ganho teórico no componente. Um acelerador especializado difícil de escalonar ou mal atendido pelos programas de execução se transforma numa demonstração cara de por que o sistema completo importa.

A Anthropic pode concentrar o desenvolvimento conjunto em cargas de trabalho com volume e previsibilidade suficientes para justificar a especialização. A economia precisa superar o custo de engenharia, o risco de execução e a perda de flexibilidade. Abaixo desse patamar, prevalecem os equipamentos disponíveis no mercado; acima dele, a Anthropic paga repetidamente pela versatilidade de que já não precisa.

Os programas de execução determinam se os ganhos do circuito integrado chegam à margem da API

Um negócio de API só captura a economia proporcionada pelos equipamentos quando ela sobrevive à passagem pela arquitetura do modelo, rotinas computacionais, quantização, armazenamento temporário, agrupamento de requisições, roteamento, escalonamento e recuperação de falhas. Circuitos mais rápidos têm pouco valor econômico se a utilização cai, as requisições entram em filas imprevisíveis ou o modelo consome mais tokens para concluir o mesmo trabalho.

A ênfase do Opus 5 no uso de menos tokens e de ferramentas compatíveis com o reaproveitamento de instruções já processadas aponta diretamente para essa camada. A unidade útil é a tarefa concluída. Um modelo capaz de realizar um trabalho comparável gerando menos tokens pode sair mais barato mesmo sem alteração no preço de tabela, enquanto o contexto reaproveitado e o agrupamento de requisições compatíveis reduzem a infraestrutura consumida por esses tokens.

A Inferact, fundada pelos criadores do vLLM para explorar comercialmente o mecanismo de inferência de código aberto, captou $150 milhões em uma rodada inicial, com avaliação de $800 milhões. Segundo informações divulgadas, engenheiros da OpenAI encontraram uma forma de reduzir os custos de inferência em mais da metade. Uma grande rodada de financiamento para um mecanismo de inferência e uma redução de custos superior a 50% dentro de um laboratório colocam os programas de execução no mesmo plano estratégico que o projeto dos modelos.

As cargas de trabalho baseadas em agentes reforçam esse incentivo. A demora de resposta domina a experiência quando uma pessoa aguarda cada retorno. Fluxos autônomos mais longos dão maior peso à vazão, à flexibilidade de escalonamento, ao comportamento das novas tentativas e ao custo total da tarefa. A infraestrutura pode trocar parte da rapidez imediata por maior utilização quando o sistema de execução sabe quais trabalhos permitem essa escolha.

Os fornecedores devem otimizar o custo por tarefa útil. Modelos, aceleradores e centros de dados são insumos; o resultado comercial é uma conclusão confiável, como uma alteração de código, uma pesquisa estruturada, uma sequência de ferramentas executada ou um processo empresarial mais avançado. Quem mede apenas tokens otimiza o medidor. Quem controla o sistema consegue otimizar o trabalho.

O controle da infraestrutura pode ampliar margens ou destruir retornos

Ao avançar para as camadas de infraestrutura, a Anthropic assume riscos de capital e utilização em troca de menor exposição aos fornecedores. Contratos de capacidade de longa duração podem garantir abastecimento e reduzir custos unitários quando a demanda chega conforme o previsto. Também podem transformar uma estimativa errada de demanda em anos de obrigações fixas.

Programas de circuitos integrados próprios envolvem a mesma contrapartida. A especialização pode melhorar o desempenho por watt e reduzir a dependência de um fornecedor dominante. Também pode tornar inútil todo o trabalho de engenharia se as arquiteturas dos modelos mudarem, a fabricação atrasar ou os programas não oferecerem suporte adequado ao dispositivo. A memória contratada ainda precisa de aceleradores, redes, energia e demanda dos clientes ao seu redor.

A Anthropic precisa se destacar na coordenação. O laboratório deve alinhar lançamentos de modelos, eficiência no uso de tokens, disponibilidade de equipamentos, abastecimento de HBM, entrega de centros de dados e demanda dos clientes com precisão suficiente para manter produtiva uma capacidade cara. Essa capacidade precisa chegar quando modelos e clientes puderem utilizá-la, e o sistema de execução deve mantê-la ocupada sem prejudicar o trabalho concluído.

O compromisso de 2GW com a AMD transforma a utilização numa questão operacional central: quanto trabalho remunerado a Anthropic conseguirá direcionar para a capacidade contratada à medida que ela entrar em operação? Condições de compra melhores só aprimoram a economia unitária quando a empresa consegue compatibilizar a oferta de infraestrutura com a demanda dos clientes.

Restringir a oferta de modelos não elimina a substituição

Fornecedores de modelos fechados também podem defender seus preços limitando a disponibilidade ou a reprodução de alternativas. Segundo informações divulgadas, Anthropic e OpenAI fizeram pressão em Washington por restrições a modelos chineses de código aberto, entrando em conflito com outras empresas de tecnologia em torno da proposta. OpenAI, Anthropic e Google também compartilharam informações por meio do Frontier Model Forum para detectar tentativas adversárias de destilação que violem seus termos.

Essas medidas podem afetar o acesso, os custos de conformidade e a facilidade de copiar determinado modelo. A disputa pelo custo de execução continua mesmo sob essas regras. A DeepInfra já oferece suporte a mais de 190 modelos abertos, transformando a infraestrutura de inferência em um canal de distribuição para uma ampla oferta de modelos. Segundo informações divulgadas, Gemma 3, do Google, e Command A, da Cohere, funcionavam com uma ou duas Nvidia H100s, reduzindo o patamar de equipamentos necessário para alternativas competitivas.

A política pública pode estreitar o campo de concorrentes, mas os clientes continuarão comparando preço e desempenho dentro dele. Um fornecedor fechado ainda precisa justificar seu preço mais alto com melhores resultados econômicos, confiabilidade, integração ou governança. Medidas contra a destilação protegem um produto específico; uma produção eficiente protege sua viabilidade econômica.

O compromisso de 2GW da Anthropic decorre diretamente do fato de a inferência consumir mais da metade da receita. A API pode conquistar o cliente; a alocação de memória, as condições de compra dos aceleradores e os programas de execução determinam quanto esse cliente vale. A vantagem duradoura está no sistema capaz de transformar modelos em constante mudança em trabalho confiável com menor custo marginal — mesmo depois que o próprio modelo deixa de ser escasso.

Da rápida evolução dos modelos à contratação de infraestrutura

  • 2026-07-25 — A Anthropic lançou o Opus 5, seu quarto modelo em menos de dois meses, e afirmou que ele custava metade do Fable 5.
  • 2026-07-25 — A Anthropic afirmou que se esperava que os classificadores do Opus 5 interviessem cerca de 85% menos vezes do que os classificadores do Fable 5 e tornou o Opus 5 a opção padrão no Claude Max.
  • 2026-07-26 — Foi confirmado o pedido da Anthropic para que a SK Hynix fornecesse circuitos integrados de memória destinados ao desenvolvimento de seu próprio circuito integrado, ampliando seus esforços de otimização para as camadas abaixo do modelo.

Perguntas frequentes

Por que a Anthropic está contratando tanta capacidade da AMD?

O acordo garante até 2GW de capacidade baseada no MI450 a partir do primeiro semestre de 2027. Isso pode diversificar a base de fornecedores da Anthropic para além dos fabricantes dominantes de aceleradores e ampliar seu poder de negociação, mas somente se a demanda dos clientes mantiver essa capacidade produtiva.

Por que a Anthropic quer memória da SK Hynix?

A memória de alta largura de banda pode limitar a implantação mesmo quando há aceleradores disponíveis. Trabalhar com a SK Hynix pode dar à Anthropic maior visibilidade sobre o abastecimento e mais influência no projeto de seu próprio circuito integrado ou de sistemas desenvolvidos por terceiros.

Como os programas de execução podem reduzir os custos de inferência da Anthropic?

Armazenamento temporário, agrupamento de requisições, quantização, roteamento, escalonamento e melhor recuperação de falhas podem elevar a utilização e reduzir a infraestrutura necessária para cada tarefa concluída. O argumento é que ganhos nos circuitos integrados só importam quando essa camada de programas os converte em resultados confiáveis da API.

Controlar a infraestrutura significa que a Anthropic precisa fabricar seus próprios circuitos integrados?

Não. A Anthropic pode moldar sua estrutura de custos por meio de especificações, direitos de alocação, contratos de compra, concorrência entre parceiros e desenvolvimento conjunto orientado pela carga de trabalho, sem controlar a fabricação nem sequer lançar um acelerador próprio.

Qual é o maior risco financeiro da estratégia de 2GW?

O risco de utilização. Os contratos de capacidade reduzem os custos unitários quando a demanda chega no prazo previsto, mas uma projeção equivocada pode deixar a Anthropic pagando durante anos por infraestrutura subutilizada.