A DeepSeek elevou o preço da saída do V4-Flash de $0.28 por milhão de tokens para $1.32 no horário de pico, enquanto fora do pico cobra $0.66. O modelo não fica mais inteligente conforme as horas passam; é a fila que aperta. Ao vincular o preço de cada token ao relógio, a DeepSeek deixou claro o que os clientes estão comprando cada vez mais.
Principais conclusões
- O preço da saída do V4-Flash da DeepSeek sobe de $0.66 por milhão de tokens fora do pico para $1.32 no pico, o que mostra que o custo marginal é determinado pelo congestionamento e pelo momento da entrega — e não por qualquer mudança na inteligência do modelo.
- Pesos abertos e arquiteturas mais baratas tornam o acesso aos modelos cada vez mais comum, mas não oferecem capacidade computacional reservada, latência previsível, capacidade para absorver picos nem confiabilidade em produção.
- Sistemas que coordenam agentes podem reduzir custos adiando tarefas flexíveis, trocando de modelo ou pagando valores mais altos apenas quando a conclusão imediata for necessária.
- À medida que o acesso aos modelos fica mais barato, o valor comercial e o risco de infraestrutura migram para hospedagem, coordenação de recursos, compra de energia, planejamento de capacidade e prestação confiável do serviço.
- Os prejuízos atribuídos à DeepSeek e a proposta de captação para financiar infraestrutura mostram como o aumento do uso pode criar grandes necessidades de financiamento mesmo quando a receita cresce rapidamente.
Um arquivo de pesos — ou o acesso a um modelo competente — representa uma parcela cada vez menor do custo total de uso em produção. O fornecedor precisa entregar capacidade de processamento quando os clientes a solicitam, absorver picos sem interromper o serviço, manter a latência sob carga e deixar recursos suficientes ociosos para cumprir sua promessa de disponibilidade. O modelo pode ser barato mesmo quando o atendimento imediato não é.
Essa separação muda o que os fornecedores vendem. Antes, os tokens eram precificados sobretudo como uma tarifa pelo nível de desempenho: o modelo mais inteligente custava mais porque a inteligência era tratada como o recurso escasso. Já os preços da DeepSeek remuneram um sistema de atendimento com capacidade limitada em determinado momento.
Pesos abertos tornam o modelo comum, não o compromisso de entrega
Os fabricantes estão ampliando por várias frentes a oferta de inteligência que pode ser efetivamente utilizada. A DeepSeek lançou o V4-Pro a $0.435 por milhão de tokens de entrada e $0.87 por milhão de tokens de saída. A Tencent apresentou um modelo aberto de 770 bilhões de parâmetros com uma janela de contexto de um milhão de tokens.
Todos os fornecedores têm o mesmo incentivo. Pesos abertos ampliam a distribuição, atraem desenvolvedores e reduzem o risco de ficar de fora de um ecossistema organizado em torno de agentes proprietários. Com a queda dos custos de arquitetura e acesso, vários fornecedores chegam de forma independente à conclusão de que abrir seus modelos faz sentido.
Publicar os pesos elimina apenas uma restrição. Isso não cria um serviço gerenciado, não reserva aceleradores para uma disparada no tráfego nem garante que uma solicitação de um milhão de tokens termine no prazo. Essas funções cabem ao sistema completo de operação, no qual confiabilidade, latência, utilização e custos recorrentes de produção importam tanto quanto o desempenho em testes comparativos.
Desenvolvedores podem retirar parte da inferência das interfaces centralizadas por meio de modelos executados nos próprios dispositivos e de pesos hospedados internamente. Essa alternativa funciona para equipes cujas cargas cabem no equipamento disponível e que conseguem assumir a responsabilidade operacional. O serviço gerenciado continua valioso para quem prefere pagar a terceiros para manter tudo funcionando.
O relógio agora equilibra o mercado de tokens
Nada dentro do V4-Flash muda na passagem do horário de pico para o período fora dele. Os clientes simplesmente pagam mais quando suas solicitações disputam a mesma capacidade de atendimento.
A DeepSeek está aplicando a economia da capacidade computacional por meio de uma interface de programação. No horário de pico, uma solicitação ocupa recursos que poderiam atender outra. Fora do pico, a mesma solicitação ajuda a gerar receita com uma infraestrutura que, de outra forma, ficaria subutilizada.
A DeepSeek também cobra dos usuários flexíveis metade do valor praticado no pico, contrariando a ideia de que preços variáveis seriam apenas inflação exibida em uma tela mais bonita. Sua tabela encarece a urgência e barateia a espera, tornando visível o congestionamento e dando à demanda que pode ser deslocada um motivo para mudar de horário.
OpenAI e Anthropic informaram custos de inferência superiores à metade da receita. O treinamento cria o modelo, mas é a inferência que produz repetidamente aquilo que os clientes compram. As margens deixam de se parecer com as de um programa de computador quando cada unidade adicional de receita exige uma nova passagem por aceleradores, memória, energia e redes.
Engenheiros da OpenAI teriam encontrado um método para reduzir o custo de inferência em mais da metade. Sua adoção em larga escala poderia aliviar a pressão sobre os preços dos tokens e melhorar as margens em qualquer nível de utilização.
Mesmo um sistema operacional mais barato, porém, pode ficar congestionado quando solicitações demais chegam ao mesmo tempo. Ganhos de eficiência aumentam o volume de trabalho que cabe na capacidade disponível, enquanto os preços variáveis afastam da fila as tarefas que podem esperar.
Agentes transformam a espera em instrumento econômico
A cobrança por horário só funciona quando parte da demanda pode ser deslocada. Em geral, uma conversa interativa não pode esperar, porque a pessoa que aguarda a resposta considera a latência parte da qualidade do produto. As cargas dos agentes têm outro perfil: muitas tarefas podem continuar sem que alguém acompanhe a chegada de cada token.
Na inferência com agentes, a velocidade assume outro peso quando não há pessoas participando diretamente de cada etapa. Uma pesquisa executada em segundo plano, uma rodada de validação de código, um lote de processamento de documentos ou um fluxo multimodal muitas vezes pode trocar prazo de conclusão por custo menor. Cabe ao sistema de coordenação decidir se essa troca é aceitável.
A DeepSeek lançou uma estrutura para agentes sob licença MIT, com adaptadores de modelos intercambiáveis e componentes baseados em módulos adicionais. Sistemas modulares de agentes permitem programar a escolha do modelo, das ferramentas e das regras de execução, em vez de deixá-las fixas em uma interface de conversa.
Quando a camada de execução consegue avaliar preço e urgência, a capacidade fora do horário de pico vira um recurso do produto. Um agente pode encaminhar uma solicitação imediata para o serviço mais caro, adiar tarefas flexíveis para uma faixa mais barata ou transferi-las para outro modelo. A medida relevante passa a ser o custo por tarefa concluída dentro de um limite de latência, e não o preço anunciado por token.
O modelo experimental V4-Flash-Vision da DeepSeek contabiliza imagens como tokens e aplica os preços do V4-Flash. A unidade cobrada agora inclui a entrada visual consumida em um fluxo de trabalho com agentes, o que torna as regras de programação importantes para uma parcela maior do trabalho realizado por máquinas.
Os agentes colocam em prática a divisão de capacidade do mercado de inferência. A capacidade geral e barata atende tarefas flexíveis, enquanto recursos mais escassos recebem um valor adicional de cargas que exigem resposta imediata, latência previsível ou desempenho especializado. Os programas podem tomar essa decisão de contratação continuamente.
Acesso barato empurra fabricantes de modelos para a infraestrutura
Preços baixos ajudam os fornecedores a conquistar distribuição, mas não financiam sozinhos a pesquisa nem a capacidade necessária para prestar o serviço. As empresas de modelos precisam capturar receita recorrente suficiente com inferência para sustentar as duas frentes.
A DeepSeek teria registrado $70.7 milhões em receita e prejuízo líquido de $106 milhões nos primeiros sete meses de 2026, embora a receita tenha alcançado cerca de dez vezes o total de 2025. O rápido crescimento não eliminou a necessidade de financiamento, porque a expansão do serviço traz consigo custos de produção.
Em resposta, a DeepSeek estaria buscando $7.4 bilhões com uma avaliação de $74 bilhões para financiar pesquisa e avançar sobre a infraestrutura computacional. Inteligência barata atrai uso; o uso cria uma obrigação de capacidade; e essa obrigação leva o fornecedor a assumir a propriedade de ativos físicos.
A Moonshot AI buscou acordos de hospedagem com Microsoft, Amazon e Google para o Kimi K3, ao mesmo tempo que tenta obter uma participação de até 30% na receita. Em vez de financiar sozinha toda a camada de operação, a Moonshot procura capturar uma parcela maior da receita gerada pela infraestrutura dos parceiros.
Fornecedores de modelos abertos podem divulgar uma parte maior de seu projeto porque hospedagem, coordenação, distribuição, confiabilidade e acesso aos clientes continuam escassos. À medida que o modelo em si se torna amplamente disponível, essas competências operacionais passam a concentrar uma parcela maior do valor comercial.
O preço dos tokens concentra o risco de infraestrutura
Fornecedores que vendem tokens ficam expostos à disponibilidade de capacidade computacional, energia e redes. A OpenAI está contratando um responsável pela negociação de energia para proteger sua carteira de eletricidade para centros de dados, enquanto a Shanghai Futures Exchange estuda contratos futuros de tokens de IA. As duas iniciativas tratam a demanda por inferência como um risco operacional que pode ser financiado e protegido.
Os preços variáveis das interfaces de programação são a ponta dessa estrutura voltada ao cliente. O consumidor vê tarifas de pico e fora do pico. Os fornecedores administram disponibilidade de equipamentos, compra de eletricidade, utilização e o risco de a demanda contratada chegar antes da capacidade necessária. O preço de um token resume toda essa cadeia em um único número.
Os compradores passam então a ter três opções. Podem adiar tarefas flexíveis para evitar congestionamentos, pagar mais pela escassez em troca de atendimento imediato ou transferir a carga para uma instalação local ou própria e assumir diretamente os custos operacionais.
Agora, antes de escolher um modelo, o comprador precisa classificar cada carga: ela precisa ser executada imediatamente, pode esperar ou pode ser hospedada pela própria equipe? Resultados em testes comparativos não respondem a essas perguntas. São as respostas que determinam a conta e quem assume o risco de infraestrutura.
O token de $1.32 da DeepSeek no horário de pico e o de $0.66 fora dele carregam a mesma inteligência do modelo. O que a hora altera é a fila, a utilização e quem arca com o risco de infraestrutura. A concorrência em IA está se organizando em torno de capacidade programada, financiada e entregue com confiabilidade. É essa promessa que o relógio precifica.
A transição da DeepSeek, em agosto de 2026, do lançamento de modelos para o financiamento de infraestrutura
- 2026-08-21 — A DeepSeek apresentou um modelo experimental V4 Flash capaz de compreender instruções visuais.
- 2026-08-22 — A DeepSeek apresentou uma versão multimodal experimental do V4 Flash.
- 2026-08-26 — Fontes informaram receita de $70.7 milhões e prejuízo líquido de $106 milhões nos primeiros sete meses de 2026; em 2025, o prejuízo líquido anual teria sido de $139 milhões.
- 2026-08-28 — Segundo relatos, a DeepSeek se preparava para captar $7.4 bilhões com uma avaliação de $74 bilhões e planejava avançar sobre a infraestrutura computacional.
Perguntas frequentes
Por que a mesma saída do V4-Flash custa mais no horário de pico?
O modelo não muda, mas as solicitações no horário de pico disputam uma capacidade limitada de atendimento. A DeepSeek cobra $1.32 por milhão de tokens de saída no pico, ante $0.66 fora dele, atribuindo preço à urgência e ao congestionamento.
A IA com pesos abertos elimina os custos de inferência?
Não. Os pesos abertos eliminam uma restrição de acesso, mas o uso em produção ainda exige aceleradores, memória, energia, redes, programação das cargas de trabalho e confiabilidade operacional.
Quais cargas de IA mais se beneficiam dos preços fora do horário de pico?
Tarefas de agentes que podem ser adiadas, como pesquisas em segundo plano, validação de código, processamento de documentos e lotes multimodais, podem trocar prazo de conclusão por custo menor. Em geral, conversas interativas oferecem menos flexibilidade porque os usuários percebem diretamente a latência.
Os compradores devem comparar modelos apenas pelo preço dos tokens?
Não. A medida mais útil é o custo por tarefa concluída dentro de um limite de latência, levando em conta se o trabalho pode esperar, precisa ser executado imediatamente ou pode ser hospedado pela própria equipe.
Por que empresas de modelos baratos estão avançando sobre a infraestrutura?
O acesso barato atrai uso, mas atender a essa demanda cria obrigações recorrentes de capacidade e confiabilidade. Os resultados financeiros atribuídos à DeepSeek e sua proposta de captação para financiar infraestrutura computacional mostram como fornecedores de modelos podem ser levados a operações intensivas em capital.