Em agosto de 2026, a DeepSeek elevou em 4,7 vezes o preço de saída do V4-Flash no pico, de $0.28 para $1.32 por milhão de tokens. A mesma saída custava $0.66 fora do pico, embora o modelo e a unidade de cobrança não tivessem mudado. Para compradores que implantam agentes, o relógio expôs a pergunta que o medidor de tokens não consegue responder. Quanto custou o trabalho concluído?

Principais conclusões

  • A DeepSeek disse que o preço de saída do V4-Flash mudaria em 16 de agosto de 2026, para $1.32 por milhão de tokens nos horários de pico e $0.66 fora do pico, ante $0.28 anteriormente.
  • Em maio de 2026, a DeepSeek tornou permanente um desconto de 75% na API do V4-Pro, fixando os preços em $0.435 por milhão de tokens de entrada e $0.87 por milhão de tokens de saída.
  • A DeepSeek lançou o DeepSeek Harness em preview para desenvolvedores sob a licença MIT em 14 de agosto de 2026.
  • A Artificial Analysis estimou o custo do V4-Flash em $0.03 por teste de benchmark, contra $0.86 para o Kimi K3, $1.86 para o GPT-5.6 Sol e $3.15 para o Claude Fable 5.

A DeepSeek torna essa questão incomumente visível porque a empresa percorreu toda a sequência comercial entre março de 2025 e agosto de 2026: economia de modelo espetacular, competição em benchmarks, descontos agressivos, ferramentas para agentes e preços sensíveis à capacidade. Em março de 2025, a DeepSeek informou uma margem teórica de 545% para a inferência de V3 e R1 em relação às vendas durante um período de 24 horas. Em agosto de 2026, a empresa vendia esforço de raciocínio diferenciado, lançava um harness modular e cobrava tarifas de tokens distintas conforme o horário.

A DeepSeek apareceu em 4 artigos no 2024Q4 e em 133 no 2025Q1. Ao longo dos períodos de comparação de 2024–2026, seu enquadramento de pesquisa caiu de 80.0% para 46.9%, enquanto o enquadramento de financiamento subiu 31.2 pontos percentuais. A cobertura passou cada vez mais a tratar a DeepSeek como um fornecedor cujos preços, margens e stack para desenvolvedores exigiam interpretação.

Rankings venceram porque tornaram modelos distintos comparáveis

Os fornecedores de modelos precisavam de uma linguagem comum antes que os compradores pudessem comparar produtos. Os benchmarks forneciam uma coordenada de capacidade, enquanto as tabelas de preços de API forneciam uma coordenada de custo. Ambos os números circulam com facilidade por comitês de compras, materiais para investidores e anúncios de produtos, de maneiras que um fluxo de trabalho completo não consegue.

Quarterly coverage volume: DeepSeekCoverage of DeepSeek by quarter, 2024 Q4 to 2026 Q3: from 4 to 61 articles per quarter, peaking at 133.peak 133612024 Q42026 Q3
Quarterly coverage · DeepSeek · 2024 Q4–2026 Q3 · current quarter projected

A DeepSeek usou exatamente essa lógica quando posicionou o V4-Pro contra o Kimi K3, da Moonshot AI, em benchmarks, enquanto listava o V4-Pro a $0.435 por milhão de tokens de entrada e $0.87 por milhão de tokens de saída. A comparação permitia que um comprador visse capacidade e preço nominal em uma linha. Ela não exigia que a DeepSeek ou a Moonshot AI definissem um fluxo de produção comum, um padrão de aceitação ou uma política de escalonamento.

As avaliações compostas ainda podem revelar progresso real. O DeepSeek V4-Flash marcou 50 no Artificial Analysis Intelligence Index, igualando o Gemini 3.6 Flash e ganhando 10 pontos em relação ao preview de abril. A mesma avaliação registrou queda de 11 pontos na taxa de alucinação do V4-Flash, para 84%, enquanto a precisão permaneceu em 37%. Medidas de confiabilidade expõem diferenças que uma única pontuação agregada pode ocultar.

Os criadores de benchmarks também estão tornando os testes mais difíceis de superar apenas por recuperação de memória. A ARC Prize Foundation projetou o ARC-AGI-3 em torno de cenários inéditos, semelhantes a videogames, que testam raciocínio em tempo real em vez de recuperação de memória. O resultado da DeepSeek no GDPval-AA v2 subiu de 1189 para 1559 em uma avaliação estruturada em torno de tarefas de trabalho do mundo real realizadas por agentes. Ambos os esforços reduzem a distância entre a avaliação de modelos e o comportamento em produção.

Mesmo testes mais difíceis preservam a lacuna entre avaliação e compras. O ARC-AGI-3 pergunta se um modelo consegue raciocinar em um ambiente novo. O GDPval-AA pergunta como ele lida com um conjunto padronizado de tarefas semelhantes a trabalho. Um comprador ainda precisa especificar qual resposta conta como aceitável, qual erro exige escalonamento e quanta revisão uma decisão consequente merece.

Quando equipes de compras transformam uma pontuação em meta, os laboratórios racionalmente otimizam os insumos dessa pontuação. Essa resposta não exige engano. Escolhas de treinamento, orçamentos de raciocínio e configurações de produto podem melhorar um resultado medido sem melhorar todos os fluxos de clientes na mesma proporção. O benchmark continua sendo evidência sobre o modelo; o comprador fornece o julgamento sobre o trabalho.

A precificação dinâmica transforma o token em uma reivindicação de capacidade

As mudanças de preço da DeepSeek expuseram o que uma tarifa por token contém. Em maio de 2026, a empresa tornou permanente um desconto de 75% na API do V4-Pro, fixando as tarifas em $0.435 por milhão de tokens de entrada e $0.87 por milhão de tokens de saída. Em agosto, a DeepSeek introduziu preços de pico e fora do pico para o V4-Flash.

A DeepSeek cobrou o dobro pela saída do V4-Flash no pico em relação à saída fora do pico. A regra de preço alocava capacidade de atendimento escassa e incentivava compradores a deslocar cargas de trabalho flexíveis para fora dos períodos de maior demanda. Ela moldava o comportamento dos clientes em vez de medir a inteligência do modelo.

Melhorias de infraestrutura podem alterar a economia do fornecedor com a mesma rapidez. Engenheiros da OpenAI teriam encontrado uma forma de mais do que reduzir pela metade o custo de inferência em junho de 2026. Um fornecedor pode reter esse ganho como margem, repassá-lo como tarifa menor, gastá-lo em um orçamento de raciocínio maior ou usá-lo para absorver o crescimento da demanda. A tabela pública de preços, por si só, não revela qual escolha o fornecedor fez.

A economia dos tokens ainda restringe a implantação. Uma aplicação de alto volume não pode ignorar o gasto com modelos, e a latência determina se um fluxo de trabalho pode operar de forma interativa. O mercado de inferência mais amplo usa preço e latência para dividir cargas de trabalho entre modelos, níveis de serviço e janelas de tempo. As equipes de compras devem preservar essas medições porque elas identificam restrições operacionais reais.

A tarifa por token cobre apenas a capacidade do modelo. Se um agente fizer três tentativas, chamar a ferramenta errada duas vezes e enviar o caso a um revisor humano, o fornecedor cobra por cada token gerado, enquanto o cliente paga por uma conclusão e pelo caminho que falhou.

O harness passou a fazer parte do produto

Agentes de IA levam o desempenho para o loop ao redor do modelo. Um agente precisa de um adaptador de modelo, registro de ferramentas, histórico de sessão e loop de execução antes de poder atuar em um fluxo de trabalho. Operadores em produção então acrescentam permissões, observabilidade, tentativas repetidas, alternativas e revisão. Cada elemento pode determinar se a resposta do modelo chega a um estado aceito.

A DeepSeek reconheceu essa arquitetura diretamente ao lançar o DeepSeek Harness sob a licença MIT em preview para desenvolvedores. O projeto usa um design baseado em plugins, no qual desenvolvedores podem trocar componentes em vez de tratar o endpoint do modelo como a aplicação inteira. A DeepSeek também deu ao V4-Pro esforço de raciocínio configurável para tarefas simples, fluxos diários de agentes e tarefas complexas.

O design modular muda a forma como os desenvolvedores comparam modelos. Uma equipe pode manter ferramentas, tratamento de estado e lógica de aceitação relativamente estáveis enquanto substitui o adaptador de modelo. Outra equipe pode manter o modelo estável enquanto testa um loop de agente ou uma política de revisão diferentes. O harness transforma variáveis antes entrelaçadas em componentes separáveis.

Com esses componentes separados, os desenvolvedores podem atribuir um fluxo de trabalho malsucedido ao modelo, à interface da ferramenta, à política de orquestração ou à regra de aceitação, em vez de atribuir cada falha à “qualidade da IA”. Também podem gastar seletivamente: um modelo barato pode encaminhar etapas rotineiras, enquanto uma configuração de raciocínio mais cara lida com exceções.

A DeepSeek ocupa os dois lados dessa stack emergente. V4-Pro e V4-Flash fornecem capacidade de modelo; o DeepSeek Harness organiza ferramentas e estado em torno dessa capacidade. O Kimi K3, da Moonshot AI, fornece um concorrente em benchmark e preço. OpenAI e Anthropic fornecem endpoints alternativos de modelos com suas próprias estruturas de custo. O desenvolvedor decide como esses blocos se tornam um sistema funcional.

Os fornecedores de modelos têm incentivo para se expandir para a orquestração porque o harness controla roteamento, política de repetição e seleção de modelo. Os desenvolvedores têm o incentivo oposto de manter o harness modular, porque a portabilidade preserva poder de negociação. Fornecedores buscam controlar a demanda, enquanto clientes buscam controlar a troca.

As margens de inferência decidem quem carrega o risco de execução

OpenAI e Anthropic disseram a investidores que os custos de inferência superavam metade da receita. Esses custos dão a ambas as empresas uma forte razão para melhorar a eficiência de atendimento, segmentar capacidade e medir o uso com precisão. A margem teórica de 545% da DeepSeek aponta na direção oposta, mas seu cálculo cobria a inferência do modelo em relação às vendas durante um único período de 24 horas, muito aquém do fluxo de trabalho completo de um cliente.

As empresas usam denominadores diferentes. Um fornecedor compara o custo de atendimento com a receita de API. Um cliente compara o custo total do fluxo de trabalho com o trabalho aceito. Chamadas repetidas elevam os custos do cliente enquanto aumentam a receita do fornecedor.

As empresas têm usado principalmente agentes para melhorar a eficiência e reduzir custos, em vez de criar crescimento de receita, segundo uma análise da adoção de agentes empresariais. Esse objetivo torna a variação de execução cara. Um experimento de vendas pode tolerar ganho incerto; um programa de eficiência precisa superar os custos de mão de obra, software e processo que deveria substituir.

Em contratos por token, os clientes carregam a variação de execução. Eles pagam por tentativas repetidas, consomem tempo da equipe durante exceções e verificam resultados quando erros trazem consequências. Garantias de resultado transfeririam parte dessa variação ao fornecedor, dando a ele incentivo para otimizar todo o caminho até a aceitação, e não a primeira resposta.

Os fornecedores podem precificar esse risco cobrando mais por um resultado verificado, limitando o escopo do fluxo de trabalho, exigindo critérios de aceitação verificáveis por máquina ou excluindo casos que demandam julgamento organizacional. Os compradores podem manter a cobrança por token para trabalho exploratório, enquanto usam termos baseados em conclusão para processos repetitivos e delimitados. A parte que assegura a falha refletirá esse risco nos termos.

Um registro de conclusões verificadas torna os erros financeiramente visíveis

A Artificial Analysis estimou que o V4-Flash custava $0.03 por teste de benchmark, em comparação com $0.86 para o Kimi K3, $1.86 para o GPT-5.6 Sol e $3.15 para o Claude Fable 5. Essa comparação ajuda um comprador a identificar modelos que valem ser testados. Uma equipe de compras não deve descartar uma diferença de custo de 105 vezes entre o V4-Flash e o Claude Fable 5 apenas porque a comparação usa uma aproximação.

Os compradores devem levar o cálculo até o fluxo de trabalho implantado. Eles podem dividir todas as chamadas de modelo, cobranças de ferramentas, infraestrutura de orquestração, tentativas malsucedidas e trabalho de revisão pelo número de resultados que atendem a um padrão definido de aceitação. A stack de compras de modelos resultante preserva dados de benchmark e tokens, mas atribui cada número à camada que ele descreve.

Camada Métrica do comprador Custo ou risco exposto
Modelo Qualidade em benchmarks relevantes para a tarefa e gravidade dos erros Lacunas de capacidade antes da implantação
Uso Tokens de entrada e saída por conclusão aceita Gasto com modelo, incluindo chamadas repetidas
Execução Taxa de repetição, taxa de falha em chamadas de ferramentas e frequência de alternativas Desperdício de orquestração e custo de API externa
Tempo Tempo mediano e de cauda até a conclusão Filas, exposição à capacidade de pico e atraso para o usuário
Escalonamento Frequência de revisão humana e tempo de tratamento Custo de mão de obra e gargalos operacionais
Aceitação Conclusões verificadas divididas por tarefas tentadas Resultado utilizável após julgamento organizacional

As equipes de compras precisam de regras de aceitação específicas para cada carga de trabalho. Um modelo pode prever a provável resolução de um caso de suporte; a empresa ainda decide qual resolução falsa cria dano inaceitável. Um agente de programação pode gerar um patch; o responsável pelo repositório ainda decide quais testes, revisões e verificações de segurança constituem uma conclusão.

Os compradores devem incluir a verificação humana na unidade de custo para fluxos de trabalho consequentes. Devem registrar minutos dos revisores, frequência de escalonamento e o custo de corrigir erros aceitos. Os fornecedores podem então competir reduzindo esses encargos, em vez de apenas reduzir o preço da chamada de modelo que os precedeu.

Aceitação auditável cria poder para o comprador

Os compradores só podem usar a conclusão verificada quando definem “verificada” antes de a fatura chegar. Tarefas de software delimitadas podem usar testes e regras de revisão. Fluxos de atendimento ao cliente podem usar critérios de resolução, limites de escalonamento e auditorias por amostragem. Processos que envolvem consequências jurídicas, de segurança ou financeiras exigem julgamento humano mais rigoroso e devem carregar seu custo explicitamente.

Os fornecedores mantêm poder de negociação quando os clientes não conseguem mover fluxos de trabalho, inspecionar falhas ou reproduzir testes de aceitação. Os clientes ganham poder quando harnesses modulares lhes permitem substituir modelos, logs lhes permitem atribuir erros e contratos vinculam o pagamento a resultados observáveis. A concorrência entre fornecedores importa, mas portabilidade e auditabilidade determinam se os clientes conseguem usá-la.

Perguntas frequentes

Quando o preço de pico e fora do pico do V4-Flash da DeepSeek estava programado para começar?

A empresa disse que a nova precificação dinâmica começaria em 16 de agosto de 2026. As tarifas de saída anunciadas foram $1.32 por milhão de tokens no pico e $0.66 fora do pico.

Quais horários contam como “pico” na precificação do V4-Flash?

O anúncio disponível identifica tarifas de pico e fora do pico, mas não especifica os horários, o fuso horário nem o escopo regional desses períodos. Os compradores precisariam obter esse detalhe operacional da DeepSeek antes de programar cargas de trabalho flexíveis em torno da diferença de tarifa.

A mudança anunciada de preço dinâmico do V4-Flash também se aplica aos tokens de entrada?

Os valores divulgados de $1.32 no pico e $0.66 fora do pico são especificamente para tokens de saída. Antes do aumento, o V4-Flash era listado a $0.14 por milhão de tokens de entrada e $0.28 por milhão de tokens de saída; as evidências não informam uma tarifa revisada para tokens de entrada.

Como a tarifa de API publicada do V4-Pro difere da nova tarifa de pico do V4-Flash?

O V4-Pro era listado a $0.435 por milhão de tokens de entrada e $0.87 por milhão de tokens de saída. O valor de $1.32 do V4-Flash é um preço de saída em horário de pico, portanto é maior que a tarifa de saída declarada do V4-Pro, apesar de se referir a um modelo e uma condição de serviço diferentes.

Mudança no preço de saída do V4-Flash

Período ou condiçãoPreço de saída por milhão de tokensMudança em relação à tarifa anterior
Tarifa anterior$0.28
Fora do pico, a partir de 16 de agosto de 2026$0.662.4×
Horários de pico, a partir de 16 de agosto de 2026$1.324.7×

O salto de 4,7 vezes no preço de pico da DeepSeek diz aos compradores quanto custava a capacidade escassa do V4-Flash em agosto de 2026. Um teste de aceitação auditável diz a eles quanto o trabalho custou após tentativas repetidas, falhas de ferramentas e revisão. O medidor de tokens registra cada chamada; o contrato decide se essas chamadas compraram um trabalho concluído.