Em 31 de julho de 2026, a Artificial Analysis atribuiu 50 ao V4 Flash da DeepSeek, 10 pontos acima de sua prévia de abril e no mesmo nível do Gemini 3.6 Flash. Ainda assim, em um teste separado da Scale AI e da CAIS, os melhores agentes ganharam $1,810 dos $143,991 disponíveis — cerca de 1.26% do valor econômico.
Principais conclusões
- A Artificial Analysis atribuiu 50 ao DeepSeek V4 Flash em 31 de julho de 2026 — 10 pontos acima de sua prévia de abril, empatado com Gemini 3.6 Flash e um ponto atrás de GPT-5.6 Luna.
- A precisão do V4 Flash no AA-Omniscience permaneceu em 37%, enquanto sua taxa de alucinação reportada caiu 11 pontos percentuais, para 84%.
- O V4 Flash passou de 1,189 para 1,559 Elo no GDPval-AA v2, um ganho de 370 pontos.
- A DeepSeek lançou a API oficial do V4 Flash em beta público em 31 de julho, enquanto V4 Pro e seus modelos de aplicativo e web permaneceram inalterados.
- A DeepSeek precificou o V4 Flash em $0.14 por milhão de tokens de entrada, ante $1.74 do V4 Pro.
O V4 Flash ganhou 10 pontos compostos enquanto sua precisão no AA-Omniscience permaneceu em 37%; sua taxa de alucinação reportada caiu 11 pontos percentuais, para 84%. Nesse benchmark, um comprador que observasse apenas a queda na taxa de alucinação deixaria passar a estabilidade da precisão.
Os dois registros não testam o mesmo sistema: o resultado do Remote Labor Index não é um resultado do V4 Flash e não pode classificar a DeepSeek frente ao Gemini. Os relatórios citados de 31 de julho também não identificam nenhuma empresa que tenha incluído o V4 Flash em sua lista curta por causa de seu 50. A pontuação justifica um teste; não documenta adoção nem confiabilidade em produção.
A pontuação leva a DeepSeek pelo primeiro filtro
O índice de 31 de julho da Artificial Analysis colocou o V4 Flash um ponto atrás do GPT-5.6 Luna. No mesmo dia, a Bloomberg informou que a DeepSeek havia lançado a API oficial do V4 Flash em beta público, destacando capacidades aprimoradas de agentes e resultados de benchmark que superaram o V4 Pro Preview.
O beta público da DeepSeek deu aos desenvolvedores acesso ao modelo por trás do novo ranking. Uma equipe de compras ainda precisa carregar seus próprios documentos, conectar suas próprias ferramentas, aplicar suas permissões e definir suas tolerâncias a erros.
Laboratórios, desenvolvedores e compradores podem usar o mesmo número para decisões diferentes. A DeepSeek pode alegar paridade, um desenvolvedor pode ordenar APIs e uma equipe de compras pode escolher uma lista curta. A pontuação cumpriu sua função quando a lista curta existe.
O ganho da DeepSeek separa precisão de alucinação
A DeepSeek manteve para o V4 Flash a arquitetura e o tamanho do modelo de prévia. Lançou a atualização por sua API, enquanto V4 Pro, seu aplicativo e seu modelo web permaneceram inalterados. Compradores devem registrar o endpoint e a versão exatos que testam; o resultado da API Flash se aplica a essa interface.
A Artificial Analysis introduziu o AA-Omniscience em novembro de 2025 para testar conhecimento e alucinação em mais de 40 tópicos. Seus campos separados de precisão e alucinação expõem uma distinção que uma pontuação composta pode obscurecer. Uma alegação de calibração exigiria confiança, abstenção e evidências de que a confiança acompanha a correção.
Antes de aprovar um assistente de busca de documentos, uma equipe de compras pode inserir em arquivos internos perguntas respondíveis e não respondíveis. Deve pontuar separadamente respostas corretas, respostas sem suporte, abstenções e citações, e então encaminhar erros de alto risco para revisão humana.
O V4 Flash também passou de 1,189 para 1,559 Elo no GDPval-AA v2, uma avaliação de tarefas reais de trabalho com agentes. Para transformar esse ganho em uma decisão de delegação, um comprador deve reproduzir tarefas representativas de ponta a ponta e contar entregas aceitas, correções humanas, ações inseguras e tempo até a conclusão.
Cada alegação de compra precisa de seu próprio filtro
Uma equipe de compras adquire várias alegações de uma só vez: capacidade, desempenho de fluxo de trabalho, calibração, controle, qualidade de serviço e economia. Cada alegação precisa de sua própria evidência.
| Alegação que está sendo adquirida | Evidência que o comprador deve exigir | Pergunta sobre falha |
|---|---|---|
| Capacidade geral | Índice composto com resultados por componente | Qual capacidade subjacente realmente mudou? |
| Desempenho de fluxo de trabalho | Conclusão repetida de ponta a ponta em um ambiente representativo | O desempenho resiste à variação das tarefas e ao uso de ferramentas? |
| Calibração | Taxas de confiança, erro, abstenção e escalonamento | A confiança acompanha a correção, e o sistema para quando necessário? |
| Segurança e controle | Testes de permissão, logs de ações e limites de aprovação | O agente pode ultrapassar seu escopo autorizado? |
| Qualidade de serviço | Distribuição de latência sob a carga esperada | A capacidade de resposta se mantém fora de uma demonstração? |
| Economia | Custo total por resultado aceito, incluindo novas tentativas e revisão | Quanto custa o trabalho concluído? |
| Adequação de implantação | Plataformas compatíveis, limites de dados e suporte operacional | A organização consegue operar e governar o sistema que testou? |
Implantações de agentes acrescentam falhas de conectores e de aprovação, enquanto mudanças de preço podem inverter uma lista curta definida por benchmark.
Agentes expõem falhas de conectores e aprovação
Um agente combina um modelo com ferramentas, dados externos, orquestração e ações autorizadas por permissões. O modelo propõe; o sistema ao redor decide o que a proposta pode ler, alterar, gastar ou enviar.
O Remote Labor Index da Scale AI e da CAIS testou agentes em tarefas freelance de valor econômico, incluindo design, edição de vídeo, desenvolvimento de jogos e trabalho administrativo.
Essa proporção mede o valor econômico capturado, não a parcela de tarefas concluídas. O índice não informa que 98.74% das tarefas falharam, e não testou o V4 Flash. Ele alerta contra traduzir qualquer pontuação composta de modelo em um percentual de trabalho concluído.
Uma equipe de compras deve executar a mesma tarefa pelo modelo, conector, fonte de dados, política de orquestração e caminho de aprovação humana. Deve registrar retornos ambíguos de ferramentas, permissões negadas, novas tentativas e escalonamentos para verificar se o agente consegue se recuperar sem ultrapassar seu escopo.
Revisores devem registrar correções, preservar uma trilha de auditoria e identificar quem pode aprovar ações consequentes. Quando um agente pode agir, compradores precisam verificar o controle separadamente da qualidade do modelo.
Uma vantagem de um ponto pode perder no custo
A DeepSeek precificou o V4 Flash em $0.14 por milhão de tokens de entrada e o V4 Pro em $1.74. Um comprador ainda precisa considerar tokens de saída, novas tentativas, chamadas de ferramentas e revisão humana.
Em 30 de julho, a Axios informou que a OpenAI cortou o preço do GPT-5.6 Luna em cerca de 80% e do GPT-5.6 Terra em 20% após melhorar a eficiência de atendimento. No dia seguinte, a Artificial Analysis colocou Luna um ponto de índice à frente do V4 Flash. Luna manteve essa vantagem estreita após uma grande mudança de preço.
Um comprador pode usar custos menores de atendimento para mais tentativas, contextos maiores ou implantação mais ampla. Equipes que trabalham de forma interativa também precisam de medições de latência sob a carga esperada, porque uma resposta lenta pode paralisar um fluxo de trabalho que, de outra forma, seria econômico.
Uma equipe de compras deve dividir o gasto total — incluindo tokens de saída, novas tentativas, chamadas de ferramentas e revisão — pelos resultados aceitos. Esse cálculo pode favorecer um modelo que perde no índice público se ele concluir mais trabalho dentro do orçamento e do limite de tempo de resposta do comprador.
Perguntas frequentes
Quando o DeepSeek V4 Flash deixará o beta público?
As evidências citadas não indicam uma data de disponibilidade geral. Compradores precisariam perguntar à DeepSeek sobre o cronograma de lançamento, os termos de suporte e se os endpoints podem mudar durante o beta.
Quais componentes de benchmark produziram o ganho composto de 10 pontos do V4 Flash?
O texto não fornece essa decomposição. A precisão estável de 37% no AA-Omniscience mostra que o aumento composto não pode, por si só, estabelecer uma melhora de precisão.
O V4 Flash tem resultados publicados de calibração ou abstenção?
Nenhum é reportado aqui. Os números disponíveis cobrem precisão e alucinação, não se a confiança acompanha a correção ou se o modelo se abstém adequadamente.
Qual é o custo total do V4 Flash após tokens de saída e operações de agentes?
A taxa citada de $0.14 cobre apenas um milhão de tokens de entrada. Não é fornecido um valor completo para tokens de saída, novas tentativas, chamadas de ferramentas, revisão humana ou custo por resultado aceito.
Qual pontuação de benchmark é alta o bastante para aprovação em produção?
Nenhum corte universal é estabelecido pelas evidências. Um limite para produção dependeria da precisão exigida pelo comprador, dos controles de risco, da latência, do orçamento e da tolerância à revisão humana.
Em 31 de julho, o 50 colocou o V4 Flash ao lado do Gemini em um índice público. O resultado de $1,810 do Remote Labor Index, de sistemas diferentes em um teste diferente, não rebaixa a DeepSeek; ele delimita a alegação que o índice não pode fazer. O 50 pode levar o V4 Flash a um teste. Só trabalho aceito pode levá-lo adiante.