El 31 de julio de 2026, Artificial Analysis calificó a DeepSeek V4 Flash con 50, 10 puntos por encima de su versión preliminar de abril y al nivel de Gemini 3.6 Flash. Sin embargo, en una prueba separada de Scale AI y CAIS, los mejores agentes obtuvieron $1,810 de los $143,991 disponibles: cerca de 1.26% del valor económico.
Puntos clave
- Artificial Analysis calificó a DeepSeek V4 Flash con 50 el 31 de julio de 2026: 10 puntos por encima de su versión preliminar de abril, empatado con Gemini 3.6 Flash y un punto detrás de GPT-5.6 Luna.
- La precisión de AA-Omniscience de V4 Flash se mantuvo en 37%, mientras su tasa de alucinación reportada cayó 11 puntos porcentuales, a 84%.
- V4 Flash pasó de 1,189 a 1,559 Elo en GDPval-AA v2, una mejora de 370 puntos.
- DeepSeek lanzó la API oficial de V4 Flash en beta pública el 31 de julio, mientras V4 Pro y sus modelos de app y web se mantuvieron sin cambios.
- DeepSeek fijó el precio de V4 Flash en $0.14 por millón de tokens de entrada, frente a $1.74 para V4 Pro.
V4 Flash ganó 10 puntos compuestos mientras su precisión de AA-Omniscience se mantuvo en 37%; su tasa de alucinación reportada cayó 11 puntos porcentuales, a 84%. En ese benchmark, un comprador que solo observe la caída en la tasa de alucinación no verá que la precisión se mantuvo sin cambios.
Los dos registros no prueban el mismo sistema: el resultado del Remote Labor Index no es un resultado de V4 Flash y no puede clasificar a DeepSeek frente a Gemini. Los reportes citados del 31 de julio tampoco identifican a alguna empresa que haya incluido a V4 Flash en una lista corta por su 50. La calificación respalda una prueba; no documenta adopción ni confiabilidad en producción.
La calificación hace que DeepSeek pase el primer filtro
El índice de Artificial Analysis del 31 de julio ubicó a V4 Flash un punto detrás de GPT-5.6 Luna. Bloomberg reportó el mismo día que DeepSeek había lanzado la API oficial de V4 Flash en beta pública, destacando capacidades mejoradas para agentes y resultados de benchmarks que superaron a V4 Pro Preview.
La beta pública de DeepSeek dio a los desarrolladores acceso al modelo detrás de la nueva clasificación. Un equipo de adquisiciones todavía debe cargar sus propios documentos, conectar sus propias herramientas, hacer cumplir sus permisos y aplicar sus tolerancias a errores.
Laboratorios, desarrolladores y compradores pueden reutilizar el mismo número para decisiones distintas. DeepSeek puede afirmar paridad, un desarrollador puede ordenar APIs y un equipo de adquisiciones puede elegir una lista corta. La calificación ya cumplió su función una vez que existe la lista corta.
La mejora de DeepSeek separa la precisión de la alucinación
DeepSeek mantuvo la arquitectura y el tamaño del modelo preliminar para V4 Flash. Lanzó la actualización mediante su API, mientras V4 Pro, su app y su modelo web se mantuvieron sin cambios. Los compradores deben registrar el endpoint y la versión exactos que prueban; el resultado de la API Flash aplica a esa interfaz.
Artificial Analysis introdujo AA-Omniscience en noviembre de 2025 para probar conocimiento y alucinación en más de 40 temas. Sus campos separados de precisión y alucinación exponen una distinción que una calificación compuesta puede ocultar. Una afirmación de calibración requeriría confianza, abstención y evidencia de que la confianza sigue a la corrección.
Antes de aprobar un asistente de búsqueda documental, un equipo de adquisiciones puede sembrar archivos internos con preguntas respondibles e imposibles de responder. Debe calificar por separado las respuestas correctas, las respuestas sin respaldo, las abstenciones y las citas, y luego enviar los errores de alto riesgo a revisión humana.
V4 Flash también pasó de 1,189 a 1,559 Elo en GDPval-AA v2, una evaluación de tareas reales de trabajo agéntico. Para convertir esa mejora en una decisión de delegación, un comprador debe repetir trabajos representativos de principio a fin y contar resultados aceptados, correcciones humanas, acciones inseguras y tiempo de finalización.
Cada afirmación de compra necesita su propio filtro
Un equipo de adquisiciones compra varias afirmaciones a la vez: capacidad, desempeño del flujo de trabajo, calibración, control, calidad de servicio y economía. Cada afirmación necesita su propia evidencia.
| Afirmación que se compra | Evidencia que el comprador debe exigir | Pregunta sobre fallas |
|---|---|---|
| Capacidad general | Índice compuesto con resultados por componente | ¿Qué capacidad subyacente realmente cambió? |
| Desempeño del flujo de trabajo | Finalización repetida de principio a fin en un entorno representativo | ¿El desempeño resiste la variación de tareas y el uso de herramientas? |
| Calibración | Tasas de confianza, error, abstención y escalamiento | ¿La confianza sigue a la corrección y el sistema se detiene cuando es necesario? |
| Seguridad y control | Pruebas de permisos, registros de acciones y límites de aprobación | ¿Puede el agente exceder su alcance autorizado? |
| Calidad de servicio | Distribución de latencia bajo la carga esperada | ¿La capacidad de respuesta se mantiene fuera de una demostración? |
| Economía | Costo total por resultado aceptado, incluidos reintentos y revisión | ¿Cuánto cuesta el trabajo terminado? |
| Ajuste de implementación | Plataformas compatibles, límites de datos y soporte operativo | ¿Puede la organización operar y gobernar el sistema que probó? |
Las implementaciones de agentes agregan fallas de conectores y aprobaciones, mientras los precios cambiantes pueden revertir una lista corta liderada por benchmarks.
Los agentes exponen fallas de conectores y aprobaciones
Un agente combina un modelo con herramientas, datos externos, orquestación y acciones con permisos. El modelo propone; el sistema circundante decide qué puede leer, cambiar, gastar o enviar la propuesta.
El Remote Labor Index de Scale AI y CAIS probó agentes en tareas freelance de valor económico, incluidas diseño, edición de video, desarrollo de videojuegos y trabajo administrativo.
Esa proporción mide el valor económico capturado, no la proporción de tareas completadas. El índice no reporta que 98.74% de las tareas fallaron, y no probó V4 Flash. Advierte contra traducir cualquier calificación compuesta de un modelo en un porcentaje de trabajo terminado.
Un equipo de adquisiciones debe ejecutar la misma tarea mediante el modelo, conector, fuente de datos, política de orquestación y ruta de aprobación humana. Debe registrar respuestas ambiguas de herramientas, permisos denegados, reintentos y escalaciones para ver si el agente puede recuperarse sin exceder su alcance.
Los revisores deben registrar correcciones, conservar una pista de auditoría e identificar quién puede aprobar acciones con consecuencias. Una vez que un agente puede actuar, los compradores deben verificar el control por separado de la calidad del modelo.
Una ventaja de un punto puede perder por costo
DeepSeek fijó el precio de V4 Flash en $0.14 por millón de tokens de entrada y el de V4 Pro en $1.74. Un comprador todavía debe considerar tokens de salida, reintentos, llamadas a herramientas y revisión humana.
El 30 de julio, Axios reportó que OpenAI redujo el precio de GPT-5.6 Luna en cerca de 80% y el de GPT-5.6 Terra en 20% tras mejorar la eficiencia del servicio. Al día siguiente, Artificial Analysis ubicó a Luna un punto de índice por encima de V4 Flash. Luna mantuvo esa estrecha ventaja después de un gran cambio de precio.
Un comprador puede destinar menores costos de servicio a más intentos, contextos más grandes o una implementación más amplia. Los equipos interactivos también necesitan mediciones de latencia bajo la carga esperada porque una respuesta lenta puede detener un flujo de trabajo que de otro modo sería económico.
Un equipo de adquisiciones debe dividir el gasto total —incluidos tokens de salida, reintentos, llamadas a herramientas y revisión— entre los resultados aceptados. Ese cálculo puede favorecer a un modelo que pierde el índice público si completa más trabajo dentro del presupuesto y el límite de tiempo de respuesta del comprador.
Preguntas frecuentes
¿Cuándo saldrá DeepSeek V4 Flash de la beta pública?
La evidencia citada no da una fecha de disponibilidad general. Los compradores tendrían que preguntar a DeepSeek sobre el calendario de lanzamiento, los términos de soporte y si los endpoints podrían cambiar durante la beta.
¿Qué componentes del benchmark produjeron la mejora compuesta de 10 puntos de V4 Flash?
La pieza no proporciona ese desglose. La precisión plana de 37% de AA-Omniscience muestra que el aumento compuesto no puede por sí solo establecer una mejora de precisión.
¿V4 Flash tiene resultados publicados de calibración o abstención?
Aquí no se reporta ninguno. Las cifras disponibles cubren precisión y alucinación, no si la confianza sigue a la corrección ni si el modelo se abstiene de forma adecuada.
¿Cuál es el costo total de V4 Flash después de los tokens de salida y las operaciones de agentes?
La tarifa citada de $0.14 cubre solo un millón de tokens de entrada. No se proporciona una cifra completa para tokens de salida, reintentos, llamadas a herramientas, revisión humana o costo por resultado aceptado.
¿Qué calificación de benchmark es suficientemente alta para aprobar producción?
La evidencia no establece un umbral universal. Un umbral de producción dependería de la precisión requerida por el comprador, los controles de riesgo, la latencia, el presupuesto y la tolerancia a la revisión humana.
El 31 de julio, el 50 colocó a V4 Flash junto a Gemini en un índice público. El resultado de $1,810 del Remote Labor Index, obtenido de sistemas distintos en una prueba diferente, no rebaja a DeepSeek; marca la afirmación que el índice no puede hacer. El 50 puede llevar a V4 Flash a una prueba. Solo el trabajo aceptado puede llevarlo fuera de ella.