En agosto de 2026, DeepSeek elevó 4.7 veces el precio de salida de V4-Flash en horas pico, de $0.28 a $1.32 por millón de tokens. La misma salida costaba $0.66 fuera de horas pico, aunque el modelo y la unidad de facturación no cambiaron. Para los compradores que implementan agentes, el horario dejó al descubierto la pregunta que el medidor de tokens no puede responder. ¿Cuánto costó el trabajo terminado?
Puntos clave
- DeepSeek dijo que el precio de salida de V4-Flash cambiaría el 16 de agosto de 2026 a $1.32 por millón de tokens en horas pico y $0.66 fuera de horas pico, frente a los $0.28 anteriores.
- En mayo de 2026, DeepSeek hizo permanente un descuento de 75% en la API de V4-Pro, fijando los precios en $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida.
- DeepSeek lanzó DeepSeek Harness en vista previa para desarrolladores bajo la licencia MIT el 14 de agosto de 2026.
- Artificial Analysis estimó el costo de V4-Flash en $0.03 por prueba de benchmark, frente a $0.86 para Kimi K3, $1.86 para GPT-5.6 Sol y $3.15 para Claude Fable 5.
DeepSeek vuelve esa pregunta especialmente visible porque la empresa recorrió toda la secuencia comercial de marzo de 2025 a agosto de 2026: una economía de modelo espectacular, competencia en benchmarks, descuentos agresivos, herramientas para agentes y precios sensibles a la capacidad. En marzo de 2025, DeepSeek reportó un margen teórico de 545% para la inferencia de V3 y R1 frente a las ventas durante un periodo de 24 horas. Para agosto de 2026, la empresa vendía esfuerzo de razonamiento diferenciado, lanzaba un harness modular y cobraba distintas tarifas por token según el horario.
DeepSeek apareció en 4 artículos en 2024Q4 y en 133 en 2025Q1. A lo largo de los periodos de comparación 2024–2026, su encuadre como investigación cayó de 80.0% a 46.9%, mientras que el encuadre de financiamiento subió 31.2 puntos porcentuales. La cobertura trató cada vez más a DeepSeek como un proveedor cuyos precios, márgenes y stack para desarrolladores requerían interpretación.
Los rankings ganaron porque hicieron comparables a modelos distintos
Los proveedores de modelos necesitaban un lenguaje común antes de que los compradores pudieran comparar productos. Los benchmarks aportaron una coordenada de capacidad, mientras que las listas de precios de API aportaron una coordenada de costo. Ambos números circulan fácilmente por comités de compra, materiales para inversionistas y anuncios de producto, de maneras en que un flujo de trabajo completo no puede hacerlo.
DeepSeek usó exactamente esa gramática cuando posicionó V4-Pro frente a Kimi K3 de Moonshot AI en benchmarks, mientras listaba V4-Pro en $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida. La comparación permitía a un comprador ver capacidad y precio nominal en una sola línea. No exigía que DeepSeek o Moonshot AI definieran un flujo de trabajo de producción común, un estándar de aceptación o una política de escalamiento.
Las evaluaciones compuestas todavía pueden revelar avances genuinos. DeepSeek V4-Flash obtuvo 50 en el Artificial Analysis Intelligence Index, igualando a Gemini 3.6 Flash y sumando 10 puntos frente a su vista previa de abril. La misma evaluación reportó una caída de 11 puntos en la tasa de alucinaciones de V4-Flash, a 84%, mientras que la precisión se mantuvo en 37%. Las medidas de confiabilidad exponen diferencias que una sola puntuación agregada puede ocultar.
Los diseñadores de benchmarks también están haciendo que las pruebas sean más difíciles de superar solo mediante recuperación de memoria. La ARC Prize Foundation diseñó ARC-AGI-3 en torno a escenarios novedosos, similares a videojuegos, que prueban el razonamiento sobre la marcha en vez de la recuperación de memoria. El resultado de DeepSeek en GDPval-AA v2 subió de 1189 a 1559 en una evaluación planteada en torno a tareas reales de trabajo agéntico. Ambos esfuerzos reducen la brecha entre la evaluación del modelo y el comportamiento implementado.
Incluso las pruebas más difíciles dejan intacta la brecha entre evaluación y compras. ARC-AGI-3 pregunta si un modelo puede razonar en un entorno novedoso. GDPval-AA pregunta cómo maneja un conjunto estandarizado de tareas similares al trabajo. Un comprador aún tiene que especificar qué respuesta cuenta como aceptable, qué error exige escalamiento y cuánta revisión merece una decisión con consecuencias.
Una vez que los equipos de compras convierten una puntuación en un objetivo, los laboratorios optimizan racionalmente los insumos de esa puntuación. Esa respuesta no requiere engaño. Las decisiones de entrenamiento, los presupuestos de razonamiento y las configuraciones de producto pueden mejorar un resultado medido sin mejorar cada flujo de trabajo del cliente en la misma medida. El benchmark sigue siendo evidencia sobre el modelo; el comprador aporta el juicio sobre el trabajo.
Los precios dinámicos convierten el token en una afirmación sobre capacidad
Los cambios de precio de DeepSeek expusieron qué contiene una tarifa por token. En mayo de 2026, la empresa hizo permanente un descuento de 75% en la API de V4-Pro, fijando las tarifas en $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida. En agosto, DeepSeek introdujo precios de horas pico y fuera de horas pico para V4-Flash.
DeepSeek cobró el doble por la salida de V4-Flash en horas pico que fuera de horas pico. La regla de precios asignaba capacidad de servicio escasa y alentaba a los compradores a alejar las cargas de trabajo flexibles de los periodos de mayor demanda. Moldeaba el comportamiento del cliente en vez de medir la inteligencia del modelo.
Las mejoras de infraestructura pueden mover la economía del proveedor con la misma rapidez. Según informes, ingenieros de OpenAI encontraron una forma de reducir a más de la mitad el costo de inferencia en junio de 2026. Un proveedor puede conservar esa ganancia como margen, trasladarla en una tarifa más baja, destinarla a un mayor presupuesto de razonamiento o usarla para absorber el crecimiento de la demanda. La lista pública de precios por sí sola no revela cuál decisión tomó el proveedor.
La economía de los tokens todavía restringe la implementación. Una aplicación de alto volumen no puede ignorar el gasto en modelos, y la latencia determina si un flujo de trabajo puede operar de forma interactiva. El mercado de inferencia más amplio usa precio y latencia para dividir las cargas de trabajo entre modelos, niveles de servicio y franjas horarias. Compras debe conservar esas mediciones porque identifican restricciones operativas reales.
La tarifa por token cubre solo la capacidad del modelo. Si un agente hace tres intentos, llama dos veces a la herramienta equivocada y envía el caso a un revisor humano, el proveedor factura cada token generado mientras el cliente paga por una finalización y por la ruta fallida.
El harness se ha vuelto parte del producto
Los agentes de IA trasladan el desempeño al ciclo que rodea al modelo. Un agente necesita un adaptador de modelo, un registro de herramientas, historial de sesión y un ciclo de ejecución antes de poder actuar en un flujo de trabajo. Los operadores de producción luego agregan permisos, observabilidad, reintentos, alternativas y revisión. Cada elemento puede determinar si la respuesta del modelo llega a un estado aceptado.
DeepSeek reconoció directamente esa arquitectura al lanzar DeepSeek Harness bajo la licencia MIT en vista previa para desarrolladores. El proyecto usa un diseño basado en plugins en el que los desarrolladores pueden intercambiar componentes en lugar de tratar el endpoint del modelo como toda la aplicación. DeepSeek también dio a V4-Pro esfuerzo de razonamiento configurable para tareas simples, flujos diarios de agentes y tareas complejas.
El diseño modular cambia la forma en que los desarrolladores comparan modelos. Un equipo puede mantener relativamente estables las herramientas, el manejo del estado y la lógica de aceptación mientras reemplaza el adaptador del modelo. Otro equipo puede mantener estable el modelo mientras prueba un ciclo de agente o una política de revisión distintos. El harness convierte variables antes entrelazadas en componentes separables.
Con esos componentes separados, los desarrolladores pueden atribuir un flujo de trabajo fallido al modelo, la interfaz de herramientas, la política de orquestación o la regla de aceptación, en vez de asignar cada falla a la “calidad de la IA”. También pueden gastar de forma selectiva: un modelo barato puede enrutar pasos rutinarios, mientras una configuración de razonamiento más costosa maneja las excepciones.
DeepSeek ocupa ambos lados de este stack emergente. V4-Pro y V4-Flash aportan capacidad de modelo; DeepSeek Harness organiza herramientas y estado alrededor de esa capacidad. Kimi K3 de Moonshot AI aporta un competidor en benchmarks y precios. OpenAI y Anthropic aportan endpoints de modelos alternativos con sus propias estructuras de costos. El desarrollador decide cómo esos bloques se convierten en un sistema funcional.
Los proveedores de modelos tienen un incentivo para expandirse hacia la orquestación porque el harness controla el enrutamiento, la política de reintentos y la selección de modelos. Los desarrolladores tienen el incentivo opuesto de mantener el harness modular porque la portabilidad preserva su poder de negociación. Los proveedores buscan control sobre la demanda, mientras que los clientes buscan control sobre el cambio de proveedor.
Los márgenes de inferencia deciden quién asume el riesgo de ejecución
OpenAI y Anthropic dijeron a los inversionistas que los costos de inferencia superaban la mitad de los ingresos. Esos costos dan a ambas empresas una razón sólida para mejorar la eficiencia del servicio, segmentar la capacidad y medir el uso con precisión. El margen teórico de 545% de DeepSeek apunta en la otra dirección, pero su cálculo cubría la inferencia del modelo frente a ventas durante un solo periodo de 24 horas, muy lejos del flujo de trabajo completo de un cliente.
Las empresas usan denominadores distintos. Un proveedor compara el costo de servicio con los ingresos de API. Un cliente compara el costo total del flujo de trabajo con el trabajo aceptado. Las llamadas repetidas elevan los costos del cliente mientras se suman a los ingresos del proveedor.
Las empresas han usado principalmente agentes para mejorar la eficiencia y reducir costos, en lugar de crear crecimiento en ingresos, según una revisión de la adopción empresarial de agentes. Ese objetivo vuelve costosa la variación en la ejecución. Un experimento de ventas puede tolerar un beneficio incierto; un programa de eficiencia tiene que superar los costos de mano de obra, software y procesos que se supone debe reemplazar.
Bajo contratos por token, los clientes asumen la variación de ejecución. Pagan por reintentos, consumen tiempo del personal durante las excepciones y verifican resultados cuando los errores tienen consecuencias. Las garantías de resultados trasladarían parte de esa variación al proveedor, dándole un incentivo para optimizar toda la ruta hacia la aceptación en vez de la primera respuesta.
Los proveedores pueden poner precio a ese riesgo cobrando más por un resultado verificado, limitando el alcance del flujo de trabajo, exigiendo criterios de aceptación verificables por máquina o excluyendo casos que demandan juicio organizacional. Los compradores pueden conservar la facturación por token para trabajo exploratorio mientras usan términos basados en finalización para procesos repetitivos y acotados. La parte que asegura el fracaso reflejará ese riesgo en los términos.
Un registro de finalizaciones verificadas hace visibles financieramente los errores
Artificial Analysis estimó que V4-Flash costaba $0.03 por prueba de benchmark, frente a $0.86 para Kimi K3, $1.86 para GPT-5.6 Sol y $3.15 para Claude Fable 5. Esa comparación ayuda a un comprador a identificar modelos que vale la pena probar. Un equipo de compras no debería descartar una diferencia de costo de 105 veces entre V4-Flash y Claude Fable 5 solo porque la comparación usa un proxy.
Los compradores deben llevar el cálculo hasta el flujo de trabajo implementado. Pueden dividir todas las llamadas al modelo, cargos por herramientas, infraestructura de orquestación, intentos fallidos y mano de obra de revisión entre el número de resultados que cumplen un estándar de aceptación definido. El stack de compras de modelos resultante conserva los datos de benchmarks y tokens, pero asigna cada número a la capa que describe.
| Capa | Medida del comprador | Costo o riesgo expuesto |
|---|---|---|
| Modelo | Calidad del benchmark relevante para la tarea y gravedad del error | Brechas de capacidad antes de la implementación |
| Uso | Tokens de entrada y salida por finalización aceptada | Gasto en modelos, incluidas las llamadas repetidas |
| Ejecución | Tasa de reintentos, tasa de fallas en llamadas a herramientas y frecuencia de alternativas | Desperdicio de orquestación y costo de API externa |
| Tiempo | Tiempo mediano y de cola hasta la finalización | Formación de colas, exposición a capacidad pico y demora para el usuario |
| Escalamiento | Frecuencia de revisión humana y tiempo de gestión | Costo laboral y cuellos de botella operativos |
| Aceptación | Finalizaciones verificadas divididas entre tareas intentadas | Resultado utilizable tras el juicio organizacional |
Los equipos de compras necesitan reglas de aceptación específicas para cada carga de trabajo. Un modelo puede predecir la resolución probable de un caso de soporte; la empresa todavía decide qué resolución falsa genera un daño inaceptable. Un agente de programación puede generar un parche; el propietario del repositorio todavía decide qué pruebas, revisiones y verificaciones de seguridad constituyen una finalización.
Los compradores deben incluir la verificación humana en la unidad de costo para flujos de trabajo con consecuencias. Deben registrar los minutos de los revisores, la frecuencia de escalamiento y el costo de corregir errores aceptados. Los proveedores entonces pueden competir reduciendo esas cargas, en lugar de limitarse a reducir el precio de la llamada al modelo que las precedió.
La aceptación auditable crea poder para el comprador
Los compradores pueden usar la finalización verificada solo cuando definen “verificada” antes de que llegue la factura. Las tareas de software acotadas pueden usar pruebas y reglas de revisión. Los flujos de trabajo de servicio al cliente pueden usar criterios de resolución, límites de escalamiento y auditorías por muestreo. Los procesos con consecuencias legales, de seguridad o financieras requieren un juicio humano más estricto y deben incluir explícitamente su costo.
Los proveedores conservan ventaja cuando los clientes no pueden mover flujos de trabajo, inspeccionar fallas o reproducir pruebas de aceptación. Los clientes ganan ventaja cuando los harnesses modulares les permiten sustituir modelos, los registros les permiten atribuir errores y los contratos vinculan el pago con resultados observables. La competencia entre proveedores importa, pero la portabilidad y la auditabilidad determinan si los clientes pueden aprovecharla.
Preguntas frecuentes
¿Cuándo estaba programado que comenzaran los precios de V4-Flash en horas pico y fuera de horas pico de DeepSeek?
La empresa dijo que los nuevos precios dinámicos comenzarían el 16 de agosto de 2026. Las tarifas de salida anunciadas fueron de $1.32 por millón de tokens en horas pico y $0.66 fuera de horas pico.
¿Qué horas cuentan como “pico” para los precios de V4-Flash?
El anuncio disponible identifica las tarifas de horas pico y fuera de horas pico, pero no especifica las horas, la zona horaria ni el alcance regional de esos periodos. Los compradores necesitarían ese detalle operativo de DeepSeek antes de programar cargas de trabajo flexibles en torno a la diferencia de tarifa.
¿El cambio anunciado de precio dinámico de V4-Flash también aplica a los tokens de entrada?
Las cifras divulgadas de $1.32 en horas pico y $0.66 fuera de horas pico son específicamente para tokens de salida. Antes del aumento, V4-Flash se listaba en $0.14 por millón de tokens de entrada y $0.28 por millón de tokens de salida; la evidencia no indica una tarifa revisada para los tokens de entrada.
¿En qué difiere la tarifa pública de API de V4-Pro de la nueva tarifa pico de V4-Flash?
V4-Pro se listaba en $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida. La cifra de $1.32 de V4-Flash es un precio de salida en horas pico, por lo que es superior a la tarifa de salida declarada para V4-Pro pese a referirse a un modelo y una condición de servicio distintos.
Cambio en el precio de salida de V4-Flash
| Periodo o condición | Precio de salida por millón de tokens | Cambio frente a la tarifa anterior |
|---|---|---|
| Tarifa anterior | $0.28 | — |
| Fuera de horas pico, a partir del 16 de agosto de 2026 | $0.66 | 2.4× |
| Horas pico, a partir del 16 de agosto de 2026 | $1.32 | 4.7× |
El salto de 4.7 veces en el precio pico de DeepSeek les dice a los compradores cuánto costaba la capacidad escasa de V4-Flash en agosto de 2026. Una prueba de aceptación auditable les dice cuánto costó el trabajo después de reintentos, fallas de herramientas y revisión. El medidor de tokens registra cada llamada; el contrato decide si esas llamadas compraron un trabajo terminado.