DeepSeek elevó el precio de salida de V4-Flash de $0.28 por millón de tokens a $1.32 en horas de mayor demanda, mientras que fuera de ellas cobra $0.66. El modelo no se vuelve más inteligente según la hora; lo que se satura es la fila de solicitudes. Al ponerle horario al precio de un token, DeepSeek dejó al descubierto qué están comprando cada vez más sus clientes.

Puntos clave

  • El precio de salida de V4-Flash de DeepSeek sube de $0.66 por millón de tokens fuera de las horas de mayor demanda a $1.32 durante ellas, lo que muestra que el precio marginal depende de la congestión y del momento de entrega, no de un cambio en la inteligencia del modelo.
  • Los pesos abiertos y las arquitecturas más baratas convierten el acceso a los modelos en un producto indiferenciado, pero no ofrecen capacidad de cómputo reservada, latencia predecible, capacidad para absorber picos ni confiabilidad en producción.
  • Los programadores de tareas de los agentes pueden reducir costos al aplazar cargas de trabajo flexibles, cambiar de modelo o pagar tarifas más altas solo cuando sea indispensable terminar de inmediato.
  • A medida que se abarata el acceso a los modelos, el valor comercial y el riesgo de infraestructura se desplazan hacia el alojamiento, la coordinación, la contratación de energía, la planeación de capacidad y la prestación confiable del servicio.
  • Las pérdidas reportadas por DeepSeek y su propuesta de captar capital para financiar infraestructura muestran que un mayor uso puede generar enormes necesidades de financiamiento incluso cuando los ingresos crecen con rapidez.

Un archivo de pesos —o el acceso a un modelo capaz— representa una proporción cada vez menor del costo total de usarlo en producción. El proveedor debe ofrecer capacidad de procesamiento cuando los clientes la necesiten, absorber picos sin fallar, mantener la latencia bajo carga y conservar suficiente capacidad ociosa para cumplir su promesa de disponibilidad. El mismo modelo puede ser barato aunque el servicio inmediato no lo sea.

Esa separación cambia lo que venden los proveedores. Antes, el precio de los tokens funcionaba principalmente como una tarifa por capacidad: el modelo más inteligente costaba más porque la inteligencia se consideraba el recurso escaso. En cambio, las tarifas de DeepSeek cobran por usar, en un momento determinado, un sistema de prestación con capacidad limitada.

Los pesos abiertos abaratan el modelo, no la promesa de servicio

Los desarrolladores de modelos están ampliando desde varios frentes la oferta de inteligencia aprovechable. DeepSeek lanzó V4-Pro a $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida. Tencent presentó un modelo abierto de 770 mil millones de parámetros con una ventana de contexto de un millón de tokens.

Quarterly coverage volume: DeepSeekCoverage of DeepSeek by quarter, 2024 Q4 to 2026 Q3: from 4 to 62 articles per quarter, peaking at 133.peak 133622024 Q42026 Q3
Quarterly coverage · DeepSeek · 2024 Q4–2026 Q3 · current quarter projected

Todos los proveedores tienen el mismo incentivo. Los pesos abiertos amplían la distribución, atraen desarrolladores y reducen el riesgo de quedar excluidos de un ecosistema organizado alrededor de agentes propietarios. La caída de los costos de arquitectura y acceso hace que distintos proveedores, por separado, encuentren conveniente publicar sus modelos.

Publicar los pesos elimina una sola restricción. No ofrece un punto de acceso administrado, no reserva aceleradores para un pico de tráfico ni garantiza que una solicitud de un millón de tokens termine a tiempo. Esas funciones corresponden al sistema completo de prestación, donde la confiabilidad, la latencia, el nivel de utilización y los costos recurrentes de producción importan tanto como la calidad medida en pruebas comparativas.

Los desarrolladores pueden trasladar parte de la inferencia fuera de las interfaces centralizadas mediante modelos ejecutados en los dispositivos y pesos alojados por cuenta propia. Esto funciona para los equipos cuyas cargas caben en el equipo disponible y que pueden asumir la operación. El servicio administrado conserva su valor para quienes prefieren pagar a un tercero para mantener el sistema en funcionamiento.

El horario ahora equilibra el mercado de tokens

Nada cambia dentro de V4-Flash cuando comienza o termina el horario de mayor demanda. Los clientes simplemente pagan más cuando sus solicitudes compiten por la misma capacidad de servicio.

Precio de salida de V4-Flash por 1M de tokens en horas de mayor demanda
Precio de salida de V4-Flash por 1M de tokens fuera de las horas de mayor demanda

DeepSeek está aplicando la economía de la capacidad de cómputo mediante una interfaz de programación. En las horas de mayor demanda, una solicitud ocupa capacidad que podría atender otra. Fuera de esas horas, la misma solicitud ayuda a generar ingresos con infraestructura que, de otro modo, estaría subutilizada.

DeepSeek también cobra a los usuarios flexibles la mitad de la tarifa máxima, lo que contradice la idea de que los precios dinámicos no son más que inflación presentada en un tablero más atractivo. Su esquema encarece la urgencia y abarata la espera: hace visible la congestión y, al mismo tiempo, da a la demanda flexible un incentivo para cambiar de horario.

OpenAI y Anthropic han reportado costos de inferencia superiores a la mitad de sus ingresos. El entrenamiento crea el modelo, pero la inferencia produce una y otra vez aquello que compran los clientes. Los márgenes del sector dejan de parecerse a los del software cuando cada unidad adicional de ingresos exige otro recorrido por aceleradores, memoria, energía y redes.

Según los reportes, los ingenieros de OpenAI encontraron un método para reducir el costo de inferencia a menos de la mitad. Su adopción generalizada podría aliviar la presión sobre las tarifas por token y mejorar los márgenes en todos los niveles de utilización.

Sin embargo, incluso un sistema de servicio más barato puede saturarse cuando llegan demasiadas solicitudes al mismo tiempo. La eficiencia permite realizar más trabajo con la capacidad disponible, mientras que los precios dinámicos alejan de la fila las tareas que pueden esperar.

Los agentes convierten la espera en una herramienta económica

Las tarifas por horario solo funcionan cuando parte de la demanda puede desplazarse. Por lo general, una conversación interactiva no puede esperar, porque quien aguarda una respuesta considera la latencia parte de la calidad del producto. Las cargas de trabajo de los agentes tienen otro patrón de demanda: muchas tareas pueden continuar sin que una persona observe la llegada de cada token.

En la inferencia basada en agentes, la velocidad importa de otra manera cuando no hay una persona participando directamente en el proceso. Una investigación en segundo plano, una revisión de código, un lote de documentos o un proceso multimodal suelen poder intercambiar tiempo de terminación por un menor costo. El programador de tareas decide si ese intercambio es aceptable.

DeepSeek publicó un entorno para agentes con licencia MIT, adaptadores de modelos intercambiables y componentes basados en complementos. Los sistemas modulares de agentes permiten programar la elección del modelo, las herramientas y las reglas de ejecución, en lugar de dejarlas fijas dentro de una interfaz de conversación.

Cuando una capa de ejecución puede evaluar el precio y la urgencia, la capacidad disponible fuera de las horas de mayor demanda se convierte en una característica del producto. Un agente puede enviar una solicitud inmediata a un servicio de mayor precio, aplazar una tarea flexible hasta un horario más barato o trasladarla a otro modelo. La medida relevante pasa a ser el costo por tarea terminada dentro de un límite de latencia, no el precio publicado por token.

El modelo experimental V4-Flash-Vision de DeepSeek factura las imágenes como tokens conforme a las tarifas de V4-Flash. La unidad cobrada ahora abarca la información visual consumida dentro de un proceso ejecutado por agentes, por lo que las reglas de programación inciden en una proporción mayor del trabajo automatizado.

Los agentes llevan a la práctica la división de capacidad del mercado de inferencia. La capacidad general y barata atiende el trabajo flexible, mientras que la capacidad más escasa obtiene un precio adicional de las cargas que exigen respuesta inmediata, latencia predecible o desempeño especializado. El software puede tomar esa decisión de contratación de manera continua.

El acceso barato empuja a los desarrolladores de modelos hacia la infraestructura

Los precios bajos ayudan a los proveedores a ganar distribución, pero por sí solos no financian la investigación ni garantizan el servicio. Las empresas de modelos deben captar suficiente gasto recurrente en inferencia para sostener ambas actividades.

Según los reportes, DeepSeek generó $70.7 millones en ingresos y una pérdida neta de $106 millones durante los primeros siete meses de 2026, aunque sus ingresos llegaron a ser aproximadamente diez veces los registrados en todo 2025. El rápido crecimiento no eliminó la necesidad de financiamiento, porque la expansión del servicio trae consigo costos de producción.

En respuesta, DeepSeek estaría buscando $7.4 mil millones con una valuación de $74 mil millones para financiar investigación y expandirse hacia la infraestructura de cómputo. La inteligencia barata atrae uso; el uso genera una obligación de capacidad; y esa obligación empuja al proveedor a poseer activos de capital.

Moonshot AI ha buscado acuerdos de alojamiento con Microsoft, Amazon y Google para Kimi K3, además de solicitar una participación de hasta 30% de los ingresos. En lugar de financiar por sí sola toda la capa de servicio, Moonshot intenta captar una proporción mayor de los ingresos generados por la infraestructura de sus socios.

Los proveedores de modelos abiertos pueden divulgar una mayor parte del diseño porque el alojamiento, la coordinación, la distribución, la confiabilidad y el acceso a los clientes siguen siendo escasos. Conforme el modelo se vuelve ampliamente accesible, esas capacidades operativas concentran una mayor parte del valor comercial.

Los precios de los tokens condensan el riesgo de infraestructura

Los proveedores que venden tokens asumen exposición a la capacidad de cómputo, energía y redes. OpenAI está contratando a un responsable de operaciones en mercados eléctricos para cubrir el riesgo de su cartera energética de centros de datos, mientras que la Shanghai Futures Exchange estudia contratos de futuros sobre tokens de IA. Ambas iniciativas tratan la demanda de inferencia como un riesgo operativo que puede financiarse y cubrirse.

Los precios dinámicos de las interfaces de programación son la cara minorista de esa estructura. Los clientes ven tarifas para horas de mayor y menor demanda. Los proveedores administran la disponibilidad de equipos, la contratación de electricidad, la utilización y el riesgo de que la demanda comprometida llegue antes de contar con capacidad suficiente. El precio de un token condensa toda esa cadena en una sola cifra.

Los compradores enfrentan entonces tres opciones. Pueden aplazar el trabajo flexible para evitar la congestión, pagar un precio adicional por escasez para recibir servicio inmediato o trasladar la carga a una instalación local o propia y asumir directamente los costos de operación.

Antes de elegir un modelo, el comprador debe clasificar cada carga de trabajo: ¿debe ejecutarse ahora, puede esperar o puede alojarla el equipo? La calidad medida en pruebas comparativas no responde esas preguntas. Las respuestas determinan el monto de la factura y quién asume el riesgo de infraestructura.

El token de DeepSeek que cuesta $1.32 en horas de mayor demanda y el que cuesta $0.66 fuera de ellas contienen la misma inteligencia del modelo. Lo que cambia con la hora es la fila, la utilización y quién asume el riesgo de infraestructura. La competencia en IA se está definiendo alrededor de capacidad programada, financiada y suministrada de manera confiable. El horario pone precio a esa promesa.

El giro de DeepSeek en agosto de 2026: del lanzamiento de modelos al financiamiento de infraestructura

  • 2026-08-21 — DeepSeek presentó un modelo experimental V4 Flash capaz de comprender instrucciones visuales.
  • 2026-08-22 — DeepSeek presentó una versión multimodal experimental de V4 Flash.
  • 2026-08-26 — Fuentes reportaron $70.7 millones en ingresos y una pérdida neta de $106 millones durante los primeros siete meses de 2026; en todo 2025, la pérdida neta habría sido de $139 millones.
  • 2026-08-28 — Según los reportes, DeepSeek se preparaba para captar $7.4 mil millones con una valuación de $74 mil millones y planeaba expandirse hacia la infraestructura de cómputo.

Preguntas frecuentes

¿Por qué la misma salida de V4-Flash cuesta más en horas de mayor demanda?

El modelo no cambia, pero las solicitudes recibidas en esas horas compiten por una capacidad de servicio limitada. DeepSeek cobra $1.32 por millón de tokens de salida en horas de mayor demanda, frente a $0.66 fuera de ellas, con lo que pone precio a la urgencia y la congestión.

¿La IA con pesos abiertos elimina los costos de inferencia?

No. Los pesos abiertos eliminan una restricción de acceso, pero el uso en producción todavía requiere aceleradores, memoria, energía, redes, programación de cargas de trabajo y confiabilidad operativa.

¿Qué cargas de trabajo de IA pueden aprovechar mejor las tarifas fuera de las horas de mayor demanda?

Las tareas aplazables de los agentes, como la investigación en segundo plano, la validación de código, el procesamiento de documentos y los lotes multimodales, pueden aceptar un mayor tiempo de terminación a cambio de un menor costo. La conversación interactiva suele tener menos flexibilidad porque los usuarios perciben directamente la latencia.

¿Los compradores deberían comparar los modelos únicamente por el precio de los tokens?

No. La medida más útil es el costo por tarea terminada dentro de un límite de latencia, considerando si el trabajo puede esperar, debe ejecutarse de inmediato o puede alojarse en infraestructura propia.

¿Por qué las empresas de modelos de bajo costo están incursionando en infraestructura?

El acceso barato atrae uso, pero atenderlo genera obligaciones recurrentes de capacidad y confiabilidad. Los resultados financieros reportados por DeepSeek y su propuesta de captar fondos para infraestructura de cómputo muestran cómo los proveedores de modelos pueden verse empujados hacia operaciones intensivas en capital.