En agosto de 2026, según informes, OpenRouter procesó 25T de tokens por semana entre más de 400 modelos de IA, frente a 5T seis meses antes. El costo de cambiar entre modelos caía más rápido que el costo de saber si el cambio funcionaba. Los routers volvieron rutinaria la sustitución justo cuando los agentes llevaron el éxito más allá de los precios por token y las tablas de clasificación.
Puntos clave
- Según informes, OpenRouter procesó 25 billones de tokens por semana entre más de 400 modelos en agosto de 2026, frente a 5 billones seis meses antes.
- DeepSeek V4-Flash tiene un precio de $0.14 por millón de tokens de entrada y $0.28 por millón de tokens de salida.
- Artificial Analysis estimó costos por prueba de benchmark de $0.03 para DeepSeek V4-Flash, $0.86 para Kimi K3 y $1.86 para GPT-5.6 Sol.
- DeepSeek V4-Flash obtuvo 50 en el Artificial Analysis Intelligence Index, 10 puntos por encima de su versión preliminar de abril.
- Alibaba dijo que publicaría los pesos de Qwen3.8-Max, de 2.4 billones de parámetros, y Qwen3.8-27B.
Al inicio de este ciclo de 18 meses, la competencia entre modelos todavía cabía en una sola escalera. Alibaba lanzó Qwen2.5-Max afirmando que superaba a GPT-4o, DeepSeek-V3 y Llama-3.1-405B en casi todos los frentes. La pregunta obvia era qué laboratorio había construido el modelo más capaz.
Desde entonces, las empresas que adoptan IA empresarial han empezado a enrutar cargas de trabajo entre proveedores, y la competencia entre modelos se ha extendido al propio sistema de medición. Los benchmarks, los tokens con precio de lista, las licencias de pesos abiertos y las evaluaciones de tareas de agentes revelan cada uno una propiedad real, pero parcial.
Una tarifa por token se queda corta antes de terminar el trabajo
Alibaba fija el precio de Qwen3.8-Max en $2 por millón de tokens de entrada y $6 por millón de tokens de salida. Moonshot AI cobra $3 y $15 por Kimi K3. DeepSeek V4-Flash está mucho más abajo, con $0.14 por millón de tokens de entrada y $0.28 por millón de tokens de salida.
Para un equipo de adquisiciones, la factura relevante termina con un resultado aceptado. Un modelo puede producir una respuesta más larga, invocar más herramientas, fallar una acción externa, volver a intentar la solicitud o enviar el resultado a un revisor humano. Una tarifa baja todavía puede producir un flujo de trabajo caro; una tarifa más alta puede ser económica si el modelo termina de forma confiable con menos salida y supervisión.
Artificial Analysis ha empezado a reportar el costo por prueba de benchmark, acercando los precios al trabajo terminado. Estimó que DeepSeek V4-Flash costaba $0.03 por prueba, frente a $0.86 para Kimi K3 y $1.86 para GPT-5.6 Sol. Una factura por prueba es más útil que una tarifa por token porque el evaluador aporta un denominador compartido. La prueba todavía excluye la pila de herramientas de una empresa, los criterios de aceptación, la política de escalamiento y la carga de revisión, pero mide una mayor parte del recorrido.
Según informes, OpenAI y Anthropic proyectaron costos de inferencia superiores a la mitad de los ingresos, por lo que cada mejora en la eficiencia de servicio afecta la economía del proveedor antes de llegar al cliente. Sus proyecciones ayudan a explicar por qué la economía de la inferencia moldea cada vez más el diseño de producto, las tarifas y la segmentación de modelos. Los compradores todavía deben medir qué sistema termina el trabajo.
Una sola tabla de clasificación oculta el desacuerdo útil
DeepSeek V4 Flash obtuvo 50 en el Artificial Analysis Intelligence Index, igualando a Gemini 3.6 Flash y mejorando 10 puntos frente a su versión preliminar de abril. Esa puntuación coloca al modelo en un conjunto serio de comparación y permite a los compradores descartar candidatos claramente más débiles sin evaluar cada lanzamiento desde cero.
Kimi K3 lideró Frontend Code Arena mientras obtenía 88.3 en Terminal Bench 2.1, apenas por detrás de GPT-5.6 Sol con 88.8. Estas clasificaciones no invalidan la puntuación de DeepSeek en el índice. La programación de front-end y el trabajo en terminal recompensan comportamientos distintos, mientras que un índice compuesto de inteligencia pondera aún más capacidades en una sola cifra.
Los equipos de investigación persiguen el mejor desempeño en benchmarks porque una prueba común hace legible el progreso. Los responsables de producción buscan inferencia rápida, latencia predecible, interpretabilidad y resultados que satisfagan a distintos interesados. Ambos grupos pueden evaluar correctamente el mismo modelo y aun así llegar a conclusiones distintas porque tienen funciones objetivo diferentes.
Aquí se abre la brecha entre evaluación y adquisición. Una puntuación general puede filtrar candidatos. La orden de compra todavía depende de si una ventaja de un punto en programación importa más que el tiempo de respuesta, el control del despliegue, la recuperación ante fallas o la aceptación humana. El benchmark responde la pregunta que planteó su diseñador; adquisiciones es responsable de la pregunta que tiene el negocio.
Los pesos abiertos ponen precio al control que las API no pueden vender
Un cliente de API compra acceso al sistema en operación de un proveedor. Un cliente de pesos abiertos adquiere otro conjunto de opciones: dónde corre el modelo, quién lo adapta, qué infraestructura lo aloja y qué tan fácilmente puede la organización alejarse del proveedor original.
Alibaba dijo que publicaría los pesos de Qwen3.8-Max, de 2.4 billones de parámetros, y Qwen3.8-27B después de publicar comparaciones de benchmarks con Kimi K3. Alibaba ya había publicado Qwen3.6-27B como un modelo denso de pesos abiertos y dijo que el modelo más pequeño superaba a un predecesor Qwen mucho mayor en los principales benchmarks de programación. El plan de OpenAI de 2025 para su primer modelo de lenguaje de pesos abiertos desde GPT-2 mostró que incluso un proveedor propietario líder quería esa opción.
Un modelo autoalojado hace al comprador responsable del despliegue, la capacidad, las actualizaciones y la evaluación. Las API administradas pueden costar menos en conjunto o entregar mejores resultados medidos.
Los desarrolladores, proveedores de nube y vendedores pueden tratar un modelo de pesos abiertos ampliamente adoptado como un sustrato neutral, construir integraciones a su alrededor y preservar la portabilidad entre proveedores de infraestructura. Para los compradores, el control del despliegue se convierte en una dimensión separada de adquisición junto con la capacidad y el precio.
Los routers convierten las adquisiciones en un ciclo operativo
Un router rompe el supuesto de que un modelo debe ganar todas las solicitudes. Puede enviar trabajo rutinario a un modelo más barato, trabajo especializado a un modelo adecuado para el dominio y trabajo de alto riesgo a una ruta con controles más estrictos de confiabilidad o revisión. La organización puede cambiar la ruta cuando cambian las tarifas, los modelos o los requisitos.
Al volumen de OpenRouter, la selección de modelos se vuelve infraestructura de producción, con reglas de enrutamiento que moldean costos y fallas en vivo.
Las empresas estadounidenses enviaron casi 60% de su uso de tokens en OpenRouter a modelos chinos. Una decisión de política, una interrupción de proveedor o un cambio de precio que afectara esos modelos alteraría sistemas en operación, no despliegues futuros hipotéticos.
Meta llegó a la misma conclusión arquitectónica desde dentro de su propia estructura de costos. La incubadora interna de la empresa está desarrollando Switchboard para enviar algunas tareas de programación a modelos de menor costo en lugar de pagar precios de modelos de primer nivel por cada solicitud. OpenRouter atiende a muchos desarrolladores; Meta quiere un plano de control interno. Ambos están segmentando cargas de trabajo.
El enrutamiento también crea una factura propia. Un equipo de enrutamiento debe evaluar cada modelo elegible, observar cada ruta, gobernar el acceso a modelos y datos, mantener alternativas y detectar cambios de desempeño. Una empresa con cargas de trabajo mal segmentadas puede añadir complejidad sin ahorrar dinero ni mejorar la confiabilidad. La economía multimodelo mejora solo cuando el operador puede distinguir las solicitudes y confiar en las mediciones utilizadas para moverlas.
Los agentes extienden la factura más allá de la respuesta
Un agente razona sobre un objetivo y actúa a través de sistemas externos. Su resultado depende de algo más que la primera respuesta del modelo. El agente debe seleccionar herramientas, transferir estado entre pasos, recuperarse de errores y detenerse cuando el trabajo cumple una condición definida.
Un benchmark de prompt-respuesta puede probar un componente de ese sistema. No puede establecer si la secuencia completa se terminó correctamente. OpenAI reconoció la distinción cuando agregó sandboxing nativo y un arnés in-distribution a su Agents SDK para probar modelos en tareas de horizonte largo. El arnés permite a los operadores observar el comportamiento en despliegue en lugar de inferirlo a partir de una tarjeta de modelo.
Los puntos de control humanos pertenecen dentro del mismo límite contable. Una organización puede requerir que una persona apruebe una acción consecuente, inspeccione evidencia de respaldo o resuelva un resultado ambiguo. Esos controles aportan responsabilidad en el despliegue, pero los empleados todavía dedican tiempo a operarlos. Un cálculo de adquisición que excluye el trabajo de revisión hace que el modelo parezca más barato al trasladar parte de su costo a otro departamento.
Un flujo de trabajo puede usar modelos distintos para planificación, ejecución y verificación. Cada transferencia añade otro lugar donde pueden entrar latencia, costo de herramientas, pérdida de estado o fallas. El operador debe evaluar el sistema ensamblado a lo largo del flujo de trabajo, en vez de promediar las puntuaciones de los componentes y esperar que la aritmética desarrolle criterio.
Un libro mayor de cargas de trabajo vuelve falsable cada afirmación
Una definición estable de terminado permite a un comprador comparar rutas sin resolver una definición universal de inteligencia. El comprador puede convertir un flujo de trabajo acotado en una unidad auditable al registrar las mismas medidas para cada ruta.
| Medida | Lo que registra el comprador | Por qué cambia la economía |
|---|---|---|
| Éxito de la tarea | Tasa de aprobación frente a una prueba de aceptación específica de la carga de trabajo | Los resultados fallidos e inutilizables dejan de contar como trabajo barato |
| Latencia de extremo a extremo | Tiempo desde la solicitud hasta la finalización aceptada, incluidas herramientas y revisión | Un modelo rápido no puede ocultar un flujo de trabajo lento |
| Costo total | Cargos de entrada, salida, herramientas, despliegue e infraestructura | Las rutas por API y autoalojadas se vuelven comparables dentro de un mismo límite |
| Reintentos y escalamiento | Intentos repetidos, rutas de respaldo y transferencias a personas | Los costos de confiabilidad aparecen en el mismo registro que los ahorros por token |
| Revisión humana | Tiempo del revisor, frecuencia de aprobación y motivo de intervención | La supervisión se convierte en un costo operativo en lugar de una externalidad |
| Procedencia | Versión del modelo, ruta, herramientas, entradas e historial de decisiones | Los operadores pueden reproducir, auditar y cuestionar resultados consecuentes |
Un Model Procurement Stack maduro da a cada actor una responsabilidad medible. Los proveedores publican tarifas, condiciones de despliegue y evidencia de benchmarks. Los routers registran qué modelo atendió una solicitud y qué consumió la ruta. Los compradores definen pruebas de aceptación, presupuestos de latencia, umbrales de escalamiento y políticas de revisión. Cada actor sigue siendo responsable de sus propias afirmaciones.
El libro mayor también crea memoria institucional. Un comprador puede comparar un nuevo lanzamiento con las rutas que ya opera, conservar la evidencia detrás de un cambio y revertirlo si el desempeño de la carga de trabajo se deteriora. El equipo de adquisiciones mantiene una definición estable de valor cuando un laboratorio publica una nueva tabla de clasificación.
Preguntas frecuentes
¿Stripe adquirió OpenRouter?
No aparece ninguna adquisición confirmada en la evidencia proporcionada. Reportes de julio de 2026 describieron una oferta o conversaciones por aproximadamente $10 mil millones; PitchBook reportó por separado que OpenRouter había sido valorada en $1.3 mil millones en mayo.
¿“Pesos abiertos” significa lo mismo que “código abierto”?
No necesariamente. El texto establece que los compradores pueden obtener y desplegar los pesos del modelo, pero no especifica si la licencia otorga derechos más amplios de código abierto sobre código, datos de entrenamiento, modificación o redistribución.
¿La participación de casi 60% de modelos chinos representa todo el mercado estadounidense de IA?
No. La cifra cubre el uso de tokens de empresas estadounidenses en OpenRouter, no todo el consumo empresarial de IA en Estados Unidos ni los despliegues fuera de esa plataforma.
¿Con qué frecuencia debe un comprador actualizar su libro mayor de cargas de trabajo?
El texto no establece una cadencia fija. Su lógica operativa implica una reevaluación cuando cambia una versión de modelo, tarifa, regla de enrutamiento, requisito de negocio o desempeño observado de la carga de trabajo.
¿Los pesos de Qwen3.8 ya están disponibles?
El texto reporta el compromiso de Alibaba de publicarlos, no una publicación completada ni una fecha de disponibilidad. Los compradores todavía tendrían que verificar la publicación y las condiciones de licencia antes de planear el despliegue.
A la escala de OpenRouter, siempre hay otro modelo al alcance. El activo duradero es el registro del comprador de qué ruta completó qué trabajo, bajo qué controles y a qué costo total.