Los modelos chinos ahora representan casi el 60% del uso de tokens de empresas estadounidenses en OpenRouter. Una aplicación estadounidense puede generar esa proporción sin entregar toda su carga de trabajo a ningún proveedor chino, porque el software ahora elige al proveedor una solicitud a la vez.

Puntos clave

  • La inferencia está pasando del compromiso con un proveedor a la adquisición a nivel de solicitud: las aplicaciones pueden elegir entre modelos para cada llamada según calidad, latencia, disponibilidad y precio.
  • La escala de OpenRouter —25 billones de tokens semanales entre más de 400 modelos— muestra que el enrutamiento puede crear un mercado funcional, no solo simplificar el acceso a APIs.
  • Los modelos chinos de pesos abiertos ofrecen sustitutos creíbles y de bajo costo, representan casi el 60% del uso de tokens de empresas estadounidenses en OpenRouter y aumentan el poder de negociación de los compradores frente a proveedores propietarios.
  • Las reducciones de costos ya no se convierten automáticamente en margen del proveedor cuando los routers pueden redirigir tráfico; los compradores capturan más ahorros, salvo que un modelo siga siendo irremplazable para una carga de trabajo valiosa.
  • El punto de control duradero es la capa de evaluación y flujo de trabajo, pero los routers deben superar los sistemas internos de los compradores mediante selección confiable, respaldos, cumplimiento y rendición de cuentas.

Los compradores capturan una reducción de costos solo cuando pueden cambiar de proveedor. Un menú amplio de modelos hace poco por sí solo. Las aplicaciones ganan poder de negociación cuando el software puede elegir repetidamente según la calidad, latencia, disponibilidad y precio requeridos para cada llamada.

Una aplicación vinculada a un modelo deja que el proveedor decida cuánto de una ganancia de eficiencia conservar. Cuando la aplicación puede enrutar entre sustitutos creíbles, cada proveedor debe volver a competir por la carga de trabajo. Una interfaz compartida crea esa competencia sin coordinación entre proveedores.

Un router convierte una llamada a la API en un evento de abastecimiento

El volumen semanal de OpenRouter creció cinco veces en seis meses, de 5 billones a 25 billones de tokens, entre más de 400 modelos.

tokens enrutados semanalmente entre 400+ modelos

A esa escala, el enrutamiento va más allá de la conveniencia para desarrolladores. El software puede asignar cada solicitud a un costoso modelo de frontera, un sustituto más barato, un proveedor de respaldo o varios modelos en paralelo. Las aplicaciones pueden convertir la elección de modelo en una decisión operativa miles de veces por minuto, en lugar de un compromiso arquitectónico que se revisa cada seis meses.

El comportamiento de Meta revela más que el discurso de cualquier empresa de enrutamiento. La compañía está desarrollando Switchboard para dirigir algunas tareas hacia modelos de menor costo, en vez de pagar indiscriminadamente precios de modelos de primera línea. Meta puede costear la inferencia de frontera, pero su escala hace valiosa la segmentación: la pregunta relevante pasa a ser qué modelo es suficiente para esta solicitud.

Al principio, los desarrolladores usaban inferencia más barata para operar las mismas aplicaciones a menor costo. Los routers les permiten rediseñar aplicaciones en torno a distintos niveles de inferencia para diferentes trabajos, y convierten la solicitud en la unidad de competencia.

La oferta china de pesos abiertos volvió operativa la sustitución

Los routers necesitan sustitutos creíbles. Los modelos chinos de pesos abiertos los han proporcionado con suficiente calidad y a un costo suficientemente bajo como para llevar la diversificación de un plan de riesgo de proveedores a producción.

Los modelos chinos representan casi el 60% del uso de tokens de empresas estadounidenses en OpenRouter. Los modelos de menor costo de DeepSeek y MiniMax comenzaron a superar a sus rivales estadounidenses en consumo de tokens en febrero. Esas cifras de consumo registran cargas de trabajo asignadas, no votos en benchmarks.

Las nubes de inferencia facilitan esa sustitución. Cursor accede a Kimi K2.5 de Moonshot AI mediante Fireworks AI para su integración con Composer 2. La aplicación estadounidense no necesita reorganizarse alrededor de un proveedor chino, porque Fireworks absorbe el límite de integración y ofrece el modelo como otra fuente de capacidad.

Los pesos abiertos amplían el grupo de proveedores incluso cuando los compradores no alojan los modelos por sí mismos. Los routers, las nubes de inferencia y las plataformas administradas pueden ofrecer más sustitutos sin obligar a cada aplicación a reconstruir su producto.

Los reguladores y los equipos de seguridad corporativa pueden reducir ese grupo. Las restricciones sobre modelos chinos interrumpirían cargas de trabajo que ya los usan, mientras que las reglas de cumplimiento pueden descalificar un modelo técnicamente sustituible. Incluso dentro de esos límites, las aplicaciones estadounidenses eligieron modelos chinos de menor costo una vez que las nubes de inferencia facilitaron su incorporación.

La calidad se está convirtiendo en un resultado de cartera

Un modelo fija el techo de calidad de una aplicación solo cuando recibe todas las tareas. El enrutamiento rompe ese paquete. Las solicitudes rutinarias pueden ir a modelos económicos, las solicitudes difíciles a sistemas de frontera y las solicitudes fallidas a un segundo proveedor. Las aplicaciones también pueden combinar varias respuestas para trabajo complejo.

Fusion de OpenRouter hace explícita la lógica de cartera al consultar varios modelos en paralelo y sintetizar los resultados. La compañía afirma que Fusion puede igualar o superar el rendimiento de nivel Fable en tareas de investigación profunda a la mitad del precio.

La afirmación no resuelve la economía. Según informes, Fusion mantuvo un modelo Opus premium en la pila de llamadas como juez. Los compradores deben contar toda la pila, porque un evaluador costoso puede absorber los ahorros de los modelos subyacentes más baratos.

Las aplicaciones pueden optimizar una cartera de inferencia entre costo, latencia y desempeño. Los compradores ya no preguntan solo qué modelo ocupa el puesto más alto en un benchmark independiente; preguntan qué tan barato puede el flujo de trabajo lograr un resultado aceptable.

El modelo más barato puede fijar el precio del trabajo rutinario incluso cuando el mejor modelo establece el techo de calidad.

Los modelos de frontera pueden conservar un poder de fijación de precios considerable para la cola difícil. El enrutamiento incluso puede concentrar la demanda premium al reservar el mejor modelo para llamadas donde su ventaja es medible y valiosa. El mercado de inferencia en general se está dividiendo entre capacidad general barata y capacidad especializada seleccionada deliberadamente, con una economía premium reservada para modelos cuya eliminación perjudica el resultado lo suficiente como para justificar su precio.

La eficiencia del proveedor ya no garantiza el margen del proveedor

Los proveedores de modelos aún tienen formas poderosas de reducir sus costos. OpenAI y Anthropic han dicho a inversionistas que los costos de inferencia superan la mitad de los ingresos, lo que vuelve central la eficiencia de servir modelos para su economía. Según informes, ingenieros de OpenAI también encontraron un método para reducir a más de la mitad el costo de inferencia.

Un proveedor puede usar esas ganancias para bajar precios, aumentar márgenes o respaldar más uso. Sin embargo, cuando varios proveedores pueden atender una solicitud y las aplicaciones pueden moverse entre ellos, la reducción de costos de un proveedor se convierte en una nueva puja en un mercado competitivo. Los rivales responden, los routers reasignan tráfico y parte de la ganancia se transfiere al comprador.

Los proveedores pueden esperar que los tokens más baratos estimulen suficiente demanda para que capturen un mercado en expansión. La demanda total aún puede subir, pero ningún proveedor tiene garantizado el valor resultante. Los compradores pueden segmentar la demanda, reservar modelos premium para llamadas de alto valor y obligar el trabajo rutinario a entrar en un grupo de menor precio.

Para los compradores, la respuesta operativa es concreta: medir resultados por tarea, establecer límites de costo y latencia, y reservar modelos de frontera para solicitudes donde los sistemas más baratos fallen. Sin evaluaciones confiables, el enrutamiento equivale a una reducción indiscriminada de costos.

El plano de control tiene que ganarse su posición

Los inversionistas están valorando el acceso, la personalización y la selección como funciones comerciales sustanciales. OpenRouter superó los $50 millones en ingresos anualizados, mientras que, según informes, Fireworks AI buscó financiamiento con una valuación de $15 mil millones después de haber sido valuada en $4 mil millones en octubre de 2025.

Los routers no pueden asumir que esa posición sea defendible. Switchboard de Meta muestra que un gran comprador puede internalizar el enrutamiento una vez que su factura de inferencia y volumen de carga de trabajo justifican el esfuerzo. Los grandes compradores pueden replicar un endpoint común, por lo que los routers necesitan una ventaja más profunda que el acceso.

Un router conserva valor solo cuando toma mejores decisiones que las que el comprador puede tomar por sí solo. Debe ofrecer evaluaciones confiables, respaldos fiables, gestión de latencia, cumplimiento e integración con el flujo de trabajo que define el éxito. Su foso competitivo reside en elegir el modelo para la próxima llamada relevante, explicar la elección y asumir la responsabilidad cuando falla.

A la escala de OpenRouter, esa proporción de casi el 60% es el poder de negociación de los compradores hecho visible. Entre 25 billones de tokens semanales, sustitutos creíbles, libertad para cambiar y evaluaciones confiables pueden convertir cada solicitud en una nueva puja, con la aplicación decidiendo quién gana.

Evidencia de que la inferencia se está convirtiendo en un mercado enrutado

Fecha de la evidenciaSeñal de mercadoCifra específica
2026-05-27Volumen semanal de OpenRouter25 billones de tokens, frente a 5 billones seis meses antes
2026-05-27Grupo disponible de proveedores400+ modelos
2026-06-15Economía afirmada de OpenRouter FusionInteligencia de nivel Fable a la mitad del precio
2026-07-22Participación de modelos chinos en el uso de empresas estadounidenses en OpenRouterAproximadamente 60% de los tokens

Preguntas frecuentes

¿Cómo convierte el enrutamiento de modelos la inferencia en un mercado de adquisición?

Un router evalúa cada solicitud y la asigna a un proveedor adecuado, en lugar de vincular la aplicación a un solo modelo. Eso obliga a los proveedores a competir repetidamente por las cargas de trabajo en precio, calidad, latencia y disponibilidad.

¿Por qué son importantes los modelos chinos de pesos abiertos para este cambio?

Amplían el grupo de sustitutos creíbles y de menor costo: los modelos chinos representan casi el 60% del uso de tokens de empresas estadounidenses en OpenRouter. Las nubes de inferencia y las plataformas administradas permiten que las aplicaciones usen esos modelos sin integrarse directamente con cada proveedor.

¿Los modelos de frontera perderán todo su poder de fijación de precios?

No. El enrutamiento puede reservar los modelos de frontera para solicitudes difíciles o de alto valor donde su eliminación perjudica de forma medible los resultados, mientras los modelos más baratos fijan el precio del trabajo rutinario.

¿Los flujos de trabajo con varios modelos siempre pueden reducir costos?

No. OpenRouter afirma que Fusion puede ofrecer desempeño de investigación profunda de nivel Fable a la mitad del precio, pero su uso reportado de un modelo Opus premium como juez muestra por qué los compradores deben evaluar el costo de todo el flujo de trabajo.

¿Qué hace defendible a una plataforma de enrutamiento?

Un endpoint común por sí solo es replicable, especialmente por grandes compradores como Meta. Un router necesita evaluaciones de tareas superiores, respaldos confiables, controles de latencia y cumplimiento, integración con el flujo de trabajo y responsabilidad por decisiones de enrutamiento relevantes.