Un millón de tokens de entrada cuesta $0.30 en Gemini 3.5 Flash-Lite de Google. Sin embargo, Google califica a Gemini 3.5 Flash Cyber como “eficiente en costos” aunque limita su acceso a gobiernos y socios seleccionados. Entre ambos niveles está Gemini 3.6 Flash, un modelo general que, según Google, utiliza hasta 17% menos tokens que su predecesor. Una sola familia ahora combina abundancia a bajo costo, capacidades amplias y acceso controlado: una contradicción que las clasificaciones de desempeño no pueden explicar.

Puntos clave

  • La competencia en inferencia está dejando atrás las posiciones en pruebas comparativas y los precios publicados por token para centrarse en el costo total de completar una tarea útil, incluidos tokens, latencia, reintentos, confiabilidad y fallas.
  • La oferta Gemini de Google funciona como una cartera: Flash-Lite se dirige al trabajo rutinario de gran volumen, 3.6 Flash atiende cargas generales más exigentes y Flash Cyber combina capacidades especializadas con acceso restringido.
  • La asignación de modelos se convierte en una fuente de margen al dirigir cada paso al nivel más barato que cumpla sus requisitos de calidad, latencia y riesgo, en lugar de enviar todas las solicitudes al modelo más potente.
  • La eficiencia operativa importa a escala de infraestructura: menos tokens, menos reintentos, una mejor programación y una mayor utilización permiten generar más trabajo facturable con recursos limitados de cómputo y energía.
  • La inferencia de uso general puede acercarse a precios de producto básico, pero las capacidades de alto impacto pueden conservar una economía de nivel superior porque la gobernanza, la supervisión y la distribución controlada forman parte del producto.

Flash se convirtió en una arquitectura de precios, no en un modelo más pequeño

Flash comenzó como un solo modelo basado en concesiones. En 2024, Gemini 1.5 Flash llegó como una alternativa más ligera y económica a Gemini Pro, pero conservó capacidades multimodales y una ventana de contexto de un millón de tokens. En 2025, Google amplió la familia con 2.5 Flash-Lite, al que describió como su modelo más rápido y eficiente en costos de esa generación. Para 2026, “Flash” ya designaba una escala de posiciones diferenciadas por costo, capacidad, latencia y acceso.

Quarterly coverage volume: GoogleCoverage of Google by quarter, 2024 Q4 to 2026 Q3: from 207 to 309 articles per quarter, peaking at 385.peak 3853092024 Q42026 Q3
Quarterly coverage · Google · 2024 Q4–2026 Q3 · current quarter projected

Un solo modelo más barato permite a Google captar compradores que no pueden justificar el modelo insignia. Una familia escalonada le permite colocar distintas cargas de trabajo en diferentes puntos de su curva de costos operativos. Google pasó de segmentar productos a diseñar un sistema.

Los desarrolladores de motores de inferencia llegaron desde abajo a la misma limitación. Los creadores del motor de inferencia de código abierto vLLM fundaron Inferact para comercializar la capa operativa y recaudaron una ronda inicial de $150 millones con una valuación de $800 millones. La operación asigna un valor concreto a la capa que convierte la capacidad de un modelo en volumen de procesamiento asequible.

La variedad de nombres puede parecer excesiva, pero Google está dividiendo una capacidad abundante en productos económicos distintos.

La tarea completada está sustituyendo al token como unidad económica

Un token barato no necesariamente se traduce en trabajo barato. Un agente puede consultar un modelo repetidas veces, utilizar herramientas, corregir pasos fallidos y generar una respuesta extensa antes de completar un solo flujo de trabajo. La tarifa de entrada publicada cubre apenas una parte de ese proceso. La métrica de producción pertinente es el costo de IA por tarea útil: el efecto combinado del precio, el consumo de tokens, la latencia, los reintentos, la confiabilidad y las fallas.

Google mantuvo el precio de entrada de Gemini 3.6 Flash en $1.50 por millón de tokens, pero redujo el precio de salida a $7.50, desde los $9 de Gemini 3.5 Flash. También afirma que el nuevo modelo mejora el desempeño en programación, tareas multimodales y trabajo basado en conocimiento, al tiempo que utiliza hasta 17% menos tokens. Si un flujo de trabajo alcanza un resultado aceptable con menos tokens e intentos, la reducción efectiva supera lo que sugiere por sí solo el cambio en la tarifa de salida.

Precio de entrada de Gemini 3.5 Flash-Lite por 1M de tokens
Reducción máxima de tokens que Google atribuye a Gemini 3.6 Flash frente a 3.5 Flash

A escala de laboratorio, esas diferencias se vuelven importantes. Según documentos, OpenAI y Anthropic han dicho a inversionistas que los costos de inferencia superan la mitad de sus ingresos. Con esa proporción, la eficiencia operativa determina cuánto ingreso queda después de entregar el producto.

Liderar las pruebas comparativas todavía ayuda a establecer qué tareas puede intentar un modelo, pero no cuántas solicitudes, tokens, reintentos o segundos exige la operación. Por ello, los compradores deben medir el costo por tarea completada en lugar de deducirlo de una tarifa publicada por token.

Los distintos trabajos convierten una familia de modelos en una cartera

La oferta de Google para julio deja la segmentación especialmente clara. Flash-Lite está orientado al trabajo cotidiano rápido y rentable. Gemini 3.6 Flash ocupa el nivel general con mayores capacidades. Gemini 3.5 Flash Cyber se presenta como un especialista eficiente en costos, capaz de detectar y corregir vulnerabilidades, pero su distribución inicial está limitada a gobiernos y socios seleccionados.

Nivel de Gemini Entrada por 1M de tokens Salida por 1M de tokens Función en la cartera
3.5 Flash-Lite $0.30 $2.50 Tareas cotidianas de gran volumen
3.6 Flash $1.50 $7.50 Cargas generales que exigen mayor capacidad
3.5 Flash Cyber Trabajo restringido sobre vulnerabilidades

El nivel de bajo costo establece un precio de referencia para tareas en las que varios modelos ofrecen resultados suficientes. El nivel intermedio capta trabajo cuyo umbral de calidad justifica un mayor gasto. El nivel especializado compite por las consecuencias, la gobernanza y el acceso, no por un volumen irrestricto. Google puede atender los tres sin obligar a que cada solicitud pase por la misma estructura de costos.

Flash Cyber también marca un límite para la mercantilización total. Google lo califica como un modelo eficiente en costos, pero restringe su disponibilidad inicial a gobiernos y socios seleccionados. Su precio y su distribución avanzan en sentidos opuestos: capacidad más barata, acceso más estricto. El acceso condicionado a modelos se ha convertido en parte del producto, en lugar de ser una política añadida después de la implementación.

La asignación convierte la variedad de modelos en margen

Sin una distribución inteligente de las cargas de trabajo, tres modelos generan tres decisiones de compra y varias oportunidades nuevas para producir documentación.

Un sistema de asignación de modelos crea valor al dirigir cada solicitud al modelo de menor costo que cumpla el umbral requerido de calidad, latencia y riesgo. Según documentos, la incubadora interna de IA de Meta está desarrollando un sistema de este tipo para reducir costos mediante el envío de algunas tareas a modelos más baratos.

El catálogo de Google aporta los componentes para la misma arquitectura: un nivel de gran volumen, otro con mayores capacidades y un nivel especializado de acceso restringido. Ningún informe confirma que Google distribuya automáticamente las solicitudes entre ellos. Aun así, el catálogo demuestra por qué la asignación adquiere valor: cuando varios modelos son viables, elegir entre ellos para cada tarea genera más ventaja que elegir una sola vez a un proveedor.

Una tarea visible asignada a un agente puede contener muchas decisiones de inferencia ocultas. Un sistema de asignación puede enviar pasos rutinarios de clasificación, extracción y formato a un nivel más barato, mientras reserva un modelo con mayores capacidades para razonamientos ambiguos. También puede bloquear pasos sensibles al riesgo o redirigirlos a capacidad controlada. El ahorro se acumula entre solicitudes, en lugar de aparecer una sola vez en una hoja de compras.

Las cargas de trabajo basadas en agentes también cambian el valor de la latencia. Cuando ninguna persona espera cada paso intermedio, los operadores pueden sacrificar velocidad de respuesta inmediata a cambio de mayor volumen, mejor programación y menor tiempo total de finalización. A escala de centros de datos, pueden programar las solicitudes según la capacidad disponible sin hacer que una persona espere entre cada paso.

La eficiencia operativa amplía el alcance de una infraestructura escasa

La inferencia más barata está surgiendo dentro de una carrera por la infraestructura, no en sustitución de ella. OpenAI planea gastar más de $30 mil millones en un centro de datos en Georgia con 3.2 gigavatios de capacidad energética, y se prevé que varios cientos de megavatios entren en operación a partir de 2028. Project Rainier de AWS, construido para Anthropic, utiliza más de 500,000 chips Trainium2. El sector está asegurando aceleradores, energía y capacidad de centros de datos a escala industrial.

Cuando un modelo utiliza menos tokens por tarea completada, la misma flota de aceleradores puede terminar más trabajo facturable. Menos reintentos, respuestas más breves, una mejor programación y un mayor aprovechamiento reducen el costo unitario y retrasan la necesidad del siguiente bloque de capacidad.

Por ello, los precios de los modelos y el mercado de megavatios contratados deben formar parte del mismo análisis. Los compromisos de infraestructura a largo plazo fijan una parte considerable de la base de costos. La asignación y la eficiencia de los modelos determinan cuánto resultado útil produce esa capacidad.

Los proveedores también están llevando la optimización por debajo de la capa de programas informáticos. Según fuentes, Google está desarrollando para 2028 un chip de servidor especializado que integra en silicio el diseño de Gemini, aunque el proyecto solo ha sido reportado y no está confirmado. Arquitectos de modelos, ingenieros de operación, responsables de programación y diseñadores de chips comparten un objetivo: completar más tareas con cada unidad limitada de cómputo y energía.

La inferencia de alto impacto no se vende al precio de un producto básico

Los compradores comparan con mayor agresividad los modelos generales cuando los errores cuestan poco y las cargas de trabajo son repetitivas. Las capacidades de alto impacto reciben un trato distinto. Un modelo capaz de descubrir y corregir vulnerabilidades es valioso, en parte, porque una falla, el uso indebido o la distribución sin control generan riesgos de seguridad.

Los agentes de IA para programación ya están modificando la economía del desarrollo de vulnerabilidades al automatizar partes del descubrimiento de fallas de día cero. Los proveedores deben decidir quién puede utilizar esa capacidad, en qué entorno, bajo qué supervisión y contra qué objetivos. La política de acceso se convierte en un insumo operativo, no en una capa de relaciones públicas.

La respuesta de OpenAI en la capa para desarrolladores apunta en la misma dirección. La empresa añadió aislamiento nativo y un entorno de pruebas dentro de la distribución a su Agents SDK para implementar y evaluar agentes en tareas de larga duración. Los entornos aislados, las herramientas de prueba, la distribución restringida y los modelos especializados responden al mismo requisito estructural: la inferencia de alto impacto necesita un sistema de entrega controlado.

Los compradores pueden empujar la capacidad rutinaria hacia precios de producto básico porque tienen la opción de sustituirla por modelos que cumplen un umbral común. Los proveedores pueden conservar una economía de nivel superior o un acceso restringido para la capacidad especializada cuando las consecuencias convierten la gobernanza en parte del producto.

La clasificación sigue vigente, pero ya no determina el mercado

Los laboratorios de frontera todavía pueden sostener que la capacidad más avanzada continúa siendo escasa. Google inició lo que denomina su proceso de preentrenamiento más ambicioso hasta la fecha para Gemini 4. Reducir el costo operativo y entrenar modelos de frontera son líneas competitivas paralelas, no sustitutas. Un proveedor todavía necesita investigación de frontera para ampliar el conjunto de tareas que puede atender su cartera.

Los menores precios de los modelos tampoco eliminan las dificultades de integración. Google aplazó la migración de Assistant a Gemini en la mayoría de los dispositivos Android más allá de su objetivo previo de finales de 2025 y hasta 2026. Distribuir mediante una base de productos existente todavía exige una ejecución que no puede comprarse con un precio por token.

El mercado de agentes tampoco está resuelto en términos operativos. Los principales proveedores utilizan definiciones distintas de un agente de IA, lo que frustra a clientes incapaces de determinar qué hace el sistema, dónde recae la responsabilidad o cómo se mide el éxito. Hasta que los proveedores aclaren esas responsabilidades, un menor costo por sí solo no definirá la implementación.

Los laboratorios de frontera siguen necesitando capacidad, distribución y confianza. Una cartera asigna una función distinta a cada ventaja: el entrenamiento de frontera eleva el límite, la integración llega a los usuarios, los controles abren mercados de alto impacto y la asignación protege el margen.

El precio de $0.30 por los tokens de entrada no es el punto final de la competencia en inferencia; es el piso de una cartera cuyos demás niveles compran capacidad, control o ambos. En el extremo opuesto, el lanzamiento restringido de Flash Cyber demuestra que parte de la capacidad se valorará y administrará según sus consecuencias. La clasificación aún identifica al modelo más potente, pero el margen pertenece al operador que sabe cuándo no utilizarlo.

Preguntas frecuentes

¿Por qué el precio por token ya no es la mejor medida del costo de inferencia de IA?

Los agentes pueden realizar múltiples solicitudes, utilizar herramientas, repetir pasos fallidos y generar respuestas extensas antes de completar un flujo de trabajo. Por ello, los compradores deben medir el costo por tarea útil completada, no el precio de un solo token de entrada o salida.

¿Cómo mejora los márgenes de la IA la asignación de modelos?

Un sistema de asignación puede enviar pasos rutinarios, como clasificación, extracción y formato, a modelos más baratos, mientras reserva los modelos con mayores capacidades para razonamientos ambiguos. El ahorro se acumula a lo largo de las numerosas solicitudes que integran el flujo de trabajo de un agente.

¿El modelo Gemini más barato vuelve innecesarios los niveles con mayores capacidades?

No. Flash-Lite establece un nivel de bajo costo para el trabajo cotidiano de gran volumen, mientras Gemini 3.6 Flash se dirige a tareas con mayores requisitos de calidad y Flash Cyber atiende trabajos controlados sobre vulnerabilidades.

¿Por qué Gemini Flash Cyber tiene acceso restringido si Google lo considera eficiente en costos?

Las capacidades de ciberseguridad generan riesgos de uso indebido y seguridad que el costo operativo por sí solo no refleja. Restringir el acceso a gobiernos y socios seleccionados convierte la gobernanza y los controles de distribución en parte de la oferta.

¿Las clasificaciones de modelos están perdiendo relevancia?

No: el desempeño de frontera aún determina qué tareas puede intentar un proveedor. Sin embargo, liderar las pruebas comparativas no determina por sí solo la economía de producción, la distribución, la confianza ni la eficiencia con que se asignan las cargas de trabajo entre los distintos niveles de modelos.