Anthropic ofreció un millón de tokens a precio estándar para Opus 4.6 y Sonnet 4.6. Sin embargo, cada token que entra en esa ventana sigue consumiendo memoria, aumentando la latencia y elevando el costo de inferencia. Una ventana de un millón de tokens puede abarcar una mayor parte de un flujo de trabajo empresarial, pero no puede decidir qué merece entrar, permanecer o volver.
Puntos clave
- La ventana de un millón de tokens de Anthropic a precio estándar traslada el cuello de botella empresarial de la capacidad bruta a la decisión de qué información entra, permanece y sale del conjunto de trabajo del modelo.
- El contexto extenso sigue implicando costos de memoria, latencia e inferencia; que quepa más contenido en una ventana no vuelve útil cada token.
- Los agentes persistentes requieren una capa operativa de contexto que coordine la admisión, el almacenamiento en caché, la recuperación, la compresión, el desalojo, los archivos, las herramientas y la memoria administrada entre llamadas sucesivas.
- Los compradores empresariales deben optimizar el contexto útil por dólar y por segundo —y, en última instancia, el costo por tarea útil— en vez del número máximo de tokens aceptados.
- Las arquitecturas más eficientes pueden ampliar el presupuesto disponible para contexto, pero no eliminan la necesidad de administrar la relevancia, el historial y el estado.
El precio estándar lleva la escasez más allá del tamaño de la ventana
Opus 4.6 llegó con una ventana de contexto de un millón de tokens en versión beta y una puntuación reportada de 90.2% en BigLaw Bench. Después, Anthropic ofreció la ventana completa de un millón de tokens a precio estándar para Opus 4.6 y Sonnet 4.6, además de establecerla como opción predeterminada para los usuarios de Claude Code Max, Team y Enterprise que utilizan Opus.
El resultado reportado en la prueba de referencia indicaba que la ventana podía sostener una carga de trabajo profesional exigente. Al ofrecerla a precio estándar, Anthropic desvinculó el tamaño de la ventana de un recargo visible por contexto extenso y convirtió esa capacidad en una prestación básica del producto.
La decisión de Anthropic cuestiona la idea de que el contexto extenso necesariamente debe seguir siendo demasiado costoso. Los proveedores pueden absorber el sobreprecio, reducirlo mediante mejoras operativas o recuperarlo en otra parte del producto. Sin embargo, un precio estándar no vuelve igualmente útil cada token ni elimina la carga de memoria y latencia que genera el estado activo; simplemente traslada esa carga detrás de los límites visibles del producto.
Cuando una ventana grande ya viene incluida, los compradores dejan de preguntar únicamente: “¿El modelo puede contener esto?”. También deben preguntarse si el modelo puede encontrar el material pertinente, si vale la pena volver a procesar información estable y si el flujo de trabajo sigue siendo rentable después del décimo paso del agente, no solo del primero. El problema deja de ser la capacidad y pasa a ser el rendimiento que se obtiene de ella.
La atención convierte la capacidad disponible en una factura operativa
En la inferencia convencional con transformadores, la caché KV crece de forma lineal con la longitud de la secuencia, y cada token generado debe atender a los tokens anteriores. Una ventana más grande amplía el contenido al que puede acceder el modelo, no lo que puede procesar sin consecuencias.
Al principio, los desarrolladores recurrieron a la generación aumentada por recuperación para enfrentar la dificultad de procesar grandes volúmenes de texto de manera eficiente: recuperar un subconjunto pertinente en vez de tratar todo el corpus como parte activa de la instrucción. Después, el concepto se amplió de la ingeniería de instrucciones a la ingeniería de contexto, porque redactar una instrucción ya no era la tarea que sostenía todo el sistema. Conforme los modelos incorporaron herramientas, archivos, memoria y flujos de trabajo más largos, la instrucción dejó de ser un simple mensaje y se convirtió en un conjunto de trabajo administrado.
| Control del contexto | Pregunta del sistema | Efecto económico |
|---|---|---|
| Admisión | ¿Qué entra en la ventana activa? | Evita gastar capacidad de atención en material irrelevante |
| Persistencia | ¿Qué se conserva entre llamadas? | Reduce el procesamiento repetido del estado estable |
| Recuperación | ¿Qué se carga únicamente cuando hace falta? | Sustituye una instrucción permanentemente más grande por una consulta específica |
| Desalojo y compresión | ¿Qué puede eliminarse o resumirse? | Controla el aumento de la latencia, el uso de memoria y el consumo de tokens |
La ventana de un modelo proporciona espacio direccionable; la capa de contexto decide cómo utilizarlo. Cargar todo solo porque cabe no vuelve más inteligente al sistema. Automatiza el archivo de documentos sin crear carpetas.
Los agentes persistentes necesitan una capa operativa
Una instrucción de una sola ejecución puede tolerar una administración rudimentaria del contexto porque la interacción termina. Un agente persistente no. Genera resultados de herramientas, abre archivos, modifica planes, conserva instrucciones y acumula el historial de la sesión entre llamadas. Volver a procesar todo eso en cada paso convierte la memoria en un gasto recurrente de inferencia.
Las novedades de la API de Anthropic muestran cómo la capa de desarrollo descompuso este problema. En agosto de 2024, el almacenamiento en caché de instrucciones permitió a los desarrolladores conservar entre llamadas el contexto utilizado con frecuencia en vez de enviarlo repetidamente. Para mayo de 2025, Anthropic ya había integrado el almacenamiento prolongado en caché de instrucciones con la ejecución de código, un conector MCP y una API de archivos. El contexto dejó de ser un único bloque de texto: los desarrolladores podían distribuirlo entre instrucciones almacenadas en caché, elementos externos, herramientas y estados recuperados.
En mayo de 2026, Managed Agents añadió “dreaming”, un proceso programado que revisa las sesiones recientes y actualiza la memoria del agente. El proceso se asemeja al mantenimiento programado de una base de datos: la memoria ya se encuentra fuera del turno inmediato de la conversación.
Por ello, los agentes persistentes necesitan una capa operativa alrededor del modelo que administre la asignación de tareas, el uso de herramientas y los planes. Esta capa también admite información nueva, conserva determinados estados, descarta los obsoletos y vuelve a incorporar el material almacenado al conjunto de trabajo.
Cuanto más autónomo parece un agente, mayor debe ser el control que ejerza su capa de contexto.
El almacenamiento en caché y la recuperación no son optimizaciones menores: determinan qué puede saber un agente en cada paso y cuánta inferencia debe comprar el operador para que pueda saberlo. Al definir tanto los permisos como el costo recurrente, la política de contexto se convierte en parte de la economía de los agentes.
En producción importa el contexto útil, no el contexto máximo
La economía de los proveedores ya deja ver esta presión. Barclays proyectó que el gasto de capital destinado a la inferencia superaría al de entrenamiento en un plazo de dos años, mientras que documentos para inversionistas señalaron que OpenAI y Anthropic elaboraron proyecciones de rentabilidad con y sin costos de entrenamiento. En ambos casos, la operación de los modelos —no solo su desarrollo— determinó la restricción.
Los agentes que operan durante periodos prolongados agravan esa presión porque no compran una sola respuesta. Compran una secuencia de llamadas al modelo, cada una con instrucciones, información recuperada, resultados de herramientas y alguna representación del estado anterior. Una decisión de contexto que parece trivial en cada llamada se vuelve una cuestión de arquitectura al repetirse a lo largo de un flujo de trabajo.
La respuesta reportada de Microsoft resulta ilustrativa. La empresa comenzó a sustituir algunos modelos de OpenAI y Anthropic por sus propios modelos MAI en productos como Excel y Outlook para reducir los costos de IA. Estas sustituciones no demuestran que un modelo sea universalmente superior; muestran cómo cambia una estrategia racional de compra cuando es posible asignar tareas según las capacidades y la inferencia se convierte en un costo recurrente.
Las mejoras en los sistemas pueden modificar con rapidez la estructura de costos. Según los reportes, ingenieros de OpenAI encontraron una forma de reducir el costo de inferencia a menos de la mitad, lo que vuelve frágil cualquier supuesto fijo sobre el costo de las ventanas de contexto actuales. El precio estándar de Anthropic demuestra lo mismo desde la perspectiva del cliente: el recargo visible puede disminuir más rápido de lo que cambia la carga de trabajo.
Una inferencia más barata amplía el número de llamadas que resulta viable costear; no vuelve valioso el reprocesamiento de estados obsoletos. Los equipos de compras pueden dirigir cada flujo de trabajo hacia la combinación de capacidad y latencia que cumpla los requisitos de la tarea, y después comparar el costo total de la recuperación, la reutilización de la caché y el contexto repetido. La unidad adecuada para esa decisión es el costo de IA por tarea útil, no la cantidad de tokens aceptados.
Las nuevas arquitecturas amplían el presupuesto, no el criterio
Google Research presentó Titans como una arquitectura que combina la velocidad de las RNN con la precisión de los transformadores y afirmó que podía escalar a más de dos millones de tokens. Alibaba presentó Qwen3-Next como una arquitectura híbrida optimizada para comprender contextos extensos y mejorar la eficiencia computacional.
Google y Alibaba están rediseñando la arquitectura en vez de limitarse a optimizarla en torno a las restricciones operativas actuales. Si esos diseños reducen el costo y la latencia de mantener estados prolongados, una mayor cantidad de contexto se vuelve realmente utilizable, no solo accesible.
En conjunto, estos proyectos cuestionan cualquier afirmación de que las limitaciones actuales de los transformadores determinarán para siempre la administración del contexto. Las arquitecturas cambian, las curvas de costos se desplazan y el presupuesto disponible crece.
Los agentes y sus operadores todavía deben decidir qué es pertinente, qué versión del historial conviene conservar y cuándo cargar un archivo. Un procesamiento más barato eleva el nivel de esas decisiones: ya no se trata de si la información cabe, sino de si merece atención. Mientras la latencia y el costo operativo no lleguen a cero y cada pieza de información no sea igualmente útil, esa política seguirá siendo necesaria.
La ventana de un millón de tokens de Anthropic a precio estándar no termina la competencia por el contexto extenso; deja al descubierto la siguiente restricción. Conforme los agentes conservan su estado entre llamadas y los tokens activos generan latencia y costos operativos, el valor se desplaza hacia la capa que decide qué ve el modelo ahora, qué recuerda después y qué nunca tendrá que pagar por volver a leer. Anthropic amplió el espacio; la ventaja duradera está en decidir qué merece ocuparlo.
La cobertura de Anthropic se orientó más hacia las empresas, 2024–2026
| Categoría de enfoque | Proporción en 2024 | Proporción en 2026 | Cambio reportado |
|---|---|---|---|
| Empresarial | 12.3% | 19.0% | +6.7 puntos |
| Consumo | 32.4% | 15.6% | −16.8 puntos |
| Investigación | 40.3% | 22.0% | −18.3 puntos |
Preguntas frecuentes
¿Qué cambió con la ventana de contexto de un millón de tokens de Anthropic?
Anthropic ofreció la ventana completa a precio estándar para Opus 4.6 y Sonnet 4.6, con lo que la capacidad de contexto extenso dejó de ser una prestación adicional claramente diferenciada y se acercó más a una característica básica del producto.
¿El precio estándar significa que procesar un millón de tokens es gratuito?
No. El contexto activo sigue consumiendo memoria, aumentando la latencia y contribuyendo a los costos de inferencia, incluso cuando el proveedor no cobra un recargo específico por contexto extenso.
¿Por qué un agente empresarial no puede simplemente cargar todo lo que quepa?
Los agentes persistentes acumulan instrucciones, archivos, resultados de herramientas, planes e historiales de sesión a lo largo de muchas llamadas. Volver a procesar todo repetidamente consume capacidad de atención y recursos de inferencia en material que puede estar obsoleto, duplicado o ser irrelevante.
¿Cómo deben administrar el contexto los desarrolladores de agentes persistentes?
Deben combinar la admisión selectiva, el almacenamiento en caché de instrucciones, la recuperación, los archivos externos, la memoria administrada, la compresión y el desalojo. El objetivo es mantener activo el estado que resulta pertinente en ese momento y almacenar o volver a cargar el resto de la información únicamente cuando sea necesario.
¿Qué métrica importa más que el tamaño máximo de la ventana de contexto?
El análisis propone medir el contexto utilizable por dólar y por segundo, evaluado mediante el costo de IA por tarea útil. Esta métrica permite determinar si un flujo de trabajo cumple sus requisitos de capacidad y latencia a lo largo de los pasos sucesivos de un agente.