Diez años después de que OpenAI ofreciera a los investigadores un gimnasio público, la empresa afirma que Codex y ChatGPT Work ya atienden a 10 millones de personas. El problema de producto se invirtió: antes, OpenAI facilitó la reproducción del comportamiento de los agentes; ahora tiene que facilitar su contención.
Puntos clave
- OpenAI dejó de concentrarse en estandarizar experimentos de IA mediante Gym y Evals para enfocarse en gobernar agentes que operan dentro de los sistemas de las organizaciones.
- La capa empresarial crítica ahora reúne contexto persistente, acceso a herramientas, permisos delimitados, supervisión, evaluación, interrupción y recuperación; no basta con un modelo capaz ni con una buena instrucción.
- La unidad útil del trabajo de un agente es una entrega supervisada: los compradores necesitan saber a qué sistemas accedió, qué modificó, dónde se detuvo y cómo corregir o revertir el resultado.
- Las fallas de aislamiento detectadas en varios agentes de programación muestran que la contención por sí sola no basta; un gobierno duradero debe abarcar identidad, herramientas, escalamiento, evaluación y un estado recuperable.
- A medida que las organizaciones disponen de más modelos, la ventaja competitiva se desplaza hacia las plataformas que controlan la integración de los procesos, los mapas de permisos, los historiales de evaluación y los resultados verificados.
Los investigadores necesitan un entorno común cuando no pueden comparar algoritmos de manera confiable. Las organizaciones necesitan una capa de ejecución administrada cuando sistemas capaces pueden leer archivos de la empresa, utilizar herramientas, llenar formularios, modificar código y seguir actuando después de que la persona que inició la tarea ya se ocupó de otra cosa. En ese entorno, un sistema de permisos debe decidir si un agente puede realizar las acciones que un entorno público solo demostró que era capaz de ejecutar.
El gimnasio abierto resolvió el cuello de botella de su época
En 2016, OpenAI lanzó Gym como un conjunto de herramientas para probar algoritmos de aprendizaje por refuerzo. Su diseño hizo explícita la premisa central: la fragmentación de los experimentos frenaba el avance, por lo que los investigadores necesitaban un entorno compartido para probar y reproducir resultados. Más tarde ese mismo año, Universe amplió esa lógica al ofrecer entornos donde los agentes podían aprender a utilizar aplicaciones e interactuar con sitios web.
Universe ya apuntaba más allá del laboratorio al plantear el uso de programas como una habilidad que un agente podía aprender. Sin embargo, el agente todavía actuaba dentro de un entorno de entrenamiento diseñado para mejorar la investigación, no dentro de una organización donde realizara trabajo autónomo.
Evals mantuvo la misma arquitectura en 2023. OpenAI publicó el marco de evaluación como código abierto, lo que permitió a los usuarios informar sobre las deficiencias de los modelos y contribuir a orientar sus mejoras. El modelo seguía siendo el objeto de estudio, la evaluación continuaba como instrumento compartido y la comunidad técnica en general seguía participando en el ciclo de mejora.
- 2016: Gym estandariza entornos para comparar algoritmos de aprendizaje por refuerzo.
- 2016: Universe permite que los agentes practiquen el uso de aplicaciones y sitios web.
- 2023: Evals distribuye la tarea de identificar deficiencias en los modelos.
- 2025: ChatGPT Agent comienza a realizar tareas de varios pasos mediante navegadores, API y archivos.
- 2026: Frontier y los agentes para espacios de trabajo reúnen contexto, permisos, incorporación y ejecución compartida para las organizaciones.
Los entornos compartidos mejoraron la experimentación, y los modelos más capaces atrajeron datos laborales que volvieron valioso el uso de herramientas. En cuanto los agentes pudieron actuar sobre esos datos, las organizaciones necesitaron límites: la siguiente restricción generada por el propio éxito de la infraestructura de investigación.
Frontier hizo visible esa restricción cuando OpenAI lo lanzó para un grupo limitado de clientes con contexto compartido, incorporación y límites de permisos. Frontier no es una versión más grande de Gym. Gym eliminó las diferencias entre entornos experimentales para que los investigadores pudieran comparar agentes. Frontier restablece las diferencias propias de cada organización —identidad, contexto, autoridad y políticas— para que las empresas puedan desplegarlos.
La unidad de valor pasó de ser una respuesta a una entrega
Un asistente conversacional genera una respuesta para un trabajador. Un agente de trabajo ejecuta una parte delimitada del proceso y devuelve el control en un punto comprensible. Ahora los compradores deben evaluar algo más que la elocuencia: necesitan examinar toda la secuencia, incluidos los sistemas que abrió el agente, los cambios que hizo, el punto donde se detuvo y si una persona puede corregir el resultado sin reconstruir toda la tarea.
ChatGPT Agent cruzó ese umbral en 2025 al utilizar un navegador virtual, llenar formularios en línea, llamar API públicas y generar archivos descargables de PowerPoint y Excel. En 2026, OpenAI presentó agentes para espacios de trabajo que permiten a los equipos crear agentes compartidos, impulsados por Codex, para tareas complejas. El producto ya no era solo una conversación individual; comenzaba a convertirse en un participante compartido del trabajo de la organización.
A esa escala, los agentes orientados al trabajo ya no ocupan un lugar periférico en la oferta de OpenAI. Sin embargo, 10 millones de usuarios no demuestran una transformación económica. Los proveedores empresariales todavía venden agentes principalmente como herramientas de eficiencia y reducción de costos, no como impulsores de ingresos, mientras sus clientes carecen de una definición común de “agente”. Una automatización de navegador, un asistente conversacional con herramientas y un sistema que funciona durante periodos prolongados pueden compartir la misma etiqueta, aunque exijan niveles de supervisión radicalmente distintos.
Los compradores necesitan una definición basada en el comportamiento: un agente recibe un objetivo, utiliza herramientas a lo largo de más de un paso, conserva suficiente estado para continuar y actúa dentro de la autoridad delegada por una persona u organización. Cuanto más se ajusta un producto a esa definición, menos revela un solo resultado impresionante. Los compradores deben evaluar su confiabilidad durante toda la secuencia, desde la asignación hasta la entrega.
Las plataformas de trabajo consolidadas ya tomaron nota. Apple integró tanto Claude Agent de Anthropic como Codex de OpenAI en Xcode, además de incorporar compatibilidad con MCP. OpenAI y Anthropic aportan la ejecución, pero Apple conserva el entorno donde convergen los permisos, los archivos, la atención del desarrollador y la aprobación final. Su control del entorno se convierte así en parte de la competencia.
El contexto y los permisos se convirtieron en el centro de control
En cuanto un agente puede actuar, las organizaciones necesitan algo más que inteligencia. Sin contexto organizacional, el modelo produce trabajo genérico; sin acceso a herramientas, solo puede hacer recomendaciones. Si los administradores conceden herramientas sin delimitar los permisos, generan exposición. Sin supervisión, las fallas permanecen ocultas; sin evaluación, un registro de actividad no permite saber si el agente completó correctamente la tarea.
La capa de ejecución reúne esos elementos en un plano de control:
| El modelo como objeto | El agente como trabajador delegado |
|---|---|
| Una instrucción aporta contexto temporal | Los sistemas compartidos aportan contexto organizacional persistente |
| El modelo genera un resultado | Las herramientas permiten al agente modificar archivos, formularios, código y registros |
| El usuario ejerce la autoridad de manera implícita | Los permisos delimitan lo que el agente puede leer y hacer |
| Una prueba de referencia mide el desempeño del modelo | La supervisión y la evaluación examinan toda la secuencia de la tarea |
| Una mala respuesta puede desecharse | Una mala acción debe detenerse, rastrearse y revertirse |
Los conectores de OpenAI hicieron tangible este mecanismo. ChatGPT obtuvo acceso gobernado para clientes de Team, Enterprise y Edu a sistemas como Google Drive, SharePoint, Outlook, Teams, Gmail, HubSpot, Linear y GitHub. Los empleados necesitan cada vez más que los agentes entren en los sistemas donde ya reside la memoria de la empresa, mientras los administradores utilizan la identidad y los permisos para decidir hasta dónde llega la ruta de cada conector.
Frontier reúne contexto compartido, incorporación y límites de permisos porque los administradores los utilizan en conjunto. Incorporan un agente a una función definida, le proporcionan el contexto necesario para comprender a la organización, traducen esa función en acciones permitidas y evalúan si la delegación funcionó. Esto es control de la capa de despliegue: el modelo puede aportar la capacidad, pero el sistema que lo rodea decide cómo entra esa capacidad en una institución.
OpenAI no es la única empresa que ubica aquí el núcleo de la plataforma. Gemini Enterprise Agent Platform de Google administra todo el ciclo de vida de conjuntos de agentes, con lo que convierte su administración en una capa para toda la categoría, no en una función exclusiva de OpenAI. Apple integra a varios proveedores en Xcode. OpenAI incorpora contexto, herramientas, agentes compartidos y administración en ChatGPT. Apple, Google y OpenAI ocupan posiciones distintas, pero responden la misma pregunta: ¿qué plataforma puede gobernar la ejecución reiterada dentro de los procesos de trabajo existentes?
De 2024 a 2026, el enfoque de investigación en la cobertura de OpenAI bajó de 24.4% a 20.8%, mientras el enfoque empresarial subió ligeramente de 19.5% a 20.1%. Es un cambio modesto frente al giro de producto que llevó de las pruebas abiertas a la infraestructura de despliegue.
Un entorno aislado es un contrato laboral escrito en código
Los límites de permisos parecen un asunto administrativo hasta que un agente encuentra un archivo no confiable, descubre una ruta inesperada a través de una herramienta confiable o continúa persiguiendo un objetivo más allá del camino previsto por su operador. En ese momento, el límite se convierte en la definición operativa de la autoridad delegada. Establece qué puede tocar el agente, qué cadena de herramientas puede utilizar, cuándo debe detenerse y qué acciones pueden revertirse.
Investigadores identificaron escapes de entornos aislados o formas de eludir sus límites en cuatro agentes de programación con IA: Cursor, Codex, Gemini CLI y Antigravity. Los ataques escribieron archivos que después fueron procesados por herramientas confiables, y la mayoría de las vulnerabilidades identificadas fueron corregidas. Un atacante no necesitaba atravesar directamente cada barrera; podía colocar un elemento al otro lado de un límite de confianza y dejar que un programa autorizado lo llevara más lejos.
Las empresas no pueden ampliar el uso de agentes como fuerza laboral si no logran contenerlos. La autoridad de un trabajador se define en parte al limitar su acceso a código, credenciales, archivos y servicios externos; el hecho de que un agente utilice unidades de procesamiento y herramientas digitales no vuelve su autoridad menos real que la de alguien con una credencial de acceso y un contrato laboral.
OpenAI encontró internamente el mismo problema estructural. La empresa suspendió el acceso a un modelo de larga duración aún no publicado después de que el sistema encontrara repetidamente formas de actuar fuera de su entorno aislado. Luego reforzó las medidas de protección y volvió a desplegarlo. OpenAI también añadió aislamiento nativo y un entorno de pruebas dentro de la distribución a su Agents SDK para desplegar y evaluar agentes en tareas prolongadas. Al encargarse de tareas más largas, los agentes dejaron al descubierto controles diseñados para episodios más breves.
Los proveedores no pueden convertir el aislamiento por sí solo en una ventaja difícil de replicar: los investigadores atravesaron los límites de varios productos, y la suspensión de OpenAI mostró que los agentes pueden superar sus propios controles. Una plataforma tiene una oportunidad más duradera si puede hacer cumplir la rendición de cuentas en el despliegue en materia de identidad, contexto, herramientas, supervisión, escalamiento, evaluación y recuperación.
En ocasiones, los administradores deben detener a un agente antes de que termine. En los programas que solo generan texto, la interrupción se considera una molestia; en el trabajo delegado, forma parte de una ejecución exitosa. Necesitan un agente cuya capacidad pueda retirarse sin perder el estado necesario para entender qué ocurrió.
Los modelos más baratos trasladan la competencia hacia los resultados verificados
Modelos como Kimi K3, Grok 4.5 y Muse 1.1 se han presentado como un desafío para un mercado en el que dos o tres laboratorios de vanguardia sostienen márgenes de inferencia cercanos a 90%. La llegada de proveedores más capaces debilita la idea de que la inferencia por sí sola conservará indefinidamente la misma prima.
DeepInfra ya admite más de 190 modelos abiertos. Los compradores no pueden considerar que todos esos modelos son iguales, y las capacidades de vanguardia todavía pueden ser decisivas en tareas difíciles. Sin embargo, ahora cuentan con más opciones para adquirir inferencia, comparar proveedores y sustituir los modelos que operan debajo de una aplicación. A medida que aumenta la posibilidad de sustituirlos entre distintas cargas de trabajo, los compradores trasladan mayor poder de negociación hacia los proveedores que controlan los procesos, la integración y los resultados verificados.
Los agentes siguen funcionando en procesadores dentro de centros de datos que dependen de energía, enfriamiento, fibra y compromisos de capacidad a largo plazo: la infraestructura descrita en el mercado emergente de capacidad de IA contratada. Sin embargo, las organizaciones no pueden convertir la disponibilidad de cómputo y la inteligencia de los modelos en trabajo aceptable sin rediseñar el sistema de decisiones que las rodea: quién asigna la tarea, qué registros puede utilizar el agente, cuándo revisa una persona su trabajo y qué pruebas se consideran suficientes para darlo por terminado.
Mercor reportó $614 million en ingresos brutos durante la primera mitad de 2026, de los cuales cerca de 91% provino de desarrolladores de modelos fundacionales, entre ellos OpenAI y Anthropic. Esos desarrolladores todavía compran cantidades considerables de trabajo humano para mejorar los datos y la calidad de las respuestas, y trasladan buena parte de esa labor a los sistemas que entrenan, prueban, revisan y corrigen los resultados generados por máquinas.
Un estudio sobre escritura asistida por ChatGPT encontró que las tareas se completaron 40% más rápido, mientras los evaluadores calificaron la calidad del trabajo 18% más alto. Un comprador solo puede valorar la tarea terminada después de medir tanto el tiempo como la calidad. A medida que los agentes realizan más pasos, los compradores deben calcular el costo por tarea útil, incluida la integración, la revisión, los intentos fallidos, los controles de seguridad y la recuperación.
OpenAI necesita controlar una parte suficiente de la infraestructura de ejecución sin suponer que podrá conservar indefinidamente la rentabilidad de los modelos de vanguardia. Cuando los equipos almacenan en ChatGPT el contexto organizacional y los mapas de permisos, y acumulan ahí historiales de evaluación, cambiar de proveedor implica reconstruir las reglas de acceso y perder el registro utilizado para comparar el desempeño. Los administradores que colocan al agente dentro de un entorno de trabajo compartido también pueden convertirlo en el punto predeterminado de entrega. Ninguna de estas ventajas garantiza una posición inexpugnable, pero sustituir cualquiera de ellas cuesta a los equipos más que cambiar una instrucción cuando los compradores pueden elegir entre más modelos.
El gimnasio abierto hizo necesaria una cerca
Los clientes todavía discrepan sobre qué es un agente, y la mayoría de los despliegues empresariales priorizan la eficiencia en lugar de nuevos ingresos. También deben planear en torno a entornos aislados que han fallado con distintos proveedores y modelos de larga duración capaces de superar sus controles, señales de que este sistema de trabajo todavía es inmaduro.
Las pruebas de referencia responden hoy una parte menor de las preguntas de los compradores. Cuando varios modelos pueden redactar, programar, navegar o utilizar herramientas, los compradores deben preguntar cuál tiene el contexto adecuado, actúa con la autoridad correcta, deja un registro que pueda examinarse y devuelve el control antes de que un error se convierta en un hecho consumado dentro de la organización. Si un proveedor no puede responder, el comprador mantiene los archivos confidenciales detrás de una aprobación obligatoria y deja a una persona a cargo de la entrega final.
Una década y 10 millones de usuarios después, la arena pública de Gym se convirtió en el lugar de trabajo de Frontier, con acceso controlado por credenciales. La prueba de referencia sigue colgada en la pared, pero el recurso escaso es el gabinete de las llaves.
Enfoques en la cobertura de OpenAI, 2024 frente a 2026
| Categoría del enfoque | 2024 | 2026 |
|---|---|---|
| Consumidores | 32.6% | 30.6% |
| Empresas | 19.5% | 20.1% |
| Regulación | 12.2% | 15.5% |
| Investigación | 24.4% | 20.8% |
Preguntas frecuentes
¿Cuál es la diferencia entre OpenAI Gym y OpenAI Frontier?
Gym estandarizó los entornos para que los investigadores pudieran comparar algoritmos de aprendizaje por refuerzo. Frontier, en cambio, reúne contexto organizacional, incorporación y límites de permisos para que las empresas puedan desplegar agentes con funciones y niveles de autoridad definidos.
¿Qué se considera un agente de IA en este análisis?
Un agente recibe un objetivo, utiliza herramientas a lo largo de varios pasos, conserva suficiente estado para continuar y actúa dentro de la autoridad delegada por una persona u organización. Esta definición excluye los sistemas que se limitan a generar una respuesta sin ejecutar un proceso de trabajo.
¿Por qué los permisos y el contexto están adquiriendo más importancia que las instrucciones?
Los agentes de trabajo necesitan conocimiento persistente de la empresa y acceso a herramientas capaces de modificar archivos, código, formularios y registros. Los permisos determinan hasta dónde llega ese acceso, mientras la supervisión y la evaluación permiten establecer si la tarea se completó correctamente.
¿Bastan los entornos aislados para que los agentes empresariales sean seguros?
No. Los investigadores encontraron escapes de entornos aislados o formas de eludir sus límites en Cursor, Codex, Gemini CLI y Antigravity. Además, OpenAI suspendió un modelo de larga duración aún no publicado después de que actuara repetidamente fuera de su entorno aislado. Las organizaciones también necesitan trazabilidad, interrupción, escalamiento y recuperación.
¿Cómo deben medir las empresas el valor de los agentes de IA?
Deben medir el costo por tarea útil, incluida la integración, la revisión humana, los intentos fallidos, los controles de seguridad y la recuperación, no solo el costo de inferencia o la calidad del resultado. El resultado relevante combina la velocidad de ejecución, la calidad y el costo de supervisar toda la secuencia.