El 14 de agosto de 2026, Anthropic hará que el modo automático sea el predeterminado para los usuarios de Claude Code con planes Pro, Max y Team. En pruebas, su clasificador detectó el 89% de los comandos peligrosos; los usuarios que dependían de la aprobación manual detectaron aproximadamente el 14%. El resultado respalda dar más autonomía a un agente porque los humanos encargados de supervisarlo fueron el control de seguridad más débil.
Puntos clave
- Anthropic hará que el modo automático de Claude Code sea el predeterminado para los planes Pro, Max y Team el 14 de agosto de 2026.
- Anthropic informa que su clasificador de modo automático detectó el 89% de los comandos peligrosos en pruebas.
- La prueba de aprobación manual de Anthropic incluyó a 1,053 usuarios de pago.
- Los participantes que usaron aprobación manual detectaron un comando de solo texto claramente peligroso el 13.6% de las veces.
- Después de 50 solicitudes de permisos, la detección manual en la prueba de Anthropic cayó a cerca del 5%.
La revisión automatizada aporta la autonomía de ejecución que se necesita
El modo automático crea una inversión de supervisión: Anthropic da a Claude Code más tiempo de ejecución ininterrumpido porque un clasificador separado revisa sus comandos de shell y acciones. Ese revisor puede superar a usuarios habituados. La pregunta más difícil es si cada herramienta, credencial, sandbox y servicio posterior limita al agente a la autoridad real de la tarea.
Anthropic presentó el modo automático en marzo para tomar decisiones de nivel de permisos mientras bloqueaba operaciones destructivas como la eliminación masiva de archivos. La empresa ahora plantea la función en torno a ejecuciones más largas entre interrupciones y tareas de varias horas más viables. La revisión automatizada hace más que sustituir un control de seguridad; le da a Claude Code más tiempo para trabajar sin que haya una persona presente.
Los usuarios todavía pueden cambiar los modos de permisos, mientras que los administradores de cuentas administradas pueden fijar un valor predeterminado o desactivar por completo el modo automático. Sin embargo, Anthropic cambia el comportamiento habitual al cambiar el valor predeterminado. La mayoría de los usuarios utiliza el producto tal como está configurado, no como podría configurarse en teoría.
La repetición convierte la aprobación en una ceremonia
Anthropic probó la aprobación manual con 1,053 usuarios de pago. Los participantes detectaron un comando de solo texto claramente peligroso el 13.6% de las veces, y su desempeño se deterioró a medida que se acumulaban las solicitudes.
Las solicitudes repetitivas enseñan a los usuarios que la aprobación es el precio rutinario del avance. La interfaz entonces pide a una persona cada vez más habituada distinguir una solicitud peligrosa entre decenas inofensivas. La seguridad obtiene un botón; la fatiga obtiene el clic.
El resultado del clasificador debilita el argumento a favor de exigir que una persona apruebe cada acción consecuente. La revisión humana rutinaria puede ser una defensa excepcionalmente deficiente, mientras que una revisión automatizada calibrada puede preservar restricciones sin detener el trabajo útil.
OpenAI llegó al mismo problema de diseño desde otra dirección cuando añadió sandboxing nativo y un entorno de pruebas dentro de la distribución a su Agents SDK para tareas de horizonte largo. El modelo puede elegir una acción, pero el entorno limita dónde puede ejecutarse esa acción y qué puede afectar.
CISA aportó una versión menos elegante de la lección. La agencia atribuyó la exposición por parte de un contratista de claves privadas de acceso a la nube y otras credenciales a controles débiles alrededor de repositorios públicos de GitHub. Un revisor de comandos no puede restringir una credencial que una organización ya hizo demasiado amplia, duradera o pública.
Los permisos de las herramientas definen el radio de impacto
Cuando un agente escribe código, consulta una base de datos o inicia un flujo de trabajo, los sistemas que lo rodean le dan su poder. El modelo elige una acción; las herramientas y credenciales determinan hasta dónde llega esa acción.
Apple ha incorporado agentes de programación de Anthropic y OpenAI en Xcode y añadió soporte para MCP. Cada integración expone más funciones de software a quienes llaman desde máquinas, por lo que los permisos detrás de esas funciones pasan a formar parte del límite de seguridad del agente.
Por lo tanto, los administradores deben especificar a qué repositorio, base de datos, entorno o cuenta puede acceder un agente; cuánto tiempo sigue siendo válida su credencial; qué identidad delegó la acción; y quién puede revocar esa delegación. Un agente capaz con una credencial limitada tiene un alcance limitado. Un agente cauteloso con un token de administrador sigue estando a un error de consecuencias de administrador.
Cuanto mejor sea la revisión automatizada, más daño puede autorizar una credencial excesivamente amplia antes de que un humano revise.
La inyección de prompts vuelve concreta la distinción. Un atacante puede colocar instrucciones en código, documentos o mensajes que un agente lee. Las pruebas de Claude Cowork de Anthropic destacaron este riesgo conforme los agentes de propósito general fueron más allá de la programación. Un límite de autorización acotado puede rechazar una solicitud manipulada incluso cuando el modelo acepta la instrucción inyectada.
Estos controles se superponen en vez de sustituirse entre sí. Un clasificador inspecciona la operación propuesta, un sandbox contiene la ejecución, una credencial acotada niega el acceso excesivo y un servicio posterior aplica su propia política. Cada control detecta una falla diferente.
La coordinación amplía una sesión hasta convertirla en una superficie operativa
Anthropic también ha habilitado que las sesiones de Claude Code se envíen mensajes entre sí, compartan hallazgos, hagan preguntas y coordinen el trabajo. Anthropic dice que una sesión puede contactar a otra cuando un cambio afecta la tarea de esa sesión. Una tarea coordinada ahora puede abarcar varias sesiones en lugar de un usuario, una sesión y un comando.
Cursor extiende la cadena en una dirección diferente. Cursor Automations puede iniciar agentes cuando alguien cambia una base de código, envía un mensaje de Slack o llega una hora programada. Un temporizador no padece fatiga por solicitudes porque no espera a una persona en absoluto.
Estos productos todavía implementan autonomía orquestada en lugar de una agencia plenamente autodirigida. Los agentes actuales pueden seleccionar herramientas y recorrer rutas predefinidas, pero no pueden mantener de forma confiable la alineación a medida que cambian sus estrategias. La coordinación añade transferencias mientras esa limitación persiste.
Las organizaciones deben preservar la identidad y la autoridad en todo el grafo de orquestación. Una segunda sesión no debe heredar silenciosamente más acceso que la primera. Un flujo de trabajo iniciado desde Slack debe conservar el usuario iniciador, la fuente y el contexto de política. Cuando un temporizador inicia el trabajo, el administrador que creó la automatización sigue formando parte de la cadena de custodia.
El trabajo sin supervisión se convierte en un problema de auditoría
Los proveedores de agentes tienen un incentivo económico directo para eliminar la fricción de aprobación. Cada interrupción evitable vuelve a añadir tiempo de espera humano a un producto que se vende para eliminarlo.
Los compradores empresariales pueden leer la tasa de detección de un clasificador, pero también deben responder preguntas operativas más difíciles. ¿Qué identidad actuó? ¿Qué herramienta otorgó permiso? ¿Qué credencial cruzó el límite? ¿Qué estado posterior cambió? ¿Qué administrador puede detener el flujo de trabajo o revocar el acceso?
Los proveedores necesitan registros y controles que respondan esas preguntas después de la ejecución, restrinjan las acciones antes de la ejecución y retiren la autoridad mientras un flujo de trabajo de larga duración sigue activo. Bloquear prompts riesgosos puede reducir incidentes; preservar identidad, delegación y revocación permite a los clientes gobernar el trabajo sin supervisión.
Preguntas frecuentes
¿La tasa de detección reportada del 89% incluye falsas alarmas?
El texto informa la tasa a la que el clasificador detectó comandos peligrosos, pero no proporciona una tasa de falsos positivos, un umbral de confianza ni un desglose de los comandos bloqueados incorrectamente.
¿Qué operaciones destructivas bloquea el modo automático de Claude Code?
La eliminación masiva de archivos es la única operación bloqueada específica mencionada en el texto. No proporciona una lista completa de comandos o categorías de acciones que el clasificador rechazará.
¿El modo automático será el predeterminado para planes además de Pro, Max y Team?
El despliegue descrito aplica a los planes Pro, Max y Team a partir del 14 de agosto de 2026. El texto no indica la configuración predeterminada para ningún otro plan.
¿Cómo puede una organización revocar el acceso de un agente durante una ejecución activa?
El texto identifica la revocación en tiempo real como un control que los proveedores deben admitir, pero no especifica una API, un flujo de trabajo administrativo ni un límite de tiempo particular para que la revocación surta efecto.
Resultados de las pruebas de seguridad de Claude Code
| Método de revisión | Medida | Resultado | Contexto de prueba |
|---|---|---|---|
| Clasificador automatizado | Comandos peligrosos detectados | 89% | Pruebas de Anthropic |
| Aprobación manual | Comando de solo texto claramente peligroso detectado | 13.6% | 1,053 usuarios de pago |
| Aprobación manual después de solicitudes repetidas | Tasa de detección | ~5% | Después de 50 solicitudes |
La brecha de 89% a 14% explica por qué Anthropic puede sacar la supervisión de cada solicitud de permisos. Ese cambio da más peso a identidades acotadas, credenciales limitadas, ejecución aislada, registros auditables y revocación durante una ejecución activa. El cuadro de permisos no desaparece; el sistema lo absorbe.