En agosto de 2026, investigadores reportaron que modelos hermanos más débiles podían convertir en texto plano los rastros de razonamiento cifrados de Claude, GPT y Gemini. Un modelo más barato y menos capaz del mismo proveedor se convirtió en un decodificador del trabajo de frontera.
Puntos clave
- Investigadores reportaron en agosto de 2026 el resultado de extracción de rastros entre niveles en las familias de modelos Claude, GPT y Gemini.
- Google ubicó Gemini 2.5 Deep Think en su nivel Ultra de $250 al mes.
- Google DeepMind liberó como código abierto su modelo de pronóstico WeatherNext el 7 de agosto de 2026.
- Agents SDK de OpenAI añadió sandboxing nativo y un arnés dentro de la distribución para el despliegue y las pruebas de agentes de largo horizonte.
- El equipo Alignment Science de Anthropic advirtió que la cadena de pensamiento puede ser poco fiel o estar estratégicamente oculta.
El archivo del modelo ya no contiene toda la ventaja
Los pesos codifican capacidades reutilizables. Un sistema de razonamiento crea otra capa propietaria cada vez que se ejecuta. Su estado intermedio puede capturar la ruta de búsqueda que exploró, las instrucciones que moldearon su comportamiento, las alternativas que descartó y el trabajo específico de la tarea comprimido en la respuesta final.
Esa capa de ejecución adquiere relevancia comercial cuando un proveedor vende el razonamiento como producto premium. Google ubicó Gemini 2.5 Deep Think en un nivel Ultra de $250 al mes y describió al modelo como capaz de considerar múltiples ideas simultáneamente. El cliente ve la respuesta. Google retiene el proceso que hizo posible la respuesta premium.
Los equipos de seguridad no pueden equiparar ese proceso con una transcripción honesta de la cognición. El equipo Alignment Science de Anthropic advirtió que la cadena de pensamiento puede ser poco fiel o estar estratégicamente oculta. Un rastro en texto plano puede omitir, distorsionar o inventar una justificación.
Incluso un rastro poco fiel puede exponer prompts ocultos, estrategias candidatas, referencias a herramientas o comportamiento posterior al entrenamiento. Tiene valor operativo siempre que revele trabajo que su propietario pretendía restringir.
Un hermano barato puede convertirse en el intermediario confundido
La extracción entre niveles amplía la pregunta de seguridad más allá de quién puede descargar pesos o llamar al endpoint de frontera: abarca qué puede entender cada modelo autorizado dentro del sistema del proveedor.
Como el decodificador reportado provenía del mismo proveedor, la arquitectura del producto pasa a ser parte de la superficie de ataque. Un endpoint de menor costo puede tener menos capacidades, pero compartir suficiente familiaridad con los artefactos del proveedor para interpretarlos. El modelo barato no necesita vencer al modelo fuerte; solo necesita entender lo que produjo el modelo fuerte.
El costo y la latencia de inferencia vuelven inevitable esta frontera. Los proveedores reservan el razonamiento costoso para los pasos que lo requieren, enrutan el trabajo rutinario a modelos más baratos y trasladan la ejecución adecuada a los dispositivos. La economía unitaria produjo la arquitectura.
Gemini Robotics 2 muestra la forma resultante. Google DeepMind combinó varios modelos en un sistema robótico mientras posicionaba un modelo en el dispositivo para ejecutarse localmente y adaptarse a distintos cuerpos robóticos. Cada modelo cumple un propósito racional de costo, latencia o despliegue. Cada transferencia también determina qué puede inspeccionar, retener o reinterpretar el componente receptor.
Por tanto, un enrutador no puede elegir un modelo solo por precio, velocidad y puntuación en benchmarks. También debe saber si el modelo de destino puede entender el estado intermedio del modelo de origen. Cuando ambos niveles participan en un flujo de trabajo, un endpoint más barato conlleva autoridad de seguridad además de un menor precio.
Los agentes convierten la filtración de rastros en reconocimiento del flujo de trabajo
Los agentes de IA aumentan el valor del estado intermedio porque razonan sobre objetivos, toman decisiones, ejecutan acciones e interactúan con sistemas externos. Su capa de orquestación coordina modelos, herramientas, almacenes de memoria y permisos. Un rastro dentro de esa capa puede revelar tanto lo que consideró el modelo como lo que el sistema puede hacer después.
El estado de trabajo de un agente puede identificar qué documento recuperó, qué herramienta seleccionó, qué alcance de credenciales invocó y qué acciones planeó. Un atacante que lee ese estado obtiene un mapa del flujo de trabajo: dónde entra la autoridad, qué componentes confían entre sí y qué paso ofrece ventaja. La misma divulgación puede exponer lógica de tarea propietaria y una vía para subvertirla.
El Agents SDK de OpenAI añadió sandboxing nativo y un arnés dentro de la distribución para desplegar y probar agentes en tareas de largo horizonte. Esos controles abordan riesgos operativos que un filtro aislado de prompt-respuesta no puede contener. El sistema debe gobernar qué toca el agente mientras trabaja.
La custodia de rastros es, por tanto, parte del control verificable de los agentes. Un sandbox puede restringir acciones, pero el sistema también necesita evidencia de que el modelo, el enrutador y la cadena de herramientas manejaron el estado protegido conforme a la política. Las pruebas de capacidad preguntan si un agente puede completar la tarea; la custodia en ejecución registra quién aprendió cómo lo hizo.
La cartera de Google necesita más de una regla de secreto
Google DeepMind liberó WeatherNext como código abierto mientras mantuvo Deep Think en el nivel Ultra de pago. Esas decisiones asignan fronteras distintas a activos distintos: un modelo funciona como infraestructura compartida de pronóstico, mientras el razonamiento de otro modelo sostiene un producto premium. El propósito del producto determina qué artefacto requiere resguardo.
Deep Think, Gemini Robotics, el agente de seguridad CodeMender y variantes más baratas de Gemini pueden crear más valor en conjunto que cualquier checkpoint aislado. Google debe preservar los permisos entre esos componentes con la misma deliberación con que desarrolla sus capacidades.
El enrutador pertenece dentro de la bóveda
Los equipos de ingeniería pueden ubicar los artefactos de frontera y de niveles inferiores en contextos acotados separados, asignar a cada rastro un registro de procedencia y vincular el acceso a un modelo, sesión, tarea y propósito permitidos. Un modelo hermano no debería recibir autoridad genérica para interpretar un artefacto solo porque ambos modelos comparten proveedor.
Los proveedores pueden entonces aplicar el principio de mínimo privilegio en cada transferencia. Los enrutadores deben exponer solo la información necesaria para seleccionar un endpoint. Las herramientas deben recibir solo el estado de tarea necesario para su acción. Los almacenes de memoria deben separar el contexto duradero del usuario del estado temporal de razonamiento. Los registros de auditoría deben documentar qué modelo, herramienta y política tocaron cada artefacto protegido.
El cifrado sigue importando, pero no puede cargar con toda la política. El resultado entre niveles muestra por qué: un artefacto puede permanecer oscuro para externos mientras otro componente autorizado lo vuelve inteligible. Los proveedores necesitan una cadena de custodia computacional que controle la interpretación, no solo la posesión.
Preguntas frecuentes
¿Qué modelo más débil específico decodificó los rastros de cada proveedor?
La evidencia proporcionada identifica únicamente modelos hermanos más débiles y las familias Claude, GPT y Gemini. No nombra los modelos decodificadores, las versiones precisas de los modelos de frontera ni una correspondencia proveedor por proveedor.
¿Qué acceso técnico o formato de artefacto requirió el método de extracción?
La evidencia dice que rastros de razonamiento cifrados fueron convertidos en texto plano, pero no revela el esquema de codificación, los requisitos de acceso, los prompts ni otros pasos técnicos utilizados por los investigadores.
¿Anthropic, OpenAI o Google han revelado una solución o un cambio en los permisos de enrutamiento?
La evidencia proporcionada no describe ninguna corrección, respuesta del proveedor ni cambio de política de producto. El reporte establece una frontera de diseño que debe abordarse, no un compromiso documentado del enrutamiento de producción.
El resultado de agosto convirtió a hermanos más débiles en intérpretes de Claude, GPT y Gemini. Los proveedores dividen las tareas entre niveles de modelos porque el precio y la latencia lo incentivan; mantienen el razonamiento premium como propietario solo cuando cada enrutador, herramienta, almacén de memoria y modelo hermano cuenta con autoridad limitada por propósito. El enrutador pertenece dentro de la bóveda.