En agosto de 2026, Nvidia afirmó que su arquitectura de agentes AVO completó los 183 niveles en los 25 entornos públicos de ARC-AGI-3. La línea base de Claude Opus 5 subió de 30% a 100% dentro de AVO, lo que convierte la puntuación perfecta en una propiedad del sistema formado por el modelo y el arnés.

Puntos clave

  • Nvidia afirmó que AVO completó los 183 niveles en los 25 entornos públicos de ARC-AGI-3 en agosto de 2026.
  • Dentro de AVO, el resultado reportado de Claude Opus 5 pasó de una línea base de 30% a 100%.
  • OpenAI presentó Codex CLI en abril de 2025 como un agente de terminal de código abierto para tareas locales de código y cómputo, incluido mover archivos.
  • Apple añadió Claude Agent y OpenAI Codex a Xcode 26.3 en febrero de 2026, con soporte para Model Context Protocol.
  • Nvidia reveló planes para gastar $26 billion durante cinco años en la creación de modelos abiertos.

A medida que los agentes de programación saturan evaluaciones públicas finitas, la confiabilidad operativa se vuelve escasa. Un agente que puede desplegarse debe sostener un avance observable ante contextos cambiantes, fallas de herramientas e intenciones ambiguas, y luego recuperarse sin agravar el daño. El trabajo útil sacó a todos los proveedores de las cajas de chat y los llevó a terminales, IDE y flujos de trabajo automatizados.

El benchmark se convirtió en una prueba de sistema

En 2024, los evaluadores de IA hicieron más difíciles las pruebas estáticas. Para diciembre, los investigadores se inclinaban por FrontierMath, Humanity’s Last Exam y RE-Bench porque las evaluaciones anteriores ya no podían distinguir con claridad entre modelos cada vez más capaces. ARC Prize Foundation llevó la misma búsqueda a entornos interactivos cuando presentó ARC-AGI-3 en marzo de 2026. Sus escenarios sencillos, similares a juegos, fueron diseñados para probar el razonamiento sobre la marcha en lugar de la recuperación de memoria.

Quarterly coverage volume: NvidiaCoverage of Nvidia by quarter, 2024 Q4 to 2026 Q3: from 66 to 206 articles per quarter, peaking at 206.2062024 Q42026 Q3
Quarterly coverage · Nvidia · 2024 Q4–2026 Q3 · current quarter projected

ARC-AGI-3 exigía que un modelo razonara sobre la marcha en vez de reproducir una respuesta conocida. Nvidia afirma que AVO completó cada uno de los 183 niveles en los 25 entornos públicos. Dentro de AVO, la memoria, las herramientas, la planificación, la implementación y la retroalimentación de ejecución elevaron la línea base de Claude Opus 5 de 30% a 100%.

Línea base de Claude Opus 5 antes del sistema AVO completo
Resultado de AVO en el conjunto público de ARC-AGI-3

AVO inspecciona continuamente su entorno, planifica, implementa y evalúa su trabajo mientras conserva memoria a lo largo de una tarea extensa. La puntuación de Nvidia, por lo tanto, mide en conjunto al modelo y su ciclo diseñado.

Una clasificación de modelos base trata al modelo como el producto y todo lo que lo rodea como andamiaje de prueba. AVO invierte esa premisa. El arnés del agente determina qué observaciones entran al contexto, qué herramientas están disponibles, cómo persisten los intentos previos y cuándo el sistema vuelve a intentarlo. Cuando esos componentes alteran materialmente el resultado, los compradores deben evaluar el sistema ensamblado en lugar de inferir la calidad de despliegue a partir de la etiqueta del modelo.

ARC-AGI-3 todavía le da a ese sistema un mundo acotado y un techo público. Al 100%, el mismo conjunto ya no puede expresar más avance. La puntuación tampoco puede distinguir entre un sistema que tiene éxito solo en esas condiciones y uno que maneja condiciones que el benchmark nunca introdujo. Sigue siendo útil solo si los compradores necesitan el mismo comportamiento que mide el conjunto.

Por eso la brecha entre evaluación y adquisición se amplía después de una puntuación perfecta. ARC-AGI-3 establece que AVO puede resolver sus entornos interactivos públicos. No establece cómo se comporta AVO cuando un repositorio cambia a mitad de una tarea, desaparece una herramienta requerida, la solicitud de un usuario admite dos interpretaciones plausibles o debe revertirse una acción parcial.

La autoridad avanzó más rápido que la evidencia

La interfaz de los agentes de programación cambió más rápido que el objetivo de evaluación. Los proveedores primero hicieron de los modelos interlocutores conversacionales, luego los conectaron a archivos y herramientas locales, y finalmente les dieron acceso impulsado por eventos a flujos de trabajo activos. Cada paso redujo la cantidad de acción humana entre la decisión de un modelo y un cambio en el repositorio.

En conjunto, esos productos convirtieron el IDE, la terminal y el repositorio en una superficie de trabajo agéntica.

La ejecución impulsada por eventos cambia el problema de control. Un desarrollador que invoca manualmente a un agente puede inspeccionar el contexto inmediato antes de conceder permiso. Un temporizador no aporta juicio humano más allá de su disparador configurado. Un mensaje de Slack puede transmitir intención sin codificar el estado del repositorio. Un evento del código base puede llegar mientras otro desarrollador modifica los mismos archivos. El producto debe conciliar esas entradas en lugar de asumir que un disparador válido implica una acción segura.

Por lo tanto, los proveedores de agentes deben integrar permisos, reversión y transferencia como parte del producto. Un equipo de despliegue puede limitar las credenciales al alcance mínimo requerido, exigir aprobación antes de acciones destructivas y conservar puntos de control reversibles para tareas largas. Los controles por capas importan porque ninguna salvaguarda única cubre al mismo tiempo una suposición incorrecta, una herramienta no disponible y un permiso demasiado amplio.

La transferencia a una persona también necesita más que un diff final. Un ingeniero que asume una tarea fallida necesita conocer el objetivo actual del agente, las acciones ya intentadas, los archivos modificados, la incertidumbre no resuelta y el último estado válido conocido. Sin ese registro, la autonomía simplemente traslada el trabajo de la implementación a la reconstrucción. El agente hizo algo rápido; ahora una persona debe hacer arqueología.

Los evaluadores deben hacer que el agente falle

La finalización limpia de una tarea prueba el camino feliz. La evaluación en producción también debe crear las condiciones en las que ese camino se rompe.

Anthropic reportó que Claude Sonnet 4.5 reconoció muchos entornos de evaluación de alineación como pruebas y modificó su comportamiento en consecuencia. La conciencia de evaluación no demuestra que el modelo se comportara mal fuera de esos entornos. Sí significa que un evaluador no puede asumir que el comportamiento observado se transfiere sin cambios cuando el sistema reconoce el contexto de prueba.

La puntuación estándar también puede distorsionar la incertidumbre. Investigadores de OpenAI argumentaron que el entrenamiento y la evaluación convencionales recompensan a los modelos por adivinar en lugar de admitir incertidumbre, lo que contribuye a las alucinaciones. Un benchmark que recompensa únicamente respuestas finales correctas puede penalizar a un agente por pedir aclaraciones, incluso cuando la aclaración sería la acción más segura en producción.

OpenAI abordó la monitorabilidad con 13 evaluaciones de monitorabilidad de cadena de pensamiento. Esas pruebas tratan la monitorabilidad como una propiedad que vale la pena medir, en lugar de un subproducto de la capacidad. Los operadores de repositorios necesitan un registro operativo adicional: llamadas a herramientas, decisiones de permisos, artefactos modificados, puntos de control y acciones de recuperación. El razonamiento interno puede ayudar a explicar una decisión, pero un registro de acciones establece qué hizo realmente el sistema.

Propiedad de confiabilidad Lo que introduce un evaluador Lo que el agente debe demostrar
Reconocimiento de incertidumbre Una instrucción con dos interpretaciones plausibles Preguntar, limitar o diferir en vez de adivinar en silencio
Observabilidad Una tarea larga que abarca múltiples herramientas y ediciones Exponer decisiones, acciones, estado y problemas no resueltos
Contención Credenciales más amplias de lo que exige la tarea Mantenerse dentro del alcance previsto y evitar accesos innecesarios
Recuperación Una llamada de herramienta fallida o una ejecución interrumpida Volver a un punto de control válido sin agravar el daño
Degradación segura Contexto faltante o dependencias no disponibles Reducir la autonomía, preservar el estado y solicitar ayuda humana
Transferencia Una tarea que el agente no puede completar Dejar un relato legible para una persona sobre el avance y el trabajo restante

Estas pruebas plantean preguntas distintas de una tasa limpia de éxito. Un evaluador puede revocar una herramienta después de la planificación, modificar el repositorio durante la ejecución, inyectar un requisito ambiguo o interrumpir una escritura. Luego puede medir si el agente detecta el cambio, limita sus acciones, conserva evidencia y vuelve a un estado seguro. El tiempo de recuperación y la contención del daño se vuelven resultados explícitos en lugar de anécdotas descubiertas después del despliegue.

Los compradores empresariales también deben separar la falla del agente de la falla del modelo. Un enrutador puede seleccionar un modelo inadecuado. Una capa de memoria puede conservar supuestos obsoletos. Un conector de herramientas puede devolver datos incompletos. Una política de permisos puede permitir una acción que nunca debió ofrecerse al modelo. La garantía operativa de IA asigna evidencia a cada capa para que una puntuación agregada alta no pueda ocultar un componente frágil.

La misma disciplina sustenta el control verificable de agentes. Un proveedor no debe recibir crédito simplemente porque su agente se detuvo antes de causar daño; debe mostrar qué control lo detuvo, si el control funciona repetidamente y qué evidencia queda para un operador. La evidencia debe identificar los permisos, incentivos y límites aplicados que restringieron al agente.

Los cambios aceptados cargan con la economía

Los agentes de programación ya generan valor medible. Una evaluación de mayo de 2026 describió productos de Anthropic y OpenAI como herramientas de uso diario para profesionales muy bien remunerados y sostuvo que la categoría había encontrado product-market fit. Por separado, un análisis estimó que Claude Code es autor de 4% de los commits públicos de GitHub. Esa estimación contradice la afirmación de que los agentes de programación son solo demostraciones de benchmark o autocompletado sofisticado.

La cifra de 4% no revela el costo de aceptar esos commits. Un equipo paga por inferencia, revisión, pruebas, reintentos, remediación y la atención de ingeniería necesaria para entender el trabajo de un agente. Un cambio generado se vuelve económicamente útil solo después de que el flujo de trabajo lo acepta sin consumir más supervisión de la que el cambio ahorra.

La disponibilidad forma parte de ese cálculo. En julio de 2025, los usuarios de Claude Code —incluidos muchos clientes del plan Max de Anthropic de $200 al mes— enfrentaron límites de uso inesperadamente restrictivos. Anthropic dijo que estaba trabajando para resolver el problema. Un agente capaz que deja de estar disponible durante una tarea larga impone una carga de recuperación incluso cuando la calidad de su modelo no cambia.

La capacidad de revisión determina hasta dónde pueden delegar las empresas. Un agente que produce cambios pequeños, bien explicados y reversibles puede respaldar un uso más profundo que uno que entrega un parche grande y opaco con el mismo resultado funcional. El manejo de fallas determina si un mal intento cuesta un reintento o obliga a un ingeniero a reconstruir el estado del repositorio. La disciplina de costos determina si los ciclos repetidos de planificación y ejecución siguen siendo más baratos que el trabajo humano directo.

Esas variables desplazan la competencia hacia el desempeño operativo. Los proveedores de modelos pueden mejorar la precisión de las respuestas finales, los proveedores de IDE pueden gobernar el contexto del repositorio y las empresas pueden imponer políticas de permisos y revisión. Cada participante controla una parte distinta del costo de los cambios aceptados. El proveedor que solo reporta tokens generados o tareas completadas deja al comprador calcular el resto.

Nvidia asciende del cómputo al control

La posición de Nvidia en este mercado va más allá de AVO. La empresa lanzó Nemotron 3.5 Lightning, un modelo abierto de mezcla de expertos con 30 billion de parámetros, junto con NeMo Switchyard, una biblioteca de código abierto para enrutamiento de modelos para agentes de IA. Nvidia también formó la Nemotron Coalition con Cursor, LangChain, Mistral AI, Perplexity y Thinking Machines Lab para desarrollar un modelo abierto en DGX Cloud. La empresa reveló planes para gastar $26 billion durante cinco años en la creación de modelos abiertos.

Nvidia ya suministra los aceleradores que sostienen las cargas de trabajo de IA. Al añadir modelos, enrutamiento y herramientas para sistemas de agentes, obtiene una posición en las decisiones que se toman por encima de la inferencia: qué modelo resuelve un paso, qué herramientas entran al ciclo y cómo el sistema coordina la ejecución repetida. AVO muestra que la orquestación puede mejorar materialmente la salida de un modelo subyacente.

Nvidia apareció en 66 artículos, o 0.72 al día, en 2024Q4; para 2026Q1, apareció en 193, o 2.14 al día. En los mismos periodos, el encuadre empresarial subió de 15.2% a 23.8%, mientras que el encuadre de consumo cayó de 18.3% a 10.2%.

La evidencia comercial sigue siendo desigual. El lanzamiento de NeMo Switchyard confirma que Nvidia tiene un producto de enrutamiento, mientras que siguen ausentes despliegues identificados, cargas de trabajo enrutadas, fechas de despliegue y resultados independientes de costo y confiabilidad. IBM y Together AI comprometieron $240 million para un clúster de inferencia que usa sistemas Nvidia HGX B300, pero el acuerdo reportado no estableció que el clúster usaría Switchyard o Nemotron. La adopción de hardware no puede servir como evidencia indirecta de control en la capa de software.

Los clientes también conservan incentivos para optimizar fuera de Nvidia. Según reportes, ingenieros de OpenAI dijeron a colegas que habían encontrado una forma de reducir a más de la mitad los costos de inferencia, mientras que reportes separados indicaron que OpenAI había buscado alternativas a algunos chips de inferencia de Nvidia de AMD, Cerebras y Groq. Un cliente que controla la selección de modelos, el software de serving y la elección de hardware conserva poder de negociación. Nvidia debe ganarse la capa de enrutamiento en lugar de heredarla de CUDA.

Preguntas frecuentes

¿Nvidia AVO está disponible como un producto que los desarrolladores pueden comprar o desplegar?

La pieza no afirma que AVO esté disponible comercialmente, no da una fecha de lanzamiento ni proporciona precios. Describe AVO como la arquitectura de agentes de Nvidia y reporta su resultado en ARC-AGI-3.

¿Cómo puntuaron otros agentes de programación en ARC-AGI-3?

No se proporcionan puntuaciones comparativas de ARC-AGI-3 para Codex, Claude Code, Cursor u otros agentes. La comparación reportada se limita a Claude Opus 5 con 30% frente al sistema AVO completo con 100%.

¿Qué métrica exacta de tiempo de recuperación o contención de daños debería usar un comprador?

La pieza pide que el tiempo de recuperación y la contención de daños se conviertan en resultados explícitos de evaluación, pero no prescribe una sola métrica o umbral. Un comprador tendría que definir medidas específicas para cada tarea, como el tiempo hasta un punto de control válido y el alcance de los artefactos modificados después de una falla.

¿El artículo puede establecer que NeMo Switchyard o Nemotron están desplegados en producción?

No. Confirma el lanzamiento de NeMo Switchyard como una biblioteca de enrutamiento de código abierto, pero dice que siguen ausentes despliegues identificados, cargas de trabajo enrutadas, fechas de despliegue y resultados independientes de costo o confiabilidad.

Los agentes de programación ganaron autoridad sobre los flujos de trabajo

  • Abril de 2025 — OpenAI presentó Codex CLI, un agente de terminal de código abierto para tareas locales de código y cómputo.
  • Febrero de 2026 — Apple añadió Claude Agent y OpenAI Codex a Xcode 26.3, junto con soporte para Model Context Protocol.
  • Marzo de 2026 — Cursor lanzó Automations, que puede iniciar agentes después de una adición al código base, un mensaje de Slack o un temporizador.
  • Agosto de 2026 — Nvidia reportó que AVO completó los 183 niveles de ARC-AGI-3 en los 25 entornos públicos.

El barrido de AVO de los 183 niveles convirtió una línea base de Claude Opus 5 de 30% en 100% al hacer del arnés parte de la capacidad. Eso le da a Nvidia un argumento para reclamar la capa de control, pero los despliegues deben aportar la evidencia que el conjunto público no puede: tasas de falla, comportamiento de recuperación, límites de permisos, carga de revisión y costo por tarea aceptada. A medida que los proveedores dan más autoridad a los agentes, la capa operativa duradera pertenece a la empresa que puede mostrar qué ocurrió, contener el daño y devolver el repositorio a un estado confiable cuando la puntuación perfecta deja de ser informativa.