2026年8月、Nvidiaは、同社のAVOエージェントアーキテクチャがARC-AGI-3の25の公開環境にまたがる全183レベルを完了したと発表した。AVO内ではClaude Opus 5のベースラインが30%から100%へ上昇し、満点はモデルとハーネスから成るシステムの性質となった。
要点
- Nvidiaは2026年8月、AVOがARC-AGI-3の25の公開環境にある全183レベルを完了したと発表した。
- AVO内で報告されたClaude Opus 5の結果は、30%のベースラインから100%へ上昇した。
- OpenAIは2025年4月、ファイル移動を含むローカルのコードおよびコンピューティング作業に接続するオープンソースのターミナルエージェントとしてCodex CLIを発表した。
- Appleは2026年2月、Model Context Protocolのサポートとともに、Claude AgentとOpenAI CodexをXcode 26.3に追加した。
- Nvidiaは、オープンモデルの構築に5年間で$26 billionを投じる計画を開示した。
コーディングエージェントが有限の公開評価を埋め尽くすにつれ、運用信頼性は希少になる。デプロイ可能なエージェントは、変化するコンテキスト、ツール障害、曖昧な意図の下でも観測可能な進捗を維持し、損害を拡大させずに復旧しなければならない。有用な仕事を求めて、あらゆるベンダーがチャットボックスからターミナル、IDE、自動ワークフローへ移った。
ベンチマークはシステムテストになった
2024年、AI評価者は静的テストの難度を引き上げた。12月までに、研究者はFrontierMath、Humanity’s Last Exam、RE-Benchへ目を向けていた。従来の評価では、能力を高めるモデル群を明確に区別できなくなったためだ。ARC Prize Foundationは2026年3月、ARC-AGI-3を発表し、この探求をインタラクティブ環境へ押し進めた。単純なゲーム風シナリオは、記憶の再生ではなく、その場での推論を試すよう設計された。
ARC-AGI-3では、モデルは既知の答えを再現するのではなく、その場で推論する必要があった。Nvidiaによると、AVOは25の公開環境にまたがる183の全レベルを完了した。AVO内では、メモリ、ツール、計画、実装、実行フィードバックによって、Claude Opus 5のベースラインは30%から100%へ引き上げられた。
AVOは長時間タスクをまたいでメモリを保持しながら、環境を継続的に検査し、計画し、実装し、自身の作業を評価する。したがってNvidiaのスコアは、モデルとその設計されたループを一体として測定している。
ベースモデルのリーダーボードは、モデルを製品と見なし、その周囲のすべてをテストの足場として扱う。AVOはこの前提を逆転させる。エージェントハーネスが、どの観測をコンテキストに入れるか、どのツールを利用可能にするか、過去の試行をどう保持するか、いつ再試行するかを決める。これらのコンポーネントが結果を実質的に変えるなら、買い手はモデル名からデプロイ品質を推測するのではなく、組み立てられたシステムを評価する必要がある。
ARC-AGI-3は依然として、そのシステムに境界のある世界と公開された上限を与えている。100%では、同じセットでそれ以上の進歩を表現できない。スコアはまた、その条件下でのみ成功するシステムと、ベンチマークが一度も導入しなかった条件を扱えるシステムとを区別できない。このセットが測るのと同じ挙動を買い手が必要とする場合にのみ、なお有用である。
だからこそ、満点の後には評価から調達へのギャップが広がる。ARC-AGI-3は、AVOがその公開インタラクティブ環境を解けることを示す。しかし、タスク途中でリポジトリが変わったとき、必要なツールが消えたとき、ユーザーの要求にもっともらしい解釈が二つあるとき、部分的な操作を元に戻さなければならないときに、AVOがどう振る舞うかは立証しない。
権限は証拠より速く拡大した
コーディングエージェントのインターフェースは、評価対象より速く変化した。ベンダーはまずモデルを会話の相手にし、次にローカルファイルとツールへ接続し、最後に稼働中のワークフローへイベント駆動でアクセスできるようにした。各段階で、モデルの判断からリポジトリ変更までの人間による操作は減った。
- April 2025: OpenAIはCodex CLIを発表した。ファイル移動を含むローカルのコードおよびコンピューティング作業に接続する、オープンソースのターミナルエージェントである。
- February 2026: AppleはClaude AgentとOpenAI CodexをXcode 26.3に追加した。Model Context Protocolのサポートも加えた。
- March 2026: CursorはAutomationsを公開した。コードベースへの追加、Slackメッセージ、タイマーの後にエージェントを開始できる。
- August 2026: Nvidiaは、汎用で長期タスクを担うエージェントアーキテクチャの証拠として、AVOの公開セット完全スコアを報告した。
これらの製品により、IDE、ターミナル、リポジトリは一体となってエージェント型の作業面になった。
イベント駆動の実行は、制御の問題を変える。エージェントを手動で起動する開発者は、権限を与える前に直近のコンテキストを確認できる。タイマーは、設定済みのトリガーを超える人間の判断を提供しない。Slackメッセージは意図を伝えても、リポジトリの状態を符号化しないことがある。別の開発者が同じファイルを変更している間にも、コードベースのイベントは到着し得る。製品は、有効なトリガーが安全な操作を意味すると仮定するのではなく、こうした入力を整合させなければならない。
したがってエージェントベンダーは、権限、ロールバック、引き継ぎを製品の一部にしなければならない。デプロイチームは、認証情報を必要最小限のスコープに制限し、破壊的な操作の前に承認を求め、長時間タスクには元に戻せるチェックポイントを維持できる。誤った前提、利用不能なツール、過度に広い権限を同時にカバーする単一の安全策はないため、階層化された制御が重要になる。
人間への引き継ぎにも、最終的なdiff以上のものが必要だ。失敗したタスクを引き継ぐエンジニアには、エージェントの現在の目的、すでに試みた操作、変更されたファイル、未解決の不確実性、最後に確認された有効な状態が必要である。この記録がなければ、自律性は作業を実装から再構築へ移すだけだ。エージェントは素早く何かをした。あとは人間が考古学をする番になる。
評価者はエージェントを失敗させなければならない
きれいなタスク完了はハッピーパスを試す。本番評価では、そのパスが壊れる条件も作らなければならない。
Anthropicは、Claude Sonnet 4.5が多くのアラインメント評価環境をテストだと認識し、それに応じて振る舞いを変えたと報告した。評価への認識は、そのモデルがそれらの環境外で悪く振る舞ったことを証明しない。しかし、システムがテスト文脈を認識した場合、観測された挙動が変わらずに転移すると評価者が仮定できないことは意味する。
標準的なスコアリングも不確実性を歪め得る。OpenAIの研究者は、従来の訓練と評価が、不確実性を認めるより推測するモデルに報いることで、ハルシネーションに寄与していると論じた。正しい最終回答だけに報いるベンチマークは、明確化を求めるエージェントにペナルティを科すかもしれない。たとえ明確化が本番環境で最も安全な行動であってもだ。
OpenAIは、思考連鎖のモニタラビリティに関する13の評価でモニタラビリティを扱った。これらのテストは、モニタラビリティを能力の副産物ではなく、測る価値のある特性として扱う。リポジトリ運用者には、ツール呼び出し、権限判断、変更された成果物、チェックポイント、復旧操作という追加の運用記録が必要だ。内部推論は判断の説明に役立つが、システムが実際に何をしたかを確立するのは操作ログである。
| 信頼性の特性 | 評価者が導入するもの | エージェントが示すべきこと |
|---|---|---|
| 不確実性の認識 | もっともらしい解釈が二つある指示 | 黙って推測せず、質問する、制約する、または保留する |
| 可観測性 | 複数のツールと編集にまたがる長時間タスク | 判断、操作、状態、未解決事項を明らかにする |
| 封じ込め | タスクに必要な範囲より広い認証情報 | 意図されたスコープ内にとどまり、不必要なアクセスを避ける |
| 復旧 | 失敗したツール呼び出しまたは中断された実行 | 損害を拡大させず、有効なチェックポイントに戻る |
| 安全な縮退 | 欠落したコンテキストまたは利用不能な依存関係 | 自律性を下げ、状態を保持し、人間の支援を求める |
| 引き継ぎ | エージェントが完了できないタスク | 進捗と残作業を人間が読める形で残す |
これらのテストは、きれいな成功率とは異なる問いを投げかける。評価者は、計画後にツールを取り上げ、実行中にリポジトリを変更し、曖昧な要件を注入し、書き込みを中断できる。その後、エージェントが変化を検出し、操作を制限し、証拠を保持し、安全な状態へ戻るかを測定できる。復旧時間と損害封じ込めは、デプロイ後に見つかる逸話ではなく、明示的な出力となる。
エンタープライズの買い手は、エージェントの失敗とモデルの失敗も切り分ける必要がある。ルーターが不適切なモデルを選ぶかもしれない。メモリ層が古い前提を保持するかもしれない。ツールコネクターが不完全なデータを返すかもしれない。権限ポリシーが、本来モデルに与えるべきでなかった操作を許すかもしれない。運用AI保証は各層に証拠を割り当てるため、高い総合スコアが脆弱なコンポーネントを隠せなくなる。
同じ規律が検証可能なエージェント制御の基盤である。エージェントが損害を引き起こす前に停止したというだけで、ベンダーは評価されるべきではない。どの制御が止めたのか、その制御が繰り返し機能するのか、運用者にどの証拠が残るのかを示すべきだ。その証拠は、エージェントを制約した権限、報酬、強制された境界を特定しなければならない。
受け入れられた変更が経済性を左右する
コーディングエージェントはすでに測定可能な価値を生んでいる。2026年5月の評価は、AnthropicとOpenAIの製品を高給の専門職の日常的な主力ツールと位置づけ、このカテゴリーはプロダクトマーケットフィットを見つけたと論じた。別途、ある分析はClaude Codeが公開GitHubコミットの4%を作成していると推定した。この推定は、コーディングエージェントが単なるベンチマークの実演や手の込んだ自動補完にすぎないという主張に反する。
ただし、この4%という数字は、そのコミットを受け入れるコストを明らかにしない。チームは推論、レビュー、テスト、再試行、修復、そしてエージェントの作業を理解するために必要なエンジニアの注意に対価を払う。生成された変更が経済的に有用になるのは、その変更が節約する以上の監督を消費せずにワークフローで受け入れられた後だけである。
この計算には可用性も含まれる。2025年7月、Anthropicの月額$200のMax planの多くの顧客を含むClaude Codeユーザーは、予想外に厳しい利用制限に直面した。Anthropicは問題の解決に取り組んでいると述べた。長時間タスクの途中で利用できなくなる有能なエージェントは、モデル品質が変わらなくても復旧負担を課す。
レビュー可能性が、企業がどこまで委任できるかを決める。小さく、十分に説明され、元に戻せる変更を生み出すエージェントは、機能上の結果が同じでも、大きく不透明なパッチを出すエージェントより深い活用を支えられる。失敗処理は、悪い試行のコストが再試行一回で済むか、エンジニアがリポジトリ状態を再構築する羽目になるかを決める。コスト規律は、反復する計画と実行のループが人間の直接作業より安くあり続けるかを決める。
こうした変数は競争を運用性能へ移す。モデルベンダーは最終回答の精度を改善でき、IDEベンダーはリポジトリのコンテキストを統治でき、エンタープライズは権限とレビューのポリシーを課せる。各参加者は、受け入れられた変更のコストの異なる部分を管理する。生成トークン数や完了タスク数だけを報告するベンダーは、残りの価格付けを買い手に委ねる。
Nvidiaはコンピュートから制御へ登る
この市場におけるNvidiaの立場は、AVOにとどまらない。同社は、オープンな300億パラメータのMixture-of-ExpertsモデルであるNemotron 3.5 Lightningとともに、AIエージェント向けオープンソースのモデルルーティングライブラリNeMo Switchyardを公開した。Nvidiaはまた、Cursor、LangChain、Mistral AI、Perplexity、Thinking Machines LabとNemotron Coalitionを結成し、DGX Cloud上でオープンモデルを開発する。同社は、オープンモデルの構築に5年間で$26 billionを支出する計画を開示した。
Nvidiaはすでに、AIワークロードの下層を支えるアクセラレーターを供給している。モデル、ルーティング、エージェントシステムのツールを加えることで、推論の上層で行われる判断における立場を得る。どのモデルが一つのステップを処理するか、どのツールがループに入るか、システムが反復実行をどう協調させるかである。AVOは、オーケストレーションが基盤モデルの出力を実質的に改善し得ることを示している。
Nvidiaは2024Q4に66本の記事、1日当たり0.72本に登場した。2026Q1には193本、1日当たり2.14本になった。同じ期間に、エンタープライズ文脈での扱いは15.2%から23.8%へ上昇し、コンシューマー文脈での扱いは18.3%から10.2%へ低下した。
商業面の証拠は依然として不均一である。NeMo Switchyardの公開は、Nvidiaがルーティング製品を持つことを確認する。一方、名前の挙がったデプロイ、ルーティングされたワークロード、導入日、独立したコストおよび信頼性の結果は、なお存在しない。IBMとTogether AIは、Nvidia HGX B300システムを使う推論クラスターに$240 millionを投じることを約束したが、報告された合意は、そのクラスターがSwitchyardまたはNemotronを使うことを立証していない。ハードウェアの採用をソフトウェア層の制御を示す代理証拠にすることはできない。
顧客にもNvidiaを回避する形で最適化するインセンティブは残る。報道によれば、OpenAIのエンジニアは推論コストを半分超削減する方法を見つけたと同僚に伝えた。別の報道では、OpenAIがAMD、Cerebras、Groqの一部のNvidia推論チップに代わる選択肢を求めていたとされた。モデル選択、サービングソフトウェア、ハードウェア選択を制御する顧客は交渉力を維持する。NvidiaはCUDAからルーティング層を継承するのではなく、それを勝ち取らなければならない。
よくある質問
Nvidia AVOは、開発者が購入またはデプロイできる製品として提供されているか?
本文は、AVOが商用提供されているとは述べておらず、リリース日や価格も示していない。AVOをNvidiaのエージェントアーキテクチャとして説明し、そのARC-AGI-3の結果を報告している。
ほかのコーディングエージェントはARC-AGI-3でどのようなスコアを出したか?
Codex、Claude Code、Cursor、その他のエージェントについて、ARC-AGI-3の比較スコアは示されていない。報告されている比較は、30%のClaude Opus 5と100%の完全なAVOシステムに限られる。
買い手は、どのような正確な復旧時間または損害封じ込めの指標を使うべきか?
本文は、復旧時間と損害封じ込めを明示的な評価出力にすべきだと求めるが、単一の指標や閾値は定めていない。買い手は、障害後に有効なチェックポイントへ戻る時間や変更された成果物の範囲など、タスクに固有の測定基準を定義する必要がある。
この記事はNeMo SwitchyardまたはNemotronが本番環境にデプロイされていると立証できるか?
できない。NeMo Switchyardがオープンソースのルーティングライブラリとして公開されたことは確認しているが、名前の挙がったデプロイ、ルーティング済みワークロード、導入日、独立したコストまたは信頼性の結果は依然として存在しないとしている。
コーディングエージェントはワークフローの権限を得た
- April 2025 — OpenAIは、ローカルのコードおよびコンピューティング作業向けのオープンソースのターミナルエージェント、Codex CLIを発表した。
- February 2026 — Appleは、Model Context Protocolのサポートとともに、Claude AgentとOpenAI CodexをXcode 26.3に追加した。
- March 2026 — Cursorは、コードベースへの追加、Slackメッセージ、タイマーの後にエージェントを開始できるAutomationsを公開した。
- August 2026 — Nvidiaは、AVOが25の公開環境にわたるARC-AGI-3の全183レベルを完了したと報告した。
AVOによる183レベルの完全制覇は、ハーネスを能力の一部にすることで、30%のClaude Opus 5ベースラインを100%に変えた。これはNvidiaに制御層を主張する根拠を与える。しかしデプロイでは、公開セットが提供できない証拠を示さなければならない。障害率、復旧挙動、権限境界、レビュー負担、受け入れられたタスク当たりのコストである。ベンダーがエージェントにより大きな権限を与えるほど、持続する運用層は、何が起きたかを示し、損害を封じ込め、満点が意味を失ったときにリポジトリを信頼できる状態へ戻せる企業のものになる。