2026年8月11日、Nvidiaは、最大で4倍高速に出力を生成できるとするオープンAIモデルNemotron 3.5 Lightningと、各リクエストをどのモデルが処理するかを選ぶソフトウェアNeMo Switchyardを公開した。同時期の報道では、Nvidia、Apollo、BlackRockなどが$500 billion規模のインフラパッケージに関与しているとされた。チップ供給企業は、リクエストのルーティングと、どの設備能力が建設されるかを決める資金調達の両方に手を伸ばしていた。
要点
- Nvidiaは2026年8月11日にNemotron 3.5 LightningとNeMo Switchyardを公開した。
- Nemotron 3.5 Lightningは30BパラメータのMixture-of-Expertsモデルである。
- IBMとTogether AIは、Nvidia HGX B300システムを使うIBM Cloudの推論クラスターについて、確認済みの$240 millionの複数年契約を締結した。
- Nvidia、Apollo、BlackRockなどが関与すると報じられた$500 billionのAIインフラパッケージはなお協議中で、コミットメントも導入も発表されていない。
- AIインフラ企業は2025年に$100 billion超を借り入れた。
CUDAは、この拡張におけるNvidiaの技術的な接点である。オープンモデル、ルーティングソフトウェア、リファレンスクラスター、資本提携はいずれも同じ変化への応答だ。異種混在でコストに敏感な推論では、差別化のない実行能力を増やすよりも、リソース間の選択に価値が生じる。
今回のリリースは、30BパラメータのMixture-of-Expertsモデルとエージェント型ルーターを組み合わせた。NemotronはSwitchyardにとってNvidiaが管理する一つの行き先となる。レイテンシー、品質、コストが求めれば、ルーターは処理を別の場所へ送れる。
2024年の比較期間には、Nvidiaに関する記事の15.2%がエンタープライズの枠組みを用いていた。2026年には23.5%となった。コンシューマーの枠組みは18.3%から10.9%へ低下した。報道の焦点は、デバイスやチップから導入と資本配分へ、Nvidiaをスタックの上位へと追った。
CUDAは互換性を蓄積された優位性に変えた
Nvidiaは長年、ソフトウェアを通じてワークロードを自社ハードウェアへ引き寄せてきた。2018年には、同社はKubernetesにGPUサポートを追加し、その拡張をオープンソースのオーケストレーションコミュニティに提供した。NvidiaはIBM、HPEなどのパートナーとRapidsも立ち上げ、GPUアクセラレーションをデータサイエンスと機械学習のワークフローに結び付けた。2019年には、CUDAアクセラレーションをArm CPUにもたらし、AIおよびハイパフォーマンスコンピューティング向けソフトウェアをArmと共有すると述べた。
これらの統合により、構築者がNvidiaシステムへ持ち込めるワークロードの範囲は広がった。組織はその後、CUDAを中心にコード、ツール、運用慣行を蓄積した。書き直すよりも、そのまま使い続ける方が安くなった。
中国のAIラボは、数年の利用の後にこの蓄積がどう見えるかを示している。情報筋によれば、これらのラボは依然として主要な言語モデルをNvidiaのチップで学習させている。CUDAからHuaweiのCANNへ移行するには、大規模なコード変更が必要だからだ。ハードウェア購入が最初の関係をつくり、ソフトウェアがその後の購買判断をまたいでそれを維持した。
これらのラボはCUDAとの結び付きを保っているが、移行コストがNvidiaにモデル、ルーティング方針、サービス品質の閾値に対する権限を与えるわけではない。Nvidiaは強力な優位性を持って次の競争に入るが、勝利が保証されているわけではない。
高コストの判断はいま実行前に起きる
投資家に示された文書は、OpenAIとAnthropicが売上高の半分超を推論に費やしていることを示すと報じられている。この規模では、すべてのリクエストが、サービスが許容できる品質、レイテンシー、計算量についての判断を迫る。
Nemotronは、その判断の中でSwitchyardに一つの候補を与える。運用者は、すべてのリクエストに同じシステムとコストプロファイルを割り当てるのではなく、異なるタスクを異なるモデルへ振り向けられる。Nvidiaが主張する4倍の出力向上はこの提案を強めるだろう。ただし、独立した検証ではこの数値は確認されていない。
運用者はポータビリティ、レイテンシー、コスト、レジリエンス、ガバナンスの均衡を取らなければならない。一方でルーターは、その方針自体が失敗しうる新たなサービスを加える。ルーティングエラーは節約分を消し去り、不透明な方針は調達と説明責任を複雑にしうる。生のスループットは、買い手のコストの一部しか捉えない。
他の構築者も同じ圧力点へ向かっている。vLLM推論エンジンの開発者が設立したInferactは、推論サービングを商用化するため、$800 millionの評価額で$150 millionのシードラウンドを調達した。その一方でOpenAIのエンジニアは、推論コストを半分超削減できる可能性がある社内手法を見つけたと報じられている。これによりOpenAIはNvidiaのルーターを採用せずに、その効果を得られる。
Nvidia、OpenAI、Inferactは異なる方向からサービングコストに収束した。そのアプローチは最適化の価値を確立する一方、その価値を誰が所有するかは未決着のままである。
オープンモデルはリファレンスシステムの価値を高める
運用者は、モデルを入れ替えながらでもインフラを標準化できる。IBMとTogether AIは、オープンソースモデル向けにNvidia HGX B300システムを使うIBM Cloud上の推論クラスターを構築する、確認済みの$240 million、複数年契約を締結した。Together AIは変化するモデルカタログをサポートでき、IBMはその下の環境を標準化できる。
Nvidiaはこの実装経路を長年にわたり育ててきた。2018年のHGX-2は16基のGPUをAIおよびハイパフォーマンスコンピューティング向けのプラットフォームに統合した。Tesla T4はデータセンター推論を対象とし、Nvidiaは同じ消費電力で従来のTesla P4の最大12倍の性能をうたった。HGX B300システムは、運用者が完全なサービングシステムをますます重視する市場へ、このプラットフォームの論理を拡張する。
クラウド運用者は、クラスターアーキテクチャをその都度再構築せずに、オープンモデルを置き換えたり追加したりできる。多数のプロバイダーがNvidiaのリファレンスシステム、ソフトウェアライブラリ、運用慣行に収束する限り、単一のモデルプロバイダーが支配的にならなくてもNvidiaは繁栄できる。
IBM–Together AIの契約は、運用者に具体的な調達経路を与える。ハードウェアとソフトウェアの全コンポーネントを個別に組み立てず、オープン推論向けの複数年サービスを購入できる。オープンモデルによって買い手はカタログ項目を変更できるが、標準化された実装がその下のNvidia環境を維持する。
どの設備能力が存在するかは資金調達が決める
Nvidia、Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs、KKRなどは、$500 billionの資金調達パッケージに取り組んでいると報じられた。AIインフラ金融を通じ、配分はさらに上流へ移る。このパッケージはコミットメントや導入に先立ち、なお協議中だった。参加者は新たな設備能力に対する資金調達制約を標的にしていた。
他の取引は、より小規模ながらその仕組みを示している。Lambdaは、Nvidiaとの契約に基づくGPUの資金調達のため、$917 millionのレバレッジドローンを販売していると報じられた。Nvidiaは、電力インフラ開発企業Lanciumに$2 billionを投資することで合意したとされ、さらに$1 billionはStargateキャンパスでの性能閾値に連動しているとされた。チップ注文、電力用地、顧客契約、ローンは、ますます一つの金融商品として到来する。
AIインフラ企業は2025年に$100 billion超を借り入れた。一方で債務投資家は、実証されていないAI事業に疑義を示し、小規模企業により高い金利を課した。融資は建設を加速できるが、その保有コストは推論収入で支えられなければならない。利息付きで資金調達されたクラスターは、それでも事業モデルを維持しなければならない。
貸し手と資産所有者は、どの契約がバンクアブルか、どの電力プロジェクトが資本を受けるか、どのハードウェア構成が担保の裏付けとなるかを決めることで、設備能力を配分する。顧客、ソフトウェア、再販市場がすでに認知しているという理由でNvidia対応の導入を選好するなら、買い手の正式な連携なしに、資金調達が導入済み基盤を強化しうる。
機関投資家がNvidia製品を消費するシステムに資金を供給すれば、Nvidiaは利益を得る。一方、AI収入が設備投資を賄えなければ、貸し手と資産所有者がより大きなエクスポージャーを負う。これらの投資家が需要を生むのは、その前提となる稼働率を受け入れる間だけである。建設される設備能力の量を決めるのは見出しの金額ではなく、アンダーライティングだ。
ルーティングの力はすべてのリクエストで獲得しなければならない
競合チップメーカーは、別の境界から同じ配分問題を攻められる。Nvidiaの主要なAIプロセッサ競合であるAMDは、モデルの重みをシリコンに直接統合し、推論性能の向上を約束するスタートアップ、Taalasを買収した。Taalasは、モデルとハードウェアの上により広いルーティング層を挿入するのではなく、両者の距離を縮める。
OpenAIの報じられたコスト削減が示すように、顧客は最適化を自社システム内に保持することもできる。クラウドプロバイダー、モデルホスト、企業は、総運用コスト、レイテンシー、信頼性、ポータビリティ、方針の制御でルーターを評価する。Switchyardがこの比較で劣るところでは、ワークロードを社内システムに残せる。
借入金はこの試験を厳しくする。稼働率が想定を下回れば、資金調達済みの設備能力に利息が残るからだ。ハードウェア利用率を改善するルーティング層は、その経済性を支えられる。主にハードウェアへの結び付きを維持するだけなら、すでにレバレッジのかかったシステムにおけるもう一つのコストセンターとなる。
よくある質問
Nemotron 3.5 Lightningが最大4×高速な出力を実現するというNvidiaの主張を裏付けるには、どのような証拠が必要か
本文では、独立した検証はこの主張された向上を確認していないとしている。ベンチマーク手法、ワークロード、比較対象モデル、第三者評価の予定は示されていない。
NeMo Switchyardは、どのNvidia以外のモデルまたはハードウェアプラットフォームへ処理をルーティングできるのか
記事は、レイテンシー、品質、コストが求めればSwitchyardが別の場所へ処理を送れるとしているが、対応する外部モデル、クラウド、ハードウェアプラットフォームは特定していない。
報じられた$500 billionのインフラパッケージに、実際に資本をコミットした企業はどこか
コミットメントは特定されていない。報道では、Nvidia、Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs、KKRなどが、なお協議中のパッケージに取り組んでいるとされている。
Nvidiaが報じられたLanciumへの追加$1 billion投資を実行するには、どのような性能閾値を満たす必要があるのか
本文では、$1 billionがStargateキャンパスでの性能閾値に連動しているとしているが、閾値、測定基準、支払い時期は開示していない。
報じられたAIインフラ資金調達額
| 取引 | 金額 | 状況または条件 |
|---|---|---|
| Nvidia、Apollo、BlackRockなどが関与するインフラパッケージ | $500 billion | 協議中と報道。コミットメントも導入も発表されていない |
| Nvidiaとの契約に基づくGPU向けLambdaレバレッジドローン | $917 million | 販売中と報道 |
| 電力インフラ開発企業LanciumへのNvidia投資 | $2 billion | 合意済みと報道 |
| LanciumへのNvidia追加投資 | $1 billion | Stargateキャンパスでの性能閾値に連動 |
| 2025年のAIインフラ企業による借り入れ | More than $100 billion | 借入総額として報道 |
顧客が、Switchyardが有用な処理のコストを下げ、モデルと方針の制御を自らに残すことを検証できる間だけ、Nvidiaは配車デスクを握り続けられる。CUDAはコンパイル時にNvidiaから離れるコストを高くした。実行時には、すべてのリクエストが顧客に離脱の機会をもう一度与える。$500 billionは行き先に資金を供給できるかもしれないが、次のリクエストがどこへ向かうかは決められない。