中国モデルは現在、OpenRouterにおける米国企業のトークン使用量のほぼ60%を占める。ソフトウェアがリクエストごとにサプライヤーを選ぶようになったため、米国のアプリケーションはワークロード全体を単一の中国ベンダーに委ねずとも、この比率を生み出せる。
要点
- 推論はベンダーへのコミットメントから、リクエスト単位の調達へ移行している。アプリケーションは呼び出しごとに、品質、レイテンシー、可用性、価格を基準としてモデルを選べる。
- 400超のモデルにわたり週25兆トークンというOpenRouterの規模は、ルーティングが単にAPIアクセスを簡素化するだけでなく、機能する市場を生み出せることを示している。
- 中国のオープンウェイトモデルは信頼できる低コストの代替手段を提供している。OpenRouter上の米国企業によるトークン使用量のほぼ60%を占め、独自モデルのサプライヤーに対する買い手の交渉力を高めている。
- ルーターがトラフィックを振り替えられるなら、コスト削減が自動的にプロバイダーの利益率になることはない。あるモデルが価値あるワークロードにとって代替不能でない限り、買い手が節約分をより多く得る。
- 持続する支配点は評価とワークフローのレイヤーにある。ただしルーターは、信頼できる選定、フォールバック、コンプライアンス、説明責任を通じて、買い手の社内システムを上回らなければならない。
買い手がコスト低下の恩恵を得られるのは、サプライヤーを切り替えられる場合だけである。モデルの選択肢が長いだけでは大した意味はない。アプリケーションが呼び出しごとに求められる品質、レイテンシー、可用性、価格に応じてソフトウェアで繰り返し選べるとき、交渉力を得る。
一つのモデルに固定されたアプリケーションでは、効率改善の利益をどれだけ確保するかはプロバイダーが決める。アプリケーションが信頼できる代替手段の間でルーティングできれば、各プロバイダーはワークロードを再び獲得するために競争しなければならない。共通インターフェースは、サプライヤー同士の協調なしにその競争を生む。
ルーターはAPI呼び出しを調達イベントに変える
OpenRouterの週間取引量は、6カ月で5倍に成長し、5兆トークンから25兆トークンへ増えた。対象は400超のモデルに及ぶ。
この規模では、ルーティングは開発者の利便性を超える。ソフトウェアは各リクエストを、高価な最先端モデル、より安価な代替手段、フォールバックのサプライヤー、あるいは並列稼働する複数モデルに割り当てられる。アプリケーションはモデル選定を、半年ごとに見直すアーキテクチャ上のコミットメントではなく、毎分数千回行う運用上の判断にできる。
どのルーティング企業の売り文句よりも、Metaの行動のほうが示唆的である。同社は、最上位モデルの価格を無差別に支払うのではなく、一部のタスクを低コストモデルへ振り向けるSwitchboardを開発している。Metaには最先端の推論を負担する余力があるが、その規模ゆえにセグメンテーションには価値がある。問うべきは、このリクエストにはどのモデルで十分か、となる。
開発者は当初、同じアプリケーションをより安く動かすために低コストの推論を使った。ルーターによって、異なる仕事に異なる水準の推論を割り当てる形でアプリケーションを再設計できるようになり、リクエストが競争の単位となった。
中国のオープンウェイト供給が代替を実用化した
ルーターには信頼できる代替手段が必要である。中国のオープンウェイトモデルは、ベンダーリスク対策だった分散化を本番環境へ移すのに足る品質と低コストで、その代替手段を提供してきた。
中国モデルは、OpenRouterにおける米国企業のトークン使用量のほぼ60%を占める。DeepSeekとMiniMaxの低コストモデルは2月、トークン消費量で米国の競合を上回り始めた。この消費量の数値が記録するのは、ベンチマーク投票ではなく割り当てられたワークロードである。
推論クラウドはその代替を容易にする。CursorはComposer 2統合のため、Fireworks AI経由でMoonshot AIのKimi K2.5にアクセスしている。Fireworksが統合の境界を引き受け、モデルをもう一つのキャパシティ供給源として提供するため、この米国アプリケーションは中国のサプライヤーを中心に再編する必要がない。
買い手が自らモデルをホストしない場合でも、オープンウェイトはサプライヤープールを広げる。ルーター、推論クラウド、マネージドプラットフォームは、各アプリケーションに製品の作り直しを強いることなく、より多くの代替手段を提供できる。
規制当局と企業のセキュリティチームは、そのプールを狭めうる。中国モデルへの制限は、すでにそれらを使うワークロードを混乱させる一方、コンプライアンス規則は技術的には代替可能なモデルを不適格にしうる。そうした制約の中でも、推論クラウドが組み込みを容易にすると、米国のアプリケーションは低コストの中国モデルを選んだ。
品質はポートフォリオの結果になりつつある
一つのモデルがアプリケーションの品質上限を決めるのは、すべてのタスクを受け取る場合だけである。ルーティングはその束を解く。定型的なリクエストは低価格モデルへ、難しいリクエストは最先端システムへ、失敗したリクエストは第二のサプライヤーへ送れる。複雑な作業では、複数の出力を組み合わせることもできる。
OpenRouterのFusionは、複数モデルに並列でプロンプトを送り、結果を統合することで、このポートフォリオの論理を明示する。同社は、Fusionがディープリサーチのタスクで、半額でFable水準の性能に到達、あるいはそれを上回れると主張する。
その主張だけで経済性は決まらない。Fusionは、コールスタックにプレミアムのOpusモデルを判定役として残していたと報じられている。高価な評価器が、より安価な基盤モデルによる節約分を吸収しかねないため、買い手はスタック全体を数えなければならない。
アプリケーションは、コスト、レイテンシー、性能にまたがって推論ポートフォリオを最適化できる。買い手は、単独のベンチマークでどのモデルが最上位かだけを問わなくなる。ワークフローが許容可能な結果をどれほど安く達成できるかを問う。
最高のモデルが品質上限を決める場合でも、最も安いモデルが定型業務の価格を決めうる。
最先端モデルは、難しい裾野の領域で大きな価格決定力を維持できる。ルーティングは、その優位性が測定可能で価値がある呼び出しに最良のモデルを限定することで、プレミアム需要をむしろ集中させる可能性さえある。より広い推論市場は分裂している。安価な汎用キャパシティと意図的に選ばれる専門キャパシティに分かれ、取り除くと成果を十分に損ない、その価格を正当化できるモデルにプレミアムの経済性が残る。
サプライヤーの効率化はもはや利益率を保証しない
モデルプロバイダーには、コストを引き下げる強力な手段がなおある。OpenAIとAnthropicは投資家に対し、推論コストが売上高の半分を超えると説明しており、提供効率がその経済性の中核となっている。OpenAIのエンジニアも、推論コストを半分超削減する手法を見つけたと報じられている。
プロバイダーは、こうした改善を値下げ、利益率の引き上げ、利用量の拡大に使える。しかし複数のプロバイダーが一つのリクエストを処理でき、アプリケーションがその間を移動できるなら、一社のコスト削減は競争市場における新たな入札となる。競合は対応し、ルーターはトラフィックを再配分し、改善の一部は買い手へ渡る。
サプライヤーは、より安いトークンが十分な需要を喚起し、拡大する市場を取り込めると期待するかもしれない。総需要は依然として増えうるが、どのプロバイダーにもそこから生じる価値は保証されない。買い手は需要をセグメント化し、高価値の呼び出しにはプレミアムモデルを確保し、定型業務を低価格のプールへ押し込める。
買い手にとって運用上の対応は具体的だ。タスクごとに成果を測定し、コストとレイテンシーの上限を設け、安価なシステムが失敗するリクエストに最先端モデルを限定する。信頼できる評価がなければ、ルーティングは無差別なコスト削減にすぎない。
コントロールプレーンはその地位を勝ち取らなければならない
投資家は、アクセス、カスタマイズ、選定を大きな商業機能として評価している。OpenRouterの年換算売上高は$50 millionを超えた。一方Fireworks AIは、October 2025に$4 billionと評価された後、$15 billionの評価額で資金調達を目指したと報じられている。
ルーターは、その地位が守れると決め込めない。MetaのSwitchboardは、大口の買い手が推論費用とワークロード量によって努力を正当化できるようになると、ルーティングを内製化できることを示す。大口の買い手は共通エンドポイントを再現できるため、ルーターにはアクセス以上に深い優位性が必要である。
ルーターが価値を維持できるのは、買い手が単独で下すより優れた判断を下せるときだけである。信頼できる評価、確実なフォールバック、レイテンシー管理、コンプライアンス、成功を定義するワークフローとの統合を提供しなければならない。その堀は、次の重要な呼び出しに向けてモデルを選び、選定を説明し、失敗時に責任を負うことにある。
OpenRouterの規模では、そのほぼ60%という比率は可視化された買い手の交渉力である。週25兆トークンにわたり、信頼できる代替手段、切り替えの自由、信頼できる評価があれば、すべてのリクエストを新たな入札に変え、アプリケーションが勝者を決められる。
推論がルーティングされる市場になりつつある証拠
| 証拠の日付 | 市場シグナル | 具体的な数値 |
|---|---|---|
| 2026-05-27 | OpenRouterの週間取引量 | 25兆トークン、6カ月前の5兆トークンから増加 |
| 2026-05-27 | 利用可能なサプライヤープール | 400+モデル |
| 2026-06-15 | OpenRouter Fusionが主張する経済性 | 半額でFable水準の知能 |
| 2026-07-22 | OpenRouterにおける米国企業利用での中国モデルの比率 | トークンの約60% |
よくある質問
モデルルーティングはどのように推論を調達市場へ変えるのか?
ルーターは各リクエストを評価し、アプリケーションを一つのモデルに固定するのではなく、適切なサプライヤーへ割り当てる。これによりプロバイダーは、価格、品質、レイテンシー、可用性を巡ってワークロードを繰り返し競わなければならなくなる。
この変化において、中国のオープンウェイトモデルが重要なのはなぜか?
信頼できる低コストの代替手段のプールを拡大するからである。中国モデルはOpenRouter上の米国企業のトークン使用量のほぼ60%を占める。推論クラウドとマネージドプラットフォームにより、アプリケーションは各ベンダーと直接統合せずにこれらのモデルを使える。
最先端モデルは価格決定力をすべて失うのか?
失わない。ルーティングは、取り除くと結果が測定可能なほど悪化する難しい、または高価値のリクエストに最先端モデルを限定できる。一方、定型業務の価格はより安価なモデルが決める。
マルチモデルのワークフローは常にコストを下げられるのか?
そうではない。OpenRouterは、Fusionが半額でFable水準のディープリサーチ性能を提供できると主張するが、プレミアムのOpusモデルを判定役として使っているとの報告は、買い手がワークフロー全体のコストを評価しなければならない理由を示している。
ルーティングプラットフォームが防御可能になる条件は何か?
共通エンドポイントだけでは再現可能であり、特にMetaのような大口買い手にはそうである。ルーターには、優れたタスク評価、信頼できるフォールバック、レイテンシーとコンプライアンスの制御、ワークフロー統合、重要なルーティング判断への説明責任が必要だ。