2026年8月、OpenRouterは400以上のAIモデルで週25Tトークンを処理したと報じられた。6カ月前の5Tから増加した。モデル間の切り替えコストは、その切り替えが機能したかを知るコストより速く下がっていた。ルーターが代替を日常化する一方で、エージェントはトークン価格やリーダーボードの範囲を超えて成功を押し広げた。
要点
- OpenRouterは2026年8月、400以上のモデルで週25兆トークンを処理したとされる。6カ月前の5兆トークンから増加した。
- DeepSeek V4-Flashの価格は、入力100万トークン当たり$0.14、出力100万トークン当たり$0.28である。
- Artificial Analysisは、ベンチマークテスト当たりのコストをDeepSeek V4-Flashは$0.03、Kimi K3は$0.86、GPT-5.6 Solは$1.86と推定した。
- DeepSeek V4-FlashはArtificial Analysis Intelligence Indexで50を記録し、4月のプレビューを10ポイント上回った。
- Alibabaは、2.4兆パラメータのQwen3.8-MaxとQwen3.8-27Bのウェイトを公開するとした。
この18カ月の流れの初め、モデル競争はなお一本のはしごに収まっていた。AlibabaはQwen2.5-Maxを投入し、GPT-4o、DeepSeek-V3、Llama-3.1-405Bをほぼ全面的に上回ると主張した。明白な問いは、どの研究所が最も能力の高いモデルを作ったかだった。
それ以降、エンタープライズAIを導入する企業はプロバイダー間でワークロードをルーティングし始め、モデル競争は測定システムそのものへ広がった。ベンチマーク、定価ベースのトークン、オープンウェイトのライセンス、エージェントタスク評価は、それぞれ実在するが部分的な性質を示す。
トークン料金では仕事の完了まで測れない
AlibabaはQwen3.8-Maxを入力100万トークン当たり$2、出力100万トークン当たり$6で価格設定している。Moonshot AIのKimi K3は$3と$15である。DeepSeek V4-Flashははるかに低く、入力100万トークン当たり$0.14、出力100万トークン当たり$0.28である。
調達チームにとって重要なのは、受け入れられた結果で終わる請求額である。あるモデルはより長い回答を出し、より多くのツールを呼び出し、外部アクションに失敗し、リクエストを再試行し、結果を人間のレビュアーに送るかもしれない。低料金でも高コストのワークフローになり得る。より高い料金でも、出力と監督を抑えながら確実に完了するモデルなら経済的である。
Artificial Analysisはベンチマークテスト当たりのコストを報告し始め、価格を完了した仕事に近づけている。DeepSeek V4-Flashは1テスト当たり$0.03、Kimi K3は$0.86、GPT-5.6 Solは$1.86と推定した。評価者が共通の分母を提供するため、テスト単位の請求額はトークン料金より有用である。このテストにも、企業のツールスタック、受け入れ基準、エスカレーション方針、レビュ負荷は含まれない。それでも、道のりのより多くを測定する。
OpenAIとAnthropicは、推論コストが売上高の半分を超えると予測したと報じられている。したがって、サービング効率のあらゆる改善は顧客に届く前にサプライヤーの経済性に影響する。この予測は、推論経済性が製品設計、料金表、モデルのセグメンテーションをますます左右する理由を説明する。買い手はなお、どのシステムが仕事を完了するのかを測らなければならない。
単一のリーダーボードは有用な不一致を隠す
DeepSeek V4 FlashはArtificial Analysis Intelligence Indexで50を記録し、Gemini 3.6 Flashと並んだ。4月のプレビューからは10ポイント改善した。このスコアによりモデルは本格的な比較対象に入り、買い手はリリースのたびに一から評価せずとも、明らかに弱い候補を除外できる。
Kimi K3はFrontend Code Arenaで首位に立ち、Terminal Bench 2.1では88.3を記録した。GPT-5.6 Solの88.8にわずかに届かなかった。これらのランキングはDeepSeekの指数スコアを否定しない。フロントエンドのコーディングとターミナル作業では異なる振る舞いが報われ、複合的な知能指数はさらに多くの能力を一つの数値に重み付けしている。
研究チームが最先端のベンチマーク性能を追うのは、共通テストが進歩を見えやすくするからである。本番の責任者が追うのは、高速な推論、予測可能なレイテンシー、解釈可能性、異なるステークホルダーを満足させる成果だ。同じモデルを正しく評価しても、目的関数が異なるため、両者は異なる結論に至り得る。
評価と調達の隔たりはここで開く。総合スコアは候補の絞り込みに使える。しかし発注書を左右するのは、コーディングでの1ポイントの優位が応答時間、デプロイの制御、失敗からの復旧、人間による受容より重要かどうかである。ベンチマークは設計者が問うた問いに答える。調達は事業が持つ問いを担う。
オープンウェイトはAPIでは売れない制御を価格化する
APIの顧客が購入するのは、プロバイダーが稼働させるシステムへのアクセスである。オープンウェイトの顧客は別の選択肢を得る。モデルをどこで動かすか、誰が適応させるか、どのインフラがホストするか、組織が元のサプライヤーからどれほど容易に離れられるかである。
Alibabaはウェイトを公開するとした。Kimi K3とのベンチマーク比較を公表した後、2.4兆パラメータのQwen3.8-MaxとQwen3.8-27Bを対象とする。AlibabaはすでにQwen3.6-27Bをオープンウェイトの高密度モデルとして公開しており、この小型モデルは主要なコーディングベンチマークで、はるかに大きいQwenの前世代モデルを上回ったとしていた。OpenAIが2025年に示した、GPT-2以来初となるオープンウェイト言語モデルの計画は、主要なプロプライエタリープロバイダーでさえその選択肢を求めていたことを示す。
セルフホストのモデルでは、デプロイ、容量、更新、評価の責任を買い手が負う。マネージドAPIの方が、総コストを低くできる場合も、測定された成果をより良くできる場合もある。
開発者、クラウドプロバイダー、ベンダーは、広く採用されたオープンウェイトモデルを中立的な基盤として扱い、その周囲に統合を構築し、インフラプロバイダー間のポータビリティを保てる。買い手にとってデプロイの制御は、能力と価格に並ぶ独立した調達軸になる。
ルーターは調達を運用ループに変える
ルーターは、すべてのリクエストで一つのモデルが勝たなければならないという前提を崩す。定型的な仕事はより安価なモデルへ、専門的な仕事はその領域に適したモデルへ、重要度の高い仕事はより厳格な信頼性またはレビュー制御を持つ経路へ送れる。料金、モデル、要件が変われば、組織は経路を変更できる。
OpenRouterの規模では、モデル選択は本番インフラとなり、ルーティングルールが稼働中のコストと失敗を形作る。
米国企業はOpenRouter上のトークン利用量のほぼ60%を中国モデルに送った。これらのモデルに影響する政策判断、プロバイダー障害、価格変更は、仮説上の将来のデプロイではなく、稼働中のシステムを変える。
Metaは自社のコスト構造の内側から、同じアーキテクチャ上の結論に達した。同社の社内インキュベーターは、すべてのリクエストで最上位モデルの価格を払う代わりに、一部のコーディングタスクを低コストモデルへ送るSwitchboardを開発している。OpenRouterは多くの開発者にサービスを提供する。Metaが欲しているのは社内コントロールプレーンである。両者ともワークロードを分割している。
ルーティング自体にも請求額が生じる。ルーティングチームは対象となる全モデルを評価し、各経路を観測し、モデルとデータへのアクセスを統制し、フォールバックを維持し、性能変化を検知しなければならない。ワークロードの分割が不十分な企業は、コストを削減したり信頼性を高めたりせずに複雑さだけを増やしかねない。マルチモデルの経済性が改善するのは、運用者がリクエストを区別でき、それらを移動するための測定を信頼できる場合だけである。
エージェントは応答の先まで請求範囲を広げる
エージェントは目標について推論し、外部システムを通じて行動する。その結果はモデルの最初の応答以上のものに依存する。エージェントはツールを選択し、ステップ間で状態を渡し、エラーから回復し、定義された条件を満たした時点で作業を止めなければならない。
プロンプトと応答のベンチマークは、そのシステムの一つの構成要素をテストできる。シーケンス全体が正しく完了したかどうかは立証できない。OpenAIは、長期的なタスクでモデルをテストするため、Agents SDKにネイティブサンドボックスとインディストリビューションのハーネスを追加した際、この違いを認めた。このハーネスにより、運用者はモデルカードから推論するのではなく、デプロイ時の振る舞いを観測できる。
人間によるチェックポイントも同じ会計境界の内側に置くべきである。組織は重要なアクションを人が承認すること、裏付けとなる証拠を確認すること、曖昧な結果を解決することを求める場合がある。こうした制御はデプロイ上の説明責任をもたらすが、従業員はなおそれを運用する時間を費やす。レビュの労務を除外する調達計算は、コストの一部を別部門へ移すことでモデルを安く見せる。
一つのワークフローで、計画、実行、検証に異なるモデルを使うこともある。引き渡しが一つ増えるごとに、レイテンシー、ツールコスト、状態喪失、失敗が入り込む場所も増える。運用者は、構成要素のスコアを平均して計算が判断力を生むことを期待するのではなく、ワークフロー全体で組み立てられたシステムを評価しなければならない。
ワークロード台帳はあらゆる主張を反証可能にする
完了の安定した定義があれば、買い手は知能の普遍的な定義で合意せずとも経路を比較できる。同じ尺度をすべての経路について記録すれば、限定されたワークフローを監査可能な単位に変えられる。
| 指標 | 買い手が記録する内容 | 経済性を変える理由 |
|---|---|---|
| タスク成功 | ワークロード固有の受け入れテストに対する合格率 | 失敗した出力や使えない出力は、安価な仕事として数えられなくなる |
| エンドツーエンドのレイテンシー | ツールとレビューを含む、リクエストから受け入れられた完了までの時間 | 高速なモデルでも低速なワークフローは隠せない |
| フルロードコスト | 入力、出力、ツール、デプロイ、インフラの料金 | API経路とセルフホスト経路を一つの境界で比較できる |
| 再試行とエスカレーション | 繰り返しの試行、フォールバック経路、人への引き継ぎ | 信頼性のコストがトークン節約と同じ記録に現れる |
| 人間によるレビュー | レビュアーの時間、承認頻度、介入理由 | 監督が外部性ではなく運用コストになる |
| 来歴 | モデルバージョン、経路、ツール、入力、意思決定履歴 | 運用者は重要な結果を再現、監査、異議申し立てできる |
成熟したModel Procurement Stackでは、各主体に測定可能な責任がある。プロバイダーは料金、デプロイ条件、ベンチマークの根拠を公表する。ルーターは、どのモデルがリクエストを処理し、経路が何を消費したかを記録する。買い手は受け入れテスト、レイテンシー予算、エスカレーションのしきい値、レビュー方針を定義する。各主体は自らの主張に責任を持ち続ける。
台帳は組織の記憶も作る。買い手は新リリースをすでに運用している経路と比較し、切り替えの根拠を保存し、ワークロード性能が悪化すれば変更を戻せる。研究所が新たなリーダーボードを公表しても、調達チームは安定した価値の定義を維持できる。
よくある質問
OpenRouterはStripeに買収されたのか?
提供された根拠には、買収を確認する情報はない。2026年7月の報道は、およそ$10 billionでの買収提案または協議を伝えた。PitchBookは別途、OpenRouterが5月に$1.3 billionと評価されていたと報じた。
「オープンウェイト」は「オープンソース」と同じ意味か?
必ずしもそうではない。本稿が示しているのは、買い手がモデルのウェイトを取得しデプロイできることだ。ただし、ライセンスがコード、学習データ、改変、再配布に関するより広範なオープンソース権利を付与するかどうかは示していない。
ほぼ60%という中国モデルのシェアは、米国AI市場全体を表すのか?
いいえ。この数値は、OpenRouter上での米国企業によるトークン利用量を対象としており、米国のエンタープライズAI消費全体や同プラットフォーム外のデプロイを対象とするものではない。
買い手はワークロード台帳をどのくらいの頻度で更新すべきか?
本稿は固定的な頻度を定めていない。その運用ロジックは、モデルバージョン、料金、ルーティングルール、事業要件、観測されたワークロード性能が変化した際の再評価を示唆する。
Qwen3.8のウェイトはすでに利用可能か?
本稿が報じるのはAlibabaによる公開の約束であり、公開完了や利用可能日ではない。買い手はデプロイを計画する前に、公開とライセンス条件をなお確認する必要がある。
OpenRouterの規模では、別のモデルは常に手の届くところにある。長く残る資産は、どの経路が、どの統制の下で、どの仕事を、どのフルロードコストで完了したかという買い手の記録である。