Anthropicは、Opus 4.6とSonnet 4.6で100万トークンを標準料金の範囲内に収めた。しかし、その枠に取り込むトークンは一つ残らずメモリを消費し、遅延を増やし、推論費用を押し上げる。100万トークンの枠があれば、企業業務のより多くを保持できる。だが、何を取り込み、何を残し、何を再び呼び戻すべきかまでは決めてくれない。
要点
- Anthropicが100万トークン枠を標準料金で提供したことで、企業向けAIの制約点は単純な容量から、どの情報をモデルの作業領域に入れ、残し、外すかの判断へ移った。
- 長文コンテキストには、なおメモリ、遅延、推論費用が伴う。枠に多くの情報を収められても、すべてのトークンが有用になるわけではない。
- 継続稼働するエージェントには、複数回の呼び出しを通じて情報の受け入れ、キャッシュ、検索、圧縮、破棄、ファイル、道具、管理型メモリを統括するコンテキスト運用層が必要になる。
- 企業の買い手が最適化すべきなのは、受け入れ可能な最大トークン数ではなく、ドル・秒当たりの有効コンテキスト量、そして最終的には有用な業務1件当たりの費用である。
- 効率の高い構成は、負担可能なコンテキスト予算を広げる可能性がある。しかし、関連性、履歴、状態を管理する必要まではなくならない。
標準料金化で、希少性は枠の大きさの先へ移る
Opus 4.6は、試験提供の100万トークン・コンテキスト枠を備え、BigLaw Benchで90.2%を記録したとされる。Anthropicはその後、Opus 4.6とSonnet 4.6で100万トークンの全枠を標準料金で利用可能にし、Claude Code Max、Team、EnterpriseでOpusを利用する場合の既定値にも設定した。
公表された評価結果は、この枠が高度な専門業務にも対応し得ることを示した。さらに標準料金化により、Anthropicは枠の大きさと長文コンテキスト向けの明示的な追加料金を切り離し、大容量を製品の標準的な約束へ近づけた。
Anthropicの動きは、長文コンテキストは法外に高いままでなければならないという見方に疑問を投げかける。提供企業は追加費用を自社で負担することも、配信効率の改善で削減することも、製品内の別の部分で回収することもできる。ただし、標準料金になったからといって、すべてのトークンが同じだけ役立つわけではない。モデルがその場で保持する状態に伴うメモリと遅延の負担も消えない。その負担が製品の内側に移るだけだ。
大容量の枠が標準で含まれるようになると、買い手の問いは「モデルに収まるか」だけでは済まなくなる。必要な情報を見つけられるのか、変化しない情報を再処理すべきなのか、最初ではなく10回目のエージェント処理でも採算が合うのかを問わなければならない。課題は容量から成果効率へ移る。
余った容量も、注意機構を通せば配信費用になる
従来型のトランスフォーマー推論では、KV cacheは系列長に比例して増え、生成する各トークンはそれ以前のトークンを参照しなければならない。枠を広げればモデルが参照できる範囲は増えるが、代償なく処理できる量が増えるわけではない。
開発者がまず採用したのは、大量の文章を効率よく処理する難しさに対処するRAGだった。資料全体を常時プロンプトに載せるのではなく、関連する部分だけを取得する。その後、議論の軸はプロンプト設計からコンテキスト設計へ広がった。指示文の書き方だけでは、もはやシステムを支えられなくなったからだ。モデルが道具、ファイル、メモリを使い、長い業務をこなすようになると、プロンプトは単なるメッセージではなく、管理対象の作業領域になった。
| コンテキスト管理 | システム上の問い | 経済的な効果 |
|---|---|---|
| 受け入れ | その場で使う枠に何を入れるか | 無関係な情報への注意機構の浪費を防ぐ |
| 保持 | 呼び出しをまたいで何を残すか | 変化しない状態の反復処理を減らす |
| 検索 | 必要なときだけ何を読み込むか | 常に大きなプロンプトを抱える代わりに、対象を絞って取得する |
| 破棄と圧縮 | 何を外し、何を要約できるか | 遅延、メモリ、トークン使用量の増加を抑える |
モデルのコンテキスト枠が提供するのは参照可能な領域であり、その使い方を決めるのはコンテキスト層だ。収まるからといって何でも読み込ませても、システムが賢くなるわけではない。整理棚を作らずに、書類の格納だけを自動化するようなものだ。
継続稼働するエージェントには運用層が要る
一度きりのプロンプトなら、やり取りがそこで終わるため、粗雑なコンテキスト管理でも耐えられる。継続稼働するエージェントはそうはいかない。道具の実行結果を生み、ファイルを開き、計画を修正し、指示を引き継ぎ、呼び出しを重ねるたびに履歴を蓄積する。そのすべてを各段階で再投入すれば、メモリは推論費用を繰り返し発生させる要因になる。
AnthropicのAPI公開内容を見ると、開発基盤がこの問題をどのように分解してきたかが分かる。2024年8月には、プロンプトキャッシュにより、頻繁に使うコンテキストを呼び出し間で保持できるようになり、毎回送り直す必要がなくなった。2025年5月までに、Anthropicは保存期間を延長したプロンプトキャッシュを、コード実行、MCP接続機能、Files APIと組み合わせて提供した。コンテキストはもはや一つの文章ではない。開発者は、キャッシュした指示、外部資料、道具、取得した状態へ分割できるようになった。
2026年5月には、Managed Agentsに直近のセッションを定期的に見直し、エージェントのメモリを更新する「dreaming」が加わった。この処理は定期的なデータベース保守に近い。メモリは、その場の会話から切り離された領域へ移った。
したがって、継続稼働するエージェントには、処理の振り分け、道具の利用、計画を管理するモデル周辺の運用層が必要になる。この層は新しい情報を受け入れ、選んだ状態を保持し、古くなった状態を捨て、保存済みの情報を作業領域へ呼び戻す役割も担う。
エージェントの自律性が高く見えるほど、コンテキスト層には厳密な統制が求められる。
キャッシュと検索は細かな効率化ではない。各段階でエージェントが何を知り得るか、また、それを認識させるために運用者がどれだけ推論費用を負担するかを左右する。コンテキスト方針は権限と継続費用の双方を定めるため、エージェントの経済性を構成する一部となる。
導入現場が評価するのは最大容量ではなく、有用なコンテキスト
提供企業の収支には、すでにこの圧力が表れている。Barclaysは、推論向け設備投資が2年以内に学習向けを上回ると予測した。一方、投資家向け資料では、OpenAIとAnthropicが学習費用を含む場合と含まない場合の双方で収益化を試算していたと報じられた。いずれも、制約となったのはモデル開発だけではなく、提供時の処理だった。
長時間動くエージェントは、この圧力をさらに強める。購入するのは1件の回答ではなく、一連のモデル呼び出しだからだ。その都度、指示、取得情報、道具の出力、過去の状態を何らかの形で引き継ぐ。呼び出し1回では些細に見えるコンテキスト上の判断も、業務全体で繰り返せばシステム構成を左右する問題になる。
Microsoftの対応は示唆に富む。同社はAI費用を抑えるため、ExcelやOutlookなどの製品でOpenAIとAnthropicの一部モデルを自社のMAIモデルへ置き換え始めたと報じられている。この置き換えは、あるモデルが常に優れていることを示すものではない。能力に応じて処理先を振り分けられ、推論が継続的な投入費用になると、合理的な調達判断がどう変わるかを示している。
システム面の改善は、費用水準を短期間で大きく変え得る。OpenAIの技術者は推論費用を半分以下にする方法を見つけたとされ、現在のコンテキスト枠の費用を固定的に捉える前提は崩れやすい。Anthropicの標準料金化も、顧客側から同じことを示している。業務内容が変わるより速く、目に見える追加料金が下がることはあり得る。
推論が安くなれば、費用を負担できる呼び出しの範囲は広がる。だが、古くなった状態を繰り返し投入する価値が高まるわけではない。調達担当者は、業務要件を満たす能力と応答速度の組み合わせに応じて処理先を振り分けたうえで、検索、キャッシュの再利用、コンテキストの反復投入を含む総費用を比較できる。この判断に適した単位は、受け入れ可能なトークン数ではなく、有用な業務1件当たりのAI費用である。
新しい構成が広げるのは予算であり、判断を不要にはしない
Google Researchは、RNNの速度とトランスフォーマーの精度を組み合わせた構成としてTitansを発表し、200万トークン超まで拡張可能だと説明した。AlibabaはQwen3-Nextを、長文コンテキストの理解と計算効率に最適化した混成構成と位置づけた。
GoogleとAlibabaが進めているのは、現在の提供上の制約を前提とした効率化だけではなく、構成そのものの再設計だ。長い状態を維持する費用と遅延を削減できれば、参照可能なだけでなく、実際に活用できるコンテキストが増える。
これらの取り組みは、現在のトランスフォーマーの制約がコンテキスト管理を恒久的に規定するという見方に疑問を突きつける。構成は変わり、費用曲線は動き、使える予算は増える。
それでも、エージェントと運用者は、何が関連しているのか、履歴のどの版を残すのか、いつファイルを読み込むのかを決めなければならない。処理費用が下がれば、判断の焦点は「情報が収まるか」から「注意を向ける価値があるか」へ移る。遅延と提供費用がゼロになり、すべての情報が同じだけ有用にならない限り、この方針決定は残り続ける。
Anthropicが100万トークン枠を標準料金で提供したからといって、長文コンテキスト競争が終わるわけではない。むしろ、次の制約が明確になった。エージェントが呼び出しをまたいで状態を引き継ぎ、その場で保持するトークンが遅延と提供費用を生むなか、価値は、モデルに今何を見せ、後で何を思い出させ、何を二度と費用をかけて読ませないかを決める層へ移る。Anthropicは部屋を広げた。持続的な優位を生むのは、その中に何を置くべきかを決める力である。
Anthropicに関する報道は企業向けへ比重が移った、2024–2026
| 報道の切り口 | 2024年の比率 | 2026年の比率 | 報告された変化 |
|---|---|---|---|
| 企業向け | 12.3% | 19.0% | +6.7ポイント |
| 消費者向け | 32.4% | 15.6% | −16.8ポイント |
| 研究 | 40.3% | 22.0% | −18.3ポイント |
よくある質問
Anthropicの100万トークン・コンテキスト枠は何が変わったのか
Anthropicは、Opus 4.6とSonnet 4.6で全枠を標準料金の対象とした。これにより、長文コンテキストの容量は、目に見える追加料金を伴う機能から、製品の標準的な約束へ近づいた。
標準料金なら、100万トークンを無料で処理できるのか
できない。提供企業が長文コンテキスト向けの追加料金を別途請求しなくても、その場で参照するコンテキストはメモリを消費し、遅延を増やし、推論費用を発生させる。
企業向けエージェントは、枠に収まる情報をすべて読み込めばよいのではないか
継続稼働するエージェントは、多数の呼び出しを通じて指示、ファイル、道具の出力、計画、履歴を蓄積する。そのすべてを繰り返し投入すると、古い情報、重複した情報、無関係な情報にも注意機構と推論資源を費やすことになる。
継続稼働するエージェントのコンテキストは、どう管理すべきか
情報の選択的な受け入れ、プロンプトキャッシュ、検索、外部ファイル、管理型メモリ、圧縮、破棄を組み合わせるべきだ。直ちに必要な状態だけをその場で保持し、それ以外は保存するか、必要なときだけ再読込することが狙いとなる。
コンテキスト枠の最大容量より重要な指標は何か
本稿が重視するのは、ドル・秒当たりで実際に使えるコンテキスト量であり、有用な業務1件当たりのAI費用を通じて評価する。これにより、エージェントが処理を繰り返しても、業務が必要な能力と応答速度を満たしているかを捉えられる。