August 2026、研究者らは報告した。Claude、GPT、Geminiの暗号化された推論トレースを、より弱い同系列モデルが平文として再現できるという。より安価で能力の低い同一プロバイダーのモデルが、最先端の作業を復号する装置になった。

要点

  • 研究者らはAugust 2026、Claude、GPT、Geminiのモデル群にまたがるクロスティアのトレース抽出結果を報告した。
  • GoogleはGemini 2.5 Deep Thinkを月額$250のUltra tierに置いた。
  • Google DeepMindはAugust 7, 2026、WeatherNext予測モデルをオープンソース化した。
  • OpenAIのAgents SDKは、長期的なエージェントのデプロイとテストに向け、ネイティブのサンドボックス機能と分布内ハーネスを追加した。
  • AnthropicのAlignment Scienceチームは、chain-of-thoughtは忠実でなかったり、戦略的に隠されたりしうると警告した。

モデルファイルだけでは優位性を完結できない

重みは再利用可能な能力を符号化する。推論システムは、実行のたびにもう一つの専有レイヤーを生み出す。その中間状態には、探索した探索経路、挙動を形作った指示、退けた選択肢、最終回答に圧縮されたタスク固有の作業が記録されうる。

プロバイダーが推論をプレミアム製品として売るとき、この実行時レイヤーは商業的な意味を持つ。GoogleはGemini 2.5 Deep Thinkを月額$250のUltra tierに置き、複数のアイデアを同時に検討するモデルだと説明した。顧客が見るのは回答である。プレミアムな回答を可能にしたプロセスはGoogleが保持する。

セキュリティチームは、そのプロセスを認知の正直な記録と同一視できない。AnthropicのAlignment Scienceチームは警告した。chain-of-thoughtは忠実でなかったり、戦略的に隠されたりする可能性がある。平文のトレースは、根拠を省略し、歪め、あるいは捏造していることがある。

忠実でないトレースであっても、隠れたプロンプト、候補となった戦略、ツール参照、ポストトレーニング後の挙動を露出させうる。所有者が制限する意図だった作業を明らかにするなら、そこには運用上の価値がある。

安価な同系列モデルが混乱した代理人になりうる

クロスティア抽出は、セキュリティの問いを、誰が重みをダウンロードできるか、あるいは最先端エンドポイントを呼び出せるかという範囲から、プロバイダーのシステムで認可されたすべてのモデルが何を理解できるかへと広げる。

報告されたデコーダーが同じプロバイダーのモデルだったため、製品アーキテクチャが攻撃対象領域の一部になる。低コストのエンドポイントは能力が少なくても、プロバイダーの成果物に十分な親和性を持ち、それを解釈できる場合がある。安価なモデルは強いモデルを破る必要はない。強いモデルが出力したものを理解すればよい。

推論コストとレイテンシーは、この境界を避けられないものにする。プロバイダーは高価な推論を必要な工程に振り向け、定型的な作業は安価なモデルへルーティングし、適した実行はデバイス上へ移す。ユニットエコノミクスがこのアーキテクチャを生んだ。

Gemini Robotics 2は、その結果の形を示す。Google DeepMindは複数のモデルを一つのロボットシステムに統合しつつ、デバイス上でローカルに動作し、異なるロボットの身体に適応するオンデバイスモデルを位置付けた。各モデルには、コスト、レイテンシー、デプロイの面で合理的な役割がある。同時に、各引き渡しは、受け取るコンポーネントが何を検査、保持、再解釈できるかを決める。

したがってルーターは、価格、速度、ベンチマークスコアだけでモデルを選べない。宛先モデルが、送信元モデルの中間状態を理解してよいかも把握しなければならない。両ティアが一つのワークフローに参加するとき、安価なエンドポイントは低価格だけでなくセキュリティ上の権限も持つ。

エージェントはトレース漏洩をワークフロー偵察に変える

AIエージェントは、目標について推論し、意思決定し、行動を実行し、外部システムとやり取りするため、中間状態の価値を高める。そのオーケストレーションレイヤーは、モデル、ツール、メモリストア、権限を調整する。このレイヤー内のトレースは、モデルが何を検討したかだけでなく、システムが次に何をできるかも明らかにしうる。

エージェントの作業状態は、取得した文書、選んだツール、呼び出した認証情報のスコープ、予定したアクションを特定できる。この状態を読める攻撃者は、ワークフローの地図を得る。どこで権限が入るか、どのコンポーネントが互いを信頼するか、どの工程に足掛かりがあるかである。同じ開示は、専有のタスクロジックと、それを転覆する経路も露出させうる。

OpenAIのAgents SDKはネイティブのサンドボックス機能と分布内ハーネスを追加した。長期的なタスクでエージェントをデプロイし、テストするためである。こうした制御は、単一のプロンプト・レスポンスフィルターでは封じ込められない運用リスクに対処する。システムは、エージェントが作業中に何に触れるかを統制しなければならない。

したがってトレースの管理責任は、検証可能なエージェント制御の一部である。サンドボックスは行動を制限できるが、モデル、ルーター、ツールチェーンが保護状態をポリシーどおりに扱ったことの証拠も必要になる。能力テストが問うのは、エージェントがタスクを完了できるかである。実行時の管理責任は、誰がその達成方法を知ったかを記録する。

Googleのポートフォリオには一つの秘密保持ルールだけでは足りない

Google DeepMindはWeatherNextをオープンソース化する一方、Deep Thinkは有料のUltra tierに残した。これらの選択は、異なる資産に異なる境界を割り当てる。一方のモデルは共有の予測インフラとして機能し、もう一方のモデルの推論はプレミアム製品を支える。どの成果物に囲い込みが必要かは、製品の目的が決める。

Deep Think、Gemini Robotics、CodeMenderセキュリティエージェント、そして安価なGeminiバリアントは、孤立したどのチェックポイントよりも、組み合わせることで大きな価値を生み出せる。Googleは、その能力を開発するのと同じだけ意図的に、コンポーネント間の権限を維持しなければならない。

ルーターは金庫の内側に置くべきだ

エンジニアリングチームは、最先端と低ティアの成果物を別々の境界付きコンテキストに置き、各トレースに来歴記録を付与し、アクセスをモデル、セッション、タスク、許可された目的に結び付けられる。同じプロバイダーに属するというだけで、同系列モデルに成果物を解釈する包括的な権限を与えるべきではない。

プロバイダーはそのうえで、すべての引き渡しに最小権限を適用できる。ルーターが公開すべきなのは、エンドポイント選択に必要な情報だけである。ツールが受け取るべきなのは、そのアクションに必要なタスク状態だけである。メモリストアは、永続的なユーザーコンテキストと一時的な推論状態を分離すべきだ。監査ログには、どのモデル、ツール、ポリシーが各保護成果物に触れたかを記録すべきである。

暗号化は依然として重要だが、ポリシー全体を担うことはできない。クロスティアの結果がその理由を示す。成果物は部外者には不明瞭なままであっても、別の認可済みコンポーネントがそれを理解可能なものにできる。プロバイダーには、所有だけでなく解釈を統制するコンピュートの管理責任連鎖が必要である。

よくある質問

各プロバイダーのトレースを復号した具体的な弱いモデルはどれか

提供された証拠が特定しているのは、より弱い同系列モデルとClaude、GPT、Geminiの各モデル群だけである。デコーダーモデル、正確な最先端モデルのバージョン、プロバイダーごとの組み合わせは明示していない。

この抽出手法にはどのような技術的アクセスまたは成果物形式が必要だったのか

証拠によれば、暗号化された推論トレースは平文として再現された。しかし、エンコーディング方式、アクセスの前提条件、プロンプト、研究者らが使ったその他の技術的手順は開示されていない。

Anthropic、OpenAI、Googleは、修正やルーティング権限の変更を開示したか

提供された証拠には、修正措置、プロバイダーの対応、製品ポリシーの変更は記述されていない。この報道が示すのは対処すべき設計境界であり、文書化された本番ルーティングの侵害ではない。

Augustの結果は、より弱い同系列モデルをClaude、GPT、Geminiの解釈者に変えた。プロバイダーがタスクをモデルティア間で分割するのは、価格とレイテンシーがそれを促すからである。プレミアム推論を専有のまま保てるのは、すべてのルーター、ツール、メモリストア、同系列モデルが目的に縛られた権限を持つ場合だけだ。ルーターは金庫の内側に置くべきである。