2026年、Redditは、GoogleとOpenAIとのコンテンツライセンス契約が収益の約10%を占めたと述べた。コア検索の週間ユニークユーザーは70Mを超えた。Redditが目に見える価格を付けるまで、ウェブは20年にわたりこのアーカイブを排気ガス同然に扱ってきた。
要点
- Redditは2026年、GoogleとOpenAIとのコンテンツライセンス契約が収益の約10%を占めたと述べた。
- Stack OverflowのCEOは2023年、50 million件の質問と回答へのアクセスについて、大手AI開発企業に課金する計画だと述べた。
- 1,800件のAIデータセットの分析では、約70%にライセンスの明記がないか、作成者の意図よりも許容範囲の広いラベルが使われていた。
- Stack Overflowの年間収益は、エンタープライズ製品とAIライセンスを原動力に、ChatGPT後に$115 millionへ倍増した。
- Diggの2026年の再始動は、67,000 usersが参加した招待制期間を経て行われた。
Redditの広告収益はQ4に前年同期比60%増となっており、ライセンスはなお二次的な事業である。Reddit Answersの週間利用者は6Mに達したが、コア検索は新しい回答インターフェースの11倍超の規模だ。この差が示すのは導入状況であり、買い手にとって記録がどれほどの価値を持つかではない。
Google、OpenAIなどの買い手はいま、所有者が素材を認証し、更新し、アクセス条件を設定できるアーカイブを持つコミュニティプラットフォームに価値を見いだしている。RedditとStack Overflowは、AIの回答によってリファラル、人間による投稿、そしてそのアーカイブを買う価値あるものにしているモデレーション判断が失われないよう、管理されたアクセスを売らなければならない。
アーカイブは製品になる前にインフラになった
2008年にさかのぼるCommon Crawlの9.5PBアーカイブは、自由に収集されたウェブ規模の履歴を、モデル開発者にとって標準的な入力にした。無秩序な公開ウェブページを、開発者が各サイトと個別に交渉することなく利用できる、機械規模の学習素材へ変換した。
コミュニティアーカイブには、もう一層ある。RedditとStack Overflowは、議論、返信、異論、投票、評判、鮮度、モデレーションの判断を保存している。スレッドは言葉だけで成り立つわけではない。周囲にある判断が文脈を与える。
モデルの学習者は大規模な過去サンプルを消費する。検索システムには、最新で検索可能な切り出しが必要であり、回答エンジンは両方を組み合わせる。AIシステムが学習データとコンテキストウィンドウの外にある情報を必要とする場合、外部ソースに到達しなければならない。ここで、プラットフォームが所有するアーカイブはコピーされたページより優位に立つ。
Stack Overflowはこの商機を早くから見抜いた。同社CEOは2023年、50M件の質問と回答へのアクセスについて大手AI開発企業に課金する計画だと述べた。Redditは後にGoogleとOpenAIへコンテンツをライセンスした。これらの契約は、組織化された知識をAIシステム向けの交渉対象となる入力に位置付けた。
プラットフォーム所有者は、議論が自らのシステムから生まれたことを証明し、ランキングとモデレーションのシグナルを保存し、コーパスを更新し、アクセス条件を定められるとき、アーカイブの規模を使えるものにする。コピーされたデータセットは言葉を残しても、その周囲の判断を失い得る。買い手は、そうしたシグナルを欠く在庫を割り引いて評価する。
1つのコーパスが4つのアクセス市場を支える
コミュニティプラットフォームはいま、買い手、時間軸、失敗のあり方がそれぞれ異なる複数のアクセス判断を行っている。
| アクセス製品 | 主な顧客 | 経済的機能 | 制約 |
|---|---|---|---|
| コーパスライセンス | モデル開発者 | 過去の素材と定義された利用権に価格を付ける | 来歴と同意 |
| 従量制クローラーまたはAPIアクセス | 検索エンジンとエージェント | 最新で機械可読な検索取得に価格を付ける | 執行とクローラー回避 |
| 自社検索と回答 | ユーザー | クエリ、文脈、発見をプラットフォーム内にとどめる | 回答品質と信頼 |
| 広告主連携型の検索取得 | 広告主と買い物客 | コミュニティの推薦を商業的意図につなげる | 推薦とスポンサーシップの分離 |
契約では、これらの権利を区別しなければならない。学習ライセンスが継続的な検索取得を許すとは限らない。クローラーアクセスが、回答エンジンによる結果の再現を許すとも限らない。回答製品に広告権が自動的に伴うわけでもない。かつてのウェブは、閲覧、インデックス化、リファラル、収益化を1つの非公式な取り決めに束ねていた。AIはその取り決めを、個別に交渉される権利へと分割した。
プロトコル層では、CloudflareのPay per Crawlマーケットプレイスが、サイトにAIクローラーから訪問ごとに料金を取らせる。一方、新規のCloudflareサイトは標準でそれらのクローラーをブロックする。Cloudflareは、自ら所有しないアーカイブへの入口で通行料を取る。
Redditはスタックのより上位で動く。同社は、コミュニティの推薦と広告パートナーの商品を組み合わせるAI検索結果をテストしている。一括ライセンスは過去を収益化する。従量制アクセスは鮮度を収益化する。自社検索はクエリを獲得する。広告は商業的意図を獲得する。各製品は同じアーカイブから引き出すが、それぞれ異なる契約を必要とする。
AI検索はアーカイブに見返りを払わなくなった
Googleなどの検索エンジンはかつて、古い議論を新しい訪問へ変えていた。2017年までに、検索はリファラルトラフィックの34.8%を生み、ソーシャルからの25.6%を上回った。有用なRedditスレッドやStack Overflowの回答は何年も上位表示され、公開から長い時間が経っても読者、投稿者、広告インプレッションを集めることができた。
AI回答インターフェースは、この交換を変える。TollBitは160のウェブサイトにわたるリファラルを比較した。Similarwebは別途、GoogleがAI Overviewsを導入した後、クリックに至らずに終わったニュース検索の増加を測定した。
サンプルの対象サイトと測定指標は異なるが、どちらも回答インターフェースがより多くの効用を内部に抱え込み、返す訪問は少ないことを示す。GoogleとOpenAIは、ユーザーを情報源から離れた場所で満足させ得るインターフェースを運用しながら、ライセンス済みアクセスを購入している。
Redditはすでに、検索リファラルの不安定さを報告している。Steve Huffmanはまた、新規ユーザー向けの歴史的なデフォルトフィードだったr/popularから離れ、よりパーソナライズされたフィードへ移行すると述べた。外部からの発見が頼りにくくなるなか、Redditは発見を自社フィードへ移している。
自前の回答画面により、Redditはランキング、帰属表示、更新、広告を管理できる。導入が進むかどうかは、ユーザーがRedditに求めてきた具体性をそのインターフェースが保てるかに依然としてかかっている。
契約はプラットフォームが取り締まれて初めて意味を持つ
Reddit、Yahoo、Medium、Quora、O’Reilly、wikiHow、Ziff Davisなどは、AIスクレイピングの条件を表明するためReally Simple Licensing標準を採用した。この標準は、公開データの許可境界を機械可読にする。ただし、プラットフォーム所有者はなお自らそれを執行しなければならない。
RedditはAnthropicを提訴した。同社が停止したと述べた後も100,000回超Redditにアクセスしたと主張している。Redditは後に、著作権管理違反の疑いをめぐりPerplexity AIとデータスクレイピング企業も提訴した。これらの訴訟は、条件を公表することと、それを執行することの隔たりを露呈している。
売り手は来歴も証明しなければならない。1,800件のAIデータセットの分析では、約70%にライセンスの明記がないか、作成者の意図より許容範囲の広いラベルが付いていた。その後、7つのデータセット販売者は、売り手が証明できない権利を買い手は評価できないため、倫理的な調達を掲げてDataset Providers Allianceを結成した。
コミュニティアーカイブは今や、重要インフラになりつつあるオープンAIコモンズと同じセキュリティ問題に直面している。他のシステムがその資源に依存し始めると、来歴、許可、アクセス制御は製品要件になる。
モデレーターが作るものこそ、買い手がライセンスしていると思っているものだ
Redditのモデレーターは、AI生成の低品質な投稿が真正性を損なっていると述べている。また、モデルが先行するモデルの生成した合成素材で学習する可能性も警告している。モデルはテキストを生成し、それがコミュニティに入り、コミュニティのシグナルを通じて可視性を得て、後のモデルには人間の判断を示す証拠のように戻り得る。
開発者を名乗る人物による拡散したReddit投稿は、この問題を示した。その投稿は大手フードデリバリーアプリの不正行為を主張し、AI生成のように見え、広く拡散し、UberとDoorDashから否定を引き出した。人気を示すメタデータは、来歴の確認が追い付く前に合成された主張を増幅し得る。
Redditは、LLMを活用するモデレーションツールRules Hubのテストを拡大している。同社はアーカイブの両端でAIを使う。検索取得は素材を露出させ、モデレーションはその品質を保とうとする。説明責任を負う層はなお人間のモデレーターである。彼らはコミュニティルールを解釈し、曖昧な事例を審査し、自動化システムには引き受けられない判断の責任を負う。その判断が、どの投稿が可視状態に残り、買い手が後にどのシグナルを引き継ぐかを決める。
Diggは2026年の再始動で、この関係を明示した。67,000 usersが参加した招待制期間を経て、Kevin RoseとAlexis Ohanianは、オープンなコミュニティ、透明なモデレーション措置、公開アルゴリズムを製品機能として位置付けた。その売り文句は、フィードとアーカイブの統治を可視化した。
Stack Overflowは質問が消えても収益を伸ばせることを示す
Stack Overflowの年間収益はChatGPT後に$115Mへ倍増した。原動力はエンタープライズ製品とAIライセンスだった。December 2025には、月間質問数が2008年の水準へ落ち込んだ。
Stack Overflowは、新しい人間由来の素材の流入が弱まる一方で、蓄積された在庫を収益化した。数値だけでは、参加がなぜ減ったかを立証できない。
過去の質問は、モデル学習や安定した技術的問題にはなお有用である。検索・回答システムには、より厳しい試験がある。ソフトウェアライブラリ、API、受け入れられた慣行は変化する。最新情報を約束するシステムには、古いアーカイブに加え、新しい質問、訂正、投票、モデレーション判断が必要だ。
Stack Overflowのエンタープライズツールとデータ権利は、参加が減るなかでも収益を支えた。だが、これらの製品は技術コーパスを最新に保つ人間の活動を作り出せない。
学習契約は蓄積された素材に価格を付ける。検索・回答製品は現在の有用性に価格を付ける。モデレーションは、コピーされたテキストと信頼できる知識の間にある差を守る。この3つをすべて「データ」と呼ぶのは決算資料では便利だが、それ以外の場所では高くつく。
よくある質問
GoogleとOpenAIはそれぞれ、コンテンツへのアクセスにRedditへいくら支払ったのか?
本稿が報じているのは、ライセンス契約の合計がReddit収益の約10%を占めたという点だけである。各社の個別契約について、金額、期間、利用権は開示していない。
TollBitのリファラル96%減という数値は、Redditのトラフィックを特に測定したものか?
そうではない。この数値は、Reddit単独ではなく、TollBitの160ウェブサイトのサンプル全体でAI検索からのリファラルとGoogle Searchを比較したものである。本稿は別途、Redditが検索リファラルの不安定さを報告したと述べるが、同社自身のAI検索によるトラフィック損失は定量化していない。
AnthropicとPerplexity AIに対するRedditの訴訟はどうなっているのか?
本稿が示すのは主張である。Anthropicは停止したと述べた後も100,000回超Redditにアクセスしたとされ、RedditはDMCA違反の疑いをめぐりPerplexity AIとスクレイピング企業を提訴した。判決、和解、その他の結果は示していない。
Redditの投稿者やモデレーターはAIライセンス収益の分配を受けるのか?
本稿は、ユーザーやモデレーター向けの収益分配の仕組みを説明していない。モデレーターの判断をアーカイブの価値の重要な一部として扱っているが、ライセンスに連動した報酬は特定していない。
AI回答インターフェースとリファラルの隔たり
| 指標 | 以前の数値 | 後の数値または比較値 | 対象範囲 |
|---|---|---|---|
| 検索とソーシャルのリファラルトラフィック | 2017年までに検索から34.8% | 2017年までにソーシャルから25.6% | リファラルトラフィックの比較 |
| AI検索からのリファラルとGoogle Searchの比較 | Google Searchを基準 | AI検索エンジンからのリファラルトラフィックは96%少ない | TollBitによる160ウェブサイトのサンプル |
| クリック遷移のないニュース検索 | May 2024に56% | May 2025に69% | GoogleがAI Overviewsを導入した後のSimilarweb測定 |
Redditの広告事業と比べれば、10%は小さく見える。しかし、このライセンス項目が捉えるのは契約済みの抽出権だけだ。Reddit Answers、管理されたクローラーアクセス、広告主連携型の検索取得、そして情報源の品質を保つモデレーターは、この数字の外にある。収益の10%という一行は、アーカイブの受注簿に初めて現れた見積価格である。