Cloudflareは、検索エンジンでの表示と人工知能の学習を切り分けるためのウェブサイト向け制御機能を発表した。現在、一つの識別情報で両方の役割を担っているクローラーに対応するものだ。新しい「Disallow AI Training」設定は、サイト側の意向を公開する一方、この仕組みに対応する複数用途のボットが、検索用にサイトのインデックス登録を続けることを認める。

サイト所有者はこうしたクローラーに対し、表明されたすべての目的についてアクセスを許可するか、ボットを遮断して検索結果から消える可能性を受け入れるかという、二者択一を迫られることが多かった。Cloudflareによると、Apple、Google、Microsoftは、この新たな意向表明をすでに尊重しているか、期限を定めて対応することを約束している。同社は、透明性と制御に関する自社の要件を満たす運営者を「Accountable」と呼んでいる。

この設定はサイトのrobots.txtファイル内のDisallowディレクティブを使うが、Cloudflareは、実効性の確保はテキストの公開だけにとどまらないと説明する。同社のネットワークはクローラーを識別してその挙動を分類し、表明された選択を無視する学習用ボットを遮断できる。同社は、観測した運営者の挙動をCloudflare Radarで報告する計画だ。

この区別は、Cloudflareの顧客の間で対応姿勢が異なることを反映している。同社によると、検索ボットの遮断を選ぶサイトは1%未満なのに対し、17%は学習を防ぐことを目的とした何らかの手段を有効にしている。検索は通常、利用者を情報の公開元へと誘導するが、モデルの学習では、同じような訪問者との関係を生み出さずに公開元の素材を利用できる。この違いは、広告、購読料、読者との直接的な交流によって運営資金を得ているサイトにとって、特に重要だ。

Cloudflareは今回の提供開始に合わせ、Bot ManagementとAI Crawl Controlの選択肢の定義を変更する。複数用途のクローラーに対して「Block」を選ぶと、今後は検索活動も含め、そのクローラーを全面的に停止する。より限定的な「Disallow AI Training」を選ぶ場合は、学習への制限を表明しながら、検索用の巡回を認める。学習を遮断していた既存の細かな設定や、広告のあるページで学習を遮断していた設定は、適切な場合に、新たな不許可の選択肢へ移行される予定だ。

同社によると、Applebot、Bingbot、GooglebotはAccountableの指定要件を満たしている。また、Amazon、Anthropic、Meta、OpenAIの関連クローラーもAccountableとして挙げている。これらの企業は検索用と学習用のボットを分離しており、インデックス登録に影響を与えずに後者を遮断できるためだ。Cloudflareは、Appleがすでに学習を拒否するためのApplebot-Extendedという仕組みを提供していると指摘している。

今回のリリースで、公開元のあらゆる懸念が解消されるわけではない。Cloudflareは、AIが生成する検索要約について、要約があるかどうかだけでなく、複製または要約される素材の量が重要なため、より精密な制御が必要だと説明している。同社は来年初めまでに、サイト所有者がこの利用を一元的に制御する手段の提供を目指している。エージェント型クローラーも、意向表明の仕組みや標準の整備が続いているため、今回の新たな不許可設定の対象外となっている。

これによって方針をより細かく設定できるようになるが、その遵守は依然として、クローラー運営者が表明した目的を守ること、または正しく識別されて遮断されることにかかっている。Cloudflareの発表は制御機能と約束を説明したものであり、インターネット上のあらゆる自動収集プログラムがそれらを尊重することを立証するものではない。