発生日:2026年3月21日。 電子フロンティア財団(EFF)は、出版社が自社コンテンツの自動収集を阻止しようとする取り組みにより、インターネット・アーカイブが将来の研究のためにニュースページを保存できなくなる恐れもあると警告した。デジタル権利団体であるEFFは論評で、人工知能の訓練をめぐる論争と、公益のためにウェブを保存するアーカイブの役割は切り分けるべきだと主張した。
EFFによると、ニューヨーク・タイムズは、従来のrobots.txtシステムを超える技術的措置を使い、インターネット・アーカイブによる自社サイトのクロールを阻止し始めた。ガーディアンを含むほかの新聞社も、同様の方向へ動いているようだと付け加えた。この説明では、それらの制限は単にAI企業への制限ではなく、ジャーナリスト、歴史家、研究者、裁判所が利用する記録への脅威として位置付けられた。
この懸念は、オンライン出版の性質が変化していることから生じている。記事は更新、削除、差し替えられる可能性があり、アーカイブされた複製が、あるページが以前の時点でどのように表示されていたかを示す唯一のアクセス可能な証拠になることもある。EFFはアーカイブの役割を、新聞を保存する物理的な図書館の役割になぞらえ、保存は商用の生成AI製品を構築することとは異なる目的に資するものだと強調した。
同団体はウェイバックマシンの規模に言及し、1兆ページを超えるアーカイブが収められていると述べた。また、インターネット・アーカイブのスタッフによる数字として、ウィキペディアが249言語、260万件超のアーカイブ済みニュース記事にリンクしているとも伝えた。これらの数字は、出版社の直接的な目的が自社コンテンツの再利用を管理することであっても、保存用クローラーを遮断すれば、引用や研究のより広範なエコシステムに影響が及び得ることを示すために使われた。
論評は、出版社には自社の著作物がどのように複製、利用されるかについて正当な利害があり、一部は著作権で保護された素材をAIモデルの訓練に使用することをめぐって訴訟を進めていると認めた。それでもEFFは、アーカイブと検索は、確立されたフェアユースの原則によって保護される変容的な活動だとの立場を取った。コレクションを検索可能にすることの類例として、検索可能なデータベースを作るためにグーグルが書籍を複製した行為に対する裁判所の判断を挙げた。この法的解釈はEFFの主張であり、提供された情報源はAI訓練をめぐる別個の訴訟を決着させるものではない。
政策上の区別は、この警告の核心である。広範な技術的遮断では、クローラーが商用AI企業、非営利アーカイブ、あるいは別の研究ツールのいずれに属するかを識別できない可能性がある。EFFは、アーカイブを遮断すれば、根本にある著作権紛争を解決しないまま、永続的な公共的損失をもたらすとの見解だ。保存される前にページが消えれば、その後に法律や出版社の方針が変わっても、欠落した歴史的記録を再構築することはできないと主張した。



