AI訓練データをめぐるMetaの著作権紛争は、新たに公開された電子メールが、ある報道でこの訴訟におけるこれまでで最も強力な証拠と呼ばれるものを提示したように見えることから、さらに厄介な局面を迎えた。資料に含まれるArs Technicaの記事によると、この資料は、Metaが海賊版書籍を使ってAIシステムを訓練したと訴える書籍著者らによって利用されており、訴訟記録で閲覧可能になった電子メールは、同社がデータをどのように収集したかをめぐる著者らの主張を補強する可能性がある。

情報資料における主要な疑惑は、Metaが著作権で保護された素材を含む81.7テラバイトのデータセットをトレントでダウンロードし、シードしたというものだ。この数字は、この訴訟がこれほど注視されるようになった理由を説明できるほど大きい。事実であれば、企業が大量のデータを使用しただけでなく、その一部が、適正にライセンスを得たという説明とは整合させにくいファイル共有の仕組みを通じて移動したことを示唆する。Arsによると、公開された電子メールはその慣行をめぐる社内事情を付け加えている。

報道に法的な重みを与えているのは「最も決定的な証拠」という表現で、最新の提出書類が単なる背景情報以上のものになり得ることを示している。情報源の抜粋によると、この電子メールは書籍著者らが起こした著作権訴訟におけるMetaの抗弁を複雑にしている。平たく言えば、原告側は、同社が単に公開情報を取り込んだり、適正な許諾に依拠したりしたのではないことを立証しようとしている。訓練パイプラインには、適切なライセンスを得ていない著作権保護対象の書籍が含まれていたと主張しているのだ。

この報道は、問題を解決済みの事実関係として扱うのではなく、法廷内の問題にとどめるよう慎重を期している。資料は電子メールを疑惑の証拠とし、主張は著作権訴訟で審理されているとしている。この点が重要なのは、メッセージが何を意味するのか、どのように入手されたのか、著者らの中心的主張を証明するものかどうかを、裁判所がなお判断しなければならないからだ。それでも、トレントでのダウンロード、シーディング、社内電子メールという組み合わせは、訴訟を抽象的な政策論争から文書に基づく争いへと転換させ得る種類の詳細である。

だからこそ、この話はMetaだけにとどまらない重要性を持つ。AI業界全体の企業は過去2年間、訓練データ、フェアユース、ライセンス、そしてインターネットがモデル開発者にとって無料で好きなだけ使える情報源になったのかどうかをめぐって議論してきた。Arsの報道は、社内のやり取りが訴訟記録に載ると、そうした議論がどのように変化するかを示している。意図や手順の立証に役立つのであれば、電子メールの一文が技術アーキテクチャ図と同じくらい重要になる可能性がある。

資料は訴訟に決着をつけるものではなく、裁判所が本案について判断を下したとも述べていない。資料が示しているのは、原告側が、自らの主張をより強固にすると考える資料を入手したということだ。Metaにとっては、モデルがどのように構築され、どのようなデータから学習したかをめぐってすでに圧力を受けている時期に、さらなる法的精査に直面することを意味する。