出来事の日付:2026年9月18日。

ニューヨーク・タイムズなどの報道機関がOpenAIとMicrosoftを相手取った著作権訴訟で、新たに黒塗りが解除された資料により、生成AIの学習が報道に及ぼす影響について、社内で極めて率直な評価が行われていたことが明らかになった。この資料は報道機関側の準備書面で説明されているもので、主張はまだ裁判で判断されておらず、根拠となる証拠の一部も非公開のままである。

提出資料に関するTechCrunchの報道によると、Microsoftの応用科学ディレクターBrent Hecht氏による2023年1月のメモは、報道資料の大量複製を並外れた窃盗と呼び、人類史上最大の労働の窃盗だと表現した。書面は、OpenAIの中間学習用データに、タイムズ、ニューヨーク・デイリーニューズ、調査報道センターの著作物の複製が91,000件以上含まれ、Common Crawl由来のデータ群にはnytimes.comの文書が200万件以上含まれていたとしている。

提出資料はまた、OpenAIとMicrosoftがBingのインデックスやTaxi、Mangoと呼ばれるプロジェクトなど、複数の経路を通じて学習データを集めたと主張する。Project Mangoには原告である報道機関の著作物が少なくとも160,903件含まれていたとされる。報道機関側はさらに、OpenAIの職員がタイムズの有料購読制限を回避する方法を議論し、モデルの学習前に資料から著作権表示を削除したと主張する。これらは原告側による説明であり、報道は、引用のいくつかが元の文脈全体を示さずに提示されていると注意を促している。

書面で引用された社内の議論はデータ収集にとどまらない。OpenAI幹部のNick Turley氏は、チャットボット製品が報道機関の代替となる度合いを強める恐れがあると警告したとされる。Microsoftの文書には、生成AIが学習に使われた資料を作った人々の仕事を揺るがすリスクが記されていたという。別の社内発表資料は、MicrosoftのCopilot回答エンジンが、従来のBing検索と比べ、タイムズのドメインへのクリック経由の流入を最大93%減らしたと説明し、ウェブとモデル品質への相互作用を、潜在的な「破滅の循環」と位置づけた。

提出資料によると、Microsoftのサティア・ナデラ最高経営責任者は、有料購読の対象資料をグラウンディングや学習に用いる場合はライセンスを得るべきだと証言した。また、OpenAIが有料情報で学習していたと知っていれば、Microsoftの契約上の権利を行使し、再学習を求めることを検討しただろうとも述べた。

今回の開示は、著作権で保護された著作物をモデルの学習に使うことがフェアユースに当たるかという中心的な争点を際立たせる。市場での代替性や元の著作物への損害は、裁判所が検討する要素に含まれる。OpenAIとMicrosoftは、TechCrunchのコメント要請に回答しなかった。したがって、新しい資料は報道機関側の主張に証拠を加えるものではあるが、それだけで法的問題を解決したり、責任を確定したりするものではない。