IT 注目度 78

マイクロソフト、AIチャットボットの著作権侵害訴訟で「原文の再現は稀」と主張

※本記事の要約および解説はAIが自動生成しており、誤りが含まれる可能性があります。事実確認は元ニュースをご参照ください。

マイクロソフトは、ニューヨーク・タイムズ(NYT)などの出版社や著者らから提起された著作権侵害訴訟において、自社のAIチャットボット「Copilot」がニュース記事や書籍の内容を再現することは極めて稀であると、新たな法廷提出文書で主張しました。本訴訟は、AIが著作物を利用して生成したコンテンツが、元の著作権者のビジネスを脅かし、市場を侵害しているという点に焦点が当たっています。

マイクロソフト側は、訴訟の証拠開示の一環として、820万件を超えるCopilotのチャットログを専門家に提供しました。同社によると、これらのログは、訴訟原告のウェブサイトの使用を示唆するキーワードを含むものに絞り込まれたものです。分析の結果、ログ全体のうち、少なくとも16語がニュースコンテンツと共通するものは1パーセント未満であったと主張しています。さらに、特定の調査機関の専門家による分析では、データセット内に「実質的な重複」が確認されたのは51件に留まり、著者側の訴訟では、少なくとも30語が一致する応答はわずか24件であったと報告しています。また、評価された212冊の書籍のうち、一致が見られたのはわずか10冊に過ぎないと述べています。

一方、NYTの主任弁護士は、これらの証拠開示を通じて得られた証言は「マイクロソフトとOpenAIが、同社のジャーナリズムに代わる商業製品を製造するためにNYTから盗んだ」という結論しか導き出せないと強く反論しました。マイクロソフトは、著作権コンテンツをAI学習データセットに使用することは「フェアユース(公正利用)」に該当すると主張し、Copilotのようなシステムが元の目的とは大きく異なる用途で利用されるため、部分的なテキストの再現は「変革的な目的」を損なうものではないと反論しています。マイクロソフトは、裁判官に対し、早期の判決(summary judgement)を下すよう求めています。


背景

近年、生成AI(Generative AI)の急速な発展に伴い、AIモデルの学習データとして大量の著作物(ニュース記事、書籍など)が利用されるようになりました。これに対し、著作権を持つ出版社や著作者側が、AIによる学習や出力が著作権侵害にあたるとして、マイクロソフトやOpenAIなどの開発企業を相手取り、大規模な法的係争を巻き起こしています。

重要用語解説

  • Copilot: マイクロソフトが提供するAIアシスタント機能。ユーザーの質問に対し、チャット形式で回答を生成する大規模言語モデル(LLM)を搭載したサービスであり、本件ではその学習データ利用が争点となっています。
  • フェアユース(公正利用): 著作権法における概念の一つで、著作物の利用目的や方法が、著作権者の利益を不当に害さない場合に、著作権者の許諾なく利用できる範囲を指します。AI学習における利用がこれに該当するかどうかが争点です。
  • 大規模言語モデル(LLM): 大量のテキストデータからパターンを学習し、人間のような自然な文章を生成するAIモデルの総称です。Copilotの基盤技術であり、著作権侵害の議論の中心となっています。

今後の影響

本件の判決は、今後のAI開発における「学習データの利用範囲」に関する世界的な法的基準を確立する可能性が高く、AI企業とコンテンツ産業の経済構造に甚大な影響を与えます。もし著作権侵害が認められれば、AI開発はより厳格なライセンス契約やデータ管理を求められるでしょう。