AI学習データの著作権レッドラインが引き締まりつつある。2026年9月21日、米国作家協会(Authors Guild)は、Alter v. OpenAI and Microsoft訴訟における原告側の最新準備書面で引用された内部文書を公開した。OpenAIとマイクロソフトの幹部は、海賊版図書サイトLibGenの蔵書をモデルの学習に使うことに法的リスクがあることを何年も前から知りながら実行し、2022年夏には痕跡の消去を試みていたという。
この集団訴訟はニューヨーク南区連邦地方裁判所で審理中(事件番号1:23-cv-08292)で、両社に対する広域係争訴訟(MDL)の一部である。原告には作家協会と十数名の作家が含まれ、ジョージ・R・R・マーティン、ジョン・グリシャムらが名を連ねる。2026年9月17日、原告は一部略式判決を求める申立て(Docket 1982)と162ページの事実陳述書(Docket 1987)を提出し、作家協会がこれを公表した。
何が起きたのか:海賊版書籍のダウンロードから「Project Clear」まで
原告準備書面が引用する内部文書によれば、時系列は概ね次の通りである。
2018年、OpenAIはLibGenから約11万7500冊の書籍をダウンロードし、さらに約35TBのデータをトレントで取得した。準備書面によれば、これは当時のLibGenの全蔵書460万冊に相当する。2019年4月、サム・アルトマンがビル・ゲイツにGPT-3の初期版を披露した際、資料には「Library Genesis(LibGen)からさらに約110億語を追加」と明記されていた。その2か月後、マイクロソフトはOpenAIに10億ドルを出資した。GPT-3の論文では、このデータは「Books1」「Books2」と呼ばれていた。
より重要なのは「認識」の証拠である。2020年5月、OpenAIの政策ディレクター、ジャック・クラークは社内で、モデルが「人々を失業させる」こと、「アーティストたちが懸念を表明する時点が来るだろうが、我々はその懸念を無視してリリースする可能性が高い」ことを書き記した。2022年にモデルの文章力向上のために入社したタルン・ゴギネニは、作家たちの「データセットは盗まれたものだ」という訴えを「許容可能な経済的代償」とみなし、『氷と炎の歌』最終2巻をGPTに書かせる構想まで語っていた。
マイクロソフトも「認識」の追及対象となっている。準備書面によれば、2019年4月のデモの場で、アルトマンと当時OpenAI研究ディレクターだったダリオ・アモデイは、ゲイツらに対してLibGenの利用を開示していた。アモデイは当時、LibGenを「学習データとしてはやや怪しい(a bit sketchier)」と評し、研究者のサム・マッキャンドリッシュが心配したのは「見栄え」だった——「Hacker Newsに『OpenAIが怪しいロシアのサイトの著作権データを学習に使用』と出たらまずい」というものだ。
2022年夏、OpenAIは「Project Clear」というコードネームの削除作戦を開始し、LibGenファイルを削除した。2022年6月15日のSlack記録では、ドキュメントやチャット履歴のあちこちに「libgen」の言及があることをどうするかという問いに対し、研究担当副社長のボブ・マクルーがその夜こう返信した。「OpenAIがこれほど注目されている今こそ、LibGenをシステムとストレージから除去する好機だ」。これに先立ち、オナ・ワン判事はこのSlack記録に対するOpenAIの秘匿特権の主張を退け、「project-clear」「excise-libgen」チャンネルの記録の提出を命じていた。
誰に影響するか:AI開発者が直撃、作家・出版社は交渉材料を得る
最も直接的な影響を受けるのは、AIモデルの開発者と学習データの責任者だ。これまで学習データの著作権をめぐる議論は「フェアユースが学習行為をカバーするか」に集中していたが、この準備書面は戦場を「海賊版書籍のダウンロードと保存自体が侵害か」、そして企業が「認識」していたかどうかへと前進させた。「認識」が認定されれば、フェアユースの抗弁の余地は大幅に狭まる。米第9巡回区控訴裁判所が別のAI著作権訴訟で扱ったのはAI生成物が著作権管理情報を削除するかだったのに対し、本件は学習データの出所の適法性が問われており、戦場が異なる。
作家と出版社はもう一方の当事者だ。作家協会の会員は1万8000人で、原告にはベストセラー作家も多数含まれる。注目すべきは、本件の文書開示の数日前に、『ニューヨーク・タイムズ』対マイクロソフト・OpenAI訴訟でも同様の文書が公開され、数百万本の記事の学習利用が新聞業界に「存亡の脅威」をもたらすと示されたことだ。二つの戦線が呼応し始めている。
ただし境界線を明確にしておく必要がある。以上はすべて原告側準備書面とそこに引用された内部文書に基づく一方的な主張である。侵害の成否やフェアユースの適用について、裁判所はまだ判断を示していない。準備書面が求めているのは一部略式判決であり、今後数か月で双方がさらに書面を提出し、審理は2027年初頭に見込まれている。
何をすべきか:記録の削除より先にデータ来歴の監査を
モデルを学習させた、あるいは学習中のチームにとって、この訴訟が示す実行可能な対応は4つある。
第一に、学習データセットにLibGenやZ-Libraryのような海賊版由来のデータが混入していないか確認すること。データの出所、取得方法、ライセンス状態を記録する完全なデータ来歴監査を実施する。
第二に、ライセンス交渉はできるだけ早く。Anthropicは同様の海賊版書籍学習訴訟(Bartz v. Anthropic)で15億ドルの和解金を支払った。「まず作って後から許諾」方式のコストは、事前許諾よりはるかに高くつく可能性がある。
第三に、海賊版データを発見したら証跡を残して除去すること。ただし「Project Clear」の真似は禁物だ。削除が証拠隠滅と解釈されれば、かえって「認識」の裏付けになる。本件で判事が関連Slack記録の全面提出を命じたのは、まさにそのためである。
第四に、社内コミュニケーションの管理だ。Slack、ドキュメント、論文草稿におけるデータ出所の議論は、すべて証拠開示の対象になる。根本的な解決策は事前のコンプライアンスであり、事後の「見栄え」管理ではない。
リスクはどこにあるか:3つの数字と1つの時期
1つ目の数字は15万ドル——米国著作権法における「故意侵害」の法定賠償の上限額(1作品あたり)である。原告準備書面が「認識」を軸に組み立てられているのは、まさにこの賠償区分に到達するためだ。11万7500冊に15万ドルを掛ければ天文学的な数字になる。
2つ目の数字は15億ドル——Anthropic事件の和解金額だ。並行する訴訟では、連邦判事がすでに次の判断を示している。海賊版書籍の違法ダウンロード自体が独立した侵害であり、後に正規品を購入しても変わらない。この判例の論理が本件にも及べば、OpenAIのフェアユースの防衛はさらに厳しくなる。
3つ目のリスクは時期である。審理は2027年初頭に見込まれ、今後数か月で双方がさらに書面を提出する。第三者のモデルAPIを利用する企業にとって、リスクは間接的だが現実的だ。学習データの適法性に問題があると判断されれば、サプライヤーのコンプライアンス上の瑕疵がサプライチェーンを伝って波及しうる。
最後に適用範囲を確認しておく。この訴訟は米国著作権法の下で争われており、LibGenは2017年から米国通商代表部の「悪名高い市場」リストに載っている。学習データのルールは法域ごとに異なるため、米国裁判所の行方をそのままグローバル事業に当てはめることはできない。
AI企業にとって、この訴訟は学習データのコンプライアンスを「法務からの助言」から「証拠開示」レベルのリスクへと引き上げた。データがどこから来たのか、誰が知っていたのか、いつ知ったのか——そのすべてが法廷の証拠になりうる。