AI 训练数据的版权红线正在收紧。2026 年 9 月 21 日,美国作家协会(Authors Guild)公开了 Alter v. OpenAI and Microsoft 一案原告最新简报中引用的内部文件:OpenAI 与微软的高管早在多年前就知道,用盗版图书网站 LibGen 的藏书训练模型存在法律风险——公司还是做了,并在 2022 年夏天试图抹掉痕迹。
这起集体诉讼在纽约南区联邦地区法院审理(案号 1:23-cv-08292),是针对两家公司的多区诉讼的一部分,原告包括作家协会及十余位作家,乔治·R.R. 马丁、约翰·格里森姆等人名列其中。2026 年 9 月 17 日,原告提交了即决判决动议简报(Docket 1982)与一份 162 页的事实陈述(Docket 1987),随后由作家协会向公众披露。
发生了什么:从下载盗版书到"Project Clear"
根据原告简报披露的内部文件,时间线大致如下:
2018 年,OpenAI 从 LibGen 下载了约 11.75 万册图书,随后又通过 BT 抓取了约 35TB 数据——简报称,这相当于 LibGen 当时 460 万册的全部馆藏。2019 年 4 月,奥尔特曼向比尔·盖茨展示 GPT-3 早期版本时,文件里写明"又从 Library Genesis(LibGen)增加了约 110 亿词";两个月后,微软向 OpenAI 投资了 10 亿美元。GPT-3 论文中,这批数据被称为 "Books1" 和 "Books2"。
更关键的是"明知"的证据。2020 年 5 月,OpenAI 政策总监 Jack Clark 在内部写道,模型"将使人们失业","会有艺术家表达担忧,而我们可能会无视他们的担忧照样发布"。2022 年加入 OpenAI、负责提升模型写作质量的 Tarun Gogineni,则把作者们"数据集是偷来的"投诉视为"可接受的经济代价",还设想过让 GPT 写完《冰与火之歌》最后两卷。
微软也被卷入"明知"的指控:简报称,2019 年 4 月那次演示中,奥尔特曼与达里奥·阿莫迪(当时还是 OpenAI 研究总监)就向盖茨等人披露了 LibGen 的用法。阿莫迪当时评价 LibGen"作为训练集有点可疑(a bit sketchier)";研究员 Sam McCandlish 担心的则是"观感"——"要是 Hacker News 上出现'OpenAI 用俄罗斯盗版网站的版权数据'就不好了"。
2022 年夏天,OpenAI 启动了代号 "Project Clear" 的清理行动,删除了 LibGen 文件。2022 年 6 月 15 日的 Slack 记录显示,有人问起文档和聊天记录里到处都是 "libgen" 的提法该怎么办;研究副总裁 Bob McGrew 当晚回复:"鉴于 OpenAI 现在这么受关注,现在正是把 LibGen 从系统和存储中清除的好时机。"此前,主审法官 Ona Wang 已驳回 OpenAI 对这批 Slack 记录的特权主张,命令公司交出 "project-clear" 与 "excise-libgen" 频道的聊天记录。
影响谁:AI 开发者首当其冲,作者出版商看到筹码
最直接的影响落在 AI 模型开发者和训练数据负责人身上。过去关于训练数据版权的争论多停留在"合理使用(fair use)能不能覆盖训练行为";而这份简报把战场前移到了"下载和存储盗版书本身是否侵权",以及公司是否"明知故犯"。一旦"明知"成立,合理使用的辩护空间会被大幅压缩。此前美国第九巡回法院在另一起 AI 版权案中处理的是 AI 生成物是否删除版权信息,本案处理的是训练数据来源的合法性——两者不在同一个战场。
作者和出版商是另一端。作家协会拥有 1.8 万名会员,本案原告还包括多位畅销书作家。值得注意的是,就在本案文件披露的几天前,《纽约时报》诉微软与 OpenAI 一案也有类似文件被公开,显示用数百万篇新闻训练模型对报业构成"生存威胁"——两条战线正在形成呼应。
但必须划清边界:以上全部来自原告方简报及其引用的内部文件,是单方主张。法院尚未就侵权是否成立、"合理使用"是否适用作出裁决。简报请求的是部分即决判决,未来几个月双方还会继续提交法律文件,听证会预计在 2027 年初举行。
该怎么做:先做数据血缘审计,而不是先删记录
对训练过模型或正在训练模型的团队,这起案件给出了四条可执行的动作:
第一,排查训练数据集里是否混入 LibGen、Z-Library 这类盗版来源,做一次完整的数据血缘审计,记录每批数据的来源、获取方式和授权状态。
第二,能谈许可的尽快谈。Anthropic 在类似的盗版书训练诉讼(Bartz v. Anthropic)中已付出 15 亿美元和解,说明"先上车后补票"的成本可能远高于事前许可。
第三,发现盗版数据要清除并留痕,但不要学 "Project Clear"——删除本身若被解读为掩盖证据,反而会成为"明知"的佐证。本案中法官正是因此命令交出了全部相关 Slack 记录。
第四,管好内部沟通。Slack、文档、论文草稿里关于数据来源的讨论都会成为证据开示的对象。根本的解决办法是事前合规,而不是事后控制"观感"。
风险在哪里:三个数字与一个时间点
第一个数字是 15 万美元——美国版权法下"故意侵权"(willful infringement)的法定赔偿上限是每部作品 15 万美元。原告简报通篇围绕"明知"做文章,正是为了够到这一档赔偿:11.75 万册图书乘以 15 万美元,是个天文数字。
第二个数字是 15 亿美元——Anthropic 案的和解金额。在平行案件中,联邦法官已确认:非法下载盗版书本身就是独立的侵权行为,即使公司事后购买了正版书也一样。这个判例逻辑如果延续到本案,OpenAI 的"合理使用"防线会更难守。
第三个风险是时间:听证会在 2027 年初,未来几个月双方还会提交更多法律文件。对使用第三方模型 API 的企业,风险是间接但真实的——如果训练数据的合法性被判有问题,供应商的合规瑕疵可能沿着供应链传导。
最后要提醒适用范围:这场诉讼打的是美国版权法,LibGen 早在 2017 年就被美国贸易代表列为"恶名市场"。其他司法辖区的训练数据规则各不相同,不能把美国法院的走向直接套用到全球业务上。
对 AI 公司来说,这起案件把训练数据合规从"法务建议"升级成了"证据开示"级别的风险:数据从哪来、谁知道、什么时候知道的,现在都可能成为呈堂证供。