7月21日消息,美国加州北区联邦法院法官 Araceli Martínez-Olguín 批准了 Anthropic 与图书作者及出版商之间 15 亿美元的集体诉讼和解协议。法院称这是美国版权史上金额最大的集体诉讼和解。协议覆盖约 48.2 万部作品,每部作品的权利人预计获得约 3000 美元赔偿,Anthropic 须在终审判决后 30 天内销毁从盗版网站下载的全部数据集并提交书面证明。这是 AI 行业首次因训练数据的获取方式支付巨额赔偿,但需要注意的是,赔偿针对的是盗版行为,而非 AI 训练本身——此前 Alsup 法官已裁定用版权作品训练大语言模型属于合理使用。和解结案意味着此案不会进入上诉程序,不构成约束性判例。
700 万本盗版书、内部知情邮件与 Alsup 的双面裁定
案件起源于 Anthropic 获取训练数据的方式。据法院查明的事实,Anthropic 联合创始人 Ben Mann 从盗版网站 Library Genesis(LibGen)下载了至少 500 万本书,从 Pirate Library Mirror(PiLiMi)下载了至少 200 万本。法庭文件显示,内部邮件表明管理层知道来源的非法性质,但选择"窃取"而非合法授权,理由是避免"法律和商业层面的漫长流程"。公司后来聘请前 Google Books 负责人 Tom Turvey 转向合法路径——购买实体书、拆除装订、逐页扫描,但 Alsup 法官认定后续合法采购不能追溯消除此前的盗版行为。
2025 年 6 月 23 日,Alsup 法官在同一份裁定中做出了方向相反的两个判断。他认定用版权作品训练大语言模型属于"高度变革性使用",符合《版权法》第 107 条的合理使用条件;购买实体书后扫描数字化同样属于合理使用。但从盗版网站下载并长期保留数百万本书以建成永久性内部图书馆,不受合理使用保护。法院将"用数据做什么"和"数据怎么来的"切割成了两个独立的法律问题。Anthropic 面临的赔偿源于后者。
15 亿美元分四期支付,91% 作品已提交索赔
和解基金总额 15 亿美元,为不可撤回基金。Anthropic 已在初步批准后支付首笔 3 亿美元,终审批准后 5 日内再支付 3 亿美元,剩余 9 亿美元分两期在初步批准的第一和第二个周年日各支付 4.5 亿美元。律师费方面,原告律师团最初请求 1.875 亿美元,法官削减至 1.016 亿美元(约占基金 6.8%),另加约 264 万美元诉讼费用。
截至终审批准,91% 的覆盖作品已提交索赔(约 44 万部),远高于集体诉讼通常约 10% 的索赔率。协议仅覆盖 2025 年 8 月 25 日之前的下载和保留行为,不构成持续许可,也不免除 Anthropic 未来因模型输出或后续训练方式面临的索赔。6 名作者选择退出和解、提起个人诉讼,主张每部作品 15 万美元的法定最高赔偿。Anthropic 声明,盗版数据集及其任何部分均未进入商业发布的大语言模型训练语料。
3000 美元是盗版代价,不是训练授权价格
15 亿美元除以约 48.2 万部作品,得到约 3000 美元的单部作品清算价格。这是 AI 训练数据领域首次出现法院认可的可量化赔偿基准,约为普通版权侵权法定最低赔偿额的四倍。容易误读的地方在于把 3000 美元理解为"训练一本书该付的钱"。这个价格对应的是盗版侵权赔偿,不是合法训练的市场授权费——Alsup 法官已裁定训练本身是合理使用,如果数据来源合法,可能根本不需要支付版权许可费。
但现实中这个区分会被模糊。内容版权方在后续授权谈判中几乎必然援引此数字,而 AI 公司是否愿意坚持"合理使用不需付费"的立场,取决于各自数据获取方式能否经受审查。对正面临类似诉讼的 OpenAI、Meta、Google 来说,这个和解释放的信号是双面的:如果训练数据的获取路径清白,合理使用的抗辩空间已经过司法确认;如果存在盗版链条,赔偿风险独立于训练行为。
约束性判例缺位,行业走向取决于其他法官
Alsup 的裁定是地区法院层级的个案判断。Anthropic 选择和解而非上诉,意味着"训练合理使用、盗版不合理使用"的逻辑不会被上级法院正式确认或推翻,其他法官可以自行判断。New York Times 诉 OpenAI、Kadrey 诉 Meta、出版商诉 Google 以及针对 Midjourney 和 Perplexity 的案件,均在独立审理中。如果其中任何一位法官不认同"训练即合理使用"的判断,赔偿量级将完全不同——退出和解的作者主张的 15 万美元单部作品赔偿,就是另一种可能框架下的数字。在 Alsup 的框架下,15 亿美元是盗版的代价;在另一种框架下,15 亿美元可能只是 AI 训练数据成本的冰山一角。