当代版的“焚书坑儒”判决终于落下了帷幕。然而讽刺的是,Anthropic 在诉讼中承认的“焚书”行为,反而成了整起案件中法律风险最低的一环。
从 2024 年 8 月到 10 月 20 日,这场关于 Anthropic 盗用书籍训练数据的集体诉讼拉锯了近两年,最终法院批准 Anthropic 向原告支付 15 亿美元的天价和解金。这个数字的震撼程度可见一斑。根据路透社此前报道,Anthropic 在 2023 年至 2025 年的两年实际营收仅为 50 亿美元。这笔赔偿几乎砍断了他们的“大动脉”,作为 AI 行业首个因版权问题付出如此惨重代价的公司,这无疑是一次杀鸡儆猴。
为了探究原因,我们翻阅了判决书,发现这场风波的导火索源于 Anthropic 自己递出的“刀子”。早在 2021 年 12 月,Anthropic 曾发表过一篇论文,详细介绍了其早期大模型的训练数据来源,主要包括 Common Crawl 爬取的网页和网络书籍。在论文引用区,一个名为 The Pile 的数据集引起了广泛关注,其中包含近 20 万本电子书。
当时,这个名为 Books3 的子集被广泛认为是不受版权保护的,几乎所有大模型都曾使用它进行训练。虽然书籍后来被下架,但在当时,Anthropic 仍处于学术研究阶段,版权方暂时只是将其记在账上。真正让 Anthropic 面临致命一击的,是 2024 年媒体对企业使用 The Pile 训练模型发起的大规模调查。面对记者的追问,Anthropic 发言人最终承认,其商业模型 Claude 确实使用了包含侵权内容的 The Pile 进行训练。
这一承认彻底激怒了版权方。作家们认为,Anthropic 非法获取作品,利用训练出的模型获利甚至抢占饭碗,却分文不给。于是,三名作家代表数十万版权人发起了这起史上最大的 AI 版权诉讼。
在立案后,原告深入调查了 Anthropic 的内部情况,结果发现 Books3 的规模根本不算什么。Anthropic 还使用了 LibGen 和 PiLiMi,加起来至少有七百万本没有版权的非法下载书籍。此外,案件中还有一个极具讽刺意味的细节:Anthropic 为了规避法律风险,花费数百万美元收购纸质书籍,经过去皮、切页等破坏性扫描后构建数据库。虽然这种做法在法律上符合“首次销售原则”,但在伦理上却显得极其恶劣。相比之下,Google Books 扫描完整图书且保留原件的做法曾被法院认定为合理使用,而 Anthropic 为了降低成本,直接将书拆解销毁。
这一行为迅速引爆了舆论。社交媒体上相关讨论的浏览量已超过两千万,评论数近四千条。专家学者纷纷谴责 Anthropic 不地道,二手书商也担忧自己库存中珍贵的绝版书可能被销毁。马斯克也站出来批评了这一行为。Anthropic 的举动被指责为试图垄断人类文明,甚至被戏称为“历史罪人”。
更具讽刺意味的是,Anthropic 这套看似合规的扫描操作,反而向法官证明了他们深谙版权法。既然知道如何规避风险,那么此前的盗版下载行为就是明知故犯,罪加一等。
目前案件已进入上诉期,在已被申领侵权的作品中,91.3% 获得了每本 3000 美元的和解金。尽管如此,这场官司中获利最多的恐怕是原告的律师。原本律师费高达 3 亿美元(和解金的 20%),经法院削减后仍达 1 亿美元,这依然是一个惊人的数字。
尽管遭受重创,这大概率不是 Anthropic 为版权付出的最后一笔钱,许多放弃集体诉讼的版权方仍在单独维权。但这起判决已为所有未决的 AI 版权案树立了标杆:法院不再拖泥带水,判决果断,先解决赔偿问题。面对 AI 发展与人类权益的博弈,Anthropic 似乎更应先解决良心问题,而不是沉迷于技术竞赛。
