一本厚书被推进液压切纸机,随着压板落下,刀片切入,原本连贯的书脊被干脆利落地削掉,书页瞬间散开,变成了一沓整齐的纸张。若没有后续解释,这段画面或许能让人感到“极度解压”。
但如果告知你,这是AI公司批量处理纸质书的方式,其中可能包含大量冷门书或绝版书,恐怕你不仅无法感到舒适,反而会心生寒意。
为了获取更多训练数据,AI公司已将触角从公开互联网、盗版电子书延伸至现实世界的纸质书。其中,2022年以前出版的书籍因未混入AI生成内容,且未经过现代数据投毒工具处理,被视为难得的“上品”。而那些在网络上搜不到、没有电子版的冷门书和绝版书,因能提供互联网抓取不到的内容,更是“上上品”。Anthropic被曝光的“巴拿马计划”便明确表达了这种意图。AI公司也深知此事“不好看”。
AI公司盯上纸质书,最早源于Anthropic卷入的一场官司。2024年8月,三名作家起诉Anthropic,指控其未经授权使用其作品训练Claude。尽管此类争议自ChatGPT问世以来便屡见不鲜,但纸质书最初并非主角。
为了让Claude更强大,Anthropic首先扫荡了公开互联网,随后盯上了经过作者写作、编辑筛选的书籍。虽然直接下载电子书最方便,但Anthropic通过法庭文件显示,其曾从Books3、LibGen和PiLiMi等资源库下载了超过700万本书,其中相当一部分来自盗版网站。这些文件被存入“中央图书馆”以备未来使用。
随后,“巴拿马计划”启动。这是一个大规模购买纸质书、扫描并喂给AI的工程。起初,法庭关注的是获取方式的合法性。2025年6月,法官威廉·阿尔萨普给出了对Anthropic有利的判决。他认为,大模型读取书籍是为了学习语言、知识和表达方式以生成新内容,这种用途具有“转化性”,类似于人类读书后创作,属于合理使用。至于购买纸质书,Anthropic已为每本书付款,扫描后销毁实体书,只保留数字副本,未增加市场流通量,因此也不侵权。但盗版获取的700万本书则无法辩护。
2025年1月,《华盛顿邮报》解封的法庭材料揭示了“巴拿马计划”的更多细节。Anthropic在一年内花费数千万美元,买下数百万本书。供应商切掉书脊,将散页送入高速扫描仪,最后将纸张交给回收公司。仅一份方案就计划半年内处理50万至200万本书。
规模之惊人,令Anthropic内部文件中的两句话格外刺眼:“巴拿马计划,是我们对全世界所有书籍进行破坏性扫描的行动。”“我们不希望外界知道我们正在做这件事。”这暴露了公司标榜的“AI安全”与背地“毁书”的矛盾。切书原本可以解释为追求效率,但“不希望外界知道”则让人不得不怀疑,Anthropic自己也清楚,此事一旦公开,绝对说不过去。
Anthropic到底偷偷毁了多少书?《华盛顿邮报》未获完整书目,外界也不清楚其中畅销书与绝版书的比例。人们震惊于工业化切书的规模,却难断具体损失。
半年后,404 Media的报道将担忧聚焦于绝版书。报道提到ISBNdb,一家号称拥有全球最大图书数据库的公司,公开接单为AI公司采购纸质书,货源包括旧书店、图书馆和绝版书目录,数量从1000到100万本不等,并签署保密协议隐藏买家身份。
更讽刺的是,ISBNdb自己也知道这门生意见不得光。它在宣传中直言:“AI公司毁掉200万本书”绝非能赢得同情的标题。此外,AI公司尤其青睐2022年以前的纸质书,因为那是未经AI污染的“人类知识”。
这股需求传导至二手书市场。一名书商表示,从今年4月开始,处理冷门书、绝版书的订单量激增。虽然清库存是好事,但书商对书的最终用途感到不适:“我不喜欢这些书最后的用途,也不喜欢那些不常见的书被打成纸浆。”正如前文所说,AI公司扫描纸质书的流程很粗暴,这让生意变好的书商也忍不住心疼。
从互联网到盗版电子书,再到可以批量买来的纸质书,AI公司一直在寻找训练资源的触角向外延伸。现在,冷门书籍乃至绝版书也难以幸免。绝版不等于孤本,目前尚无证据证明某本书的最后一册已被销毁。但风险显而易见。
2025年的判例(至少在美国范围)已给Anthropic一定的法律保护。法官认为,合法购买纸质书并销毁实体,只保留数字文件,属于合理使用。按此逻辑,销毁实体书甚至成了降低法律风险的手段。康奈尔科技学院教授James Grimmelmann认为,Anthropic放弃盗版库,转而购买扫描纸质书,是一个“聪明”且“克制”的做法。
然而,这种做法对绝版书而言代价巨大。畅销书销毁一册影响不大,但绝版书往往承载着历史痕迹,如批注、签名、装帧等。这些信息依附于具体的实体书,一旦被破坏,后人便无法复原。也就是说,AI公司得到的是适合训练的数字文件,却可能毁掉了无法通过数字文件完整还原的实物。
争议扩大后,科技行业很快出现了退让。马斯克在X上表示,已要求SpaceXAI将稀有书籍保存在图书馆,并采用无损扫描。ISBNdb则反应更快,在报道发布9天后删除了面向AI公司的采购页面,声称那只是“市场需求测试”,服务从未真正上线。
这番解释能否令人信服是一回事,它至少说明,匿名帮助AI公司大批量采购纸质书,已成为企业不愿承担的声誉风险。
不过,马斯克的承诺和ISBNdb的撤回,都代替不了真正的规则。谁负责在扫描前判断一本书是否稀有?判断依据是出版年份、版本,还是书里的签名、批注?AI公司是否应公开大规模采购的书目?如果某本书已绝版,是否只能采用无损扫描并在扫描后交给图书馆保存?目前,这些问题都没有答案。
讽刺的是,ISBNdb此前反复强调,2022年以前的纸质书之所以珍贵,正是因为它们保存了未受AI污染的人类知识。AI公司越承认这些内容不可替代,就越难解释为何承载它们的实体可以被当成一次性耗材。
