当AI生成内容占据互联网新发布内容的一半以上,高质量人类文本已成为稀缺资源。多家AI公司正通过中间商大规模收购二手图书,扫描后将其物理销毁,只为获取2022年之前“未被机器污染”的训练数据。Anthropic的“巴拿马计划”曝光了这一隐秘产业链,其15亿美元的和解金额创下了美国版权案件的历史纪录。这不仅是数据争夺战,更揭示了AI产业的核心悖论:它越成功,赖以训练的人类数据就越稀缺。
一、被拆解的旧书
调查媒体404 Media今年7月披露,多家AI公司正通过数据中间商ISBNdb大规模收购二手图书,切掉书脊、高速扫描、物理销毁。单次订单从1000本到100万本不等,书商销量在数月内飙升了五倍。Anthropic内部文件显示,其“巴拿马计划”在一年内花费数千万美元购买了数百万本纸质书,拆解扫描后全部销毁。
为何AI公司要花大价钱买旧书、拆书、毁书?答案指向一个它们自己制造的问题:互联网已经被AI生成内容污染了。斯坦福大学2026 AI指数报告显示,自2025年初以来,新发布的互联网内容中AI生成的比例已超过一半。2022年ChatGPT发布之前,这个数字接近于零。Cloudflare的数据也印证了这一趋势,其托管网站的网络访问请求中,约57.4%来自人工智能和自动化程序。
当AI模型用AI生成的内容继续训练时,就会发生“模型塌缩”。牛津大学等机构的联合研究证明,经过九次递归训练,模型输出质量会急剧退化,从讨论建筑到热情洋溢地介绍不存在的兔子物种。Epoch AI测算,语言模型将在2026年到2032年间耗尽人类公开的高质量文本数据。虽然合成数据看似是解药,但研究显示,训练数据中仅0.01%的虚假文本就能导致模型有害输出增加11.2%,呈现指数级放大。此外,作者们正在反击,芝加哥大学开发的Nightshade工具能让模型“中毒”。这意味着互联网爬取的数据无法保证“干净”,只有纸质书从时间线上天然免疫。
二、旧书争夺战
ISBNdb原本是一家服务于图书馆、书商和发行商的图书数据库公司,如今业务重心转向AI行业。其官网称书籍代表着经过精心策划、同行评审的人类知识,结构无法被网络爬虫复制。它提供批量采购,并承诺严格保密。据404 Media报道,采购对象几乎全部带有国际标准书号,毫无主题偏好,买家也不在意价格。一位书商表示,过去一周只能卖出约20本书,近几个月销量飙升至平时的五倍。
被大量买走的书多是长尾、冷门的绝版书籍,如地方史、土著语言文献、自费出版的回忆录等。Anthropic的巴拿马计划提供了一个完整标本。2024年初启动,由汤姆·特维负责。内部文件称:“我们不想让人知道我们在做这件事。”公司花费数千万美元购买数百万本书。负责该项目的汤姆·特维曾是Google Books项目的硅谷老兵。联合创始人本·曼恩早在2021年就亲自从盗版网站LibGen下载了至少500万本盗版图书,向同事转发链接附言“真是太及时了!!!”。CEO达里奥·阿莫代伊对此知情,在内部邮件中将寻求正版授权的理由概括为“法律/实践/商业上的繁琐工作”。
具体操作流程是:工人使用液压切割机切掉书脊,将散开的书页送入高速生产级扫描仪,转化为高清PDF文件,然后将纸质残骸直接送往回收公司销毁。ISBNdb的服务条款承认:“大规模扫描通常会毁掉书籍。”它建议客户将这一行为重新包装为“数字化保存”,但扫描后的内容进入私有数据库,公众无法访问。
三、买书合法,偷书不行
2025年6月,联邦法官威廉·阿尔苏普作出了一项双重裁定。一方面,他认定Anthropic的破坏性扫描行为属于“合理使用”,因为训练是“变革性”的。另一方面,他认定该公司曾下载700万本盗版图书侵犯了版权。2025年9月,阿尔苏普初步批准了Anthropic以15亿美元和解。这是美国版权案件中已知最大的和解金额。这组判决传递了清晰信号:买书、拆书、扫描、销毁,只要书是合法购买的,法院可能不拦你;但如果你从盗版网站下载,代价会极其昂贵。
Anthropic的律师团队提出了双重辩护:基于“首次销售原则”,合法购买后有权处理副本;叠加“合理使用”,扫描件仅用于内部训练,不对外分发。销毁原件反而“规避了非法复制”的指控。这种“合法但更贵”的路径正在重塑AI训练数据供应链。ISBNdb作为“法律上干净”的中间商应运而生。与Anthropic案不同,谷歌和Meta面临诉讼,核心在于“授权但超出范围”或从盗版网站获取。
四、被锁进黑箱的人类智慧
这场旧书争夺战揭示了一个悖论:AI公司承诺“让人类知识触手可及”,一边却在买断、拆毁人类知识最坚实的载体。扫描后的数字内容进入AI公司的私有数据库,公众无法访问。这与图书馆数字化为了保存和传播不同,AI公司的数字化是为了消耗和训练。
在批量采购中,AI公司是否会区分普通图书与珍贵绝版图书?如果稀有书籍被拆毁,它们可能永久退出流通。对中小作者而言,打击同样真实。AI公司提供的授权报价“在经济上完全不具吸引力”,一张永久AI训练许可证的报价大约只有每本书10美元。独立作者无法聘请顶级律所追责。几组关键数据对比显示,对中国AI从业者而言挑战严峻。据业内研究估计,中文高质量数据在全球大模型训练数据集中的占比极低。数据稀缺迫使国内开发者更多依赖机器翻译和合成内容,进一步加剧数据污染。DeepSeek-V3需要14.8万亿高质量文本片段来训练,这个量级的中文高质量数据目前根本没有。
五、旧书耗尽之后
即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,新一轮模型又要从这片被污染的海洋中捞取素材。收购旧书只是延缓了模型塌缩的速度,并没有解决根本问题。
学术界正在探索多条出路,如“累积”而非“替换”范式,或加入封闭循环之外的真实数据。但这些技术路径都有局限:它们赢得的是时间,不是永恒。模型塌缩的根本矛盾是,AI的成功正在毁掉它赖以成功的数据。我们需要的不仅是更高效的数据获取方式,更是一套让技术进步与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。人类花了几个世纪积累的知识,AI公司正在用几年时间消耗殆尽。这不再是一个技术问题,而是一个关于人类文明如何与人工智能共存的根本问题。
