伴随AI生成内容在互联网上泛滥成灾,人工撰写的“干净语料”变得日益稀缺。在此背景下,AI巨头们将目光转向了实体书籍。独立媒体404 Media的一则报道揭露了这一现状:AI公司正批量购入2022年以前出版的书籍。他们利用液压设备切除书脊并进行扫描,以此获取未被AI生成的“干净”训练数据。为防止数据泄露,这些书籍往往在扫描后被粉碎销毁。据报道,Anthropic已销毁数百万册实体书,甚至包括存世量稀少的古籍。
Anthropic将此举称为“巴拿马计划”。值得注意的是,美国联邦法院已裁定该行为合法,认为“合法购买纸质书并进行破坏性扫描”属于合理使用范畴。该报道引发舆论热议。X平台账号Hedgie在转述此事时,收到了马斯克的回复。马斯克表示,已要求SpaceXAI团队保存珍贵书籍并采用无损扫描方式,以避免破坏书脊。Hedgie对此表示感谢,并呼吁行业应以SpaceXAI为标准,即便扫描速度较慢,无损获取数据依然是可行的。
无论采用何种手段,书籍已成为AI训练语料的重要来源。据报道,号称拥有“全球最大图书数据库”的ISBNdb已转型为AI企业的数据供应商,而Anthropic也与旧书交易平台Better World Books建立了合作。由此引发的版权纠纷也愈发频繁:7月22日,新闻集团向法院提起反诉,指控Brave Software未经授权抓取其旗下《华尔街日报》等媒体内容用于AI训练;7月14日,主要出版商也对谷歌提起诉讼,指控其非法使用受版权保护的书籍训练Gemini模型,谷歌内部对此感到担忧,若违规使用出版商文本可能面临高达千亿美元的罚款。
中信证券研报指出,预计2026年文化IP数字化运营将为出版业带来约700亿元的增量空间。大模型训练亟需大量优质语料,出版企业的内容资产能为模型提供丰富的语言素材。中泰证券亦认为,出版公司版权归属清晰,且在垂类内容上具备优势,有望跨越多个技术周期,成为持续发展的核心资产。
