《科创板日报》7月29日讯 随着AI生成内容如潮水般涌入互联网,由人工创作的“干净语料”倏然变为稀缺资源。在这一趋势下,AI巨头们将目光投向了纸质书籍。
日前,独立媒体404 MediaX一则报道指出,人工智能公司正在批量购买2022年前出版的珍稀书籍,利用液压切割机切除书脊并加以扫描,从而获取未被AI“污染”的干净数据(2022年前出版的图书不包含AI生成内容)。
为防止数据再度流入市场,这些书籍在事后往往会被粉碎销毁。报道指出,Anthropic曾销毁数百万册实体书,甚至包括存世量极少的绝版古籍。
据悉,这项行动被Anthropic称作“巴拿马计划”,并且被美国联邦法院判决为合法。法院认定,“合法购买纸质书再加以破坏性扫描”的模式属于合理使用。
报道甫一公开,相关舆论迅速在社交媒体发酵:X平台账号Hedgie转述此事时得到马斯克回复。后者表示:“已经要求SpaceXAI团队保存图书馆中所有珍贵的书籍,并采用无损扫描方式,从而避免破坏书脊。”
Hedgie对此回复称:“感谢马斯克团队这样做,虽然扫描速度慢一些,但你们仍然可以获得训练数据。如果SpaceXAI能够坚持这样做,那么其他业内公司也应该以此为标准。”
无论采取何种方式获取数据,种种迹象表明,书籍已成为AI训练语料的重要来源之一。
如上述报道所述,ISBNdb是一家提供大批量图书采购服务的公司,其号称拥有“全球最大的图书数据库”,并于近年转型为AI企业的“图书数据供应商”。《华盛顿邮报》则发现,Anthropic已与Better World Books建立合作,后者是图书馆、零售商和个人出售旧书的平台。
在此背景下,海外出版传媒集团与AI企业之间频繁爆发法律纠纷:
7月22日,新闻集团(News Corp)式向加州奥克兰联邦法院提起反诉,指控美国搜索引擎公司Brave Software未经授权大规模抓取并转售《华尔街日报》《纽约邮报》等旗下媒体的文章内容,用于人工智能模型训练。
7月14日,一群主要出版商对谷歌提起诉讼,指控该公司非法使用数百万本受版权保护的书籍来帮助其构建Gemini人工智能模型,称这是“历史上最严重的侵犯版权行为之一”。谷歌内部指出,如果将出版商提供的文本用于Google Play图书,公司可能面临“100亿至1000亿美元的潜在罚款”。
中信证券研报指出,预计2026年文化IP数字化运营有望为出版业带来约700亿元增量空间。大模型训练需要大量的优质语料数据,出版企业所拥有的内容资产可以为模型提供丰富的优质语言素材。中泰证券表示,相关出版公司内容版权归属较清晰,垂类内容优势明显,有望跨越互联网、AI等多个技术周期,成为持续发展的底层核心资产。
