如同经典反乌托邦小说《华氏451度》中的场景,一些人工智能公司不仅阅读书籍,还在销毁它们。随着开发者竞相构建更强大的AI模型,以及版权诉讼不断增加,一门新兴行业应运而生:向AI公司供应数百万本实体书,这些书被拆解、扫描成训练数据集后丢弃。
据404 Media首次报道,AI公司正通过中间商以工业规模匿名收购书籍。专门从事批量采购的公司声称能定位数十万种图书,同时为AI客户保密,反映出这一做法的敏感性。批评者认为,这股收购热潮源于AI公司急于在人类知识被AI生成文本(常被称为“AI垃圾”)稀释之前,保存人类作者创作的知识。2023年生成式AI兴起之前出版的书籍尤其珍贵,因为它们提供了完全由人类编写的高质量训练数据。
需求的激增已经开始重塑二手书市场。一位不愿透露姓名的书商告诉404 Media,在AI买家进入市场后,他的周销量从大约20本攀升至数百本。虽然销量增长带来了利润,但他担心那些稀有和绝版书籍在被扫描销毁后永久消失。“这对我有经济上的好处,也能清理掉原本难以售出的旧库存,”该书商表示,“我拥有来自海外和外文书籍的库存,非常适合这类销售。但另一方面,我不喜欢最终的用途,也不喜欢稀有书籍被直接打成纸浆。”
这种做法与Anthropic公司的“巴拿马项目”如出一辙,该项目通过破坏性扫描将数百万本书数字化。去年夏天,在Bartz诉Anthropic PBC的版权诉讼中,旧金山联邦法官裁定,将合法购买的实体书扫描成数字副本(即使原书被销毁)构成“转换性合理使用”。随后,联邦法官在涉及OpenAI和Meta的另一起版权案中作出了类似裁决。然而,在同一地区的另一起案件中,一名联邦法官本周批准了一项15亿美元的和解协议,要求Anthropic因使用盗版作品训练Claude向数千名作者支付每本书约3000美元的赔偿。
面对日益增长的反对声,包括Elon Musk在内的AI开发者公开批评了这一做法,并表示公司应保留被扫描的书籍。“我已要求SpaceXAI团队将任何稀有书籍保存在图书馆中,并以更困难的方式扫描,而不是直接切掉书脊再扫描,”Musk在X平台上写道。
