科技调查媒体404 Media近日做了一项实验:他们在一批稀有旧书中放置了追踪器,最终信号停在了拉斯维加斯的一座亚马逊仓库。调查发现,这些旧书的最终用途并非转售或收藏,而是被拆封扫描后用于训练人工智能模型。
据在该仓库工作的亚马逊员工透露,他们的日常工作就是接收大量印刷书籍,然后割掉书脊以便快速扫描,纸质原书在这个过程中被彻底销毁。一名员工描述说,切掉书脊、摊平书页扫描后,书就当废纸处理掉了。
这并非404 Media首次报道AI公司大量收购旧书。上个月该媒体曾披露,多家AI公司正批量采购二手旧书,原因是这些出版物中没有所谓的AI垃圾内容,即由大语言模型生成的低质量文本。旧书被视为更干净、更可靠的训练语料。
有出版业人士指出,稀有书籍和绝版著作承载着独特的文化价值,将它们简单销毁并转化为训练数据,不仅是对作者劳动的不尊重,也可能导致部分珍贵版本永久消失。尽管AI公司辩称扫描属于合理使用,但相关法律争论仍在全球持续。
此次追踪让外界得以一窥AI训练供应链中鲜为人知的一环。随着大模型对高质量文本数据的需求不断膨胀,旧书、学术论文、新闻档案正成为科技巨头争夺的资源,版权保护与AI发展之间的张力也愈发突出。
