亚马逊被曝拆毁稀缺图书,为 AI 训练获取扫描文本
一批装有追踪器的图书揭开亚马逊训练数据供应链:实体书被批量购入、拆解并扫描,原件随之损毁。
浮出水面的实体训练数据供应链
404 Media 的一项调查追踪了一笔大规模稀缺及绝版图书订单,最终发现这些书被运往亚马逊位于拉斯维加斯的一处设施。据报道,工作人员会拆除装订,以便快速扫描书页并用于 AI 开发,实体原件则在这一过程中被毁坏。这为外界了解科技巨头如何从公开互联网之外获取受版权保护的材料提供了罕见窗口。
调查源于一名书商通过 Biblio 收到约 1000 本书的订单。该交易平台允许买方隐藏身份。经书商配合,记者在其中一本书内放入 AirTag,并一路追踪至亚马逊仓库。报道援引工作人员称,现场会先切除书脊,再批量扫描页面,因此原书无法保留。
亚马逊确认,公司会通过商业渠道购买书籍,用于开发和改进面向客户的产品与服务,但没有公开说明扫描内容被用于哪些模型、数据集或产品。由于亚马逊购买了实体副本,这种做法与直接抓取未经授权的数字书库在法律上并不完全相同;不过,训练行为的版权边界以及原始材料应否保留,仍存在争议。
为什么重要
这项调查表明,围绕高质量训练数据的竞争正在延伸到实体档案。稀缺和绝版书籍包含大量常规网络数据集未必收录的内容,对寻求更干净、更丰富语料的 AI 实验室具有吸引力。
合法购书并不能消除所有问题。破坏性扫描可能令本已稀少的作品退出流通,而匿名批量采购也使书商、作者和收藏者难以判断具有文化价值的材料最终流向何处。亚马逊没有披露下游数据集,更限制了外界对授权、来源和重复收录情况的审查。
这项调查把 AI 训练数据争议从抽象的网页抓取,转化为由交易平台、仓库和被毁实体书组成的具体供应链,也可能促使图书馆、经销商和监管机构重新评估现行规则能否同时保护知识产权与稀缺文本的实物保存。