正在加载文章内容,请稍候。
正在加载文章内容,请稍候。
Ars Technica 追踪亚马逊收购、拆解并扫描稀有书籍的链条,揭示 AI 训练数据需求与文化保存之间的直接冲突。

精准输入
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可保存笔记、高亮、划线和批注。
书商长期怀疑 AI 公司批量收购稀有书籍,扫描后直接销毁,却一直缺乏证据。一本暗藏 AirTag 的书被追踪到亚马逊拉斯维加斯 AI 训练设施后,这条链路第一次变得具体,也把训练数据竞争与文化保存的冲突推到台前。
过去一年左右,书商一直怀疑 AI 公司大批购买珍本,扫描用于训练后便把书销毁。直到现在,这一做法都很难证明。404 Media 报道,一枚藏在珍本中的 AirTag 表明,至少有一家在前沿模型竞赛中下大单的科技巨头就是 Amazon。
404 Media 周一披露,他们联系到一位书商,后者同意在大宗订单中的一本珍本里放入 AirTag。定位信息最终指向 Amazon 位于拉斯维加斯的一处 AI 训练设施。404 Media 称,那里有一支团队专门把书页从书脊上撕下来,再逐页扫描。
面对破坏性扫描引发的反弹,这支团队似乎毫无敏感度:仓库 VGT3 门上的标志是一只正要吞掉书本的霸王龙。

Amazon 拒绝评论 404 Media 的调查,只向 Ars 提供了同一份声明,其中没有具体提到 AI 训练。
声明说:“Amazon 通过商业渠道购买书籍,以帮助开发和改进客户使用的产品与服务。”
但 Amazon 正在开发自己认定的前沿 AI 模型,需要海量独特训练数据,才能与 Google、OpenAI 和 Anthropic 等领先公司竞争。目前,各家公司都严密保护训练数据,以免失去优势。难以找到的珍本文本看起来能给 Amazon 带来竞争优势,尤其是 Anthropic 和 xAI 已公开表示不会使用珍本或古籍训练。
Amazon 似乎也急需新的原创文本来源。404 Media 注意到网络论坛中 VGT3 工人的讨论:今年早些时候,Amazon 一度几乎没有书可扫描,短缺严重到工人担心如果找不到更多书,仓库就会关闭。工人说,供应曾完全耗尽。不过设施仍在运行,如今也已证实,送到那里的珍本大宗订单会被这支团队系统性销毁。
许多爱书人对破坏性扫描感到震惊,因为扫描并非必须毁书。坚定批评者迈克尔·伯里(Michael Burry)甚至把这种做法称为“邪恶的化身”。不过,Amazon 工人在论坛上说,对喜欢单调、时间灵活工作的人而言,这是一份“不错”的差事。
除了揭示书商珍视的稀有作品如何被 Amazon 的 AI 机器咀嚼吞下,404 Media 的调查还为另一个理论增加了证据:AI 公司为什么选择某些珍本,而不是另一些。
经历据称创纪录的一年销售后,书商怀疑 AI 公司专门寻找带 ISBN 的书,以确保训练数据尽可能收录大量互不重复的作品。404 Media 查阅 Amazon 工人的网络讨论后发现,他们接受的培训要求先扫描条形码或 ISBN,再扫描书本。报道认为,这进一步支持了书商的猜测:AI 公司正沿 ISBN 清单逐项推进,试图有计划地扫描世界上每一本印刷书。
对书商来说,大宗订单带来的收入很可观,但精心搜集的藏书可能被送去销毁,又造成伦理困境。书商知道如何从各种维度评估珍本价值,而 AI 公司似乎跳过这一步,只寻找廉价且独特的 ISBN 来完成清单。
AI 公司目前收购的未必是价格最高的名作初版,反而常是货币价值较低的旧书,例如从未从如今少有人使用的外语译出的作品,或因不够流行而从未广泛发行的书。
然而,放入 AirTag 的书商告诉 404 Media,这些作品仍可能拥有“历史价值、思想价值、情感价值”。珍本价值可以来自“各种各样的东西”,但 AI 公司不在乎;它们只想取得由一串串词组成的内容。
在 Reddit 上,一些爱书人争论:企业毁掉珍本训练 AI 是否真的那么严重。BBC 曾报道,其中一些书在书商货架上积灰几十年。
有人在一则哀叹帖子下留言:“你本来也不会买那本旧纸书。”原帖则说,一本 1700 年的冷门书如今也许是博物馆藏品,能揭示过去的日常生活;真正的问题是,从珍本细节中获得的微小信息乃至重大历史洞见,会因 AI 的贪婪而丢失。AI 公司不会分享扫描内容,因为它们不愿让别人用同样作品训练模型。
另一名用户反驳说,这听起来像“AI 反对者的宣传”。随后又有人表达相似担忧:即使有人认为训练 AI 会让作品知识更容易在线获取,模型真正提供的也可能只是被扭曲、审查并置于付费墙后的思想碎片。
还有人说:“即使你热爱这项技术,也可以承认 AI 为了变强而真的吃掉书本,这个概念非常反乌托邦。”
BBC 报道,一些书商也同意并非所有文本都必须保存。但苏格兰书商德里克·沃克(Derek Walker)认为,AI 公司应区分两类作品:一种是不太会有人怀念、技术上稀有的冷门学术文本;另一种是鲜为人知,却可能属于“某一版本唯一已知存世样本”的古籍。
沃克说,如果后一种书存活至今却被买去销毁,问题就严重得多。
然而,AI 公司保护训练数据,又通过服务掩盖买家身份,大概不愿与书商直接讨论大宗采购。让书商参与判断哪些作品可以送进模型,需要更高透明度;对这些公司而言,这种透明也许比日后被证明毁掉珍贵初版所造成的声誉损失更危险。
文章以 AirTag 的实物追踪证据揭开 Amazon 拆书扫描设施,再结合工人论坛和 ISBN 操作,解释企业如何为前沿模型系统性搜集独特文本;随后把争议从高价初版扩展到低货币价值但可能不可替代的冷门作品。Reddit 争论和书商意见呈现两种价值观:训练数据把书看成词串,文化保存则关心版本、语境和未来可研究性。结尾指出,竞争保密与匿名采购恰好阻断了销毁前最需要的专业判断。
费曼输出