正在加载文章内容,请稍候。
正在加载文章内容,请稍候。
AI 公司为获取没有生成内容污染的训练数据而批量采购旧书,由此引出版权、数据来源透明度与文化保存的伦理争议。

精准输入
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可保存笔记、高亮、划线和批注。
当互联网文本越来越混入 AI 生成内容,出版于大模型时代之前的纸质书反而成了稀缺的“干净数据”。本文追踪一家图书数据库、匿名批量买家和旧书商的异常订单,揭示 AI 公司如何把旧书变成训练材料,以及这一过程对版权、稀有藏书和实体书保存造成的争议。
AI 公司为了寻找更多训练数据来改进模型,一家公司开始把旧纸书包装成理想来源:这些书可以保证不含 AI 公司自己制造的 AI 垃圾内容。
ISBNdb 自称拥有“全球最大的图书数据库”,并向 AI 公司提供大批量图书采购服务。它在网站上写道:“世界上最好的 AI 训练数据就放在书架上。”书籍包含经过策展、同行评审、按专业领域组织的人类知识,其结构是任何网络抓取都无法复制的;它们信息密集、经过编辑,也更具权威性。
ISBNdb 在一篇说明文章中称,2022 年以前出版的纸质书特别适合做 AI 训练数据,因为其中没有 AI 生成文本。如今从互联网上抓取的数据很可能已经混入生成内容,进而造成“模型坍塌”:模型用 AI 生成的数据继续训练后,质量变差,也更容易出错。它还指出,反对作品被抓取训练的作者,现在可以故意创作会操纵或破坏模型的文本来“投毒”。
它的推销语是:“大模型时代以前的纸质书,从结构上保证不受这种污染。”以及:“在这个日期以前,也就是 2022 年以前出版的实体书,从结构上不含现代投毒工具。”
ISBN 是国际标准书号,也就是大多数书籍背面的数字商业标识和条形码。多年来,ISBNdb 帮助书商、图书馆和发行商管理库存、寻找与销售图书;生成式 AI 的兴起使它对 AI 公司变得格外有价值。除出售图书元数据外,它现在还帮助 AI 实验室一次采购 1,000 到 100 万本纸质书。它的数据让 AI 公司能够有计划地采购、扫描并把纸书转成训练数据,同时避免买到重复书目。
今年 1 月,作家起诉 Anthropic 的版权诉讼披露了内部文件,详细说明该公司获取和扫描数百万本纸质书、并在过程中销毁它们的计划。AI 公司吞噬纸书作为训练数据的做法由此受到广泛关注。《华盛顿邮报》的报道发现,Anthropic 从 Better World Books 采购图书;这是图书馆、零售商和个人出售旧书的多个平台之一。图书出版商最近也起诉 Google,指控它用受版权保护的书籍训练 Gemini。
ISBNdb 还宣传自己能够对 AI 买家的身份保密。其网站承诺:“每一项合作都签署严格的保密协议。每个项目都以具有法律约束力的保密协议开始。您的身份、策略和采购目标绝不会被披露。”
它也明白,AI 公司不会愿意被公众看到在扫描时毁掉纸书。网站直言:“形象问题确实存在。‘AI 公司销毁 200 万本书’绝不是一个能赢得同情的标题。”
一位在这些平台上专营外文书的职业书商告诉作者,从 4 月开始,他和其他书商发现销量出现历史性飙升。他要求匿名,以便继续在平台上做生意。
这位书商怀疑自己已经向 AI 公司卖出数百本用于训练的书。他说自己对此感情复杂:一方面,这给他带来收入,也帮他清理了原本很难卖掉的旧库存;他的海外书和外文书库存尤其适合这类采购。另一方面,他不喜欢这些书的最终用途,也不愿看到不常见的书被打成纸浆。
他的库存中有很多稀有、外文和小印量书籍。如果它们在变成训练数据的过程中被销毁,将来只会更加难以获得。
正常情况下,他一周行情好时大约卖出 20 本书;自 4 月以来,他经常每周卖出数百本。他没有明确证据证明买家是 AI 公司,但订单特征令人生疑。他销售的是专业书,通常买家是学校和图书馆,而这些机构因为经费削减,采购量一直下降。通常,批量购买会围绕某个特定主题;最近的大订单却包含彼此毫无关联的书,唯一共同点是都有 ISBN。他也销售没有 ISBN 的稀有书,但那些书一本都没有进入批量订单。作者没有发现证据证明这些销售由 ISBNdb 促成,也无法确认客户就是 Anthropic 或其他 AI 公司。
书商说:“奇怪的不只是数量,还有订单本身。我以前接过图书馆订单,通常都集中于一个主题,最多扩展到稍宽的主题范围。但世界上几乎每家图书馆都失去了预算。美国大学图书馆现在买不了多少书,澳大利亚图书馆也一样。这批书看不出任何逻辑,而且买家完全不在乎价格。有些书定价高得离谱,照样通过这种方式卖掉了。这有点像 AI 买家的特征,因为它们的钱实在太多。”
今年 2 月,另一家图书交易平台 Alibris 的论坛上,有书商问:“是只有我感觉到,还是从去年年底开始,自动购买订单明显增加了?”自动购买功能允许客户标记想买的书,一旦上架就自动下单。他还追问:究竟发生了什么,是否有 AI 要读遍每一本书,选书依据是什么,为什么品相、装帧、价格都差异巨大。
Alibris 客户服务总监迈克·费尔德曼(Mike Feldman)回复说:“我们有几个新的大宗买家正在扫购大众图书,所以很多卖家都收到了大量订单。”
另一位书商说,在 Biblio 平台上也出现了类似的大订单。客户可以向 Biblio 提交一张包含所需 ISBN 的电子表格,之后由平台完成采购。今年 6 月,荷兰一家媒体也采访了几位稀有书商,他们观察到相同的大批采购,并猜测买家来自 AI 公司。
要断言这些书确实被 AI 公司买去训练、甚至被销毁并不容易,因为 ISBNdb、Biblio 和 Alibris 等平台都隐藏买家身份。大宗采购的书会先被送往配送中心,例如 Alibris 会检查书籍质量,再把它们交给客户。
版权诉讼披露的 Anthropic 内部文件,也没有解释公司为什么要在扫描过程中销毁数百万本书。Anthropic 聘请汤姆·哈维(Tom Harvey)领导该项目;他此前参与创建 Google Books。哈维的证词显示,Anthropic 的承包扫描商之一 Datamation 同时提供“大批量破坏性和非破坏性图书扫描”。破坏性扫描会切掉书脊,让散页进入扫描机,速度更快、成本也更低。
无论 Anthropic 最初意图如何,审理作家诉 Anthropic 版权案的联邦法官威廉·阿尔萨普(William Alsup)认定,公司制作图书数字副本的行为合法,而理由恰恰与纸书被销毁有关。
阿尔萨普在裁决中写道:每一本购得的纸质书都被复制,目的是节省存储空间并让数字副本可供检索;纸质原件随后被销毁,一份替代另一份。没有证据显示新的数字副本在公司外部被展示、分享或出售。
他认为这种行为“明显具有转换性”,因此符合美国《版权法》第 107 条的合理使用规定。
ISBNdb 也拿这套法律论证向 AI 公司推销服务。它称,从二手市场大规模购买纸书,不会让任何创作者失去原本应得的收入,因为这些书早已完成了对创作者的全部经济义务。
在解释为什么销毁后的书必须回收时,ISBNdb 甚至写道:“负责任地采购实体书不是焚书,而是完成一本书的生命周期:从树木到知识,再回到树木。”
ISBNdb 与 Anthropic 均未回应置评请求。旧书由此同时成为干净训练数据、匿名采购商品和可能被一次性消耗的文化载体;AI 公司得到的是语料,社会失去的可能是无法复原的实体藏本。
文章从“2022 年前纸书没有 AI 污染”的商业卖点切入,解释 ISBN 元数据如何支撑一次 1,000 至 100 万本的采购;随后用匿名书商从每周约 20 本跃升至数百本的异常订单,补足市场侧证据,同时明确买家身份仍无法证实。最后,文章沿 Anthropic 的破坏性扫描、合理使用裁决和 ISBNdb 的回收话术,把数据训练的需求推进到版权与文化保存的冲突上。
费曼输出