这是什么

404 Media 的调查记者做了一次很聪明的实验:把一颗 Apple AirTag 偷偷塞进一箱约 1000 本旧书的包裹里,跟踪它的物流去向。这批书来自 Biblio(一个旧书交易平台),买家身份不明、下单量大、对价格不敏感——这些特征在过去一年里被业界普遍怀疑是 AI 公司在批量扫货,准备用来训练模型。

追踪结果指向明确:这箱书最终到了亚马逊位于内华达州拉斯维加斯的 LAS8 设施 VGT3 区域,入口挂着一头恐龙抱书的 logo(讽刺意味很足)。亚马逊员工在在线论坛中确认,这个角落的工作就是「破坏性扫描」大量书籍。

这不是第一次被怀疑。Simon Willison 提到,2025 年 6 月就报道过 Anthropic 类似的批量购书传闻。但这是第一次有记者用实物证据走完了从下单到扫描的完整链路。

行业怎么看

这件事最值得我们警觉的是证据链闭合。过去外界只能推测「这些异常订单可能是 AI 公司下的」,现在物流记录把推测变成了事实。亚马逊截至目前没有公开回应。

正方观点会辩护:扫描旧书训练模型属于合理使用(fair use),且数据经过「脱敏处理」。但反对意见同样尖锐——出版商和作家协会指出,批量收购、未经授权、且是「破坏性扫描」(即原书被物理损坏),这在版权法和训练数据合规上都在灰色地带,可能踩线。

更大的风险在监管端:欧盟 AI 法案已对训练数据透明度提出明确要求,类似的实物证据若出现在美国版权诉讼里,会是关键呈堂证供。AI 公司过去「闷头买数据」的策略正在失效。

对普通人的影响

对企业 IT:采购 AI 模型或服务时,「训练数据来源合规」即将成为必审项,类比当年的数据隐私合规审查。

对个人职场:出版、版权、内容创作行业的从业者,可能很快遇到来自客户或雇主的版权风险问询;律师行业会出现一批新咨询需求。

对消费市场:你在二手平台卖掉的旧书、你买过的绝版书,都可能正在被扫描进某个大模型的训练集。「我的书被 AI 读了」从假设变成了可能的事实。