一本珍本图书被藏进追踪器,最后停在了亚马逊的人工智能训练中心。404 Media 用这次实证,把亚马逊从未公开的购书行动掀了出来:批量购入大量图书,扫描成 AI 训练数据,随后销毁。这些书不是被收藏,而是被当成原料。过去版权方只能猜测作品是否被数字化利用,现在一条可查验的物流轨迹摆在眼前。
追踪设备记录的不只是某一次运输。它串起一条隐蔽供应链:旧书市场、二手书商、批量订单,最终流向训练设施。被扫描后的图书据称会遭到销毁,这意味着一些珍本、绝版书可能在完成数字化后从实体世界消失。相比网页爬虫,实体书采购更不易留痕。网页抓取还有访问日志可查,二手书交易却几乎没有公开记录,追踪器补上的正是这个缺口。对作者和出版方来说,这不再是模糊的行业传闻,而是可以拿上台面的版权证据。
亚马逊目前没有公开回应。但这件事把 AI 行业“训练数据从哪来”的老问题逼到了更具体的位置:公司可以抓网页,也可以买书扫描,但版权规则没有同步跟上。追踪器做的,正是把藏在供应链里的动作变成可核查的事实。一旦版权方把物流记录、购书凭证和销毁证据串起来,授权谈判或集体诉讼都会更有底气。下一步怎么走,值得继续看。

