“AI毁书”剧情进入第二幕!这次的主角竟是亚马逊

过去一年多来,二手书商们一直在私下议论一件事:市面上突然出现了一批批量收购旧书的神秘买家,出价不算高,但量极大,而且对书的品相和版本几乎不做甄别。有书商怀疑这些书最终流向了AI公司——被扫描后用于训练大模型,而纸质原件则被直接销毁。

怀疑归怀疑,始终没有人拿到过实锤。直到最近,科技媒体404 Media的一次调查,用一枚苹果AirTag揭开了谜底。

事情的起点是一批约1000本图书的大宗订单。一位与404 Media合作的书商接下了这笔生意,但在发货前,他将一枚AirTag夹进了其中一本书的书页之间。接下来要做的,就是等。

AirTag的信号一路向西,最终停在了拉斯维加斯。具体位置是亚马逊位于当地的一座仓库——内部编号VGT3。按照亚马逊的公开信息,这座仓库并非普通的订单履行中心,而是一处AI训练设施。

404 Media的记者随后展开了实地调查。据其报道,VGT3仓库内设有一个专门团队,日常工作就是处理大批量购入的纸质书籍。操作流程大致有三步:先切掉书脊,然后将书页送入高速扫描仪,最后将扫描完的纸质原件直接销毁。

一位知情人士向404 Media描述,这个团队的标志竟然是一只霸王龙——正准备吞食一本书。

亚马逊购买这些书的目的很明确:获取文本数据用于训练其前沿AI模型。至于书的稀缺性、版本价值或收藏意义,不在采购的考量范围之内。在亚马逊眼中,这些书只是数据的载体,用完即弃。

这一发现引发了书商群体的强烈反应。对于长期经营稀有书籍的从业者来说,每本书的版本、品相和流传脉络都是其价值的一部分。而批量购入、批量拆解、批量销毁的做法,在他们看来无异于对书籍文化价值的粗暴抹杀。

事实上,亚马逊并非第一家被曝光以类似方式获取训练数据的科技公司。此前,Anthropic曾被曝出代号“Project Panama”的毁书扫描计划。更早之前,多家AI公司也被指在二手书市场大量采购旧书用于模型训练。随着大模型参数规模不断膨胀,对高质量文本数据的需求几乎是无止境的。而纸质书籍——尤其是那些尚未被大规模数字化、内容经过编辑和校验的出版物——正在成为AI公司争抢的“干净数据”来源。

亚马逊尚未就此事公开发表声明。但VGT3仓库的存在以及其内部团队的工作内容,已经被AirTag的追踪信号和404 Media的实地调查交叉印证。

对于普通读者而言,这件事的冲击力在于一种认知上的错位:一家以在线卖书起家的公司,如今正在用销毁书籍的方式来喂养自己的AI。从卖书到毁书,亚马逊完成了一次意味深长的转身——书籍不再是商品,而是原材料。

而对于整个AI行业来说,这或许只是冰山一角。当模型的训练数据需求越来越庞大,当“干净数据”变得越来越稀缺,下一批被送上扫描线和碎纸机的,又会是什么?

智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。