近日,一条关于人工智能公司大规模收购旧书的消息在科技与文化圈引发广泛关注。据多家外媒报道,包括OpenAI、Anthropic、Meta在内的多家AI头部企业,正通过第三方中介或直接派员深入全球各地的旧书店、二手书市场和图书馆清仓甩卖现场,批量购入各类非虚构类、专业领域及文学经典旧书。这些书籍往往体积庞大、运输成本高昂,甚至不乏出版数十年的绝版书籍。一时间,旧书从业者既惊喜于“久旱逢甘霖”的订单,又困惑于AI公司此举的真实意图。

背后动机:AI的“数据荒漠化”危机

为何AI公司会对旧书产生浓厚兴趣?核心原因在于高质量训练数据的极度短缺。当前大语言模型依赖海量文本进行预训练,而互联网上的可用文本资源——如网页、论坛、新闻、维基百科等——已接近被“榨干”。尤其当公开网络内容充斥着重复、低质、广告乃至AI生成的垃圾信息时,单纯依靠网络爬虫获取的数据质量急剧下滑。

旧书则代表了另一片“处女地”:它们经过出版机构的专业筛选与编辑校对,语言逻辑严密、知识体系完整,且包含大量互联网上难以获取的“长尾”专业知识——比如20世纪中后期的物理学专著、地方文史手册、冷门工业标准汇编等。这些书籍不仅文本正确率高,还具备独特的语境和深度,能帮助AI模型避免“知识面狭窄”或“胡编乱造”的问题。换句话说,在AI行业,“一本旧书的价值可能超过一万条推特”。

操作模式:中介扫货与“盲盒式”采购

据业内知情人士透露,AI公司并非直接派员工推着板车扫街,而是委托专业的数据标注公司或书籍采购代理开展行动。这些代理会向旧书店老板提出统一要求:“只要2000年以后出版的非虚构类、学术类或工具书,无论内容多冷门,打包全收,按斤或按吨计价。”部分代理甚至不要求现场翻看内容,直接按“书架长度”整批下单,被店主戏称为“盲盒式采购”。

某上海旧书店主在接受采访时称,今年初曾有人一次性买走店内近60%的库存,总计超过3000册,付款爽快得让他“以为遇到了骗子”。对方只提出一个额外要求:所有书籍不得涂改、不得撕页,并且需要提供原始版权页清晰的扫描件。这进一步证实了AI公司买书的真正目的不是阅读,而是将纸质内容数字化后纳入训练语料。

版权争议:灰色地带与隐忧丛生

然而,大规模旧书收购的背后,法律与伦理风险正在浮现。虽然旧书作为“二手物品”的交易通常合法,但将这些书籍的文本进行数字化扫描并用于AI训练,则可能触及版权红线。尤其对于尚有版权保护的绝版书籍,作者或原出版社并未授权AI公司进行复制与机器学习。

美国作家协会近期已对多起“未经授权使用书籍训练AI”的行为提起诉讼,而此次旧书收购事件无异于火上浇油。知识产权律师指出,购买合法二手书不等于拥有数字复制权,更不等同于能将其语料用于商业AI模型。更棘手的是,许多绝版书的版权归属模糊,即使AI公司愿意支付费用,也常常找不到版权人。这使得旧书采购成为一条“法外坦途”,引发学术界和文化界的强烈担忧。

市场涟漪:旧书价格飙升,书商分化

受AI公司入局影响,全球旧书市场格局正在发生变化。以亚马逊旗下的在线二手书平台AbeBooks为例,部分非虚构类、科学史类旧书的均价在过去半年上涨了15%至30%。一些稀有、小印量的学术著作甚至短期内被抬价至原价的数倍。传统藏书者与学者群体叫苦不迭,称普通研究者已无力购买研究所需的原始文献。

但也有书商持乐观态度。他们认为,AI公司的涌入打破了旧书行业长期“低利润、高库存”的死循环,大量滞销书籍得以变现,为店铺更新腾出空间。更有书店开始主动提供“电子化授权”服务,试图将书籍内容销售给AI公司以获取长期分成。

专家呼吁:建章立制,避免“知识黑洞”

面对这场由AI引发的旧书收购热,多位文化学者和数据伦理专家发出警告:如果放任不管,大量人类文明精华可能被少数公司垄断,成为无法公开访问的“知识黑洞”。中国科学技术大学一位从事数字人文研究的教授指出:“AI公司获取旧书数据本身并不可怕,可怕的是这些数据在数字化后不再对公众开放,最终形成一种新型的文化霸权。”

业内呼吁,应尽快建立AI训练数据的版权登记与使用补偿机制,同时鼓励科技公司与图书馆、博物馆合作开展公益性的文献数字化项目,确保技术进步不以牺牲文化公共性为代价。

结语

从“淘书”到“淘数据”,AI公司的旧书收购狂潮折射出人工智能进化中的深层矛盾:越是追求强大的模型性能,就越需要优质的人类知识沉淀。然而,当知识成为AI的“燃料”,谁来定义这一过程的规则与边界?在人类文明与机器智能的博弈中,每一本旧书的命运,或许都不只是一场交易那么简单。