AI公司批量抢购旧书:一场争夺高质量语料的“数据淘金热”

在刚刚过去的2025年图书市场,出现了一股不容忽视的新势力。不同于传统读者为知识或情怀买单,一批人工智能公司正以惊人的速度,在各大旧书平台、古籍书店乃至私人藏家手中批量“扫货”。从绝版的学术专著到泛黄的地方县志,从早期的科幻杂志到上个世纪的文学期刊,这些曾经无人问津的“冷门货”,如今正成为AI大模型训练数据领域的“香饽饽”。

这场被业内称为“数据淘金热”的浪潮,其核心动因在于一个日益严峻的现实:高质量训练数据的枯竭。随着人工智能大模型在过去两年间的指数级发展,互联网上可公开获取的文本数据几乎已被“榨干”。研究机构Epoch AI曾预测,高质量的文本数据可能在2026年前后耗尽。为了“喂养”规模越来越庞大的模型,AI公司不得不将目光转向更深、更难获取的“断层带”——实体旧书。

旧书之所以成为“金矿”,在于其无可替代的内容深度与筛选价值。相较于充斥着重复、浅薄甚至AI生成垃圾信息的互联网内容,旧书是经过编辑、出版、市场检验的优质信息载体。尤其是一些专业领域的绝版书、冷门学术著作,其蕴含的知识密度和逻辑严谨性,是网络语料无法比拟的。对于需要理解复杂世界、掌握严谨逻辑的AI模型而言,这些文本是提升其推理能力与专业知识储备的“理想食材”。

这并非空穴来风。此前有报道称,Meta公司为了训练其Llama模型,曾与图书出版商谈判获取数百万本书的版权;而在国内,大量科技公司或初创团队也开始通过“数据服务商”与旧书供应链建立隐秘合作。在某知名二手书平台上,一些关于特定历史时期经济数据或地方风物的书籍,被不留痕迹地批量买断,卖家甚至注意到,买家的收货地址多位于互联网科技园或数据中心附近。

然而,这场“扫货”风潮也带来了复杂的涟漪效应。

首先,价格体系被重塑。在部分古籍市场,与AI训练相关的书籍价格出现了剧烈波动。原本几元到几十元不等的旧书,在批量购买需求刺激下,价格翻了数倍甚至数十倍。一些稀缺品直接被“截胡”,普通读者和研究者获取资料的难度无形增加。这种“价格扭曲”虽然让部分旧书商获利,却也引发了市场失序的担忧。

其次,版权与伦理困境浮出水面。旧书的版权状况极其复杂,大量作品处于“孤儿作品”或版权失效的边缘地带。AI公司的大规模复制与利用,究竟是“合理使用”还是“侵权行为”?目前法律界尚无定论。更深层的伦理问题在于,当人类知识的结晶被当作原材料投入商业模型的“熔炉”,原作者并未得到任何补偿或知情权,这无疑触碰了创造与知识共享的底线。

从更宏观的视角看,AI公司抢购旧书,是一种“舍近求远”的无奈之举,同时也是一次数据价值评估体系的革命。它标志着人工智能的竞争已从纯粹的算力比拼,升级为对“数据资产”的精细化争夺。谁能掌握更独特、更高质量的历史语料,谁就更有可能在未来的通用人工智能(AGI)竞赛中占据先机。

但真正的产业化挑战在于,如何构建一个“数据—版权—利益”的良性循环。如果AI公司只把旧书视为一次性“燃料”,那么这种淘金热注定难以持久,并会耗尽文化传承的公共信任。未来的解决方案,或许在于建立更透明、更公正的数据授权机制,通过“数据信托”或“版税分成”等方式,让知识生产的源头也能分享AI技术进步的红利。

当人工智能开始“啃”起故纸堆,这既是技术对过去的一次回望,也是它对未来生存空间的开拓。在算法与油墨的交汇处,人类必须以清醒的头脑,为知识与技术划定一条互利共生的边界。