“绝版书”三个字,过去只属于藏书家、二手书店和少数狂热爱好者的字典。如今,它们却成了AI公司争相竞逐的“数字金矿”。近日,多家AI大模型训练团队被曝出大规模收购绝版纸质书籍,用于扩充训练数据集,引发出版界、版权界和学术界的广泛关注。

现象:绝版书价格飙升,二手书商接到大订单

“最近半年,我店里的绝版书突然好卖了,而且买家一开口就是‘有多少收多少’。”北京潘家园旧书市场的资深书商老赵告诉记者,他从业二十余年,从未见过这种阵仗。部分上世纪八十年代的文学、科技、哲学类绝版书,价格在短短几个月内翻了五到十倍。

记者调查发现,这些买家多来自国内头部AI公司或其委托的第三方采购团队。他们的需求明确:寻找过去未被数字化、标引或收录进主流电子数据库的纸质书,尤其是那些已经断版、不再重印的冷门著作。

“我们需要的是‘稀缺数据’——不是网上随便能扒下来的文本,而是真正有深度、有独特性、没有被大模型‘喂饱’的内容。”一位不愿具名的AI训练工程师向记者证实,其所在团队近期专门成立了“纸质书采集小组”,目标是在全球范围内扫货绝版书。

原因:高质量数据成AI训练新瓶颈

为何AI公司突然对纸质书“下手”?根本原因在于大模型训练的数据“饥渴”。

自ChatGPT引爆生成式AI浪潮以来,全球各大科技公司疯狂爬取互联网文本、论文、图书、代码等公开数据。但研究表明,公开可获取的高质量文本数据正在逼近极限。据Epoch AI预测,到2026年,高质量的语言数据将全部被AI模型消耗殆尽。

“存量数据中,‘低垂的果实’摘完了。”北京某AI研究院研究员解释,“现在需要的是那些没有被数字化、没有被‘洗’过的原生文本。纸质绝版书恰恰符合这个条件:它们内容优质,但从未进入公开网络,因此不存在被其他模型训练过的问题,属于‘处女地’。”

更重要的是,大模型训练需要多样化的语料来提升泛化能力。而现代出版物高度同质化,大量经典、冷门、跨学科的内容只能从过去的纸质书中寻找。

争议:版权灰色地带与信息公平性

AI公司收购绝版纸质书,引发了多方面的争议。

首当其冲的是版权问题。绝大多数绝版书仍在版权保护期内,只是由于市场原因不再重印,版权归属依然在原作者或其继承人、原出版社手中。AI公司购入纸质书后,将内容扫描、OCR识别、录入训练数据集,这一过程是否构成未经许可的复制与改编?目前法律尚无明确界定。有版权律师指出,即使在“合理使用”原则下,大规模商业化复制绝版书也可能面临侵权风险。

其次是信息公平性问题。绝版书中的知识一旦被AI公司私有化训练,是否会进一步加剧“信息垄断”?有学者担忧,未来只有使用特定AI服务的人才能获取这些绝版知识,普通公众反而因为纸质书被市场扫光、又没有数字版本,而永远失去接触这些知识的机会。

未来:绝版书数字化或迎新路径

面对AI公司这股“抢书潮”,部分出版社和版权机构开始积极应对。一些出版社表示,将加快绝版书的数字化授权和再版工作,以免被AI公司“先斩后奏”。中国文字著作权协会相关负责人呼吁,应尽快建立针对AI训练的数据集版权收费机制,让作者和出版社从AI技术发展中受益。

也有乐观者认为,AI公司对绝版书的关注,客观上推动了文化遗产的数字化抢救。许多绝版书存世量极少,纸质正逐渐老化,AI公司的大规模扫描和录入,反而为这些书籍留下了数字备份。

无论如何,当AI公司开始推着购物车冲进二手书店抢购绝版书时,一个全新的“数据淘金时代”已经到来。这场博弈的结果,将深刻影响未来AI的知识结构、版权制度以及我们与历史的关系。