曝多家 AI 公司大量收购旧书训练模型后销毁,此前先例被法院认定合理,这会成为常态吗?可能带来哪些影响?
说实话,刚看到这新闻的时候,我心里咯噔了一下。
首先,这事儿不是个例,而是正在发生的事实。据报道,一些AI公司大批量收购旧书、绝版书、甚至是图书馆淘汰的库存,扫描或者OCR提取文字后,直接把书销毁了。更让人细思极恐的是,这操作在美国已经有法院判例支持:只要是通过合法渠道购买(比如图书馆拍卖、旧书店回收),你买了就是你的,你想怎么处理就怎么处理,包括销毁。那法院凭什么说合理?因为书是“物”,不是“信息”的无限使用权。你花钱买了这个物理载体,就有权处分它。

但你品,你细品,这事儿背后根本不是法律问题,而是“合理”两字在真实世界里的裂痕。
这会成为常态吗?大概率会,但会有更多暗流
短期内,会越来越常见。 原因很简单:AI训练需要海量、高质量、干净的数据。网上能爬到的公开文本已经快被吃干了,而且一堆重复、广告、垃圾内容。而旧书——尤其是那些绝版的、学术类的、小众领域的书——是真正的高质量语料库。那些书没人管、没人维护,就像散落荒野的宝藏。公司买来扫完就毁,既节约了储存成本,又防止了被你发现后追责(比如版权方后来主张权利)。

但长期看,会有反弹。 一方面是舆论压力,书迷、作者、图书馆员会炸锅。另一方面是法律灰色地带:虽然法院说“买了销毁”合法,但如果你是为了避开版权限制而故意销毁(比如法律要求必须保留证据、或者有合同约定不能销毁),那就不是财产权问题了。而且欧盟、中国等地的法律环境不同,这块迟早会有新判例。

可能带来哪些影响?三个字:大震荡
第一,知识保存面临巨大危机。 旧书是很多活历史、地方志、绝版技术的唯一载体。AI公司只取“文字”,不考虑物理书本身的文物价值或孤本价值。如果大量旧书被这种“扫完即焚”的模式吃掉,人类知识图谱会出现真空。以后你想查某本冷门书,可能连二手市场都找不到了,因为都被粉碎机吃了。
第二,版权生态会遭遇暴击。 虽然旧书很多版权已经过期,或者作者已故、权利人不明,但还有大量书籍的版权仍在有效期内(比如上世纪八九十年代的畅销书、专业教材)。AI公司大量收购后,原作者或出版社可能根本不知道自己的书被用于训练模型,而且书被销毁后证据都没了。以后诉讼会非常难打。更可怕的是:这可能会催生一个“数据黑市”——有人专门囤积绝版书,高价卖给AI公司,然后销毁,人为制造稀缺。
第三,AI模型的“知识边界”会加速固化。 你可能会问,这不是在丰富语料吗?怎么会固化?你想啊,旧书被销毁后,这些文字只存在于AI模型的黑盒子里。以后你想验证某个冷知识,只能依赖AI的输出。而AI输出的东西随时可能被模型更新、过滤、遗忘。等于人类把自己的历史档案外包给了一个不透明的机器,而原本的档案原件已经不存在了。这跟把记忆全部存在云盘然后剪掉自己的大脑有啥区别?
说句实在话
我不是反对AI技术进步,但这事儿真的挺让人不安的。
技术的尽头不应该是消灭“源头”。 书这种东西,哪怕你不需要它提供文字,它摆在那里,就是一种文化景深。你把书销毁了,只留下数字化的僵尸片段,损失的不仅仅是墨水纸浆,而是一个时代的呼吸感。
法院判它“合理”,那是从财产权角度说的。但从文明角度说,合理不代表正确。如果这个趋势不刹车,未来的人类可能会在AI的语料库里找到所有答案,却在真实世界里找不到一本能翻动的旧书。
想想就后背发凉。
所以我的答案是:这可能会成为常态,但希望它不要成为常识。 至少,得有人为每本被销毁的书立个碑,哪怕只是一行数字化的水印。