【AI企业销毁百万册旧书,文明载体不能只换数字数据】
2024 年起美国AI公司Anthropic启动巴拿马计划,批量收购2022年前纸质旧书,切割书脊高速扫描提取文字后全部销毁,数百万册书籍就此消失,法院判定该行为合规,这件事近期持续引发全球讨论。
很多人只看到企业为训练AI找干净文本,很少有人思考这种操作长期会带来哪些影响。资本追逐效率的做法,是否会让人类留存千年的文字载体慢慢消失?
网络上充斥AI生成的重复文字,这类内容会降低模型学习效果,早年未被机器改写的纸质读物,自然成为行业争抢的资源。企业选择破坏性扫描,一是拆分书页能大幅提升扫描速度,压缩运营开支;二是销毁原件可以规避版权纠纷,减少后续诉讼风险。
整套流程只看重文字信息,书本纸张、手写批注、原版版式全部失去留存机会,不少存量极少的绝版史料、小众孤本在这个过程彻底消失,这类载体一旦损毁,没有任何复原途径。数字化文本只能记录文字,附着在实体书籍上的历史痕迹无法复刻。
对比国内同步推进的国家版本馆,思路存在明显区别。馆内保存三千四百多万件实体版本,搭配大容量数字备份库,所有典籍采用无损数字化方式处理,实物长期恒温保存,数字资源同步整理归档。依托馆藏搭建训练数据集,完整保留完整文化资料,不会为提取数据舍弃原始载体。
科技向前推进的速度很快,但各类文明留存载体没有重新生成的渠道。头部科技企业掌握海量独家数字文本,大量实体书消失后,公众查阅冷门史料只能依赖企业私有数据库,公共知识存储渠道会持续收窄。马斯克此前公开表态,旗下 AI 项目改用无损扫描,也能看出行业内部已经意识到这种毁书方式存在明显短板。
我们发展 AI 产业需要充足优质语料,获取数据的方式有很多,一定要以损毁实体典籍为代价吗?


