大模型终于露出了最原本的獠牙:它们开始吃纸了。
近期日本古书界爆出一个让人脊背发凉的诡异现象: 大批神秘买家正在日本各地扫荡式购买二手书。
从历史哲学、医学法律,到偏远地区的地方志甚至数十年前的政治小册子,只要是带字的,几乎来者不拒。
一开始当地人还以为是遇到了收古董的,后来才慢慢知道,这些书最终都流向了和人工智能相关的公司。
收走的所有实体书,最终都会被批量扫描识别成电子文本,作为训练数据喂给大模型,简单来说就是之前互联网上的公开数据被挖得差不多了,大模型开始把手伸到线下的实体书里找新的训练素材。
最近这两年大模型迭代速度越来越快,各家企业拼算力、拼参数规模,拼到最后才发现,高质量的文字数据才是真正的短板。
早些年训练大模型,用的都是网上公开的网页、博客、电子书还有社交媒体内容,这些数据量大、获取成本低,足够支撑早期的模型训练。
但经过这几年几轮大模型的消耗,主流语种的公开网络数据已经被挖掘得非常充分,再想靠新增同类数据提升模型能力,效果越来越差。
这种情况下,那些还没有被数字化的实体书籍,尤其是小众领域的专业书、地方史料、老旧出版物,就成了各家公司争抢的稀缺资源。
这类内容之前因为受众少、商业化价值低,从来没人做过数字化整理,对大模型来说就是全新的信息增量,能实实在在提升模型在冷门领域的回答能力。
有行业机构测算过,按照现在大模型的训练消耗速度,全球通用的高质量公开文本数据,可能在未来三到五年内就会面临供给不足。
这个预测比之前行业普遍预期的时间提前了不少,也倒逼各家AI公司提前布局,到处找新的数据来源,日本的旧书扫荡只是其中一个比较显眼的缩影。
这种情况不是日本独有,国内的旧书市场也已经出现了类似的苗头。
不少线上旧书平台的商家都反映,最近一年来批量采购的订单明显变多,很多买家不指定具体书名,只要是某个品类的正规出版物,直接按数量打包收购,价格比零售低一些,但胜在走量大。
线下的旧书市场里,收书的报价也比前几年高了一截,以前论斤卖的旧杂志、老课本,现在很多都按本计价,背后就有AI数据采集的需求在拉动。
普通人家里压箱底的旧书,之前只能当废品处理,现在说不定还能多卖几个钱,只是很少有人知道,这些旧书最终会变成大模型训练数据的一部分。
这种批量收购旧书用来训练AI的做法,从一开始就绕不开版权争议。
按照大多数国家的著作权相关规定,将受版权保护的作品扫描后用于商业用途,需要取得版权方的授权。
但现实情况是,很多老旧书籍的版权归属很难确认,有的作者已经去世多年,有的出版社早已解散,还有很多地方出版物根本找不到明确的版权方。
AI公司大多是先通过二手渠道收购实体书,扫描之后直接用于训练,真的遇到版权主张再协商赔偿,这种先使用后沟通的做法,也让整个行业的版权边界一直处于模糊状态。
日本的AI产业协会此前发布过相关的行业指引,建议企业优先采购已经获得授权的数字化内容,针对版权归属不明确的作品,可以先行做数字化留存,同时留存好采购凭证,后续有版权主张时积极配合处理。
当地几家头部AI企业也对外回应过收购旧书的传闻,称公司确实在扩充训练数据集的多样性,所有旧书都通过正规二手渠道采购,扫描后的内容仅用于内部模型训练,不会对外传播书籍的完整内容,也不会用于其他商业用途。
这场由大模型引发的扫书潮,最先影响的就是旧书市场的价格。
随着越来越多的资金进场扫货,很多原本不值钱的老旧书籍价格都在往上涨,一些偏门的地方志、行业刊物,价格比两年前翻了一倍还多。
普通淘书人想找本想看的旧书,要花的钱比以前多了不少。
更值得关注的是,当实体书这个存量池也被挖得差不多的时候,大模型还会向哪里找新的数据,目前整个行业都没有明确的答案。
会不会进一步延伸到个人的手写内容、私人信件,或者其他非公开的文字资料,现在还没法下定论。
对普通人来说,这件事看起来离自己很远,其实和每个人都有关系。
咱们平时在网上发的评论、写的动态,早就是大模型的训练素材,现在连线下的实体书都开始被吸纳,本质上就是AI在逐步消化人类有史以来积累的所有文字成果。
这个过程会让AI的能力越来越强,能回答的问题越来越偏门,但同时也带来了数据权益、版权归属之类的问题。
这些问题不会立刻影响到日常的生活,但会一点点改变整个内容行业的规则,也会改变每个人创造的文字内容的价值。

评论列表