以卖书起家的电商巨头亚马逊,如今为了训练人工智能,正在对珍贵的实体书籍进行物理拆解。
亚马逊目前正在对部分珍本书籍进行破坏性处理,目的是提取其中的文本内容,用于训练其大语言模型(LLM)。这揭开了当前大模型行业面临的一个现实:高质量的训练数据正在枯竭,科技公司开始把目光投向线下实体书。
卖书起家,如今“拆书”喂AI
在图书数字化过程中,为了获取清晰的扫描图像,有时需要对书籍进行物理拆解。对于普通书籍,这只是常规操作;但对于具有收藏和历史价值的珍本书籍,这种操作意味着不可逆的物理损毁。
亚马逊之所以对珍本书籍采取这种极端手段,是因为这些书里藏着大模型急需的“稀缺营养”。大模型的能力靠海量文本喂出来,而珍本书籍中包含了大量逻辑严密、专业度高且从未在互联网上公开过的深度内容。通过拆解并数字化这些罕见文献,亚马逊能够为其AI模型提供独家的高质量语料。
公开数据见底,大模型患上“数据饥渴症”
过去几年,各大科技公司训练AI的主要方式是爬取互联网上的公开网页、论坛、论文和电子书。
然而,互联网上高质量的公开文本是有限的。目前,主流大模型几乎已经把网上能找到的优质内容吸收得差不多了。当模型吃透了容易获取的公开数据后,单纯增加数据数量很难带来能力的显著提升。如果强行用低质量数据或AI生成的合成数据去训练,反而会导致模型能力退化。因此,行业陷入了真正的“数据荒”。
在这样的背景下,未数字化的线下实体书、私人档案和珍本古籍,成了大模型提升能力的最后一片数据蓝海。珍本书籍极少被数字化,其文本内容对模型来说是完全新鲜的,能够有效提升其在复杂推理和专业领域的表现。
从“网上爬”到“线下找”,竞争逻辑生变
亚马逊的这一动作,给国内的大模型厂商和AI创业者释放了一个明确的信号:大模型的竞争逻辑正在发生转变。
在行业早期,大家拼的是算力规模和参数大小,数据主要靠互联网公开资源。但现在,拼参数已经触及瓶颈,真正的护城河变成了独家高质量数据。如果继续在公开互联网数据里内卷,很难拉开与竞争对手的差距。
这意味着,国内的AI公司需要把目光转向线下。比如,与出版社、高校图书馆、专业研究机构合作,获取垂直领域的专业书籍、未公开论文和行业报告;或者通过合法授权,获取医疗、法律、金融等垂直行业的私有数据。这些线下数据不仅质量高,而且具有极强的专业壁垒。掌握别人拿不到的稀缺数据,才能在下一阶段的AI竞争中训练出更聪明的模型,从而在商业化落地时提供更具针对性的行业解决方案。
获取稀缺数据,版权与伦理争议难避
尽管获取稀缺数据是提升AI能力的有效途径,但毁坏实体书训练AI的做法,也暴露出行业面临的现实阻力。
一方面是伦理与文化保护争议。珍本书籍不仅是信息的载体,更是具有文物价值的实体。为了提取数据而销毁实体书,必然会遭到图书管理员和文化保护人士的反对。如何在数字化利用与物理保护之间找到平衡,是科技公司必须面对的问题。
另一方面是复杂的版权风险。许多珍本书籍的版权状态并不清晰,有的属于孤儿作品,有的涉及版权继承问题。大模型在未经授权的情况下使用这些内容进行商业化训练,极易引发版权诉讼。目前全球范围内关于AI训练数据版权的法律界定仍在博弈中,这给依赖线下稀缺数据训练模型的公司带来了合规压力。
大模型的发展已经进入深水区。从互联网上轻松获取数据的时代已经结束,未来AI的进化,将越来越依赖于对现实世界中那些未被数字化的隐秘知识的挖掘。亚马逊拆解珍本书籍只是一个缩影,预示着AI行业为了获取优质口粮,正在向更深、更传统的物理世界进军。
