AI 巨头们为了抢干净的训练数据,开始疯抢古董孤本书了!
AI公司为了给大模型找“干净”的训练数据,正在全球二手书店疯狂扫货——买回来、切开、扫描、粉碎。一气呵成,毫不留情。连18世纪存世极少的植物学孤本都没能幸免。
我看完这条消息的第一反应是:人类花了几百年保存下来的东西,AI几个月就给你绞没了。
事情的导火索来自独立媒体404 Media的报道:人工智能公司正在批量购买2022年前出版的珍稀书籍,利用液压切割机切除书脊并高速扫描,获取未被AI生成内容“污染”的干净数据。
为什么要2022年以前的书?因为2022年之后,互联网上铺天盖地都是AI生成的内容——“AI slop”,低质量的机器生成文本正在污染训练数据集。
当AI从AI生成的内容中学习,输出质量只会越来越差。
于是,这些科技巨头把目光投向了实体书。
那些经过编辑、同行评审、结构清晰的人类著作,尤其是大语言模型出现前出版的——成了“最后的净土”。
而把事情推向舆论风暴中心的,是Anthropic。
这家开发Claude大模型的公司,启动了一个代号“巴拿马计划”的内部项目。
内部文件写得清清楚楚:“巴拿马计划是指我们破坏性扫描世界上所有书籍......我们不想让别人知道我们正在进行这项计划。”
据法庭文件显示,Anthropic累计销毁了约200万册实体书。他们花数千万美元从Better World Books、World of Books等二手书商处批量采购。为了提高效率——拆除书脊、高速扫描、粉碎回收。
而这一切,被美国联邦法院判定为合法。法官的逻辑是:公司合法购买了每本书,将其转化为数字副本并销毁了原件,没有创造额外副本——“一册换一册”,属于合理使用。
这个判决意味着什么?意味着AI公司可以合法地把人类文化遗产变成一次性耗材。
更让人后背发凉的是,这已经形成了一条完整的产业链。
ISBNdb,一家号称拥有全球最大图书数据库的公司,如今已经转型为AI企业的“图书数据供应商”。
它的网站上写着:“世界上最好的人工智能训练数据正静静躺在书架上。”它向AI公司承诺:单笔订单可从1000册到100万册,提供严格的保密协议,买家身份全程匿名。
这家公司自己都承认舆论风险是真实存在的。它的网站上有这么一句话——我几乎不敢相信这是他们自己写的——“‘AI公司销毁两百万册书’可不是一个能引发同情的标题。”
你看,他们自己都知道这事有多离谱。但照样干。
这件事最讽刺的地方在哪里?
AI公司声称自己在“保存知识”——把书数字化了嘛。但问题是,如果你真的想保存知识,为什么要把原件销毁?为什么不能像图书馆那样,扫描完之后把书还回去?
答案是:销毁原件是为了满足法院“合理使用”的认定条件——只有销毁了原件,才不算“复制传播”。换句话说,法律漏洞和商业效率合谋,给“焚书”披上了合法外衣。
我不赞同那种“AI毁书是为了保存知识”的说法。
这就是为了训练模型,为了商业利益。如果真为了保存知识,无损扫描的技术早就有了,成本虽高但不是做不到。
为什么选破坏性扫描?因为快、便宜、合法。
当然,这件事也有另一面。
支持者会说:很多二手书本来就堆在仓库里慢慢损坏,最终被填埋。扫描后回收纸张,至少算一种循环利用。而且数字化确实能让更多沉睡的知识被检索、被阅读。
这个说法有一定道理。但我认为它混淆了两个问题:数字化和销毁是两件事,不是一件事。 你可以数字化,然后保存原件。
这两者不矛盾。选择销毁,只有一个原因——省事省钱,顺便堵住法律的嘴。
马斯克这次倒是做了一个正确的决定。
他在X上转发相关报道后表示:“我已要求SpaceXAI团队妥善保存图书馆中的所有珍稀图书,并采用非破坏性的方式进行扫描,而不是直接切除书脊进行扫描。”
有网友回复他:“感谢马斯克团队这样做,虽然扫描速度慢一些,但你们仍然可以获得训练数据。如果SpaceXAI能够坚持这样做,那么其他业内公司也应该以此为标准。”
说得对。但这恰恰说明了一个问题:无损扫描是可行的,只是更慢、更贵。 AI公司选择了更快更便宜的方式,代价是——人类文化遗产。
我觉得,这件事不会因为马斯克的一句表态就停下来。
只要“破坏性扫描合法”的判例还在,只要AI公司对“干净数据”的渴求还在,只要ISBNdb这样的中间商还在批量供货——这场工业级的“焚书”就会继续。
人类用几百年写下来的东西,AI用几分钟就能绞碎。
这不是技术进步,这是文明的短视。
