昊梵体育网

#Anthropic为训练模型焚书坑儒# 当代版“焚书坑儒”的判决出来了,拉扯了

#Anthropic为训练模型焚书坑儒# 当代版“焚书坑儒”的判决出来了,拉扯了快两年的 Anthropic 盗版书训练集体诉讼案,终于结束了。法院最终批准,Anthropic 向原告支付15亿美元的天价和解金。而 Anthropic 前两年的实际营收,也只有50亿。这一刀,快砍到大动脉了。

还是先简单介绍下前情。很多企业都用 The Pile 数据集训练模型,里面有个 Book3 子集,包含近20万本没有版权的电子书。这玩意儿明面上早就被下架,所以懂的都懂。媒体对此发起了大规模调查,最终 A/ 的发言人承认 Claude 确实干了。

于是,三名作家代表数十万版权人,朝着 A/ 就 A 了上去,告出了这起史上最大的 AI 版权案。立案以后调查才发现,Books3 那几十万本算个啥,还有 LibGen、PiLiMi,加起来至少有七百万本书,都是没版权非法下载的!

同时,也牵扯出了这起案件中槽点最大,却唯一合法的操作:A/ 花数百万美元收购纸质书籍,书被扫描入库,制成数据集以后立即销毁,数据集也只能在公司内部用于模型训练,不得外传。。。这个操作完美符合美国的版权法的“首次销售原则”。

其实隔壁 Google Books 也扫书,但纸书原件没有销毁,法院依然认为是合理使用。A/ 这事儿干的实在太不地道了,谁也说不准他毁掉的书里,有没有什么珍稀孤本。还要永远封存,咋地,你是要独占人类文明?

而且你小子懂版权,为了规避法律风险就把书毁了,那之前下载盗版书不就是明知故犯?所以15亿美金也算杀A儆猴了,但 AI 和版权的争议远远没有结束。