Anthropic书籍销毁事件揭开AI训练数据黑箱
在历时数年的版权纠纷尘埃落定后,Anthropic公司以15亿美元达成史上最大规模版权和解的消息甫一公布,便迅速被更深层的细节所覆盖。法庭文件揭示,该公司曾大规模采购数百万册实体出版物,通过工业级液压切割设备移除书脊,逐页数字化后彻底焚毁原书——该项目内部代号为“巴拿马计划”,其操作方式极具视觉冲击力,迅速点燃公众愤怒。
法律认可下的争议实践:为何“合法”仍难平众怒
尽管联邦法院在“巴茨诉 Anthropic”案中裁定,对合法购入书籍进行非复制性数字化并销毁原件,属于“变革性合理使用”,不构成侵权,但这一法律结论并未缓解社会焦虑。另一项涉及从LibGen及PiLiMi等平台获取盗版文献的诉讼,则通过总额达15亿美元的和解协议收场。据披露,该赔偿金将分配至数千名作者手中,平均每本书补偿约3000美元,创下美国版权领域最高纪录。
破坏性扫描成为情绪引爆点:从书脊切割到全球声讨
真正引发广泛共鸣的,并非金额本身,而是其执行过程的具象化呈现——液压切割机切开书脊的画面,成为社交媒体上最具争议的符号。知名投资人迈克尔·伯里在社交平台直言此举“堪称邪恶的体现”。埃隆·马斯克亦公开表态,要求其SpaceX团队采用非破坏性方式处理珍贵文献,强调应建立数字档案而非物理损毁。一位荷兰图书经销商透露,他曾误以为收到3000份同一本书的订单是诈骗邮件,这一细节折射出该类交易在传统出版界眼中何等离奇且反常。
Anthropic回应模糊:否认古籍破坏,却未否定操作流程
面对持续发酵的批评,公司发言人澄清称,Claude模型的数据来源包括开放网络内容、商业授权数据集以及自研生成文本,并强调所有书籍均来自常规市场渠道,明确排除针对稀有或历史典籍的专项采购。然而,该声明并未否定实际操作中的破坏性扫描行为。法庭记录显示,Anthropic曾委托如Datamation Information Services等第三方服务商,实施高速、不可逆的大规模扫描作业,进一步证实了其流程的系统性与规模化。
行业共谋?破坏性扫描正演变为标准供应链
Anthropic并非孤例。多家媒体报道指出,其他人工智能研究机构同样采用过类似手段进行数据采集。如今,专门服务于AI企业的书籍中介商已形成成熟产业链,部分通过ISBNdb等平台匿名对接买家,实现全流程隐蔽运作。尤其值得注意的是,2022年以前出版的图书因其内容尚未受大量AI生成文本污染,被视为更具价值的人类写作样本,成为训练高质量模型的核心资产。这一经济逻辑暗示,即便公众态度转冷,此类采购模式仍可能在行业内长期存在。
未来走向:监管、伦理与法律边界的博弈
当前风波或将推动多重变革:第一,是否会有更多企业转向无损扫描技术;第二,参与此类服务的中介机构与供应商是否会受到审查;第三,此次事件是否会影响后续针对其他科技巨头训练数据合法性的诉讼进程。随着公众对数据伦理的关注日益加深,这场争议或将重新定义人工智能发展背后的道德底线与法律边界。