AI公司“买书训练后销毁”:是技术常态还是版权灰色地带?

字号

近日,知乎热榜上一则关于“多家AI公司大量收购旧书训练模型后销毁”的话题引发热议。据爆料,部分AI企业为获取高质量训练数据,批量采购绝版书籍、学术典籍甚至私人收藏,在完成数据提取后直接销毁实体书,而类似行为此前已被法院认定为“合理使用”。这一操作究竟是AI训练的高效策略,还是对知识产权的变相侵蚀?未来会否成为行业常态?

旧书成“数据金矿”:AI训练的无奈与贪婪

AI模型对数据的渴求早已不是秘密。从GPT到国产大模型,训练语料库的规模和质量直接决定模型表现。然而,互联网公开数据逐渐枯竭,高质量、结构化的文本——尤其是专业书籍、历史文献、学术著作——成为稀缺资源。旧书市场因此被盯上:一本绝版医学典籍可能包含数万条专业术语和案例,一套古籍扫描件能填补历史文本的空白。

更关键的是,实体书的版权状态往往模糊。许多老书作者已故、版权归属不清,或处于“孤儿作品”状态(版权持有者无法联系)。AI公司通过购买实体书获取内容,再主张“合理使用”(fair use),规避了直接数字化的版权风险。此前美国法院在类似案例中曾裁定,为训练AI而复制文本属于“转换性使用”,不构成侵权。这一判例为行业提供了“合法外衣”。

销毁行为背后的逻辑:成本与风险的权衡

为何要销毁实体书?表面看是“买椟还珠”,实则暗藏算计。一方面,存储海量实体书成本高昂,且数字化后实体书价值归零;另一方面,销毁能消除“非法复制”的证据——若保留书籍,可能被指控“以训练为名行盗版之实”。更微妙的是,旧书市场因此被搅动:某些绝版书价格暴涨,收藏者抱怨“AI抢了我们的书”,而二手书商则趁机囤货炒作。

但这一行为已触及伦理红线。书籍不仅是数据载体,更是文化传承的实体。当《四库全书》零本被拆解扫描、当私人日记被批量收购后粉碎,我们失去的不仅是纸张,还有历史记忆的完整性。正如某知乎答主所言:“AI在吞噬人类文明,连骨头都不吐。”

会否成为常态?法律与市场的双重博弈

短期内,这一模式很难被全面禁止。当前版权法尚未针对AI训练明确立法,而“合理使用”的弹性空间仍被企业利用。但长期看,三大趋势可能改变游戏规则:

  1. 版权集体管理组织介入:类似音乐版权的集体授权机制或延伸至文本领域,AI公司需支付“数据版税”;
  2. 合成数据崛起:随着AI生成内容质量提升,企业可能转向合成数据训练,减少对真实书籍的依赖;
  3. 公众监督压力:若销毁行为引发文化保护争议,监管部门可能要求企业公开数据来源,甚至建立“训练数据白名单”。

影响与反思:技术狂奔时,我们该守住什么?

这一事件暴露了AI发展的深层矛盾:效率至上与文化保护的冲突。若放任“买书-训练-销毁”链条蔓延,可能导致三大后果:

技术本应服务于人,而非吞噬文明。或许我们需要的不仅是法律补丁,更是行业共识:AI训练可以“吃”书,但请别“吃”掉书的灵魂。毕竟,当所有书籍都变成0和1的代码,人类还能否在纸页间找到回家的路?

参考资料:知乎话题《曝多家AI公司大量收购旧书训练模型后销毁》、美国法院“合理使用”判例分析、AI训练数据来源研究报告。


扫描二维码,在手机上阅读
收藏 0