近日,知乎热榜上一则关于“多家AI公司大量收购旧书训练模型后销毁”的话题引发热议。据爆料,部分AI企业为获取高质量训练数据,批量采购绝版书籍、学术典籍甚至私人收藏,在完成数据提取后直接销毁实体书,而类似行为此前已被法院认定为“合理使用”。这一操作究竟是AI训练的高效策略,还是对知识产权的变相侵蚀?未来会否成为行业常态?
旧书成“数据金矿”:AI训练的无奈与贪婪
AI模型对数据的渴求早已不是秘密。从GPT到国产大模型,训练语料库的规模和质量直接决定模型表现。然而,互联网公开数据逐渐枯竭,高质量、结构化的文本——尤其是专业书籍、历史文献、学术著作——成为稀缺资源。旧书市场因此被盯上:一本绝版医学典籍可能包含数万条专业术语和案例,一套古籍扫描件能填补历史文本的空白。
更关键的是,实体书的版权状态往往模糊。许多老书作者已故、版权归属不清,或处于“孤儿作品”状态(版权持有者无法联系)。AI公司通过购买实体书获取内容,再主张“合理使用”(fair use),规避了直接数字化的版权风险。此前美国法院在类似案例中曾裁定,为训练AI而复制文本属于“转换性使用”,不构成侵权。这一判例为行业提供了“合法外衣”。
销毁行为背后的逻辑:成本与风险的权衡
为何要销毁实体书?表面看是“买椟还珠”,实则暗藏算计。一方面,存储海量实体书成本高昂,且数字化后实体书价值归零;另一方面,销毁能消除“非法复制”的证据——若保留书籍,可能被指控“以训练为名行盗版之实”。更微妙的是,旧书市场因此被搅动:某些绝版书价格暴涨,收藏者抱怨“AI抢了我们的书”,而二手书商则趁机囤货炒作。
但这一行为已触及伦理红线。书籍不仅是数据载体,更是文化传承的实体。当《四库全书》零本被拆解扫描、当私人日记被批量收购后粉碎,我们失去的不仅是纸张,还有历史记忆的完整性。正如某知乎答主所言:“AI在吞噬人类文明,连骨头都不吐。”
会否成为常态?法律与市场的双重博弈
短期内,这一模式很难被全面禁止。当前版权法尚未针对AI训练明确立法,而“合理使用”的弹性空间仍被企业利用。但长期看,三大趋势可能改变游戏规则:
- 版权集体管理组织介入:类似音乐版权的集体授权机制或延伸至文本领域,AI公司需支付“数据版税”;
- 合成数据崛起:随着AI生成内容质量提升,企业可能转向合成数据训练,减少对真实书籍的依赖;
- 公众监督压力:若销毁行为引发文化保护争议,监管部门可能要求企业公开数据来源,甚至建立“训练数据白名单”。
影响与反思:技术狂奔时,我们该守住什么?
这一事件暴露了AI发展的深层矛盾:效率至上与文化保护的冲突。若放任“买书-训练-销毁”链条蔓延,可能导致三大后果:
- 文化资源垄断:大公司通过资本控制稀缺书籍,中小开发者更难获取高质量数据;
- 版权体系崩塌:作者和出版方利益受损,最终抑制创作积极性;
- 历史记忆断层:实体书的消失让未来研究者失去触摸历史的机会。
技术本应服务于人,而非吞噬文明。或许我们需要的不仅是法律补丁,更是行业共识:AI训练可以“吃”书,但请别“吃”掉书的灵魂。毕竟,当所有书籍都变成0和1的代码,人类还能否在纸页间找到回家的路?
参考资料:知乎话题《曝多家AI公司大量收购旧书训练模型后销毁》、美国法院“合理使用”判例分析、AI训练数据来源研究报告。
微信扫码查看