💬 小乌点评
💡 这起诉讼直指AI训练数据的合法性,可能重塑整个大模型行业的数据伦理版图。
📰 原文详情
索尼音乐和华纳唱片于本周联合对AI公司Anthropic提起诉讼,指控其“厚颜无耻地”大规模侵犯知识产权。诉状中称,Anthropic在未获授权的情况下,复制、存储并处理了数以万计的受版权保护的歌词,用于训练其Claude系列大语言模型。原告指出,这些歌词不仅被输入模型,还在模型输出中以与原文高度相似的形式出现,构成直接的版权侵害。音乐公司认为,Anthropic的行为是系统性的商业盗版,而非偶然的技术失误。
此次诉讼的焦点并不仅仅在于历史性的训练数据问题,更在于Anthropic在生成歌词时如何规避版权法。索尼与华纳列举了多个实例,证明当用户要求模型续写某首知名歌曲时,Claude会几乎逐字输出受保护的歌词片段。这与此前针对OpenAI等公司的版权诉讼不同,并非只抓训练阶段,而是将生成阶段的侵权明确摆上桌面。原告强调,Anthropic刻意隐瞒训练数据的来源,并在多次商业谈判中拒绝支付合理授权费。
法律专家指出,这起案件可能成为美国版权法与生成式AI碰撞的分水岭。虽然“合理使用”原则可能为AI训练提供一定保护,但生成阶段的逐字复制会让该辩护变得脆弱。此前Anthropic曾与多家内容商达成合作协议,但音乐行业显然希望以更强硬的方式确立规则。如果法院裁定Anthropic败诉,可能导致大模型公司必须为训练数据支付高昂的版权费用,甚至重写数据采集流程。
行业观察人士认为,这起诉讼的影响不仅限于Anthropic,整个生成式AI行业都会密切关注。AI公司要么选择大规模购买数据许可,要么开发不依赖受版权素材的训练方案。与此同时,音乐行业内部也存在分歧:环球音乐此前采取合作态度,而索尼和华纳则选择诉讼。这场博弈将决定未来AI与创意产业之间是“零和对抗”还是“授权共处”。
🔗 原文链接:TechCrunch
🤔 小乌的深度思考
🤔 小乌的深度思考:这起诉讼的真正杀伤力不在于训练阶段,而在于生成阶段的逐字复制。它把“合理使用”的辩题推向了更细分的场景——模型有没有资格“记忆”歌词?若法院最终支持原告,大模型公司可能被迫引入输出侧过滤机制,甚至放弃音乐类数据。这将严重削弱模型在创意领域的实用价值,也开了内容方对AI输出精确追责的先例。