8月28日,索尼音乐、华纳查普尔等35家音乐出版实体联合在美国加州北区联邦法院对Anthropic提起诉讼,被告包括其CEO达里奥·阿莫迪(Dario Amodei)和联合创始人本杰明·曼(Benjamin Mann)。原告指控Anthropic在训练其AI模型Claude时,使用了大量盗版书籍和从歌词网站抓取的文本,侵犯了数万部音乐作品的版权。由于每部被故意侵权的作品最高可索赔15万美元,索尼和华纳方面要求的赔偿总额可能高达数十亿美元。
这并非Anthropic首次因训练数据来源陷入版权纠纷。今年早些时候,环球音乐已在同一法院对Anthropic提起诉讼。至此,全球三大音乐集团——环球、索尼、华纳——均已加入对Anthropic的法律围剿。此外,Anthropic此前还面临图书作者的集体诉讼(Bartz案),并已为此支付了15亿美元的和解金。
原告的核心指控是,Anthropic在训练Claude时,未经授权复制了包含歌词和曲谱的书籍及在线内容。据此前Bartz案披露的信息,Anthropic曾从盗版网站下载了至少700万本盗版书,并通过爬虫抓取大量网页文本。音乐出版商认为,这些材料中包括数百部歌曲集和歌词书,加上从LyricFind等网站抓取的歌词,受版权保护的作品数量可能达到数万部。
法律层面,此案的关键在于“合理使用”原则的适用。美国法院此前在Google Books案等判例中,倾向于认为大规模复制文本用于训练AI模型,若具有“高度转换性”(即模型学习知识而非复制表达),可构成合理使用。然而,Anthropic使用盗版来源的数据,可能使其难以援引这一抗辩。正如有分析指出,即使模型训练本身属于合理使用,盗版下载行为本身仍可能构成侵权。
此外,音乐出版商还提出另一项有力论点:与书籍不同,歌词的商业价值很大程度上依赖于原文展示。原告测试发现,Claude在某些提示词下能够输出完整或近乎完整的歌词,这相当于对外发行了受版权保护的副本,并与Musixmatch、LyricFind等付费歌词服务形成直接竞争。若此点被法院采信,将对Anthropic极为不利。
从商业角度看,音乐出版商此举意在确立一种新的授权模式——“AI训练歌词授权”。历史上,每当新技术出现(如iTunes、Spotify、TikTok),音乐出版商总能通过诉讼和谈判,将新的使用场景纳入其版权收费体系。此次针对Anthropic的诉讼,正是这一模式的延续。此前,AI音乐生成公司Suno和Udio在被大型唱片公司起诉后,已达成和解,并同意使用正版曲库训练新模型。
对于Anthropic而言,诉讼风险不仅关乎赔偿金额。若案件进入庭审,公司可能被迫公开高管的决策记录,以及“数据清洗”过程中是否故意删除作者信息和版权声明的证据,这可能影响其上市进程、估值及商业合作。因此,业内普遍预期双方最终会走向和解,类似Bartz案的处理方式。可能的和解条件包括:Anthropic为过去使用盗版材料支付一次性赔偿、保留歌词输出护栏,并对未来歌词使用签订付费授权协议。
然而,即便和解,AI训练素材的版权边界问题仍未解决。音乐出版商希望将每一种新的媒介用途转化为授权收入,而AI公司则希望尽可能降低训练成本。这场涉及行业根本利益的博弈,恐怕不会因一纸和解协议而终结。正如评论所言,出版商和科技公司的争执最终走向何方尚难预料,但夹在中间的律师无疑将获利丰厚。