8月28日,索尼音樂、華納查普爾等35家音樂出版實體聯合在美國加州北區聯邦法院對Anthropic提起訴訟,被告包括其CEO達里奧·阿莫迪(Dario Amodei)和聯合創始人本傑明·曼(Benjamin Mann)。原告指控Anthropic在訓練其AI模型Claude時,使用了大量盜版書籍和從歌詞網站抓取的文本,侵犯了數萬部音樂作品的版權。由於每部被故意侵權的作品最高可索賠15萬美元,索尼和華納方面要求的賠償總額可能高達數十億美元。
這並非Anthropic首次因訓練資料來源陷入版權糾紛。今年早些時候,環球音樂已在同一法院對Anthropic提起訴訟。至此,全球三大音樂集團——環球、索尼、華納——均已加入對Anthropic的法律圍剿。此外,Anthropic此前還面臨圖書作者的集體訴訟(Bartz案),並已為此支付了15億美元的和解金。
原告的核心指控是,Anthropic在訓練Claude時,未經授權複製了包含歌詞和曲譜的書籍及線上內容。據此前Bartz案披露的資訊,Anthropic曾從盜版網站下載了至少700萬本盜版書,並通過爬蟲抓取大量網頁文本。音樂出版商認為,這些材料中包括數百部歌曲集和歌詞書,加上從LyricFind等網站抓取的歌詞,受版權保護的作品數量可能達到數萬部。
法律層面,此案的關鍵在於“合理使用”原則的適用。美國法院此前在Google Books案等判例中,傾向於認為大規模複製文本用於訓練AI模型,若具有“高度轉換性”(即模型學習知識而非複製表達),可構成合理使用。然而,Anthropic使用盜版來源的資料,可能使其難以援引這一抗辯。正如有分析指出,即使模型訓練本身屬於合理使用,盜版下載行為本身仍可能構成侵權。
此外,音樂出版商還提出另一項有力論點:與書籍不同,歌詞的商業價值很大程度上依賴於原文展示。原告測試發現,Claude在某些提示詞下能夠輸出完整或近乎完整的歌詞,這相當於對外發行了受版權保護的副本,並與Musixmatch、LyricFind等付費歌詞服務形成直接競爭。若此點被法院採信,將對Anthropic極為不利。
從商業角度看,音樂出版商此舉意在確立一種新的授權模式——“AI訓練歌詞授權”。歷史上,每當新技術出現(如iTunes、Spotify、TikTok),音樂出版商總能通過訴訟和談判,將新的使用場景納入其版權收費體系。此次針對Anthropic的訴訟,正是這一模式的延續。此前,AI音樂生成公司Suno和Udio在被大型唱片公司起訴後,已達成和解,並同意使用正版曲庫訓練新模型。
對於Anthropic而言,訴訟風險不僅關乎賠償金額。若案件進入庭審,公司可能被迫公開高管的決策記錄,以及“資料清洗”過程中是否故意刪除作者資訊和版權宣告的證據,這可能影響其上市程序、估值及商業合作。因此,業內普遍預期雙方最終會走向和解,類似Bartz案的處理方式。可能的和解條件包括:Anthropic為過去使用盜版材料支付一次性賠償、保留歌詞輸出護欄,並對未來歌詞使用簽訂付費授權協議。
然而,即便和解,AI訓練素材的版權邊界問題仍未解決。音樂出版商希望將每一種新的媒介用途轉化為授權收入,而AI公司則希望儘可能降低訓練成本。這場涉及行業根本利益的博弈,恐怕不會因一紙和解協議而終結。正如評論所言,出版商和科技公司的爭執最終走向何方尚難預料,但夾在中間的律師無疑將獲利豐厚。