隨著AI生成內容充斥網際網路,人工創作的“乾淨語料”變得稀缺,AI巨頭們將目光投向紙質書籍。據獨立媒體404 MediaX報道,人工智慧公司正批次購買2022年前出版的珍稀書籍——這些書不包含AI生成內容——利用液壓切割機切除書脊並掃描,隨後將書籍粉碎銷燬,以防資料再度流入市場。報道指出,Anthropic曾銷燬數百萬冊實體書,包括存世量極少的絕版古籍,該行動被內部稱為“巴拿馬計劃”,且已被美國聯邦法院判決為合法,法院認定“合法購買紙質書再加以破壞性掃描”屬於合理使用。

該報道在社交媒體上引發強烈反響。X平台賬號Hedgie轉述此事後,馬斯克迅速回應,表示已要求SpaceXAI(原xAI)團隊儲存圖書館中所有珍貴書籍,並採用無損掃描方式,避免破壞書脊。Hedgie對此回覆稱,感謝馬斯克團隊的做法,雖然掃描速度較慢,但能獲得訓練資料,並呼籲其他業內公司以此為標準。

這一事件凸顯了AI訓練資料獲取的倫理與法律困境。書籍已成為AI語料的重要來源:ISBNdb公司轉型為AI企業的圖書資料供應商,提供大批次圖書採購服務;Anthropic已與舊書平台Better World Books建立合作。與此同時,出版傳媒集團與AI企業之間的法律糾紛頻繁爆發。7月22日,新聞集團(News Corp)在加州奧克蘭聯邦法院提起反訴,指控搜尋引擎公司Brave Software未經授權抓取並轉售《華爾街日報》《紐約郵報》等旗下文章用於AI訓練。7月14日,一群主要出版商對谷歌提起訴訟,指控其非法使用數百萬本受版權保護的書籍構建Gemini模型,谷歌內部檔案顯示,若將出版商文本用於Google Play圖書,可能面臨100億至1000億美元的潛在罰款。

中信證券研報預計,2026年文化IP數字化運營有望為出版業帶來約700億元增量空間,大模型訓練對優質語料的需求將推動出版企業內容資產價值重估。中泰證券則表示,相關出版公司版權歸屬清晰,垂類內容優勢明顯,有望跨越多個技術週期成為核心資產。馬斯克的無損掃描表態,或為行業資料採集提供更可持續的路徑,但版權與資料倫理的博弈仍將持續。