随着AI生成内容充斥互联网,人工创作的“干净语料”变得稀缺,AI巨头们将目光投向纸质书籍。据独立媒体404 MediaX报道,人工智能公司正批量购买2022年前出版的珍稀书籍——这些书不包含AI生成内容——利用液压切割机切除书脊并扫描,随后将书籍粉碎销毁,以防数据再度流入市场。报道指出,Anthropic曾销毁数百万册实体书,包括存世量极少的绝版古籍,该行动被内部称为“巴拿马计划”,且已被美国联邦法院判决为合法,法院认定“合法购买纸质书再加以破坏性扫描”属于合理使用。

该报道在社交媒体上引发强烈反响。X平台账号Hedgie转述此事后,马斯克迅速回应,表示已要求SpaceXAI(原xAI)团队保存图书馆中所有珍贵书籍,并采用无损扫描方式,避免破坏书脊。Hedgie对此回复称,感谢马斯克团队的做法,虽然扫描速度较慢,但能获得训练数据,并呼吁其他业内公司以此为标准。

这一事件凸显了AI训练数据获取的伦理与法律困境。书籍已成为AI语料的重要来源:ISBNdb公司转型为AI企业的图书数据供应商,提供大批量图书采购服务;Anthropic已与旧书平台Better World Books建立合作。与此同时,出版传媒集团与AI企业之间的法律纠纷频繁爆发。7月22日,新闻集团(News Corp)在加州奥克兰联邦法院提起反诉,指控搜索引擎公司Brave Software未经授权抓取并转售《华尔街日报》《纽约邮报》等旗下文章用于AI训练。7月14日,一群主要出版商对谷歌提起诉讼,指控其非法使用数百万本受版权保护的书籍构建Gemini模型,谷歌内部文件显示,若将出版商文本用于Google Play图书,可能面临100亿至1000亿美元的潜在罚款。

中信证券研报预计,2026年文化IP数字化运营有望为出版业带来约700亿元增量空间,大模型训练对优质语料的需求将推动出版企业内容资产价值重估。中泰证券则表示,相关出版公司版权归属清晰,垂类内容优势明显,有望跨越多个技术周期成为核心资产。马斯克的无损扫描表态,或为行业数据采集提供更可持续的路径,但版权与数据伦理的博弈仍将持续。