旧金山联邦法院近日批准了一项创纪录的版权和解协议,要求人工智能公司 Anthropic 向图书作者支付 15 亿美元 赔偿金。这是美国集体诉讼历史上金额最高的版权和解案,但案件的核心并非 AI 训练本身,而是 Anthropic 在 2021 年至 2022 年 期间从盗版数据库 LibGen 和 PiLiMi 下载了约 482,460 部 受版权保护的作品。
根据和解条款,约 91.3% 的列名作品被权利人认领,每部作品获得约 3000 美元 赔偿,是法定最低赔偿额的四倍。Anthropic 还被要求销毁所有盗版文件。此外,作者保留对 AI 输出内容中复制原作品的部分以及 Anthropic 未来行为的索赔权利。
尽管赔偿金额巨大,但该和解结果被法律界和科技界普遍视为 AI 实验室的重大胜利。关键原因在于,法官 William Alsup 在此前的裁决中已明确区分了两种行为:盗版下载与 AI 训练。Alsup 法官裁定,基于合法获取的书籍进行 AI 训练属于“转换性使用”——他形容为“极具转换性”——并适用 合理使用原则。这意味着,只要 AI 公司通过合法途径获取训练数据,其模型训练行为本身并不构成侵权。
然而,本案并未彻底解决 AI 版权争议。一个悬而未决的关键问题是:未经作者同意大规模抓取互联网内容是否算作“合法获取”?如果抓取行为本身不合法,那么后续的合理使用抗辩将无从谈起。因此,围绕 AI 训练数据来源的公平使用辩论远未结束。
对于整个 AI 行业而言,本案的里程碑意义在于:它首次在司法层面将“盗版数据来源”与“合法数据训练”的法律后果切割开来。那些依赖从网络抓取内容(而非盗版数据库)训练模型的 AI 实验室,如 OpenAI、Google DeepMind 以及马斯克旗下的 SpaceXAI(原 xAI),可能因此获得更强的法律信心。
《The Decoder》的评论指出,虽然 Anthropic 付出了高昂代价,但这一结果实际上为 AI 行业提供了最有力的法律武器——只要确保数据获取途径的合法性,模型训练本身就能获得合理使用的保护。