印度德里高等法院近日作出临时裁决,驳回了该国主要新闻机构亚洲国际新闻社(ANI)针对 OpenAI 的初步禁令申请。ANI 此前起诉 OpenAI,指控其在 AI 训练及 ChatGPT 输出中使用了受版权保护的新闻内容。法官 Amit Bansal 驳回了 ANI 在两项主张上的救济请求,裁决涉及模型记忆、检索增强生成(RAG)以及 AI 训练的法律地位等关键问题。AI 版权法专家 Andres Guadamuz 称此裁决是 OpenAI 的重要早期胜利。

ANI 提交给法庭的多份 ChatGPT 输出内容,声称是对其文章的实质性复制。然而,OpenAI 证明所使用的模型 GPT-4 和 GPT-4o 的训练数据分别截止于 2022 年 4 月和 2024 年 4 月,而 ANI 引用的文章大多发表于 2024 年 8 月和 9 月,因此不可能包含在训练数据中。法官初步认为,输出内容的相似性源于 RAG 技术——该技术允许语言模型实时检索网络信息,类似搜索引擎。ANI 在诉状中未涉及 RAG 问题,法庭因此无法就此作出最终裁决。法官表示,基于 RAG 的输出可能构成“向公众传播”,这一问题将在主审中处理。

ANI 的立场进一步削弱。该机构使用了对抗性提示,明确要求模型“精确”复制文章,但即便如此,也未能提供任何逐字复制的实例。法官认为,新闻文章中的事实通常不受版权保护,且复制主题和标题在此案中不构成与 ANI 的直接竞争。证据也不支持 ANI 关于 OpenAI 在模型中永久存储训练数据并可随时逐字复制的说法,但法庭将在主审中重新审视这一问题。

在 AI 训练是否构成版权侵权方面,ANI 同样未能证明。双方均承认 OpenAI 在训练中使用了 ANI 的内容,但 OpenAI 辩称,这些材料在整个数据集中占比极小,模型仅提取了语法、句法和语言模式等非表达性元素。法官依据印度版权法中的例外条款,将“私人或个人使用,包括研究”中的“研究”解释为涵盖 AI 训练。法官为此设定了条件:训练副本必须来自合法来源,而非影子图书馆或未经授权访问的付费网站;OpenAI 也未公开训练副本,仅作内部处理。Guadamuz 指出,这是法院首次明确认定 AI 训练属于私人使用例外。

法院进行了三要素公平性测试,并在所有三项上支持 OpenAI。OpenAI 对 ANI 作品的使用仅限于训练,未证明存在记忆或复制行为。ANI 也无法证明经济损害,因为两家公司业务领域不同。即使 ChatGPT 被问及 ANI 的新闻标题,模型也仅返回主题和至多几个文章标题。法官引用了美国案例,包括 Bartz v. Anthropic 和 Kadrey v. Meta,认为语言模型输出具有变革性,并提及了早期的 Google Books 裁决。法官还认为,训练后的语言模型能改善信息获取、支持教育、推进科学研究、辅助软件开发、实现翻译,并为残障人士创造工具。

德里高等法院的裁决加入了全球范围内日益增多的、结论相互冲突的 AI 版权案件。在美国,法官驳回了 Raw Story 和 AlterNet 对 OpenAI 的诉讼,理由是原告未能证明足够损害且精确复制概率极低,同时认定事实不受版权保护。GitHub Copilot 案也以失败告终,原告未能提供任何相同代码的实例。而 The Intercept 则通过 DMCA 投诉获得了部分胜利,涉及训练前被剥离的版权材料。在 Ross Intelligence v. Thomson Reuters 案中,法院否定了合理使用,因为 AI 研究工具直接与 Thomson Reuters 的法律数据库 Westlaw 竞争,使用不具有变革性。法院强调该裁决仅适用于此非生成式使用案例,不能延伸至大型语言模型。在 Anthropic 案中,旧金山联邦法院称使用版权作品进行 AI 训练“惊人地”具有变革性,发出了有利于合理使用的强烈信号,但法院也做了“Napster 类比”,因为 Anthropic 使用了来自影子图书馆的盗版书籍作为训练数据,合理使用不涵盖非法获取的材料。Anthropic 后来为此向图书作者支付了 15 亿美元。