美国司法部(DOJ)在涉及《纽约时报》的合并诉讼中支持AI公司,主张使用受版权保护的材料训练AI模型属于合理使用。该案由《纽约时报》于2023年底在曼哈顿联邦法院提起,指控OpenAI和微软未经许可使用数百万篇NYT文章训练GPT-4等模型,并构建与之竞争的信息产品。《纽约时报》索赔数十亿美元,并要求销毁基于其文章训练的语言模型。此案被视为AI版权问题的风向标,司法部的立场可能对法院判决产生重要影响。

司法部认为,训练与输出之间存在法律区别:训练过程中复制完整作品但未公开,且模型输出“通常(若非总是)缺乏实质性相似”。司法部驳斥了将两者混为一谈的“市场损害”理论,认为这“在法律上是错误的”。司法部还以作家琼·狄迪恩为例,称她年轻时抄写海明威故事以学习写作,若按原告逻辑,她每次出版都可能面临责任。

司法部强调,大语言模型具有创造性和社会价值,人类使用LLM创作原创作品,若仅因训练就施加责任,将扼杀版权法本应保护的创造力。据报道,连《纽约时报》的记者也使用LLM起草和编辑文章。

然而,批评者指出,这些论点忽略了规模问题:单个作者抄写文本学习是一回事,而一家数十亿美元的公司将内容转化为竞争性大众产品则是另一回事。美国版权局在报告中明确拒绝了对AI训练适用全面合理使用,认为AI处理完美副本并以远超人类的速度和规模生成内容,商业应用若与现有市场中的原创作品竞争,则超出合理使用范围。

司法部在文件中直接反驳了版权局报告,称前版权局局长希拉·珀尔穆特的评估不具法律约束力,且报告忽视了逐案分析的法律先例和法定的市场损害类型。珀尔穆特在报告发布后不久被特朗普政府解职。民主党众议员乔·莫雷尔表示,她因拒绝为AI训练版权作品合法化背书而被解雇,这一立场得到特朗普盟友埃隆·马斯克的支持。司法部在脚注中指出,珀尔穆特正在对解雇提出异议。

此案凸显了AI版权问题的复杂性,以及政府内部不同机构之间的分歧。司法部支持AI公司的立场,可能为AI行业提供法律上的喘息空间,但最终裁决仍取决于法院。无论结果如何,此案都将为未来AI训练与版权法的互动设定先例。