印度德里高等法院近日作出臨時裁決,駁回了該國主要新聞機構亞洲國際新聞社(ANI)針對 OpenAI 的初步禁令申請。ANI 此前起訴 OpenAI,指控其在 AI 訓練及 ChatGPT 輸出中使用了受版權保護的新聞內容。法官 Amit Bansal 駁回了 ANI 在兩項主張上的救濟請求,裁決涉及模型記憶、檢索增強生成(RAG)以及 AI 訓練的法律地位等關鍵問題。AI 版權法專家 Andres Guadamuz 稱此裁決是 OpenAI 的重要早期勝利。

ANI 提交給法庭的多份 ChatGPT 輸出內容,聲稱是對其文章的實質性複製。然而,OpenAI 證明所使用的模型 GPT-4 和 GPT-4o 的訓練資料分別截止於 2022 年 4 月和 2024 年 4 月,而 ANI 引用的文章大多發表於 2024 年 8 月和 9 月,因此不可能包含在訓練資料中。法官初步認為,輸出內容的相似性源於 RAG 技術——該技術允許語言模型即時檢索網路資訊,類似搜尋引擎。ANI 在訴狀中未涉及 RAG 問題,法庭因此無法就此作出最終裁決。法官表示,基於 RAG 的輸出可能構成“向公眾傳播”,這一問題將在主審中處理。

ANI 的立場進一步削弱。該機構使用了對抗性提示,明確要求模型“精確”複製文章,但即便如此,也未能提供任何逐字複製的例項。法官認為,新聞文章中的事實通常不受版權保護,且複製主題和標題在此案中不構成與 ANI 的直接競爭。證據也不支援 ANI 關於 OpenAI 在模型中永久儲存訓練資料並可隨時逐字複製的說法,但法庭將在主審中重新審視這一問題。

在 AI 訓練是否構成版權侵權方面,ANI 同樣未能證明。雙方均承認 OpenAI 在訓練中使用了 ANI 的內容,但 OpenAI 辯稱,這些材料在整個資料集中佔比極小,模型僅提取了語法、句法和語言模式等非表達性元素。法官依據印度版權法中的例外條款,將“私人或個人使用,包括研究”中的“研究”解釋為涵蓋 AI 訓練。法官為此設定了條件:訓練副本必須來自合法來源,而非影子圖書館或未經授權訪問的付費網站;OpenAI 也未公開訓練副本,僅作內部處理。Guadamuz 指出,這是法院首次明確認定 AI 訓練屬於私人使用例外。

法院進行了三要素公平性測試,並在所有三項上支援 OpenAI。OpenAI 對 ANI 作品的使用僅限於訓練,未證明存在記憶或複製行為。ANI 也無法證明經濟損害,因為兩家公司業務領域不同。即使 ChatGPT 被問及 ANI 的新聞標題,模型也僅返回主題和至多幾個文章標題。法官引用了美國案例,包括 Bartz v. Anthropic 和 Kadrey v. Meta,認為語言模型輸出具有變革性,並提及了早期的 Google Books 裁決。法官還認為,訓練後的語言模型能改善資訊獲取、支援教育、推進科學研究、輔助軟體開發、實現翻譯,併為殘障人士創造工具。

德里高等法院的裁決加入了全球範圍內日益增多的、結論相互衝突的 AI 版權案件。在美國,法官駁回了 Raw Story 和 AlterNet 對 OpenAI 的訴訟,理由是原告未能證明足夠損害且精確複製機率極低,同時認定事實不受版權保護。GitHub Copilot 案也以失敗告終,原告未能提供任何相同程式碼的例項。而 The Intercept 則通過 DMCA 投訴獲得了部分勝利,涉及訓練前被剝離的版權材料。在 Ross Intelligence v. Thomson Reuters 案中,法院否定了合理使用,因為 AI 研究工具直接與 Thomson Reuters 的法律資料庫 Westlaw 競爭,使用不具有變革性。法院強調該裁決僅適用於此非生成式使用案例,不能延伸至大型語言模型。在 Anthropic 案中,舊金山聯邦法院稱使用版權作品進行 AI 訓練“驚人地”具有變革性,發出了有利於合理使用的強烈訊號,但法院也做了“Napster 類比”,因為 Anthropic 使用了來自影子圖書館的盜版書籍作為訓練資料,合理使用不涵蓋非法獲取的材料。Anthropic 後來為此向圖書作者支付了 15 億美元。