一份本周解密的法庭文件顯示,新聞出版商在訴訟中援引的高管言論表明,AI公司在使用海量已發表文本訓練其大語言模型
時,明知這種做法構成了對版權材料的竊取。
該訴訟文件本月早些時候提交,涉及針對ChatGPT開發商OpenAI及其合作夥伴微軟的多起版權侵權案件的合併審理,其中包括《紐約時報》以及CNET母公司Ziff Davis
提起的訴訟。
據出版商提交的文件顯示,微軟應用科學總監布倫特·赫克特
(Brent Hecht)將此稱為「規模空前的驚人盜竊」,甚至可能是「人類歷史上最大規模的勞動成果竊取」。文件中引用言論的完整背景材料目前仍處於保密狀態。
出版商援引的這些言論似乎削弱了AI公司此前的辯護理由,即使用版權材料受到「合理使用
」原則的法律保護。根據這一法律原則,版權材料的使用是否受保護,取決於使用方式、作品性質、使用量以及該使用對原作品市場的影響等因素。
據文件顯示,微軟首席執行官薩提亞·納德拉
(Satya Nadella)在宣誓作證時表示,與聊天機器人的對話可以直接在「AI平台上的網站」獲取資訊,而無需「前往資訊的原始來源」,比如發布該資訊的出版商網站。同樣,一位OpenAI高管也曾寫道,出版商面臨著來自該公司聊天機器人等產品的「生存威脅」。
出版商的訴訟文件還描述了AI開發者規避付費牆
的具體做法,例如針對《紐約時報》付費牆的操作。文件中提到,一名OpenAI員工曾告訴公司總裁格雷格·布羅克曼
(Greg Brockman)「有一個繞過紐約時報付費牆的辦法」,布羅克曼回復道:「啊,不錯。」
與此同時,文件顯示納德拉曾作證稱,任何處於付費牆之後的內容,凡是想用於AI開發的一方「都應當獲得授權許可」,並且如果他當時知道OpenAI是用付費牆內容訓練模型的,他會要求OpenAI重新訓練其模型。
微軟發言人在向CNET提供的聲明中表示,赫克特的言論「反映的是個人觀點」,公司的立場體現在其法庭文件中,該文件「解釋了為什麼這些具有變革性的使用方式符合版權法,以及為什麼Copilot
不能替代出版商的新聞報道」。
該發言人表示,納德拉的言論針對的是人們獲取資訊方式的變化,與公司的法律立場「完全一致」。「這些觀點不應與法院正在審理的版權問題的結論混為一談,微軟已在其法庭文件中就此作出說明。」
在該案的自辯文件中,微軟表示,使用已發表內容訓練大語言模型具有顯著的變革性。該公司辯稱:「版權法並不允許版權持有者阻止像大語言模型這樣具有變革性的技術;相反,它鼓勵此類使用,因為可以預期版權持有者會隨之調整,公眾也將因此受益。」
OpenAI和Ziff Davis的代表尚未立即回應置評請求。
大語言模型的訓練依賴於開發者能夠獲取的儘可能多的已發表內容,而圍繞版權展開的訴訟——包括書籍作者提起的相關案件——可能會對AI公司和媒體機構都產生重大影響。出版商認為,AI公司應當為其使用的內容支付授權費用,而科技公司則表示這樣做既無必要,也會給能力更強的AI開發帶來負擔。川普政府本月早些時候就此案發表聲明,認為授權要求將阻礙美國在與中國的AI競賽中的發展。
出版商還指出,OpenAI和微軟的員工也清楚地知道,他們的聊天機器人能夠查找、複製、總結甚至有時直接複述出版商的內容,這正在讓讀者不再訪問新聞機構的網站。
出版商在訴訟文件中寫道:「被告自己的專家也承認,具備資訊溯源能力的大語言模型是在利用其資訊來源,而不是像被認定為合理使用的搜索行為那樣為其引流。」
Q&A
Q1:為什麼新聞出版商起訴OpenAI和微軟?
A:出版商認為OpenAI和微軟在訓練大語言模型時未經授權使用了受版權保護的新聞內容,構成版權侵權,因此提起了包括《紐約時報》和Ziff Davis在內的多起相關訴訟。
Q2:微軟高管是否承認AI訓練使用版權內容存在問題?
A:法庭文件顯示,微軟應用科學總監布倫特·赫克特曾將此稱為「規模空前的驚人盜竊」,首席執行官薩提亞·納德拉也曾作證稱付費牆內容應獲得授權許可才能用於AI開發。
Q3:OpenAI是否曾試圖繞過《紐約時報》的付費牆?
A:根據文件,一名OpenAI員工曾告訴公司總裁格雷格·布羅克曼存在「繞過紐約時報付費牆的辦法」,布羅克曼對此回應「不錯」。






