全球頂尖音樂出版商認為,Anthropic此前在一項歷史性和解中支付的賠償遠遠不夠。此前,Claude的開發商承認盜取逾700萬冊書籍用於AI訓練,最終賠付15億美元。
"15億美元的和解金額顯然不足以對一家公司的侵權行為形成震懾——該公司正是憑藉這種大規模侵權行為,積累起高達2萬億美元的估值。"音樂出版商在上周五提起的訴訟中如此表示。
提起訴訟的音樂出版商包括索尼、EMI和華納·查普爾。他們指控Anthropic的非法種子下載行為還涉及"數以萬計"包含歌詞和樂譜的書籍,涵蓋數百首乃至更多受版權保護的音樂作品。
訴狀指出,在音樂排行榜上日益要與AI生成作品競爭的詞曲作者,正因這種盜版行為受到直接傷害。
據稱,Anthropic計劃"永久"保留的盜版書籍中,包括披頭士全集、泰勒·斯威夫特"最佳"歌曲精選,以及《VH1百大搖滾金曲》等。出版商指控,若法院不頒布禁令叫停這種不當的AI訓練行為,Anthropic將持續侵犯音樂版權——不僅逐字複製歌詞,還會生成新歌曲來模仿熱門作品的"靈魂",從而不正當地取代藝術家在市場中的地位。舉例來說,Anthropic可能利用歌曲集或樂譜來響應用戶提示,要求Claude將Eminem的歌詞改寫成"碧昂絲風格"的歌曲。
"這是一場肆無忌憚的大規模非法種子下載、爬取和抓取受版權保護作品的行動,目的是為了開發和運營AI系統,並從中攫取巨額利潤。"音樂出版商在訴狀中寫道。
Anthropic的"大規模非法種子下載行動"始於2021年7月,彼時Anthropic聯合創始人班傑明·曼親自使用BitTorrent,從有爭議的盜版圖書館"創世紀圖書館"(LibGen)非法下載並上傳了數百萬冊盜版書籍。訴狀還指名Anthropic聯合創始人兼CEO達里奧·阿莫代伊批准了上述種子下載行為,兩人均被列為被告。
然而到2021年底,FBI關閉了LibGen。訴狀指出,"但在此之前,網路盜版者已將其內容複製,並建立了一個新的圖書館,名為'Z-Library'。"儘管Z-Library隨後也迅速遭到關閉,但在圖書作者的維權訴訟中曝光的內部消息顯示,Anthropic通過"盜版圖書館鏡像"(PiLiMi)獲取了這份副本的複製版本。
曼被指控在PiLiMi上線後不久,便指示員工下載該鏡像,並在內部消息中寫道,這個鏡像出現得"正是時候!"對此,一名Anthropic員工回復道:"zlibrary my beloved(Z圖書館,我的摯愛)。"
音樂出版商援引上述言論,作為Anthropic推崇盜版行為、並依賴種子下載快速獲取訓練數據的證據。他們總計指控,通過檢索LibGen和PiLiMi的非保密目錄,發現"書目元數據,包括書名、作者和ISBN",表明"Anthropic至少種子下載了數百冊含有樂譜和歌詞的書籍",這些書籍均涉及原告出版商所擁有的版權音樂作品。
出版商在訴狀中表示,將通過證據開示程序披露Anthropic種子下載行為的"全部範圍"。
對此,出版商承認Anthropic否認將任何從LibGen和PiLiMi種子下載的書籍用於訓練商業版Claude大語言模型。但他們認為,Anthropic的表述取決於對"訓練"的定義。他們認為,如果法院追溯Anthropic的操作路徑足夠深入,或許會發現商業模型在某個階段確實基於盜版作品進行了訓練。正如訴狀所解釋的:
"AI開發通常包括一個'預訓練'階段,在此階段,一個AI模型可能基於另一個AI模型生成的'合成數據'進行訓練,或從另一個AI模型獲得行為反饋。Anthropic至少使用了一個非商業AI模型所生成的合成數據,來訓練其對外發布的Claude商業模型——而該非商業模型是基於源自LibGen和/或PiLiMi的文本訓練而成的。Anthropic還使用了至少一個基於LibGen和/或PiLiMi文本訓練的非商業模型,為至少一個商業版Claude模型提供強化反饋。"
此外,訴狀還指出,圖書作者案近期解封的文件"揭示了Anthropic將非法下載的盜版書籍用於其內容審核機制"。例如,在一份文件中,Anthropic的一名證人作證稱,Anthropic已停止使用LibGen數據集訓練大語言模型,但仍繼續使用該數據集來檢測模型輸出內容是否與原始文本存在過長的字符串匹配。
Q&A
Q1:音樂出版商為何認為15億美元的和解金不夠?
A:音樂出版商認為,Anthropic憑藉大規模盜版行為積累了高達2萬億美元的估值,15億美元的賠償根本無法對其形成有效震懾。他們在訴狀中明確指出,這一金額不足以遏制未來的侵權行為,因此提起新的訴訟,要求法院頒布禁令,叫停Anthropic繼續利用盜版作品訓練AI模型。
Q2:Anthropic內部員工的"zlibrary my beloved"聊天記錄說明了什麼?
A:這條內部聊天記錄出現在Anthropic聯合創始人班傑明·曼指示員工下載盜版圖書館鏡像PiLiMi之後,員工的回覆表明團隊對使用盜版資源持歡迎甚至推崇的態度。音樂出版商將其作為關鍵證據,用以證明Anthropic主觀上認可並依賴盜版手段快速獲取AI訓練數據,而非僅僅是技術上的疏忽。
Q3:Anthropic否認侵權,為何出版商仍認為商業版Claude涉及盜版訓練?
A:Anthropic聲稱其商業版Claude模型未直接使用盜版書籍訓練,但出版商指出,AI開發存在"預訓練"階段——商業模型可能基於另一個非商業模型生成的合成數據進行訓練,而那個非商業模型恰恰是用LibGen或PiLiMi的內容訓練出來的。出版商認為,追溯完整的訓練鏈條,盜版內容實際上間接影響了商業模型。






