英國和愛爾蘭的二手書商近期頻繁收到來自神秘買家的大批量訂單,業界普遍猜測這些訂單背後是AI公司在為訓練數據大肆採購書籍。
多家書店向英國《衛報》反映,他們陸續收到來自美國、加拿大、歐洲大陸及英國買家的訂單。這一現象並非孤例,美國、澳大利亞及歐洲的書商也同樣報告了異常訂購情況。
英格蘭諾森伯蘭郡奧尼克鎮Barter Books書店的聯合老闆史都華·曼利表示,這些訂單從三個月前開始湧入,令人感到異常,因為它們完全不符合正常的主題歸類規律,既不按運動類劃分,也不按汽車類整理。
"這些書的組合確實很奇怪,"曼利說,"通常書單會圍繞某個主題,但這些訂單亂七八糟,毫無規律可言。"
其中一張訂單包括約翰·勒卡雷《使命之歌》的愛沙尼亞語譯本、特定出版社版本的安妮·勃朗特《艾格尼絲·格雷》,以及1983年10月出版的月刊《戰艦》。曼利表示,他已向三位買家售出了"數百本"雜亂無章的書籍,總金額約為4000英鎊。
愛爾蘭克拉拉爾韋鎮MW Books書店老闆吉姆·肖內西表示,他的書店自5月份以來持續收到大量內容各異的訂單。
"這些訂單時斷時續,應該是機器下單的,書目之間幾乎毫無主題關聯,從18世紀非洲農具類書籍,到1950年代賽車手的傳記,應有盡有,"他說,"我個人並不覺得我們有權干涉顧客購書後的用途,但這些訂單中的選書邏輯確實耐人尋味。"
英國巴斯BookLovers書店老闆戴維·高爾-斯彭斯表示,他在5月至7月間接到了約200本書的集中訂單,下單買家與其他書商提到的名字相互印證。
其中一家總部位於加拿大的Zoom Books自稱是"北美領先的圖書回收公司",此前已被多家媒體報道過。《衛報》已就此向Zoom Books發出採訪請求,截至發稿尚未獲得回應。
"有段時間訂單多到應接不暇,而我已經算是管理比較有序的了,"高爾-斯彭斯說。
一位不願具名的英國二手書商透露,部分零散訂單可能來自不同買家,但送貨地址卻指向同一處。"這些訂單背後的身份對資深書商來說也極為不透明,"這位書商說。
《衛報》獲取的一個英國收貨郵編顯示,不同買家的訂單最終都指向希思羅機場附近的一片貨運倉庫區。
這位書商自1月份以來已向類似買家累計售出6000本書,金額達數千英鎊。他表示,這些買家出價不菲,即便是批量採購也從不壓價。
"這正在擾亂二手書市場,因為這根本不是正常的交易模式,"他說,"看起來像是有人或某台機器在二手書市場裡隨機撈貨,而他們的購書邏輯與市場整體趨勢完全對不上號。"
《衛報》本月早些時候還報道稱,澳大利亞書商同樣遭遇了訂單爆發的情況,一位書商表示這種突如其來的大規模需求"讓人抓狂"。
這一連串異常訂單讓書商們普遍猜測,AI公司正在採購這些書籍,掃描內容後將書體
送去銷毀。
曼利說:"我的判斷是,這背後是大量AI資金在肆意揮霍。"
《華盛頓郵報》今年曾披露,知名AI公司、Claude
聊天機器人的開發商Anthropic曾斥資數千萬美元大量購書,割掉書脊後掃描內容,再將書籍送去回收處理。
Anthropic對此回應稱:"Claude的訓練數據來源包括公開網路數據、商業授權數據集,以及我們自行生成的數據。採購書籍是整個AI行業訓練大語言模型的普遍做法。我們的任何數據採購項目都不會購買或損毀珍本書籍或古舊書籍。"
上月,科技媒體404 Media報道稱,一家圖書資料庫曾向書商宣稱"世界上最優質的AI訓練數據就擺在書架上",並指出2022年前出版的書籍對AI公司而言是理想素材,因為其文本未受任何聊天機器人生成內容的"污染"。該資料庫ISBNdb隨後回應稱,相關內容只是一次"市場興趣測試"頁面,現已下線。
聊天機器人等AI工具需要依靠海量數據進行"訓練"才能生成回應,這一需求驅使科技公司不斷尋找新的數據來源以構建新模型。部分二手書出版於ChatGPT問世之前數十年,且不曾在網上留下數字痕跡,或許正因如此成為了新鮮數據的寶貴來源。
《衛報》在一個書商在線論壇上看到有人發帖寫道:"遺憾的是,這些書都將用於AI訓練,最終難逃被剝皮銷毀的命運。"
也有書商對這些毫無規律的訂單感到困惑,還有人質疑這究竟是否真的用於AI訓練——畢竟這些訂單中不乏《格列佛遊記》(1726年出版)這類早已在網上免費公開的書籍。
這些訂單通常通過Biblio、亞馬遜旗下的AbeBooks等圖書交易平台完成。《衛報》已就此向Biblio和AbeBooks發出採訪請求,尚未收到回復。
Q&A
Q1:Anthropic採購二手書是為了什麼用途?
A:根據《華盛頓郵報》的報道,Anthropic斥資數千萬美元大量購書,採購後會割掉書脊、掃描書籍內容,再將書送去回收處理,目的是為旗下大語言模型Claude獲取訓練數據。Anthropic方面表示,採購書籍是整個AI行業訓練大語言模型的普遍做法,並強調不會購買或損毀珍本及古舊書籍。
Q2:AI公司為什麼要專門購買二手實體書,而不是直接用網上的數據?
A:部分二手書出版於ChatGPT問世之前數十年,從未在網上留下數位版本。更重要的是,2022年前出版的書籍文本未受任何AI生成內容的"污染",數據質量更為純淨,因此對AI公司來說具有較高的訓練價值。
Q3:ISBNdb圖書資料庫為什麼會向書商推銷AI訓練數據服務?
A:科技媒體404 Media報道稱,ISBNdb曾在網站上宣傳"世界上最優質的AI訓練數據就擺在書架上"。ISBNdb事後回應稱,該內容只是一次"市場興趣測試"頁面,並非正式服務,相關頁面已下線。






