近日,調查媒體404 Media揭露了AI行業里一場隱秘的「搶書大戰」:多家AI公司通過中間商,在全球範圍內大量收購二手紙質書,用來訓練大語言模型。而這些書在掃描完成後,紙質原件往往被直接粉碎銷毀。

報道稱,AI公司的目標很明確——只要2022年以前出版的紙質書。因為現在網上到處是AI生成的內容,真正由人類原創的「乾淨」文本越來越稀缺。在線圖書資料庫ISBNdb已經面向AI企業推出批量採購服務,一次訂單從1000本到100萬本不等。有書商透露,今年4月以來,他每周的銷量從大約20本猛增到幾百本,漲了將近五倍。
在這場「獵書」行動中,Anthropic公司是主力之一。他們啟動了代號「巴拿馬計劃」的項目,投入數百萬美元買書,用液壓切割機切掉書脊,再用高速工業掃描儀數位化,最後把紙質書粉碎銷毀。雖然美國聯邦法院曾認定,這種「合法購買後破壞性掃描」的做法屬於合理使用,但Anthropic因為長期保存了一個包含700萬本盜版圖書的資料庫,已被判賠償15億美元。

這種做法也引發了很大爭議。批評者擔心,大量存世稀少的絕版古籍可能因此永久消失。特斯拉CEO馬斯克已經公開回應,要求他旗下的SpaceX AI團隊改用非破壞性方式掃描書籍,避免切掉書脊。與此同時,谷歌也因涉嫌使用數百萬本受版權保護的圖書訓練Gemini模型,遭到出版商聯盟起訴。



當AI把人類幾千年積累的紙質文化遺產當作「數據礦山」來開採時,我們該如何在技術進步和文明存續之間找到平衡?這已經是一個無法迴避的問題。






