全球大型圖書資料庫之一 ISBNdb 於 7 月 30 日撤下其官方網站上標榜「AI 訓練專用實體書採購」的行銷登陸頁面。據《404 Media》7 月 21 日首度報導,該平台日前架設專頁,企圖向大語言模型(LLM)科技公司推銷大量採購實體舊書作為訓練語料的對接管道,引發出版界、圖書館員與廣大讀者的強烈撻伐。社群批評將紙本書當成一次性耗材的商業模式無異於現代版《華氏 451 度》文化焚書,迫使 ISBNdb 刪除宣傳頁面並發布聲明切割。

科技公司搶購實體書:從盜版訴訟走向「買書裁切掃描」的合法路徑
科技公司對實體書的龐大需求,源於大型語言模型面臨的「模型崩潰」(Model Collapse,萊斯大學團隊稱之為 Model Autophagy Disorder 模型自噬症)危機。隨著網路上由生成式 AI 產出的垃圾文章(AI Slop)與合成數據鋪天蓋地,AI 模型若持續吸納網路公開資料,將陷入效能退化的惡性循環。為了獲取未經 AI 污染的「乾淨語料」,科技巨頭將目光投向印刷出版物。
美商 Anthropic 早年為訓練 Claude 模型,曾從 LibGen 等盜版影子圖書館下載數百萬本電子書,最終於 2025 年 9 月以 15 億美元與作者團體達成和解。隨後曝光的內部文件顯示,Anthropic 轉向名為「巴拿馬計畫」(Project Panama)的替代路徑,暗中斥資數千萬美元,直接向市場大量收購數百萬冊實體書籍,並切除書脊進行高速 OCR 掃描後將殘骸丟棄。2025 年 6 月,加州北區地院法官 William Alsup 裁定,使用合法購入的紙本書進行模型訓練構成合理使用(Transformative Use)。由於法律上無障礙,外界推測科技公司之所以選擇切毀書籍而非非破壞性掃描,純粹是為了節省昂貴的設備與人力成本。2026 年 1 月,相關解密文件在訴訟中曝光,引發震撼。
媒合專頁引爆觀感危機:ISBNdb 喊卡否認親自經手書籍
二手舊書商透露,近期市場湧入異常大量的匿名整批訂單,業界普遍懷疑買家為 AI 公司或其代採購機構。在此背景下,專攻書目資料的 ISBNdb 嘗試切入 AI 訓練語料的採購媒合市場。其被刪除的登陸頁面曾宣稱「全球最頂級的 AI 訓練數據正靜靜躺在書架上」,主張實體書籍具備網頁爬蟲無法比擬的權威性與結構化知識。
在報導曝光九天後,ISBNdb 於 7 月 30 日撤下頁面並發布否認聲明。ISBNdb 澄清官方從未購買、掃描或販售過任何一本書,頁面僅為「測試市場興趣」,且公司本身從未訓練過 AI 模型。然而,《404 Media》揭露 ISBNdb 曾私下向客戶承認「觀感問題是真實存在的」(the optics problem is real),與事後宣稱的「市場測試」形成強烈對比。
趨勢分析:私有語料封存與公共知識保存的衝突
加州法院雖然正面認定合法購書後的掃描訓練屬於合理使用,但「買書毀書」在輿論與道德層面仍承受巨大的社會壓力。這些實體書雖然被掃描為數位檔案,但其成果被封存為科技企業私有的訓練語料,既不對外公開,亦未進入任何公共典藏系統;而實體書籍本身卻已遭到永久破壞。
AI 產業對高品質數據的渴求已觸及實體文化載體的邊界。隨著 Google Books 過去建立可公開檢索索引的開放模式不再被 AI 巨頭採納,科技公司封閉式的數據擷取模式正引發文化機構對知識獨佔與文獻保存的深刻疑慮。如何在大模型訓練需求與實體文獻保存之間建立合理的倫理規範,仍是全球出版界與科技界持續博弈的核心議題。
資料來源:
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!