根據外媒 404 Media 的最新深入調查披露,包含亞馬遜(Amazon)在內的多家科技巨頭,正透過隱密供應鏈批量採購珍稀書籍,並將其送入特定倉庫進行集中式破壞性銷毀。
404 Media 的調查團隊在一筆上千本珍稀藏書的交易中植入 AirTag 追蹤器,最終跨州定位至亞馬遜位於內華達州的秘密倉庫,揭開了這些珍本被切斷書脊、高速轉化為演算法訓練「數據飼料」後隨即丟棄的驚人真相。顯示當商業巨頭為了訓練大模型而無情榨取實體藏書資源的問題。
AirTag 跨州追蹤:揭開神秘倉庫「LAS8」的毀書流水線
這起調查始於 404 Media 與一位珍稀書籍賣家的跨界合作。調查團隊在一筆高達 1,000 本珍貴藏書的採購訂單中,將一枚蘋果 AirTag 追蹤器巧妙隱藏在其中一本珍稀書籍的夾層內,展開為期數週的物流追蹤。
追蹤訊號顯示,這批珍稀文獻從加州出發,中途輾轉經過密爾瓦基以及科羅拉多州的大章克申,最終抵達了位於內華達州拉斯維加斯東北部、代號為「LAS8」的亞馬遜大型物流倉庫。
這座「LAS8」倉庫在公開業務中通常負責亞馬遜的按需印刷(Print-on-Demand)服務,然而在倉庫內部一個被標記為「VGT3」的特定管制區域內,現場進行的卻是完全相反的破壞性作業。
在「VGT3」作業區內,送達的大量珍稀書籍面臨著殘酷的標準處置流程:工作人員使用專業切紙設備直接切斷整本書的書脊(Debinding),將原本裝訂完整的書籍解體為零散紙頁,隨後送入工業級高速進紙掃描儀(Sheet-fed Scanner)進行全自動光學掃描,在極短時間內將所有文字轉化為高純度的純文字數據。
更值得關注的是,這些珍貴書籍被數位化後,既不會上架公開給一般大眾借閱,也不會被製作成供人類閱讀的 PDF 或電子書版本,而是直接作為預訓練演算法的專屬「飼料」,專門灌注至大語言模型的底層數據集中。一旦書籍內含的文字數據價值被徹底榨乾,殘存的物理碎紙與封皮便會被當作廢棄物直接丟棄銷毀。
逃離「模型崩潰」:AI 資料荒下的原始原創渴求
科技巨頭之所以採取如此極端的「毀書取字」手段,核心癥結在於當前 AI 產業遭遇的嚴重資料荒。
隨著網路上的新聞、文章、音樂與社群媒體充斥著大量由 AI 生成的合成內容,AI 開發商正面臨嚴峻的技術瓶頸。專家與研究機構多次提出警示:當大型語言模型反覆使用由其他 AI 產生的資料進行訓練時,會引發所謂的「模型崩潰(Model Collapse)」效應,導致模型輸出的內容日益同質化、平庸化,甚至喪失多樣性與邏輯推理能力;同時,合成資料還會成倍放大 AI 的「幻覺(Hallucination)」問題,使錯誤資訊在遞迴訓練中被強化為虛假的事實基準。
為了打破這種數位資訊污染的惡性循環、順利讓模型突破更高難度的評測與圖靈測試,開發商急需海量真實、獨特且從未被 AI 污染過的人類原創內容。尚未被數位化、保留著純粹人類智慧結晶的古老實體書籍,因而成為科技公司眼中最頂級的「未污染黃金礦脈」。
在法律層面上,目前法院的司法判例傾向於認定此類操作在合理使用(Fair Use)範疇內屬於合法行為,其法律前提是科技企業並未將這些未經授權數位化的書籍副本公開發行或轉售牟利,而是僅將其作為訓練演算法的內部參數分析。
事實上,採取這種破壞性掃描策略的並非只有亞馬遜一家,包括知名 AI 獨角獸 Anthropic 在內的多數大型商業 AI 研發機構,也早已紛紛加入搶購實體書籍並進行內部訓練的行列。
然而,法律的許可並未能平息文化界的巨大焦慮。業內專家與文史學者沈痛警告,實體書籍的存量終究是有限的,隨著科技巨頭無休止地消耗這些實體資源,部分原本存世量就極為稀少的絕版書與地方文獻,極有可能在這場「先拆書、後銷毀」的 AI 軍備競賽中徹底在物理世界中絕跡。
- 延伸閱讀:手持掃描器產品介紹與正確用法,書本、文件數位化好幫手
- 延伸閱讀:AI 公司狂買紙本書訓練模型!ISBNdb 推採購媒合服務惹怒出版界,急撤下切割
- 延伸閱讀:Seedance 2.0 AI 竟光憑一張臉就能產生複製真人聲音,遭質疑盜用抖音資料訓練模型
- 延伸閱讀:矛盾的大型語言模型:科技巨頭訓練模型時猛撈他人資料,但卻不允許自身資料外流
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!