AI 公司秘密收購百萬舊書,「數位保存」背後的破壞式掃描產業鏈

近期,外媒 404 Media 揭露了一項令人震驚的產業鏈:人工智慧公司通過中間商大量收購二手書,尤其是稀有、絕版和專門題材書籍,再以拆書、掃描、銷毀原書的方式取得訓練資料,引發了文化保存與著作權爭議。

事實陳述

自今年 4 月起,二手書商觀察到一陣異常採購潮,部分書商甚至接到單筆從 1,000 本到 100 萬本的訂單,且買家大多要求匿名。這些採購往往不挑選主題、作者或類型,只要有 ISBN 就可能收購,且買家對價格幾乎不設上限,顯示其目的並非收藏或轉售,而是為了訓練模型。

各方反應

ISBNdb 這類書目資料庫業務已轉向替 AI 公司大量採購紙本書,主打可提供「世界最好的 AI 訓練資料」,並強調 2022 年前出版的書籍為更優質的訓練內容。多數書商對此表示擔憂,認為這種做法不僅破壞了書籍的物理存在,還可能侵犯著作權。

相關文件顯示,Anthropic 曾推動類似方法,雇用外包掃描公司以液壓切割機拆開書脊,再用高速工業掃描器掃描整本書,之後實體書只能報廢或回收。這種「破壞式掃描」速度更快、成本更低,但代價是大量紙本書永久消失,外界擔心這些犧牲書本可能包含許多珍本與絕版書。

背景補充

此做法再度突顯 AI 產業對高品質資料的迫切需求。隨著網路上充斥大量 AI 生成內容且品質逐漸下降,AI 巨頭紛紛轉向尋找更「乾淨」的人類原創文本。然而,法律與倫理層面,這種未經授權、未予補償就大量取用內容的模式,也與出版界和創作者的權益正面衝突。

從產業面來看,AI 公司的這種做法雖然可以快速獲取大量訓練資料,但長期來看,可能會對文化遺產造成無法彌補的損失。出版界和創作者應聯合起來,通過法律手段保護自己的權益,同時尋求更可持續的數位保存方案。建議讀者關注此議題,並支持正版書籍。

文章看完覺得有幫助,何不給我們一個鼓勵?請我們喝杯咖啡,讓我們有更多動力繼續帶來深入報導。

本文改寫整理自公開新聞來源,原始報導由科技新報發布。

常見問題 FAQ

AI 公司為什麼要大量收購舊書?

AI 公司需要大量高品質的訓練資料來提升模型性能,舊書尤其是稀有、絕版和專門題材書籍,提供了豐富的內容資源。

這種「破壞式掃描」有哪些問題?

這種方法速度快、成本低,但會導致大量紙本書永久消失,可能包含珍本和絕版書,且未經著作權持有者授權,侵犯了著作權。

出版界如何應對這種現象?

出版界應通過法律手段保護自己的權益,同時尋求更可持續的數位保存方案,如合作建立數位檔案庫,確保原書得以保留。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。