美國人工智慧公司 Anthropic 因使用盜版書籍訓練 AI 模型,被判賠償 15 億美元和解金,此事件凸顯全球 AI 發展中對內容著作權保護的重視。
盜版書籍訓練 AI 的法律風波
Anthropic 旗下的大型語言模型 Claude 被控從創世紀圖書館(Library Genesis)及 Pirate Library Mirror 等平台下載盜版書籍,用於其 AI 模型的訓練。這些盜版書籍涵蓋了約 50 萬部受著作權保護的作品。
根據訴訟指控,Anthropic 从 2021 年開始下載 Books3 資料庫,內容包含 196,640 本未經授權書籍,隨後又從 LibGen 下載至少 500 萬本書籍,2022 年再取得至少 200 萬本內容,累計超過 700 萬本來自未經授權的盜版網站。
內部知情卻選擇冒險
Anthropic 內部清楚來自盜版網站的資料可能帶來法律風險,依然選擇保留這批資料,且並非一次性的 AI 訓練資料,而是規劃建立永久保存的中央圖書館。數百名工程師都可存取這些內容,甚至能建立額外副本供其他用途使用。
合法購買書籍的替代方案
Anthropic 為建立 AI 訓練資料,原本希望取得更多合法內容,甚至提出建立「世界上所有書籍」資料庫的構想,但授權結果不如預期。隨後,公司改以大量購買紙本書方式,投入數百萬美元購買大量紙本書籍,再委託第三方拆除書脊、裁切每一頁並掃描為數位檔。
美國加州北區聯邦法院認為,若公司合法購買紙本書,再將內容一對一數位化供 AI 訓練使用,即使紙本遭銷毀,仍可構成合理使用。然而,來自盜版網站下載超過 700 萬本書籍,並建立永久保存的中央圖書館,已超出合理使用範圍。
從產業面來看,此次判決將對全球 AI 公司產生重大影響,未來在訓練 AI 模型時,必須更加謹慎處理著作權問題。盜版書籍的使用不僅違法,還可能導致巨大的法律和財務風險。建議所有 AI 公司在取得訓練資料時,應優先考慮合法途徑。
行動呼籲
此次事件提醒我們,AI 技術的發展不能以侵犯著作權為代價。作為讀者和消費者,我們也應該支持正版內容,共同維護創作者的權益。如果你對 AI 著作權有興趣,不妨深入了解一下相關法律規定,並在日常生活中踐行合法使用原則。
本文改寫整理自公開新聞來源,原始報導由自由時報發布。
常見問題 FAQ
Anthropic 被控告的原因是什麼?
Anthropic 被控告的原因是使用盜版書籍訓練 AI 模型,涉及約 50 萬部受著作權保護的作品。
盜版書籍的來源有哪些?
盜版書籍主要來自創世紀圖書館(Library Genesis)及 Pirate Library Mirror 等平台。
Anthropic 如何處理盜版書籍?
Anthropic 將盜版書籍下載後,建立永久保存的中央圖書館,數百名工程師可存取這些內容,甚至能建立額外副本供其他用途使用。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。