重點摘要
15 億美元劃下紅線:AI 訓練資料若取自盜版,代價是你負擔不起的天文數字
美法院批准史上最大版權和解,482,460 件作品獲賠,每件約 3,000 美元,Anthropic 須銷毀所有從 LibGen 與 PiLiMi 取得的盜版訓練資料。
地方法院裁定:合法取得書籍訓練 AI 受合理使用保護,但從盜版來源下載資料則構成侵權,兩者有本質差異,AI 公司必須能舉證資料來源合法。
本案是美國首個重大版權和解,但缺乏上訴判例且多起訴訟仍在進行,業界資料來源合規風險遠未終結。
前情提要
和解案核心條款與影響範圍
2026 年 7 月 20 日,美國聯邦地方法院法官 Araceli Martinez-Olguin 正式批准 Anthropic 與作家出版商集體訴訟的 15 億美元和解協議,創下美國有史以來最大版權賠償紀錄。
本案 Bartz v. Anthropic 於 2024 年提起,作家群指控 Anthropic 未經授權使用盜版書籍訓練 Claude 系列模型。和解涵蓋約 482,460 件作品,每件賠償約 3,000 美元;超過 91% 的受涉作家與出版商已完成申報。
和解條款同時要求 Anthropic 銷毀所有從 Library Genesis(LibGen) 與 Pirate Library Mirror(PiLiMi) 下載的盜版檔案及其全部衍生副本。律師費方面,法院從原申請的 1.875 億美元中核定 1.01 億美元。
值得注意的是,部分作家選擇退出集體和解、另行提起獨立訴訟,本案爭議並未因此全面終結。
版權作品訓練 AI 的法律灰色地帶
本案最關鍵的法律釐清,來自初步批准階段退休法官 William Alsup 的裁決:以合法取得書籍訓練 AI,屬於「典型轉化性使用 (quintessentially transformative) 」,受合理使用原則保護。
然而,Anthropic 從 LibGen 與 PiLiMi 下載並儲存逾 700 萬本盜版書至「中央資料庫」的行為,被裁定侵犯版權——即使這些書未必全數用於實際訓練。
這一區分確立了重要原則:問題不在「AI 訓練」本身,而在「資料取得的合法性」。AI 公司必須能夠證明訓練資料來源合法,而非等到訴訟時才補救。
名詞解釋
合理使用 (Fair Use) :美國版權法允許在特定條件下無需授權使用受版權保護作品,評估標準包含使用目的、作品性質、使用比例及市場影響四大要素。
此裁決僅為地方法院層級判決,缺乏聯邦上訴法院的先例效力。其他法官在類似案件中仍有充分裁量空間,AI 訓練資料版權問題的最終法律答案尚未到來。
各大 AI 公司面臨的訴訟全景
Anthropic 並非孤例。Google、Meta、Midjourney 與 OpenAI 均面臨類似的版權訴訟,各案針對訓練資料來源的合法性提出不同指控。
2026 年 7 月 14 日,出版商 Hachette 對 Google 提出新一輪版權索賠,顯示業界版權糾紛仍在持續升溫。本案雖是美國 AI 版權訴訟中首個達成重大和解的案件,但各公司仍處於各自評估法律風險的不確定狀態中。
部分觀察者指出,中國 AI 實驗室在授權機制上面臨較少法律約束,可能繼續在版權爭議較小的環境下訓練模型,形成國際競爭的非對稱性。
和解先例對產業的長期衝擊
15 億美元的天文數字向業界傳遞了清晰警示:資料來源合規審查將成為 AI 公司的核心法務議題,而非事後補救的選項。
本案確立的核心區分——合法取得資料可受合理使用保護,盜版來源取得資料則構成侵權——將成為後續所有訓練資料決策的基準參照。
然而本案在法律架構上留下重大缺口。Books3 資料集中的作者因元資料品質不足而無法識別、未獲任何賠償,顯示現有版權框架在處理大規模 AI 訓練資料時仍有嚴重侷限。
未來 AI 公司組建訓練資料集時,需建立嚴格的資料溯源 (data provenance) 機制,驗證每份資料的授權狀態、建立合規審計流程,並評估授權採購與訴訟風險之間的成本效益。
政策法規細節
核心條款
和解金 15 億美元,涵蓋約 482,460 件受版權保護作品,每件賠償約 3,000 美元。Anthropic 須銷毀所有從 Library Genesis 與 Pirate Library Mirror 取得的盜版書籍檔案及全部衍生副本。律師費由原申請的 1.875 億美元核定為 1.01 億美元。
適用範圍
本案為集體訴訟,適用於所有在指定時期內著作被 Anthropic 以上述盜版來源使用的作家與出版商。超過 91% 的受涉創作者已完成申報;部分作家選擇退出集體和解,另行提起獨立訴訟,爭議未全面終結。
執法機制
Anthropic 須在指定期限內銷毀問題資料並向法院確認執行。法官 Martinez-Olguin 裁定,就和解金額過低提出的異議「並非建立在對訴訟整體風險與報酬的現實評估之上」,相關反對意見遭到駁回。
合規實作影響
工程改造需求
AI 公司需建立完整的訓練資料溯源 (data provenance) 系統,能夠追蹤每份訓練資料的取得方式與授權狀態。
現有資料集若包含來源不明的內容,需進行合規審計並清除問題資料,類似本案 Anthropic 被要求銷毀 LibGen/PiLiMi 資料的操作。訓練管線也需加入資料來源驗證步驟,確保新增資料均有明確授權依據。
合規成本估計
授權採購成本顯著上升:OpenAI 目前每年透過 150+ 個授權協議支付數億美元取得版權內容使用權。訴訟風險儲備金亦需計入預算——本案 15 億美元的先例意味著業界無法再以「機率極低」低估版權訴訟的財務曝險。
法律顧問與資料合規專員的人力成本也將持續增加,中小型 AI 新創公司所承受的相對壓力尤為顯著。
最小合規路徑
短期最低限度合規步驟:
- 審查現有訓練資料集,識別並隔離來源不明或已知盜版平台(LibGen、PiLiMi、Sci-Hub 等)的資料
- 建立資料授權清單,確保新增資料均有明確授權或合理使用依據
- 訓練資料版本控管,保留完整資料集快照供潛在訴訟舉證
- 與版權持有人展開主動授權談判,降低後續訴訟風險
產業衝擊
直接影響者
首當其衝的是訓練大型語言模型的 AI 公司,尤其是仍依賴未授權網路爬取資料的中小型實驗室。出版業(書籍、新聞、學術期刊)將因此擁有更強的談判籌碼,要求 AI 公司支付授權費用或簽署資料使用協議。
間接波及者
訓練資料蒐集與清洗服務提供商、版權資料庫業者(如 Copyright Clearance Center)將迎來新市場機會。AI 訓練資料合規工具的需求預期增加,相關法律科技 (LegalTech) 新創可能因此崛起。
成本轉嫁效應
AI 服務授權成本的增加最終可能部分轉嫁至企業用戶,特別是依賴 LLM API 構建應用的開發者與新創公司。出版業若成功建立資料授權收費機制,書籍與新聞內容的訂閱費或授權費可能隨之調整。
時程與展望
Bartz v. Anthropic 集體訴訟提起,作家群指控 Anthropic 未經授權使用盜版書籍訓練 Claude
退休法官 William Alsup 初步批准和解,裁定合法取得書籍訓練 AI 屬「典型轉化性使用」,受合理使用保護
出版商 Hachette 對 Google 提出新一輪版權索賠,業界版權糾紛持續升溫
法官 Martinez-Olguin 正式批准 15 億美元和解,成為美國有史以來最大版權賠償紀錄
Anthropic 完成銷毀 LibGen/PiLiMi 盜版資料程序;業界 AI 公司展開訓練資料集合規審計
Google、Meta、OpenAI 等公司面臨類似訴訟壓力;聯邦上訴法院具有約束力的版權判例可能出現
Books3 資料集相關訴訟進展、各國版權框架對 AI 訓練的適用性、授權成本對 AI 產業競爭格局的長期影響
唱反調
15 億美元在 Anthropic 的資本規模下相對可承受,可能實際上降低了業界對版權訴訟的風險感知——讓 AI 公司更傾向把訴訟賠償當作可接受的經營成本,而非主動與版權持有人建立長期授權關係。
Alsup 法官的合理使用裁定不代表所有 AI 訓練都受保護;此裁決僅為地方法院層級,缺乏上訴先例約束力,讓這個「里程碑」遠比表面看起來脆弱,後續上訴程序仍可能翻轉現有解釋。
社群風向
15 億美元 Bartz v. Anthropic 版權和解中有一個令人震驚的細節:Books3 資料集中著作遭侵犯的作者——也就是 Anthropic 用來訓練模型的盜版資料集、原始訴狀的核心依據——根本未獲分文賠償。Alsup 法官表示,Books3 資料集的元資料品質太差,無法可靠識別作者與書名。
最新消息:Anthropic 集體訴訟和解細節已提交法院批准。Anthropic 同意向集體成員支付 15 億美元。「史上已公開報告中最大的版權賠償金額」!
這說法不正確。Anthropic 支付了 15 億美元賠償給版權持有人,補償其內容被用於訓練資料。OpenAI 每年透過 150 多個授權協議支付數億美元取得版權內容使用權,Meta 和 Alphabet 也有類似安排。根據和解條款,Anthropic 被強制刪除其訓練所用的盜版資料。中國實驗室仍可在盜版資料上訓練,我懷疑中國模型是否受到類似授權協議的約束。
法官剛剛批准了 Anthropic 版權案的和解。
史上最大版權集體訴訟和解於週一獲得最終批准,15 億美元賠償授予作家和創作者,其作品被 AI 公司 Anthropic 用於訓練大型語言模型。
炒作指數
行動建議
審查自身產品所使用的 LLM 服務供應商的資料授權政策,確認其是否有明確的訓練資料合規聲明與溯源機制。
若正在開發需要 fine-tuning 或自訓模型的系統,從一開始就建立訓練資料溯源記錄,避免使用 LibGen、PiLiMi 等已知盜版來源的資料集。
關注 Google、Meta、OpenAI 面臨的類似版權訴訟進展,以及聯邦上訴法院可能出現的具有約束力判例——那才是真正能定案 AI 訓練合理使用邊界的裁決。