Anthropic買書掃描再銷毀,想守住訓練合法性
Anthropic買正版紙書掃描後銷毀原書,想用首次銷售原則和合理使用原則,讓模型訓練站進美國版權法的可辯護範圍。

Anthropic先買正版紙書,再掃描成訓練資料,最後銷毀實體書,想把模型訓練放進美國版權法可接受的範圍。
Anthropic這招很直白,也很硬派。先合法買書,再把紙書轉成數位文本,最後把實體書處理掉。它想說服法院的核心很簡單:這比較像格式轉換,不像額外複製受保護內容。
這件事會吵起來,不意外。AI 訓練最敏感的兩個問題,一直都是資料來源和使用邊界。這次把兩個問題一起拉到桌面,法律味道比技術味道更重。
| 項目 | 資訊 | 意義 |
|---|---|---|
| 公司 | Anthropic | 爭議核心當事方 |
| 資料來源 | 正版紙質書 | 強調合法購入 |
| 處理方式 | 掃描後銷毀實體書 | 降低新增副本爭議 |
| 法理基礎 | 首次銷售原則、合理使用 | 替訓練行為找合法入口 |
| 相關公司 | OpenAI、Google | 同樣面臨資料合規壓力 |
這套做法為什麼有法律味
訂閱 AI 趨勢週報
每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。
不會寄垃圾信,隨時可取消。
美國版權法的首次銷售原則,意思很單純。你買了合法出售的實體書,就能轉賣、借出,或自己處理那本書。Anthropic 的論點,是把掃描後的數位文本視為原書的替代形式,而不是市場上新增的一份副本。

它還會再疊一層合理使用。法院看這件事時,通常會看用途、作品性質、使用比例,以及是否影響市場。AI 公司最想說服法官的地方,就是訓練屬於高度轉換性的技術用途。
但模型訓練和人類閱讀差很多。人讀完一本書,腦中留下的是理解。模型訓練後留下的是參數和權重。這種差異,會直接影響法院怎麼看「複製」和「使用」的界線。
- 合法購入:先把來源做乾淨
- 掃描轉檔:把紙本變成可訓練資料
- 銷毀原件:避免紙本和數位版同時存在
- 訴訟策略:把焦點鎖在合理使用
法院為什麼會認真看這件事
因為這不是學術問題,是商業模式問題。Anthropic、OpenAI、Google 這類公司,都需要大量高品質、可追溯的資料。紙書掃描路線的吸引力,就在於它比亂抓網頁更容易交代來源。
這裡的關鍵,不只是技術流程,而是證據鏈。你能不能證明每一本書都合法買來?掃描後有沒有留下完整紀錄?原件是不是確實銷毀?這些細節會決定法官怎麼看你的動機。
Anthropic CEO Dario Amodei 直接把立場講得很明白:
“Fair use is the most important defense for the development of generative AI.” — Dario Amodei
這句話很直球。它代表 Anthropic 不是在躲版權爭議,而是在押注合理使用能不能撐住生成式 AI 的訓練需求。法律站得住,商業模式才有空間。
如果法院接受這種說法,其他公司也會更重視可審計流程。買書、掃描、建庫、銷毀原件,會變成一套可以被檢查的合規工法。
和直接抓網頁訓練差在哪
差很多。網頁爬蟲拿到的資料來源很散,版權狀態也很亂。付費牆、平台條款、robots 設定、轉載來源,全部混在一起。紙書掃描則是封閉流程,來源清楚,購買紀錄也比較好查。

但這不代表風險消失。法院還是會問,掃描後的數位檔是不是新副本?訓練行為有沒有超過合理使用?模型輸出會不會替代原作市場?這些問題,不會因為「我買了正版」就自動消失。
對開發者來說,這件事的啟發其實很現實。資料治理不是貼個合規標籤就結束。你要能回答資料從哪來、誰能用、用了多少、留了多久。
- 網頁抓取:來源多,邊界亂
- 紙書掃描:來源清楚,流程可追
- 市場影響:若模型替代閱讀,爭議更大
- 合規成本:買書、掃描、存檔、銷毀都要錢
如果這條路被接受,會改變什麼
最直接的變化,是 AI 公司會把買實體書變成資料管線的一部分。出版商和版權代理也會重新算帳,因為資料來源一旦有司法空間,談判籌碼就會變。
但這條路不會適用所有內容。書籍可以買、可以掃、可以銷毀。網頁、論壇貼文、程式碼倉庫、使用者內容,就沒這麼整齊。也就是說,就算紙書路線成立,它也只是局部解法。
更麻煩的是,這會把爭論從「有沒有偷資料」往前推成「法官願不願意接受這種資料處理方式」。這才是後面真正難打的地方。
從產業角度看,這也會逼 AI 公司更重視資料來源治理。未來誰能證明資料合法、流程可追、風險可控,誰就更容易在訴訟裡站穩。
這件事放回 AI 產業脈絡看
大模型競爭早就不只比參數。現在比的是資料、算力、法務和供應鏈。Anthropic 走這種紙書掃描路線,等於把版權風險前移到採購端,而不是等訓練完才補救。
這也反映一個現實:模型越大,資料治理越重要。台灣很多軟體團隊在做 RAG、知識庫或企業內訓模型時,常常只看效果,不看來源。短期看起來快,長期很容易踩雷。
如果你在做 AI 產品,我會建議先問三件事:資料來源有沒有授權、是否保留證據、資料處理規則能不能寫進內控。這三件事看起來無聊,出事時卻最有用。
結論很簡單
Anthropic 這招是在測試法院底線。它想證明,合法買來的紙書,掃描後銷毀原件,再拿去訓練模型,能不能被放進合理使用的框架裡。
如果你在做 AI 產品,現在就該把資料來源和處理流程整理乾淨。別等訴訟來了,才開始補文件。這場爭議接下來會看法院怎麼畫線,也會看業界願不願意照著這條線做事。