[IND] 5 分鐘閱讀OraCore 編輯部

Anthropic買書掃描再銷毀,想守住訓練合法性

Anthropic買正版紙書掃描後銷毀原書,想用首次銷售原則和合理使用原則,讓模型訓練站進美國版權法的可辯護範圍。

分享 LinkedIn
Anthropic買書掃描再銷毀,想守住訓練合法性

Anthropic先買正版紙書,再掃描成訓練資料,最後銷毀實體書,想把模型訓練放進美國版權法可接受的範圍。

Anthropic這招很直白,也很硬派。先合法買書,再把紙書轉成數位文本,最後把實體書處理掉。它想說服法院的核心很簡單:這比較像格式轉換,不像額外複製受保護內容。

這件事會吵起來,不意外。AI 訓練最敏感的兩個問題,一直都是資料來源和使用邊界。這次把兩個問題一起拉到桌面,法律味道比技術味道更重。

項目資訊意義
公司Anthropic爭議核心當事方
資料來源正版紙質書強調合法購入
處理方式掃描後銷毀實體書降低新增副本爭議
法理基礎首次銷售原則合理使用替訓練行為找合法入口
相關公司OpenAIGoogle同樣面臨資料合規壓力

這套做法為什麼有法律味

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

美國版權法的首次銷售原則,意思很單純。你買了合法出售的實體書,就能轉賣、借出,或自己處理那本書。Anthropic 的論點,是把掃描後的數位文本視為原書的替代形式,而不是市場上新增的一份副本。

Anthropic買書掃描再銷毀,想守住訓練合法性

它還會再疊一層合理使用。法院看這件事時,通常會看用途、作品性質、使用比例,以及是否影響市場。AI 公司最想說服法官的地方,就是訓練屬於高度轉換性的技術用途。

但模型訓練和人類閱讀差很多。人讀完一本書,腦中留下的是理解。模型訓練後留下的是參數和權重。這種差異,會直接影響法院怎麼看「複製」和「使用」的界線。

  • 合法購入:先把來源做乾淨
  • 掃描轉檔:把紙本變成可訓練資料
  • 銷毀原件:避免紙本和數位版同時存在
  • 訴訟策略:把焦點鎖在合理使用

法院為什麼會認真看這件事

因為這不是學術問題,是商業模式問題。AnthropicOpenAIGoogle 這類公司,都需要大量高品質、可追溯的資料。紙書掃描路線的吸引力,就在於它比亂抓網頁更容易交代來源。

這裡的關鍵,不只是技術流程,而是證據鏈。你能不能證明每一本書都合法買來?掃描後有沒有留下完整紀錄?原件是不是確實銷毀?這些細節會決定法官怎麼看你的動機。

Anthropic CEO Dario Amodei 直接把立場講得很明白:

“Fair use is the most important defense for the development of generative AI.” — Dario Amodei

這句話很直球。它代表 Anthropic 不是在躲版權爭議,而是在押注合理使用能不能撐住生成式 AI 的訓練需求。法律站得住,商業模式才有空間。

如果法院接受這種說法,其他公司也會更重視可審計流程。買書、掃描、建庫、銷毀原件,會變成一套可以被檢查的合規工法。

和直接抓網頁訓練差在哪

差很多。網頁爬蟲拿到的資料來源很散,版權狀態也很亂。付費牆、平台條款、robots 設定、轉載來源,全部混在一起。紙書掃描則是封閉流程,來源清楚,購買紀錄也比較好查。

Anthropic買書掃描再銷毀,想守住訓練合法性

但這不代表風險消失。法院還是會問,掃描後的數位檔是不是新副本?訓練行為有沒有超過合理使用?模型輸出會不會替代原作市場?這些問題,不會因為「我買了正版」就自動消失。

對開發者來說,這件事的啟發其實很現實。資料治理不是貼個合規標籤就結束。你要能回答資料從哪來、誰能用、用了多少、留了多久。

  • 網頁抓取:來源多,邊界亂
  • 紙書掃描:來源清楚,流程可追
  • 市場影響:若模型替代閱讀,爭議更大
  • 合規成本:買書、掃描、存檔、銷毀都要錢

如果這條路被接受,會改變什麼

最直接的變化,是 AI 公司會把買實體書變成資料管線的一部分。出版商和版權代理也會重新算帳,因為資料來源一旦有司法空間,談判籌碼就會變。

但這條路不會適用所有內容。書籍可以買、可以掃、可以銷毀。網頁、論壇貼文、程式碼倉庫、使用者內容,就沒這麼整齊。也就是說,就算紙書路線成立,它也只是局部解法。

更麻煩的是,這會把爭論從「有沒有偷資料」往前推成「法官願不願意接受這種資料處理方式」。這才是後面真正難打的地方。

從產業角度看,這也會逼 AI 公司更重視資料來源治理。未來誰能證明資料合法、流程可追、風險可控,誰就更容易在訴訟裡站穩。

這件事放回 AI 產業脈絡看

大模型競爭早就不只比參數。現在比的是資料、算力、法務和供應鏈。Anthropic 走這種紙書掃描路線,等於把版權風險前移到採購端,而不是等訓練完才補救。

這也反映一個現實:模型越大,資料治理越重要。台灣很多軟體團隊在做 RAG、知識庫或企業內訓模型時,常常只看效果,不看來源。短期看起來快,長期很容易踩雷。

如果你在做 AI 產品,我會建議先問三件事:資料來源有沒有授權、是否保留證據、資料處理規則能不能寫進內控。這三件事看起來無聊,出事時卻最有用。

結論很簡單

Anthropic 這招是在測試法院底線。它想證明,合法買來的紙書,掃描後銷毀原件,再拿去訓練模型,能不能被放進合理使用的框架裡。

如果你在做 AI 產品,現在就該把資料來源和處理流程整理乾淨。別等訴訟來了,才開始補文件。這場爭議接下來會看法院怎麼畫線,也會看業界願不願意照著這條線做事。