iT邦幫忙

2026 iThome 鐵人賽

DAY 19
0
AI Security

我也希望安全第一——然後我們看看這些鎖是怎麼一個個被撬開的系列 第 19

第 19 篇|訓練資料的版權戰——fair use、盜版取得與逐字重現

  • 分享至 

  • xImage
  •  

訓練資料的版權戰——fair use、盜版取得與逐字重現

[[我也希望安全第一]]|第 19/30 天

「拿來訓練」不是一個單一動作

Anthropic 的版權案提供了一個很好的分界。法院認為以受版權文本訓練模型可以構成 fair use,但從 Library Genesis 等盜版來源取得書籍,仍可能違法。後者原本可能進入審判,最後以 15 億美元集體和解收尾。

所以「訓練是否合法」不能一次回答整條資料流程。作品怎麼取得、拿來做什麼、模型會不會吐回原文、產品是否取代原作市場,是幾個不同問題。

那項裁決也只是單一地方法院案件加和解,沒有經上訴形成普遍適用的拘束判例。本文不是法律意見;不同司法管轄、資料類型與產品行為,都可能得到不同結果。

四個關卡,證據也不同

取得 acquisition
   ↓ 來源、授權、付費牆、robots、契約
整理與訓練 transformation
   ↓ 去重、切分、用途、fair-use 分析
檢索與生成 retrieval/output
   ↓ RAG、prompt、逐字/近似重現
市場影響 distribution
   ↓ 替代訂閱、授權與流量,版權資訊是否保留

紐約時報案集中在 regurgitation 與證據開示。原告指控 OpenAI 其實有內部工具和對話資料可搜尋逐字重現,卻在訴訟中沒有完整提供;OpenAI 否認藏證據,並主張原告索取內容侵害使用者隱私。這是尚待法院處理的爭議,不應先替任何一方下結論。

Seattle Times 與 Newsday 的新訴狀又把問題拉得更完整:原告主張內容可能從付費牆後被抓取,用於訓練、微調或 RAG,輸出移除版權管理資訊並替代原站。這些同樣都是原告主張,尚非法院認定。

新書狀把「市場影響」寫得更具體

9 月 17 日公開的未遮蔽書狀,讓紐約時報案多了一批來自 OpenAI 與 Microsoft 內部的材料。原告引用 Microsoft 資料,主張 Copilot answer engine 帶往 NYT 網域的 click-through rate,最多比傳統 Bing 搜尋低 93%;內部簡報則擔心,內容網站失去流量和收入後,模型也會失去高品質的內容供應,最後形成一個 doom loop。

這正好落在上面第四個關卡。模型有沒有逐字重現不是唯一問題;即使回答經過摘要,如果產品讓使用者不必再回到原始網站,是否替代原作市場也會進入 fair-use 分析。

同一份書狀還主張兩家公司曾繞過付費牆、移除資料中的版權標示,並透過 Bing Index、Project Taxi 與 Project Mango 等管道交換或建立資料集。原告列出的數字包括:OpenAI 的 mid-training datasets 含 91,692 份三家媒體的作品,Project Mango 至少含 160,903 份不重複作品。

目前還不能把這些數字寫成法院認定。多數材料是原告書狀截取的內部引文,底層證物仍被封存,原始上下文不完整;OpenAI 與 Microsoft 也沒有在報導刊出前回應。它們的價值是讓工程問題變得更具體:資料 manifest 不只要記授權,還要保留付費牆狀態、版權標示是否被移除,以及產品是否把來源流量截斷的證據。

RAG 不會自動洗掉授權問題

工程團隊有時把 RAG 當成較安全的答案:資料不進模型權重,只在回答時即時檢索。從模型訓練角度確實不同,從內容權利角度卻仍要問來源是否允許抓取、索引、快取、摘要與顯示。

如果系統把付費文章整段送進 prompt,再向沒有訂閱的使用者逐字顯示,資料沒有進權重也不代表沒有問題。反過來,只因模型曾看過某篇文章,也不能直接推定每個相似句子都構成侵權;需要具體比對與法律分析。

對工程團隊而言,最有用的做法是保留能回答問題的 lineage。

Dataset manifest 不要只記一個網址

dataset_id: news-corpus-2026-09
snapshot_at: 2026-09-01
items:
  - source_id: publisher-article-8842
    canonical_url: https://publisher.example/article/8842
    acquired_via: licensed_feed
    acquired_at: 2026-08-14T03:12:00Z
    license_id: contract-2026-17
    permitted_uses: [index, retrieval, evaluation]
    prohibited_uses: [foundation_model_training]
    retention_until: 2027-08-14
    content_hash: sha256:...
    copyright_metadata_preserved: true
    removal_contact: rights@example.com

還需要把 manifest 接到 pipeline。permitted_uses 沒有 foundation_model_training,訓練 job 就應直接拒絕,不是寄一封提醒信;來源被撤回時,也要能用 source_id 找到 index、cache、fine-tuning set 與評估樣本。

輸出端則要另外做 regurgitation 測試:以長片段、稀有片語、不同 prompt 和 RAG 開關測量逐字重疊;記錄模型與資料 snapshot;高相似結果送人工檢查。單一 Bloom filter 或相似度門檻都可能誤判,不能直接當法律判決器。

國家競爭又把門檻往另一邊推

Trump 政府在紐約時報訴 OpenAI 案提交意見書,支持較寬的訓練 fair-use 解釋,理由之一是避免妨礙美國 AI 競爭力。政府意見書不是判決,卻讓資料治理承受另一種壓力:授權成本被視為產業速度與國家競爭問題。

對小團隊來說,這更不是放棄 lineage 的理由。大公司的訴訟可以打多年,小公司通常更需要在收到下架或稽核要求時,快速說清楚某份資料從哪裡來、允許怎麼用、出現在哪些產品。

下一篇會談另一種常被當成版權解法的技術:浮水印和 C2PA 可以幫忙證明內容來源,但它們不能證明一張沒有標記的圖一定是真,也不能替資料授權作決定。

本篇的鎖

  • 鎖是什麼:資料 lineage、license-aware pipeline、版權資訊保存與輸出 regurgitation 測試。
  • 想攔什麼:把盜版取得、未授權用途、逐字重現與市場替代全部藏在一句「拿來訓練」裡。
  • 破口在哪:fair use 依具體事實與司法管轄而變;RAG 仍可能重現內容,相似度工具也不能自行判定侵權。
  • 怎麼補:讓每份資料帶有來源、授權用途、hash、保留與移除資訊,並讓訓練、檢索和輸出測試都能沿 source_id 回溯。

參考與來源


上一篇
第 18 篇|誰為失控負責——開發者、部署者、使用者與模型供應商
系列文
我也希望安全第一——然後我們看看這些鎖是怎麼一個個被撬開的19
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言