iT邦幫忙

2026 iThome 鐵人賽

DAY 19
0
Claude AI

AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像系列 第 19 篇

[Day 19] 這段字是 AI 寫的嗎? 浮水印怎麼運作、為什麼不能當證據

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20261003/20078298PIFDZFGOIs.png

為什麼講這個 — Why This Matters

Day 16 到 Day 18 做的是自己疊的粗偵測 (共現訊號 — ——、emoji、粗體、…). 這些訊號有價值 (排序用), 但明顯有盲區 (單一指紋被 upstream 壓就失效, 翻面問題「純手寫」更難回答).

那官方正式做的呢? 2026-08-02 起, Claude 的產出開始埋看不見的標記: 文字是嵌入式浮水印 (複製貼上會跟著跑), 檔案是 C2PA 簽章 metadata. OpenAI 的影像從 2026-05 也全面加 SynthID + C2PA. 這些不是我自己疊的指標, 是模型廠商官方 ship 的技術.

然後呢? 這篇講三件事:

  1. Claude 跟 OpenAI 現在怎麼標 (文字 + 檔案兩條路)
  2. 為什麼查到跟沒查到都不能當判決 — 包括一個驚人數字: 單次 paraphrase 就能移除 98% 浮水印訊號
  3. 誰在推這件事 — 不是廠商自願, 是監管 (EU AI Act Article 50) 逼的

結論跟 Day 16-18 一樣: 是線索, 不是鐵證. 但這個結論對官方浮水印更重要, 因為它天生帶權威光環, 讓人以為「官方的驗證結果就是真相」. 不是.


Claude 怎麼標記 — How Claude Marks Content

Anthropic 用兩種互補技術 (2026-08-02 起):

對象 技術 特性
文字 嵌入式浮水印 — 把難以察覺的標記織進文字本身 不影響品質與可讀性; 複製貼上會跟著跑
檔案 (.png / .jpg / .svg…) 簽章 metadata, 遵循 C2PA 開放標準 (內容來源與真實性聯盟) 記錄內容來源; 但 metadata 可能被平台剝除

適用範圍: 2026-08-02 之後推出的新模型從第一天就支援, 涵蓋 API / Claude 網頁版 / Claude Code / Claude Cowork / 各雲端夥伴. 全球適用.

怎麼查:

  • 檔案 C2PA: Anthropic 的 claude.com/check-content 免費檢查器, 拖曳 .png / .jpg / .svg 進去檢視 manifest
  • 文字浮水印: 偵測 API 目前是 private preview, 只開放給監管機關、執法、媒體、fact-checker、研究者、公民團體等合格對象. 一般使用者還沒得用

文字浮水印的三條技術路線

(Wisely Chen 的拆解 整理, 外部推測, 非官方細節):

  1. 零寬度/特殊空白字元: 字間插入人眼看不到的字元, 例如 U+00A0 (不換行空白)、U+2009 (窄空白)
  2. 同形字替換: 換成長得一樣但 Unicode 碼位不同的字, 例如拉丁 a ↔ 西里爾 а — 跟釣魚網址 pаypal.com 騙人同一手法
  3. 統計指紋: 微調用詞的機率分布形成可偵測的模式, 例如刻意偏好「所以」而不是「因此」

前兩種是字元層級 (工具檢查 Unicode 碼位揪得出來), 第三種是統計層級 (要大量文本 + 演算法才驗得出). 改寫會讓浮水印消失 — 下一節是重點.


兩個都不能當證據 — Neither Direction Is Proof

這是全篇最重要的一段, Anthropic 官方自己也特別強調:

⚠️ 查到標記 ≠ 這是 AI 寫的: 只代表內容「可能經 Claude 處理過」 — 可能只是拿去校對、翻譯、改格式, 原作者仍是人.

⚠️ 沒查到標記 ≠ 這是人寫的: 可能是舊模型產出、被大幅編輯過、文字太短、metadata 被平台剝除, 或用了不支援標記的工具.

「沒查到」有多脆弱: 98% paraphrase 移除

2026 一份研究 (arXiv:2508.20228) 在 Google SynthID-Text 上實測:

  • 單次 paraphrase 就能移除約 98% 的浮水印訊號
  • back-translation (英→中→英) 跟 copy-paste 進其他 AI 潤稿也會嚴重弱化

換句話說, 只要作者「用 AI 寫完再用另一個 AI 改寫一次」就能大幅逃過偵測. 這不是 SynthID 特有的缺陷, 統計指紋類的浮水印都受這種攻擊影響. Anthropic 的技術細節未公開, 但一般假設面對 paraphrase 攻擊也不會樂觀太多.

所以浮水印是線索, 不是判決. 拿「沒查到」當「這是人寫的」會冤枉人, 拿「查到」當「這是 AI 代寫」也會冤枉人.


誰在推這件事 — Why Everyone Moved in 2026

不是廠商自願, 是監管逼的.

驅動來源: EU AI Act Article 50 於 2026-08-02 生效 (歐盟官方公告). 這條要求:

  1. AI 生成或大幅改動的內容要有機器可讀的標記
  2. Deepfake 要明顯揭露
  3. 與 AI 系統互動要告知使用者 (chatbot 揭露)

所以 2026 一堆廠商同步動起來:

  • Anthropic 從 2026-08-02 開始標記 (文字 + 檔案)
  • OpenAI 的立場轉變 — 文字至今沒上線 (調查顯示 30% 用戶表示「加浮水印就不用 ChatGPT 了」), 但影像 2026-05 轉向, 全面加 SynthID + C2PA
  • Google SynthID 快速擴張
  • TikTok 升格 C2PA Steering Committee (宣稱已標超過 30 億支影片)
  • 中國 2025-09-01 上路類似的《AI 生成合成內容標識辦法》, 2026 初開始執法

張力: 溯源透明 vs 使用者接受度. 在影像領域監管壓力較大 (deepfake 政治風險高)、使用者反彈相對小, 文字則相反. 未來看到 AI 廠商加浮水印, 先問「是不是被監管逼的」, 答案通常是「對」.


我的重點 — Takeaways

  • 浮水印是線索, 不是判決. 查到不等於 AI 寫, 沒查到不等於人寫
  • 「沒查到」特別脆弱: 單次 paraphrase 移除 98% 訊號 (SynthID 實測, Claude 細節未公開但假設差不多)
  • 跟 Day 16-Day 18 的共現訊號 (——、emoji、粗體、…) 本質一樣: 都是證據, 都不是鐵證. 把兩者疊起來也不會變鐵證, 只會提高「可能性」
  • 廠商 2026 動起來不是良心發現, 是 EU AI Act Article 50 (2026-08-02 生效) 逼的. 中國 2025-09 類似規範也上路
  • 實務建議: 看到別人拿「AI 偵測結果」當判決指控人, 把這篇數據丟給他

Sources


上一篇
[Day 18] 翻面問題: 哪些文章是純手寫, 完全沒碰 AI 的?
下一篇
[Day 20] AI 文化入侵
系列文
AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像 共 20 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言