iT邦幫忙

2026 iThome 鐵人賽

DAY 16
0
Claude AI

AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像系列 第 16 篇

[Day 16] 掃當屆所有文章, 量一次「AI 味」有多少

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20260930/20078298C3Lb6YiOTM.png

為什麼講這個 — Why This Matters

原話 (jason3e7):

在用 Claude 寫鐵人賽的過程, 一直要修正 AI 產出不通順、不自然的大量內容, 非常厭世, 所以催生了 Day 12 和 Day 13. 接下來也想分析整個鐵人賽到目前為止的文章, AI 明顯的痕跡有多少, 和對未來的推測.

展開來講:

  • Day 12 心智清單 skill: 為了讓自己 (人類) 一眼看完 AI 寫的長段落而催生的兩個 skill
  • Day 13 驗證疲勞: 每篇都要驗真的太累, 動筆時已經半崩潰

問題是: 這 15 天全是我一個人的體感. 有沒有辦法拿數據看大家實際的樣子?

想法很直接: 掃這一屆鐵人賽已發布的所有公開文章, 用最粗的機械指標算一次「AI 味濃度」. 這篇講: 雙破折號 —— 密度.


挑最強指紋: 雙破折號 —— — The Cleanest Fingerprint

為什麼從 —— 開始:

  • 中文寫作幾乎不用 —— (至少不會密集出現), 但 AI (Claude / GPT 未特別壓制時) 極愛用它做插敘、下定義、切節奏
  • 純字元計數, 不用 NLP model, 最容易驗證跟複製
  • 從最容易的訊號開始, 拿到 pipeline 骨架再堆更複雜的 signal

⭐ 這是共現訊號, 不是判決: 高密度不等於 AI 寫的, 低密度也不等於人寫的. 有些老派作者本來就愛用 ——, 也有人用 AI 但已經把痕跡壓乾淨. 這個指標只用來排序, 不用來判定個案.


方法: 抓、算、排 — Fetch, Count, Rank

三步, 拆給看得懂 Python 就會做:

1. 列名單: signup/list + RSS

  • 官方 /2026ironman/signup/list?group=... → 每一組的全部系列, 系列數要對得上「報名數」
  • 每個系列的 RSS /rss/series/{id} → 該系列的文章清單
  • 對帳: RSS 篇數對不上報名頁的進度 DAY N, 就讀文章頁的「共 N 篇」補抓, 差多少列在 raw/completeness.json

2. 抓內文: 一律走文章頁

RSS 雖然附全文, 但濾掉部分標點: 同一篇文章對照, RSS 版本 — 常常是 0, 文章頁卻可能有數十. 拿 RSS 算會讓每篇密度都變 0. 所以 RSS 只用來列文章清單, 內文一律以文章頁為準.

3. 算密度: 命中 / 字數

密度 = 命中 `——` 次數 / 整篇文章總字數

三個定義先講死:

項目 定義
命中次數 整篇文章 (正文、標題、程式碼區塊都算) 裡 —— 出現幾次. 一個 —— (兩個 U+2014 相連) 算 1 次, 不是 2 次
總字數 整篇文章去掉空白後的字元數. 中文字、英數字、標點都各算 1 字. 標題、程式碼區塊都算, 跟命中次數用同一段範圍
呈現單位 同時列原始比值與 × 1,000 後的「每千字 X 次」

系列匯總用「加總再除」, 不用「平均各篇密度」:

系列密度 = 該系列所有文章命中次數加總 / 該系列所有文章總字數加總

平均各篇密度會讓 200 字命中 1 次的短文 (每千字 5 次) 跟 5,000 字的長文權重一樣, 把數字拉歪. 加總再除等於用字數當權重.

參考: The Last Fingerprint (2026) 用的是「每千英文字」. 中文沒有空格斷詞, 這裡改用「每千字元」, 兩者不能直接比, 只能在本 lab 內部互比.

禮貌參數: fetch 開頭寫死 SLEEP_SEC = 0.1、WORKERS = 7 (每請求 0.1 秒, 同時 7 條連線). 全部組別約 929 系列、1.5 萬篇, 跑完約 30 分鐘, 全程 0 失敗沒被 Cloudflare 擋. 初版設 1 秒 / 2 workers 保守, 實測可以更快. 抓的是公開頁面, 不動任何登入牆或付費內容.


結果: 密度分佈與排行 — What We Found

抓取時間 2026-09-30. 掃出 814 個系列、15,057 篇文章.

整體數字

項目 數值
系列 / 文章 814 / 15,057
有 —— 的文章 4,547 (30.2%)
零命中 10,510 (69.8%)
命中總次數 34,185
總字數 39,634,634
全體每千字 0.86 次

各組排行 (加總再除)

組別 每千字 命中 篇數
Claude AI 1.78 4654 990
佛心分享-IT 人自學之術 1.69 1708 469
Kubernetes 1.46 1913 384
AI Engineering 1.35 9339 2146
JavaScript 0.95 1094 438
佛心分享-IT 人職涯歷練 0.92 364 295
AI 自動化 0.77 1347 843
AI Security 0.70 1456 666
Modern Web 0.68 1614 748
Vibe Coding 0.62 1300 900
Software Development 0.60 4141 2289
Build on Google AI 0.58 1478 1028
自我挑戰 0.57 1417 1459
Security 0.52 1060 889
佛心分享-SideProject30 0.51 383 291
IT Operation 0.41 742 612
佛心分享-IT 人技術創業 0.35 33 36
ChatGPT & Codex 0.11 142 574

ChatGPT & Codex 組全體最低, 0.11 每千字. 用 ChatGPT 或 Codex 寫的作者, 密度不到全體 0.86 的八分之一. Claude AI 組 1.78 是它的十六倍.

怎麼解釋? OpenAI 2025-11 讓 GPT-5.1 開始能遵守 custom instruction 的「不要用 em-dash」, 用該工具寫的作者天然沒訊號. Claude 跟 Gemini 目前壓不掉, Claude AI 組還是最高. 當初挑 —— 是圖它最粗最好算, 現在看下來, 這個指紋對 GPT 生態已經在失效. 是這次掃描最有價值的意外收穫.


原始比值最高的前 3 篇(不設字數門檻)

# 原始比值 每千字 命中 字數 文章 系列 組別
1 0.017510 17.51 27 1542 Day01用 Claude 從零打造一個軟體產品:30 天你也做得到 零基礎也能當產品長:30 天用 Claude 身兼數職,從零打造軟體產品 Claude AI
2 0.014291 14.29 42 2939 Day 12|第 6 章:流程再造(下) 白稜 佛心分享-IT 人自學之術
3 0.013489 13.49 15 1112 Day25:另一套 mpv 懶人包:dyphire/mpv-config 介紹 一天一招,快速上手 mpv-lazy 自我挑戰

邊界與限制 — Caveats

  • 只算 —— (兩個連在一起的 em dash). 不算單一 —, 不算 --, 不算 - -
  • 算整篇: 正文、標題、程式碼區塊都納入, 命中次數與總字數用同一段範圍
  • 排行榜不設字數門檻, 短文密度會比較跳, 看排行時一併看字數欄
  • 抓的時間點會影響結果, 每次跑數字都不一樣
  • 不是 AI 判定, 只是排序訊號. 不 doxx、不點名, 排行榜只給連結不加評論

我的重點 — Takeaways

  • 選 —— 當第一發沒錯, 用「中文不用、AI 極愛」的落差最乾淨, 純字元計數最好複製
  • 最意外的一件事: ChatGPT & Codex 組全體最低 (0.11), 對照 2025-11 GPT-5.1 起可壓 em-dash 的變化, 這個指紋對 GPT 生態已經在失效. 訊號選集要考慮不同模型的實際輸出, 這行為還會隨版本變
  • 七成文章零命中, 這件事本身也是強觀察. 大多數作者根本不用這個符號

Sources


上一篇
[Day 15] 用 AI 拓展自己: 5 個手段主動破舒適圈
下一篇
[Day 17] 從 1 個訊號擴到 6 個, 綜合分數再測「AI 味」
系列文
AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像 共 17 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言