
原話 (jason3e7):
在用 Claude 寫鐵人賽的過程, 一直要修正 AI 產出不通順、不自然的大量內容, 非常厭世, 所以催生了 Day 12 和 Day 13. 接下來也想分析整個鐵人賽到目前為止的文章, AI 明顯的痕跡有多少, 和對未來的推測.
展開來講:
問題是: 這 15 天全是我一個人的體感. 有沒有辦法拿數據看大家實際的樣子?
想法很直接: 掃這一屆鐵人賽已發布的所有公開文章, 用最粗的機械指標算一次「AI 味濃度」. 這篇講: 雙破折號 —— 密度.
—— — The Cleanest Fingerprint為什麼從 —— 開始:
—— (至少不會密集出現), 但 AI (Claude / GPT 未特別壓制時) 極愛用它做插敘、下定義、切節奏⭐ 這是共現訊號, 不是判決: 高密度不等於 AI 寫的, 低密度也不等於人寫的. 有些老派作者本來就愛用
——, 也有人用 AI 但已經把痕跡壓乾淨. 這個指標只用來排序, 不用來判定個案.
三步, 拆給看得懂 Python 就會做:
/2026ironman/signup/list?group=... → 每一組的全部系列, 系列數要對得上「報名數」/rss/series/{id} → 該系列的文章清單DAY N, 就讀文章頁的「共 N 篇」補抓, 差多少列在 raw/completeness.json
RSS 雖然附全文, 但濾掉部分標點: 同一篇文章對照, RSS 版本 — 常常是 0, 文章頁卻可能有數十. 拿 RSS 算會讓每篇密度都變 0. 所以 RSS 只用來列文章清單, 內文一律以文章頁為準.
密度 = 命中 `——` 次數 / 整篇文章總字數
三個定義先講死:
| 項目 | 定義 |
|---|---|
| 命中次數 | 整篇文章 (正文、標題、程式碼區塊都算) 裡 —— 出現幾次. 一個 —— (兩個 U+2014 相連) 算 1 次, 不是 2 次 |
| 總字數 | 整篇文章去掉空白後的字元數. 中文字、英數字、標點都各算 1 字. 標題、程式碼區塊都算, 跟命中次數用同一段範圍 |
| 呈現單位 | 同時列原始比值與 × 1,000 後的「每千字 X 次」 |
系列匯總用「加總再除」, 不用「平均各篇密度」:
系列密度 = 該系列所有文章命中次數加總 / 該系列所有文章總字數加總
平均各篇密度會讓 200 字命中 1 次的短文 (每千字 5 次) 跟 5,000 字的長文權重一樣, 把數字拉歪. 加總再除等於用字數當權重.
參考: The Last Fingerprint (2026) 用的是「每千英文字」. 中文沒有空格斷詞, 這裡改用「每千字元」, 兩者不能直接比, 只能在本 lab 內部互比.
禮貌參數: fetch 開頭寫死 SLEEP_SEC = 0.1、WORKERS = 7 (每請求 0.1 秒, 同時 7 條連線). 全部組別約 929 系列、1.5 萬篇, 跑完約 30 分鐘, 全程 0 失敗沒被 Cloudflare 擋. 初版設 1 秒 / 2 workers 保守, 實測可以更快. 抓的是公開頁面, 不動任何登入牆或付費內容.
抓取時間 2026-09-30. 掃出 814 個系列、15,057 篇文章.
| 項目 | 數值 |
|---|---|
| 系列 / 文章 | 814 / 15,057 |
有 —— 的文章 |
4,547 (30.2%) |
| 零命中 | 10,510 (69.8%) |
| 命中總次數 | 34,185 |
| 總字數 | 39,634,634 |
| 全體每千字 | 0.86 次 |
| 組別 | 每千字 | 命中 | 篇數 |
|---|---|---|---|
| Claude AI | 1.78 | 4654 | 990 |
| 佛心分享-IT 人自學之術 | 1.69 | 1708 | 469 |
| Kubernetes | 1.46 | 1913 | 384 |
| AI Engineering | 1.35 | 9339 | 2146 |
| JavaScript | 0.95 | 1094 | 438 |
| 佛心分享-IT 人職涯歷練 | 0.92 | 364 | 295 |
| AI 自動化 | 0.77 | 1347 | 843 |
| AI Security | 0.70 | 1456 | 666 |
| Modern Web | 0.68 | 1614 | 748 |
| Vibe Coding | 0.62 | 1300 | 900 |
| Software Development | 0.60 | 4141 | 2289 |
| Build on Google AI | 0.58 | 1478 | 1028 |
| 自我挑戰 | 0.57 | 1417 | 1459 |
| Security | 0.52 | 1060 | 889 |
| 佛心分享-SideProject30 | 0.51 | 383 | 291 |
| IT Operation | 0.41 | 742 | 612 |
| 佛心分享-IT 人技術創業 | 0.35 | 33 | 36 |
| ChatGPT & Codex | 0.11 | 142 | 574 |
ChatGPT & Codex 組全體最低, 0.11 每千字. 用 ChatGPT 或 Codex 寫的作者, 密度不到全體 0.86 的八分之一. Claude AI 組 1.78 是它的十六倍.
怎麼解釋? OpenAI 2025-11 讓 GPT-5.1 開始能遵守 custom instruction 的「不要用 em-dash」, 用該工具寫的作者天然沒訊號. Claude 跟 Gemini 目前壓不掉, Claude AI 組還是最高. 當初挑 —— 是圖它最粗最好算, 現在看下來, 這個指紋對 GPT 生態已經在失效. 是這次掃描最有價值的意外收穫.
| # | 原始比值 | 每千字 | 命中 | 字數 | 文章 | 系列 | 組別 |
|---|---|---|---|---|---|---|---|
| 1 | 0.017510 | 17.51 | 27 | 1542 | Day01用 Claude 從零打造一個軟體產品:30 天你也做得到 | 零基礎也能當產品長:30 天用 Claude 身兼數職,從零打造軟體產品 | Claude AI |
| 2 | 0.014291 | 14.29 | 42 | 2939 | Day 12|第 6 章:流程再造(下) | 白稜 | 佛心分享-IT 人自學之術 |
| 3 | 0.013489 | 13.49 | 15 | 1112 | Day25:另一套 mpv 懶人包:dyphire/mpv-config 介紹 | 一天一招,快速上手 mpv-lazy | 自我挑戰 |
—— (兩個連在一起的 em dash). 不算單一 —, 不算 --, 不算 - -
—— 當第一發沒錯, 用「中文不用、AI 極愛」的落差最乾淨, 純字元計數最好複製