iT邦幫忙

2026 iThome 鐵人賽

DAY 13
0

https://ithelp.ithome.com.tw/upload/images/20260927/20078298H7jQYLuvTD.png

為什麼講這個 — Why This Matters

前兩天在磨驗證的工具: Day 11 給了六招驗算法, Day 12 給心智清單降低驗證成本. 但驗證這件事有另一個環節你動不了 — 人的狀況.

想想這些場景:

  • 醫師知道 AI 可能錯, 還是照單全收
  • 工程師用 GitHub Copilot 半年後, 接受它建議的比例爬高了 (不是因為建議變好)
  • 用 LLM 寫作的人, 事後回想不出自己剛寫的東西

這些不是猜測, 是 2024-2025 累積的實證. 這篇把兩個時間尺度都攤開, 也給有靠山的破法.


兩種鈍法, 同一個機制 — Two Kinds, One Mechanism

用 AI 用久了, 驗證會鈍, 分兩層講:

  • 急性: rubber-stamping (蓋章化, 白話 = 看都不看就過, 像蓋章一樣機械). 單次連續使用就出現
  • 慢性: cognitive offloading (認知外包, 白話 = 長期把思考丟給 AI 做, 自己的獨立思考能力測得到下降)

兩者不是兩件事, 是同一個機制在不同時間尺度上的顯現. Microsoft 2025 那份 survey 給了因果橋樑: 越信任 AI, 就越少實際去動腦; 每一次蓋章 = 訓練自己下次更快蓋 = 累積成長期的認知外包.


急性證據 — Acute Rubber-Stamping Evidence

三份 2024-2025 的研究都指同一件事: 你以為在驗, 其實在點頭.

醫療 RCT NCT07328815: ensemble 警示 +7.6pp

醫師知道 AI 會錯, 還是照單全收. 這是最硬的證據.

研究代號: NCT07328815 (2025). RCT = 隨機對照試驗, 兩組隨機分配, 一組拿介入一組拿對照, 是醫學實證裡最硬的證據等級之一.

設計: 72 名 AI-trained 醫師評估 6 個臨床案例, 其中 3 個是蓄意錯的, 配 ChatGPT-5.1 建議. 介入組多兩個提醒: (1) ChatGPT 平均準確度 (讓你知道它不是萬能), (2) 三個 LLM (Claude / Gemini / GPT-4o) 意見不合時的紅綠燈警示.

結果: 介入組 82.8% vs 對照組 75.6%, 差 +7.6pp (P=0.016, 意思是這個差異不是巧合).

意義: 沒警示的組別明明知道 AI 可能錯, 還是照單全收. 因為連續讀 AI 給的合理答案已經把批判性打疲了. 這是 rubber-stamping 的 RCT 級證據.

Radiology 2023 乳房攝影: AI 錯時醫師錯 4.89x

沒 XAI 的情境 (XAI = explainable AI, 會告訴你「為什麼這樣答」的 AI) — 醫師在 36.1% 被操弄的案例發生 automation bias (白話說 = AI 說什麼就信什麼). AI 錯的時候, 醫師跟著錯的機率是基準的 4.89 倍.

新手更慘: 從 79.7% 正確率掉到 19.8%, 只因 AI 給了誤導答案.

有 XAI 的時候, bias 從 36.1% 降到 17.8% — 有幫助但沒消失.

GitHub Copilot 接受率半年 28.9% → 34%

Copilot 建議的接受率從第一個月 28.9% 爬到第六個月 34%. 接受率隨使用時間爬升.

這個曲線跟航空業對 automation complacency (自動化自滿, 白話 = 用習慣自動化後的鬆懈) 累積半世紀的事故資料幾乎一樣. 你越熟 Copilot, 越傾向直接吞掉它給的補完.


慢性證據 — Chronic Cognitive Offloading Evidence

三份 2025 研究從腦神經、行為、理論框架三個角度都指同一方向.

MIT EEG: 神經連結 -55%, 認知債

Kosmyna et al., 2025. EEG = 腦波檢測, 用貼在頭皮上的電極測腦電活動.

54 位受試者分三組 (LLM / 傳統搜尋 / 純腦子) 寫議論文, 全程戴 EEG. 結果:

  • LLM 組 EEG 神經連結度下降 55%, 涵蓋記憶、注意、執行網路
  • LLM 組對自己剛寫的文字沒感覺, 事後回想不出來
  • 效應持續: 之後單獨寫 (無 AI), LLM 組表現仍然差

論文自己創了個詞叫 "cognitive debt" (認知債): 用 AI 省下的思考, 累積成一筆日後要還的認知額度. 概念跟技術債一樣, 只是這次是你自己的腦子.

Microsoft/CMU: 越信 AI 越少動腦

Lee et al., CHI 2025. 319 名知識工作者, 936 次真實 GenAI 使用的調查:

  • 對 AI 信心越高, 使用者實際去做的 critical thinking (批判性思考) 越少
  • 對自己信心越高, critical thinking 越多
  • 工作者的認知任務從生產 (自己想) 轉成驗證/編輯. 這不是記憶外包 (計算機那種只是幫你記數字), 而是推理這個動作本身被外包出去

這份 survey 提供了「急性 → 慢性」的因果橋樑: 每次蓋章都在訓練「不動腦」變成默認.

Cleverly: 集體判斷會被 AI 偏見複製

Cleverly 2025 不是實證研究, 是提出 cognitive inheritance (認知繼承) 框架 — AI 的偏誤如何透過長期依賴被放大、複製到集體判斷. 值得看的是問題定型, 不是數據.


五招破法 — Evidence-Based Interventions

不是喊「多動腦」就行. 下面 5 招各有 2024-2025 的實驗數據或半世紀航空業經驗做靠山.

招式 白話說 相關研究背景
多 AI 對照 (ensemble) 用 2-3 個 model 跑同題, 意見不合就升紅旗 NCT07328815 RCT (+7.6pp 準確度)
讓 AI 說原因 (XAI) 讓 AI 顯示「為什麼這樣答」而不是只給結論 Radiology 2023 (bias 從 36.1% → 17.8%)
自己先寫再問 (pre-commit) 打開 AI 前, 先寫下自己的假設或答案, 再問 AI, 再對比 Generation effect (自己想的比較記得住) + Kosmyna 建議
純腦子日 (brain-only) 固定比例 (例如每 3-4 個任務) 完全不用 AI, 純腦子完成 Kosmyna「認知債」建議, 防長期累積
對抗性自測 定期餵 AI 已知錯的 output / 案例, 練自己抓錯 航空業慣例 (weekly failure drill), 醫療 RCT 已在試

共通模式: 都是主動把「自己動腦的機會」種回工作流裡. AI 太好用, 不會有機會自動出現.


我的重點 — Takeaways

  • 前兩天教你怎麼驗, 這篇是你自己會鈍, 得防這一環. 工具再利, 人鈍了也沒用
  • 兩種鈍是同一機制在不同時間尺度: 急性蓋章 → 訓練慢性外包 → 判斷力測得到下降
  • 五招破法都有實證靠山, 不是喊多動腦. 挑一招今天就開始

Sources

急性: 驗證疲勞

慢性: 判斷力生鏽


上一篇
[Day 12] 為了方便人類驗證而生的兩個 skill
下一篇
[Day 14] AI 抹平的是中產, 頂層反而變貴
系列文
AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像 共 17 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言