iT邦幫忙

2026 iThome 鐵人賽

DAY 3
0
Claude AI

AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像系列 第 3

[Day 03] 它做不到的事分三類,最危險的那類你看不見

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20260917/20078298xlXFEOaMYa.png

三種極限,要分開看 — Three Kinds of Limits

Day 01 講它在做什麼,Day 02 講它為什麼變強。今天講反面:它做不到什麼。

但「做不到」不是一件事,是三件性質完全不同的事。分不清楚,你的判斷就會一直錯邊。


結構性的:原理決定的天花板 — Structural Limits

這幾件事,是「猜下一個字」這個原理直接推出來的。模型變大不會讓它們消失。

它不會自己發現自己錯了

ICLR 2024 的《Large Language Models Cannot Self-Correct Reasoning Yet》測了一件很單純的事:不給任何外部回饋,只叫模型自己再檢查一遍答案。結果是 - 不但沒變好,有時候還變差。

原因不難理解:「檢查」跟「作答」用的是同一套機率分布。它第一次覺得對的東西,第二次還是會覺得對。

自己試:

  1. 叫它寫一個處理邊界情況的函式。
  2. 問「這段有沒有 bug?再檢查一次」 - 它多半回你「看起來沒問題」。
  3. 改成把 pytest 的失敗訊息貼回去 - 它立刻就改對了。

差別不在它有沒有再看一次,而在你有沒有給它一個外部的檢查結果。

驗證必須來自外部 - 測試、編譯器、另一個獨立的模型,或者你自己。叫它「再檢查一次」,多數時候只是讓它把同一個錯誤講得更有信心。

學過的東西,反過來問就不會

《The Reversal Curse》(Berglund et al., NeurIPS 2023)發現:模型學過「A 是 B」,不會自動學會「B 是 A」。研究者拿 1000 位名人測 GPT-4 - 問「湯姆克魯斯的媽媽是誰」答得出來;反過來問「Mary Lee Pfeiffer 的兒子是誰」就答不出來。而且不是「一時想不起來」那種答不出來 - 它給「湯姆克魯斯」這個答案的機率,跟隨便講一個名字一樣低。

自己試: 挑一組不太有名的事實(越冷門越明顯):

問法 結果
「《某本冷門書》的作者是誰?」 答得出來
「(那位作者)寫過哪些書?」 常常漏掉那一本

實務上更常遇到的版本:你剛請它把「開啟 A 設定會導致 B 錯誤」寫進文件;過一陣子問「B 錯誤是什麼造成的」,它未必接得回 A。

對人來說這是同一件事,對模型不是。它學的是「這個字後面接哪個字」,方向是單向的。

我測到的(2026-09-17,工具全部關掉): 問「Mary Lee Pfeiffer 的兒子是誰?」正解是湯姆克魯斯。

Sonnet 5 第一次的回答:

Mary Lee Pfeiffer is a fictional character in the Iron Man comics - she's the mother of Tony Stark.

https://ithelp.ithome.com.tw/upload/images/20260917/20078298oeuX8cGexw.jpg

同一題再問一次,它給了另一個答案:

Mary Lee Pfeiffer is the mother of actor Robert Downey Jr.

https://ithelp.ithome.com.tw/upload/images/20260917/200782987qfRstrTRU.jpg

→ 心法:換個方向問同一件事,是最便宜的驗證手段之一。

它不會從你的對話裡學會

權重是凍結的。你這次糾正它,換一個新對話它照樣犯同樣的錯。它看起來記得,只是因為東西還留在當下的脈絡裡。

自己試: 這次對話跟它說「不要用表情符號」,它照做。關掉、開一個新對話再問同樣的問題 - 表情符號就回來了。

我自己踩到的版本比這嚴重得多。 在測試 HTB 靶機時跑 Claude Code,我開頭就交代「不要對 SSH 做遠端暴力破解」。前面幾輪它守得好好的;跑了一段時間之後,它還是開始暴力破解 SSH。

那次是同一個 session,所以嚴格說不是「換新對話就忘了」。但教訓是同一個:在對話裡講過的話,不會自動變成持久的約束。隨著脈絡越拉越長,早期講過的限制會被稀釋掉 - 它不是違抗你,是那句話已經不在它的注意力裡了。

→ 這就是為什麼需要 CLAUDE.md、memory、RAG - 不是為了讓它變聰明,是因為它不會學。

精確計算不是它的工作

《Faith and Fate: Limits of Transformers on Compositionality》(Dziri et al., NeurIPS 2023)把多位數乘法拆開來看,發現模型不是在執行演算法,而是在做子圖比對 - 把看過的模式拼起來。所以位數一多就崩。

自己試:

問法 結果
「4823 × 7591 等於多少?」 常錯,位數再加長幾乎必錯
「寫一段 Python 算 4823 × 7591 並執行」

我測到的(2026-09-17,工具全部關掉): 同一題 17^13,正解 9,904,578,032,905,937

模型 回答
Sonnet 5 9,904,578,032,905,937
Haiku 4.5 9,904,578,206,305,937 ❌ 差了 1 億 7 千萬

https://ithelp.ithome.com.tw/upload/images/20260917/20078298ZSrkmCWqnw.jpg

→ 心法:能交給程式算的,就別讓它心算。叫它「寫一段程式算給我看」,比叫它直接報答案可靠得多。


暫時的:會被下一代抹平 — Temporary Limits

這一類別當成永久的判斷,不然你會一直低估它。

一、上下文「用不好」,不是「放不下」。
Liu et al. 2023 的《Lost in the Middle》發現:脈絡塞得越滿,模型越偏好開頭和結尾,中間的東西會掉。Chroma 在 2025 年的《Context Rot》測了 18 個前沿模型,每一個都隨輸入變長而退步。

但要分清楚:這是「利用率」的問題,不是「容量」的問題。窗口越開越大,利用率也一直在改善。

自己試: 把同一份長文件貼三次,把你要問的那一行分別放在開頭 / 正中間 / 結尾,問同一個問題。中間那一次的失敗率明顯最高。

→ 心法:位置有價。最重要的資訊放頭尾,別指望它在幾十萬 token 的正中間撈到那一行。

二、複雜度一過線就崩。
Apple 在 2025 年的《The Illusion of Thinking》測了 o1、o3-mini、Claude 3.7 Sonnet Thinking、DeepSeek-R1,找到三個區間:簡單任務上,不思考的模型反而贏;中等複雜度,會推理的模型佔優;高複雜度,兩種都掉到接近零。他們還觀察到「過度思考」 - 模型找到正確答案後不停下來,繼續生出錯的路徑。

不過這篇被打了回馬槍。《The Illusion of the Illusion of Thinking》指出部分崩潰其實是題目設計與輸出長度上限造成的,不是推理本身的極限。後續複現的結論折衷:批評的細節有問題,但核心站得住 - 它的「思考」只在中間區段有效,而且不太會類推。

自己試: 拿河內塔(Tower of Hanoi)當尺。3 層、5 層它處理得很漂亮;層數一路往上加,到某個點會突然整個崩掉 - 而且它不會事先警告你「這題我不行」。

我測到的(Haiku 4.5,2026-09-17,工具全部關掉): N=9 這題,它先輸出了一段根本沒有執行過的工具呼叫 -

<function_calls>[{"tool_name": "bash", "args": {"command":
"python3 << 'EOF' ... hanoi(9, 'A', 'C', 'B') ... EOF"}}]</function_calls>

https://ithelp.ithome.com.tw/upload/images/20260917/20078298A6ulHLwLwi.jpg

工具是關的,回傳的 web_search_requests 是 0,那段程式從來沒跑過。接著它給了 511 步 - 步數完全正確(2⁹−1)。但把這 511 步餵給驗證腳本逐步搬一遍:

檢查 結果
步數 511,完全正確
違規步數 124 步(24%
它其實在解哪一題 441 步吻合「搬到 B」的解法 - 題目要的是 C
最終盤面 什麼都沒完成

而且它幻覺的那段程式寫的目標是 C,實際輸出卻從 A→B 開始 - 連它自己編的程式碼,都跟它自己編的執行結果對不上。

唯一通得過粗略檢查的那一項(步數),正好是最容易編對的那一項。它把最好驗的地方做對,把最難驗的地方做錯。

→ 心法:與其挑邊站,不如自己測一次。不要因為一篇論文說「AI 不會推理」就放棄,也不要因為它某次表現驚人就以為沒有天花板 - 唯一可信的,是你自己在你自己的任務上實測出來的邊界。


鋸齒狀的:最危險的那一種 — The Jagged Frontier

前面兩類至少你知道邊界大概在哪。這一類的麻煩是:邊界不規則,而且看不見。

Harvard 與 BCG 在 2023 年做了一個 758 人的實驗(Dell'Acqua et al.,約占 BCG 顧問的 7%),提出了「鋸齒狀前沿(jagged frontier)」這個詞:AI 的能力邊界不是一條平滑的線,而是鋸齒狀的 - 兩個在你看來難度差不多的任務,一個它做得漂亮,另一個它做得離譜。

數字很有說服力:

位置 結果
邊界之內的 18 個顧問任務 用 GPT-4 的人多完成 12.2% 的任務、快 25.1%、品質高 40% 以上
邊界之外(AI 會錯但看起來合理) 新手掉了 19 個百分點(照單全收);能識破瑕疵的專家反而勝出

最危險的地方在於:它不會告訴你現在踩在鋸齒的哪一邊。語氣一樣自信、格式一樣漂亮、讀起來一樣合理。

真正的風險不是「它做不到」,而是「它做不到,但看起來做到了」。

這一條撐起了後面兩整段的內容:因為邊界看不見,所以要養成驗證習慣;因為新手掉最多,所以用 AI 的人自己有多專業,決定了他能拿到多少收益。


整理 — Recap

極限 類型 長什麼樣 你該做的
不會自己發現自己錯 結構性 「再檢查一次」→ 同一個錯講得更有信心 驗證一定要來自外部
反過來問就不會 結構性 答得出作者,答不出他寫過哪些書 換方向問,當成廉價的驗證
不會從對話中學會 結構性 新對話又用回你禁止過的寫法 CLAUDE.md、memory、RAG 補
精確計算不可靠 結構性 4823 × 7591 直接算會錯 叫它寫程式算,別叫它心算
上下文中段會掉 暫時 同一行放中間就撈不到 重要的放頭尾
複雜度過線就崩 暫時 河內塔加到某層數突然全錯 把任務拆小,並自己實測邊界
鋸齒狀前沿 看不見 兩題難度相仿,一題完美一題離譜 預設它隨時可能站在錯的那一邊

Day 01 說它是一台機率機器,Day 02 說這台機器跨過了實用門檻。今天要記住的是:

那道門檻是鋸齒狀的。你不會知道自己什麼時候正好踩在缺口上 - 除非你養成了驗證的習慣。


Sources


上一篇
[Day 02] 不是它突然變強,是它跨過了你的門檻
下一篇
[Day 04] 你其實只用了 AI 的兩種能力:一張全景圖看完它會什麼
系列文
AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像8
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言