
Day 01 講它在做什麼,Day 02 講它為什麼變強。今天講反面:它做不到什麼。
但「做不到」不是一件事,是三件性質完全不同的事。分不清楚,你的判斷就會一直錯邊。
這幾件事,是「猜下一個字」這個原理直接推出來的。模型變大不會讓它們消失。
ICLR 2024 的《Large Language Models Cannot Self-Correct Reasoning Yet》測了一件很單純的事:不給任何外部回饋,只叫模型自己再檢查一遍答案。結果是 - 不但沒變好,有時候還變差。
原因不難理解:「檢查」跟「作答」用的是同一套機率分布。它第一次覺得對的東西,第二次還是會覺得對。
自己試:
pytest 的失敗訊息貼回去 - 它立刻就改對了。差別不在它有沒有再看一次,而在你有沒有給它一個外部的檢查結果。
驗證必須來自外部 - 測試、編譯器、另一個獨立的模型,或者你自己。叫它「再檢查一次」,多數時候只是讓它把同一個錯誤講得更有信心。
《The Reversal Curse》(Berglund et al., NeurIPS 2023)發現:模型學過「A 是 B」,不會自動學會「B 是 A」。研究者拿 1000 位名人測 GPT-4 - 問「湯姆克魯斯的媽媽是誰」答得出來;反過來問「Mary Lee Pfeiffer 的兒子是誰」就答不出來。而且不是「一時想不起來」那種答不出來 - 它給「湯姆克魯斯」這個答案的機率,跟隨便講一個名字一樣低。
自己試: 挑一組不太有名的事實(越冷門越明顯):
| 問法 | 結果 |
|---|---|
| 「《某本冷門書》的作者是誰?」 | 答得出來 |
| 「(那位作者)寫過哪些書?」 | 常常漏掉那一本 |
實務上更常遇到的版本:你剛請它把「開啟 A 設定會導致 B 錯誤」寫進文件;過一陣子問「B 錯誤是什麼造成的」,它未必接得回 A。
對人來說這是同一件事,對模型不是。它學的是「這個字後面接哪個字」,方向是單向的。
我測到的(2026-09-17,工具全部關掉): 問「Mary Lee Pfeiffer 的兒子是誰?」正解是湯姆克魯斯。
Sonnet 5 第一次的回答:
Mary Lee Pfeiffer is a fictional character in the Iron Man comics - she's the mother of Tony Stark.

同一題再問一次,它給了另一個答案:
Mary Lee Pfeiffer is the mother of actor Robert Downey Jr.

→ 心法:換個方向問同一件事,是最便宜的驗證手段之一。
權重是凍結的。你這次糾正它,換一個新對話它照樣犯同樣的錯。它看起來記得,只是因為東西還留在當下的脈絡裡。
自己試: 這次對話跟它說「不要用表情符號」,它照做。關掉、開一個新對話再問同樣的問題 - 表情符號就回來了。
我自己踩到的版本比這嚴重得多。 在測試 HTB 靶機時跑 Claude Code,我開頭就交代「不要對 SSH 做遠端暴力破解」。前面幾輪它守得好好的;跑了一段時間之後,它還是開始暴力破解 SSH。
那次是同一個 session,所以嚴格說不是「換新對話就忘了」。但教訓是同一個:在對話裡講過的話,不會自動變成持久的約束。隨著脈絡越拉越長,早期講過的限制會被稀釋掉 - 它不是違抗你,是那句話已經不在它的注意力裡了。
→ 這就是為什麼需要 CLAUDE.md、memory、RAG - 不是為了讓它變聰明,是因為它不會學。
《Faith and Fate: Limits of Transformers on Compositionality》(Dziri et al., NeurIPS 2023)把多位數乘法拆開來看,發現模型不是在執行演算法,而是在做子圖比對 - 把看過的模式拼起來。所以位數一多就崩。
自己試:
| 問法 | 結果 |
|---|---|
| 「4823 × 7591 等於多少?」 | 常錯,位數再加長幾乎必錯 |
| 「寫一段 Python 算 4823 × 7591 並執行」 | 對 |
我測到的(2026-09-17,工具全部關掉): 同一題 17^13,正解 9,904,578,032,905,937。
| 模型 | 回答 | |
|---|---|---|
| Sonnet 5 | 9,904,578,032,905,937 |
✅ |
| Haiku 4.5 | 9,904,578,206,305,937 |
❌ 差了 1 億 7 千萬 |

→ 心法:能交給程式算的,就別讓它心算。叫它「寫一段程式算給我看」,比叫它直接報答案可靠得多。
這一類別當成永久的判斷,不然你會一直低估它。
一、上下文「用不好」,不是「放不下」。
Liu et al. 2023 的《Lost in the Middle》發現:脈絡塞得越滿,模型越偏好開頭和結尾,中間的東西會掉。Chroma 在 2025 年的《Context Rot》測了 18 個前沿模型,每一個都隨輸入變長而退步。
但要分清楚:這是「利用率」的問題,不是「容量」的問題。窗口越開越大,利用率也一直在改善。
自己試: 把同一份長文件貼三次,把你要問的那一行分別放在開頭 / 正中間 / 結尾,問同一個問題。中間那一次的失敗率明顯最高。
→ 心法:位置有價。最重要的資訊放頭尾,別指望它在幾十萬 token 的正中間撈到那一行。
二、複雜度一過線就崩。
Apple 在 2025 年的《The Illusion of Thinking》測了 o1、o3-mini、Claude 3.7 Sonnet Thinking、DeepSeek-R1,找到三個區間:簡單任務上,不思考的模型反而贏;中等複雜度,會推理的模型佔優;高複雜度,兩種都掉到接近零。他們還觀察到「過度思考」 - 模型找到正確答案後不停下來,繼續生出錯的路徑。
不過這篇被打了回馬槍。《The Illusion of the Illusion of Thinking》指出部分崩潰其實是題目設計與輸出長度上限造成的,不是推理本身的極限。後續複現的結論折衷:批評的細節有問題,但核心站得住 - 它的「思考」只在中間區段有效,而且不太會類推。
自己試: 拿河內塔(Tower of Hanoi)當尺。3 層、5 層它處理得很漂亮;層數一路往上加,到某個點會突然整個崩掉 - 而且它不會事先警告你「這題我不行」。
我測到的(Haiku 4.5,2026-09-17,工具全部關掉): N=9 這題,它先輸出了一段根本沒有執行過的工具呼叫 -
<function_calls>[{"tool_name": "bash", "args": {"command":
"python3 << 'EOF' ... hanoi(9, 'A', 'C', 'B') ... EOF"}}]</function_calls>

工具是關的,回傳的 web_search_requests 是 0,那段程式從來沒跑過。接著它給了 511 步 - 步數完全正確(2⁹−1)。但把這 511 步餵給驗證腳本逐步搬一遍:
| 檢查 | 結果 |
|---|---|
| 步數 | 511,完全正確 |
| 違規步數 | 124 步(24%) |
| 它其實在解哪一題 | 441 步吻合「搬到 B」的解法 - 題目要的是 C |
| 最終盤面 | 什麼都沒完成 |
而且它幻覺的那段程式寫的目標是 C,實際輸出卻從 A→B 開始 - 連它自己編的程式碼,都跟它自己編的執行結果對不上。
唯一通得過粗略檢查的那一項(步數),正好是最容易編對的那一項。它把最好驗的地方做對,把最難驗的地方做錯。
→ 心法:與其挑邊站,不如自己測一次。不要因為一篇論文說「AI 不會推理」就放棄,也不要因為它某次表現驚人就以為沒有天花板 - 唯一可信的,是你自己在你自己的任務上實測出來的邊界。
前面兩類至少你知道邊界大概在哪。這一類的麻煩是:邊界不規則,而且看不見。
Harvard 與 BCG 在 2023 年做了一個 758 人的實驗(Dell'Acqua et al.,約占 BCG 顧問的 7%),提出了「鋸齒狀前沿(jagged frontier)」這個詞:AI 的能力邊界不是一條平滑的線,而是鋸齒狀的 - 兩個在你看來難度差不多的任務,一個它做得漂亮,另一個它做得離譜。
數字很有說服力:
| 位置 | 結果 |
|---|---|
| 邊界之內的 18 個顧問任務 | 用 GPT-4 的人多完成 12.2% 的任務、快 25.1%、品質高 40% 以上 |
| 邊界之外(AI 會錯但看起來合理) | 新手掉了 19 個百分點(照單全收);能識破瑕疵的專家反而勝出 |
最危險的地方在於:它不會告訴你現在踩在鋸齒的哪一邊。語氣一樣自信、格式一樣漂亮、讀起來一樣合理。
真正的風險不是「它做不到」,而是「它做不到,但看起來做到了」。
這一條撐起了後面兩整段的內容:因為邊界看不見,所以要養成驗證習慣;因為新手掉最多,所以用 AI 的人自己有多專業,決定了他能拿到多少收益。
| 極限 | 類型 | 長什麼樣 | 你該做的 |
|---|---|---|---|
| 不會自己發現自己錯 | 結構性 | 「再檢查一次」→ 同一個錯講得更有信心 | 驗證一定要來自外部 |
| 反過來問就不會 | 結構性 | 答得出作者,答不出他寫過哪些書 | 換方向問,當成廉價的驗證 |
| 不會從對話中學會 | 結構性 | 新對話又用回你禁止過的寫法 | 用 CLAUDE.md、memory、RAG 補 |
| 精確計算不可靠 | 結構性 | 4823 × 7591 直接算會錯 |
叫它寫程式算,別叫它心算 |
| 上下文中段會掉 | 暫時 | 同一行放中間就撈不到 | 重要的放頭尾 |
| 複雜度過線就崩 | 暫時 | 河內塔加到某層數突然全錯 | 把任務拆小,並自己實測邊界 |
| 鋸齒狀前沿 | 看不見 | 兩題難度相仿,一題完美一題離譜 | 預設它隨時可能站在錯的那一邊 |
Day 01 說它是一台機率機器,Day 02 說這台機器跨過了實用門檻。今天要記住的是:
那道門檻是鋸齒狀的。你不會知道自己什麼時候正好踩在缺口上 - 除非你養成了驗證的習慣。