iT邦幫忙

2026 iThome 鐵人賽

DAY 2
0
Claude AI

AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像系列 第 2

[Day 02] 不是它突然變強,是它跨過了你的門檻

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20260916/20078298LeDmipMOkF.png

先修一個前提 — It Crossed a Line, It Didn't Spike

(jason3e7 的疑問)LLM 以前就有,但好像去年底突然大爆發,為什麼?

答案有點反直覺:能力沒有突然爆發,它一路都在指數成長。爆發的是「它跨過了對你有用的那條線」。

研究機構 METR 把這件事量化成一個指標:模型能以 50% 機率完成的任務時長

模型(發布年) 任務時長(50% 成功率)
GPT-2(2019) 3 秒
GPT-4(2023) 4 分鐘
Claude 3.7 Sonnet(2025-02) 1 小時
Claude Opus 4.5(2025-11) 約 5 小時

這個指標有三個地方要先講清楚,不然很容易誤讀。

一、那是臨界點,不是保證。 50% 不是說「所有五小時的任務它都有一半機會」,而是成功率剛好掉到一半的那個長度。曲線是連續的:人要做一小時的事,它成功率遠高於一半;人要做十小時的事,就明顯低於一半了。

二、「人」指的是專家。 這個時長是拿領域專家的實際耗時當基準 - 「五小時」是一個本來就會做這件事的人要花的時間,不是隨便找個人來試。

三、「工作」有範圍。 題庫涵蓋的是機器學習研究工程、軟體工程與軟體維運這三類任務,不是所有職業的工作。

這條線全期平均每 6.2 個月翻一倍;而 2023 年之後更快,每 4.2 個月就翻一倍。

更新的資料還顯示一件事:2026 年的模型已經衝到 12 小時以上,但信賴區間從 5 小時橫跨到 60 小時,METR 自己也講明,超過 16 小時就超出這套題庫能測的範圍了。量尺已經跟不上被量的東西。

指數曲線的特性就是這樣 - 在跨過你的門檻之前,看起來什麼都沒發生:

  • 3 秒 → 你連當玩具都不會想到它
  • 4 分鐘 → 可以幫忙寫一個小函式
  • 1 小時 → 可以交辦一個小任務
  • 5 小時 → 可以交辦一件真的工作

前三格你都不會覺得「爆發」。跨到第四格的那一刻,你的體感就是世界一夕之間變了。曲線沒有變,是你的門檻被跨過了。


三個引擎,先後點火 — Three Engines

那條指數曲線是三件事撐起來的,而且是先後點火,不是同時。

引擎一:把規模變成可預測的投資(2017–2022)

  • 2017 Transformer 架構問世(《Attention Is All You Need》):可以平行訓練,才有辦法一路放大。
  • 2020 Scaling Laws(Kaplan et al.):模型表現跟算力、資料量、參數量之間有一條可預測的曲線 - 你投多少,大概就能算出會得到多少。
  • 2022 Chinchilla(Hoffmann et al.):修正配方 - 當時的大模型其實「餵太少」,同樣算力下該用更多資料。

第二點才是真正的轉折。它把「這條路走不走得通」變成「你想花多少錢」。一件事只要能用錢換,產業就會全力押注。

引擎二:讓它聽得懂人話(2022)

GPT-3 在 2020 年就存在了,但很難用 - 你得用很技巧的方式去「引導」它接話。2022 年的 InstructGPT(Ouyang et al.)用 RLHF(從人類回饋中做強化學習)把模型調成「照指令做事」。

這一步沒有讓模型更聰明,是讓它變得可用。同年 11 月 ChatGPT 之所以炸開,是產品時刻,不是模型突破 - 底層模型早就在那裡了。

這是第一次「感覺上的爆發 ≠ 技術上的突破」。同樣的錯覺,後面還會再發生一次。

引擎三:回答的時候多想一下(2024 起)

2024 年 OpenAI 的 o1 系列開了第二根軸:不是把模型訓練得更大,而是在回答時多給它一點算力去想。

這根軸特別的地方在於,它可以用時間換聰明 - 一個小模型讓它想 10 秒,可以贏過一個大上十幾倍、但秒答的模型。從 o1 到它的後繼者 o3,投在強化學習上的算力增加了超過 10 倍。

到這裡,模型已經很強了。但你去年感覺到的那次爆發,還缺最後一塊。


你感覺到的那一次:它長出了手 — When the Model Got Hands

前面三個引擎讓模型「會想」;2024 年底開始的這一波,讓它「能動」。

  • MCP(Model Context Protocol):2024 年 11 月由 Anthropic 提出,讓模型用同一套規格接上檔案、資料庫、API 與外部工具。採用速度很誇張 - 下載數從 2024 年 11 月的約 10 萬,到 2025 年 4 月超過 800 萬;2025 年底已有 5,800 個以上的 server、300 個以上的 client。RedMonk 說這是他們看過採用最快的標準。
  • 寫程式工具從「自動補完」變成「交辦任務」:這個轉折在 2025 年底完成。你不再是一行一行接受建議,而是給一個目標,讓它自己讀檔、修改、跑測試、看錯誤、再修。

把兩件事乘起來,就是答案:

(它能接手人要做好幾個小時的工作)×(它能接上你真實的檔案與工具)= 第一次可以「交辦一件真事」。

所以「去年底突然大爆發」的實際內容是:不是模型在那個月變聰明了,而是模型的能力曲線,剛好在那時候跟工具生態的成熟度撞在一起。

順帶一提,同一段時間也出現了「尺不夠長」的訊號:SWE-bench Verified 這個寫程式評測 2024 年 8 月才推出,到 2026 年 OpenAI 已公開表示它不再足以衡量前沿的寫程式能力。當你的量尺跟不上,你就會覺得到處都在爆發。


這對我們的意義 — What This Means

三條可以直接拿去用的心法:

一、「現在不行」的保存期限很短。
如果曲線 4 到 6 個月翻一倍,那你半年前試過、覺得「AI 做不到」的事,現在很可能做得到。把失敗過的嘗試記下來,每季重試一次,比每天追新聞有用得多。

二、你能施力的地方不是模型。
爆發來自「模型能力 × 工具接得好不好 × 任務切得夠不夠準」這個乘積。模型你改不了,但另外兩項完全在你手上。

三、你不一定要待在能力邊界上。
前面說過,50% 是成功率剛好掉到一半的那個長度 - 任務切得越小,成功率就越回得去。與其把一件五小時的事整包丟給它,不如切成五件一小時的事。真的得在邊界上做,就先想好怎麼驗。

最後留一個提醒:上面講的每一個「突然」,拆開來看都不突然。

下次聽到「AI 又爆發了」,先問一句:是它的能力變了,還是我的門檻被跨過了?


Sources


上一篇
[Day 01] 它只是在猜下一個字:LLM 的原理,決定了後面 29 天的所有心法
下一篇
[Day 03] 它做不到的事分三類,最危險的那類你看不見
系列文
AI 心法三十天:用 Claude Code 當實驗場,從提問、驗證到拓展自己的想像8
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言