iT邦幫忙

2026 iThome 鐵人賽

DAY 5
0
AI Engineering

30 天 AI eval 實戰:一隻 PM agent,改完之後怎麼確定它還是對的系列 第 5

# Day 5|是我的 agent 特別爛,還是大家都這樣?

  • 分享至 

  • xImage
  •  

現在 AI 模型和兩年前相比進步非常多,公開 benchmark 上排前四名的 agent,跑一次就對的比率都在 73% 以上,榜首 78.4%。但同一張表改問「同一個任務連跑三次都對」,那四名掉到 62% 到 68.5%。單次的分數拉上去了,連跑三次都對的比率沒有跟上。

昨天那四個性質,好幾輪才走完、查幾次自己決定、查到的東西每天不一樣、寫回去就改了卡,把「寫測試就好」這條路堵死之後,下一個念頭通常會轉向內部:是不是這隻 agent 做得太爛、規格沒寫清楚、別人家的都好好的。

另一個更常見的懷疑是:現在的模型不是已經很強了嗎?這兩個問題都先看別人跑出來的數字。

公開的 benchmark 上,現在的 agent 拿幾分?

Toolathlon(官方站arXiv:2510.25726)是專門評會用工具的 agent 的 benchmark,有 32 個軟體應用、604 個工具、108 個任務。判定方式官方寫的是 execution-based evaluation,每個任務有一支專屬的評分腳本,去驗這一趟到底有沒有做到。

下面是它官方 leaderboard 的一部分,時間是 2026 年 8 月底:

模型 跑一次就對 連三次都對
Kimi K3 76.5 68.5
Claude Opus 4.8 76.2 66.7
Muse Spark 1.2 75.9 63.0
GPT-5.5 73.5 62.0
Gemini 3.5 Flash 67.3 53.7

只看「跑一次就對」那一欄,那個懷疑是對的。兩年前的公開數字還不到 50%,現在前四名都在 73% 以上,當時的榜首甚至是 78.4(Z.ai 的 GLM 5.3 Flash,它沒報連三次的數字),模型確實變強了。

而且這張表本來就落後現實,第三方評測站 Artificial Analysis 在 2026-09-02 記了一筆,Google 光是 Flash 這一條線,四個月內就出了第四款(Gemini 3.8 Flash 分析)。榜單量完、模型又換一輪,讀到這篇的時候上面那幾個名字大概又不是最新的了。

但新模型也沒有把這件事解掉。同一篇裡,Gemini 3.8 Flash 進步最多的正是工具使用那一項(τ³-Banking,比前一代多 12 分),而它的分數是 45%

回到「連三次都對」那一欄,它是同一批執行、同一支評分腳本跑出來的,只是把問題從「這次對不對」換成「三次都對嗎」。掉幅 8 到 14 個百分點,而且這還只是連跑 3 次。

大家每個月在比「跑一次就對」,「連三次都對」很少人看。

掉的是哪一批任務?

掉的幅度其實比「三次獨立相乘」少,單次 75.9 那一隻如果每次都是獨立抽一把,三次全中只剩四成出頭,實際報的卻是 63.0。這表示失敗並不是均勻分散在所有任務上,而是集中在某些任務。

有一批任務它穩定做對、有一批穩定做不到,這兩批都不造成落差。造成落差的是中間那一批任務:同一個任務、同一份輸入、什麼都沒改,它有時候過有時候不過。 這種任務在公司裡出現時,通常聽到的是「昨天明明是好的」。

「連跑幾次都對」這個問法從哪裡來?

「連跑 k 次都對的比率是多少」這個問法有出處,k 是重跑的次數,上面那張表的 k 是 3。τ-bench(arXiv:2406.12045)做的事跟這 30 天很接近,它不評 agent 講話漂不漂亮,而是讓它跟使用者多輪對話、實際去動一個資料庫,像退貨、改訂單這類每天在發生的客服工作。

判定的方式是對話結束後比對資料庫的最終狀態跟事先標好的答案。而它把「連 k 次都對」拿出來當一個要報的數字,不只報一次的成績。

它 2024 年那組數字是 GPT-4o 世代的,今天不能代表現況(上面那張表就是反例)。但它當年收的結論沒有過期,SOTA agent 在兩件現實需求上表現不好:行為一致性,以及可靠地遵守領域規則

行為一致性昨天就撞到了,同一張卡跑兩次,search_web 撈到的東西不一樣,Scope 就多一句少一句。遵守領域規則那件,後面會再碰到。

而這些 benchmark 再怎麼做得像真的,條件仍然比公司裡那張需求方用 AI 生出來、Goal 跟 Scope 混在一起、AC 是三句感想的 ticket 乾淨得多,分數還是這樣。所以不用先怪自己,也不用等新模型。

那自己手上這一隻,跑起來會好看嗎?

需求釐清 agent 還沒到能跑的階段,但手邊有另一份跑完的東西可以對照。這份實驗叫 agent 照一份寫作規範產出 Trello 卡片,4 個 case × 2 個 configuration × 3 次,共 24 次,單一變因是那份規範在不在輸入裡。把規範拿掉,逐條算的通過率(assertion pass rate)掉到 64%,case 層級 4 個裡一個都沒有全過。

24 次太少,不能叫 benchmark,而且「拿掉規範」是用指示要求它不要讀那份檔案,不是真的把檔案移掉,所以是準實驗。它能說的只有一句:自己跑過,一樣難看。

「跑過三次都對」,誰在替它擔保?

決定上線的時候,會議室裡通常是這樣:

  • 主管:「這隻能不能上?」
  • QA/開發:「手動測試跑過三次都對,可以上了。」

那句話就是上面那張表「連三次都對」那一欄在算的事,而 Claude Opus 4.8 那一格是 66.7。更麻煩的是,手動跑那三次通常是同一個人在同一個下午跑的,比表上那一欄還寬鬆。簽核的人聽到三次都對就簽了,但上線之後是每一筆請求都要對。

https://ithelp.ithome.com.tw/upload/images/20260907/2017240110rTFIcrXi.png

上線之後就不再有「那一次」了,每次抽到壞的,手上依然沒有東西可以拿來比,這才是前五天真正的問題,不是分數低。

分數最高的那一隻也不一定是最穩的那一隻。 另一份 2026 的研究(arXiv:2603.29231)換了一個角度看同一件事,拿 10 個模型跑了兩萬多次,任務長度從短到很長分四級。

短任務上 Llama 3.3 70B 是 75%、Qwen3 30B 是 76%,幾乎分不出高下,到最長那一級 Llama 還有 55%,Qwen 只剩 34%。任務一長,能力的排名跟可靠性的排名就會倒過來,選型的時候看的是前者,上線之後承擔的是後者。

明天要先處理什麼?

接下來要開始動手,但 eval、grader、dataset、harness、scorer 這五個詞,在不同文章和工具裡的定義並不一致。明天先把這五個詞的定義和彼此的關係說清楚,後面才不會講混。


上一篇
# Day 4|那我寫測試不就好了? 對一次呼叫寫 assert,抓不到的四件事
下一篇
# Day 6|eval、dataset、grader、scorer、harness 這五個詞,各自負責哪一段?
系列文
30 天 AI eval 實戰:一隻 PM agent,改完之後怎麼確定它還是對的7
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言