iT邦幫忙

2026 iThome 鐵人賽

DAY 1
0
AI Engineering

AI 寫的測試,誰來測?系列 第 1

【Day1】我的退休試算上線一年,我檢查過,它「沒問題」?

  • 分享至 

  • xImage
  •  

TL;DR

  • 去年我用三種驗證法檢查過自己做的退休試算工具,一年後它被找出四個計算缺陷,一個都沒被抓到
  • 「沒看到 bug」不等於「沒有 bug」,而這件事我是用自己的作品學會的
  • 這個系列文章就是把「證明測試有效」這件事,做成可量測的方法

https://ithelp.ithome.com.tw/upload/images/20260902/20103826WACgAV4dQC.jpg


前言

去年鐵人賽,我用 Gemini 做了一個「進階退休規劃試算」。輸入年齡、月存金額、報酬率、通膨率,它畫出一條資產曲線,告訴你退休金有沒有缺口。它上線了,掛在網路上,真的有人在用。

一年後,它被找出四個計算缺陷一年後,它被找出四個計算缺陷,荒謬程度各不相同:

  1. 壽命倒掛變好消息:預期壽命填得比退休年齡還短,系統不報錯,反而跳出「恭喜您準備金充足」。
  2. 輸入打錯字假裝沒事:欄位輸入非純數字被靜默轉成 0 或整筆丟棄,產出一份看似乾淨卻全錯的試算。
  3. 活不到的幽靈支出:填了一筆 95 歲的大額支出,目標金額暴增 300 萬,但 85 歲結束的折線圖完全看不出這筆錢。
  4. 期初/期末沒對齊:目標金額少算整整一年的利息;更嚴重的是,在畫面上寫著「恭喜您,準備金充足」的同時,你 85 歲那年的真實帳戶餘額其實是負的 86 萬——而這筆赤字被一行代碼悄悄夾成了 0。

我當年真的檢查過

這不是「當初太趕所以沒測」的故事。

去年的 Day8〈AI 會彈錯音嗎?〉,我寫了整整一篇文章在講怎麼驗證 AI 的產出。裡面白紙黑字列了三種驗證法,我一個個做過:

  • 特定值驗證法:拿一組已知答案的數據去考它。42 歲、退休 65、月存 19,391、報酬率 8%,預期累積到 20,281,460 元——答案是用外部的複利計算機算的,不是我自己說了算
  • 邊界測試法:把報酬率和通膨率都設成 0%,看資產總額是不是等於單純的加總;再用一組能心算的數字(30 歲、一年、100 萬、10% 報酬)確認它算得出 110 萬
  • AI 自我解釋法:把程式碼貼回一個新的 Gemini 視窗,要它用白話文解釋自己的計算邏輯,再拿它的說法對照我的金融常識

那篇文章的結論是:「不能盲從 AI,需要反覆的驗證、除錯,才能讓我們的工具值得信賴。」

我同意當年的自己,我也照做了。

但是,三招都做了,四個缺陷零個被抓到。

最痛的一刀

更難堪的還在後面。

去年那篇的後半,我寫了一段「進階技巧」,大意是:有時候我們和 AI 的結果不同,不一定是 AI 錯了,也可能是公式理解有差異——例如本金是年初投入還是年底投入,結果就會不同。這時候,「AI 自我解釋法」就是很好的裁判。

我當年就知道這個風險。我甚至把它寫進文章裡當提醒,還為它指派了一個裁判。

一年後找出來的第一個缺陷,正是「年初投入還是年底投入」沒對齊。而我任命的那個裁判,是缺陷的作者本人。知道風險在哪,不等於擋得住。還得問:誰來檢查檢查的人?

於是乎...

我的日常工作是 QA:讀 PRD、寫 test case、寫 test script、執行測試。這條鏈上的每一環,現在 AI 都能做,而且比我快。於是問題從「怎麼寫測試」變成:AI 寫的測試,誰來測?

AI 給你 30 個 test case,你怎麼知道它漏了什麼?它產的 script 全部綠燈,你怎麼知道那是程式沒問題,還是測試不夠兇?

答案不能是「下次認真一點」或「靠人的直覺」——直覺已經失效過一次,證據就在上面。這三十天,我要把「證明測試有效」變成可以量測的東西,而實驗體就是我自己那個退休試算。

大致會走過這幾件事:

  • 把四個缺陷驗屍一遍,順便釘死它「現在就是這樣動」
  • 幫一個從來沒有 PRD 的系統補規格,再看 AI 讀規格到底讀懂了多少
  • 故意把程式弄壞,看測試會不會發現——然後給我自己的測試打分
  • 最後把它修好,重新上線

明天先回答最根本的那一題:那三招明明都做了,為什麼會全數落空?


後記

寫這篇的時候我回頭重讀去年的 Day8,本來只想找幾句話來引用,結果「年初投入還是年底投入」那段是我自己寫的,我完全忘了。

我以為我記得當年檢查過什麼,但我記錯了。記憶中的版本是「我做得比較粗糙」,實際上我做得比記憶中細,細到已經點名了正確的風險。沒回去翻原文的話,今天這篇不會這麼痛/images/emoticon/emoticon16.gif


只帶走一件事
我檢查過,而且我檢查的時候是認真的——這正是最可怕的地方。


免責聲明:本文提及之退休試算工具與所有數字皆為假設性試算,不構成任何投資建議。該工具目前已知存在計算偏差,修正版製作中,結果僅供參考。


下一篇
【Day2】三招驗證法,為什麼一招都沒中?
系列文
AI 寫的測試,誰來測?3
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言