
去年鐵人賽,我用 Gemini 做了一個「進階退休規劃試算」。輸入年齡、月存金額、報酬率、通膨率,它畫出一條資產曲線,告訴你退休金有沒有缺口。它上線了,掛在網路上,真的有人在用。
一年後,它被找出四個計算缺陷一年後,它被找出四個計算缺陷,荒謬程度各不相同:
這不是「當初太趕所以沒測」的故事。
去年的 Day8〈AI 會彈錯音嗎?〉,我寫了整整一篇文章在講怎麼驗證 AI 的產出。裡面白紙黑字列了三種驗證法,我一個個做過:
那篇文章的結論是:「不能盲從 AI,需要反覆的驗證、除錯,才能讓我們的工具值得信賴。」
我同意當年的自己,我也照做了。
但是,三招都做了,四個缺陷零個被抓到。
更難堪的還在後面。
去年那篇的後半,我寫了一段「進階技巧」,大意是:有時候我們和 AI 的結果不同,不一定是 AI 錯了,也可能是公式理解有差異——例如本金是年初投入還是年底投入,結果就會不同。這時候,「AI 自我解釋法」就是很好的裁判。
我當年就知道這個風險。我甚至把它寫進文章裡當提醒,還為它指派了一個裁判。
一年後找出來的第一個缺陷,正是「年初投入還是年底投入」沒對齊。而我任命的那個裁判,是缺陷的作者本人。知道風險在哪,不等於擋得住。還得問:誰來檢查檢查的人?
我的日常工作是 QA:讀 PRD、寫 test case、寫 test script、執行測試。這條鏈上的每一環,現在 AI 都能做,而且比我快。於是問題從「怎麼寫測試」變成:AI 寫的測試,誰來測?
AI 給你 30 個 test case,你怎麼知道它漏了什麼?它產的 script 全部綠燈,你怎麼知道那是程式沒問題,還是測試不夠兇?
答案不能是「下次認真一點」或「靠人的直覺」——直覺已經失效過一次,證據就在上面。這三十天,我要把「證明測試有效」變成可以量測的東西,而實驗體就是我自己那個退休試算。
大致會走過這幾件事:
明天先回答最根本的那一題:那三招明明都做了,為什麼會全數落空?
寫這篇的時候我回頭重讀去年的 Day8,本來只想找幾句話來引用,結果「年初投入還是年底投入」那段是我自己寫的,我完全忘了。
我以為我記得當年檢查過什麼,但我記錯了。記憶中的版本是「我做得比較粗糙」,實際上我做得比記憶中細,細到已經點名了正確的風險。沒回去翻原文的話,今天這篇不會這麼痛![]()
只帶走一件事
我檢查過,而且我檢查的時候是認真的——這正是最可怕的地方。
免責聲明:本文提及之退休試算工具與所有數字皆為假設性試算,不構成任何投資建議。該工具目前已知存在計算偏差,修正版製作中,結果僅供參考。