從人工建立工具,到 AI 輔助開發,再到如今 AI Agent 的崛起,軟體開發的方式正在快速改變。
AI 可以很快做出我們想要的功能,但 AI 做出來的東西,真的可以信任嗎?我們又該如何驗證?
這系列文章將以我去年的作品為範例,實際測試 AI 開發出的成果,從 QA 的角度驗證它究竟可靠不可靠。
就讓我們在做中學,一起探索 AI 時代的軟體開發吧!
TL;DR 去年我用三種驗證法檢查過自己做的退休試算工具,一年後它被找出四個計算缺陷,一個都沒被抓到 「沒看到 bug」不等於「沒有 bug」,而這件事我是用...
TL;DR 昨天的三種驗證法各有各的盲區,但它們的盲區是同一種:都只能檢查我事先想得到的東西 其中最根本的一招——請 AI 檢查它自己寫的程式碼——不是不夠聰...
TL;DR 四個缺陷是這一年間由 AI 輔助的人工審查逐行比對找出來的,不是任何測試方法自動抓到的 兩個是輸入沒防好,一分鐘就能修;兩個藏在精算公式的跨期假設...
TL;DR 缺陷 A 的偏差不是隨機的:正確的目標金額正好是系統值的 (1+r) 倍,純用等比級數就推得出來 昨天那筆被藏起來的赤字也有閉式解:− r × 目...
TL;DR 要驗證一支程式算得對不對,你需要第二個獨立的實作——但「獨立」到什麼程度,是一個要人來裁決的問題 機械式抽取和重新實作,會得到兩種完全不同的測試:...
TL;DR 差分測試第一次跑就 496/500 不符——而錯的是我,不是受測物 修完之後 500 組全過,1500 個數字裡有 1182 個兩邊逐位元相同,最...
TL;DR Golden set v1:23 組,其中 8 組鎖的是缺陷本身——它們現在通過,代表缺陷還在 把明知是錯的結果寫進 assert,心理上很難受...
TL;DR 這支工具沒有 PRD,但它每一行都在替使用者做決定——我把那些決定挖出來,數了十個 十個裡面只有三個對應到已知缺陷,其餘七個現在「沒有壞」,但也沒...
TL;DR 為了驗一句「這是業界通行寫法」,我拆了六個試算器:四個看原始碼,一個黑箱反解,一個它自己寫在頁面上 查完之後改了一條裁決:同帳戶兩種複利頻率,沒有...
TL;DR 今天不報實驗結果。今天做的是實驗設計,而且是刻意的——先定好怎麼算它及格,才有資格去跑 驗收標準的預設立場寫成「這批案例不能直接用」,要推翻它得有...