從人工建立工具,到 AI 輔助開發,再到如今 AI Agent 的崛起,軟體開發的方式正在快速改變。
AI 可以很快做出我們想要的功能,但 AI 做出來的東西,真的可以信任嗎?我們又該如何驗證?
這系列文章將以我去年的作品為範例,實際測試 AI 開發出的成果,從 QA 的角度驗證它究竟可靠不可靠。
就讓我們在做中學,一起探索 AI 時代的軟體開發吧!
TL;DR 變異分數的分母是人寫的目錄。沒設計到的錯法,分數看不見,所以每一個變異體都要說出自己模擬哪一種真實錯法 十四個分兩層:實證(有跨檔案行號或第一幕實...
TL;DR 十四個領域變異體注進 calc_fixed.py,golden v2 套件殺掉十二個,變異分數 85.7% 存活的 M09、M14 都不是「斷言...
TL;DR 把昨天挖出來的兩種盲區餵回 AI:四行從沒被執行、一行執行了卻不影響結果。給原始碼,不給答案 三份產物,兩份通過驗收,變異分數 85.7% →...
TL;DR 同一個介面、同一批變異體,只換規格細度:一句話 vs 十二條 PRD,兩臺模型各五輪,共二十次生成 一句話組殺掉 0 個,PRD 組殺掉 12 個...