iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

AI 寫的測試,誰來測? 系列

從人工建立工具,到 AI 輔助開發,再到如今 AI Agent 的崛起,軟體開發的方式正在快速改變。
AI 可以很快做出我們想要的功能,但 AI 做出來的東西,真的可以信任嗎?我們又該如何驗證?
這系列文章將以我去年的作品為範例,實際測試 AI 開發出的成果,從 QA 的角度驗證它究竟可靠不可靠。
就讓我們在做中學,一起探索 AI 時代的軟體開發吧!

參賽天數 23 天 | 共 24 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 20

【Day19】十四個變異體,八個有行號八個沒有

TL;DR 變異分數的分母是人寫的目錄。沒設計到的錯法,分數看不見,所以每一個變異體都要說出自己模擬哪一種真實錯法 十四個分兩層:實證(有跨檔案行號或第一幕實...

2026-09-20 ‧ 由 eyelash*睫毛 分享
DAY 21

【Day20】第一個變異分數 85.7%,而扣分的兩個都不是斷言的錯

TL;DR 十四個領域變異體注進 calc_fixed.py,golden v2 套件殺掉十二個,變異分數 85.7% 存活的 M09、M14 都不是「斷言...

2026-09-21 ‧ 由 eyelash*睫毛 分享
DAY 22

【Day21】補完之後 100%,而那個從 Day 14 掛到現在的欄位還是 0

TL;DR 把昨天挖出來的兩種盲區餵回 AI:四行從沒被執行、一行執行了卻不影響結果。給原始碼,不給答案 三份產物,兩份通過驗收,變異分數 85.7% →...

2026-09-22 ‧ 由 eyelash*睫毛 分享
DAY 23

【Day22】規格只給一句話,寫出來的測試殺掉 0 個變異體

TL;DR 同一個介面、同一批變異體,只換規格細度:一句話 vs 十二條 PRD,兩臺模型各五輪,共二十次生成 一句話組殺掉 0 個,PRD 組殺掉 12 個...

2026-09-23 ‧ 由 eyelash*睫毛 分享