iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

AI 寫的測試,誰來測? 系列

從人工建立工具,到 AI 輔助開發,再到如今 AI Agent 的崛起,軟體開發的方式正在快速改變。
AI 可以很快做出我們想要的功能,但 AI 做出來的東西,真的可以信任嗎?我們又該如何驗證?
這系列文章將以我去年的作品為範例,實際測試 AI 開發出的成果,從 QA 的角度驗證它究竟可靠不可靠。
就讓我們在做中學,一起探索 AI 時代的軟體開發吧!

參賽天數 23 天 | 共 24 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 11

【Day11】RTM 沒抓到漏測,抓到的是我的規格書

TL;DR 424 條 AI 產出的測試案例,十條 PRD 全部有案例覆蓋。抽驗一份 74 條:零幻覺、九條算式全中——但能在文件層驗到底的就只有那九條 RT...

2026-09-11 ‧ 由 eyelash*睫毛 分享
DAY 12

【Day11-番外】十份實驗資料,全部作廢

TL;DR 我為 Day 10 的實驗寫了隔離條件,跑完十份才發現:污染源有五種,我只想到兩種 漏掉的三種有個共同點:它們是介面預設幫我打開的,不需要我做任何...

2026-09-12 ‧ 由 eyelash*睫毛 分享
DAY 13

【Day12】把「該有 A_d−1 / A_d / A_d+1」寫成 40 行程式

TL;DR 昨天跳票的人工核對,今天用 40 行程式補上一部分:把「邊界該有三個點」這個 QA 直覺寫成可執行的判定 掃十份案例集,PRD-05 上界的三點命...

2026-09-13 ‧ 由 eyelash*睫毛 分享
DAY 14

【Day13】我刪掉一條規格,沒有人偷偷把它加回來

TL;DR 我把 PRD-05 的上界子句刪掉,讓規格回到受測物當年那個狀態,再餵給兩個模型各跑五次 十份輸出裡,沒有一份默默把上界補回來。我原本預期會有 但...

2026-09-14 ‧ 由 eyelash*睫毛 分享
DAY 15

【Day14】十三條測試全綠,殺得掉的只有「乘以 −1」

TL;DR PRD v1.1 今天生效,其中一條改判讓目標金額變動 +73.17% 規格換了版,測試沒有。我拿 21 個變異體去問:把受測物改壞,那 13 條...

2026-09-15 ‧ 由 eyelash*睫毛 分享
DAY 16

【Day15】424 條案例,只有一小撮值得寫成 pytest

TL;DR 424 條是 AI 寫的,前四天量下來品質參差,而參差的位置事先看不出來 所以不全量自動化。分級與選題是暴露面控制,不只是省力氣 打分模型第一版...

2026-09-16 ‧ 由 eyelash*睫毛 分享
DAY 17

【Day15-番外】六項不合格,沒有一項是 AI 的錯

TL;DR 正文用三個字帶過的「基底有了」,實際上跑了兩輪 第一輪 6 項不合格:5 項是我的量尺寫錯,1 項是我的規格沒寫 系列問「AI 寫的測試,誰來測...

2026-09-17 ‧ 由 eyelash*睫毛 分享
DAY 17

【Day16】CI 全綠,但 AI 只寫了一句 assert result is not None

TL;DR pytest 的綠燈只代表函式沒拋例外。用 ast 寫了 assert_inspector.py,機器化地問:這條測試到底在比什麼 量尺做出來第一...

2026-09-17 ‧ 由 eyelash*睫毛 分享
DAY 18

【Day17】行覆蓋率 100%,還是有十一種錯法穿過去

TL;DR 昨天那套忠實性 100% 的測試,今天量行覆蓋率:43 行邏輯全部走過,100% 同一套測試,Day 14 的 21 個變異體存活 12 個,對...

2026-09-18 ‧ 由 eyelash*睫毛 分享
DAY 19

【Day18】誰來驗收驗收者:自建 Mutation Harness 與校準協議

TL;DR 自建變異引擎不難,難的是它自己也是程式碼:判定邏輯錯一行,之後每一個分數都是偽證 校準協議:必死、必活、必錯三組五條,答案人手寫、跑之前定。正規做...

2026-09-19 ‧ 由 eyelash*睫毛 分享