iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

AI 寫的測試,誰來測? 系列

從人工建立工具,到 AI 輔助開發,再到如今 AI Agent 的崛起,軟體開發的方式正在快速改變。
AI 可以很快做出我們想要的功能,但 AI 做出來的東西,真的可以信任嗎?我們又該如何驗證?
這系列文章將以我去年的作品為範例,實際測試 AI 開發出的成果,從 QA 的角度驗證它究竟可靠不可靠。
就讓我們在做中學,一起探索 AI 時代的軟體開發吧!

參賽天數 23 天 | 共 24 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

【Day1】我的退休試算上線一年,我檢查過,它「沒問題」?

TL;DR 去年我用三種驗證法檢查過自己做的退休試算工具,一年後它被找出四個計算缺陷,一個都沒被抓到 「沒看到 bug」不等於「沒有 bug」,而這件事我是用...

2026-09-01 ‧ 由 eyelash*睫毛 分享
DAY 2

【Day2】三招驗證法,為什麼一招都沒中?

TL;DR 昨天的三種驗證法各有各的盲區,但它們的盲區是同一種:都只能檢查我事先想得到的東西 其中最根本的一招——請 AI 檢查它自己寫的程式碼——不是不夠聰...

2026-09-02 ‧ 由 eyelash*睫毛 分享
DAY 3

【Day3】四個缺陷的驗屍報告

TL;DR 四個缺陷是這一年間由 AI 輔助的人工審查逐行比對找出來的,不是任何測試方法自動抓到的 兩個是輸入沒防好,一分鐘就能修;兩個藏在精算公式的跨期假設...

2026-09-03 ‧ 由 eyelash*睫毛 分享
DAY 4

【Day4】那個 (1+r) 是怎麼來的

TL;DR 缺陷 A 的偏差不是隨機的:正確的目標金額正好是系統值的 (1+r) 倍,純用等比級數就推得出來 昨天那筆被藏起來的赤字也有閉式解:− r × 目...

2026-09-04 ‧ 由 eyelash*睫毛 分享
DAY 5

【Day5】打造影子模型:抽取,還是重寫?

TL;DR 要驗證一支程式算得對不對,你需要第二個獨立的實作——但「獨立」到什麼程度,是一個要人來裁決的問題 機械式抽取和重新實作,會得到兩種完全不同的測試:...

2026-09-05 ‧ 由 eyelash*睫毛 分享
DAY 6

【Day6】500 組差分,第一次就掛了

TL;DR 差分測試第一次跑就 496/500 不符——而錯的是我,不是受測物 修完之後 500 組全過,1500 個數字裡有 1182 個兩邊逐位元相同,最...

2026-09-06 ‧ 由 eyelash*睫毛 分享
DAY 7

【Day7】把錯的行為,正式寫進測試裡

TL;DR Golden set v1:23 組,其中 8 組鎖的是缺陷本身——它們現在通過,代表缺陷還在 把明知是錯的結果寫進 assert,心理上很難受...

2026-09-07 ‧ 由 eyelash*睫毛 分享
DAY 8

【Day8】規格考古:十個沒有人做過決定的地方

TL;DR 這支工具沒有 PRD,但它每一行都在替使用者做決定——我把那些決定挖出來,數了十個 十個裡面只有三個對應到已知缺陷,其餘七個現在「沒有壞」,但也沒...

2026-09-08 ‧ 由 eyelash*睫毛 分享
DAY 9

【Day9】閘門一:替一年前的自己做決定

TL;DR 為了驗一句「這是業界通行寫法」,我拆了六個試算器:四個看原始碼,一個黑箱反解,一個它自己寫在頁面上 查完之後改了一條裁決:同帳戶兩種複利頻率,沒有...

2026-09-09 ‧ 由 eyelash*睫毛 分享
DAY 10

【Day10】把 PRD 餵給 AI 之前,先把及格線畫好

TL;DR 今天不報實驗結果。今天做的是實驗設計,而且是刻意的——先定好怎麼算它及格,才有資格去跑 驗收標準的預設立場寫成「這批案例不能直接用」,要推翻它得有...

2026-09-10 ‧ 由 eyelash*睫毛 分享