Day 16 結尾,我替今天寫了三個驗收條件: 匯出的是整份 draft(產品決策加上 Builder 的狀態),不含 Project Specificati...
TL;DR 四個缺陷,加上規格裁決後改寫的通膨基準年,接回那支 HTML。接回去的那份跟 Python 實作逐位元對齊:505 組輸入、2005 項比對、0...
TL;DR 三十天分四幕:驗屍、規格、造尺、沒有答案的時候。每一幕收成一句 八十筆決策紀錄,二十六筆不掛任何閘門,其中十二筆是量 AI 的人自己壞掉之後的更正...
TL;DR 用 AI 最常見的直覺是「多跑幾次挑最好的」。三十天的資料說:這一半行不通 它犯的錯很一致——三次獨立生成、跨兩臺模型,測試的盲區開在完全相同的...
TL;DR 人寫的測試套組漏掉兩種錯法,原因不是斷言不夠嚴,是二十三組案例沒有一組餵那個輸入 十份 AI 產物裡有一份補上了其中一格。補上它的不是蛻變關係,...
TL;DR 昨天那個檢查我做錯的不是我以為的地方:不是漏查了幾條,是只查了一對欄位——那對還是我碰巧注意到的 工具掃十份 AI 產物的 232 條斷言,標記...
TL;DR 把同一份規格交給兩臺模型各跑五次,十份產物裡有一條關係是全員都寫的 它在受測的那版永遠是綠的:那兩個「輸出」其實是同一個物件;換到上線那版,同一...
TL;DR 不知道答案對不對的時候,去找程式裡兩個該吻合的出口,讓它們互相對帳 我寫了四條關係,只有「對帳」那條抓到東西:它揪出上線一年的缺陷 A,而第一幕花...
TL;DR 把 Day 22 十二份紅掉的 AI 腳本拆開數:26 條失敗,一半是期望值算錯 最關鍵的一條來自完整規格那一組:十二條條款讀完,手推出的期望值差...
TL;DR 把二十份 AI 腳本裡真正餵進去的數字全部抽出來數:年齡有整數偏好,金額沒有,而且反過來 規格寫明邊界之後,AI 打邊界打得比人寫的對照組還準...
TL;DR 同一個介面、同一批變異體,只換規格細度:一句話 vs 十二條 PRD,兩臺模型各五輪,共二十次生成 一句話組殺掉 0 個,PRD 組殺掉 12 個...
TL;DR 把昨天挖出來的兩種盲區餵回 AI:四行從沒被執行、一行執行了卻不影響結果。給原始碼,不給答案 三份產物,兩份通過驗收,變異分數 85.7% →...
TL;DR 十四個領域變異體注進 calc_fixed.py,golden v2 套件殺掉十二個,變異分數 85.7% 存活的 M09、M14 都不是「斷言...
TL;DR 變異分數的分母是人寫的目錄。沒設計到的錯法,分數看不見,所以每一個變異體都要說出自己模擬哪一種真實錯法 十四個分兩層:實證(有跨檔案行號或第一幕實...
TL;DR 自建變異引擎不難,難的是它自己也是程式碼:判定邏輯錯一行,之後每一個分數都是偽證 校準協議:必死、必活、必錯三組五條,答案人手寫、跑之前定。正規做...
TL;DR 昨天那套忠實性 100% 的測試,今天量行覆蓋率:43 行邏輯全部走過,100% 同一套測試,Day 14 的 21 個變異體存活 12 個,對...
TL;DR pytest 的綠燈只代表函式沒拋例外。用 ast 寫了 assert_inspector.py,機器化地問:這條測試到底在比什麼 量尺做出來第一...
前言:「CI 全綠,還要 review 什麼?」 這句話幾乎是每個團隊都講過的話。測試涵蓋了主要情境、CI 顯示全綠、PR 描述寫得清清楚楚——這時候要求「再花...
TL;DR 424 條是 AI 寫的,前四天量下來品質參差,而參差的位置事先看不出來 所以不全量自動化。分級與選題是暴露面控制,不只是省力氣 打分模型第一版...
前言:AI 會不會主動幫你補被冷落的測試? 「如果請 AI 幫我在 PurchaseRequest 加一個新的付款方式,AI 會不會像 Day 09 講的那樣,...
前言:寫測試變慢,是不是測試框架的問題? 「這段程式碼的測試,每次都要啟動整個系統、連上資料庫、跑完一整條請求鏈路才能測到,是不是測試工具沒選對?」 這個問題背...
TL;DR PRD v1.1 今天生效,其中一條改判讓目標金額變動 +73.17% 規格換了版,測試沒有。我拿 21 個變異體去問:把受測物改壞,那 13 條...
前言:先寫測試再寫功能,才算有紀律? 「TDD 教的不是應該先寫測試、再寫功能嗎?昨天那筆 commit 看起來完全不是這樣,這樣算不算沒紀律?」 先說結論:昨...
TL;DR 我把 PRD-05 的上界子句刪掉,讓規格回到受測物當年那個狀態,再餵給兩個模型各跑五次 十份輸出裡,沒有一份默默把上界補回來。我原本預期會有 但...
TL;DR 昨天跳票的人工核對,今天用 40 行程式補上一部分:把「邊界該有三個點」這個 QA 直覺寫成可執行的判定 掃十份案例集,PRD-05 上界的三點命...
TL;DR 我為 Day 10 的實驗寫了隔離條件,跑完十份才發現:污染源有五種,我只想到兩種 漏掉的三種有個共同點:它們是介面預設幫我打開的,不需要我做任何...
TL;DR 424 條 AI 產出的測試案例,十條 PRD 全部有案例覆蓋。抽驗一份 74 條:零幻覺、九條算式全中——但能在文件層驗到底的就只有那九條 RT...
TL;DR 今天不報實驗結果。今天做的是實驗設計,而且是刻意的——先定好怎麼算它及格,才有資格去跑 驗收標準的預設立場寫成「這批案例不能直接用」,要推翻它得有...
TL;DR 為了驗一句「這是業界通行寫法」,我拆了六個試算器:四個看原始碼,一個黑箱反解,一個它自己寫在頁面上 查完之後改了一條裁決:同帳戶兩種複利頻率,沒有...
TL;DR 這支工具沒有 PRD,但它每一行都在替使用者做決定——我把那些決定挖出來,數了十個 十個裡面只有三個對應到已知缺陷,其餘七個現在「沒有壞」,但也沒...