前面幾篇已知充分了解「流程有 Skill、經驗有知識庫、規則有把關」等等了 不過 AI 終究是我們在工作時的一種工具,它能大大加速流程,但終究能有效判定是否真的...
TL;DR 把昨天挖出來的兩種盲區餵回 AI:四行從沒被執行、一行執行了卻不影響結果。給原始碼,不給答案 三份產物,兩份通過驗收,變異分數 85.7% →...
TL;DR 十四個領域變異體注進 calc_fixed.py,golden v2 套件殺掉十二個,變異分數 85.7% 存活的 M09、M14 都不是「斷言...
經過前面的經驗,我們寫的 Skill 終於能在對的時候被叫出來了。 流程寫得清楚、硬規則也定好了,用起來很順。 然後我又會開始想:既然這麼好用,那乾脆把更多東西...
昨天畫了三條 AI 不能越過的線,其中兩條由 hook 守住,AI 繞不過。 因為有了 SKILL 這個助力,規則寫在文件裡,但現實是 我完全不知道 AI 有沒...
前言:測試都綠燈、擴充套件本身能編譯,這樣就能發版了嗎? 「CI 全部綠燈、vsce package 也順利打包出 .vsix,這樣應該可以發版了吧?」 如果你...
TL;DR 變異分數的分母是人寫的目錄。沒設計到的錯法,分數看不見,所以每一個變異體都要說出自己模擬哪一種真實錯法 十四個分兩層:實證(有跨檔案行號或第一幕實...
TL;DR 自建變異引擎不難,難的是它自己也是程式碼:判定邏輯錯一行,之後每一個分數都是偽證 校準協議:必死、必活、必錯三組五條,答案人手寫、跑之前定。正規做...
Hooks 是在 Claude Code 生命週期的特定時間點(工具呼叫前/後、對話開始/結束等)自動觸發指定的腳本。它跟「CLAUDE.md」最大的差別在於:...
TL;DR 昨天那套忠實性 100% 的測試,今天量行覆蓋率:43 行邏輯全部走過,100% 同一套測試,Day 14 的 21 個變異體存活 12 個,對...
TL;DR pytest 的綠燈只代表函式沒拋例外。用 ast 寫了 assert_inspector.py,機器化地問:這條測試到底在比什麼 量尺做出來第一...
TL;DR 正文用三個字帶過的「基底有了」,實際上跑了兩輪 第一輪 6 項不合格:5 項是我的量尺寫錯,1 項是我的規格沒寫 系列問「AI 寫的測試,誰來測...
故事 王小明包第一支 Skill:產生測試案例。 流程七八個步驟、硬規則寫得清楚、範例也附了完整的輸入輸出。 寫完在群組裡說了一聲:「以後要列 case 的時候...
Prompt 是什麼 Prompt 就是你這次要對 AI 講的話。 「幫我寫測試案例」是 prompt,「請依照下列六個步驟排查這次的失敗,每一步都要列出你判斷...
前兩天講的都還停留在「一個人」的層級:AI 把知識的取得成本壓到很低,但判斷答案對不對的成本一點都沒降。 今天把範圍拉大到整個團隊。 先講結論:標題所寫的問題不...
昨天說到,AI 已經可以回答絕大多數 QA 的知識型問題。 今天來說一個王小明的故事:如果太相信 AI,就可能把一個真的 Bug 放上線。 故事如下 ▲ 那天...
TL;DR 424 條是 AI 寫的,前四天量下來品質參差,而參差的位置事先看不出來 所以不全量自動化。分級與選題是暴露面控制,不只是省力氣 打分模型第一版...
多年來身為一名電子工程師,我透過線路、訊號、方程式與電路來理解系統。我受過的訓練是看著電路圖問一些熟悉的問題:訊號從哪裡進入?它應該往哪裡去?如果這個元件失效會...
2022 年,我參加了人生第一次鐵人賽,題目是《QA 三十天養成日記》,硬是撐完了 30 篇。 四年後的今天,我在開賽前,把那 30 篇在大致重頭讀了一次。...
TL;DR PRD v1.1 今天生效,其中一條改判讓目標金額變動 +73.17% 規格換了版,測試沒有。我拿 21 個變異體去問:把受測物改壞,那 13 條...
TL;DR 我把 PRD-05 的上界子句刪掉,讓規格回到受測物當年那個狀態,再餵給兩個模型各跑五次 十份輸出裡,沒有一份默默把上界補回來。我原本預期會有 但...
TL;DR 昨天跳票的人工核對,今天用 40 行程式補上一部分:把「邊界該有三個點」這個 QA 直覺寫成可執行的判定 掃十份案例集,PRD-05 上界的三點命...
TL;DR 我為 Day 10 的實驗寫了隔離條件,跑完十份才發現:污染源有五種,我只想到兩種 漏掉的三種有個共同點:它們是介面預設幫我打開的,不需要我做任何...
TL;DR 424 條 AI 產出的測試案例,十條 PRD 全部有案例覆蓋。抽驗一份 74 條:零幻覺、九條算式全中——但能在文件層驗到底的就只有那九條 RT...
TL;DR 今天不報實驗結果。今天做的是實驗設計,而且是刻意的——先定好怎麼算它及格,才有資格去跑 驗收標準的預設立場寫成「這批案例不能直接用」,要推翻它得有...
TL;DR 為了驗一句「這是業界通行寫法」,我拆了六個試算器:四個看原始碼,一個黑箱反解,一個它自己寫在頁面上 查完之後改了一條裁決:同帳戶兩種複利頻率,沒有...
TL;DR 這支工具沒有 PRD,但它每一行都在替使用者做決定——我把那些決定挖出來,數了十個 十個裡面只有三個對應到已知缺陷,其餘七個現在「沒有壞」,但也沒...
TL;DR Golden set v1:23 組,其中 8 組鎖的是缺陷本身——它們現在通過,代表缺陷還在 把明知是錯的結果寫進 assert,心理上很難受...
TL;DR 差分測試第一次跑就 496/500 不符——而錯的是我,不是受測物 修完之後 500 組全過,1500 個數字裡有 1182 個兩邊逐位元相同,最...
TL;DR 要驗證一支程式算得對不對,你需要第二個獨立的實作——但「獨立」到什麼程度,是一個要人來裁決的問題 機械式抽取和重新實作,會得到兩種完全不同的測試:...