iT邦幫忙

qa相關文章
共有 138 則文章
鐵人賽 AI 自動化 DAY 9

技術 [Day9] AI 源頭關鍵終究是「人」!請保持專業度才能駕馭好 AI

前面幾篇已知充分了解「流程有 Skill、經驗有知識庫、規則有把關」等等了 不過 AI 終究是我們在工作時的一種工具,它能大大加速流程,但終究能有效判定是否真的...

鐵人賽 AI Engineering DAY 22
AI 寫的測試,誰來測? 系列 第 23

技術 【Day21】補完之後 100%,而那個從 Day 14 掛到現在的欄位還是 0

TL;DR 把昨天挖出來的兩種盲區餵回 AI:四行從沒被執行、一行執行了卻不影響結果。給原始碼,不給答案 三份產物,兩份通過驗收,變異分數 85.7% →...

鐵人賽 AI Engineering DAY 21
AI 寫的測試,誰來測? 系列 第 22

技術 【Day20】第一個變異分數 85.7%,而扣分的兩個都不是斷言的錯

TL;DR 十四個領域變異體注進 calc_fixed.py,golden v2 套件殺掉十二個,變異分數 85.7% 存活的 M09、M14 都不是「斷言...

鐵人賽 AI 自動化 DAY 8

技術 [Day8] Skill 越寫越大包,AI 反而變笨了?它真正需要的是「知識庫」

經過前面的經驗,我們寫的 Skill 終於能在對的時候被叫出來了。 流程寫得清楚、硬規則也定好了,用起來很順。 然後我又會開始想:既然這麼好用,那乾脆把更多東西...

鐵人賽 AI 自動化 DAY 7

技術 [Day7] 問 AI「你剛剛做得對嗎」,它可能永遠都說對

昨天畫了三條 AI 不能越過的線,其中兩條由 hook 守住,AI 繞不過。 因為有了 SKILL 這個助力,規則寫在文件裡,但現實是 我完全不知道 AI 有沒...

鐵人賽 Vibe Coding DAY 20

技術 Day 20:案例——一次發版前 AI 漏掉的檢查項

前言:測試都綠燈、擴充套件本身能編譯,這樣就能發版了嗎? 「CI 全部綠燈、vsce package 也順利打包出 .vsix,這樣應該可以發版了吧?」 如果你...

鐵人賽 AI Engineering DAY 20
AI 寫的測試,誰來測? 系列 第 21

技術 【Day19】十四個變異體,八個有行號八個沒有

TL;DR 變異分數的分母是人寫的目錄。沒設計到的錯法,分數看不見,所以每一個變異體都要說出自己模擬哪一種真實錯法 十四個分兩層:實證(有跨檔案行號或第一幕實...

鐵人賽 AI Engineering DAY 19
AI 寫的測試,誰來測? 系列 第 20

技術 【Day18】誰來驗收驗收者:自建 Mutation Harness 與校準協議

TL;DR 自建變異引擎不難,難的是它自己也是程式碼:判定邏輯錯一行,之後每一個分數都是偽證 校準協議:必死、必活、必錯三組五條,答案人手寫、跑之前定。正規做...

鐵人賽 AI 自動化 DAY 6

技術 [Day6] 善於 hook 做防線!AI 模型越來越強!但我需要一個可控制且安全的 AI!

Hooks 是在 Claude Code 生命週期的特定時間點(工具呼叫前/後、對話開始/結束等)自動觸發指定的腳本。它跟「CLAUDE.md」最大的差別在於:...

鐵人賽 AI Engineering DAY 18
AI 寫的測試,誰來測? 系列 第 19

技術 【Day17】行覆蓋率 100%,還是有十一種錯法穿過去

TL;DR 昨天那套忠實性 100% 的測試,今天量行覆蓋率:43 行邏輯全部走過,100% 同一套測試,Day 14 的 21 個變異體存活 12 個,對...

鐵人賽 AI Engineering DAY 17
AI 寫的測試,誰來測? 系列 第 18

技術 【Day16】CI 全綠,但 AI 只寫了一句 assert result is not None

TL;DR pytest 的綠燈只代表函式沒拋例外。用 ast 寫了 assert_inspector.py,機器化地問:這條測試到底在比什麼 量尺做出來第一...

鐵人賽 AI Engineering DAY 17
AI 寫的測試,誰來測? 系列 第 17

技術 【Day15-番外】六項不合格,沒有一項是 AI 的錯

TL;DR 正文用三個字帶過的「基底有了」,實際上跑了兩輪 第一輪 6 項不合格:5 項是我的量尺寫錯,1 項是我的規格沒寫 系列問「AI 寫的測試,誰來測...

鐵人賽 AI 自動化 DAY 5

技術 [Day5] 寫了一支很完整的 Skill,然後 AI 從來沒被叫出來過?所以理解使用情境真的很重要!

故事 王小明包第一支 Skill:產生測試案例。 流程七八個步驟、硬規則寫得清楚、範例也附了完整的輸入輸出。 寫完在群組裡說了一聲:「以後要列 case 的時候...

鐵人賽 AI 自動化 DAY 4

技術 [Day4] AI 中常提到 Prompt 跟 Skill 差別?對 QA 來說影響又是什麼?

Prompt 是什麼 Prompt 就是你這次要對 AI 講的話。 「幫我寫測試案例」是 prompt,「請依照下列六個步驟排查這次的失敗,每一步都要列出你判斷...

鐵人賽 AI 自動化 DAY 3

技術 [Day3] 知識斷層一直都在,AI 只是讓它裂得更快

前兩天講的都還停留在「一個人」的層級:AI 把知識的取得成本壓到很低,但判斷答案對不對的成本一點都沒降。 今天把範圍拉大到整個團隊。 先講結論:標題所寫的問題不...

鐵人賽 AI 自動化 DAY 2

技術 [Day2] 「AI 說這錯誤只是 Flaky」,我是 QA!我應該要保持懷疑百次千次!

昨天說到,AI 已經可以回答絕大多數 QA 的知識型問題。 今天來說一個王小明的故事:如果太相信 AI,就可能把一個真的 Bug 放上線。 故事如下 ▲ 那天...

鐵人賽 AI Engineering DAY 16
AI 寫的測試,誰來測? 系列 第 16

技術 【Day15】424 條案例,只有一小撮值得寫成 pytest

TL;DR 424 條是 AI 寫的,前四天量下來品質參差,而參差的位置事先看不出來 所以不全量自動化。分級與選題是暴露面控制,不只是省力氣 打分模型第一版...

鐵人賽 自我挑戰組 DAY 1

技術 當綠燈不再足夠:為什麼我不單獨信任 AI 做 QA

多年來身為一名電子工程師,我透過線路、訊號、方程式與電路來理解系統。我受過的訓練是看著電路圖問一些熟悉的問題:訊號從哪裡進入?它應該往哪裡去?如果這個元件失效會...

鐵人賽 AI 自動化 DAY 1

技術 [Day1] AI 把軟體技術的門檻壓平了,QA 卻變得更難做?

2022 年,我參加了人生第一次鐵人賽,題目是《QA 三十天養成日記》,硬是撐完了 30 篇。 四年後的今天,我在開賽前,把那 30 篇在大致重頭讀了一次。...

鐵人賽 AI Engineering DAY 15
AI 寫的測試,誰來測? 系列 第 15

技術 【Day14】十三條測試全綠,殺得掉的只有「乘以 −1」

TL;DR PRD v1.1 今天生效,其中一條改判讓目標金額變動 +73.17% 規格換了版,測試沒有。我拿 21 個變異體去問:把受測物改壞,那 13 條...

鐵人賽 AI Engineering DAY 14
AI 寫的測試,誰來測? 系列 第 14

技術 【Day13】我刪掉一條規格,沒有人偷偷把它加回來

TL;DR 我把 PRD-05 的上界子句刪掉,讓規格回到受測物當年那個狀態,再餵給兩個模型各跑五次 十份輸出裡,沒有一份默默把上界補回來。我原本預期會有 但...

鐵人賽 AI Engineering DAY 13
AI 寫的測試,誰來測? 系列 第 13

技術 【Day12】把「該有 A_d−1 / A_d / A_d+1」寫成 40 行程式

TL;DR 昨天跳票的人工核對,今天用 40 行程式補上一部分:把「邊界該有三個點」這個 QA 直覺寫成可執行的判定 掃十份案例集,PRD-05 上界的三點命...

鐵人賽 AI Engineering DAY 12
AI 寫的測試,誰來測? 系列 第 12

技術 【Day11-番外】十份實驗資料,全部作廢

TL;DR 我為 Day 10 的實驗寫了隔離條件,跑完十份才發現:污染源有五種,我只想到兩種 漏掉的三種有個共同點:它們是介面預設幫我打開的,不需要我做任何...

鐵人賽 AI Engineering DAY 11
AI 寫的測試,誰來測? 系列 第 11

技術 【Day11】RTM 沒抓到漏測,抓到的是我的規格書

TL;DR 424 條 AI 產出的測試案例,十條 PRD 全部有案例覆蓋。抽驗一份 74 條:零幻覺、九條算式全中——但能在文件層驗到底的就只有那九條 RT...

鐵人賽 AI Engineering DAY 10
AI 寫的測試,誰來測? 系列 第 10

技術 【Day10】把 PRD 餵給 AI 之前,先把及格線畫好

TL;DR 今天不報實驗結果。今天做的是實驗設計,而且是刻意的——先定好怎麼算它及格,才有資格去跑 驗收標準的預設立場寫成「這批案例不能直接用」,要推翻它得有...

鐵人賽 AI Engineering DAY 9

技術 【Day9】閘門一:替一年前的自己做決定

TL;DR 為了驗一句「這是業界通行寫法」,我拆了六個試算器:四個看原始碼,一個黑箱反解,一個它自己寫在頁面上 查完之後改了一條裁決:同帳戶兩種複利頻率,沒有...

鐵人賽 AI Engineering DAY 8

技術 【Day8】規格考古:十個沒有人做過決定的地方

TL;DR 這支工具沒有 PRD,但它每一行都在替使用者做決定——我把那些決定挖出來,數了十個 十個裡面只有三個對應到已知缺陷,其餘七個現在「沒有壞」,但也沒...

鐵人賽 AI Engineering DAY 7

技術 【Day7】把錯的行為,正式寫進測試裡

TL;DR Golden set v1:23 組,其中 8 組鎖的是缺陷本身——它們現在通過,代表缺陷還在 把明知是錯的結果寫進 assert,心理上很難受...

鐵人賽 AI Engineering DAY 6

技術 【Day6】500 組差分,第一次就掛了

TL;DR 差分測試第一次跑就 496/500 不符——而錯的是我,不是受測物 修完之後 500 組全過,1500 個數字裡有 1182 個兩邊逐位元相同,最...

鐵人賽 AI Engineering DAY 5

技術 【Day5】打造影子模型:抽取,還是重寫?

TL;DR 要驗證一支程式算得對不對,你需要第二個獨立的實作——但「獨立」到什麼程度,是一個要人來裁決的問題 機械式抽取和重新實作,會得到兩種完全不同的測試:...