iT邦幫忙

testing相關文章
共有 140 則文章
鐵人賽 Vibe Coding DAY 17

技術 Day 17|Draft 可以匯出了,但 Spec 和 Prompt 不能跟著放進去

Day 16 結尾,我替今天寫了三個驗收條件: 匯出的是整份 draft(產品決策加上 Builder 的狀態),不含 Project Specificati...

AI 寫的測試,誰來測? 系列 第 33 篇

技術 【Day30-下】修完了,然後回答第一天那個引號

TL;DR 四個缺陷,加上規格裁決後改寫的通膨基準年,接回那支 HTML。接回去的那份跟 Python 實作逐位元對齊:505 組輸入、2005 項比對、0...

AI 寫的測試,誰來測? 系列 第 32 篇

技術 【Day30-上】四幕,四個結論,八十筆決定

TL;DR 三十天分四幕:驗屍、規格、造尺、沒有答案的時候。每一幕收成一句 八十筆決策紀錄,二十六筆不掛任何閘門,其中十二筆是量 AI 的人自己壞掉之後的更正...

鐵人賽 AI Engineering DAY 30
AI 寫的測試,誰來測? 系列 第 31 篇

技術 【Day29】多生成五份,會得到五份一樣的盲區

TL;DR 用 AI 最常見的直覺是「多跑幾次挑最好的」。三十天的資料說:這一半行不通 它犯的錯很一致——三次獨立生成、跨兩臺模型,測試的盲區開在完全相同的...

鐵人賽 AI Engineering DAY 29
AI 寫的測試,誰來測? 系列 第 30 篇

技術 【Day28】補上那一格的,是一條 pytest.raises

TL;DR 人寫的測試套組漏掉兩種錯法,原因不是斷言不夠嚴,是二十三組案例沒有一組餵那個輸入 十份 AI 產物裡有一份補上了其中一格。補上它的不是蛻變關係,...

鐵人賽 AI Engineering DAY 28
AI 寫的測試,誰來測? 系列 第 29 篇

技術 【Day27】誰來查那個檢查:把「兩邊是不是同一個東西」寫成工具

TL;DR 昨天那個檢查我做錯的不是我以為的地方:不是漏查了幾條,是只查了一對欄位——那對還是我碰巧注意到的 工具掃十份 AI 產物的 232 條斷言,標記...

鐵人賽 AI Engineering DAY 27
AI 寫的測試,誰來測? 系列 第 28 篇

技術 【Day26】十份 AI 都寫了同一條測試,而它比的是同一個東西

TL;DR 把同一份規格交給兩臺模型各跑五次,十份產物裡有一條關係是全員都寫的 它在受測的那版永遠是綠的:那兩個「輸出」其實是同一個物件;換到上線那版,同一...

鐵人賽 AI Engineering DAY 26
AI 寫的測試,誰來測? 系列 第 27 篇

技術 【Day25】AI 每個函式都寫對了,湊起來差一個 (1+r)

TL;DR 不知道答案對不對的時候,去找程式裡兩個該吻合的出口,讓它們互相對帳 我寫了四條關係,只有「對帳」那條抓到東西:它揪出上線一年的缺陷 A,而第一幕花...

鐵人賽 AI Engineering DAY 25
AI 寫的測試,誰來測? 系列 第 26 篇

技術 【Day24】AI 寫下那個數字的時候,沒有人在旁邊

TL;DR 把 Day 22 十二份紅掉的 AI 腳本拆開數:26 條失敗,一半是期望值算錯 最關鍵的一條來自完整規格那一組:十二條條款讀完,手推出的期望值差...

鐵人賽 AI Engineering DAY 24
AI 寫的測試,誰來測? 系列 第 25 篇

技術 【Day23】它準確地打在邊界上,然後把期望寫反了

TL;DR 把二十份 AI 腳本裡真正餵進去的數字全部抽出來數:年齡有整數偏好,金額沒有,而且反過來 規格寫明邊界之後,AI 打邊界打得比人寫的對照組還準...

鐵人賽 AI Engineering DAY 23
AI 寫的測試,誰來測? 系列 第 24 篇

技術 【Day22】規格只給一句話,寫出來的測試殺掉 0 個變異體

TL;DR 同一個介面、同一批變異體,只換規格細度:一句話 vs 十二條 PRD,兩臺模型各五輪,共二十次生成 一句話組殺掉 0 個,PRD 組殺掉 12 個...

鐵人賽 AI Engineering DAY 22
AI 寫的測試,誰來測? 系列 第 23 篇

技術 【Day21】補完之後 100%,而那個從 Day 14 掛到現在的欄位還是 0

TL;DR 把昨天挖出來的兩種盲區餵回 AI:四行從沒被執行、一行執行了卻不影響結果。給原始碼,不給答案 三份產物,兩份通過驗收,變異分數 85.7% →...

鐵人賽 AI Engineering DAY 21
AI 寫的測試,誰來測? 系列 第 22 篇

技術 【Day20】第一個變異分數 85.7%,而扣分的兩個都不是斷言的錯

TL;DR 十四個領域變異體注進 calc_fixed.py,golden v2 套件殺掉十二個,變異分數 85.7% 存活的 M09、M14 都不是「斷言...

鐵人賽 AI Engineering DAY 20
AI 寫的測試,誰來測? 系列 第 21 篇

技術 【Day19】十四個變異體,八個有行號八個沒有

TL;DR 變異分數的分母是人寫的目錄。沒設計到的錯法,分數看不見,所以每一個變異體都要說出自己模擬哪一種真實錯法 十四個分兩層:實證(有跨檔案行號或第一幕實...

鐵人賽 AI Engineering DAY 19
AI 寫的測試,誰來測? 系列 第 20 篇

技術 【Day18】誰來驗收驗收者:自建 Mutation Harness 與校準協議

TL;DR 自建變異引擎不難,難的是它自己也是程式碼:判定邏輯錯一行,之後每一個分數都是偽證 校準協議:必死、必活、必錯三組五條,答案人手寫、跑之前定。正規做...

鐵人賽 AI Engineering DAY 18
AI 寫的測試,誰來測? 系列 第 19 篇

技術 【Day17】行覆蓋率 100%,還是有十一種錯法穿過去

TL;DR 昨天那套忠實性 100% 的測試,今天量行覆蓋率:43 行邏輯全部走過,100% 同一套測試,Day 14 的 21 個變異體存活 12 個,對...

鐵人賽 AI Engineering DAY 17
AI 寫的測試,誰來測? 系列 第 18 篇

技術 【Day16】CI 全綠,但 AI 只寫了一句 assert result is not None

TL;DR pytest 的綠燈只代表函式沒拋例外。用 ast 寫了 assert_inspector.py,機器化地問:這條測試到底在比什麼 量尺做出來第一...

鐵人賽 Software Development DAY 3

技術 Day 3:為什麼「測試都綠燈」不能證明程式碼設計沒問題

前言:「CI 全綠,還要 review 什麼?」 這句話幾乎是每個團隊都講過的話。測試涵蓋了主要情境、CI 顯示全綠、PR 描述寫得清清楚楚——這時候要求「再花...

鐵人賽 AI Engineering DAY 16
AI 寫的測試,誰來測? 系列 第 16 篇

技術 【Day15】424 條案例,只有一小撮值得寫成 pytest

TL;DR 424 條是 AI 寫的,前四天量下來品質參差,而參差的位置事先看不出來 所以不全量自動化。分級與選題是暴露面控制,不只是省力氣 打分模型第一版...

鐵人賽 IT Operation DAY 11

技術 Day 11:AI 會不會主動幫你補那些被冷落的測試?

前言:AI 會不會主動幫你補被冷落的測試? 「如果請 AI 幫我在 PurchaseRequest 加一個新的付款方式,AI 會不會像 Day 09 講的那樣,...

鐵人賽 AI Engineering DAY 16

技術 Day 16:測試邊界跟架構邊界的關係——能不能獨立測試,反映架構乾不乾淨

前言:寫測試變慢,是不是測試框架的問題? 「這段程式碼的測試,每次都要啟動整個系統、連上資料庫、跑完一整條請求鏈路才能測到,是不是測試工具沒選對?」 這個問題背...

鐵人賽 AI Engineering DAY 15
AI 寫的測試,誰來測? 系列 第 15 篇

技術 【Day14】十三條測試全綠,殺得掉的只有「乘以 −1」

TL;DR PRD v1.1 今天生效,其中一條改判讓目標金額變動 +73.17% 規格換了版,測試沒有。我拿 21 個變異體去問:把受測物改壞,那 13 條...

鐵人賽 IT Operation DAY 9

技術 Day 09:兩種節奏——「功能配測試」跟「順路補測試」

前言:先寫測試再寫功能,才算有紀律? 「TDD 教的不是應該先寫測試、再寫功能嗎?昨天那筆 commit 看起來完全不是這樣,這樣算不算沒紀律?」 先說結論:昨...

鐵人賽 AI Engineering DAY 14
AI 寫的測試,誰來測? 系列 第 14 篇

技術 【Day13】我刪掉一條規格,沒有人偷偷把它加回來

TL;DR 我把 PRD-05 的上界子句刪掉,讓規格回到受測物當年那個狀態,再餵給兩個模型各跑五次 十份輸出裡,沒有一份默默把上界補回來。我原本預期會有 但...

鐵人賽 AI Engineering DAY 13
AI 寫的測試,誰來測? 系列 第 13 篇

技術 【Day12】把「該有 A_d−1 / A_d / A_d+1」寫成 40 行程式

TL;DR 昨天跳票的人工核對,今天用 40 行程式補上一部分:把「邊界該有三個點」這個 QA 直覺寫成可執行的判定 掃十份案例集,PRD-05 上界的三點命...

鐵人賽 AI Engineering DAY 12
AI 寫的測試,誰來測? 系列 第 12 篇

技術 【Day11-番外】十份實驗資料,全部作廢

TL;DR 我為 Day 10 的實驗寫了隔離條件,跑完十份才發現:污染源有五種,我只想到兩種 漏掉的三種有個共同點:它們是介面預設幫我打開的,不需要我做任何...

鐵人賽 AI Engineering DAY 11
AI 寫的測試,誰來測? 系列 第 11 篇

技術 【Day11】RTM 沒抓到漏測,抓到的是我的規格書

TL;DR 424 條 AI 產出的測試案例,十條 PRD 全部有案例覆蓋。抽驗一份 74 條:零幻覺、九條算式全中——但能在文件層驗到底的就只有那九條 RT...

鐵人賽 AI Engineering DAY 10
AI 寫的測試,誰來測? 系列 第 10 篇

技術 【Day10】把 PRD 餵給 AI 之前,先把及格線畫好

TL;DR 今天不報實驗結果。今天做的是實驗設計,而且是刻意的——先定好怎麼算它及格,才有資格去跑 驗收標準的預設立場寫成「這批案例不能直接用」,要推翻它得有...

鐵人賽 AI Engineering DAY 9

技術 【Day9】閘門一:替一年前的自己做決定

TL;DR 為了驗一句「這是業界通行寫法」,我拆了六個試算器:四個看原始碼,一個黑箱反解,一個它自己寫在頁面上 查完之後改了一條裁決:同帳戶兩種複利頻率,沒有...

鐵人賽 AI Engineering DAY 8

技術 【Day8】規格考古:十個沒有人做過決定的地方

TL;DR 這支工具沒有 PRD,但它每一行都在替使用者做決定——我把那些決定挖出來,數了十個 十個裡面只有三個對應到已知缺陷,其餘七個現在「沒有壞」,但也沒...