iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

AI Reliability Lab:30 天用 Python 把「AI 好像很準」變成可以量的工程指標 系列

生成式 AI 已經可以回答問題、寫程式、整理資料,但「看起來很厲害」不代表它真的可靠。這 30 天,我會用 Python 建立一套 AI 評測與品質檢查工具,從 Accuracy、Consistency、Format Compliance、Abstention、Groundedness,到成本與延遲,逐步把 AI 的表現轉換成可以量化、比較、追蹤的工程指標。

參賽天數 9 天 | 共 9 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1|AI 很會回答,但「很會」到底是多少分?

今年我想做的,不是再做一個會聊天的 AI。我想做一件比較不討喜、但更接近工程的事:量它。我們平常使用大型語言模型時,很容易用一種模糊的方式評價它:這個模型好像比...

2026-09-15 ‧ 由 F24131128 分享
DAY 2

Day 2|同一題問 AI 五次,它真的會給我同一個答案嗎?

昨天我先做了一個很無聊、但我覺得必要的動作:先測「評測工具本身」。今天才開始碰 AI 真正麻煩的地方。一般程式如果輸入相同,通常希望輸出也相同。但 LLM 不是...

2026-09-16 ‧ 由 F24131128 分享
DAY 3

Day 3|又準又穩才算可靠?我把 AI 放進四象限

昨天我先把 Consistency Test 的測試方法和 Python 工具建立起來,準備用同一個 Prompt 的多次輸出來量穩定性。: 一致,不代表正確...

2026-09-17 ‧ 由 F24131128 分享
DAY 4

Day 4|答案是對的,但 JSON 壞掉,這算成功嗎?

前三天我把 AI Reliability 拆成 Accuracy 與 Consistency。今天加入第三個維度:Format Compliance。如果只是跟...

2026-09-18 ‧ 由 F24131128 分享
DAY 5

Day 5|「我不知道」可能是 AI 最可靠的一句話:第一次把拒答變成工程指標

前四天,我一直在測 AI「有沒有做好事情」。Day 1 先建立最小評測骨架;Day 2 開始看同一個問題重複多次時,答案會不會飄;Day 3 把 Accurac...

2026-09-19 ‧ 由 F24131128 分享
DAY 6

#Day 6|AI 回答得越多,真的越好嗎?第一次做 Risk-Coverage Curve

昨天做完 Abstention Test 之後,我開始碰到一個很現實的問題。 Day 5 的邏輯很直覺: 不知道的時候,不要亂答。 但如果把這句話推到極端,...

2026-09-20 ‧ 由 F24131128 分享
DAY 7

Day 7|AI 說自己有 95% 把握,我真的該信嗎?第一次把 Confidence 拿去校準

前幾天一路做到現在,我其實已經量了不少「可靠性」。 Day 1 先從最基本的 Accuracy 開始,Day 2 看同一題問多次會不會亂飄,Day 3 把 Ac...

2026-09-21 ‧ 由 F24131128 分享
DAY 8

Day 8|AI 說「我有 100% 把握」能信嗎?第一次跑真正的 LLM Confidence Experiment

Day 7,我替 AI Reliability Lab 加入了 calibration evaluator。 當時已經可以計算 Brier Score、ECE...

2026-09-22 ‧ 由 F24131128 分享
DAY 9

Day 9|模型超有自信,卻答錯了:第一次真正測 LLM 的 Calibration

Day 8,我第一次把 AI Reliability Lab 接上真正的 OpenAI API。 當時做的是一個非常小的 smoke experiment: 2...

2026-09-23 ‧ 由 F24131128 分享