生成式 AI 已經可以回答問題、寫程式、整理資料,但「看起來很厲害」不代表它真的可靠。這 30 天,我會用 Python 建立一套 AI 評測與品質檢查工具,從 Accuracy、Consistency、Format Compliance、Abstention、Groundedness,到成本與延遲,逐步把 AI 的表現轉換成可以量化、比較、追蹤的工程指標。
今年我想做的,不是再做一個會聊天的 AI。我想做一件比較不討喜、但更接近工程的事:量它。我們平常使用大型語言模型時,很容易用一種模糊的方式評價它:這個模型好像比...
昨天我先做了一個很無聊、但我覺得必要的動作:先測「評測工具本身」。今天才開始碰 AI 真正麻煩的地方。一般程式如果輸入相同,通常希望輸出也相同。但 LLM 不是...
昨天我先把 Consistency Test 的測試方法和 Python 工具建立起來,準備用同一個 Prompt 的多次輸出來量穩定性。: 一致,不代表正確...
前三天我把 AI Reliability 拆成 Accuracy 與 Consistency。今天加入第三個維度:Format Compliance。如果只是跟...
前四天,我一直在測 AI「有沒有做好事情」。Day 1 先建立最小評測骨架;Day 2 開始看同一個問題重複多次時,答案會不會飄;Day 3 把 Accurac...
昨天做完 Abstention Test 之後,我開始碰到一個很現實的問題。 Day 5 的邏輯很直覺: 不知道的時候,不要亂答。 但如果把這句話推到極端,...
前幾天一路做到現在,我其實已經量了不少「可靠性」。 Day 1 先從最基本的 Accuracy 開始,Day 2 看同一題問多次會不會亂飄,Day 3 把 Ac...
Day 7,我替 AI Reliability Lab 加入了 calibration evaluator。 當時已經可以計算 Brier Score、ECE...
Day 8,我第一次把 AI Reliability Lab 接上真正的 OpenAI API。 當時做的是一個非常小的 smoke experiment: 2...