「前幾次的階段,我們如何知道 RAG 品質好不好」
當 AI Assistant 真正轉變為一個 Production,問題會開始改變。
我們不只需要知道答案正不正確
還需要知道使用者問了什麼、哪一個步驟最容易出錯
因此今天開始進入另一個重要階段
這兩個概念很容易混在一起
可以先用一句話理解:
Evaluation 是測試系統品質,而 Observability 是觀察系統在實際運行時發生了什麼
Observability 的核心就是:
把原本看不到的系統運行狀態記錄下來
可以先用一個簡單的方式理解
因為它除了記錄錯誤訊息,也會保留 traceback
這對 Production Debugging 非常重要
AI 系統的一個重要問題是:
到底是哪個步驟變慢
因此需要對每個階段計時
Latency 不再只是一個數字,而是可以拆解的
因為 Token 使用量可能直接影響 Context Size、Chunk 數量
今天最大的轉變,是開始把 RAG 從「模型與演算法」的角度,往「Production System」的角度思考
更重要的是理解:
AI Assistant 上線後,不是完成開發就結束,而是開始進入真正的維運階段
從 Day 1 到現在,我們已經從讓 AI 可以回答問題
逐漸走向讓 AI 可以被評估、被追蹤、被分析
這也是一個 AI Prototype 與 Production AI System 之間非常重要的差異
但 Production 的另一個問題是:
「如果系統開始出問題,我們怎麼知道」
如果只是每天人工打開 Dashboard 查看,仍然不是真正的監控
因此下一步會開始建立:
也代表我們正式從 Monitoring 往 Production Operations 再往前一步