會呼叫 LLM API,不代表做得出可靠的 AI 系統。本系列從工程角度拆解一個 AI Demo 如何走向 Production,實作 Structured Output、模型選擇、RAG、Retrieval Eval、LLM Evaluation、Agent、Guardrails、Tracing、成本與延遲控制,並以 Accuracy、Recall、Latency、Cost 等指標持續驗證,建立可測試、可觀測、可維護的 AI Engineering 方法。
昨天把固定的 Eval Dataset 建起來之後,我終於可以比較不同版本的 AI Pipeline,每次換 Prompt、調 Retrieval 或改模型,都...
昨天把 Eval 裡失敗的案例拆成 Retrieval、Context、Generation、Format 和 Unsupported Answer 之後,我原...
昨天開始記錄 Latency 和 Token Cost 之後,我第一次比較清楚看到一件事,同樣是一個 AI 功能,每次呼叫模型背後花掉的成本其實差很多,而且使用...
昨天做到 Model Routing 之後,我開始比較認真看每一次 AI Request 到底花了多少時間和 Token,結果很快就發現一件以前做 Demo 時...
昨天把 Semantic Cache 加進流程之後,我第一個感覺其實很直接,同樣或非常相近的問題不需要每次重新跑 Retrieval、重新送 Prompt、再付...
前幾天把 Model Routing、Semantic Cache 和 Cache Invalidation 接起來之後,整套系統開始有一點 Productio...
昨天把 AI 系統的 Latency 拆開之後,我終於比較清楚那幾秒到底花在哪裡,有些時間在 Retrieval,有些花在模型開始產生第一個 Token 之前,...