會呼叫 LLM API,不代表做得出可靠的 AI 系統。本系列從工程角度拆解一個 AI Demo 如何走向 Production,實作 Structured Output、模型選擇、RAG、Retrieval Eval、LLM Evaluation、Agent、Guardrails、Tracing、成本與延遲控制,並以 Accuracy、Recall、Latency、Cost 等指標持續驗證,建立可測試、可觀測、可維護的 AI Engineering 方法。
如果有自己串過一次 LLM API,應該會發現做出第一個 AI Demo 真的沒有想像中困難,準備一段 Prompt、把使用者輸入丟進去,再把模型回傳的內容顯示...
昨天在整理 AI Engineering 的時候,我比較在意的是一件事:當 AI 的答案出錯,我到底能不能知道問題發生在哪一層。 到了今天,我想往前再走一步,因...
昨天整理 AI Demo 為什麼不能直接上線時,我一直碰到一個很麻煩的問題:傳統程式出錯通常很好認,API 回 500、資料庫連不上、程式直接 crash,至少...
前幾天在整理 AI 系統的時候,我一直把注意力放在模型本身,Prompt 怎麼寫、模型怎麼選、輸出怎麼控制,但真的開始碰 RAG 之後才發現,有些看起來像是「模...
昨天開始幫 AI 系統留下 Log 之後,至少出問題時已經可以往回查。 我知道這次使用哪一版 Prompt、Retrieval 找到哪些文件、模型最後拿到什麼...
前幾天把 AI 功能拆開來看之後,我開始整理輸入、輸出、模型呼叫和錯誤處理,也慢慢發現 AI 系統有一個很麻煩的地方,同一段程式碼沒有改,結果還是可能因為 Pr...
前幾天開始整理 AI 系統的輸入、輸出和錯誤之後,我慢慢發現一個以前做 Demo 時很容易忽略的問題,每次修改 Prompt,我通常會立刻拿幾個熟悉的問題測試,...
昨天開始碰 RAG 之後,我先整理了一份小型的 QA Dataset,裡面放問題、預期找到的文件和預期答案,當時先沒有急著調任何參數,因為如果連一套固定的測試題...
Day 8 我開始測 RAG 的 Chunking,把同一份文件用不同方式切開之後,再看 Retrieval 到底能不能把真正需要的內容找回來,做到這一步之後,...
前面幾天把 Prompt、資料、RAG、輸出格式慢慢拆開之後,我原本以為只要每一層都能正常運作,AI 系統應該就已經差不多了,但真的開始把這些東西接在一起,我很...