iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

你的 AI Demo 為什麼不能上線?從 Prompt 到 Production 的 AI Engineering 系列

會呼叫 LLM API,不代表做得出可靠的 AI 系統。本系列從工程角度拆解一個 AI Demo 如何走向 Production,實作 Structured Output、模型選擇、RAG、Retrieval Eval、LLM Evaluation、Agent、Guardrails、Tracing、成本與延遲控制,並以 Accuracy、Recall、Latency、Cost 等指標持續驗證,建立可測試、可觀測、可維護的 AI Engineering 方法。

參賽天數 17 天 | 共 17 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文 |團隊鳳梨田 NPC
DAY 1

Day 1|你的 AI Demo 真的能上線嗎?從「會動」開始談 AI Engineering

如果有自己串過一次 LLM API,應該會發現做出第一個 AI Demo 真的沒有想像中困難,準備一段 Prompt、把使用者輸入丟進去,再把模型回傳的內容顯示...

2026-09-07 ‧ 由 annyyyy 分享
DAY 2

Day 2|從 Prompt 到 Production,中間到底少了什麼?

昨天在整理 AI Engineering 的時候,我比較在意的是一件事:當 AI 的答案出錯,我到底能不能知道問題發生在哪一層。 到了今天,我想往前再走一步,因...

2026-09-08 ‧ 由 annyyyy 分享
DAY 3

Day 3 :AI 回答看起來沒問題,就真的沒問題嗎?我開始替輸出加上評分標準

昨天整理 AI Demo 為什麼不能直接上線時,我一直碰到一個很麻煩的問題:傳統程式出錯通常很好認,API 回 500、資料庫連不上、程式直接 crash,至少...

2026-09-09 ‧ 由 annyyyy 分享
DAY 4

Day 4:你的 RAG 為什麼明明有資料,AI 還是回答錯?

前幾天在整理 AI 系統的時候,我一直把注意力放在模型本身,Prompt 怎麼寫、模型怎麼選、輸出怎麼控制,但真的開始碰 RAG 之後才發現,有些看起來像是「模...

2026-09-10 ‧ 由 annyyyy 分享
DAY 5

Day 5 : Prompt 改完感覺更好了,但「感覺」可以當評估標準嗎?

昨天開始幫 AI 系統留下 Log 之後,至少出問題時已經可以往回查。 我知道這次使用哪一版 Prompt、Retrieval 找到哪些文件、模型最後拿到什麼...

2026-09-11 ‧ 由 annyyyy 分享
DAY 6

Day 6 : Prompt 改了一行,為什麼我還是要重新測整套流程

前幾天把 AI 功能拆開來看之後,我開始整理輸入、輸出、模型呼叫和錯誤處理,也慢慢發現 AI 系統有一個很麻煩的地方,同一段程式碼沒有改,結果還是可能因為 Pr...

2026-09-12 ‧ 由 annyyyy 分享
DAY 7

Day 7 : Prompt 改了之後變更好,可能只是你剛好測到簡單題

前幾天開始整理 AI 系統的輸入、輸出和錯誤之後,我慢慢發現一個以前做 Demo 時很容易忽略的問題,每次修改 Prompt,我通常會立刻拿幾個熟悉的問題測試,...

2026-09-13 ‧ 由 annyyyy 分享
DAY 8

Day 8 : RAG 的 Chunk 到底要切多大?這次直接拿資料測

昨天開始碰 RAG 之後,我先整理了一份小型的 QA Dataset,裡面放問題、預期找到的文件和預期答案,當時先沒有急著調任何參數,因為如果連一套固定的測試題...

2026-09-14 ‧ 由 annyyyy 分享
DAY 9

Day 9 : Top-K 越大越準嗎?我把同一批問題跑了四次

Day 8 我開始測 RAG 的 Chunking,把同一份文件用不同方式切開之後,再看 Retrieval 到底能不能把真正需要的內容找回來,做到這一步之後,...

2026-09-15 ‧ 由 annyyyy 分享
DAY 10

Day 10 : AI 回答看起來很正常,我要怎麼知道它真的答對了?

前面幾天把 Prompt、資料、RAG、輸出格式慢慢拆開之後,我原本以為只要每一層都能正常運作,AI 系統應該就已經差不多了,但真的開始把這些東西接在一起,我很...

2026-09-16 ‧ 由 annyyyy 分享